两个机器人打起来了,而且是"自己想"出来的

2026年9月7日,宇树宣布实现全球首次由世界模型实时驱动的全自主人形机器人格斗

注意这个定语链:世界模型、实时、全自主、人形、格斗。每一个词都是一道门槛,全部叠在一起,意味着机器人不再是按预编程动作库"跳舞",而是在高速对抗中实时感知、预测、决策、出动作

数据来源:宇树2026年9月7日公告,UnifoLM-WLA-1.0技术披露

为什么"格斗"是块硬试金石

格斗是检验具身智能的极端场景,因为它把所有难点同时拉满:

  • 高速:攻击、闪避发生在零点几秒之内;
  • 对抗性:对手的动作不可预测,你无法提前录制剧本;
  • 物理约束苛刻:摔倒、失衡、碰撞都有真实后果;
  • 闭环延迟要求极高:必须边看边想边动,不能"想半天再动"。

工厂里拧螺母是确定性任务——环境固定、流程固定。格斗是对抗性任务——对方会出招、会变招。能在格斗里全自主,说明这套系统具备了真正的实时反应与应变能力,而不是重复训练好的动作。

UnifoLM-WLA-1.0:60亿参数,2500小时真机

宇树这次披露的模型是UnifoLM-WLA-1.0,几个关键参数:

  • 参数量60亿:在具身世界模型里属于工程上可实时部署的规模——太大跑不动实时控制,太小学不会动作;
  • 2500小时真机数据:这是真正昂贵的资产。具身智能的瓶颈从来不是架构,而是真机数据的采集成本
  • 覆盖64项任务:说明它不是只会格斗这一件事,而是一个通用的视觉-动作世界模型。

这个组合的意义在于:宇树把世界模型从"实验室仿真"拉到了"真机实时对抗"的舞台上。

世界模型在这里扮演什么角色

在格斗场景里,世界模型做的是"在脑子里快进几秒钟":

  1. 看到对手动作,预测他下一步会怎么打;
  2. 在脑内模拟"我这样闪会怎样、那样挡会怎样";
  3. 选出最优动作并立刻执行。

这种"预测-预演-执行"的闭环,正是世界模型区别于传统运动控制的地方。它让机器人拥有了一点"打之前先算一下"的智能,而不是纯靠反射。

行业影响

guijiagi.com认为,宇树这次突破的分量,在于它把"具身智能"从表演推向了对抗性实用场景。当人形机器人能在高速对抗中实时自主决策,它离真正的通用助手就更近了一步——因为真实世界本来就是充满意外和对抗的。

当然,格斗更多是技术标杆,而非商业落点。它的价值在于证明:60亿参数的世界模型 + 2500小时真机数据,足以支撑实时全自主的复杂运动控制。 这个公式一旦跑通,接下来迁移到巡检、物流、服务等真实业务场景,就只是时间和数据成本的问题。物理AI的又一块关键拼图,被宇树拼上了。