818日消息,2026 WRC临近,在一场Workshop上,大晓机器人世界模型负责人王飞围绕开悟世界模型Kairos 3.1,给出了团队对世界模型的理解。

在王飞看来,世界模型的核心并不是生成一段视频,而是让机器人在行动前对未来状态和动作策略进行推演。“给定当前看到了什么,以及接下来准备做什么,去推演未来可能发生什么。”王飞说。

机器人需要做到“脑海中推演,现实中执行”

这也是世界模型与传统大语言模型、VLA等技术路线的差别所在。王飞表示,大语言模型或VLA更多是在预测“next token”,而世界模型要预测的是“next state”,即下一个世界状态。输入当前的视觉观测、文本指令、力触状态以及机械臂、灵巧手的策略轨迹后,模型不仅要生成未来画面,还要给出机器人未来执行的策略。

按照大晓的技术路线,Kairos 3.1将理解、生成和预测放到同一套架构中联合训练。模型先把多模态信息压缩到共享隐空间,再基于这一空间完成环境理解、过程分析、结果评估和未来推演。对于同一张桌面和同一个抽屉,机器人可以在不同指令下推演出不同的未来状态,并从多种策略中选择更合适的一条。

“脑海中推演,现实中执行。”王飞这样概括世界模型控制机器人的过程。以开冰箱为例,模型会先完成任务拆解,再在平行空间中生成35条候选轨迹及对应的未来演化结果,通过评估器判断成功率、效率和动作代价,再把更优策略部署到真机。对人形机器人而言,这种能力的意义在于减少盲目试错,避免在真实环境中执行危险、高代价或效率偏低的动作。

王飞特别强调,世界模型的生成能力不能只以画面是否自然来衡量。机器人端着咖啡移动时,水面波纹、物体接触、碰撞后的变化,都应符合真实的运动学和物理规律;盘子悬空、物体突然消失或穿模,即使画面看起来完整,也不能说明模型真正理解了物理世界。

围绕这一目标,大晓将数据分为三层:开放物理世界视频、人类第一视角交互数据,以及机器人真机数据。第一层帮助模型学习自然规律和运动规律,第二层让模型理解人如何与环境交互,第三层则将模型对动作的认知对齐到具体机器人本体和策略。

世界模型最终要接受真实场景的检验

对于行业热议的人类第一视角数据,王飞认为,这类数据有机会成为世界模型的重要来源。他表示,依赖真机数据训练机器人成本较高,也难以快速扩大规模;人类在真实环境中的操作视频,则包含大量机器人的交互知识。大晓计划在今年下半年储备百万级数据规模,后续进一步向千万级推进。“世界模型要出现比较明显的能力涌现,可能不止需要百万小时级数据,甚至可能接近千万小时级。”王飞说。

不过,规模并不是唯一标准。王飞提到,第一视角视频不能只是被直接输入模型,还需要结合手部姿态、Hand Mesh和隐空间表征等信息,提升数据中与操作有关的有效信息密度。未来,三层数据范式不会发生根本变化,但以人为中心的数据占比将继续提高,真机数据则更多承担最终对齐的作用。

模型能否在端侧实时运行,同样关系到世界模型能否真正控制机器人。王飞介绍,Kairos 3.18B模型,在NVIDIA Jetson ThorBF16条件下可实现百毫秒级单次推理延迟。大晓后续还计划将模型轻量化至2B级,用于ThorOrin及国产芯片等端侧部署。对机器人而言,推理速度直接影响移动、避障和操作的连贯性,也关系到实际场景中的运营节拍和成本。

世界模型最终仍要接受真实场景的检验。大晓机器人研发副总裁刘春晓介绍,团队在WAIC期间发布了“晓满”“晓新”“晓途”三套解决方案,分别面向即时零售、酒店客衣服务和开放场景自主作业。

其中,“晓满”要处理多SKU、窄巷道和高频履约任务;“晓新”需要完成取衣、洗涤、转运、烘干、折叠、送回等长流程服务;“晓途”则面向园区巡检、城市治理和文旅等开放环境。三类场景看似不同,但都要求机器人在连续任务中保持状态理解,并在环境变化或单次失败后重新规划。

Demo很多时候是在受控环境和有限操作物体里展示单点任务的最优状态,”刘春晓说,真正落地至少要面对场景泛化、持续作业和规模化复制三个问题。以酒店洗衣为例,机器人不能因为一次开门或抓取失败就停在原地,而要知道失败发生在哪里,并据此调整下一步动作。

在刘春晓看来,平行推演和反思能力正是世界模型进入真实业务的关键。执行前,模型要比较不同策略,选择行动代价更小的方案;执行后,如果真实结果与预期不一致,失败信息要及时回到模型中,帮助它更新对环境和任务的判断。“对于大规模真实落地来说,这种持续纠错和恢复能力是必须解决的问题。”刘春晓说。

从预测下一个词,到预测下一个世界状态,世界模型试图把机器人从“按照指令做动作”推向“理解结果后再行动”。这条路仍需要更多数据、更快的端侧推理和更长时间的真实场景验证,但在具身智能从展示走向作业的过程中,机器人能否先推演、再执行、还能反思,正在成为新的技术分界线。(定西)