自变量机器人现身WAIC畅谈世界模型,未来胜出路线更可能“集众家所长”
近日,2026世界人工智能大会(WAIC)在上海召开。物理AI和具身智能成为本届大会关注的焦点。在大晓机器人承办的世界模型巅峰论坛上,多位具身智能技术领军者直面技术最前沿的课题,共话物理世界智能落地的核心挑战。
自变量机器人联合创始人兼CTO王昊,就在大会演讲环节分享了“事件驱动的世界模型”的前沿成果,并在圆桌环节探讨了世界模型的技术演进方向等诸多话题。

在圆桌讨论环节,王昊表示,如果放眼两年后再回顾今天的世界模型路线,做得最正确的可能莫过于将“对未来预测的监督”作为训练模型的主要方法之一。相反,利用纯视频数据试图构建世界模型、理解世界规律的做法,很可能遇到挫折。
如果放眼更长久的未来,尚未收敛的世界模型路线哪一种最可能胜出?王昊表示可以类比大语言模型:之前的众多路线各自保留了做得最好的部分,组成了今天的主流模型架构。“具身领域会发生同样的事情。”
举例来说,在众多路线中,视频生成路线对未来的预测需要保留,但生成像素的能力并不重要。隐空间路线适合做视觉推理,因为有些信息必须在隐空间表示。VLA模型跟物理相关的能力需要保留。显式建模对空间的记忆同样有益,未来可能扮演类似大语言模型RAG的角色。将这些最核心的部分组合起来,就可能构成新的世界模型架构。“我相信这一天并不遥远。”
给出技术展望的同时,王昊也在演讲环节分享了自变量世界模型WALL-WM的最新进展。
王昊表示,世界模型通常以固定长度定义世界预测长度的方式存在弊端,会导致不同模态的数据难以对齐。自变量近期发布的“事件级”世界模型WALL-WM,则使用以事件为边界拆分数据的方法,实现语言、视觉和动作的更好的对齐。
事件是连接语言、视觉和动作的天然尺度:事件是基于语言表达,因此边界清晰;视觉也由事件分割,同一事件内的动作更容易预测。以事件为尺度做变长分割,能够实现对三个模态的天然统一。

作为对齐模态的优势,自变量的世界模型WALL-WM在评测中取得了优异的成果:在真机测试方面,基础任务、推理任务、灵巧任务、泛化任务等四大类操作评测benchmark上,分数均大幅超过π 0.5、DreamZero,居于世界领先水平。
总体来说,自变量聚焦自研“通用具身智能大模型”,是国内最早采用完全端到端路径实现通用具身智能大模型的公司之一。今年4月,自变量机器人发布了全球首个基于“世界统一模型(WUM)”架构的具身大模型 WALL-B。该大模型将视觉、语言、动作、物理预测等放在同一个网络中从零开始联合训练,能够消除模块间的边界和数据搬运损耗。