光象科技发布物理原生世界模型 让具身智能学会物理因果
2026年8月25日,光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型,即Phi-WM 1.0 ActEffect,简称ActEffect,该模型是其“物理原生智能”(Physics-native Intelligence,Phi)技术路线的首个模型化落地成果。ActEffect的核心创新在于将世界模型转变为“训练时反馈器”,让机器人学会“动作会带来什么后果”。
目前,主流机器人的策略学习主要沿着两条路线推进。一条是视觉-语言-动作模型(VLA),通过模仿学习让机器人学会“看到什么就做什么”。另一条是世界模型路线,无论是以Sora为代表的生成式模型、以World Labs为代表的空间智能模型,还是以JEPA为代表的视觉表征模型,本质上都遵循同一套建模范式,即通过海量数据学习世界的统计表征,从观测中预测未来变化。
然而,这两条路线各自存在瓶颈。VLA模型只学会了模拟示范动作,并未建立起对“动作带来什么物理后果”的理解。世界模型则停留在“预测未来像什么”,但机器人真正需要的,是理解“因为什么动作才能实现可预期的未来”。
图灵奖得主、中国科学院院士姚期智在2025年底指出,当前具身智能方法多依赖模仿,缺乏可解释的世界表征能力和因果理解能力,未来应将推理、规划、控制置于同一闭环框架中。今年4月,美国具身智能公司Generalist AI发布新一代模型GEN-1,明确将其定位为“专为物理交互场景而原生构建的基础模型”。这些来自学术与产业界的信号表明,具身智能需要走向对物理世界的因果理解,在物理交互中涌现原生智能。
光象科技的物理原生智能技术路线,以物理交互为首要原则,旨在让机器人从物理环境中持续学习世界规律、行为后果与物理约束,完成复杂任务并实现闭环自进化。物理原生智能具有状态解耦表征、时序因果驱动、物理定律约束三大特征,其中,“时序因果驱动”强调机器人应理解动作与状态转移之间的因果关系。
物理原生世界模型Phi-WM 1.0 ActEffect,作为物理原生智能的首个模型化实现,进行了三方面的技术创新,在LIBERO、LIBERO-PLUS和RoboCasa-GR1三项国际通用机器人操作基准测试中,分别取得了98.8%、80.3%和67.5%的平均成功率,多项对比领先。
具体而言,ActEffect能够一次性生成三个精细程度不同的动作方案,分别预测每个方案可能带来的结果,通过比较筛选出最优方案。同时,依次优化动作方案,避免虚假改进,即要求精调方案的预测结果必须优于粗调方案,粗调方案必须优于初始方案。同时通过技术机制确保精调方案的改进来自自身优化,而非通过拉低其他方案的评估结果来实现。此外,结果的预测过程仅引入物理世界的客观观测和动作方案,不引入以语言描述为代表的任务目标信息,这是因为动作引发的物理状态转移仅由客观的物理规律决定,不应依赖于任务目标。
值得一提的是,ActEffect模型能够自然实现轻量化推理,这是因为模型在训练阶段通过后果反馈让动作策略自然学会了“某个动作会带来什么变化”,所以在推理阶段无需保留世界模型进行显式循环预测。将世界模型移出推理链路,意味着推理算力成本不随训练成本线性增长,这为ActEffect的规模化应用提供了经济可行性。
据了解,光象科技走的是物理原生智能与智能终端软硬一体的协同发展路径。在2026世界机器人大会上,光象科技的工业级自进化具身智能机器人Phi-Bot X1,完成了5天连续36小时的焊接上下料与移动质检双工位自主循环作业,验证了物理原生智能从单一任务向多任务的泛化性。目前,光象科技已在汽车制造真实场景完成上述典型高价值工位的验证,并与多家国内外头部汽车企业达成商业合作。