全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
人工智能 正文
发私信给齐铖湧
发送

0

光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

本文作者: 齐铖湧   2026-08-26 12:22
导语:让机器人不仅学会“做什么”,更能理解“这个动作会带来什么后果”?

大多数机器人策略被训练为匹配演示动作,却从未被问过:“我做的这个动作,会让世界变成什么样?”

过去几年,视觉-语言-动作模型(VLA)将视觉观测和语言指令直接映射为动作,让机器人学会了“看到什么就做什么”。但这条路有一个根本性的局限:策略学习由模仿监督驱动,模型只学会了匹配演示动作,却未建立起对“动作带来什么物理后果”的理解。当场景发生变化时,泛化能力便受到限制。

世界-动作模型(WAM)试图弥补这一缺陷。这类方法将未来状态预测与动作生成耦合在同一个框架中,学习的是“未来会变成什么样”和“我该做什么”的联合分布。然而,这种耦合是隐式的,模型并未被要求区分“动作导致了哪些变化”与“场景演化带来的变化”,也未显式建立动作与状态变化之间的时序因果关联。

有没有可能让机器人不仅学会“做什么”,更能理解“这个动作会带来什么后果”?

近日,据雷峰网(公众号:雷峰网)了解,光象科技联合清华大学李升波教授课题组发布了第一代物理原生世界模型,即Phi-WM 1.0 ActEffect,简称ActEffect。相关技术报告提出将世界模型从“推理时规划器”转变为“训练时反馈器”的机器人策略学习框架,其核心洞察来自于物理交互的时间-因果结构,即当前状态之后是动作干预,然后才产生结果,因此,未来预测不应该只是动作生成的“预见”,而应该成为评估和改进动作提案的“反馈”。

Phi-WM 1.0 ActEffect技术报告:

《Phi-WM 1.0 ActEffect: From Predictive Foresight to Consequence Feedback in Robot Learning》

链接:https://www.sunrisingai.com/upload/202608/e597763b7e870a6ec5951d487b4b3e7f.pdf


三项技术创新: ActEffect如何让“反馈”成为可能

针对WAM方法存在的两个深层问题:未来预测与任务语义纠缠在同一表示空间中,预测后果反映的是任务条件下的场景演化,而非动作干预本身的孤立效果;耦合是隐式的,后果被吸收到对齐或去噪过程中而非显式评估。ActEffect在以下三个方面进行了创新设计。

创新一:从MIP获得“可比较的”完整动作提案

要实现后果比较,首先需要有多个完整的动作提案。标准扩散或流匹配策略在训练时监督的是单个噪声状态,并不显式暴露完整的动作序列。

ActEffect选择最小迭代策略(MIP)作为策略骨架。MIP将去噪过程简化为两个监督预测阶段:给定专家动作和噪声,构造中间动作,然后监督两个预测。推理时,两个阶段顺序执行:

 光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

这里的关键是:a0和a1都是完整的动作提案,而非中间噪声状态。这使得它们的预测后果可以被独立评估和比较。

在此基础上, ActEffect的策略网络实际暴露了三个完整的动作提案:前馈提案(通过VLM的action query直接生成)、粗提案(MIP第一阶段输出)和精提案(MIP第二阶段输出)。三份提案共享相同的当前状态和任务上下文,但代表不同精细程度的候选动作,为反事实比较提供了基础。

创新二:反事实排序让“越改越好”可监督

有了三个提案和它们各自的后果误差, ActEffect引入了一个排序损失,要求:

 光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

即精提案优于粗提案,粗提案优于前馈提案,且需满足一定的边际裕量。

排序损失的具体形式为:

光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果” 

其中P={(1,0),(1,ff)}, sg表示梯度截断(stop-gradient) ——梯度只流向排名更优的提案误差,而作为比较基准的 被阻断梯度。这一机制防止模型通过“让差提案表现更差”来被动满足排序条件,而是真正推动好提案变得更好。

完整的训练目标联合优化了动作预测、后果预测和反事实排序三个部分:

 光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

创新三:在任务无关空间里评估物理后果

受控()被设计为评估“给定当前状态和某个动作,未来会变成什么样”。其输入仅包含当前视觉状态和动作,不接收语言指令。设计依据在于动作引发的物理状态转移由物理规律决定,不应依赖于任务目标:

 光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

这一条件独立性意味着后果建模可以在一个与任务语义分离的表示空间中进行。ActEffect选择冻结的DINOv3视觉特征空间作为这个“纯净”的物理空间。世界模型预测的是动作带来的物理变化——物体的位置、朝向、接触状态——而非“动作是否在完成指令”。

这与FLARE、DUST等方法的区别在于后果评估是显式的、解耦的,而非隐式地吸收到对齐或去噪过程中。

ActEffect:推理轻量是时序因果设计的自然结果

ActEffect的推理阶段有一个反直觉的特性。

训练完成后,受控世界模型被完全移除。推理时,机器人看到当前观测后,直接输出最终动作。整个过程只是一次前向计算,没有循环、没有展开、没有候选采样、没有未来预测。

世界模型的全部收益在训练阶段就被“蒸馏”进了策略网络的权重中,这是时序因果设计的自然结果。因为,模型已经在训练阶段通过后果反馈学会了"动作→状态变化"的因果关联,推理时自然不再需要保留世界模型进行联合预测。

实验验证: ActEffect三项基准表现优越

ActEffect在三个互补的仿真基准上,经多项对比评估,均取得领先表现。

LIBERO(多任务操作):ActEffect达到98.8%的平均成功率,在四组任务(Long、Goal、Object、Spatial)上均取得领先性能。值得注意的是,即使在该基准性能已接近饱和的情况下, ActEffect仍然优于基于预见的方法如DiT4DiT(98.6%)和基于反馈的方法如FLARE(96.2%)、DUST(96.2%)。

光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果” 

LIBERO-PLUS(受控分布偏移):ActEffect在七种扰动(相机、机器人初始状态、语言、光照、背景、噪声、布局)下平均成功率为80.3%,显著优于Fast-WAM的51.5%。这一巨大差距表明“在策略动作的预测后果上提供显式的训练时反馈可以提高鲁棒性,超越仅依赖预测性预见的方法”。

 光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

RoboCasa-GR1(类人双手机器人,29维动作空间):ActEffect达到67.5%的平均成功率,超过Fast-WAM 10.8个百分点,超过DiT4DiT 16.7个百分点。这表明即使在更高维动作空间和更复杂的操作动力学下,显式后果反馈仍然有益。

 光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

消融实验进一步验证了ActEffect核心设计的贡献:

去除后果反馈后,成功率从98.8%降至97.0%,说明后果反馈提供了超越纯模仿的补充信息;

将DINO空间替换为VLM特征空间后,成绩降至97.3%,说明任务无关的物理后果空间对此类建模方式有实际贡献;

移除前馈提案后,成功率降至98.2%,说明额外的动作假设丰富了比较的参考集合;

去除排序损失后,成功率降至98.1%,说明结构化排序优于单纯的后果预测。

 光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”


从“预见到反馈”:一种范式转换的启示

ActEffect的价值在于它回答了一个根本性问题:“模型能否预测策略自身所提动作的后果,并将其用作反馈来改进提案本身?”这个问题之所以重要,是因为它遵循物理交互的因果结构——先有动作干预,后有结果。

从这个角度看,过去的大多数WAM把世界模型用在了错误的时间点。它们用世界模型来“预见”未来以指导动作生成,但真正的因果链条是反过来的:动作在前,后果在后。世界模型最自然的角色不是“事前规划器”,而是“事后评估器”。

这一思路与光象科技的物理原生智能(Physics-native Intelligence,Phi)技术体系一脉相承。Phi体系的核心主张是,具身智能从虚拟数字空间走向真实物理世界,仅仅预测“未来像什么”远远不够。机器人需要理解隐藏在观测背后的物理状态,理解动作如何改变未来,并遵循物理世界长期稳定运行的底层规律。这是一次从“拟合数据中的规律”走向“理解物理世界规律”的范式演进。ActEffect正是对这一方向的一次具体验证,它的三项创新围绕“动作如何改变未来”展开,回应了Phi体系中“时序因果优先”的核心原则。

ActEffect通过将“思考”前置到训练阶段,实现了推理时的轻量化与决策质量的兼得。这说明世界模型不一定是推理时的负担,它也可以是训练时的资产。

这一技术选择的产业意义尤为直接。推理算力成本,始终是具身智能规模化部署的核心制约因素。每一次决策都需要世界模型的前向展开,意味着算力消耗随部署规模线性增长,成本曲线难以收敛。ActEffect将世界模型移出推理链路,从根本上打破了算力成本与部署规模的正相关约束,为规模化应用的经济可行性提供了新的解法。(雷峰网)


雷峰网原创文章,未经授权禁止转载。详情见转载须知

光象科技发布物理原生世界模型Phi-WM 1.0 ActEffect 机器人学习从“模仿动作”走向“理解后果”

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说