热搜:暂无热词
成功率82%,推理速度提升3倍
本文解析加州大学圣地亚哥团队发布的FACT因果世界-动作模型,通过引入失败轨迹作为后果监督,解决机器人在错误动作下盲目预测成功的问题,助力机器人学习在失败中提升可靠性。
现有的机器人模型往往只从成功中学习,导致它们在犯错时依然自信满满地预测任务成功。加州大学圣地亚哥团队推出的FACT模型打破了这一局限,它通过“先生成动作,后预测结果”的因果逻辑,让机器人学会从失败后果中汲取教训,显著提升了操作的可靠性与泛化能力。

要理解FACT模型为何能打破机器人“只学成功”的局限,关键在于其底层的因果架构设计。传统世界模型往往混淆了动作与结果的因果关系,而FACT采用了一种更为严谨的“先生成动作,后预测结果”范式。这种设计确保了模型在预测未来状态时,是基于当前观测和预期动作进行推导,而非简单地记忆成功轨迹。
在具体的Token序列构建上,FACT对输入顺序进行了精细化拆解。序列依次包含观测前缀P、预测动作A、教师强制动作G、价值片段V以及未来视频片段I。这一顺序至关重要,它严格隔离了目标信息,避免了未来视频片段中的动作信息泄漏到预测阶段,从而保证了模型学习的因果纯粹性。
在训练策略上,FACT并未对失败轨迹进行简单的动作模仿,而是采用了差异化的监督机制。对于失败轨迹,模型屏蔽了动作模仿损失,转而重点监督失败的未来视频片段及较低的任务进度值。这种策略迫使模型关注“如果做了这个动作,会导致什么后果”,而非仅仅模仿专家的正确动作。
此外,FACT的价值评估模块基于干净动作G作为条件约束,使其对动作变化保持高度敏感。这意味着,即使微小的动作偏差,价值评估也能准确反映出任务进度的差异,从而帮助机器人区分不同动作带来的后果。这种对失败后果的精细化建模,正是FACT提升机器人可靠性的核心所在。
架构设计的合理性最终需通过实证数据来检验。为验证FACT在大规模任务中的稳定性,研究团队在50个RoboTwin仿真任务上进行了基准测试,并额外引入了约1.3K条推演故障数据以增强模型的抗干扰能力。实验结果显示,单纯的视觉联合训练已能带来显著增益,将平均成功率从基线的81.8%提升至85.6%;而在引入故障联合训练后,成功率进一步攀升至87.5%。这一数据直观证明了“从失败中预测后果”机制对提升操作可靠性的有效性。
在性能对比方面,FACT不仅成功率逼近现有基线方法Motus(87.8%),更在推理效率上展现出压倒性优势。FACT的部署推理运行速度约为Motus的3倍。对于需要实时反馈的机器人应用而言,这种速度优势意味着更低的延迟和更高的响应频率,使其在复杂动态环境中更具实用价值。尽管两者在准确率上差距微小,但FACT在计算效率上的突破,使其成为兼顾精度与速度的优选方案。
仿真环境中的优异表现固然令人振奋,但真实物理世界的复杂性往往远超数字模拟。为了验证FACT在现实场景下的鲁棒性与泛化能力,研究团队将实验拓展至真实机器人硬件,重点考察了可见操作任务(如叠方块、抓方块)及其不可见变体任务。在数据配置上,实验采取了精细化策略:方块任务提供了200条专家示范,其余可见任务各保留50条,而每个任务均额外引入了约30条故障轨迹,以确保模型充分感知错误后果。
实验结果令人信服。在可见任务中,FACT的基础成功率达到82%,显著优于对比基线Motus的64%。进一步引入故障训练后,成功率提升至89%;当结合打分机制优化后,更是攀升至92%,展示了极高的操作上限。更具挑战性的是不可见变体任务,即模型需处理训练集中未出现过的物体状态。在此场景下,故障感知训练将成功率从67%大幅提升至77%,结合打分机制后更是达到了82%。这一表现已十分接近依赖大规模预训练数据的π0.5模型(85%),且FACT并未使用此类庞大预训练资源,证明了其因果学习机制在有限数据下依然具备强大的泛化潜力,为资源受限场景下的机器人部署提供了可行路径。
尽管FACT在提升机器人可靠性方面表现亮眼,但工程落地中仍面临权衡。当前价值头设计仍有优化空间,未来可引入可学习式进度估计器以更精准地评估动作质量。此外,价值引导筛选需额外执行评分前向传播,虽以计算量换取了可靠性,但在实时性要求极高的场景下可能构成瓶颈。
针对这一挑战,部署策略需灵活调整。注意:在延迟严苛的应用场景中,建议仅运行动作模式,跳过价值引导选择环节,以确保响应速度。后续研究将在保持动作条件化接口的前提下,进一步优 化价值头效率,平衡计算开销与性能增益,为更广泛的机器人应用铺平道路。
CopyRight 2025 www.bzxz.net All Rights Reserved
本网站所展示的内容均由用户自行上传发布,本站仅提供信息存储服务。若您认为其中内容侵犯了您的合法权益,请及时联系我们处理,我们将在核实后尽快删除相关内容。