巨人天成
产经 科技 企业 数据 峰会 快讯 商业

训练场“幕后指导”退场,具身智能机器人凭新法更高效干活

2026-09-05来源:快讯编辑:瑞雪

在具身智能领域,世界模型一直是机器人实现智能决策的关键支撑。传统模式下,世界模型如同机器人的“脑内沙盘”,在执行任务前,机器人借助它预测未来可能发生的情况,进而规划行动路径。但这种模式存在明显弊端,模型推理链路长,每多运行一步模型,在工业场景中就意味着新的时延、算力消耗和成本增加,这严重限制了具身智能技术在真实生产环境中的大规模部署。

近期,光象科技联合清华大学李升波教授课题组推出的第一代物理原生世界模型Phi-WM 1.0 ActEffect(以下简称ActEffect),为解决这一问题带来了新思路。这一模型不走寻常路,在训练阶段发挥关键作用后,执行任务时便悄然“退场”,却意外地让机器人表现更出色。

ActEffect的突破口在于模仿学习。当前,许多通用机器人策略基于VLA架构,摄像头提供视觉信息,语言指令明确任务,模型依据演示数据生成动作。然而,在物理世界中,动作接近并不一定意味着结果正确。例如,机械臂夹爪合上的时机或手腕角度的细微偏差,都可能导致截然不同的操作结果。ActEffect没有选择延长机器人的思考链,而是让策略一次性给出三版完整动作提案。这三份提案在相同起点下,为比较谁会带来更好后果提供了基础。

随后,受控世界模型登场。它接收当前视觉状态和一份动作提案,预测该动作执行后场景的变化。三份动作提案分别经过受控世界模型的预测,相当于让机器人在训练场提前预演了三次结果。值得一提的是,语言指令留在VLA策略一侧,受控世界模型仅关注当前画面和动作,不读取任务语言。比如,同样伸手推杯子,杯子如何移动取决于其当前位置、周围环境和机械臂动作,与指令是“挪开杯子”还是“清理桌面”无关。ActEffect将未来状态置于冻结的DINOv3视觉特征空间,无需生成逼真未来画面,只需捕捉物体位置、姿态和场景结构的变化,真正体现了“物理原生”的特点。

看过三版结果后,关键环节是将差别反馈给策略。训练数据中有动作执行后的真实观测,受控世界模型将三次预测与真实未来逐一比较,要求精提案比粗提案更接近真实,粗提案优于第一版前馈提案。如此一来,策略每次修改动作都能知晓是否朝着正确方向调整。为防止模型“钻空子”,ActEffect还对排序损失加上梯度截断,确保训练推动更好提案靠近真实未来。通过这种反馈信号学习,世界模型对“后果”的判断融入策略权重。机器人上岗时,受控世界模型和未来观测分支被移除,仅留下MIP动作头完成粗提案和精修。

在多个基准测试中,ActEffect展现出了卓越的性能。在LIBERO基准测试中,包含四组单臂、多任务桌面操作,ActEffect取得了98.8%的平均成功率,比DiT4DiT高出0.2个百分点,且引入后果反馈后,机器人原有的基础操作能力未受影响。LIBERO-PLUS测试加大了难度,通过改变相机视角、机器人初始状态和语言表述,以及在光照、背景、传感器噪声、物体布局上制造变化,ActEffect的平均成功率达到80.3%,远超Fast-WAM的51.5%。在RoboCasa-GR1测试中,模型需控制拥有双臂、灵巧手和腰部自由度的GR-1人形机器人,在29维动作空间完成24项桌面操作,ActEffect的平均成功率达到67.5%,比第二名ABot-M0高9.2个百分点,比Fast-WAM高10.8个百分点。消融实验也进一步验证了ActEffect方法的有效性,去掉后果反馈、将DINOv3特征空间换成VLM表示或拿掉排序损失,成绩均有所下降。

ActEffect的这种设计,与工业部署需求高度契合。在实验室中,具身智能的评价主要看任务成功率,但在真实生产环境里,情况大不相同。仿真环境中多跑一层模型可能只是计算开销的增加,但在汽车工厂等场景中,每一次推理都会产生实际成本,算力也会随规模扩大而大幅增加。ActEffect将受控世界模型留在训练阶段,避免了执行阶段的在线开销,让机器人“多想一会儿”留在训练时,执行时拥有更短的链路。

光象科技选择这样的技术路线,与其进入的场景密切相关。汽车制造中有大量散乱件上下料、复杂曲面质检等任务,传统自动化设备适应能力有限,具身智能有望弥补这一不足。目前,光象科技已围绕焊接上下料、移动质检等典型高价值工位完成真实场景验证,并与多家国内外头部汽车企业展开商业合作。在2026ATC展会上,团队将Phi-Bot X1应用于蔚来汽车焊接上下料场景,机器人连续运行3天,累计作业21.5小时,期间零失误、零中断。

光象科技成立于2025年4月,由清华大学车辆与运载学院和人工智能学院联合孵化。创始人兼CEO张涛是清华大学博士、米兰理工大学博士后,曾担任阿里巴巴高德地图技术总监和空间感知引擎负责人,相关技术已进入汽车量产体系。联合创始人李升波长期从事自动驾驶与具身智能研究,多项技术已应用于产业。光象科技不仅专注于强化学习和世界模型研究,还搭建机器人本体、数据算法体系和开发平台,具备丰富的汽车产业工程经验,这为算法成绩在产线上的落地提供了有力保障。

在具身智能领域,过去两年不乏令人惊艳的演示,但客户现场的连续运行才是真正的考验。机器人不仅要完成正式交付,还需满足节拍、精度、安全性、故障率等验收指标,并具备从一个工位迁移到相似工位、从一家工厂复制到更多工厂的能力。ActEffect将世界模型留在训练场,若能让策略在真机上更稳定,同时节省执行阶段的世界模型开销,那么在机器人复制到更多工位时,算力成本将得到有效控制,这对于准备规模部署的工业系统而言,比单次演示多完成一个动作更具实际意义。

博联AI智能方案:无需硬件改造,扫码解锁照明设备AI新体验
无论是成熟的标准化技术能力还是极具性价比的定价,博联AI智能方案,为传统的智能设备制造企业探索了一条更轻量、更高效、更易落地的AI升级路径。 值得关注的是,博联的AI智能方案,不仅让厂商不必从零开始研发AI…

2026-09-05

破解三大难题,天津理想动力科技助力电池壳体切割提质增效
在新能源电池壳体生产过程中,切割精度不足、热影响区过大、换型效率低下等问题,正成为制约企业产能与良品率的三大瓶颈。新能源电池壳体材料种类繁多,从铝合金(如6061、5052)到不锈钢(如304、316L),再…

2026-09-05

2026-2027:人形机器人零部件国产化突破,迈向规模化商用关键期
工业、物流领域的非人形机器人技术成熟、场景落地充分,商业模式已实现闭环;人形机器人仍处于技术迭代、场景验证、成本优化的早期阶段,行业现阶段核心攻坚方向集中在供应链完善、成本压降与真实工况适配。电机、传动等上游…

2026-09-05

IFA 2026:耐士劳携多款新品亮相,以创新科技引领户外庭院产业新变革
本次IFA上“新产品+新技术+新业务”的集中发布,为耐士劳构建起“硬件整机+算法能力+核心感知雷达”三位一体的完整增长模型,实现从割草设备单元,向覆盖核心感知层、终端产品层、全场景解决方案层的智能庭院生态平…

2026-09-05

2026上海企业IT运维外包选服务商:从四维度出发,精准锁定靠谱伙伴
数据表明,拥有丰富项目经验的服务商,其方案能更精准地匹配合规要求与业务痛点,例如,在满足等保2.0三级合规整改、工业工控安全监测等特定场景时,能提供更具针对性的实施路径。企业应将目光放长远,从服务能力、行业经…

2026-09-05

OpenAI重磅推出GPT-6 Astra,覆盖多领域,或成AGI发展关键转折
据彭博社报道,OpenAI于周四正式推出新一代旗舰AI大模型GPT-6 Astra,官方称该模型在计算机操作、软件工程、科学研究及各类专业工作场景下均实现重大能力突破,是公司多年技术积累与持续高投入的集中落地…

2026-09-05

2026企业内容生产新指南:5款AI工具选型适配多场景交付需求
经常要做文档、报告、PPT和策划方案,可以先按交付重点缩小范围:快鹭KuWork适合把多种成果放进同一项目组织;澜舟智库适合重视资料依据与来源核验的内容工作;Dust侧重团队内容方法复用;有技术支持、重视本地…

2026-09-05