巨人天成
产经 科技 企业 数据 峰会 快讯 商业

对话交大杨理欣:三维时间轴如何为机器人装上“空间时间双导航”?

2026-09-09来源:快讯编辑:瑞雪

在机器人技术领域,如何让机器人在执行任务时不仅“动手”,还能“动脑”,理解任务意图、把握操作进度并感知环境变化,一直是科研人员努力攻克的关键问题。上海交通大学人工智能学院助理研究员杨理欣带领团队,围绕三维点流展开了一系列创新研究,为解决这些问题提供了新思路。

当前,视觉—语言—动作模型(Vision-Language-Action,VLA)虽能将图像和语言转化为动作,但训练重点多在于模仿专家动作,对任务意图在三维空间的落实、操作进度以及动作对环境的影响等方面关注不足。杨理欣形象地指出,机器人若无法判断自身操作进度,下一步就可能出错。为此,他担任通信作者的LaMP、ChronoFlow-Policy和Track4Action三项研究相继公开,前两项已被ECCV 2026录用,它们均尝试将三维点随时间的运动引入机器人策略,只是切入点各有不同。

LaMP的研究起点是VLA中存在的断层。预训练视觉语言模型擅长识别物体和理解指令,动作头负责输出机械臂命令,但中间缺少明确的几何表征,即机器人、物体等在三维空间应如何运动以完成任务。LaMP在视觉语言主干与动作头之间加入Motion Expert,当前观测和任务指令先经视觉语言主干处理,运动专家再生成部分去噪后的三维场景流表示,取中间隐藏状态通过门控交叉注意力送给Action Expert生成动作块。实验表明,在LIBERO-Plus的七类零样本扰动中,加入运动专家后,LaMP平均成功率从71.6%升至79.3%。不过,LaMP主要验证了当任务语义约束为三维运动表示时,动作策略在空间变化和长程任务上更稳定,并未专门评测自然语言理解和通用因果推理能力。

ChronoFlow则聚焦于解决任务中的时间歧义问题。在交换物体或检查抽屉等任务中,中间画面可能对应多种操作,正确动作不仅取决于当前观测,还与过去交互有关。ChronoFlow以物体与夹爪的稀疏三维关键点为载体,将过去轨迹、当前状态和预测的未来轨迹纳入同一坐标系。策略接收当前RGB-D点云和历史ChronoFlow,扩散模型恢复未来交互轨迹并解码动作。真机实验显示,在Swap-Easy任务中,完整模型和去掉历史的版本在第一阶段成功率相同,但第三阶段完整模型仍为93%,无历史版本只剩20%;Swap-Hard任务中,最终阶段完整模型为61%,无历史版本为11%,历史点流的作用显著。

Track4Action探索的是让VLA在训练阶段吸收三维经验,部署端仅保留必要表征。一段机器人演示包含动作序列和与之对齐的视频,常规VLA主要使用前者,Track4Action试图利用后者。团队选择让VLA学习追踪器形成轨迹前的内部表征,而非显式轨迹。训练时,冻结的Track4World提取场景、运动等特征形成教师表示,VLA学生通过当前信息和可学习的track queries逼近教师表示,并通过门控进入动作头。真机双臂任务中,Track4Action平均整项成功率为67.5%,比无追踪对齐消融版本高25个百分点,仿真结果也呈现类似趋势,说明追踪蒸馏路径能将动作结果信息转化为控制收益。

穹彻智能在这条研究链路中发挥着重要作用,将学术想法放大到工程尺度。上海交通大学人工智能学院与上海创智学院负责学生培养和研究,穹彻智能开放数据、机器人平台等资源。穹彻的数据平台累计数据时长约9.74万小时,覆盖47个城市,为三维轨迹提取等提供了可扩展的入口。同时,穹彻“以力为中心”的研究路线与点流研究形成衔接,团队也在探索将力加入世界模型。

这三项研究正在转化为量产项目,有望提升穹彻策略在不同场景的成功率。这条研究路线改变了演示数据的含义,使旧数据可重新加工成更密集的监督,还为未来VLA形态提供了分层架构思路,即视觉语言模型负责长程任务拆解,世界—动作模型负责连续操作,力觉、触觉等进入快速反应层。接下来,研究将聚焦于第一视角人类数据、灵巧手、高接触任务和自主纠错等方面,进一步检验点流作为中间接口的价值。

Meta发布AI智能体Muse:扎根日常场景,开启个人超级智能新篇章
Wang称这是"极为安全的架构"——Muse保留操作记录与待执行计划,不与Meta广告系统共享数据,并在处理敏感操作前主动向用户确认。 用户可为智能体自定义名称与头像、设置沟通风格,并将其接入邮件、健身追踪…

2026-09-09

宇树科技UnifoLM-X2-1.0:全自主机器人格斗开启具身智能新篇章
UnifoLM-X2-1.0的核心进展在于突破了世界-动作大模型在瞬时规划、决策输出和动态交互执行三个方面的技术瓶颈。在高动态、强对抗的格斗场景中,机器人能够持续感知对手位姿与接触力,在模型内部实时预测下一…

2026-09-09

复旦创智联合推出RSAgent:多轮纠错让视觉分割迈向更精准未来
训练策略上,cold-start SFT解决“会不会按格式工作”的问题,让模型掌握工具调用语法和基本反思流程;agenticRL解决“怎样做得更好”的问题,通过奖励信号优化多轮路径。 团队在RefCOCO…

2026-09-09

字节跳动入局世界模型赛道 研发空间视频生成AI模型张一鸣统筹推进
字节跳动正在推进一款实时空间视频生成AI模型的研发,正式入局世界模型赛道,未来将与Meta、Alphabet在机器人技术、自动驾驶等应用领域展开竞争。在内部定位中,这款可打造沉浸式三维世界的空间视频模型,定…

2026-09-09

赛睿进军高端游戏手柄市场,Aeon Pro无线手柄能否凭实力站稳脚跟?
与其先通过价格相对亲民的主机和 PC 手柄慢慢建立口碑,赛睿这次选择直接进入高端市场,推出售价 259.99 美元(IT之家注:现汇率约合1,749 元人民币)的 Aeon Pro 无线手柄,支持 Xbox…

2026-09-09

国产硫化物全固态电池突破:中试线年底建成,全固态家用车普及或加速
目前全球绝大多数全固态技术成果,仍停留在实验室小样品、小批次验证阶段,参数亮眼但无法适配工业化生产,一上产线就面临良率崩盘、成本失控的问题,这也是固态电池迟迟难走进民用市场的核心原因。通俗来说:行业多数玩家还…

2026-09-08

清华博士领衔千诀科技,获数亿元A+轮融资,加速机器人智能技术落地
今年3月,据千诀科技发布,在北京举办的 “中关村U30” 青年创新创业评选活动中,千诀科技创始人兼CEO高海川博士成功入选年度青年创新创业优胜者榜单。此次入选,是对千诀科技在具身智能与“机器人大脑”方向持续…

2026-09-08