新框架架起自然语言与机器人操作的桥梁——原理详解

新框架架起自然语言与机器人操作的桥梁——原理详解

2 分钟阅读•2026年5月22日•
Maya Patel
Maya Patel

最新开发的框架让机器人能够将复杂的自然语言指令转化为精确的三维动作,解决了物理AI领域一个长期存在的瓶颈。通过将“把左边那个蓝色小杯子递给我”这类模糊表述映射为可执行的动作基元,系统的任务成功率从约62%提升至89%以上,使工业协作臂更接近真正的零编程操作。

什么是这个新语言到动作框架?

该框架由一家顶尖机器人实验室的研究人员开发,作为用户自然语言指令与机器人底层控制系统之间的中间层。它首先将指令解析为语义成分(对象、位置、属性、动作),然后将这些成分匹配到一个包含27个预定义动作基元的库中(如“拿起”、“放置”、“左滑”、“旋转90°”)。每个基元包含一个3D空间模板,机器人利用来自摄像头和力/力矩传感器的实时传感器数据填充该模板。在涵盖142个独特物体操作任务的基准测试中,系统首次尝试成功率达到89.3%,而基线LLM-only管线的成功率为61.7%。

它如何将复杂指令转化为精确动作?

三幅序列图显示机械臂解释指令:先是文本输入,然后是物体检测,最后是抓取执行

管线分四个阶段工作。首先,一个微调的语言模型(7B参数,从更大的基础模型蒸馏而来)提取用户指令中的名词短语、空间介词和动作动词。其次,一个基于工作空间神经辐射场(NeRF)的视觉语言模块解决歧义——“架子上最左边的红盒子”变为相对于机器人基座的坐标(x=0.23 m, y=0.87 m, z=0.42 m)。第三,运动规划阶段将目标坐标和动作基元转换为关节空间轨迹,并通过30 Hz更新的实时占位网格检查碰撞。最后,一个力控制器回路在夹爪接触物体时调整轨迹,补偿重量和摩擦变化。

该框架的关键创新在于其学习的接地模型,该模型无需固定摄像机视角即可将语言映射到3D空间。它并非依赖单个顶置摄像头,而是融合了两个腕装RGB-D摄像头和一个静态深度摄像头的数据,使机器人能够处理物体部分遮挡的杂乱场景。在使用8种不同的厨房和工业物品(杯子、扳手、连接器)进行随机杂乱的测试中,系统在94.2%的试验中正确识别了目标物体,即使用户使用同义词或模糊属性(如“那个亮闪闪的”)描述它。

与现有方法相比如何?

特征本框架RT‑2 (Google)SayCan (Google)RoboFlamingo (OpenAI)
输入模态自然语言 + 视觉文本 + 图像仅语言文本 + 视频
3D接地NeRF + 多视角2D边界框有限(预映射)2D + 深度估计
动作基元库27个闭集通过RL学习551个技能(固定)12个技能(开集)
平均规划延迟120 ms450 ms210 ms320 ms
首次尝试成功率89.3%68.1%82.4%74.6%
开源?部分(仅模型)否否是

比较显示,新框架以开放式的技能泛化(RT‑2的优势)换取了可靠性和速度,这更符合工业部署对可重复性的要求。其120 ms的规划延迟——大约是RT‑2的2.6倍——意味着机器人可以在指令中途响应用户的纠正而几乎没有延迟。

不同框架的任务成功率对比图,新框架以89.3%领先

哪些机器人可以使用这个框架?

该框架设计为机器人无关。它公开了一个ROS 2动作接口,任何具有标准URDF模型和关节状态反馈的机械臂都可以使用。研究人员已在以下机器人上进行了验证:

  • Universal Robots UR5e(6自由度,5 kg有效载荷)
  • FANUC LR Mate 200iD(通过EtherNet/IP适配器集成)
  • Franka Emika Panda(7自由度,力矩传感关节)
  • KUKA LBR iiwa 14(7自由度,阻抗控制器)

部署要求:一台配备NVIDIA RTX 3060或更好显卡的PC(用于NeRF和LLM推理)、至少两个RGB-D摄像头(Intel RealSense D435或类似型号),以及ROS 2-foxy发行版。在推荐硬件上,感知模块以15 FPS运行。对于现有机器人单元,改造费用估计为每个工位4,500–6,000美元,用于摄像头和计算设备。如果您正在评估兼容平台,可以在Robot Overflow上浏览二手协作机器人。

这对仓储自动化和制造业意味着什么?

对于仓储拣选和轻装配,该框架解决了最大的运营痛点:产品线变更时重新编程机器人。目前,将拣选单元切换为处理新零件通常需要两到八小时的手动重新编程。而借助这一语言到动作层,主管只需输入“从A料箱中拿起新的银色支架,旋转90度放到B传送带上”,机器人即可在10秒内自主重新校准。

这对小批量制造业意义重大。一项针对87家美国制造商的调查发现,62%的企业将编程复杂性列为部署协作机器人的首要障碍。通过将编程门槛降低到自然语言水平,该框架可以扩大协作机器人超越高批量应用的可寻址市场。如果您正在评估二手工业机器人用于柔性生产线,这项技术使旧款协作机器人能够处理此前无法胜任的多SKU操作。

一名工厂工人对着平板电脑说话,同时机械臂从料箱中拣取零件

这对买家意味着什么?

对于评估动态环境中协作机器人的最终用户,该框架改变了总拥有成本的计算方式。无需再为全职机器人程序员(年薪$70k–$100k)做预算,具备基本阅读能力的产线操作员即可处理重新配置。对于典型的$40k协作机器人安装,投资回收期从大约18个月缩短到11个月。

给买家的关键建议: - 选择带有力矩传感关节的机器人臂——框架的力循环适应在机器人能感知接触力时效果最佳(Franka Panda和KUKA LBR iiwa是绝佳匹配)。 - 确保工厂网络支持低于50ms的延迟,连接策略计算机与机器人控制器——高抖动会抵消规划优势。 - 如果您已拥有UR5e或类似型号,升级成本约为5,000美元的硬件加上零许可证费用(该框架开源用于研究和内部使用)。

常见问题解答

哪些机器人臂正式受支持? 该框架已在Universal Robots UR5e、FANUC LR Mate 200iD、Franka Emika Panda和KUKA LBR iiwa 14上测试。任何具有标准ROS 2接口和关节状态反馈的6或7自由度机器人,经过少量配置后都能工作。

对模糊指令的语言理解能力如何? 接地模型在处理同义词和部分描述时,在94.2%的试验中解决了歧义。例如,“那个亮闪闪的金属东西”在启用基于反射率的注意力头时能映射到正确物体,但无深度摄像头融合时性能降至82%。

能否处理多步骤指令? 能,该框架可将单个句子中的最多五个顺序基元链接起来,例如“从托盘3中拿起红色螺栓,插入B孔,拧紧至5 Nm”。三步链的成功率为83.6%,五步链降至71.0%。

是否需要互联网连接? 所有推理在本地完成。语言模型在本地运行(7B参数,4位量化),NeRF也在同一台机器上计算。离线运行是工厂车间可靠性的设计要求。

语言模型的训练数据是什么? 研究人员在一个自定义数据集上微调了预训练LLM,该数据集包含12,500个任务规格,涵盖142个物体的27个动作基元。他们还使用GPT-4模拟器生成的合成数据来覆盖边界情况,如否定(“不是红杯子”)和复合形容词。

成本与传统编程相比如何? 对于15分钟的任务变更,传统示教编程每次需要1-2小时。该框架将其缩短至10秒以内的自然语言输入。在12个月内进行50次任务变更的情况下,每个工位可节省大约6,500美元的人工成本(按每小时50美元程序员成本计算)。

您准备好让车间操作员用话语指挥您的协作机器人了吗?还是说可靠的机器人抓取仍需时日?

AI视频引发亚利桑那州上诉法院撤销过失杀人刑期

亚利桑那州一家上诉法院撤销了加布里埃尔·霍卡西塔斯的10.5年刑期,同时维持其过失杀人罪定罪。这一消息最早由《纽约时报》报道。案件将发回马里科帕县高等法院重新量刑,届时不得使用该视频。法官认为,视频把事先撰写的陈述呈现得仿佛受害者本人正在法庭上发言。

由三名法官组成的合议庭表示,视频生成了克里斯托弗·佩尔基的声音和外貌,但并未反映真实发生过的事件。合议庭认定,允许使用并依赖该视频,使量刑程序从根本上失去了公正性;同时指出,亚利桑那州此前没有案件涉及量刑时此类影像是否可采。

法官表示,受害者的发言权不能凌驾于被告基于准确、可靠信息接受量刑的权利之上。他们指出,该视频混淆了两个不同的概念:家人认为佩尔基会说什么,以及佩尔基本人的声音和观点。

裁决区分了家人讲述佩尔基的情况与生成的影像替他发声这两种做法。

佩尔基的姐姐斯泰西·威尔斯在霍卡西塔斯接受量刑时播放了这段视频,同时还宣读了家人和朋友撰写的受害者影响陈述。威尔斯写下了视频脚本,并表示她的丈夫和夫妻俩多年的生意伙伴参与了视频制作;他们从一段YouTube视频中提取佩尔基的声音,并根据一张殡仪服务海报还原他的面部和躯干。

托德·F·朗法官称赞这段视频真挚动人,随后判处最高刑期10.5年,超过检方要求的9年。

威尔斯表示,没有人想让法庭相信佩尔基还活着,也没有人想让法庭以为他在去世前录制了这段视频。她说自己不同意这项裁决,并指出,家人会用幻灯片、拼贴画、假想对话和诗歌来表达悲痛。

威尔斯将这段AI视频比作摄影,并表示,摄影术在法院中得到广泛认可之前,经历了约1860年代开始的15年间一系列具有里程碑意义的案件。

案件将发回马里科帕县高等法院举行新的量刑听证会,届时不得使用这段AI生成视频。