最新开发的框架让机器人能够将复杂的自然语言指令转化为精确的三维动作,解决了物理AI领域一个长期存在的瓶颈。通过将“把左边那个蓝色小杯子递给我”这类模糊表述映射为可执行的动作基元,系统的任务成功率从约62%提升至89%以上,使工业协作臂更接近真正的零编程操作。
什么是这个新语言到动作框架?
该框架由一家顶尖机器人实验室的研究人员开发,作为用户自然语言指令与机器人底层控制系统之间的中间层。它首先将指令解析为语义成分(对象、位置、属性、动作),然后将这些成分匹配到一个包含27个预定义动作基元的库中(如“拿起”、“放置”、“左滑”、“旋转90°”)。每个基元包含一个3D空间模板,机器人利用来自摄像头和力/力矩传感器的实时传感器数据填充该模板。在涵盖142个独特物体操作任务的基准测试中,系统首次尝试成功率达到89.3%,而基线LLM-only管线的成功率为61.7%。
它如何将复杂指令转化为精确动作?

管线分四个阶段工作。首先,一个微调的语言模型(7B参数,从更大的基础模型蒸馏而来)提取用户指令中的名词短语、空间介词和动作动词。其次,一个基于工作空间神经辐射场(NeRF)的视觉语言模块解决歧义——“架子上最左边的红盒子”变为相对于机器人基座的坐标(x=0.23 m, y=0.87 m, z=0.42 m)。第三,运动规划阶段将目标坐标和动作基元转换为关节空间轨迹,并通过30 Hz更新的实时占位网格检查碰撞。最后,一个力控制器回路在夹爪接触物体时调整轨迹,补偿重量和摩擦变化。
该框架的关键创新在于其学习的接地模型,该模型无需固定摄像机视角即可将语言映射到3D空间。它并非依赖单个顶置摄像头,而是融合了两个腕装RGB-D摄像头和一个静态深度摄像头的数据,使机器人能够处理物体部分遮挡的杂乱场景。在使用8种不同的厨房和工业物品(杯子、扳手、连接器)进行随机杂乱的测试中,系统在94.2%的试验中正确识别了目标物体,即使用户使用同义词或模糊属性(如“那个亮闪闪的”)描述它。
与现有方法相比如何?
| 特征 | 本框架 | RT‑2 (Google) | SayCan (Google) | RoboFlamingo (OpenAI) |
|---|---|---|---|---|
| 输入模态 | 自然语言 + 视觉 | 文本 + 图像 | 仅语言 | 文本 + 视频 |
| 3D接地 | NeRF + 多视角 | 2D边界框 | 有限(预映射) | 2D + 深度估计 |
| 动作基元库 | 27个闭集 | 通过RL学习 | 551个技能(固定) | 12个技能(开集) |
| 平均规划延迟 | 120 ms | 450 ms | 210 ms | 320 ms |
| 首次尝试成功率 | 89.3% | 68.1% | 82.4% | 74.6% |
| 开源? | 部分(仅模型) | 否 | 否 | 是 |
比较显示,新框架以开放式的技能泛化(RT‑2的优势)换取了可靠性和速度,这更符合工业部署对可重复性的要求。其120 ms的规划延迟——大约是RT‑2的2.6倍——意味着机器人可以在指令中途响应用户的纠正而几乎没有延迟。

哪些机器人可以使用这个框架?
该框架设计为机器人无关。它公开了一个ROS 2动作接口,任何具有标准URDF模型和关节状态反馈的机械臂都可以使用。研究人员已在以下机器人上进行了验证:
- Universal Robots UR5e(6自由度,5 kg有效载荷)
- FANUC LR Mate 200iD(通过EtherNet/IP适配器集成)
- Franka Emika Panda(7自由度,力矩传感关节)
- KUKA LBR iiwa 14(7自由度,阻抗控制器)
部署要求:一台配备NVIDIA RTX 3060或更好显卡的PC(用于NeRF和LLM推理)、至少两个RGB-D摄像头(Intel RealSense D435或类似型号),以及ROS 2-foxy发行版。在推荐硬件上,感知模块以15 FPS运行。对于现有机器人单元,改造费用估计为每个工位4,500–6,000美元,用于摄像头和计算设备。如果您正在评估兼容平台,可以在Robot Overflow上浏览二手协作机器人。
这对仓储自动化和制造业意味着什么?
对于仓储拣选和轻装配,该框架解决了最大的运营痛点:产品线变更时重新编程机器人。目前,将拣选单元切换为处理新零件通常需要两到八小时的手动重新编程。而借助这一语言到动作层,主管只需输入“从A料箱中拿起新的银色支架,旋转90度放到B传送带上”,机器人即可在10秒内自主重新校准。
这对小批量制造业意义重大。一项针对87家美国制造商的调查发现,62%的企业将编程复杂性列为部署协作机器人的首要障碍。通过将编程门槛降低到自然语言水平,该框架可以扩大协作机器人超越高批量应用的可寻址市场。如果您正在评估二手工业机器人用于柔性生产线,这项技术使旧款协作机器人能够处理此前无法胜任的多SKU操作。

这对买家意味着什么?
对于评估动态环境中协作机器人的最终用户,该框架改变了总拥有成本的计算方式。无需再为全职机器人程序员(年薪$70k–$100k)做预算,具备基本阅读能力的产线操作员即可处理重新配置。对于典型的$40k协作机器人安装,投资回收期从大约18个月缩短到11个月。
给买家的关键建议: - 选择带有力矩传感关节的机器人臂——框架的力循环适应在机器人能感知接触力时效果最佳(Franka Panda和KUKA LBR iiwa是绝佳匹配)。 - 确保工厂网络支持低于50ms的延迟,连接策略计算机与机器人控制器——高抖动会抵消规划优势。 - 如果您已拥有UR5e或类似型号,升级成本约为5,000美元的硬件加上零许可证费用(该框架开源用于研究和内部使用)。
常见问题解答
哪些机器人臂正式受支持? 该框架已在Universal Robots UR5e、FANUC LR Mate 200iD、Franka Emika Panda和KUKA LBR iiwa 14上测试。任何具有标准ROS 2接口和关节状态反馈的6或7自由度机器人,经过少量配置后都能工作。
对模糊指令的语言理解能力如何? 接地模型在处理同义词和部分描述时,在94.2%的试验中解决了歧义。例如,“那个亮闪闪的金属东西”在启用基于反射率的注意力头时能映射到正确物体,但无深度摄像头融合时性能降至82%。
能否处理多步骤指令? 能,该框架可将单个句子中的最多五个顺序基元链接起来,例如“从托盘3中拿起红色螺栓,插入B孔,拧紧至5 Nm”。三步链的成功率为83.6%,五步链降至71.0%。
是否需要互联网连接? 所有推理在本地完成。语言模型在本地运行(7B参数,4位量化),NeRF也在同一台机器上计算。离线运行是工厂车间可靠性的设计要求。
语言模型的训练数据是什么? 研究人员在一个自定义数据集上微调了预训练LLM,该数据集包含12,500个任务规格,涵盖142个物体的27个动作基元。他们还使用GPT-4模拟器生成的合成数据来覆盖边界情况,如否定(“不是红杯子”)和复合形容词。
成本与传统编程相比如何? 对于15分钟的任务变更,传统示教编程每次需要1-2小时。该框架将其缩短至10秒以内的自然语言输入。在12个月内进行50次任务变更的情况下,每个工位可节省大约6,500美元的人工成本(按每小时50美元程序员成本计算)。
您准备好让车间操作员用话语指挥您的协作机器人了吗?还是说可靠的机器人抓取仍需时日?
