ODEWorld 将连续时间世界建模引入机器人操作

ODEWorld 将连续时间世界建模引入机器人操作

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang +3 更多

1 分钟阅读2026年8月26日

ODEWorld 是一种连续预测世界模型,它让单个紧凑的潜在状态随物理时间演化,从而生成机器人操作任务的未来视频。在 LIBERO-LONG 操作基准测试中,它取得了 83.2% 的平均任务成功率,在所有对比基线中排名第一;同时,它无需重新训练,就能适应语言指令。

目录

研究团队构建了什么

ODEWorld 是一种面向机器人操作的世界模型——也就是能够学习场景如何演化的神经网络。它没有逐帧预测视频,而是通过常微分方程(ODE)让紧凑的潜在表示沿物理时间连续演化。该架构使用 DINOv2 视觉骨干网络对当前观测进行编码,让单个潜在 token 沿学习到的速度场推进,再将结果解码为任意时间点的未来帧。

该模型支持两种目标条件方式。它既可以直接接收明确的图像目标,也可以通过轻量级目标图像预测器处理语言指令:该预测器由四层交叉注意力组成,能够根据当前观测和文本指令生成预测目标图像。

研究人员还设计了顺序子目标滚动策略:ODEWorld 会在整个任务时间范围内连续输出一串密集的子目标帧,下游操作策略按顺序跟随这些子目标。这种方式让策略引导始终紧扣任务目标,并避免长时域滚动预测中常见的逐步偏移。

ODEWorld 的速度场可视化,展示机器人操作场景中学习到的连续时间动力学

关键结果

最亮眼的结果来自专为长时域机器人操作设计的 LIBERO-LONG 基准测试。采用顺序子目标滚动策略后,ODEWorld 的平均成功率达到 83.2%,在所有 ODEWorld 变体及测试基线中均排名第一。所有 ODEWorld 变体的表现都超过了基线方法,这一提升被归因于其高保真的时间一致性:模型生成的滚动序列能够保持精确的轨迹对齐,并提供密集、可靠的引导,同时不会偏离任务目标。

三组消融实验进一步支持了这一结论。将 DINOv2 视觉编码器替换为 SigLIP 2 或 LIV 后,性能变化很小;在短时域和长时域预测中,DINOv2 仍然领先。将潜在 token 数量从一个增加到四个,性能变化同样不大,说明单个 token 已足以捕捉底层动力学。当语言指定的目标被转换为预测目标图像后,视频预测质量与使用真实目标图像时几乎相同。

设置结果
LIBERO-LONG 平均成功率——ODEWorld 顺序子目标83.2%(所有变体和基线中最佳)
视觉编码器消融(DINOv2、SigLIP 2、LIV)均表现稳健;DINOv2 在短时域和长时域预测中最佳,差距较小
潜在 token 数量(1 与 4)性能相当——单个 token 已足够
目标条件(预测目标图像与真实目标图像)视频预测性能几乎相同

长时域滚动预测始终保持时间上的连贯性和物理合理性,而基线方法在较长预测范围内则出现了视觉退化和时间不一致。

工作原理

核心思路是:将视频预测视为连续动力学问题,而不是离散序列问题。编码器先将当前观测映射为潜在状态。随后,一个学习到的 ODE 定义速度场,也就是该状态每经过单位物理时间应如何变化。数值积分器将状态推进至指定的未来时间戳,解码器再把每个状态渲染为像素。由于预测依据的是物理时间而不是帧索引,模型可以按任意时间分辨率生成帧,从而让滚动预测更加平滑,并减少漂移。

两项设计选择让模型保持高效。第一,潜在表示只有一个 token;消融实验表明,仅凭像素信息,它就足以捕捉底层动力学。第二,动力学模型刻意保持精简:它使用 DINOv2 作为视觉骨干网络,而不是大型视觉语言模型,从而避免额外的多模态对齐复杂度。

目标条件分为两个层面。图像目标会作为明确的视觉目标直接输入,引导潜在状态演化。语言指令则经过目标图像预测器,由后者根据当前观测和指令生成具有语义意义的目标图像——这实际上是在无需重新训练动力学模型的情况下,搭起文本空间与视觉特征空间之间的桥梁。

在策略学习方面,顺序子目标范式是让滚动预测真正可执行的关键。模型会在整个时间范围内依次生成子目标,为策略提供密集的时间引导,使其始终不会偏离任务目标。

ODEWorld 目标图像预测器:将当前观测和语言指令转换为预测目标图像

这对机器人技术意味着什么

LIBERO-LONG 上的 83.2% 成绩表明,连续时间世界模型有望让长时域操作更加可靠,这与抓取放置、装配和机床上下料等任务直接相关。密集的子目标引导能够减轻下游策略的负担,未来可能意味着训练机器人所需的真实世界示范更少。

文本到目标的桥接也是一项实用优势。操作人员可以用自然语言描述任务,模型则仅通过四层交叉注意力将指令转换为视觉引导,无需庞大的多模态模型。对于正在评估二手工业机器人或新一代人形机器人的采购方而言,这有助于降低部署成本。

单 token 潜在表示还意味着滚动预测可以在较低计算开销下完成。这对于实时控制回路十分重要,因为预测速度与准确性同样关键。

ODEWorld 的现实世界评估设置,包括仿真环境和潜在的机器人部署场景

局限与开放问题

这些结果来自 LIBERO 仿真环境;现有材料尚未展示真实机器人基准测试数据。报告章节也没有完整量化相对于各个基线方法的具体差距,因此相比每种竞争方法究竟提升了多少,目前仍不明确。

长时域滚动预测仍面临性能退化风险,而目标图像预测器目前仅在仿真的语言指令上得到验证。最后,视觉编码器消融实验显示各方法差距很小,这意味着编码器的选择可能不如连续时间动力学设计重要——但这一假设仍需要在更广泛的条件下检验。

常见问题

什么是 ODEWorld? ODEWorld 是一种面向机器人操作的连续时间世界模型。它利用常微分方程让紧凑的潜在状态沿物理时间演化,以预测未来视频帧,而不是一次生成一帧。

为什么连续时间预测有助于改进策略学习? 因为滚动预测在长时域内能够保持时间一致性,提供不会偏离任务目标的密集子目标引导。这使 LIBERO-LONG 的平均成功率达到 83.2%,超过所有基线方法。

如果输入的是语言指令而非目标图像,ODEWorld 如何处理? 一个由四层交叉注意力组成的轻量级目标图像预测器,会将当前观测和文本指令转换为目标图像。使用这些预测目标进行视频预测时,性能与使用真实目标图像几乎相同。

ODEWorld 是否需要大型潜在表示才能取得良好效果? 不需要。消融实验发现,一个潜在 token 的表现与四个 token 相当,说明单个紧凑 token 就能从像素中捕捉场景动力学。

结语

ODEWorld 表明,连续时间建模能够让机器人世界模型在长时域内更加可靠,同时将潜在表示保持在足够精简、便于实际应用的规模。它的文本到目标桥接机制还将同一套方法扩展到了指令驱动任务,为更加自主的工业机器人和服务机器人迈出了重要一步。

连续时间世界模型能否在生产环境的机器人控制中取代基于帧的视频预测?

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策