机器人基础模型

机器人基础模型是在来自许多机器人与任务的数据上预训练、再针对特定任务微调(或以提示方式使用)的大型模型。这一模式借用自语言与视觉领域,其奏效原因相同:广泛的预训练产生可迁移的表示,因此下游学习所需的数据少得多。

预训练配方

一个大型多模态骨干(通常是视觉-语言模型)被适配为输出动作。训练分阶段进行:先做广泛的多模态预训练,再在跨本体语料上做机器人特有的预训练,最后做任务特定微调。第一阶段提供通用感知与语言grounding;第二阶段提供感知与物理动作之间的耦合,而这是任何规模的互联网数据都无法提供的。

跨本体语料——Open X-Embodiment 及其后续——是第二阶段得以可能的原因。它们把来自许多机器人平台与任务的轨迹聚合到统一格式下。

语料里没有什么

视觉、语言、本体感觉与动作。没有力。没有触觉。没有音频。与其说是疏忽,不如说是硬件问题:要在跨本体语料的规模上采集同步的麦克风、触觉或力数据,需要每一个贡献实验室在硬件上完成标准化。

后果是基础模型继承了以视觉为中心的世界观,而每增加一个模态都必须先解决自己的数据问题才能被训练。HEAR 的 OpenX-Sound 就是音频方面的一种解法:它不去标准化硬件,而是为已有片段增强时间对齐的合成音频,并明确说明这是自举阶段而非真实录音的替代品。

实时约束

基础模型很大,机器人控制很快,二者之间的鸿沟靠动作分块来弥合。这使得盲执行间隔成为整个模型类别的性质,而不是某个模型的问题:任何大到需要分块的策略,也都有一个无法反应的间隔。

HEAR 的位置

HEAR 是一个基础模型式的策略,其预训练阶段增加了音频模态。它对这一类别别的贡献是表明:决定瞬态感官事件能否存活到产生影响的,是接口而不只是骨干。

相关概念