机器人操作研究版图

当前的机器人操作研究围绕几个大方向组织:把感知与语言直接映射为连续动作的视觉-语言-动作(VLA)策略;预测场景如何演变的世界模型;为观测栈加入触觉、力或声音的多感官扩展;以及让大型策略在实时约束下运行的一系列技术。本页是这些方向的版图,以及 HEAR 所处的那一个切片。

一、视觉-语言-动作策略

通用操作任务的主流架构。大型预训练多模态骨干以相机图像、语言指令与本体感觉为条件,直接预测动作。这个领域共同的工程问题是:这些模型代价高昂,无法以控制频率运行——这直接导致下面两节的内容。

二、动作生成与动作分块

为了掩盖推理延迟并保持运动平滑,策略一次预测一小段未来动作(“动作块”)并以开环方式执行。扩散策略与流匹配是生成动作块的两种主流方案,其中流匹配因所需积分步数更少而成为更常见的默认选择。动作分块解决了平滑性问题,同时制造了一个感知问题:在动作块执行期间,新的传感器读数无法改变已发出的指令。

三、世界模型与世界动作模型

基于世界模型的方法学习场景的动态,通常通过在像素空间、隐空间或词元空间预测未来观测来实现。当同一个模型也输出动作时,得到的系统越来越多地被称为世界动作模型(WAM):它瞄准的是未来状态与动作的联合分布,而不是从当前观测到动作的反应式映射。其实际吸引力是泛化;实际困难是预测的未来必须物理自洽,而且误差会在长时程上累积。

四、多感官策略家族

仅靠视觉无法观测接触、力或隐藏的内部状态。一个正在成长的策略家族为此增加模态:面向触觉的视觉-触觉-语言-动作(VTLA)、面向富接触任务的力感知策略,以及 HEAR 所处的音频分支。声音在这些模态中很特殊,因为它在时间上是稀疏的:安静期几乎不携带任务信息,而把信息集中在极短的事件里。

五、实时与异步控制

异步推理、实时分块、自适应动作块长度与推测式执行等工作针对的都是同一个问题:分块策略的决策天生是陈旧的。这些方法改变的是策略何时运行。HEAR 处理的是互补的问题——在它不运行的时候,哪些感官证据被销毁了——并表明对于瞬态声学事件,除非改变接口,否则答案是“全部”。

六、数据、基准与评测

这个领域的进展与大规模跨本体数据集、以及能测对东西的基准同步。标准操作基准评测最终的几何成功,无法区分“聆听过的策略”与“碰巧动作正确的策略”。声音中心操作需要时序敏感的成败规则:HEAR-Bench 会把“在所需声学线索发生前就到达目标”的试验记为失败。

声音中心操作的位置

声音中心操作是一个狭窄但定义清晰的切片:正确性取决于声音在何时发生的任务。它重要是因为听觉是报告“事件”而非“状态”的模态——接触、完成、转变、隐藏内容——而这些事件恰恰是分块、延迟的策略最容易遗漏的东西。