多感官机器人策略
多感官机器人策略为视觉-语言-动作模型扩展视觉之外的模态——通常是触觉、力或声音。动机很直接:相机无法观测接触、力或隐藏的内部状态,因此依赖这些信息的任务需要另一条通道。工程上的教训则不那么显然:每个模态都有自己的时间结构,而适合视觉的接口不会自动适合其它模态。
家族成员
视觉-触觉-语言-动作(VTLA)。为观测栈加入触觉,通常来自指尖传感器或电子皮肤。触觉数据维度高、局部、变化快,这使它对手部接触丰富的操作很有信息量,也使它难以喂给为相机帧设计的模型。
力与力矩。腕部或关节力传感给出维度更低但非常直接的接触度量,通常作为额外的输入向量而非类图像模态加入。
音频——VSLA。加入流式声音。与触觉和力不同,音频携带的是“并非发生在机器人末端”的事件信息:电器完成、电话响起、液体沸腾。
时间结构比模态本身更重要
标准 VLA 假定观测可以低频采样,因为世界变化缓慢。对相机而言这个假定合理,对“信息以短促爆发形式到达”的模态而言则是灾难性的。
触觉与力信号密集,但与机器人自身运动强相关,所以策略大体知道何时应当期待它们。音频不同:任务相关的声学事件稀疏、异步,且常常由机器人之外的某个东西产生。它们可以在任意时刻发生,包括在开环执行的动作块期间,而且不会重复。
由此得到的设计结论
增加一个模态不等于增加一个输入通道。若某模态的证据是瞬态的,接口就需要有记忆:某种累积已到达内容、并把它保存到决策能够使用为止的东西。没有这一点的额外模态,在 API 里存在,在效果上缺席。
HEAR 的位置
HEAR 是这个家族中的听觉成员。它把流式音频接口与因果记忆(Historizer)配对,配上一个把音频与视觉、语言、本体感觉融合起来的推理模块(Envisioner),并配有拒绝“在所需声音发生之前就完成的动作”的评测协议。它的设计目标是与触觉、力感知结合,而不是取代它们。