# 多感官机器人策略

> 多感官机器人策略为视觉-语言-动作模型扩展视觉之外的模态——通常是触觉、力或声音。动机很直接：相机无法观测接触、力或隐藏的内部状态，因此依赖这些信息的任务需要另一条通道。工程上的教训则不那么显然：每个模态都有自己的时间结构，而适合视觉的接口不会自动适合其它模态。

Source: https://hear.irmv.top/zh/concepts/multisensory-robotics/ · Language: zh-Hans

## 家族成员

视觉-触觉-语言-动作（VTLA）。为观测栈加入触觉，通常来自指尖传感器或电子皮肤。触觉数据维度高、局部、变化快，这使它对手部接触丰富的操作很有信息量，也使它难以喂给为相机帧设计的模型。

力与力矩。腕部或关节力传感给出维度更低但非常直接的接触度量，通常作为额外的输入向量而非类图像模态加入。

音频——VSLA。加入流式声音。与触觉和力不同，音频携带的是“并非发生在机器人末端”的事件信息：电器完成、电话响起、液体沸腾。

## 时间结构比模态本身更重要

标准 VLA 假定观测可以低频采样，因为世界变化缓慢。对相机而言这个假定合理，对“信息以短促爆发形式到达”的模态而言则是灾难性的。

触觉与力信号密集，但与机器人自身运动强相关，所以策略大体知道何时应当期待它们。音频不同：任务相关的声学事件稀疏、异步，且常常由机器人之外的某个东西产生。它们可以在任意时刻发生，包括在开环执行的动作块期间，而且不会重复。

## 由此得到的设计结论

增加一个模态不等于增加一个输入通道。若某模态的证据是瞬态的，接口就需要有记忆：某种累积已到达内容、并把它保存到决策能够使用为止的东西。没有这一点的额外模态，在 API 里存在，在效果上缺席。

## HEAR 的位置

HEAR 是这个家族中的听觉成员。它把流式音频接口与因果记忆（Historizer）配对，配上一个把音频与视觉、语言、本体感觉融合起来的推理模块（Envisioner），并配有拒绝“在所需声音发生之前就完成的动作”的评测协议。它的设计目标是与触觉、力感知结合，而不是取代它们。

---

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu and Hesheng Wang, “Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation”, The International Journal of Robotics Research, 2026. arXiv:2603.16086.