# 面向操作的机器人听觉

> 机器人听觉是计算听觉场景分析的机器人对应物：利用搭载在机器人上的麦克风解释环境声音——包括非语音事件——以用于控制与交互。在操作领域，听觉之所以有价值，是因为它报告的是事件而不是状态：接触、完成、隐藏内容与过程转变，都是听比看更直接。

Source: https://hear.irmv.top/zh/concepts/robot-audition/ · Language: zh-Hans

## 声音能告诉操作器什么视觉不能

操作中的许多状态变化最直接的表达方式是声音。一声咔哒揭示接触；一阵晃动暴露内部内容；一次提示音标记完成；一段喷溅声说明发生了看不见的转变。以传统摩卡壶为例，它既没有电子传感器，也没有离散的视觉完成指示——唯一可靠的“萃取完成”信号就是壶的声音发生了变化。

这使得听觉成为获取那些本来需要触觉、力觉或对物体做仪器化改造才能得到的信息的低成本替代途径。

## 主要分支

被动接触声学。聆听工具与物体接触产生的声音。音色携带材质、抓取质量与物体状态的信息——早期工作曾据此从撞击声估计材质属性、评估抓取是否轻柔。

接触麦克风。安装在夹爪或手指中的压电传感器比环境麦克风信噪比高得多，可作为廉价的触觉替代。已有工作用它做滑动检测、接触定位与材质分类。

主动声学感知。与其等待声音出现，机器人主动制造声音——摇晃容器、敲击表面——并读取响应。这把不可观测的隐藏状态变成可观测的。HEAR 的 Shake Bottle 任务即是一例。

语音与韵律。指令与确认所携带的意图不仅在词里，也在语调里，而转写会丢弃后者。

## 为什么听觉落后于视觉

三个原因。第一是硬件：多数机器人没有麦克风，而推动 VLA 进展的大规模跨本体数据集不含同步音频。第二是接口：把声音喂给策略的常见做法要么是用 ASR 转写（丢弃所有非语音线索），要么是把波形渲染成图像（把时间信号压扁成静态快照）。第三是时序：真正重要的事件短促且不可重复，这与大型策略低频、分块的执行方式相互冲突。

## HEAR 的位置

HEAR 把第三个问题作为主题。它不提出新的声学传感器，而是提出一种接口，能够把稍纵即逝的听觉事件保存到足够慢的策略对它作出反应为止；并提出一个基准，检验由此产生的行为是否真正声音因果，而不是视觉上看似合理。

---

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu and Hesheng Wang, “Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation”, The International Journal of Robotics Research, 2026. arXiv:2603.16086.