面向操作的机器人听觉

机器人听觉是计算听觉场景分析的机器人对应物:利用搭载在机器人上的麦克风解释环境声音——包括非语音事件——以用于控制与交互。在操作领域,听觉之所以有价值,是因为它报告的是事件而不是状态:接触、完成、隐藏内容与过程转变,都是听比看更直接。

声音能告诉操作器什么视觉不能

操作中的许多状态变化最直接的表达方式是声音。一声咔哒揭示接触;一阵晃动暴露内部内容;一次提示音标记完成;一段喷溅声说明发生了看不见的转变。以传统摩卡壶为例,它既没有电子传感器,也没有离散的视觉完成指示——唯一可靠的“萃取完成”信号就是壶的声音发生了变化。

这使得听觉成为获取那些本来需要触觉、力觉或对物体做仪器化改造才能得到的信息的低成本替代途径。

主要分支

被动接触声学。聆听工具与物体接触产生的声音。音色携带材质、抓取质量与物体状态的信息——早期工作曾据此从撞击声估计材质属性、评估抓取是否轻柔。

接触麦克风。安装在夹爪或手指中的压电传感器比环境麦克风信噪比高得多,可作为廉价的触觉替代。已有工作用它做滑动检测、接触定位与材质分类。

主动声学感知。与其等待声音出现,机器人主动制造声音——摇晃容器、敲击表面——并读取响应。这把不可观测的隐藏状态变成可观测的。HEAR 的 Shake Bottle 任务即是一例。

语音与韵律。指令与确认所携带的意图不仅在词里,也在语调里,而转写会丢弃后者。

为什么听觉落后于视觉

三个原因。第一是硬件:多数机器人没有麦克风,而推动 VLA 进展的大规模跨本体数据集不含同步音频。第二是接口:把声音喂给策略的常见做法要么是用 ASR 转写(丢弃所有非语音线索),要么是把波形渲染成图像(把时间信号压扁成静态快照)。第三是时序:真正重要的事件短促且不可重复,这与大型策略低频、分块的执行方式相互冲突。

HEAR 的位置

HEAR 把第三个问题作为主题。它不提出新的声学传感器,而是提出一种接口,能够把稍纵即逝的听觉事件保存到足够慢的策略对它作出反应为止;并提出一个基准,检验由此产生的行为是否真正声音因果,而不是视觉上看似合理。

相关概念