# 技术定位：HEAR 处在什么位置

> HEAR 是一个面向声音中心机器人操作的视-声-语言-动作（VSLA）框架。它通过把流式音频加入观测接口来扩展视觉-语言-动作（VLA）家族，并通过被形式化为音频世界模型的 Advancer 模块与世界模型研究相连。本页说明它与各个相邻研究方向的关系。

Source: https://hear.irmv.top/zh/research-context/ · Language: zh-Hans

## 视觉-语言-动作模型（VLA）

VLA 模型把图像、语言与机器人状态映射为连续动作，是通用操作任务的主流架构。HEAR 属于 VLA 家族：保持相同的观测接口形态，增加一路流式音频，并研究当决策被延迟、动作以开环动作块执行时这一接口会发生什么。论文以 OpenVLA 与 π0.5 为骨干、各配三种音频接口（一维原始波形、波形转图像适配器、ASR 转写）进行对比，使比较隔离出接口本身而非骨干能力。

## 多感官 VLA

近期一个清晰的趋势是扩展 VLA 策略的模态集合。视觉-触觉-语言-动作（VTLA）模型为观测栈加入触觉；力感知与富接触策略加入力。VSLA 是同一思路在听觉上的对应物：声音成为持续流式输入的观测，而不是执行前的指令或事后的检查。VSLA 与 VTLA 是兄弟关系而非竞争关系，机器人可以同时具备两者。

## 世界模型与世界动作模型（WAM）

基于世界模型的策略学习场景如何演变，而不只是如何反应。HEAR 的 Advancer 被形式化为音频世界模型：从隐表示预测近未来的离散音频编码，使隐状态编码的是声学的演进过程而不只是当前响度。这正是策略能在长时间视觉准静态等待中保持稳定的原因。由于 Advancer 是训练期目标、部署时会被移除，HEAR 在不增加推理开销的前提下把预测状态建模与动作生成耦合起来。

## 物理AI 与具身智能

HEAR 面向在物理世界中行动的具身智能体，也就是通常所说的物理AI 或具身智能。它关注的是智能体的感官接口：机器人必须知道接触何时发生、过程何时改变状态、外部事件何时要求它作出反应。许多状态变化最直接的表达方式是声音，因此听觉感知是物理交互中视觉的实用补充。

## 实时、异步与分块控制

近期大量工作在研究动作分块策略的延迟与陈旧性：异步推理、实时分块、自适应动作块长度、推测式执行。HEAR 从另一侧切入同一个执行空档。问题不是“策略何时运行”，而是在它不运行的时候丢失了哪些证据。盲执行间隔是一个感知问题，不只是算力问题——提高查询频率可以缩短空档，但无法消除它，因为感知、预处理、推理、通信与执行延迟始终存在。

## 机器人听觉与接触声学

声音在机器人领域有很长的研究历史，且与 VLA 浪潮相对独立：通过撞击声学估计材质、通过接触声评估抓取稳定性、把接触麦克风当作低成本触觉替代、以及主动声学探测（机器人主动产生声音以探查物体）。HEAR 建立在这些工作之上，但提出了它们没有回答的问题：如何让一段稍纵即逝的声学事件存活到慢速、分块的策略能够对它作出反应为止。

## 常见问题

**HEAR 是 VLA 模型吗？**

HEAR 是 VLA 家族中扩展了观测接口的策略。它保留视觉-语言-动作的映射，增加了流式音频与本体感觉，因此论文把由此得到的设定命名为视-声-语言-动作（VSLA），而不是声称取代 VLA。

**HEAR 是世界模型吗？**

HEAR 包含世界模型组件，但本身不是纯粹的世界模型。Advancer 在训练时预测近未来音频编码，把预测状态建模与动作生成耦合起来；它在部署时被移除，因此实际发布的策略是一个反应式控制器，只是其隐空间编码了声学动态。

**HEAR 与音频语言模型有什么不同？**

音频语言模型离线地理解音频。HEAR 是延迟、分块执行下的闭环控制器，其评测会拒绝那些在所需声音发生之前就完成目标的动作。

---

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu and Hesheng Wang, “Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation”, The International Journal of Robotics Research, 2026. arXiv:2603.16086.