# 音频世界模型

> 音频世界模型是预测声学场景将如何演变的模型，而不只是对当前状态进行分类或反应。在 HEAR 中，Advancer 组件被形式化为音频世界模型：它从隐表示预测近未来的离散音频编码，从而为机器人策略注入显式的时间对齐信息。

Source: https://hear.irmv.top/zh/concepts/audio-world-model/ · Language: zh-Hans

## 从反应到预期

纯反应式策略学习的是从当前观测到动作的映射。世界模型学习的是动态：给定现在，接下来会发生什么？对机器人而言这很重要，因为许多任务存在视觉上完全相同、正确行为却不同的状态，唯一的区分依据是过程正在朝哪个方向发展。

煮东西是最清楚的例子。一锅正在加热的水在许多时刻看起来都很像，但正确的动作完全取决于过程推进到了哪一步。只能看到“水、锅、热”的模型无法区分“快开了”和“刚温”；能预测未来几秒声音的模型可以。

## 为什么是音频

音频是承载这类进展信号格外好的载体。连续过程——沸腾、倾倒、研磨、喷溅——具有特征性的声学签名，并且以结构化的方式演变，而这种演变在视觉上明显之前就已经可以听见。相对于相机帧率，声学信号还具有更高的时间分辨率，因此变化速率是直接可观测的。

## HEAR 如何使用它

Advancer 在训练时预测近未来的离散音频编码。这迫使策略的隐表示不仅编码“现在能听到什么”，还编码“它正在如何变化”——这正是让策略在视觉准静态的长时间等待中保持稳定的原因，而这是一个与分块策略中时序运动坍缩相关的失效模式。

关键在于，Advancer 是训练期目标，部署时会被移除。它教会的时间结构保留在隐空间中，因此推理开销不变。消融掉它会使 HEAR-Bench 从 0.81 降到 0.73。

## 在世界模型版图中的位置

机器人的多数世界模型工作预测的是未来图像或未来隐状态。在音频模态中做预测较为少见，它与视觉世界模型互补而非替代：视觉报告场景看起来如何，音频报告它正在发生什么。

---

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu and Hesheng Wang, “Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation”, The International Journal of Robotics Research, 2026. arXiv:2603.16086.