音频世界模型

音频世界模型是预测声学场景将如何演变的模型,而不只是对当前状态进行分类或反应。在 HEAR 中,Advancer 组件被形式化为音频世界模型:它从隐表示预测近未来的离散音频编码,从而为机器人策略注入显式的时间对齐信息。

从反应到预期

纯反应式策略学习的是从当前观测到动作的映射。世界模型学习的是动态:给定现在,接下来会发生什么?对机器人而言这很重要,因为许多任务存在视觉上完全相同、正确行为却不同的状态,唯一的区分依据是过程正在朝哪个方向发展。

煮东西是最清楚的例子。一锅正在加热的水在许多时刻看起来都很像,但正确的动作完全取决于过程推进到了哪一步。只能看到“水、锅、热”的模型无法区分“快开了”和“刚温”;能预测未来几秒声音的模型可以。

为什么是音频

音频是承载这类进展信号格外好的载体。连续过程——沸腾、倾倒、研磨、喷溅——具有特征性的声学签名,并且以结构化的方式演变,而这种演变在视觉上明显之前就已经可以听见。相对于相机帧率,声学信号还具有更高的时间分辨率,因此变化速率是直接可观测的。

HEAR 如何使用它

Advancer 在训练时预测近未来的离散音频编码。这迫使策略的隐表示不仅编码“现在能听到什么”,还编码“它正在如何变化”——这正是让策略在视觉准静态的长时间等待中保持稳定的原因,而这是一个与分块策略中时序运动坍缩相关的失效模式。

关键在于,Advancer 是训练期目标,部署时会被移除。它教会的时间结构保留在隐空间中,因此推理开销不变。消融掉它会使 HEAR-Bench 从 0.81 降到 0.73。

在世界模型版图中的位置

机器人的多数世界模型工作预测的是未来图像或未来隐状态。在音频模态中做预测较为少见,它与视觉世界模型互补而非替代:视觉报告场景看起来如何,音频报告它正在发生什么。

相关概念