迈向视-声-语言-动作范式:
面向声音中心机器人操作的 HEAR 框架

Chang Nie1, Tianchen Deng1, Guangming Wang2, Zhe Liu1, Hesheng Wang1
1上海交通大学,中国 2剑桥大学,英国
已录用 The International Journal of Robotics Research (IJRR)

从 VLA 到 VSLA

现代视觉-语言-动作(VLA)策略已经证明,大型多模态模型可以把图像、语言与机器人状态直接映射为动作。 当任务相关证据在视觉上持续存在时,这一范式工作得很好:杯子一直在桌上,抽屉开着,相机可以在许多控制周期里反复观察到这些事实。 近期一些系统开始引入音频,但在多数情况下,声音仍被当作动作之前的一次性输入,或者主要用于语音理解。

声音中心操作则完全不同。 这里的关键证据可能是一声提示音、一次碰撞咔哒、煮水声的细微变化,或者一句口头确认的语调。 这些线索往往短暂、不可重复,只有当机器人在执行过程中的正确时刻聆听时才具有意义。 问题不只是"多加一个模态",而是音频在时间上的分布方式与视觉截然不同。 在更广阔的具身智能与物理AI 图景中,听觉是告诉智能体事情在何时发生的模态,而不只是它在哪里

现有的把声音接到 VLA 上的做法往往过于静态。 自动语音识别会丢弃非语音线索与韵律信息;而"波形转图像"适配器则把时间信号压扁成一张静态快照。 当线索很短、发生在两次策略推理之间,或者任务依赖声音如何演变而非某个孤立事件时,这两种做法都变得脆弱。

这也正是现代动作分块(action chunking)成为问题的地方。 大型策略通常一次预测一个动作块,并以开环方式执行以保持运动平滑。 在这一区间内,新的观测无法改变已经发出的指令序列。 对声音中心任务而言,这形成了一个结构性的盲区:一段很短的线索可能在下一次决策看到它之前就已经发生并消失。 我们称之为盲执行间隔(Blind Execution Interval)

这些局限促使我们提出视-声-语言-动作(VSLA)范式。 VSLA 把 VLA 从"看见并行动"扩展为"看见、听见、记住并反应",并且是在延迟、异步的控制条件下。 本文用 HEAR 实例化这一范式,并配套一个预训练数据集与一个声音因果评测基准,使整条流程可以被一致地训练与评估。

HEAR 框架与声音中心操作总览:语音、事件触发提示音、连续过程声音与物理交互反馈

HEAR 把操作任务从"视觉主导"重新定义为"声音因果":策略必须保留稍纵即逝的声学证据、对多感官上下文进行推理,并且只在正确的声音条件真正发生之后才动作。

我们提出了什么

我们的回应分为三部分。 第一,我们把 VSLA 形式化为一种控制设定:每一次决策都接收延迟的多视角视觉、一段因果音频、语言与本体感觉。 第二,我们为这一设定设计了 HEAR 这一具体架构。 第三,我们构建了规模化训练与测试这类系统所需的配套资源。

HEAR 围绕论文识别出的两个瓶颈设计。 第一个是因果保持:瞬态线索必须能够跨执行空档存活下来。 第二个是时间对齐:在视觉准静态的长时间等待中,策略仍然需要对任务进展有感知。

除模型本身之外,论文还贡献了用于大规模音频增强预训练的 OpenX-Sound,以及用于严格声音因果评测的 HEAR-Bench。 这一点很重要:只有当基准明确拒绝"看起来合理但声学上错误"的行为时,像 HEAR 这样的系统才有意义。

VSLA

面向延迟机器人决策的控制范式,以视觉、流式声音、语言与本体感觉为条件。

HEAR

把因果音频记忆与多模态推理、时间预测和平滑动作生成耦合起来的架构。

OpenX-Sound

在 Open X-Embodiment 基础上扩展同步声音的预训练资源。

查看数据集

HEAR-Bench

拒绝过早动作的声音因果基准,检验策略是否真的先聆听再行动。

HEAR 如何工作

HEAR 的整体逻辑与问题本身的推进顺序一致。 如果声音会在两次策略推理之间丢失,系统首先需要一种记忆机制。 如果长时间等待使任务在时间上变得含糊,系统随后需要一种理解"随时间推进"的表示。 如果最终策略以动作块方式执行,它还需要一个足够平滑的动作生成器,以免引入不必要的自噪声。

HEAR 完整架构总览:面向视-声-语言-动作操作的 Historizer、Envisioner、Advancer 与 Realizer

HEAR 持续处理声音,在决策时刻对整合后的多感官上下文进行推理,通过预测未来音频学习时间推进,并生成平滑的动作块用于执行。

Historizer

Historizer 模块:以流式有状态 Transformer 跨越盲执行间隔维护因果音频记忆

Historizer 是一个流式有状态 Transformer,从持续到来的音频数据包中更新一个紧凑的因果记忆。 它直接针对 BEI 问题:保住那些在固定单次查询窗口里本会消失的短暂线索。

它并不强迫主干网络处理极长的原始窗口,而是携带一个与真实执行空档对齐的压缩记忆状态。 正是这一点让下一次决策知道"关键线索刚刚发生过",即使线索本身已经消失。

换句话说,Historizer 是让系统对最近的声音过去保持因果感知的部件。

Envisioner

Envisioner 模块:融合视觉、语言、本体感觉与音频的分层多模态推理器

Envisioner 是一个分层多模态推理器。 高层全方位模型把视觉、语言、本体感觉、当前音频窗口与 Historizer 记忆融合为语义上下文; 低层模型复用这一上下文以得到面向控制的特征。

这种分工很重要,因为声音中心任务常常包含视觉上相似但意图不同的阶段,例如等待、监控、反应,或者中止正在进行的动作。 Envisioner 把这些细微差别转变成可直接用于控制的表示。

它也是 HEAR 把声音证据与任务上下文绑定起来的模块,而不是把音频当作一条孤立的旁路通道。

Advancer

Advancer 模块:预测近未来离散音频编码的音频世界模型

Advancer 从隐表示中预测近未来的音频编码。 它被形式化为一个音频世界模型:不只学习从观测到动作的反应式映射,而是学习声学场景预期会如何演变。 这一辅助目标注入了显式的时间对齐信息,帮助策略在长时间的准静态等待阶段消除歧义。

这一点在过程监控类任务中最为重要:机器人必须检测随时间推进的过程,而不是对单一尖峰作出反应。 Advancer 促使隐空间编码场景在声学上如何演变。

这把音频从一个单纯的检测信号,变成了长时序控制中时间结构的来源。

Realizer

Realizer 使用条件流匹配把推断出的控制状态转换成平滑的关节位置动作块。 这一设计不只是为了让运动更好看。 在声音中心操作中,抖动会引入自噪声,可能掩盖微弱的、与任务相关的声学线索。

通过生成更平滑的动作块,Realizer 同时改善了控制质量与声学可观测性,这在"等待、聆听、快速反应"交替出现的任务中尤为重要。

Realizer 让动作侧与任务的听觉需求保持一致,从而闭合整个回路。

训练数据与评测流程

论文指出,仅有新架构是不够的。 声音中心操作同样缺乏当初推动 VLA 进展的大规模预训练数据与时序敏感的评测基准。 因此,HEAR 同时配备了一项训练资源与一套专门的评测套件。

OpenX-Sound 为 Open X-Embodiment 轨迹增强同步音频,使模型能够先学到广谱的多感官表示。 在该预训练阶段之后,HEAR 在任务特定示教数据上微调,并在声音对成功真正必要的设定下评测。

HEAR-Bench 专为声音因果操作设计。 其任务覆盖四类声学线索:事件触发的提示音、人类语音、连续过程声音,以及物理交互反馈。 在整个套件中,成功与时序强相关:如果机器人在所需声音线索发生之前就到达了目标,该次试验记为失败。

OpenX-Sound 数据集

我们在 Hugging Face 上发布音频增强的预训练数据,为 VSLA 设定下的大规模机器人轨迹学习提供同步声音。

打开数据集

仿真基准

七项仿真任务被精心选取以覆盖互补的声音中心挑战。 Alarm Clock 与 Microwave 测试等待与瞬态触发;Check Yes 与 Interrupt 测试语音时序与韵律; Check Materials 测试撞击声学;Pour Water 与 Boil Water 测试长时序过程监控。

真机部署

物理任务通过房间混响、背景噪声、机械自噪声以及更强的视觉混淆来提升难度。 Moka Coffee 需要过程监控,Answer Phone 是语音与事件的多阶段任务,Shake Bottle 使用主动声学感知, Real Alarm Clock 测试域偏移下的稳健等待。

这些实验是刻意构造而非简单采集的。 每项任务隔离出无记忆音频集成的一种特定失效模式:瞬态线索丢失、韵律信息损失、视觉混淆,或长时序过程监控。 在这一评测协议下,HEAR 在 HEAR-Bench 上取得 81% 的声音因果成功率,在四项真实 Franka 任务上取得 70%, 在短暂的非语音触发与过程监控场景中提升尤为明显。

实验视频

本页保留一组精炼的真实机器人核心演示。 它们覆盖长时序监控、主动声学感知、语音条件化的进程跟踪,以及真实噪声与混响下的瞬态线索反应。 每个示例都回答一个关于"模型学到了什么样的声音因果能力"的具体问题。 视频由本站提供,仅在你主动播放时加载。

外部视角真机部署

Moka Coffee

为什么选这个任务:传统摩卡壶几乎没有清晰的视觉完成信号,进展只能从声音推断。

它测试什么:噪声真实环境中的长时序过程监控——机器人必须在倒出之前检测到进入喷溅阶段的转变。

Answer Phone

为什么选这个任务:机器人在任务的不同语义阶段反复回到几乎相同的视觉状态。

它测试什么:严重视觉混淆下的多阶段进程跟踪,包括铃声检测、语音理解与通话结束识别。

Shake Bottle(空瓶)

为什么选这个任务:隐藏状态无法被动恢复,机器人必须自己先制造出证据。

它测试什么:主动声学感知——感知依赖于生成一段可重复的动作以激发出具有判别力的声音。

Shake Bottle(有物)

为什么选这个任务:这一对照案例展示机器人在另一种隐藏物理状态下相同的主动感知行为。

它测试什么:策略能否利用自身产生的晃动声,在不同试验中稳定地区分有物与空瓶。

Real Alarm Clock

为什么选这个任务:把仿真中的闹钟设定迁移到物理世界,混响与背景交谈会扭曲线索。

它测试什么:在真实声学域偏移下模型是否仍保持声音因果性,并且仍然避免"看起来诱人"的提前按下。

发表信息

本工作已被《The International Journal of Robotics Research》录用。 正式 DOI 尚未分配,公开的 arXiv 预印本可在下方获取。

BibTeX

@article{nie2026visionsoundlanguageactionparadigmhearframework,
  title={Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation},
  author={Chang Nie and Tianchen Deng and Guangming Wang and Zhe Liu and Hesheng Wang},
  journal={The International Journal of Robotics Research},
  year={2026},
  note={Accepted for publication},
  eprint={2603.16086},
  archivePrefix={arXiv},
  primaryClass={cs.RO},
  url={https://arxiv.org/abs/2603.16086},
}