技术定位:HEAR 处在什么位置

HEAR 是一个面向声音中心机器人操作的视-声-语言-动作(VSLA)框架。它通过把流式音频加入观测接口来扩展视觉-语言-动作(VLA)家族,并通过被形式化为音频世界模型的 Advancer 模块与世界模型研究相连。本页说明它与各个相邻研究方向的关系。

视觉-语言-动作模型(VLA)

VLA 模型把图像、语言与机器人状态映射为连续动作,是通用操作任务的主流架构。HEAR 属于 VLA 家族:保持相同的观测接口形态,增加一路流式音频,并研究当决策被延迟、动作以开环动作块执行时这一接口会发生什么。论文以 OpenVLA 与 π0.5 为骨干、各配三种音频接口(一维原始波形、波形转图像适配器、ASR 转写)进行对比,使比较隔离出接口本身而非骨干能力。

多感官 VLA

近期一个清晰的趋势是扩展 VLA 策略的模态集合。视觉-触觉-语言-动作(VTLA)模型为观测栈加入触觉;力感知与富接触策略加入力。VSLA 是同一思路在听觉上的对应物:声音成为持续流式输入的观测,而不是执行前的指令或事后的检查。VSLA 与 VTLA 是兄弟关系而非竞争关系,机器人可以同时具备两者。

世界模型与世界动作模型(WAM)

基于世界模型的策略学习场景如何演变,而不只是如何反应。HEAR 的 Advancer 被形式化为音频世界模型:从隐表示预测近未来的离散音频编码,使隐状态编码的是声学的演进过程而不只是当前响度。这正是策略能在长时间视觉准静态等待中保持稳定的原因。由于 Advancer 是训练期目标、部署时会被移除,HEAR 在不增加推理开销的前提下把预测状态建模与动作生成耦合起来。

物理AI 与具身智能

HEAR 面向在物理世界中行动的具身智能体,也就是通常所说的物理AI 或具身智能。它关注的是智能体的感官接口:机器人必须知道接触何时发生、过程何时改变状态、外部事件何时要求它作出反应。许多状态变化最直接的表达方式是声音,因此听觉感知是物理交互中视觉的实用补充。

实时、异步与分块控制

近期大量工作在研究动作分块策略的延迟与陈旧性:异步推理、实时分块、自适应动作块长度、推测式执行。HEAR 从另一侧切入同一个执行空档。问题不是“策略何时运行”,而是在它不运行的时候丢失了哪些证据。盲执行间隔是一个感知问题,不只是算力问题——提高查询频率可以缩短空档,但无法消除它,因为感知、预处理、推理、通信与执行延迟始终存在。

机器人听觉与接触声学

声音在机器人领域有很长的研究历史,且与 VLA 浪潮相对独立:通过撞击声学估计材质、通过接触声评估抓取稳定性、把接触麦克风当作低成本触觉替代、以及主动声学探测(机器人主动产生声音以探查物体)。HEAR 建立在这些工作之上,但提出了它们没有回答的问题:如何让一段稍纵即逝的声学事件存活到慢速、分块的策略能够对它作出反应为止。

常见问题

HEAR 是 VLA 模型吗?

HEAR 是 VLA 家族中扩展了观测接口的策略。它保留视觉-语言-动作的映射,增加了流式音频与本体感觉,因此论文把由此得到的设定命名为视-声-语言-动作(VSLA),而不是声称取代 VLA。

HEAR 是世界模型吗?

HEAR 包含世界模型组件,但本身不是纯粹的世界模型。Advancer 在训练时预测近未来音频编码,把预测状态建模与动作生成耦合起来;它在部署时被移除,因此实际发布的策略是一个反应式控制器,只是其隐空间编码了声学动态。

HEAR 与音频语言模型有什么不同?

音频语言模型离线地理解音频。HEAR 是延迟、分块执行下的闭环控制器,其评测会拒绝那些在所需声音发生之前就完成目标的动作。