# 机器人操作研究版图

> 当前的机器人操作研究围绕几个大方向组织：把感知与语言直接映射为连续动作的视觉-语言-动作（VLA）策略；预测场景如何演变的世界模型；为观测栈加入触觉、力或声音的多感官扩展；以及让大型策略在实时约束下运行的一系列技术。本页是这些方向的版图，以及 HEAR 所处的那一个切片。

Source: https://hear.irmv.top/zh/research-landscape/ · Language: zh-Hans

## 一、视觉-语言-动作策略

通用操作任务的主流架构。大型预训练多模态骨干以相机图像、语言指令与本体感觉为条件，直接预测动作。这个领域共同的工程问题是：这些模型代价高昂，无法以控制频率运行——这直接导致下面两节的内容。

## 二、动作生成与动作分块

为了掩盖推理延迟并保持运动平滑，策略一次预测一小段未来动作（“动作块”）并以开环方式执行。扩散策略与流匹配是生成动作块的两种主流方案，其中流匹配因所需积分步数更少而成为更常见的默认选择。动作分块解决了平滑性问题，同时制造了一个感知问题：在动作块执行期间，新的传感器读数无法改变已发出的指令。

## 三、世界模型与世界动作模型

基于世界模型的方法学习场景的动态，通常通过在像素空间、隐空间或词元空间预测未来观测来实现。当同一个模型也输出动作时，得到的系统越来越多地被称为世界动作模型（WAM）：它瞄准的是未来状态与动作的联合分布，而不是从当前观测到动作的反应式映射。其实际吸引力是泛化；实际困难是预测的未来必须物理自洽，而且误差会在长时程上累积。

## 四、多感官策略家族

仅靠视觉无法观测接触、力或隐藏的内部状态。一个正在成长的策略家族为此增加模态：面向触觉的视觉-触觉-语言-动作（VTLA）、面向富接触任务的力感知策略，以及 HEAR 所处的音频分支。声音在这些模态中很特殊，因为它在时间上是稀疏的：安静期几乎不携带任务信息，而把信息集中在极短的事件里。

## 五、实时与异步控制

异步推理、实时分块、自适应动作块长度与推测式执行等工作针对的都是同一个问题：分块策略的决策天生是陈旧的。这些方法改变的是策略何时运行。HEAR 处理的是互补的问题——在它不运行的时候，哪些感官证据被销毁了——并表明对于瞬态声学事件，除非改变接口，否则答案是“全部”。

## 六、数据、基准与评测

这个领域的进展与大规模跨本体数据集、以及能测对东西的基准同步。标准操作基准评测最终的几何成功，无法区分“聆听过的策略”与“碰巧动作正确的策略”。声音中心操作需要时序敏感的成败规则：HEAR-Bench 会把“在所需声学线索发生前就到达目标”的试验记为失败。

## 声音中心操作的位置

声音中心操作是一个狭窄但定义清晰的切片：正确性取决于声音在何时发生的任务。它重要是因为听觉是报告“事件”而非“状态”的模态——接触、完成、转变、隐藏内容——而这些事件恰恰是分块、延迟的策略最容易遗漏的东西。

---

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu and Hesheng Wang, “Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation”, The International Journal of Robotics Research, 2026. arXiv:2603.16086.