# 动作分块

> 动作分块是指一次预测一小段未来动作（一个“动作块”）并以开环方式执行、不等待新的传感器观测。它在现代机器人策略中近乎普遍，因为它掩盖了推理延迟并产生更平滑的运动。它的代价是一个感知空档：在动作块执行期间，机器人无法对任何事情作出反应。

Source: https://hear.irmv.top/zh/concepts/action-chunking/ · Language: zh-Hans

## 为什么存在

大型机器人策略的求值代价高昂。每次底层控制指令之前都重新运行模型、一次只预测一个动作，在控制频率下并不可行。分块把一次前向传播摊销到许多控制步上。它由基于 Transformer 的模仿学习推广开来，如今在扩散策略与流匹配动作头中都是标准做法。

附带的好处是运动质量。由于整个动作块是联合生成的，得到的轨迹内部一致，而不是一串独立决策的拼接，从而减少了抖动。

## 代价

在执行期间，策略在构造上就是盲的。动作块中途到达的观测无法改动已经发出的指令。对于缓慢、视觉持续的任务，这通常无妨。而对于决定性证据是一段短事件的任务——一次接触、一声提示音、一句口头打断、一次碰撞——这意味着证据可能被完全错过。

HEAR 论文把这一现象命名为盲执行间隔。它的重点不是“分块是错的”，而是这个间隔的代价依模态而异：对视觉无害，对音频可能致命。

## 常规补救及其局限

缩短动作块能减小空档，但会降低平滑度并增加算力。提高重查询频率有同样的取舍。更近的方法——异步推理、实时分块、自适应块长、推测式执行——重构的是模型何时运行，帮助很大。但它们都无法消除空档，因为从感知到执行的延迟链条依然存在。

互补的修法在输入侧，也是 HEAR 采取的路线：让观测接口记住。如果到来的音频被累积进因果记忆，而不是每次查询单独采样，那么动作块中途发生的一段线索在下一次决策边界上仍然可用，即使它已经不再在音频中。

---

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu and Hesheng Wang, “Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation”, The International Journal of Robotics Research, 2026. arXiv:2603.16086.