动作分块
动作分块是指一次预测一小段未来动作(一个“动作块”)并以开环方式执行、不等待新的传感器观测。它在现代机器人策略中近乎普遍,因为它掩盖了推理延迟并产生更平滑的运动。它的代价是一个感知空档:在动作块执行期间,机器人无法对任何事情作出反应。
为什么存在
大型机器人策略的求值代价高昂。每次底层控制指令之前都重新运行模型、一次只预测一个动作,在控制频率下并不可行。分块把一次前向传播摊销到许多控制步上。它由基于 Transformer 的模仿学习推广开来,如今在扩散策略与流匹配动作头中都是标准做法。
附带的好处是运动质量。由于整个动作块是联合生成的,得到的轨迹内部一致,而不是一串独立决策的拼接,从而减少了抖动。
代价
在执行期间,策略在构造上就是盲的。动作块中途到达的观测无法改动已经发出的指令。对于缓慢、视觉持续的任务,这通常无妨。而对于决定性证据是一段短事件的任务——一次接触、一声提示音、一句口头打断、一次碰撞——这意味着证据可能被完全错过。
HEAR 论文把这一现象命名为盲执行间隔。它的重点不是“分块是错的”,而是这个间隔的代价依模态而异:对视觉无害,对音频可能致命。
常规补救及其局限
缩短动作块能减小空档,但会降低平滑度并增加算力。提高重查询频率有同样的取舍。更近的方法——异步推理、实时分块、自适应块长、推测式执行——重构的是模型何时运行,帮助很大。但它们都无法消除空档,因为从感知到执行的延迟链条依然存在。
互补的修法在输入侧,也是 HEAR 采取的路线:让观测接口记住。如果到来的音频被累积进因果记忆,而不是每次查询单独采样,那么动作块中途发生的一段线索在下一次决策边界上仍然可用,即使它已经不再在音频中。