GPT 与机械臂
“GPT 机械臂”指的是由大型预训练模型控制的机械臂。这件事发生在两个层面:语言模型可以用文字规划与编排任务,而视觉-语言-动作(VLA)模型——被微调为输出动作的多模态骨干——可以直接驱动机械臂。两者都可行。但两者都不会自动解决“对短暂物理事件作出正确反应”的问题。
层面一:规划
语言模型可以把“煮咖啡”分解为步骤、选择工具、并从某些失败中恢复,因为这类推理基本上是符号化的。它接触不到关节角,也不需要。这一层面已经相当成熟,主要是软件集成问题。
层面二:直接动作
VLA 模型以图像、指令与本体感觉为输入,输出连续动作。它之所以可行,是因为骨干的预训练已经产生了视觉场景与语言对齐的表示,而相对少量的机器人数据就足以接上动作头。当前的能力主要集中在这里,有意思的失效模式也在这里。
大模型自带的问题
一个模型可以规划得很漂亮,但它仍然远远慢于控制频率。标准的变通做法——预测一个动作块并以开环方式执行——意味着机械臂正在执行一秒或更久之内无法修正的指令。机器人需要在这个窗口内注意到的任何东西,它都看不见。
对视觉任务而言这通常可以容忍,因为相机一秒前看到的东西大体仍然成立。对事件而言则不然:一声咔哒、一次提示音、一阵晃动或一句口头打断,都可能在窗口内开始并结束,且不在任何后续观测中留下痕迹。
除了更大的模型还需要什么
规模无法解决这个问题,因为问题不在表示能力,而在接口设计。有帮助的是“累积而非采样”的感官接口:一份跨越执行空档维护的、关于“听到过什么”的因果记忆,使下一次决策能够对已经听不见的事件作出反应。HEAR 框架是这一思路的一种实现,并配有拒绝把“视觉上合理但声学上过早”的动作判为成功的评测协议。