物理AI 与具身智能
物理AI 与具身智能是当下用来指代“通过传感器与执行器在物理世界中感知和行动、而非生成文本或图像的 AI 系统”的术语。对机器人操作而言,这些标签背后真正有内容的是若干具体的工程问题:策略的感官接口应当如何设计、当决策被延迟时它会如何表现,以及训练数据从哪里来。
标签与实质
物理AI 是产业界的说法,具身智能是更偏学术的说法。两者指向同一个转变:语言模型预测下一个词元,而物理智能体必须预测自己行动在会“顶回来”的世界里造成的后果。这一差别不是修辞——它改变了模型需要表示的东西。质量、摩擦、惯性与接触,都不在文本的训练分布里。
真正困难的地方
数据。互联网文本与视频丰富且是第三人称视角的。机器人需要第一人称数据:“我做了这件事之后,世界会变成什么样?“这类数据采集昂贵,而且最大的跨本体数据集里仍然不含同步的音频、力或触觉。
感官接口。多数工作假定视觉已足够。但并非如此:接触、力与隐藏的内部状态对相机不可见,而能够报告它们的模态各自有独特的时间结构,策略必须被构建成能处理它。
时序。物理智能体在延迟下运行,而它们最有能力的策略运行得很慢。任何必须在两次决策之间被注意到的东西——包括每一个短暂事件——都会掉进这个空档。
评测。到达目标不等于行为正确。一个忽略听觉前提、靠视觉启发式移动的策略,在几何指标上可以看起来成功,而在真正重要的意义上却是错的。
HEAR 的位置
HEAR 在最窄的意义上是物理AI 系统——它是真实机械臂的闭环控制器;在更具体的意义上,它处理的是感官接口问题。它的主张是:对在延迟、分块控制下行动的智能体而言,保持瞬态证据是一项要求,而不是可选的改进;而听觉是这一缺失最明显的模态。