# 物理AI 与具身智能

> 物理AI 与具身智能是当下用来指代“通过传感器与执行器在物理世界中感知和行动、而非生成文本或图像的 AI 系统”的术语。对机器人操作而言，这些标签背后真正有内容的是若干具体的工程问题：策略的感官接口应当如何设计、当决策被延迟时它会如何表现，以及训练数据从哪里来。

Source: https://hear.irmv.top/zh/concepts/physical-ai/ · Language: zh-Hans

## 标签与实质

物理AI 是产业界的说法，具身智能是更偏学术的说法。两者指向同一个转变：语言模型预测下一个词元，而物理智能体必须预测自己行动在会“顶回来”的世界里造成的后果。这一差别不是修辞——它改变了模型需要表示的东西。质量、摩擦、惯性与接触，都不在文本的训练分布里。

## 真正困难的地方

数据。互联网文本与视频丰富且是第三人称视角的。机器人需要第一人称数据：“我做了这件事之后，世界会变成什么样？“这类数据采集昂贵，而且最大的跨本体数据集里仍然不含同步的音频、力或触觉。

感官接口。多数工作假定视觉已足够。但并非如此：接触、力与隐藏的内部状态对相机不可见，而能够报告它们的模态各自有独特的时间结构，策略必须被构建成能处理它。

时序。物理智能体在延迟下运行，而它们最有能力的策略运行得很慢。任何必须在两次决策之间被注意到的东西——包括每一个短暂事件——都会掉进这个空档。

评测。到达目标不等于行为正确。一个忽略听觉前提、靠视觉启发式移动的策略，在几何指标上可以看起来成功，而在真正重要的意义上却是错的。

## HEAR 的位置

HEAR 在最窄的意义上是物理AI 系统——它是真实机械臂的闭环控制器；在更具体的意义上，它处理的是感官接口问题。它的主张是：对在延迟、分块控制下行动的智能体而言，保持瞬态证据是一项要求，而不是可选的改进；而听觉是这一缺失最明显的模态。

---

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu and Hesheng Wang, “Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation”, The International Journal of Robotics Research, 2026. arXiv:2603.16086.