具身智能
引言
具身智能(Embodied AI)指智能体通过身体与物理世界交互来获得能力,而不是仅在数据集上做被动的模式识别。这个概念本身并不新——机器人学从诞生起就在做这件事——真正新的是方法论:过去每个任务都要单独建模、单独编程,而现在的路线是用大规模数据训练一个通用策略,让它像语言模型泛化到新句子那样泛化到新任务与新物体。本页面梳理这条路线的基本主张、现有范式、评价方式,以及它目前尚未解决的问题。
与传统机器人学的关系
具身智能不是要替换 控制、规划 与 感知,而是重新划分了它们之间的边界。
传统流水线把任务拆成明确的模块,每个模块有清晰的输入输出与可验证的正确性:
图像 -> 物体检测 -> 位姿估计 -> 抓取位姿生成 -> 运动规划 -> 轨迹跟踪
这条流水线的优点是每一步都可调试、可验证、可给出保证。缺点是每一步的误差都会传给下一步,而且模块之间的接口把信息压缩掉了——位姿估计只输出一个 6D 位姿,丢掉了「这个杯子是软的」「把手在这一侧」这类对抓取有用的信息。更根本的是,面对训练时没见过的物体(透明的、可变形的、没有 CAD 模型的),流水线的第一环就会失效。
端到端方法直接学习从观测到动作的映射:
它绕开了中间表示的设计,让模型自己决定该提取什么信息。代价是失去了可解释性与形式化保证,且需要大量数据。
当前的主流实践是分层混合:用学习方法处理感知与高层策略,用传统控制方法承担底层实时闭环与安全边界。一个典型的架构是 VLA 模型以 5–10 Hz 输出末端位姿目标,下层的 阻抗控制 以 1 kHz 跟踪并保证接触安全。这样既利用了学习的泛化能力,又保留了控制层可验证的安全属性。
三条技术路线
| 路线 | 数据来源 | 优势 | 主要困难 |
|---|---|---|---|
| 模仿学习 | 人类遥操作演示 | 数据质量高、无需奖励设计、样本效率高 | 采集昂贵、存在复合误差、不会超越演示者 |
| 强化学习 | 与环境交互试错 | 可超越人类水平、无需演示 | 奖励难设计、真机试错代价高、Sim-to-Real 差距 |
| 大规模预训练 | 多机器人多任务数据集 | 泛化能力最强 | 数据集构建成本极高、跨形态迁移仍不成熟 |
三者并非互斥。目前效果最好的做法通常是预训练 + 模仿微调 + 少量强化学习精修:用大规模跨形态数据预训练得到通用先验,用目标机器人的演示数据微调,最后可选地用强化学习提升成功率上限。
值得说明的是,接触丰富的操作任务上,模仿学习目前的实用性明显强于强化学习。原因是奖励函数难以描述「插好了」这类涉及接触状态的目标,而演示可以直接绕过这个问题;同时真机上的强化学习试错会造成硬件磨损,见 强化学习在机器人中的部署。
现有范式
语言模型作为高层规划器
最早落地的一类做法是把大语言模型当作任务分解器:它把「帮我做份三明治」拆成一串子任务,每个子任务再由预先编程或单独训练的技能执行。SayCan 是这一思路的代表,它用语言模型给出「应该做什么」的先验,再用价值函数给出「能不能做到」的估计,两者相乘选择动作。
这类方法的优点是把语言模型的常识能力直接接入了机器人,而且底层技能仍是可验证的传统模块。局限同样明显:语言模型不知道物理世界的当前状态,它规划出的步骤可能在几何上不可行,且技能库本身仍需人工构建,泛化的瓶颈转移到了技能库的覆盖范围上。
视觉-语言-动作模型
VLA 把动作直接纳入视觉-语言模型的输出空间,实现真正的端到端。这是当前投入最多的方向,详见 VLA 模型。
世界模型
另一条路线是学习环境的动力学模型,然后在这个学到的「想象空间」中做规划或强化学习。它的吸引力在于样本效率——在模型中试错不消耗真实时间与硬件。困难在于长程预测的误差累积,以及接触动力学难以准确建模,这与 仿真 面临的 sim-to-real 问题本质相同。
评价与基准
具身智能领域的评价比传统机器学习困难得多,原因是结果依赖于物理执行,不能只看数据集指标。
| 基准 | 类型 | 说明 |
|---|---|---|
| Open X-Embodiment | 数据集 | 汇集多家机构的真机数据,成为跨形态预训练的事实标准 |
| RLBench / CALVIN | 仿真 | 多任务操作,便于快速迭代,但与真机差距明显 |
| LIBERO | 仿真 | 侧重终身学习与知识迁移的评测 |
| BEHAVIOR | 仿真 | 家庭场景的长程任务 |
| 真机评测 | 真机 | 最有说服力,但难以复现 |
真机评测的可复现性是这个领域最实际的困难。不同实验室的机器人型号、相机位置、光照、物体、桌面高度都不同,同一个模型在两个实验室能测出显著不同的成功率。论文中报告的成功率因此很难横向比较,读者应重点关注同一篇论文内部的消融对比,而不是跨论文的绝对数值。
另一个常被忽略的问题是评测次数太少。操作任务的成功率评估往往只做 10–20 次试验,此时 60% 与 75% 的差异在统计上并不显著。合理的做法是报告置信区间,或至少说明试验次数。
尚未解决的问题
数据规模远不及语言与视觉领域。 语言模型有万亿级 token,视觉模型有十亿级图像,而目前最大的机器人数据集只有百万量级的轨迹。真机数据的采集速度受物理时间限制——一条轨迹要实际运行几十秒,且硬件会磨损。这是与其他 AI 领域最本质的差别,也是 数据采集 成为独立研究课题的原因。
跨形态迁移仍不可靠。 在 A 机器人上训练的策略迁移到 B 机器人,即使两者都是六轴机械臂,也往往需要大量微调。动作空间、相机外参、夹爪几何的差异都会破坏迁移。Open X-Embodiment 这类跨形态数据集是在尝试解决这一问题,但目前的效果是「有帮助」而非「解决了」。
长程任务的成功率仍然很低。 单步操作(抓取、放置)的成功率可以做到 90% 以上,但十步任务若每步独立成功率为 90%,整体成功率只有 35%。真实家务任务动辄几十步,这个乘法效应是当前最大的障碍。解决方向包括失败检测与重试、分层策略、以及在过程中引入人类干预。
安全性缺乏形式化保证。 神经网络策略的输出无法给出边界保证。目前的实践是在策略外部套一层传统的安全约束(关节限位、速度限幅、力矩上限、工作空间检查),但这只能限制损害范围,不能保证任务正确性。人机协作场景中的相关标准见 力控与柔顺控制。
评价体系不成熟。 缺少像 ImageNet 或 GLUE 那样被广泛接受、可复现的基准,导致进展难以客观衡量。
本专题内容
| 页面 | 主要内容 |
|---|---|
| VLA 模型 | 动作表示方式、主流架构对比、推理频率与部署、微调实践 |
| 模仿学习与数据采集 | 行为克隆的复合误差、ACT 与扩散策略、遥操作硬件、数据质量 |
相关章节:深度学习 与 基础模型 介绍底层模型技术;强化学习 与 强化学习部署 介绍另一条数据来源路线;机器人操作 介绍这些方法所要解决的任务本身。
参考资料
- Brooks, R. A. (1991). Intelligence Without Representation. Artificial Intelligence, 47(1-3), 139-159. — 具身智能思想的早期奠基。
- Kroemer, O., Niekum, S. & Konidaris, G. (2021). A Review of Robot Learning for Manipulation: Challenges, Representations, and Algorithms. Journal of Machine Learning Research, 22(30), 1-82.
- Ahn, M., et al. (2022). Do As I Can, Not As I Say: Grounding Language in Robotic Affordances. Conference on Robot Learning (CoRL). — SayCan。
- Open X-Embodiment Collaboration (2023). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv:2310.08864.
- Duan, J., et al. (2022). A Survey of Embodied AI: From Simulators to Research Tasks. IEEE Transactions on Emerging Topics in Computational Intelligence, 6(2), 230-244.
- Firoozi, R., et al. (2023). Foundation Models in Robotics: Applications, Challenges, and the Future. arXiv:2312.07843.