具身智能
语言模型会谈论杯子。多模态模型看得见杯子。世界模型被要求回答杯子被推了之后怎样。具身智能再往前问一句:这些能力能不能泛化成对一台机器的控制,让它在没见过的房间里、用没写死的步骤,把杯子拿起来。
到 2026 年 9 月,这个问题还开着。实验室里有漂亮的演示,也有能换一换物体的策略。换机器人、换家庭、换一句从没出现在数据里的话,还做不到稳定完成。这页把已经试过的接法和还没跨过去的坎分开记。
下面的模型名称是公开尝试,不是已经泛化的控制器。看到新的人形机器人视频时,先写下机器人、桌子、光照和物体有没有换,再决定它证明了什么。
要泛化的是哪一件事
莫拉维克在 1980 年代说过一句后来被反复引用的话:对机器很难的,常常是对人很容易的感知和动作;棋类反而先被做出来。具身智能面对的就是这句。
一个策略吃进观测和指令,吐出动作。动作可以是关节角、末端位姿,也可以被写成一串 token。泛化至少有四层,一层比一层稀缺:
| 层次 | 问的是什么 | 现在的公开材料大致停在哪 |
|---|---|---|
| 同一台机器、换物体 | 杯子换成没见过的马克杯,抓取还在不在 | 有一批实验室结果 |
| 同一台机器、换任务说法 | 「把最大的那个拿起来」这种话,数据里没演示过 | RT-2 一类工作展示过语义上的迁移,范围仍是实验台 |
| 换环境 | 另一个房间、另一种光、桌子高度变了 | 经常掉下去 |
| 换本体 | 这台臂上学会的,另一台臂或一个人形还能不能用 | 有跨本体训练,离任意机器还远 |
只在固定机位、固定物体上把动作复现出来,叫做这个技能在这台机器上被记住了。它还不是泛化控制。
两条更老的路还在用
工业和仓储里大量机器并不靠大模型。定位、建图、路径规划、模型预测控制、抓取规划,在环境被量过、物体被建模过的时候很稳。一进开放的家庭,几何和接触稍微变一点,手工模型就得改。
另一条是从演示里学习。行为克隆直接模仿人的动作。ACT(Zhao 等人,2023)用动作分块和 Transformer,把双臂遥操作的演示学成一段段动作,ALOHA 那类低成本臂靠这个做出了精细操作。扩散策略(Chi 等人,2023)把动作也当成去噪过程,同一种观测可以对应好几种合理抓法。这些方法在一台机器、一批任务上很强。数据离开这台机器,策略通常要重采。
语言模型伸进控制:VLA
2022 年的 RT-1 用机器人自己的轨迹训练一个 Transformer,把视觉和指令映射到动作。2023 年的 RT-2 把这件事接上互联网规模的视觉语言模型:动作被写成文本 token,和视觉问答数据一起微调。论文报告的现象是,没在机器人数据里出现过的说法,例如拿起最大的、或放到某个符号旁边,有时能被做出来。他们把这类模型叫做视觉-语言-动作模型,VLA。
这是「语言模型的知识也许能搬到控制上」的一次认真实验。搬过去的是语义,还不是一只通用的手。
后面的公开模型沿着同一条缝继续长:
- OpenVLA(2024)把这条线做成可下载的约 70 亿参数模型,动作仍偏离散 token,训练数据来自 Open X-Embodiment 那类多家实验室拼起来的机器人轨迹。
- π0(Physical Intelligence,2024)用一个预训练的视觉语言模型当骨干,再用流匹配另训一个动作专家,一次预测一小段连续动作。多种机器人的数据放在同一个模型里,这就是跨本体训练。后续的 π0-FAST、π0.5 还在这条线上改动作的表示和能覆盖的场景。它们是目前最认真的通用控制尝试之一,论文里的任务仍然是被选出来评估的。
- NVIDIA 的 GR00T 从 2025 年的 N1 起,把开放的机器人基础模型和 Isaac 仿真放在同一条产品线里,对象包括人形。版本在往后续,版本号不等于已经能进任意家庭。
- Gemini Robotics 到 2026 年仍主要以早期合作的形式提供。公开说法里,推理和底层动作可以分成两个模型。能被合作方调用,和已经解决泛化,是两件事。
关节控制要的节拍,比一次大模型前向更快。所以这些模型通常一次吐出一小段动作(action chunk),让底层控制器跟着走,而不是每个控制周期都问一次语言模型。
还没跨过去的坎
这些坎是这页的正文。模型名单会过期,坎不太会。
- 数据比网页小几个数量级。 文本可以爬。机器人轨迹要有人遥操作,或在仿真里生成再冒仿真到现实的风险。Open X-Embodiment 把很多实验室的数据拼在一起,数量级仍远小于预训练语言模型用的语料。
- 接触很难。 抓、插、折、倒,力发生在毫米和很短的时间里。视频里看起来顺的动作,夹爪差一厘米就失败。世界模型和视频生成目前还不太提供可靠的接触物理。
- 长程任务会散。 把「收拾桌子」拆成十几步之后,前面一步的小误差会吃掉后面所有步骤。现有 VLA 多数仍被评在短任务上。长程、失败后的恢复,2025 到 2026 年的论文自己也把它列为缺口。
- 本体一换,动作空间就变。 七轴臂、平行夹爪、灵巧手、轮式底盘、人形,输出的维数和语义都不同。跨本体训练是在缓解这件事,不是已经取消这件事。
- 仿真里的成功会在现实里缩水。 MuJoCo、Isaac 能把采集加快。摩擦、形变、延迟和相机噪声不会自动跟着过来。
- 安全没有现成的损失函数。 网页上说错一句话可以重说。机器撞到人、打翻热的液体,不能靠再采样一次当没发生。
强化学习那一章的奖励、策略和搜索在这里仍然有用。真实世界里奖励稀疏,试错又贵,所以主流先靠模仿和大规模离线轨迹,而不是让大模型在家里自己随机探索。
和前面三页怎么接
- 眼睛来自多模态大模型。VLA 的骨干经常就是一个视觉语言模型。
- 「做了这个动作,世界该怎样」来自世界模型。具身把这个要求从口号变成控制环。接触和长程还没被现有世界模型保住。
- 仿真里的图像和三维来自多模态生成。合成数据能多,替代不了真实接触。
- 第 4 章的 Agent 调用的是有返回值的工具。物理世界不返回一份整齐的 JSON。
还想补
- 看一段机器人演示,用四层泛化表填一遍:换了物体、说法、房间,还是换了机器。
- 若手上有一只小臂,只做行为克隆:同一任务采几十条,换一个杯子再测。把成功率写在这里。
- 新的 VLA 发布时,先记动作是离散 token、连续扩散,还是流匹配,以及控制频率靠不靠动作分块。