前面五章,我们走了一条经典路线:感知靠目标检测,决策靠PID或手工规则,行动靠关节控制。每一个模块都是独立设计的,工程师需要为每一个新任务重新编写感知逻辑、规划算法和控制策略。
这条路走得通,但有一个致命的问题:它没法泛化。 一个用红色阈值检测苹果的视觉伺服程序,换个绿色的梨就抓不住了。一个为直线行走调试好的PID参数,换了地面材质就不好使了。传统的机器人系统像一个高度精密的钟表——每一个齿轮都精确咬合,但换一个表壳就得重新设计全套齿轮。
2023年以后,一股新的技术浪潮开始从根本上改变这个局面。它叫具身大模型。这一节,我们要揭开它的面纱,用最通俗的语言讲清楚:它是什么,为什么它让整个机器人学界为之沸腾,以及它如何让机器人第一次真正“听懂”了人话。
你大概率用过ChatGPT。你打一行字,它回一段话。它读过互联网上几乎所有的文本——维基百科、技术博客、小说、论坛帖子。它学会了语言的规律,学会了推理,学会了写代码,甚至学会了讲笑话。
但它有一个你每天都在做、而它永远做不到的事:拿起桌上的水杯。
ChatGPT是一个纯粹的语言模型。它的世界由token构成——词、子词、标点符号。它从未见过真实的光线,从未感受过物体的重量,从未体验过手指触碰杯壁时那微妙的摩擦感。对它来说,“拿起水杯”只是一个符号序列,和“登上火星”没有任何本质区别。
具身大模型要做的,就是给这个纯语言的大脑,接上一具身体。
它的输入不再只是文本,还包括RGB图像、深度图、力传感器的读数、关节编码器的角度值。它的输出也不只是文字,而是动作序列——关节的目标角度、夹爪的开合指令、底盘的线速度和角速度。
用一句话定义:具身大模型是一个能理解多种输入模态,并直接输出机器人动作指令的大规模神经网络。 它把感知、决策、行动三根柱子,塞进了同一个模型里。
2023年7月,Google DeepMind发布了一篇论文,标题是《RT-2: Vision-Language-Action Models》。这个名字起得极其精准——视觉-语言-动作模型,三个关键词,完整概括了具身大模型的能力边界。
RT-2的核心创新可以用一句话说清楚:它把机器人的动作表示成文本token,然后让一个大语言模型来生成这些token。
具体来说,RT-2的基础是一个强大的视觉语言模型(VLM)——它能看图,能读文字,能理解场景。DeepMind的研究员们做了一件事:他们收集了大量机器人操作数据,每一条数据包含“图像+指令+动作序列”。然后,他们把动作序列离散化——把连续的关节角度值分成若干个离散的桶,每个桶赋予一个独一无二的token编号,就像给每个常用字分配一个编码。这样,一条动作轨迹就变成了一个由特殊token组成的“句子”。
接下来就是大语言模型的看家本领。给定一张当前场景的图像,加上一条指令“拿起红色的积木”,模型自动生成一个回答——只不过这个回答不是中文,而是一串动作token。机器人执行这些token对应的关节指令,就完成了整个任务。
RT-2最令人震撼的地方在于泛化能力。传统的机器人模型,训练的是“抓红色积木”,就只能抓红色积木。RT-2在训练时可能从未见过“把可口可乐罐放到爱因斯坦照片旁边”这个任务组合,但因为它的大语言模型底座读过互联网上关于可口可乐、爱因斯坦的所有文本,它知道哪个是可乐罐,哪张是爱因斯坦的脸,以及“放到旁边”意味着什么。互联网级别的知识,第一次被注入了物理世界的行动能力。
这就像一个学生,不是只背了标准答案,而是真正学懂了物理定律。你考他见过的题他会做,考他没见过的题,他也能推出来。
RT-2很强大,但它有一个对初学者不友好的地方:不开源。 你没法下载它的权重,没法在自己的电脑上跑,没法修改它的架构做实验。
好在,开源社区没有等太久。2024年,伯克利的研究团队发布了Octo——一个完全开源的具身基础模型。Octo的全称是Open-source Transformer for Robotics,顾名思义,它是一个基于Transformer架构、面向机器人操作、代码和权重全部公开的模型。
Octo的设计理念是做一个具身智能的“通用底座”。就像GPT是自然语言处理的底座,你可以用少量数据在它上面微调出一个客服机器人、一个翻译助手、一个代码生成器。Octo想做的是:你用几十条示教数据在它上面微调,就能得到一个会叠毛巾、会摆餐具、会收拾桌子的机器人策略。
从技术架构上看,Octo接受三种输入:自然语言指令、当前场景的RGB图像、机器人当前的状态(关节角度)。它输出一个动作向量,包含末端执行器的目标位移和夹爪的开合指令。它的训练数据来自多个机器人平台、多种任务场景的大规模开源数据集(主要是Open X-Embodiment数据集),这让它学到了跨平台、跨任务的通用操作能力。
对初学者来说,Octo最大的价值在于可以跑在消费级硬件上。你不需要8张A100显卡,一张游戏显卡甚至只用CPU,就能加载预训练权重,完成推理和微调。在下一节,我们会亲手调用Octo的API,让仿真环境里的机械臂根据你的自然语言指令执行任务。
具身大模型是当下最火热的AI赛道之一,几乎每个月都有新的模型和论文出现。除了RT-2和Octo,以下几个名字值得你关注:
Google的RT-1和RT-X:RT-1是RT-2的前身,专注机器人操作。RT-X是DeepMind和33个学术实验室的联合项目,汇集了全球最大规模的机器人操作数据集,在这个数据上训练的模型展现出了惊人的跨机器人、跨任务迁移能力。它是具身智能领域“ImageNet时刻”的有力推动者。
斯坦福的ALOHA和Mobile ALOHA:ALOHA不是一个模型,而是一个低成本的双臂操作硬件平台。Mobile ALOHA给它加上了移动底盘。它们的核心贡献在于数据采集——通过示教操作,研究者用很低的成本收集了大量双手协调操作数据,然后用模仿学习训练出能做菜、能擦桌子的策略。
Figure AI的人形机器人:Figure是一家商业公司,但他们公开的技术路线展示了具身大模型在人形机器人上的应用。他们的机器人Figure 01被接入了一个微调的VLM,能够听懂人的指令并执行操作——比如“给我一个苹果”,机器人能识别苹果,规划抓取路径,并递到人的手中。
你不必现在就深入理解这些工作的技术细节。但把这些名字记在心里,当你在B站或YouTube看到相关视频时,你会知道自己正站在一场技术变革的最前沿。
回到本节开头提出的那个问题:为什么具身大模型让整个机器人学界为之沸腾?
因为它改变了机器人编程的范式。
传统的范式是“工程师为每一个任务手写规则”——检测用阈值分割,规划用运动学求解器,控制用PID。换一个任务,全部从头来。具身大模型的范式是“数据驱动 + 通用底座 + 轻量微调”——同一个模型底座,换一组微调数据,就能从抓积木切换到叠毛巾,再切换到开门。工程师的角色从“写规则的人”变成了“教机器人的老师”。
更深远的影响在于,语言成为了人机交互的接口。过去,你让机器人做一个动作,需要写几十行代码。现在,你只需要说一句“把蓝色积木放到碗里”。这不仅降低了使用门槛,更重要的是,它让机器人可以利用人类语言中蕴含的丰富常识——方位关系、物体属性、操作逻辑——这些知识以前是锁定在文本世界里的,现在通过具身大模型,它们首次进入了物理世界。
到现在为止,你可以把机器人的学习方式分成三个梯队,清晰地对号入座:
第一梯队:手工规则。工程师手写感知、规划、控制的每一个环节。精准但脆弱,换场景就失灵。这是本书前五章讲的内容,是一切的基础。
第二梯队:端到端模仿学习。人类示教几次,机器人从数据中学出一个策略。灵活但数据需求大,泛化有限。这是下一节我们要做的微调实践。
第三梯队:具身大模型。用互联网规模的数据预训练,再用机器人数据微调。既有常识推理能力,又有物理操作能力。这是当下最前沿的方向。
你正在从第一梯队走向第二梯队,而第三梯队的轮廓已经在本节中清晰可见。
这一节我们理解了具身大模型的概念、原理和意义。在下一节,我们要实际动手——在仿真环境中调用一个开源的VLA模型,用自然语言指令让机器人完成操作任务。你将亲眼看到,当你说“拿起红色的积木”时,机器人如何理解这条指令,并将其一步步转化为真实的物理动作。
评论专区
评论加载中...登录后即可发表评论