上一节我们聊了具身智能和离身智能的区别。现在,让我们把镜头拉近,看看一个具身智能系统内部是如何运转的。
无论多么复杂的机器人——从波士顿动力的Atlas后空翻,到你家扫地机器人绕开桌腿——背后的逻辑都可以拆解成三个环环相扣的模块:感知、决策、行动。它们就像三根柱子,共同撑起具身智能的穹顶。
为了让你直观理解,我们不讲公式,不讲架构图。我们来讲一个最简单的场景:服务员倒水。
第一支柱:感知——让机器人“看见”世界 你在一家餐厅坐下,对机器人服务员说:“请给我倒杯水。”
在它动手之前,它必须先回答三个问题:水杯在哪?水壶在哪?杯子现在是空的还是满的?
这就是感知要解决的问题。具身智能的感知系统,就是机器人的感官集合——RGB摄像头捕捉彩色画面,深度相机测量物体距离,触觉传感器感知力度变化,麦克风阵列收录音频指令。这些原始信号被送入视觉识别模型和语音识别模型,最终汇聚成一句话:“桌子坐标(1.2, 0.8, 0.75)处有一个空玻璃杯,杯口直径7厘米。水壶在坐标(0.3, 0.5, 1.0)处,壶嘴朝向东南。”
感知的本质,是把物理世界的混沌信号,翻译成智能体能理解的结构化信息。没有这一步,后面的所有环节都是空中楼阁。
第二支柱:决策——在无数可能性中选出最优解 感知系统已经给出了完整的情报。现在,机器人面临一个选择:怎么倒?
它可以先走过去再伸手,也可以先伸手机械臂再移动底盘。它可以一把抓起水壶直接倾倒,也可以先调整握姿找到更稳的抓取点。它可以倒得很快溅客人一身,也可以匀速倾倒也许多花三秒钟。甚至,如果它发现杯子里还有半杯凉掉的茶,它还要判断:是先倒掉再续水,还是直接加热水?
这就是决策要承担的责任。在传统的机器人控制里,决策由状态机或运动规划算法完成;而在前沿的具身智能系统里,决策往往由一个训练好的策略网络来承担——它接收感知系统传来的状态信息(物体位置、自身姿态、力的反馈),在一瞬间输出下一步该做什么动作。
决策的难点不在于“能不能算出一个解”,而在于“能不能在几百毫秒内从几十个可行解里挑出最安全、最高效、最优雅的那一个”。毕竟,没有客人想等服务员在桌子前愣十秒钟。
第三支柱:行动——把意图刻进物理世界 决策定了:机械臂以特定角度、特定速度靠近水杯,在距离杯口15厘米处开始倾倒也壶,持续2.3秒。
但算法只是一串数字。数字不会倒水。
行动是具身智能最独特的环节,也是它和离身智能彻底分道扬镳的地方。决策层输出的指令,必须被翻译成一个个电机的旋转角度、一个个关节的力矩值。伺服控制器接收到目标位置,驱动电机转动,电机带动齿轮,齿轮带动连杆,连杆推动夹爪——最终,水壶真的倾斜了,水真的流出来了,杯子真的被注满了。
而这一切发生的瞬间,行动系统还在实时回传力传感器和关节编码器的数据。如果指尖触觉突然检测到一个异常的力峰值——也许是手肘不小心碰到了桌上的餐叉——它会立刻反馈给决策层,决策层在几毫秒内重新规划路径,让手臂绕开障碍物。
感知、决策、行动,就这样在一秒之内完成了一次闭环。
回到整体:一套永不停止的循环 现在,让我们在时间轴上拉远视角。水杯灌满后,感知系统重新扫描场景——确认水位线达标,确认杯子没有溢出,确认客人微微点头。于是新一轮决策启动:收回手臂,退回待命位置,等待下一条指令。
发现了吗?感知、决策、行动从来不是三个独立的步骤,而是一个紧密咬合的循环。感知提供情报,决策制定计划,行动落实结果,而行动的结果又立刻被感知系统捕获,成为新一轮决策的输入。
这个循环每秒可能运行几十次、上百次。正是这种在物理世界中“感知-决策-行动”的高频闭环,让机器人不再是一台只会重复固定轨迹的机器,而是一个能够对变化做出实时响应的智能体。
给你的框架 在后续章节里,我们学习每一个具体的算法和技术时,你都可以把它放进这三根柱子的框架里来理解。摄像头标定?那是在加固“感知”的柱子。强化学习策略网络?那是“决策”柱子的升级。电机PID控制?那是“行动”的基石。
你脑子里一旦有了这三根柱子,整个具身智能的知识大厦就有了骨架。剩下的,只是一块块把砖砌上去。
下一节,我们走进实验室,看看真实的机器人们长什么样。