前面六章,我们几乎把所有的感知注意力都放在了视觉上。RGB相机、深度相机、YOLO目标检测、视觉伺服——我们给机器人装上了越来越锐利的眼睛。
但你不是只有眼睛。
此刻,如果你闭上眼睛,依然可以用手指摸出键盘上F键和J键的小凸起。你端着一杯水走路,不需要盯着杯子看,手部皮肤传来的压力信号会自动告诉你水杯有没有倾斜。你从沙发上站起来,不用低头检查,脚底的触感和关节的本体感觉已经确认了地面的位置和身体的姿态。
人类的感知系统远不止视觉。而具身智能的感知系统,目前也远不止视觉需要被补齐。
这一节,我们要聊聊那些尚在拼图盒里等待被拼上的感官模块——触觉、本体感觉,以及机器人对物理规律的直觉理解。 它们是当前具身智能系统中最为缺失的几块拼图,也是下一代机器人能力突破的关键所在。
试着做一个实验。用拇指和食指捏起一粒葡萄,不要把它捏烂。
这个动作对你来说不值一提,但对机器人来说极度困难。视觉只能告诉你葡萄的位置和大致形状,但无法告诉你一个最关键的信息:指尖用了多大的力。 力太小,葡萄滑落。力太大,葡萄破裂。那个恰好捏起又不捏烂的力边界,只能通过触觉来感知。
人类的指尖是地球上最精密的触觉传感器。每平方厘米皮肤上密布着数百个机械感受器——迈斯纳小体感知轻触和滑动,默克尔细胞感知持续压力和形状边缘,鲁菲尼小体感知皮肤拉伸,帕西尼小体感知高频振动。这四种感受器并行工作,让你在捏起葡萄的瞬间,下意识地调整指腹的接触面积、按压力度和摩擦角度。整个过程发生在几百毫秒之内,完全不经过你的意识。
现代机器人有类似的东西吗?有,但远远不够。
目前最先进的机器人触觉传感器大致分为几类。压阻式触觉传感器用导电橡胶或压敏电阻阵列来检测压力分布,灵敏度尚可,但空间分辨率和耐久度有限。电容式触觉传感器通过测量微型电容极板间距离变化来感知法向力和剪切力,精度高但电路复杂。光学式触觉传感器(如GelSight)是近年来的明星方案——它在一个透明凝胶层下嵌入微型摄像头,当物体按压凝胶时,摄像头捕捉凝胶表面的形变图像,通过光度立体算法反推出精细的三维接触几何和力分布。GelSight的分辨率高到可以读出硬币上的花纹,甚至可以识别布料纹理。
但即使是最好的触觉传感器,在灵敏度和信息密度上仍然无法与人类指尖相提并论。更关键的是,触觉信号的算法处理远远落后于视觉。 视觉领域有成熟的卷积神经网络和Transformer架构,有ImageNet规模的预训练数据集,有标准化的benchmark。触觉领域的数据格式五花八门——有的输出接触力向量,有的输出形变图像,有的输出压力阵列——至今没有一个类似ImageNet的触觉预训练基准。
这意味着什么?意味着在你的有生之年,很有可能亲手为触觉感知做出贡献。每当你看到一个机器人笨拙地把东西捏碎或滑落时,你看到的不是一个失败,而是一个等待被解决的机会。
闭上眼睛,伸出右手的食指,准确地碰到你左手的食指指尖。
这个动作没有用到视觉,但你做得毫不犹豫。你的大脑不需要计算正运动学和逆运动学——你的肌肉、肌腱和关节囊里有大量的本体感觉感受器(肌梭和高尔基腱器),它们实时报告每一块肌肉的拉伸长度和张力,让你在任何时刻都精确地知道自己身体各部分在空间中的位置和运动状态。
机器人的本体感觉来自编码器——我们在3.1节讲过,电机转轴上的编码器测量旋转角度,进而推算出每个关节的当前角度。从这个角度看,机器人的本体感觉似乎比人类更加“精确”——编码器的角分辨率可以做到万分之一度,远超人类关节的感知精度。
但问题出在后面。
人类的皮肤、肌肉和关节共同构成了一个连续介质力学的感知系统。你不仅能感知关节角度,还能感知关节力矩、肌肉疲劳程度、皮肤与衣物之间的摩擦力。当你搬起一个箱子时,你能感觉到“这个箱子比看起来重”——你的本体感觉和压力感知融合在一起,实时更新你对物体质量的估计。机器人的编码器只能告诉你关节角度,至于关节受力,需要依赖电机电流的间接估计,精度和延迟都差了一个数量级。
更棘手的是本体感觉与控制的整合。在人类身上,本体感觉到运动控制的回路是天然的——你不需要“计算”,只需要“感觉”。但在机器人上,编码器数据需要被滤波、被融合、被转换成状态估计,然后输入控制器。这个过程中每一步都引入延迟和误差,累积起来就变成了运动的不平稳和不精确。
还记得我们第六章微调叠毛巾模型的经历吗?模型用几十条示教数据学会了折叠动作。但你有没有想过一个问题:如果毛巾的材质变了呢?
你演示的是纯棉毛巾,微调出的策略是在纯棉毛巾的物理特性上学出来的。现在换成一条丝绸围巾——更轻、更滑、更易皱。机器人按照学到的策略去操作,可能会因为力度过大把围巾甩飞,或者因为摩擦系数不足而无法稳定捏起。
人类处理这种变化毫不费力。你第一次拿起丝绸围巾时,手指碰到面料的瞬间,触觉告诉你它的表面光滑度和重量,你会自动调整抓取力度和速度。你不需要先摔十次丝绸围巾来“训练”,你对于“光滑的轻薄面料该怎么拿”有一个直觉的物理理解。
这就是当前具身智能最深层的短板:它缺乏对物理世界运行规律的深层理解。
大语言模型通过阅读海量文本学到了很多常识——苹果是红的,水往低处流,玻璃容易碎。具身大模型通过观察机器人操作数据学到了一些物理效应——推箱子比推气球需要更大的力,圆的东西会滚动。但这种“理解”本质上是统计相关性,而不是真正的物理直觉。模型看到过很多次“苹果掉落会摔坏”的样本,于是学会了预测这个结果。但它没有真正理解重力、动量、材料强度之间的因果链条。
这就导致了当前具身模型的脆弱性。它们对于训练分布内的场景表现良好,但一旦遇到未曾见过的物理交互——比如一个装着半杯水的不透明杯子被推了一下,水在杯子里晃动带来的惯性变化——模型就会出错。人类可以下意识地处理这个场景,因为我们的物理直觉经过了数十亿次多模态交互的锤炼。机器的“物理直觉”还很浅。
前沿研究正在从多个方向试图为机器人建立物理理解。世界模型试图让机器人学会预测其动作的物理后果——推动了杯子,下一帧画面里杯子会移到哪里,杯里的水面会如何晃动。基于物理的仿真器内训练试图让策略在多样化的物理参数下学习,从而获得对物理变化的鲁棒性。多模态融合试图将视觉、触觉、力觉、本体感觉统一到一个模型架构里,让不同感官通道的信息在表征空间中相互校准。
但坦率地说,这条路还很长。人类花了上亿年的进化才获得了如此精密的物理直觉,而具身智能的研究才进行了几十年。这不是一个悲观论断,而是一个事实陈述:物理直觉是具身智能的终极边界,也是它最迷人的研究方向。
到目前为止,我们可以勾勒出机器人感知系统的完整图景了。它和人类感知系统之间,存在一张清晰的对比表:
| 感知能力 | 人类 | 机器人(2025年水平) |
|---|---|---|
| 视觉 | 极高分辨率,立体,自适应光照 | 高分辨率,多模态,受限于域偏移 |
| 深度感知 | 双眼立体视觉+单眼线索 | 深度相机/激光雷达,精度高但受材质影响 |
| 触觉 | 极高灵敏度,多模态融合 | 传感器方案多样,算法不成熟 |
| 本体感觉 | 精确,与肌肉控制深度融合 | 编码器精确,但力感知和控制耦合不足 |
| 物理直觉 | 数十亿年进化,下意识 | 统计关联,脆弱,泛化差 |
这张表中有大量空白,空白意味着机会。对于刚刚踏入这个领域的你来说,视觉和深度感知已经相对成熟——你有RGB相机、深度相机、YOLO、视觉伺服这些现成工具。但触觉感知、力控融合、物理直觉建模这些方向,才是真正等待被攻克的前沿。
视觉是具身智能最成熟的感官,但它远非全部。触觉传感器正在快速发展,但算法层面仍是一片蓝海。本体感觉在关节层面已经精确,但在力感知和闭环整合上远不如生物系统。对物理规律的直觉理解,是目前最根本的短板——机器人看到的不是因果关系,而是统计关联。
这些“拼图的缺失”不是缺点,而是方向。当你学完这本教材,掌握了前面所有的视觉、控制、仿真技能后,这些尚未被解决的问题就是你下一步可以投入的方向。具身智能最激动人心的突破,很可能就发生在这些尚待填补的空白之上。
在下一节——也是全书的最后一节——我们将把这些展望汇聚成一张行动路线图。通向通用具身智能的路上,每一个阶段该读什么论文、该用什么工具、该加入什么社区,我们一次性说清楚。
评论专区
评论加载中...登录后即可发表评论