058、具身大模型与CoT思维链:Chain-of-Thought在机器人任务规划中的应用昨晚调一个机械臂抓取任务,模型在“把螺丝刀递给对面的人”这个指令上卡了整整四十分钟。不是抓取失败,是它压根不知道该先松爪还是先转腕——明明训练时见过类似场景,但一到新环境就露馅。后来我在prompt里加了一行“请先描述你打算怎么完成这个任务,再输出动作序列”,问题当场解决。这就是CoT(Chain-of-Thought)在具身智能里的魔力,但它的坑,比你想的多得多。从一次失败的抓取说起先还原一下那个bug。我的输入是“把桌上的红色杯子放到蓝色托盘里”,模型直接输出了一串关节角度增量,看起来挺像回事。但执行到一半,机械臂在杯子正上方悬停,爪子张张合合三次,最后把杯子碰倒了。日志显示模型输出的动作序列里,第一步是“移动到杯子位置”,第二步是“下降”,第三步却是“松开爪子”——它把“放”这个动作的松爪时机提前了整整两个时间步。这不是网络结构的问题,是任务规划里缺了中间推理层。传统端到端VLA(Vision-Language-Action)模型把“感知-规划-控制”揉成一个黑盒,输入语言指令和图像,直接吐动作。但人类操作员拿到任务时,脑子里会先过一遍“我要先接近杯子,再调整姿态,然后夹紧,最后移动并释放”——这个内部的思考过程,就是CoT。CoT在具身任务里到底起什么作用别把CoT理解成“让模型多说几句话”。在机器人任务规划里,它本质上是把长程任务的时序依赖关系显式化。拿刚才那个例子,模型如果先输出“1. 移动到杯子正上方;2. 下降