前两篇聊了运动控制和嵌入式系统,管的是"怎么走"和"怎么执行"。这篇聊感知——人形机器人要自主行动,得先知道自己在哪里、周围是什么环境。跟无人车的SLAM不同,人形机器人的感知有两个独特挑战:一是视角在晃动(走路时头部上下起伏加前后摇摆,相机画面不稳定);二是需要理解3D场景的语义(不只是"那里有个障碍物",还要知道"那是门把手可以抓"还是"那是杯子可以拿")。众擎视觉感知工程师面试核心考的是视觉SLAM和语义场景理解。面试官的开场问题很有针对性:"人形机器人走路时相机在晃,你怎么做视觉里程计(Visual Odometry)?"视觉SLAM:在晃动的相机上做稳定定位视觉SLAM的基本流程是:从相机图像中提取特征点→在连续帧之间匹配特征点→通过特征点匹配估计相机运动(位姿估计)→建图并做回环检测。但在人形机器人上,相机晃动会导致两个问题:图像模糊(快速运动时曝光时间内相机移动导致运动模糊)和特征匹配困难(相邻帧之间的视角变化太大,特征点外观变化剧烈)。解决图像模糊的方式有两种:硬件层面——用高帧率相机(120Hz或更高)缩短每帧的曝光时间,减少运动模糊;或者加光学防抖镜头。算法层面——用对模糊鲁棒的特征描述子(比如ORB对轻微模糊比SIFT更鲁棒);或者在运动特别剧烈的帧之间插入IMU预积分提供的位姿预测,减少对视觉特征的依赖。面试官追问:"如果某一步走得太猛导致连续几帧都严重模糊、特征匹配全部失败,怎么办?