马里兰大学等机构联合研发的触觉残差学习系统 这项由马里兰大学University of Maryland, College Park与佐治亚理工学院Georgia Institute of Technology联合完成的研究于2026年7月4日以预印本形式发布论文编号为arXiv:2607.03723研究方向归属于计算机科学的机器人学领域。感兴趣的读者可以通过该编号在arXiv平台查阅完整论文。**一、机器人为什么老是差那么一点点**现实生活中有一类任务看似简单实则极难完成——比如把充电器插进插孔、拧开瓶盖、或者把一根棍子插进一个刚好比它大一点点的孔里。人类做这些事情时眼睛固然会提供大致的方向感但真正决定成败的往往是手指尖传来的那一点点细微感觉插进去了没有有没有卡住是不是需要稍微转个角度对于机器人来说视觉系统就像是一双很好用的眼睛可以看清楚东西在哪里、大概朝什么方向移动。但是当机器人的夹爪真正触碰到物体的那一刻纯粹的视觉信息就有些力不从心了。接触力是多大接触的几何形状是什么样的需要往哪个方向微调这些关键信息摄像头根本没有办法直接测量到。正因如此那些需要精密接触的任务——也就是研究者们所说的接触丰富型操作——对机器人来说一直是个大难题。马里兰大学和佐治亚理工学院的研究团队决定从人类学习的经验里寻找解法。一个人学打羽毛球可以通过看视频来了解动作要领和战术套路但真正打好球必须通过大量实际练习用手腕去感受每次击球的力度和角度。视觉提供的是大方向触觉和本体感觉提供的是最后一公里的精确调整。基于这个类比这个团队提出了一套名为**OMNITACTUNE**的系统让机器人先靠视觉学会任务的大致流程然后通过用手摸索来精修那最难的接触阶段。**二、视觉大数据与触觉小数据之间的鸿沟**要理解这项研究的意义先得了解当前机器人学习领域的一个根本矛盾。近年来视觉数据变得越来越丰富。研究者们可以用人类操作的视频、远程操控的机器人录像甚至海量的互联网图片来训练机器人的眼睛。这些数据量庞大种类繁多让机器人在看这件事上变得越来越厉害。然而触觉数据就完全是另一回事了——采集触觉数据需要专用的触觉传感器每种传感器产生的数据格式不同一个任务收集到的数据换到另一个任务又得重新来过更别说换一台机器人了。目前触觉数据集的规模与视觉数据集相比差了不止一个数量级。这就造成了一个现实困境视觉策略可以靠大数据训练得很好但在接触阶段频频失败而引入触觉反馈虽然能解决接触问题却又因为数据匮乏而难以泛化。研究团队的核心洞察在于我们不需要把触觉数据也扩展到视觉数据那个量级。触觉和视觉在操作任务中扮演的角色本就不同——视觉负责全局规划触觉负责局部修正。既然如此何不让视觉策略承担宏观引导的角色然后只让一个小巧的触觉修正模块来处理接触阶段的细微调整这就是OMNITACTUNE的核心思路**把触觉学习当成对已有视觉策略的残差修正**而不是从头重新学一套新策略。所谓残差修正可以理解为这样一个场景你已经有一位经验丰富的厨师视觉策略负责整体烹饪流程但在最后收汁的关键时刻需要一位专门负责火候感知的助手触觉残差策略来做最后的精细调整。助手不需要重新学整道菜的做法只需要在关键节点上补充主厨感知不到的信息。**三、两阶段流程先看着练再摸着改**OMNITACTUNE的整个工作流程分为两个主要阶段可以用运动员学习新动作的过程来理解。第一阶段叫做热身启动Warm-start。在这个阶段机器人完全按照已有的视觉策略来行动不做任何改变但同时打开触觉传感器默默记录下每一次交互中触觉传感器感受到的信息。这就像一位新来的助手跟着主厨观摩学习虽然还没有动手操作但已经在积累对这个厨房、这道菜的感知经验。这个阶段的目的不是立刻改善表现而是做三件准备工作填充经验池也就是回放缓冲区让之后的学习有素材可用训练一个能判断当前触觉信息对应什么结果的评价网络称为评论家或Critic以及针对当前任务微调预训练的触觉编码器让它能够更好地理解这个任务特有的接触模式。为什么这三件事缺一不可呢如果直接跳过热身就开始学习评价网络因为没有数据而无从判断好坏触觉编码器因为没有针对当前任务微调而产生表征偏移简单说就是它提取出来的触觉特征跟任务实际需要的特征对不上整个学习过程会极不稳定。研究团队将这个缺乏热身的对照方法称为PLD*实验结果证明它的学习曲线确实更曲折、最终表现也更差。热身阶段还有一个巧妙的数据增强技巧利用一个叫做ControlTac的触觉图像生成工具对每一段真实收集到的接触轨迹额外合成两段虚拟的触觉轨迹模拟不同的接触力和接触位置。这相当于厨师助手观摩了一次真实操作之后在脑海中又演练了两次如果力道更轻一点或如果角度稍微偏一点会是什么感觉从而大大扩充了学习素材。第二阶段叫做在线残差强化学习Online Residual RL。这时机器人开始真正地边做边学。每一步行动的最终动作是视觉策略给出的基础动作加上触觉残差策略给出的修正量就像主厨的手法加上助手在关键时刻的轻轻一推。触觉残差策略通过反复与真实环境交互、根据任务是否成功来不断优化自己的修正能力这正是强化学习的核心思想。为了安全起见修正量被严格限制在一个较小的范围内并且通过一个逐渐放大的调度器来控制一开始修正幅度很小0到5%随着学习进行逐步增大最高到15%。这确保了早期探索不会因为修正过猛而损坏设备或破坏任务。此外研究团队还引入了一个接触门控机制只有当触觉传感器检测到实际接触时通过传感器标记点的位移量来判断触觉特征才会被输入到残差策略中。在没有接触的时候机器人完全跟随视觉策略不做任何触觉修正。这防止了机器人在还没接触物体时就过度依赖触觉信号而做出错误动作。**四、让机器人知道做得好不好多感官奖励设计**强化学习的一个核心问题是机器人怎么知道自己做得好还是不好在真实世界中这个问题比在模拟环境中难得多——不能每步都人工标注但奖励信号又必须足够密集才能让学习高效进行。OMNITACTUNE设计了一套综合视觉和触觉信号的多感官奖励系统。整体奖励由四个部分组成不同阶段侧重不同。在机器人还没抓住物体之前接近奖励引导末端执行器靠近物体的初始三维中心位置距离越近奖励越高。这相当于给机器人一个路标先朝着目标走过去。抓住物体之后主要的引导来自流奖励。这里的流指的是物体关键点的运动轨迹——研究团队用视觉方法在演示视频中追踪物体上的一组关键点生成一条预测的运动轨迹然后用机器人实际操作中物体运动轨迹与这个预测轨迹的吻合程度来给分。具体而言预测轨迹被稀疏化为若干个子目标机器人每到达一个子目标奖励就增加一级并切换到下一个子目标。这让奖励信号变得既稠密又有方向性。触觉信号贡献两类奖励。一是抓握奖励触觉传感器接触面积内的深度值超过阈值说明抓握稳固给予正向奖励。二是安全惩罚如果触觉传感器检测到的标记点位移超过安全阈值说明接触力过大立即终止当前轮次并给予大幅负奖励机器人自动复位。这四部分奖励通过加权归一化组合成一个介于0到1之间的综合分数当任务完成时额外给予1分的成功奖励。这样的设计让机器人在每一步都能获得有意义的反馈而不是在黑暗中等待偶尔成功的瞬间。**五、视觉策略从哪里来多种眼睛的训练方式**OMNITACTUNE设计为策略无关Policy-Agnostic意思是它不限定必须和哪一种视觉策略配合任何已有的视觉策略都可以作为基础。研究团队实际测试了四种不同来源和架构的视觉策略。其中最有特色的是基于流的策略Flow Policy。研究团队从人类操作的视频出发先用DINOv2一种视觉特征提取工具和SAM一种图像分割工具在视频帧中定位目标物体然后用CoTracker3追踪物体上32个关键点在整段视频中的运动轨迹。接下来用一个微调过的生成模型给定当前观察帧预测整个任务接下来的关键点运动轨迹——这就是所谓的对象流。把这条生成的流稀疏化为若干子目标策略就知道下一步应该让物体朝哪个方向运动。这个设计的妙处在于人类和机器人的手臂形态各异但两者都在操作同一个物体物体的运动轨迹是跨越了embodiment gap身体差异鸿沟的通用语言。对象流正是这样一种语言。除了这种从人类视频学习的策略研究团队还测试了通过远程操控机器人收集数据训练的ACT动作分块变换器和Diffusion Policy扩散策略以及基于大规模预训练的视觉-语言-动作模型π0.5。这四种策略代表了当前机器人学习领域最主流的几个技术路线覆盖范围相当广泛。值得一提的是研究团队发现从人类视频学到的基础策略通常比从远程操控数据学到的策略具有更平滑的运动轨迹。他们用两个专业指标SPARC和LDLJ都是衡量轨迹平滑程度的数学工具进行了量化对比发现人类演示的平滑度远高于远程操控演示并且这个差距在策略学习之后会进一步放大。原因很直观人类在操作时手部自然地产生平滑运动而操控机器人时无法直接感受接触力导致在关键接触阶段频繁出现抖动和不稳定的修正动作。这些不平滑的动作被策略学习放大之后会让接触阶段的行为更加混乱从而使触觉残差修正更难进行。**六、四个精细操作任务上的实验从一塌糊涂到近乎完美**研究团队在真实机器人上进行了全面验证使用的平台是搭载GelSight Mini触觉传感器的xArm7机械臂配合一台第三视角的Intel RealSense D435深度摄像头。四个测试任务各有各的挑战性但都属于接触丰富型操作。**插棒入孔**是第一个任务机器人需要抓起一根圆柱形棒子将其插入不同位置的目标孔中。这个任务要求空间泛化能力孔的位置每次不同、稳定抓握以及毫米级的接触对齐。视觉基础策略在这个任务上的成功率只有40%经过40到50分钟的OMNITACTUNE训练后成功率提升至100%。**充电器插入**是难度最高的任务之一机器人要把一个充电器插头插入手机充电口。充电器金属插片宽约7毫米厚约1.5毫米对应的插槽宽仅约2毫米留给误差的空间极其微小。视觉基础策略的成功率只有10%训练40分钟后成功率达到100%。**拧瓶盖**是一个工具使用任务机器人拿着开瓶器去打开瓶子盖子。这个任务要求在动态变化的接触过程中保持精确的工具姿态稍有偏差就会从瓶盖上滑落。视觉基础策略成功率仅5%训练50分钟后达到90%。**开盒子**同样是工具使用任务机器人用杠杆式开瓶器撬开一个小铁盒。这个任务的特殊挑战在于可以着力的边缘厚度只有约1.3毫米必须极精准地对准后才能产生有效的杠杆力。视觉基础策略成功率为5%训练80分钟后成功率达到85%。与此同时研究团队还对比了三种对照方法。PLD*是把现有的PLD强化学习框架引入触觉的版本但跳过了触觉编码器和评论家网络的热身优化PLD仅视觉是只用视觉反馈进行残差学习、不接入触觉的版本ViTAL是从零开始学习视觉-触觉策略、没有热身阶段的版本。四个任务上OMNITACTUNE的最终成功率比这三个对照方法高出40%以上印证了每个设计选择的必要性。**七、与其他视觉-触觉学习方法的正面对比**除了与相同框架的对照方法比较研究团队还将OMNITACTUNE与当前几种主流的视觉-触觉模仿学习方法进行了正面较量测试场景集中在插棒入孔任务上。对比方法包括带触觉融合的ACT把触觉特征拼接到视觉特征后一起输入网络、Reactive Diffusion Policy即RDP一种先进的慢-快双通道视觉-触觉扩散策略以及带触觉令牌的π0.5微调版。这些方法在学习时都额外收集了包含触觉信息的远程操控演示数据演示数量从50条增加到90条总时间成本与OMNITACTUNE的在线训练阶段相当以确保公平对比。结果显示所有基于模仿学习的视觉-触觉方法成功率均低于OMNITACTUNE。带触觉融合的ACT达到60%RDP达到65%带触觉令牌的π0.5达到45%而OMNITACTUNE达到100%。相差20%到30%的差距说明了一个核心结论对于接触丰富型的精密操作通过反复试错在线学习触觉修正比收集更多的人工演示数据更有效率。这与人类学习的直觉一致——要学会穿针引线真的需要自己动手练光靠看别人做示范是不够的。**八、兼容多种触觉感知方式**现实中触觉传感器的种类繁多不同传感器产生的数据形式各异。为了验证OMNITACTUNE不依赖于特定的触觉感知方式研究团队在插棒入孔和充电器插入两个任务上对比了四种不同的触觉表示方法。AnyTouch2是一种通用光学触觉表示学习模型能够处理动态触觉感知Sparsh是一种基于视觉的触觉自监督学习表示T3是一种跨传感器跨任务的可迁移触觉变换器还有一种更简单的低维触觉标记Tactile Markers直接使用触觉传感器中物理标记点的二维位移作为输入配合一个两层的全连接网络来编码。实验结果显示四种触觉表示在经过OMNITACTUNE训练后都实现了显著的性能提升。AnyTouch2和低维标记方法在两个任务上都达到了相当的最终性能约100%和100%对应插棒入孔约100%和100%对应充电器插入说明即使是简单的标记位移也足以提供有效的接触反馈。T3和Sparsh在充电器插入任务上表现略逊约90%和80%研究者推测这是因为这两个模型的预训练数据主要来自静态操作场景对于充电器插入这类涉及动态探索的任务其预训练特征与实际需求存在一定偏差。这个结论对实际应用有重要意义OMNITACTUNE不绑定昂贵的高端触觉传感器廉价的标记位移传感器同样可以驱动有效的触觉残差学习。**九、消融实验逐一验证每个设计选择的必要性**研究团队对系统的几个关键设计进行了消融实验系统地验证每个组件的必要性。奖励设计的消融实验显示去掉接近奖励、流奖励或触觉奖励中的任何一项学习速度都会明显减慢最终成功率也会下降。其中去掉流奖励即仅依靠稀疏的成功信号的影响最大验证了密集的基于物体运动的中间奖励对于高效强化学习的关键作用。残差策略设计的消融实验则比较了基于轨迹级关键点引导与基于逐步关键点引导的差别。逐步关键点引导会对机器人每一步的动作方向过度限制导致即使是ACT这样本身就会产生多样化动作的策略也难以与之协调最终表现反而更差。轨迹级的稀疏子目标引导则既保持了任务方向性又给了残差策略足够的自由度去处理局部接触细节。此外去掉接触门控机制让触觉特征在所有阶段都影响动作也会使表现下降说明只在真正接触时才使用触觉是一个重要的设计原则。热身阶段的消融实验验证了三件事的重要性热身期间对触觉编码器和评论家网络的联合优化、ControlTac触觉数据增强以及评论家损失与重建正则化损失的共同作用。任何一项缺失学习过程都会变得更不稳定最终成功率也更低。动作空间设计的消融实验证明了残差幅度调度器的价值去掉调度器一开始就允许较大的修正幅度会导致学习不稳定而设置过大的残差幅度上限0.5而非0.15虽然比完全无限制好但最终性能仍不如精心调校的0到0.15的逐步增大方案。**十、局限性与未来展望**研究团队对OMNITACTUNE的局限性保持了清醒的认识。系统仍然继承了真实世界强化学习的通病每次任务失败后需要人工重置环境长时间反复接触操作会造成触觉传感器的磨损。特别是GelSight Mini这类基于视觉的触觉传感器其柔性接触面在频繁接触中容易产生损耗。如何实现更自动化的环境重置、降低硬件磨损是未来工作需要解决的实际问题。研究团队提出的改进方向包括引入世界模型World Model来生成物理上更可信的视觉-触觉仿真轨迹用于预训练和在线策略改进从而减少真实环境交互的次数以及将系统扩展到更多机器人平台和更多种类的触觉传感器上。归根结底OMNITACTUNE给出的是一个关于如何用触觉补充视觉的可行路径不需要从头收集海量触觉数据也不需要重新训练视觉策略只需要在已有视觉策略的基础上用40到80分钟的真实机器人交互就能让机器人在那些最后一公里的精密接触任务上从几乎完全失败变成近乎完美。这或许意味着为机器人添加触觉感知能力真的可以比我们想象的更轻便更快捷。---QAQ1OMNITACTUNE和普通的视觉-触觉融合学习有什么区别A普通的视觉-触觉融合学习需要同时收集大量包含触觉信息的示范数据从头训练整个策略数据成本高、泛化难。OMNITACTUNE则不同它把已经训练好的视觉策略完全冻结只训练一个轻量级的触觉修正模块通过真实机器人在线练习来学习局部接触修正。这样既保留了视觉策略的泛化能力又不需要重新收集海量视觉-触觉配对数据40到80分钟内即可完成适配。Q2OMNITACTUNE需要什么样的触觉传感器才能用AOMNITACTUNE对触觉传感器类型没有强制要求。研究团队实际测试了AnyTouch2、Sparsh、T3三种预训练触觉图像编码器以及直接用传感器标记点位移作为低维输入的简单方案四种方式都能正常工作。实验结果显示简单的低维标记位移方案甚至达到了与高端预训练编码器相当的性能说明无需昂贵传感器也能有效使用该系统。Q3OMNITACTUNE训练完成后机器人插棒入孔这类任务的成功率能到多少A在研究团队的实验中视觉基础策略在插棒入孔任务上的初始成功率只有40%经过约50分钟的OMNITACTUNE在线训练后成功率提升至100%。充电器插入任务从10%提升至100%拧瓶盖从5%提升至90%开盒子从5%提升至85%平均成功率达到93.75%比对比方法高出超过40个百分点。