回归代价:拆解大模型智能体中技能的增益与损害机制 回归代价拆解大模型智能体中技能的增益与损害机制论文原链接https://arxiv.org/html/2607.22520v1摘要现有大模型智能体技能的评估仅依靠任务平均通过率提升这一单一指标该指标存在严重信息缺失新增技能不仅能解决更多任务同时也会让原本能完成的任务失效。本文在2套办公自动化基准、3套模型-运行环境组合下完成近6000组对照实验有无技能库成对对比定义两类核心样本增益样本无技能时失败加入技能后成功回归样本无技能时成功加入技能后失败实验统计显示回归样本会抵消59%的总增益。进一步拆解出三类导致回归的底层机制技能描述渗透效应技能仅停留在上下文提示词、全程未被调用仍改变智能体行为输入定位偏移技能规定的操作流程覆盖了智能原本正确读取输入的逻辑校验抑制偏移技能流程压制模型原生输出校验步骤。对持续未解决的残差失败样本分析发现现有技能过度侧重中间推理流程对输入定位、输出校验两大关键环节支撑严重不足通过优化输入读取与输出校验逻辑大量回归与残差失败问题可被修复。本文提出核心评估改进方案技能效果不能仅看平均通过率提升必须拆分为增益、回归双向指标智能体可靠性更多取决于输入读取、输出校验能力而非推理流程本身。1 引言智能体技能是可复用的流程化指导单元包含描述文本、自然语言操作步骤部分配套可执行代码会加载进模型上下文控制任务执行逻辑。Trace2Skill、EvoSkill、SkillOpt等工具均基于执行轨迹自动生成优化技能行业通用评估方式仅统计任务平均成功率提升。仅依靠平均提升指标存在重大缺陷两套技能库总提升幅度相同时其破坏的原有正确任务数量可能天差地别。现有相关工作ASSAY、GRASP等可识别有害技能并过滤但仅能处理被检索调用的技能无法检测仅存在于上下文、从未执行但干扰模型的渗透效应同时现有方案只筛选技能不分析技能导致任务失效的底层机理。本文采用成对对照实验同一套智能体、相同任务分别运行「无技能」「加载不同技能库」两组共计5832次实验覆盖两套办公基准、三套模型运行栈。核心创新将通过率变化拆解为增益、回归两类成对指标通过执行轨迹定位三类回归产生机制证明绝大多数失效集中在输入读取、输出校验阶段而非中间推理步骤。核心贡献提出双向分解评估范式将通过率变化拆分为增益、回归样本实验证明回归抵消59%的总增益定义并完整验证三类回归产生机制覆盖技能未调用时的渗透干扰效应定位智能体失效核心区间输入定位、输出校验环节修正基准打分工具重新人工复核226组打分错误任务。图1 智能任务三段式执行流水线输入定位(grounding)→推理流程(method)→输出校验(verification)。现有技能过度优化中间推理环节输入、校验环节支撑不足绝大多数回归与残差失败产生于两端。2 相关工作2.1 轨迹自动生成技能框架Trace2Skill、EvoSkill、SkillOpt、SkillOS等系统基于失败轨迹自动提炼流程技能全部以平均任务提升作为唯一评价标准忽略技能带来的任务退化损失。Anthropic、OpenAI官方技能生成工具进一步支持「用技能生成新技能」同样仅关注正向收益无退化分析。Huang2026针对数据科学任务实验发现技能带来增益与退化数量接近但仅作为现象观测未基于执行轨迹拆解底层机理。2.2 上下文干扰相关研究长上下文领域证明无关文本会稀释模型注意力、干扰推理技能描述常驻系统提示词即便从未调用也持续存在天然具备干扰条件但现有技能评估体系完全忽略该现象。2.3 有害技能筛选方案ASSAY、GRASP、RSEA、SkillGraph等方法通过掩码、预留集约束筛选负面技能但全部依赖技能被检索调用的前提无法检测仅存在于上下文、未执行却产生干扰的渗透效应本文不只是筛选坏技能而是完整拆解退化成因。3 实验设置固定控制变量同一智能、同一任务仅更换上下文内技能库成对对比有无技能的执行结果。3.1 两套办公自动化评测基准OfficeQA-Pro 金融文档问答基准素材为美国财政部真实长PDF报表任务包含多表格数值提取、跨年度对比、百分比/均值多步计算核心难点是精准定位表格、指标、时间维度输入定位环节。标准答案允许1%数值误差。SpreadsheetBench 表格操作基准基于真实Excel论坛任务分为单元格局部操作、整张表格批量操作两类要求修改单元格、筛选、公式编写、多表联动。基准打分缺陷说明表格基准原生打分工具仅对比单元格最终数值无法解析AGGREGATE等高级函数正确新式公式会被判定失败后文5.3小节使用完整表格引擎重打分同时提供原始/修正两套结果。3.2 三套模型-运行环境组合栈实验全程使用三套耦合栈模型与运行环境绑定用于验证结论普适性运行框架基座大模型OpenCodeMiniMax-M2.7CodexGPT-5.4-miniClaude CodeClaude Sonnet 4.63.3 三类技能生成流水线统一基线无技能执行轨迹提取失败信号分别采用三套生成器产出独立技能库Anthropic生成器迭代评测优化仅保留正向提升的技能OpenAI生成器单次结构化生成无迭代效果校验本文自研生成器生成前检索重复技能避免冗余内置自批判改写逻辑无需外部API。同一失败信号集三套工具产出技能数量差异巨大OpenCode栈OpenAI产出23个自研仅7个所有技能分为常驻描述全程在提示词、执行体调用时加载两部分用于区分渗透/调用两类干扰。3.4 实验对照条件每套栈、每个基准分4组实验无技能、Anthropic库、OpenAI库、自研库仅技能库为变量模型、任务、失败信号完全固定。两类对比方式有无技能成对对比计算净增益增益数-回归数不同技能库横向对比用于定位退化对应技能文本特征。3.5 四类任务结果定义对同一任务「无技能」vs「加载技能」成对结果分为四类增益Gain无技能失败加载后成功回归Regression无技能成功加载后失败残差失败Residual failure有无技能均失败保留成功Retained有无技能均成功。净效果 增益任务数量 - 回归任务数量3.6 实验规模与统计方法单栈单基准486个任务3栈×4条件5832次完整运行统计检验采用麦克内马尔精确二项检验仅增益/回归不一致样本参与计算报告95%置信区间多重比较采用Bonferroni校正α0.0028。表2 全实验成对统计结果分两套基准、三套栈展示各组通过率、增益/回归数量、净提升、置信区间与p值加粗为p0.05显著结果OfficeQA-Pro任务总数94运行栈技能库无技能通过率带技能通过率增益回归净效果百分点差值(95%CI)p值OpenCode-MiniMaxAnthropic51.1%52.1%141311.1 (-9.8,11.9)1.000OpenCode-MiniMaxOpenAI51.1%55.3%161244.3 (-6.7,15.3)0.572OpenCode-MiniMax自研51.1%60.6%15699.6 (0.2,18.9)0.078Codex-GPT5.4Anthropic54.3%56.4%171522.1 (-9.7,13.9)0.860Codex-GPT5.4OpenAI54.3%56.4%11922.1 (-7.2,11.4)0.824Codex-GPT5.4自研54.3%57.4%161333.2 (-8.0,14.4)0.711Claude-SonnetAnthropic72.3%80.9%10288.5 (1.5,15.5)0.039Claude-SonnetOpenAI72.3%77.7%12755.3 (-3.7,14.3)0.359Claude-Sonnet自研72.3%79.8%11477.4 (-0.5,15.4)0.118SpreadsheetBench任务总数392运行栈技能库无技能通过率带技能通过率增益回归净效果百分点差值(95%CI)p值OpenCode-MiniMaxAnthropic63.3%70.2%6235276.9 (2.0,11.8)0.008OpenCode-MiniMaxOpenAI63.3%64.3%454141.0 (-3.6,5.7)0.747OpenCode-MiniMax自研63.3%65.6%483992.3 (-2.4,7.0)0.391Codex-GPT5.4Anthropic65.8%67.6%302371.8 (-1.9,5.4)0.410Codex-GPT5.4OpenAI65.8%66.6%302730.8 (-3.0,4.5)0.791Codex-GPT5.4自研65.8%67.1%282351.3 (-2.3,4.8)0.576Claude-SonnetAnthropic70.2%81.1%59164311.0 (6.8,15.2)0.001Claude-SonnetOpenAI70.2%81.1%63204311.0 (6.5,15.4)0.001Claude-Sonnet自研70.2%82.1%66194712.0 (7.5,16.4)0.0014 回归代价技能带来的性能抵消4.1 回归样本整体规模全部18组实验条件均存在回归样本无零退化情况汇总全部任务总增益553例总回归324例回归抵消59%的正向收益。分基准统计OfficeQA增益122回归81抵消66%SpreadsheetBench增益431回归243抵消56%。即便整体通过率提升明显退化样本数量依然接近增益仅统计平均提升会完全掩盖该代价本文将其命名为回归代价Regression Tax。4.2 双向分解改变评估结论仅举一例OfficeQA-Claude栈三套库增益分别为10、12、11但回归数2、7、4仅看净收益Anthropic库效果最优仅统计总提升会得出完全相反排名。两套基准均存在大量此类反向案例证明单向指标具备极强误导性。4.3 统计显著性校正原始18组检验仅5组未校正p0.05Bonferroni多重校正后仅Claude栈表格基准三组结果显著p0.001其余全部失去统计意义。说明绝大多数表面提升是随机波动回归代价是核心干扰因素。5 三类回归底层作用机制基于成对执行轨迹人工标注回归成因OfficeQA任务逻辑清晰完整细分4类机制表格基准因打分工具缺陷仅做粗分类。回归判定标准技能描述渗透Osmosis技能全程未调用仅提示词描述干扰模型同一任务多套库出现相同偏移输入定位偏移Grounding displacement技能被调用流程强制覆盖原本正确的文档/表格读取逻辑校验抑制偏移Verification displacement技能流程取消模型原生输出检查步骤计算正确但结论出错其他轨迹无明确干扰特征、随机波动。表3 OfficeQA全部81例回归机制统计机制分类MiniMax栈GPT5.4栈Claude栈总计占比输入定位偏移233425972.8%技能描述渗透5091417.3%输入校验混合偏移12033.7%其他随机波动21256.2%表4 SpreadsheetBench全部243例回归粗分类机制MiniMaxGPT5.4Claude总计占比描述渗透452507028.8%调用后流程干扰60404613.2%打分工具缺陷101753213.2%其他5431109539.1%5.1 技能描述渗透效应未调用仍干扰核心发现技能常驻提示词描述即便从未执行也会改变模型判断现有基于检索掩码的筛选工具完全无法捕获该类退化。执行调用率跨栈差异极大MiniMax表格任务仅5%-14%调用技能但仍出现大量渗透型回归Claude栈调用率高渗透退化占比极低。典型案例UID0096无技能时输出37.7%正确三套库均未调用技能但描述包含revised关键词模型全部算出38.757%错误值完全复现偏移。同时渗透效应双向作用表格MiniMax栈大量增益样本也未调用技能仅描述带来正向引导证明该机制兼具好坏双向影响。5.2 输入定位偏移最主要退化成因OfficeQA中72.8%回归来自该机制技能引导模型切换文档检索路径覆盖无技能时精准读取的表格/指标。案例UID0025无技能正确读取1934、1946数值差142调用导航技能后读取错误区间算出542。推理计算步骤完全无误仅输入读取环节被技能干扰。同时存在正向案例部分技能补充指标筛选逻辑修复原生读取错误。5.3 输出校验抑制偏移技能流程省略模型原生结果校验计算逻辑正确但最终答案出错OfficeQA中单独该类退化极少表格基准中是核心优化突破口。原生打分工具仅对比数值无法识别AGGREGATE等新式函数大量正确公式被判失败使用完整表格引擎重打分后226个任务恢复正确判定。表5 SpreadsheetBench修正前后通过率对比运行栈技能库原始打分完整引擎重打分恢复任务数OpenCodeAnthropic70.2%74.7%18OpenCodeOpenAI64.3%68.4%16OpenCode自研65.6%69.6%16CodexAnthropic67.6%78.643CodexOpenAI66.679.149Codex自研67.177.842ClaudeAnthropic81.184.915ClaudeOpenAI81.185.216Claude自研82.184.911表格场景证明补充输出校验步骤可大规模修复失败现有技能完全缺失该类逻辑支撑。5.4 残差失败样本成因有无技能均失败Office全部残差失败集中在输入定位模型始终读取错误指标区间中间计算流程无误表格基准残差失败集中在输出校验公式逻辑正确但无校验步骤、打分工具无法识别新式函数结论现有技能过度优化中间推理步骤两端输入读取、输出校验支撑缺失是持续失败的根本原因。6 讨论6.1 技能评估与设计规范评估标准必须双向化同时统计增益、回归数量不能仅看单一平均通过率消融实验需要区分「仅提示词描述」「完整可调用技能」两组分离渗透效应技能设计优先补充精准输入定位、标准化输出校验逻辑而非堆砌中间推理流程。6.2 实验局限性实验场景仅限办公文档/表格结论不一定通用到纯推理类任务模型与运行环境耦合无法拆分模型、环境独立变量回归机制人工单标注无多人一致性校验仅少量栈与基准样本覆盖有限。7 结论在5832组成对对照实验中新增技能带来的回归样本抵消59%正向增益单一平均通过率指标具备极强误导性。回归分为三类可观测机制仅描述存在的渗透干扰、技能调用后输入读取偏移、技能抑制原生输出校验绝大多数退化与持续失败集中在输入、输出两端而非传统技能聚焦的中间推理流程。本文提出两项标准化改进方案智能体技能评估必须同时报告增益、回归双向任务数量技能开发优先补充输入定位、结果校验逻辑大幅降低回归代价提升整体可靠性。附录A 实验复现配置1 模型调用地址OpenCodeminimax/minimax-m2.7Codexopenai/gpt-5.4-miniClaude Codeanthropic/claude-sonnet-4.62 实验运行完整脚本实验调度、轨迹提取、回归标注、打分重计算脚本随开源artifact包提供运行启动命令# 完整对照实验批量执行python run_benchmark.py--bench[OfficeQA/Spreadsheet]--stack[opencode/codex/claude]--skill_lib[anthropic/openai/ours/none]# 回归样本自动标注工具python regression_label.py--trajectory_dir./run_logs# 表格完整引擎重打分脚本python recalc_spreadsheet.py--workbook_path./task_files3 数据集获取OfficeQA-Pro、SpreadsheetBench完整任务文件项目开源仓库data目录4 统计计算代码麦克内马尔检验、Bonferroni校正、置信区间计算脚本analysis/stat_test.py附录B 典型完整回归案例B1 输入定位偏移案例UID0025任务1934与1946公共工程支出绝对差值真值142无技能执行读取549、407差值142正确加载技能调用导航流程读取949、407差值542错误计算逻辑完全一致仅输入表格区间被技能干扰。B2 校验抑制偏移案例UID0086任务季度环比绝对变化率真值4.815无技能输出4.815匹配绝对值要求调用技能输出-4.816数值精度一致但忽略「绝对」校验规则。B3 表格打分缺陷案例任务10452无技能使用INDEX/MATCH函数打分工具可解析判定正确加载技能使用AGGREGATE函数原生打分无法解析判错完整gnumeric引擎重算后结果完全匹配标准答案。附录C 技能描述渗透典型案例C1 Office UID0096任务1939-1941关税移动平均值真值37.708%三套技能库全程未调用技能仅提示词包含revised描述全部模型输出38.757%统一偏移。C2 表格任务31628要求提取日期当月数字标准答案10无技能直接输出10加载技能但从未调用描述包含数字格式化关键词全部输出Excel序列号45301。