PAST-Bench:面向个人智能体递归自提升能力评测基准
PAST-Bench面向个人智能体递归自提升能力评测基准论文arXiv编号2608.04003v1 | 发布时间2026-08-03论文HTML原文https://arxiv.org/html/2608.04003v1论文PDFhttps://arxiv.org/pdf/2608.04003v1项目开源仓库https://github.com/Gen-Verse/PAST-Bench摘要递归自提升Recursive Self-Improvement, RSI要求AI智能体利用历史交互经验优化后续任务表现。个人AI智能体天然具备跨会话存储偏好、任务流程、工具脚本、交互历史的持久化能力但现有评测方案无法区分“性能提升是否真正来源于复用历史留存经验”。本文提出PAST-Bench评测基准采用持久化开关对照实验方案同一任务序列分别开启/关闭持久存储构建26个任务家族、总计204段交互样本覆盖四大核心自提升能力记忆留存、流程复用、信息检索、内容更新。现有评测仅输出任务正确率无法定位性能增益的真实来源PAST-Bench同时提供任务得分与机制证据分(\text{Mech})分离底座模型、智能体运行时、历史经验三类因素对结果的影响。基于基准诊断出原有Hermes智能体五大核心缺陷针对性提出**Hermes**改进框架新增五大独立可消融运行时机制规划校验E1、结构化记忆渲染E3、技能路由E3、检索门控E4、会话收尾刷新E5。在7款主流底座大模型、4套开源智能体框架上完成全量实验Hermes相较原生Hermes整体自提升差距Δ从0.13提升至0.15机制证据分从0.64提升至0.73其中内容更新类任务增益最显著Δ0.24。消融实验证明五大机制具备互补叠加效应可独立开关用于模块归因分析。PAST-Bench为持久化智能体自提升领域提供可复现、可归因标准化评测与诊断工具。1 引言研究背景个人智能体可跨会话持久存储记忆、标准化操作流程SOP、用户配置、历史交互记录理论上能够复用过往经验实现自主进化。但现有智能体评测存在致命缺陷单次快照式打分仅评估单轮孤立任务不跟踪多会话时序经验复用效果增益无法归因任务正确率提升无法区分是底座模型原生能力、上下文短期记忆还是持久化存储带来的真实收益缺少污染对照组无法排除模型内置参数记忆、提示词短期上下文带来的分数干扰。现有长记忆、技能评测数据集仅单独测试某一类持久化能力无法构建开关对照闭环实验无法量化“关闭持久存储后性能衰减幅度”也就无法证明智能体真的学会复用历史经验。核心定义在线自演化Online Self-Evolution无需微调模型、无需优化提示词智能体通过跨会话持久存储、检索、修正经验自主提升后续任务表现。这是完整递归自提升的底层基础也是本文研究核心。本文四大核心贡献PAST-Bench评测基准26个任务家族、204段交互四大自提升能力全覆盖采用持久化开启/关闭匹配对照实现性能增益归因双维度量化指标任务得分衡量最终效果机制证据分(\text{Mech})验证性能提升是否来自规范的“存储-检索-复用”完整链路Hermes改进智能体框架基于基准诊断出原生Hermes五大短板设计5个独立可消融运行时机制模块可单独开关用于消融实验完整归因实验体系单机制消融、机制交互诊断、跨模型泛化、多智能体横向对比配套完整复现脚本、评测流水线。2 相关工作现有智能评测分为三类均无法实现持久化经验的精准归因单任务交互式基准GAIA、AgentBench等仅打分单次任务无跨会话时序序列无法衡量经验复用独立记忆/技能数据集LongMemEval、SkillsBench单独评测单一持久化模块缺少同任务“开/关存储”对照增益混杂上下文短期记忆智能架构消融研究仅对比整体框架无法拆解“经验存储、检索、更新”单环节缺陷。PAST-Bench创新点以任务家族时序序列为评测单元同一套任务固定模型、提示词、工具仅切换持久存储开关同时采集完整执行轨迹用于机制链路校验。基准对比表评测基准跨会话经验评估模型横向对比智能体框架对比轨迹机制归因GAIA××××AgentBench×✓××VisualWebArena×✓××LongMemEval✓✓××SkillsBench局部近似✓局部近似×PAST-Bench✓✓✓✓3 PAST-Bench评测基准整体设计3.1 基准构造四大核心能力分类全部204段交互样本分为四大任务家族覆盖在线自演化完整链路记忆留存Memory41个样本测试用户偏好、约束、历史案例跨会话持久检索子场景偏好采纳、约束留存、弱触发历史调取、异常清单查询流程复用Procedural Reuse64个样本测试多步骤标准化SOP跨会话存储、复用子场景SOP自动生成、隐式规则归纳、故障流程沉淀信息检索Information Gathering48个样本测试历史存档信息主动调取拒绝凭空猜测子场景上线复盘、值班交接、变更冻结审计等内容更新Update51个样本测试过期信息覆盖、旧记录隔离子场景事实修正、规则迁移、临时异常过期、SOP补丁更新。样本总量分布饼图说明总样本204段26个子家族流程复用占比30.8%、更新26.9%、信息搜集23.1%、记忆留存19.2%。3.2 评测流水线核心规则1会话隔离机制每一轮评估均全新空会话上下文不继承上一轮对话历史仅开启持久化模式时智能体可读取前序学习阶段写入的记忆、技能文件。关闭持久化对照组完全屏蔽所有跨会话存储保证分数差值仅来源于历史经验复用。任务序列固定三段式结构学习轮Learn智能体执行任务并写入持久化经验评估轮Eval全新会话测试是否复用学习轮留存内容对照轮Control关闭持久存储同任务重新执行作为分数基线。2两大核心量化指标指标1任务得分ses_ese​单episodeseσe×(0.80×ce0.20×re)s_e \sigma_e \times (0.80 \times c_e 0.20 \times r_e)se​σe​×(0.80×ce​0.20×re​)σe\sigma_eσe​安全二元标识出现违规操作直接置0cec_ece​任务完成度输出内容匹配标准答案0~1rer_ere​工具调用故障恢复率。家族层面自提升差距ΔfSw/−Sw/o\Delta_f S_{\text{w/}} - S_{\text{w/o}}Δf​Sw/​−Sw/o​即开启/关闭持久化平均分差值Δ0\Delta0Δ0代表复用经验带来提升。指标2机制证据分Mech\text{\(\text{Mech}\)}Mech不单纯看正确率校验智能体是否走完写入→检索→正确复用完整标准链路五维加权计算取值0~1Mechf15(wpraucrh(1−pr))\text{\(\text{Mech}\)}_f\frac{1}{5}(\text{wp}\text{ra}\text{uc}\text{rh}(1-\text{pr}))Mechf​51​(wpraucrh(1−pr))wp学习阶段正确写入有效经验ra评估轮精准检索对应留存内容uc更新场景隔离过期旧数据rh远距离任务经验不衰减pr无效冗余存储污染占比越低分越高。(\text{Mech})分数越高代表性能提升确由规范持久化链路带来而非模型内置记忆、短期上下文投机。3评测执行脚本仓库完整bash脚本片段# 全模型对比运行脚本scripts/run_model_comparison.sh\--compare-no-persistence\--judge-model MiniMax-M2.7\--trace-dirtraces/main/model_run/${MODEL}/${RUN_ID}# Hermes单机制消融脚本scripts/run_hermes_plus_mechanisms_full.sh\--trace-root traces/ablations\--agent-profile minimax\--judge-model MiniMax-M2.7\--mechanismmemory# 可指定E1/E2/E3/E4/E5单一模块运行输出文件sequence_results.json每段任务原始得分sequence_summary.json家族级均值sequence_comparison.json持久化开关差值Δ、(\text{Mech})分数汇总。4 Hermes基于基准诊断的改进智能体框架4.1 原生Hermes五大核心缺陷PAST-Bench诊断得出规划无前置检索E1缺陷生成行动方案前不读取历史存储凭空制定流程记忆无结构化隔离E2缺陷新旧事实混杂过期记录与有效内容同时暴露流程不持久化为可检索技能E3缺陷多步骤SOP仅留在对话上下文无法跨会话调取检索后置E4缺陷未查询存档就直接生成答案凭空猜测会话无同步刷新E5缺陷更新后的新规则不会覆盖旧存档新旧信息共存。4.2 Hermes五大独立可消融机制一一对应缺陷E1 规划前置校验Plan生成任何不可逆操作前强制检索匹配持久化记忆/技能基于历史经验制定方案独立开关不依赖其他模块。E2 结构化记忆渲染Render写入记忆时附加实体、作用域、过期时间元数据读取时自动屏蔽已作废旧记录仅展示当前有效条目。E3 技能路由Route完整多步骤流程自动打包为可检索技能标注适用场景后续任务可按关键词匹配调取支持流程微调补丁。E4 检索门控Gate任务依赖历史存档时拦截草稿输出强制先执行记忆/技能检索禁止无依据作答。E5 会话收尾同步刷新Close每段任务结束同步覆盖更新后的规则、事实新会话仅读取修正后权威记录隔离过期数据。五大模块完全解耦可单独开启/关闭用于消融实验不改动Hermes基础循环架构。5 完整实验设置与结果5.1 实验基线底座大模型GLM-5.1、Kimi K2.6、DeepSeek-V4-Pro、MiniMax-M2.7、GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.6对比智能体框架原生Hermes、nanobot、ZeroClaw、Agent-Zero评测裁判固定MiniMax-M2.7温度0最大输出8192token硬件与环境Python3.11uvDocker容器化调度API多线程并发。5.2 主实验固定Hermes、更换底座模型模型整体Δ机制分(\text{Mech})四大能力增益分布GPT-5.40.240.80记忆38%、更新35%双核心增益Claude Sonnet 4.60.200.76记忆40%、更新36%DeepSeek-V4-Pro0.170.71记忆48%为主Kimi K2.60.170.72记忆49%占最高GLM-5.10.200.70更新46%收益最大MiniMax-M2.70.130.64均衡分布Claude Opus 4.60.190.70更新38%核心结论所有底座模型开启持久化后均有正向自提升但增益集中能力差异极大不存在通用最优模型。5.3 固定MiniMax-M2.7横向对比四大智能体智能体框架整体Δ(\text{Mech})分数核心短板Agent-Zero-0.080.39多数场景复用经验后性能下降ZeroClaw0.120.55记忆增益高、流程复用失效nanobot0.130.57仅更新类任务有效记忆几乎无提升原生Hermes0.130.64均衡但链路不完整Hermes本文0.150.73更新任务增益大幅提升关键现象nanobot与原生Hermes整体Δ同为0.13但(\text{Mech})差距明显说明二者分数提升底层机制完全不同仅看Δ会产生错误结论。5.4 Hermes单机制消融实验MiniMax-M2.7配置整体Δ更新任务Δ核心优势场景原生Hermes0.130.12仅E1规划0.140.13仅E2记忆渲染0.130.10仅E3技能路由0.120.05仅E4检索门控0.170.06仅E5收尾刷新0.120.16完整Hermes全部模块0.150.24结论E5单独对更新类任务增益最强多模块叠加产生超加性收益单一机制无法达到完整框架效果。5.5 跨模型泛化测试Hermes在GPT-5.4、Claude Sonnet上Δ分别达0.24、0.22仅DeepSeek、Opus小幅回落证明架构具备跨底座通用性单次运行方差±0.06整体小幅提升小于运行波动但更新能力提升统计显著。5.6 计算开销对比Hermes相较原生Hermes token总量提升约2.5倍推理耗时仅提升1.1倍额外开销主要来自系统提示词扩展不增加大量生成输出API调用成本可控。6 结论现有持久化智能体性能提升无法单纯依靠任务得分判定PAST-Bench通过开关对照轨迹机制分实现增益精准归因当前主流智能体普遍存在五大持久化链路缺陷原生Hermes框架经Hermes五模块改造后经验复用链路完整性显著提升更新类任务收益提升一倍自提升效果高度依赖底座模型特性不存在通用最优智能体架构PAST-Bench提供标准化流水线可用于后续新框架、新机制定量诊断局限当前任务为人工合成缺少真实用户长时序交互样本未来将拓展跨家族经验迁移评测、多智能体协同自提升场景。7 未来研究方向基准拓展引入真实人类交互长时序任务增加跨任务经验迁移子家族归因增强设计干预式评测删除/篡改存档经验观测分数变化实现因果验证自适应持久化路由智能体自主判断内容存入记忆/技能/临时缓存减少人工机制配置安全约束新增持久化内容隐私、污染防御评测维度。资源完整下载清单论文HTML在线版https://arxiv.org/html/2608.04003v1论文PDF全文https://arxiv.org/pdf/2608.04003v1PAST-Bench完整开源仓库数据集评测脚本Hermes实现https://github.com/Gen-Verse/PAST-Bench全套运行bash脚本仓库scripts/目录模型对比、机制消融、批量评测完整任务数据集JSON仓库dataset/204_episodes_full.json实验绘图、统计分析Python代码仓库analysis/附录完整提示词、裁判打分模板仓库prompts/消融实验热力图、归因折线图绘制代码plot/附录关键信息附录A 基准数据集完整分类表总计26个子家族、204段交互四大能力细分样本数量见正文饼图全部样本无真实用户隐私数据由多模态大模型生成并三轮人工校验规避捷径答案、可直接开源使用。附录B 指标完整数学推导包含任务得分、机制分分步计算公式人工裁判一致性校验实验48份盲样双人打分人机匹配度91.7%LLM裁判可靠可大规模自动化评测。附录C 四大智能体框架源码适配说明Hermes原生架构可无侵入插入E1-E5五大模块Agent-Zero、nanobot、ZeroClaw内置持久化逻辑重叠无法干净消融仅作为横向对比基线不做改造实验。附录D 补充实验图表说明机制消融热力图横轴四大能力、纵轴各单模块配置颜色代表Δ增益智能体归因前沿散点图横轴整体自提升Δ纵轴(\text{Mech})机制分Hermes位于最优右上角逐家族成对对比表26个子家族分别给出Hermes/Hermes开关差值细分场景优劣运行方差、单轮token/耗时统计表格完整算力开销数据。附录E 复现完整配置模型推理参数温度0最大输出16384token推理强度中等智能体运行限制单任务最多50轮工具调用300秒超时自动判0分上下文隔离规则每episode强制清空对话仅持久存储文件留存环境依赖Python≥3.11、uv包管理器、Docker容器、各大模型API密钥。附录F 拓展相关工作补充长记忆、技能智能体、时序轨迹评测领域近30篇相关论文对比区分“单次任务打分”“跨会话经验复用”两类评测范式核心差异。