一个Agent到底凭什么越来越强有人靠更大的模型有人靠更多数据但北京大学连发两篇论文给出了同一条答案让 Skill 自己进化。这两篇都来自北大一个叫VeriSkill管程序验证一个叫SESA管搜索问答自博弈。方向不同内核却高度一致——它们都不把Skill当成静态的、靠人手写的说明书而是当成一个会从失败里自我更新的活记忆。第一篇Self-Play MeetsSkillEvolution由中科院中科大北大清华等联合发表Skill这块清华也很高产SESA自博弈遇上进化SkillSESA面对的是另一类Agent——工具增强的搜索问答。自博弈能让 Agent 自己出题自己解但失败只贡献一个梯度不留持久状态外部Skill记忆又只从固定任务分布学。两边的毛病正好镜像自博弈会练但会忘Skill记忆会记但不会选题。SESA把过程记忆变成自博弈的进化状态用四个阶段闭环。SESA 概念总览一是记忆启动用 15 条手写加 142 条 bootstrap 挖出的技能共 157 条打底。二是不对称自博弈challenger 出题、solver 解题只有 solver 能检索技能防止解题策略泄漏给出题方。三是前沿塑形用钟形奖励把出题方推向 solver 能力边界附近的问题太简单太难的都罚保证失败是可学的。四是失败蒸馏把有用的失败提炼成技能写回记忆去重、按 help-hurt 淘汰、上限 800 条。SESA 训练环这个闭环的关键在于双向耦合技能更新改变 solver 行为solver 变强又改变 challenger 的奖励和未来题目分布新题目再制造新失败、改写记忆。任务生成和技能记忆一起进化。因为技能参与了训练轨迹SESA支持双路复用。最反直觉的结论来自关掉记忆的SESA-Off即便推理时不检索任何技能训练过的 solver 相对 SSP 仍有1.8Qwen3-4B和 2.2Qwen3-8B的提升。也就是说技能不是推理时的小技巧而是真的把能力烧进了模型参数再把记忆开回来还能再加 0.5 到 1.0 个点。总体看七个问答基准上SESA平均超过 SSP1.2 到 3.2 个点相对原始模型提升7.0 到 11.8 个点且跨 Qwen3、Qwen2.5、LLaMA-3.1、Search-R1 多个底座都成立。消融里失败蒸馏贡献最大去掉掉 2.7 个点前沿塑形掉 2.2记忆启动掉 1.5。对比已发布的 SkillRLSESA以 51.0 对 50.1 领先0.9 个点。训练动力学也印证了设计验证质量稳步上升后稳定活跃技能数先膨胀、后因去重和淘汰收缩——是会自我精炼的记忆而不是无限堆积。自进化动力学VeriSkill让验证失败变成可信的Skill更新程序验证是要证明一段代码满足形式化规范靠 Dafny、Frama-C、VeriFast 这类验证器。LLM Agent想全自动完成它离不开可复用技能。但验证器的反馈是失败的验证条件又晦涩又不直接可用。VeriSkill用三步把这种废信号变成可信更新。VeriSkill 总体框架第一步是责任归因。它把每次失败分成四类任务不可满足、证明器能力不足、技能不合规、技能知识缺口。前两类跟技能无关直接丢掉只留后两类作为进化信号。这一步挡住了最大的噪声来源。第二步是教训抽象。不为单个例子打补丁而是抽诊断签名——失败在哪、缺什么职责、技能文本怎么导致的失败——把同模式失败聚类再抽象成一条可复用 lesson并删掉实例细节避免把某个具体答案硬编码进技能。第三步是可执行验证。候选技能要在归因集和同模式迁移集上反复跑验证器只有严格提升验证成功率、且不破坏原程序语义才准许进入技能库。所有结果写进进化记忆指导下一轮。结果很硬。在三个验证器、两套 Agent 配置下VeriSkill六项全胜。相对无技能基线Dafny 提升43.3、Frama-C17.6、VeriFast46.0个百分点Claude Code / Opus 4.8换到 Codex / GPT 5.6 下VeriFast 直接51.3。即便对比最强的同类基线 SkillOpt-Lite它仍分别领先 15.0、9.1、5.7。消融实验说明三步缺一不可且可执行验证贡献最大去掉它PASS 从 57.3 掉到 36.0跌 21.3去掉责任归因跌 13.0去掉教训抽象跌 8.3。更值得在意的是迁移性。用 Codex 进化出的技能原封不动塞给 Terminus 框架下别的模型依然带来15.3 到 43.7个百分点的提升。这说明VeriSkill提炼的是可复用知识不是某个模型专属的 prompt 玄学。跨模型迁移性两篇合在一起说明了一件事VeriSkill和SESA场景差很远一个在形式化验证的硬骨头里一个在开放域搜索的自博弈里。但它们指向同一个判断Skill 不该是人手维护的死库而该是会从失败中自我进化的活记忆。对做 Agent 的人来说这意味着别再把精力全砸在 prompt 和模型规模上。把失败变成可复用、可验证、会自我更新的技能记忆才是 Agent 能持续变强的底层逻辑。北大这两篇把这条路铺得相当扎实。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】