一句话讲清楚香港科技大学联合多所高校发布智能体协同进化综述单体智能体的自我进化会撞上固定环境的天花板让对手、任务、反馈乃至进化规则本身一起进化才能持续突破。一个智能体部署上线之后还能不能继续变强这个问题在今天的 Agent 智能体系统里越来越现实模型在训练时见过的任务有限落地后要面对新工具、新界面、新需求靠一次性训练很难覆盖全部情况。于是「自我进化」成了一个热门方向——让智能体在运行中不断从经验里学习更新自己的记忆、技能甚至模型参数。但这类自我进化有个隐蔽的瓶颈它默认环境是不动的。任务池是固定的反馈规则是固定的对手或用户的行为也是固定的。一个人对着同一本习题册反复刷题进步会很快见顶一个智能体对着同一批任务反复自我改进能力曲线同样会进入平台期。生物学里有个著名的「红皇后效应」在共同演化的竞赛里只有一方拼命跑是不够的对手和环境也在变你必须在奔跑中保持相对位置否则就会停滞甚至落后。论文把这句来自《爱丽丝镜中奇遇记》的寓言用在了智能体系统上持续进步需要双方共同适应只改自己这一侧跑得再快也会被不断变化的环境甩下。这篇综述香港科技大学领衔联合 UIUC 、香港中文大学、香港大学、北京大学把散落在各方向的文献收拢成一个统一视角协同进化 co-evolution 。多个智能体以及它们所处的环境互相给对方施加适应压力共同变化、互相重塑。它梳理了 2017 年到 2026 年的一百多篇相关工作并提出一个三阶段递进分类法回答三个问题哪些组件在共同进化、进化自由的边界如何一步步扩大、这个过程最终会走向什么形态。左侧是单体自我进化任务和反馈被锁死进步撞上平台期右侧是多组件协同进化任务、反馈、交互空间都随智能体一起变化。先分清什么才算协同进化论文先给了两个基础定义。一个智能体系统由智能体集合和它身处的环境组成每个智能体可以看作两部分组合骨干模型模型本身的能力加 harness 模型外围的持久组件含记忆、工具、技能、 prompt 、工作流。智能体进化意味着骨干模型或 harness 发生了变化。环境则是智能体之外的一切它要完成的任务、得到的反馈、活动的交互空间。协同进化的定义比「多个智能体一起干活」要严格。论文强调多个 Agent 之间互相通信、协作、竞争只要没有产生持久的更新就只是普通交互协同进化要求至少两个进化单元都在改变而且一方的变化会持续重塑另一方后续的进化条件。用论文的话说这要求双方互相施加「进化压力」只是交换信息、没有产生持久改变的协作不算协同进化。举个最直白的例子攻击者越进化防御者就越难防防御者的新防御又逼攻击者换新招两边的改变互相锁死对方的下一步。在这个定义下论文按「系统被允许进化什么」画了一条递进线从只进化智能体自己到连环境一起进化再到连进化机制本身都可以进化。每一级都卸掉一层人类预先设定的约束。三阶段递进分类法进化自由的边界从智能体蓝色扩展到智能体环境绿色最终到达进化机制本身紫色。第一阶段 Agent 与 Agent 互相进化第一阶段的共同点环境固定进化发生在智能体集体内部。论文按目标关系把它分成三类。对抗式协同进化。 双方目标相反一方的进步直接抬高另一方的难度。这条线最早可以追溯到 GAN 生成器造假图、判别器辨真伪两者互相逼着对方变强。之后进入强化学习领域对抗扰动训练让控制策略对真实干扰更鲁棒格斗游戏和捉迷藏环境里智能体在对战中学会了用工具和反制策略。到了大语言模型时代这个思路最典型的应用是安全攻防攻击者 Agent 生成越狱 prompt 绕过安全限制的提示词防御者 Agent 学习拒绝两方互相驱动。 MAGIC 把攻防做成多轮博弈让攻击方找到单轮攻击发现不了的漏洞 CHASE 不用预设攻击模板逼防御方对没见过的攻击也保持鲁棒。当对手不止一个时就进入多源对抗 AlphaStar 的联赛训练是经典例子主智能体、针对弱点的攻击者、防止遗忘的旧版本智能体在一个联赛里共同进化。协作式协同进化。 目标一致一方的改进迫使同伴调整协作方式。基础来自多智能体强化学习 MARL 多个智能体共享任务奖励彼此适应对方的变化。 LLM 时代的协作更进一步常见「生产者-修订者」回路一个 Agent 出答案另一个 Agent 挑错修订两者周期性互换角色保持耦合批评 Agent 只有在建议真的让同伴下一次回答变好时才获得奖励。有的方法用公共品博弈模拟「有人出力、有人白拿」的博弈模型抑制搭便车行为有的方法维护一份共享的合作提示清单。论文还提到科学家场景研究员 Agent 和工程师 Agent 各自积累跨任务经验再通过持久记忆互相受益。组织级协同进化。 角色和交互结构本身也可以进化。有的方法从行为数据里发现角色再让角色与策略一起适应有的方法同时更新智能体的技能和团队结构执行过程暴露出不匹配时就重组还有方法把「工作流设计者」和「执行者」两个 Agent 一起训练让它们互相改进。第二阶段环境跟着 Agent 一起变第一阶段的协同进化能持续改变智能体但环境仍然是固定的。任务就那些反馈就那套智能体遇到的新情况终究有限。第二阶段把进化扩展到环境本身环境不是铁板一块任务、打分方式、活动空间都可以跟着智能体一起动论文就按这三块分别梳理。任务空间智能体面对什么问题在变。 一类做法是「选」任务池不变但动态调整智能体看到哪些任务。课程学习像上课一样由易到难安排任务按学习进度调整采样权重基于短板差距的方法优先给智能体安排它明显落后于强参考的任务服务型 Agent 的训练里模拟用户画像会随着 Agent 变强而变难。另一类做法是「生成」直接造新任务。工具使用场景里生成器按求解器的成功率校准难度把失败的经历改写成新任务软件工程场景里从修复过程构造仓库修复任务 RLAnything 更进一步把任务、策略和奖励模型放在一个动态系统里一起重写。换个方式打分。 环境不仅决定任务还决定怎么打分。一类是偏好驱动奖励模型给智能体行为打分的模型从轨迹对比同一问题不同回答的优劣对照里学习 DUO 专挑那些不同评分模型打分差异大、行为差别明显的样本减少人工标注。另一类是结果驱动根据任务成败反推奖励函数有的方法共同搜索奖励候选与策略变体留下表现最好的组合 CURE 让编码 Agent 和单元测试 Agent 互相进化测试从执行失败中长出新的测试用例。还有工作加一致性约束 ARCO 训练一个逐步打分的评估器要求每一步的分数加起来等于最终任务结果。交互空间智能体在哪里活动在变。 一种路线是构造可执行的世界 POET 同时进化环境和智能体群体 XLand 根据 Agent 的表现调整游戏规则和布局工具使用场景里 Agent-World 不断扩充工具组合和数据库状态暴露新的能力缺口。另一种路线是用世界模型用神经网络模拟环境、让智能体在里面预演代替真实环境 WebEvolver 同时训练一个网页世界模型和 Agent 策略用虚拟网页服务器做合成演练和前瞻 EvolvingWorld 让世界模型自己决定跟踪哪些方面进化出的世界状态反过来塑造角色进化自动驾驶场景里 LCDrive 把世界模型生成的内部表示与驾驶动作一起放进「边开边学」的训练循环里优化。第三阶段进化机制本身开始进化前两个阶段里进化机制都是人设计的系统能改变自己的内容但不能改变「自己如何被改变」。第三阶段元协同进化 Meta Co-Evolution 要解决的就是这个问题让系统自己修订自己的进化机制。论文把进化机制拆成五个自适应决策进化什么骨干模型、 harness 、组织、任务、奖励、世界、何时进化失败后、平台期、分布变化时、怎么进化训练、修订、生成、结构编辑、在哪里进化工具、网页、机器人、沙盒、仿真、真实环境、如何评价性能、新颖性、安全、鲁棒性。元协同进化的判据很严格翻译成大白话改进化规则这件事得由系统自身进化过程中积累的完整历史自主触发外部脚本或人类定期改写都不算数而且改完的规则还要反过来改变整个系统的进化环境形成闭环。目前真正满足这个判据的工作还很少。大多数相关方法是「单体元进化」前驱它们都让进化机制可进化比如 PromptBreeder 进化的是控制未来任务 prompt 如何变化的变异 prompt 有的方法进化 Agent 自身的自我修改机制有的进化管理经验复用的记忆架构有的用历史行为反馈在 harness 更新和权重更新之间做选择但都缺一个下层协同进化系统。论文认为 RQGM 是目前最接近的实践它让任务 Agent 和评估者共同进化元 Agent 把双方的表现汇总成联合反馈再据此指导后续进化。论文地图蓝色轨道是第一阶段 Agent–Agent 的代表工作绿色轨道是第二阶段 Agent–Environment 右侧是第三阶段的前驱与元协同进化闭环。这一层的意义在于通向「无终点进化」 open-endedness 真正开放的系统应该持续产出有意义的新颖性不该收敛到某个固定终点。实现它需要两个条件进化机制本身持续变化每次修订都产生新的规则系统的适应能力没有有限上界理论上可以无限提升。在论文看来元协同进化超出了第三阶段里其他方法的地位它是从「在既定规则下适应」走向「自我扩张的智能体系统」的一步。证据让对手和环境进化普遍有效综述本身没有跑新实验但论文做了一个跨论文证据汇总只收录在同一骨干模型、同一评测设置下同时报告「冻结对照」和「进化对照」的论文冻结指对手和环境保持不变进化指它们也在变在每篇论文内部做匹配对比。A 面板展示了六组受控对比的成绩每篇论文取各自匹配设置下的均值把对手、环境或任务从「冻结」换成「进化」之后六组全部提升平均相对提升约 8%。需要说明的是这些分数来自各论文自设的评测指标彼此不能直接横向比较真正有意义的是同一篇论文内部的组内差距。其中提升最明显的是 GenEnv 从 40.8 涨到 45.8 约 12%最温和的是 RLAnything 从 40.7 涨到 43.1 约 6% CoVerRL 、 WaltzRL 、 MAGIC 、 SEAL 也各自上涨了 3.4 到 4.4 分。B 面板把每篇论文做了几组「冻结 vs 进化」对照、平均涨了多少分、几组对照里正向提升占多大比例都画在一起阶段一和阶段二的工作都落在正向区域。 C 面板是 8 条归一化性能轨迹换算到同一尺度后的曲线来自 Tool-R0 、 Agent0 、 GenEnv 、 Search Self-Play 、 WaltzRL 、 RL Tango 、 CoVerRL 、 CoEvolve 平均曲线在进化后期明显放缓。这正好呼应论文的判断阶段一和阶段二能带来普遍提升但收益在逼近平台期时递减需要第三阶段打开新的改进方向。跨论文证据 A 面板六组「冻结 vs 进化」对照全部提升 B 面板按论文统计增益与一致性 C 面板归一化轨迹显示后期收益放缓。和相邻综述比这篇的定位差异也很清楚已有的自我进化综述把协同进化当作一个分支或未来方向多智能体综述和 harness 综述几乎不设协同进化类别。这篇综述把协同进化作为组织全文的主轴覆盖智能体、环境、进化机制三个层面并严格区分「互相适应」与「仅仅交互或交换信息」。与相邻综述的对比多数综述把协同进化当作分支、未来方向或散落例子本文将其作为主线。没解决的问题评估、扩展与治理综述最后列出三组开放问题都直接关系到协同进化能不能落地。动态评估。 现有基准大多测量智能体的最终能力。协同进化需要回答更难的问题所有进化组件是否都在变好、收益能否迁移到没见过的伙伴和环境、每个组件对联合进步贡献了多少。论文特别提醒任务成功率升高可能掩盖「刷分」评估器被利用、对固定伙伴过拟合、多样性塌缩所有智能体最后都变成同一种套路都是协同进化特有的失败模式。因此评估应该把固定基准和过程级测试结合起来比如历史交叉对局、组件消融测试逐个拆掉某个组件看整体效果掉多少还要把评估器本身当成被检验对象防止智能体把打分器「骗」到失灵。扩展。 现有系统大多研究局部回路攻防两方、策略与奖励、 Agent 与任务生成。真正的难点在于拿捏分寸哪些组件该放开进化、哪些该保持稳定以及各组件的更新如何互相影响如何让协同压力保持有效又不至于不稳定或被某个组件主导。元协同进化让系统自己做这些决策算是朝这个方向迈出的一步。安全与治理。 协同进化越自治人类越可能失去对系统行为的掌控。进化中的 Agent 可能发展出超出人类理解、难以监控的攻击策略、工具使用模式、通信协议或组织行为在元协同进化层面系统甚至可能改变「哪些行为被奖励和保留」。论文提出的治理方向包括沙盒部署、持续监控、回滚到已验证状态、保留人类干预点。但作者也坦承这些目前停留在愿望层面没有具体的保障协议。判断这篇综述的价值在于把一堆零散现象收进一个可操作的分析框架任何「持续改进」的智能体系统都可以问一句除了自己还有谁在进化如果答案是「没有」那么平台期大概率就在前方。三阶段分类法给出的路线图也足够直白先让 Agent 之间互相进化再放开环境最后放开进化规则本身。需要注意的是第三阶段目前几乎只有概念和少数前驱工作 RQGM 也只是雏形把进化机制交给系统自己同时还要保证可审计、可回滚、可干预这条路才刚刚开始。作者还维护了一份配套资源清单 Awesome Co-Evolution github.com/zongqing0068/awesome-co-evolution 按同一套三阶段框架收录了 142 篇相关论文并持续更新想顺着这条线深挖的读者可以收藏。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】