加三行代码,Agent成功率翻三倍
身边有人在用Agent跑代码审查拉diff、分析代码、跑测试、查漏洞、生成报告、发通知一套下来20次工具调用、30分钟。中间API超时一次整个任务就废了从头再来。我以前以为Agent跑长任务失败是因为模型不够聪明后来才发现真正的瓶颈根本不在智力——是工程基础设施没跟上。先搞清楚为什么长任务这么容易挂算一道简单的数学题20次工具调用每次有5%的超时概率。不加重试整条链路成功率只有35.8%。也就是说你跑三次长任务两次会中途挂掉。这不是模型的问题是概率叠加的问题。更隐蔽的是上下文溢出。30分钟的Agent任务可能产生几百轮对话轻松超过128K token窗口。一旦溢出Agent要么直接崩溃要么丢失前面的关键信息后续决策全部跑偏。有人统计过超过80%的长任务失败源于上下文管理不当。还有一种叫doom looping的死循环Agent失败了你告诉它换种方式试试它说好的然后又回到同样的解法一模一样地再错一次。旧模型特别容易陷入这种循环白白烧token。Anthropic的解法给Agent套上Harness2025年11月Anthropic发了一篇Effective Harnesses for Long-Running Agents核心思路是把Agent想象成一匹野马——它有跑的能力但没有缰绳就会跑偏、失控。Harness就是那套缰绳检查点、重试退避、幂等性、上下文管理、超时熔断、可观测性、安全护栏七条绳子绑在一起让Agent跑得又快又稳。最关键的一条是检查点机制。Agent跑长任务就像打RPG游戏没存档的话一次Game Over全部重来有存档的话从最近的存档点继续。每完成一步就存档——状态、进度、配置全部持久化到PostgreSQL。崩溃了传个None进去自动从最近的检查点恢复不用从头跑。Anthropic还借了GAN的思路一个generator Agent干活一个evaluator Agent批评两个来回打磨。干完一段就清空上下文窗口用结构化的交接文件把状态传给下一个Agent给它一个干净的起点。这样既避免了上下文溢出又保证了输出质量比单跑好很多。Close the Loop让Agent自己验证自己的输出Anthropic的产品经理Theo Chu最近有一场演讲核心观点只有一句话Close the Loop让Agent验证自己的输出结果。她举了一个例子一年前Claude在SWE-bench上只有60%的通过率现在Opus 4.8已经到了88%。失败率一年内降了3倍。这个变化不是多做对了几道题而是模型从经常翻车变成了翻车后能自己爬起来。真正有价值的Agent不是永远不犯错而是犯错之后能恢复。如果你做一个应用生成Agent就该给它访问前端界面的能力——让它自己点击、自己测试、自己判断按钮能不能用、页面是不是正常。只有拿到这些验证信号才能形成执行、验证、修正、再执行的闭环。Theo还提了一个反直觉的建议精简脚手架。很多开发者为了修补旧模型的各种漏洞在周围套了无数系统提示词、外部工具、约束补丁。但新模型的指令遵循能力变强之后旧补丁反而成了问题——Anthropic自己就踩过坑新模型太听话了严格执行了一行过时的引用格式指令导致功能异常。删掉那行过时提示词功能就恢复了。给模型松绑你才能看清它真正的天花板在哪里。七个策略每个都能今天动手检查点机制LangGraph内置了PostgresSaver三行代码就能用from langgraph.checkpoint.postgres import PostgresSavercheckpointer PostgresSaver.from_conn_string(“postgresql://user:passlocalhost:5432/agent_db”)checkpointer.setup()graph workflow.compile(checkpointercheckpointer)跑任务时指定thread_id每个任务一个ID崩溃了传None进去自动从最近存档恢复。开发阶段用MemorySaver连数据库都不需要。存档内容四件套Agent完整状态messages、currentstep、执行位置stepindex5、配置参数model、temperature、时间戳版本号。不是只存结果是把跑到哪一步、前面发生了什么全存下来。不想用LangGraphTemporal也行。它的Durable Execution天然支持Event Sourcing所有状态变更以事件形式持久化每个Activity独立配置重试策略跨语言支持Go/Python/Java/TypeScript。重试退避不是所有错误都该重试。429限流和5xx服务器错误值得重试4xx客户端错误和业务逻辑错误不该重试——重试只会浪费token。指数退避配置初始1秒系数2.0最多3次。第1次等1秒第2次等2秒第3次等4秒。LangGraph里给每个节点加retry_policyRetryPolicy(maximum_attempts3, backoff_coefficient2.0)关键设一个全局最大重试预算。单个步骤3次重试没问题但整个任务如果累计超过30次重试说明这条路走不通直接熔断停止。幂等性Agent最怕的不是API超时是超时之后重试导致副作用翻倍——发两封邮件、扣两次款、创建两条数据库记录。落地做法每个工具调用带一个Idempotency Key格式是操作类型:任务ID:步骤序号。比如send_email:task-001:step-5。服务端收到请求先查Rediskey已存在且状态是succeeded就直接返回之前的响应结果不重复执行。数据库写入用UPSERT代替INSERT存在就更新不存在才插入。创建订单用唯一索引防重复。这些都是后端常规操作但Agent团队经常忽略因为Demo里不会触发重复调用。上下文管理30分钟的长任务轻松产生几百轮对话128K窗口撑不住。三种落地方案滑动窗口只保留最近N轮对话系统提示词。N根据任务复杂度设简单任务10轮够用复杂任务50轮。丢掉的历史不删存到检查点里需要的时候能查。摘要压缩跑完一个阶段比如5轮工具调用让模型把这几轮的对话压缩成一段200字的摘要替换原文丢进上下文。Anthropic的Harness就是这么做的——干完一段清空窗口用结构化交接文件把状态传给下一个Agent。状态分离把对话历史和任务状态分开存储。对话历史只用于给模型看最近的上下文任务状态已完成步骤、待执行步骤、中间结果单独存数据库。模型每次拿到的不是全部对话而是最近10轮对话任务状态摘要。超时与预算两层熔断步骤级超时单个工具调用超时30秒单个LLM调用超时60秒。超时直接走重试退避逻辑不无限等待。任务级预算整个任务最多跑30分钟、最多消耗50万token、最多执行100步工具调用。任何一个阈值触达任务强制停止进入人工审批队列。为什么设三个维度时间超了可能是死循环token超了可能是上下文膨胀步骤超了可能是反复重试。三个维度交叉验证才能精准判断任务到底卡在哪。可观测性看不见的东西无法优化。Agent每一步都要打日志不是打完才看是跑的时候实时看。最少要记录五类数据每步开始时间结束时间算耗时、每步输入输出算token用量、每步成功/失败/重试次数算故障率、每步调用了哪个工具算工具分布、最终任务结果算成功率。落地工具LangSmith追踪LangGraph的每一步执行Datadog LLM Observability SDK追踪API调用和token消耗自己搭的话用OpenTelemetry标准Python/Go/Java都能接入。核心指标只有一个成功率。所有优化的终极目标就是把长任务成功率从35.8%往99%推。安全护栏最后一道防线。Agent执行完输出结果之前过三层扫描输入扫描检查用户prompt是否包含注入攻击忽略之前所有指令这类。用正则模型双检。输出扫描检查Agent返回的内容是否包含敏感信息泄露、违规操作指令。用NeMo Guardrails这类专门工具。权限扫描检查Agent调用的工具是否超出授权范围。每个Agent的API Key应该是权限受限的临时工不是超级管理员。只给它当前任务需要的权限任务结束自动回收。今天就能做的最小行动如果你的Agent还在裸跑按优先级加这三样第一步加检查点。LangGraph的PostgresSaver三行代码搞定成功率立刻从35.8%往90%走。第二步加Idempotency Key。每个工具调用带唯一标识Redis查重防止重复发邮件、扣款、创建记录。第三步加任务级预算。设30分钟/50万token/100步上限任何一个触达就强制停止。防止死循环烧钱。这三样加完你的Agent就从跑着跑着就挂变成挂了能恢复、恢复不重复、重复有上限。三点最深的感触Agent长任务失败不是智力问题是概率叠加问题。每次5%的超时率叠加20次就是64.2%的失败率跟模型聪明不聪明没关系。Harness不是给Agent加枷锁是给它加存档。存档机制让Agent从一次翻车全部重来变成从最近的存档点继续这才是长任务能跑通的前提。用户感知的延迟和技术延迟是两码事。先让用户觉得快流式输出、进度条、中间状态反馈再让系统真的快。优化顺序不能反。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】