Chat 阶段 vs Agentic 阶段:当人被移出循环,推理经济学被彻底改写 Chat 阶段 vs Agentic 阶段当人被移出循环推理经济学被彻底改写前两篇我们拆解了一次推理的完整过程和 KV Cache 的工作原理——那是一次请求视角的物理层。这一篇上升到使用范式层同样的模型、同样的 prefill 和 decode从 Chat 用法切换到 Agentic 用法后负载形态、成本结构、延迟瓶颈全部变了样。理解这个转变你就能看懂两件事为什么 API 厂商拼命降低缓存输入的价格以及为什么 2024 年之后 Agent 产品突然爆发。一、一句话区别Chat 阶段人是循环的一部分。模型每输出一次就停下来等人读、等人回一问一答。Agentic 阶段模型自己在循环里跑。接到任务后自主决策——调工具、看结果、再决策循环几十上百轮直到任务完成才回到人面前。Agentic 阶段人在循环外否是用户下达任务LLM 推理决策任务完成?调用工具(搜索/读文件/执行代码...)工具结果追加进上下文最终结果交付用户Chat 阶段人在循环内用户提问LLM 一次推理(prefill decode)回复文本人阅读、思考核心差别就一处Chat 的循环节点是人Agentic 的循环节点是环境工具执行结果。人被移出了内循环只在任务的入口和出口出现。ChatGPT 网页版、客服机器人是前者的典型Claude Code、Deep Research、Computer Use、自动化 workflow 是后者的典型。二、逐维度对比维度Chat 阶段Agentic 阶段交互单位一问一答turn一个任务task内含几十上百次推理循环里的角色人读完再发下一条工具结果自动喂回无人介入输出的本质给人看的文本多数是动作结构化工具调用最后才是给人看的文本上下文增长慢按人打字的速度快且猛每轮追加工具输出轻松堆到几万 token输入:输出 token 比接近 1:1 到 5:1常见 20:1 甚至 100:1输入占绝对大头延迟指标TTFT 逐字生成速度端到端任务完成时间几十次串行推理累加错误的代价答错一次人当场纠正错误逐步复利放大对模型的核心要求语言质量、知识规划、工具使用、长程一致性、自我纠错下面挑最有分量的三个维度展开。输出的本质变了从文本到动作Chat 模式下模型的输出是终点——人读完就结束了。Agentic 模式下模型输出的大多数 token 根本不是给人看的而是结构化的工具调用{tool:run_command,input:{cmd:pytest tests/ -x}}这段 JSON 会被框架解析、真正执行执行结果测试通过还是报错栈再追加回上下文成为模型下一轮决策的依据。模型的输出从内容变成了因果链上的一环——它会真实地改变环境状态环境再反过来改变模型接下来看到的东西。上下文增长模式变了从线性到爆炸Chat 的上下文按人打字的速度增长一轮几十几百 token。Agentic 的每一轮都可能追加一整个文件、一页搜索结果、一段几千行的报错日志。一个中等复杂度的编码任务跑 50 轮上下文轻松突破十万 token——而且这些内容每一轮都要原样重发给模型。错误模式变了从单点到复利Chat 里答错一次人当场就纠正了错误不传播。Agentic 循环里第 3 步理解偏了方向第 4 到 20 步全在错误方向上勤奋工作。错误不是叠加是乘法。这一点是理解能力门槛一节的钥匙。三、推理经济学被改写三个倒转前两篇的结论——prefill 便宜、decode 贵、缓存命中近乎免费——在 Agentic 负载下不是失效了而是权重被重新排序。1. 前缀缓存从优化项变成生死线Agentic 循环每一轮都要把全部历史system prompt 工具定义 任务 前面所有轮次重新发给模型。没有 prefix caching每轮都是一次全量 prefill第 30 轮时仅首字延迟就不可接受成本更是灾难。命中缓存后完全不同稳定前缀和历史轮次直接从 KV Cache 读出每轮只需对新追加的工具结果做增量 prefill。每轮上下文构成前缀缓存命中≈零成本增量缓存命中唯一需要真正prefill 的部分稳定前缀system 工具定义历史轮次逐轮膨胀本轮新增工具结果KV Cache本轮推理API 厂商把缓存命中的输入价格压到 1/10表面看是让利实际是 agentic 负载的物理成本就是这么低——命中的部分不用算只是从缓存里读。没有这个定价agent 产品在经济上根本不成立。2. 成本结构倒转从盯输出到管输入Chat 时代大家盯着输出 token 贵 3~5 倍省钱靠少生成。Agentic 时代账单大头是输入历史被反复携带输入量随轮数近似平方级累积第 n 轮要重发前 n-1 轮的全部内容。省钱的主战场变成了上下文管理压缩历史compaction把跑完的中间过程摘要成几句话替换原始轨迹稳定前缀system prompt、工具定义、大文档放开头且逐字节不变保证缓存命中工具结果瘦身几千行日志先截取、摘要再入上下文别让一次cat毁掉整个预算。3. 延迟瓶颈转移串行次数成为新大头一次任务 几十次串行的 prefill decode上一轮的工具结果不出来下一轮无法开始。单次推理快 20% 在 Chat 里感知不强在 50 轮的 agent 任务里就是几分钟的差距。这解释了几件事的价值排序为什么变了投机解码压单步延迟身价倍增简单步骤路由给小模型成为标配架构能并行发起多个工具调用的模型比串行的模型在体感上快出一截。四、能力门槛为什么 Agentic 到 2024 年后才爆发工具调用 API 早就有了为什么 agent 产品直到近两年才真正可用因为 Agentic 循环对模型有三个 Chat 时代不苛求的硬要求可靠的结构化输出工具调用格式错一个括号整个循环就断长程目标保持几万 token 的轨迹里不忘记最初任务、不被中间结果带偏失败恢复工具报错时换路径重试而不是复读同一个错误动作。这三项本质上都是同一个数学问题——多步乘法单步成功率20 步任务成功率90%12%95%36%99%82%99.5%90%单步 95% 的模型做 Chat 绰绰有余人随时兜底做 20 步的 agent 任务却只有三分之一的完成率。Chat 到 Agentic 的跨越不是加了个工具调用 API而是单步可靠性跨过了让长链路乘积仍然可用的阈值。模型能力在及格线附近的微小提升会在任务成功率上呈现出突然能用了的相变——这就是 agent 爆发看起来很突然的原因。五、总结Chat 阶段模型是问答引擎人驱动循环。token 经济以输出为主比拼语言质量和知识Agentic 阶段模型是任务执行引擎环境反馈驱动循环。输出变成动作输入成为成本大头比拼规划、工具使用和长程可靠性对基础设施prefix caching、上下文管理、串行延迟优化从锦上添花变成核心竞争力对能力范式切换的引爆点不是新 API而是单步可靠性跨过多步乘法的可用阈值。一句话收束整个系列物理层没变——还是那套 prefill、decode 和 KV Cache变的是负载形态。Chat 是零售式的一问一答Agentic 是批发式的自主循环而批发时代的赢家是把缓存和上下文管得最好的那一个。