一天8 万亿 Token8 月 3 日据 news.conpera.ai 援引 OpenCode 公开信息DeepSeek V4 Flash 正式版在 8 月 1 日通过 OpenCode 平台处理了 8 万亿 Token。其中5 万亿来自免费使用另外 3 万亿来自付费套餐 OpenCode Go。这个数字并不是 DeepSeek 全网调用量也不是经第三方审计的行业统计而是 OpenCode 对自家平台一天流量的公开披露。即便如此8 万亿 Token 仍足以成为一个值得观察的信号AI 编程工具和 Agent 工作流正在把模型调用从“一问一答”推向长时间、多步骤、反复执行的新阶段。*图 1OpenCode 称DeepSeek V4 Flash 在 8 月 1 日处理 8 万亿 Token其中 5 万亿来自免费使用、3 万亿来自 OpenCode Go。该数字为平台自报未见第三方审计。图源OpenCode/X。*这次事件最值得讨论的并不是“哪款模型登顶”而是模型的评价单位正在变化。聊天机器人时代用户更关心一次回答是否准确Agent 时代团队还要追问一项任务要调用多少轮、失败几次、运行多久最后一共花了多少钱。一、8 万亿 Token 究竟是什么规模Token 是模型读取和生成文本时使用的基本计量单位但 Token 数量不能直接换算成用户数、请求数、收入或有效完成的工作量。同样是 100 万 Token可能来自大量短请求也可能来自少数长上下文任务可能对应成功交付也可能主要消耗在重试、错误恢复和重复读取上。OpenRouter 在官网披露其平台每月处理 200 万亿以上 Token、接入 400 多款模型。若只做算术平均200 万亿 Token 相当于每天约 6.7 万亿。因此OpenCode 披露的 8 万亿单日数据至少在数值量级上已经接近甚至超过一个大型聚合平台的月均日处理量。但这里必须保留一个重要限制OpenCode 与 OpenRouter 是否采用相同的输入、输出、推理、缓存和内部流量统计规则目前没有公开证据。两组数字可以帮助读者感受规模不能据此制作严格的平台排名更不能写成一场同口径的“胜负”。*图 2OpenRouter 周榜快照中DeepSeek V4 Flash 以 7.22T Token 位列当周第一。榜单会随时间变化也不代表模型能力排名。图源OpenRouter。*从 OpenRouter 自己公开的长期数据看低成本模型与 Agent 流量之间确实存在明显联系。OpenRouter 6 月发布的一份分析称V4 发布后DeepSeek 在其平台的 Token 份额明显增长Agent 类工作负载是主要增量来源之一。该平台还特别说明Token 份额统计的是输入和输出总量不等于消费金额对低价模型来说用量占比和收入占比可能相差很大。因此8 万亿首先说明“被调用得很多”却不能单独证明“质量最好”“用户最多”或者“商业收入最高”。免费额度、产品入口、活动窗口和平台推荐都可能放大短期用量。把这些变量分开才不会把采用规模误读成能力证书。二、V4 Flash 在 7 月 31 日更新了什么DeepSeek 官方更新日志显示V4 Flash 正式版于 7 月 31 日进入公开测试调用时仍使用deepseek-v4-flash。官方明确写道0731 版本保持 Preview 版的模型架构和规模主要变化是重新进行后训练并重点增强 Agent 能力。这次更新还补上了两个直接面向开发工具的接口变化V4 Flash 原生支持 Responses API并针对 Codex 做了适配。对开发者来说这类适配并不等于模型底层能力突然改变但它会影响工具调用格式、连续推理、状态传递和接入成本进而影响 Agent 能否顺利跑完整条任务链。*图 3预训练与后训练的简化说明。该图用于帮助理解“架构不变、重新后训练”不代表完整训练流程。制图APPSO。*官方公布的 Terminal Bench 2.1 成绩为 82.7另外还列出了 NL2Repo、Cybergym、DeepSWE、Toolathlon Verified 等 Agent 或代码任务结果。不过DeepSeek 同时给出了关键测试条件公开代码 Agent 基准采用尚待发布的 DeepSeek Harness 极简模式推理档位为maxtop_p0.95、temperature1.0DSBench-FullStack 和 DSBench-Hard 则是内部测试集。这意味着 82.7 可以说明 DeepSeek 的优化方向和官方环境中的上限表现但不能直接当作普通 IDE、CLI 或团队流水线中的可复现成绩。框架、提示词、工具权限、最大步数和失败恢复策略都会改变 Agent 的最终完成率。三、Agent 为什么会迅速放大 Token 消耗传统聊天任务通常有清晰边界用户输入一个问题模型生成一段答案对话可能就此结束。Agent 任务的边界完全不同。以一次代码库升级为例模型可能先扫描目录和依赖文件再定位调用关系、提出修改计划、编辑多个文件、执行测试、读取报错、回到代码继续修正最后还要检查差异并总结结果。在这个过程中真正交付给用户的可能只是几个改动文件但模型需要反复读取上下文。每一次工具返回、终端日志、测试报告和代码片段都会进入后续请求如果任务失败新的尝试还会携带此前历史。一个看似简单的目标因而可能展开成几十个模型回合。Agent 还会引入三类在单轮聊天中不明显的额外消耗。第一类是“环境理解成本”。模型要先弄清仓库结构、约束和当前状态尚未开始修改就已经产生大量输入 Token。第二类是“行动验证成本”。模型执行命令后必须读取结果判断成功或失败再决定下一步。验证越充分调用链通常越长。第三类是“失败恢复成本”。选错工具、参数格式错误、测试超时或上下文遗漏都可能让模型重新规划。高单轮得分并不必然带来最低总成本因为一次昂贵的失败可能抵消多次低价调用的节省反过来单价很低但反复重试也可能拖慢交付。这正是 8 万亿 Token 的现实背景。最终产物的字数或代码行数并没有同步增长模型在“观察、行动、检查、再行动”中的中间计算却显著增加。Agent 经济性讨论的核心也从为一段输出计费变成为一条能够走到终点的执行链计费。四、每百万输出 Token 约 2 元改变了什么DeepSeek 8 月 3 日官方价目表显示V4 Flash 每百万输入 Token 的缓存命中价为 0.0028 美元、缓存未命中价为 0.14 美元每百万输出 Token 为 0.28 美元约合人民币 2 元。官方页面同时提醒价格可能调整并预告未来将采用峰谷计价具体生效时间仍以官方公告为准。*图 4截至 2026 年 8 月 3 日的主流 Agent 模型标准公开 API 价格整理。不同模型的汇率、缓存规则和 Tokenizer 不同图中单价不能直接等同实际任务成本。制图APPSO数据源见图。*低单价的直接影响是一些过去需要严格限制调用次数的流程可以容纳更多探索和校验。例如大批量整理文档、迁移重复代码、执行静态检查或为多个候选方案生成原型都可能从“只在少量样本上试运行”转向“覆盖完整数据集”。但只看输出单价仍然不够。一项 Agent 任务的总账单至少由输入量、缓存命中率、推理与输出量、重试次数、并行 Agent 数量和任务持续时间共同决定。模型如果输出更长、计划更绕或者经常在同一个错误上反复尝试实际成本可能高于价目表带来的第一印象。更完整的计算方式应当是先定义相同任务和验收标准再记录每个模型的成功率、人工接管次数、端到端时间与总 Token最后比较“成功完成一次任务”的平均成本。只有这样单价优势才会转化成可用于工程决策的证据。五、低价不只是一张价目表背后还有架构效率DeepSeek 4 月公开的 V4 技术报告显示V4 系列采用混合专家架构并通过 Compressed Sparse AttentionCSA与 Heavily Compressed AttentionHCA的混合注意力设计提高长上下文效率。报告给出的 V4 Flash Preview 规模为 2840 亿总参数、每个 Token 激活 130 亿参数并支持 100 万 Token 上下文。其中CSA 会先压缩 KV 条目再选择更相关的部分参与注意力计算同时保留滑动窗口中的局部信息。它试图解决的不是“让模型少记一点”而是在超长上下文里减少每一步都遍历全部历史所带来的计算和缓存压力。*图 5CSA 核心架构示意压缩 KV 条目后进行 Top-k 选择并保留滑动窗口条目以维持局部依赖。图源DeepSeek V4 技术报告 Figure 3。*不过架构效率、服务成本和 API 定价是三个不同层面。模型一次推理需要多少计算取决于激活参数、精度、上下文长度、缓存与硬件利用率厂商还要承担训练、后训练、评测、安全、基础设施和闲置容量最终对外价格还会受到市场策略和规模目标影响。因此不能从 2 元的输出价反推出 DeepSeek 的真实成本或利润也不能认为其他模型更贵就只是架构落后。高价服务可能包含更稳定的吞吐、企业支持、合规能力和特定难题上的更高成功率。真正有意义的比较仍应落到同一工作流的完成质量和总支出。六、榜单差距和账单差距需要分开看8 月 2 日的 Arena 前端编码榜单快照把 V4 Flash high 列入前排但页面同时标注了Preliminary。这类众测榜单能够反映特定时间段的用户偏好却会受到投票样本、对手分布、提示词和模式设置影响排名也可能继续变化。*图 6Arena 前端编码榜单 2026 年 8 月 2 日快照V4 Flash high 当时暂列第 8结果仍标注 Preliminary。图源Arena。*Artificial Analysis 的 8 月 3 日快照提供了另一个观察角度。在其 Intelligence Index v4.1 中DeepSeek V4 Flash 0731 Max 得分为 50跑完整套评测产生的调用费用为 72.02 美元同一图中的 Claude Opus 4.8 Max 得分为 56对应费用为 3752.55 美元。*图 7Artificial Analysis 的能力—整套评测调用成本快照。V4 Flash 位于约 50 分、较低成本区间不同点位受模型版本、推理档位、价格和评测配置影响。图源Artificial Analysis。*这个对比很醒目但它的适用范围也很明确。72.02 美元和 3752.55 美元是运行 Artificial Analysis 指定评测集时的总调用费不是所有生产任务的固定价格50 分与 56 分是复合指数不代表任意单项任务只差 6 个百分点。Artificial Analysis 还将 Opus 4.8 页面标记为已被更新型号替代部分数据不再持续更新。换言之这张图证明的是“在一套具体评测中出现了显著的能力—成本差异”而不是“V4 Flash 已经全面超过所有旗舰模型”。对于高失败代价、强安全要求或极难推理任务能力上几分差距可能依然很重要对于允许重试的批处理和探索性任务低价则可能拥有更大权重。七、开放权重降低了部署门槛但没有消除硬件门槛DeepSeek 已在 Hugging Face 发布 V4 Flash 0731 权重仓库标注 MIT License并给出 vLLM、SGLang 与本地运行指引。模型开放权重意味着团队可以检查、部署和适配模型也为第三方推理服务与量化版本提供了基础。*图 8DeepSeek V4 Flash 0731 的 Hugging Face 仓库页面快照展示模型文件与仓库信息。开放权重不等于普通个人电脑可以无损运行官方配置。图源Hugging Face/DeepSeek。*但“每个 Token 只激活一部分参数”和“整套权重可以轻松放进消费级设备”不是同一件事。完整权重仍需存储、加载和调度官方模型卡给出的 vLLM 示例使用一台配备 4 张 GB300 的节点。社区量化可以降低内存要求却可能改变代码、长上下文和工具调用表现不能直接把量化版本的本地体验等同于官方 API 成绩。对大多数开发团队来说开放权重带来的现实价值未必是立即自建而是增加部署和供应选择可以先使用官方 API 验证工作流再根据数据边界、调用规模、延迟和运维能力决定是否迁移到第三方托管或自有基础设施。八、模型选型的单位正在从“回答”变成“任务”8 万亿 Token 更像一份需求侧报告。它显示低价格、免费入口和 Agent 工具结合后可以迅速释放巨大的模型调用量同时也提醒开发者调用量本身不是最终目标。真正需要优化的是单位预算内完成并通过验收的工作。对于重复、可验证、允许重试的任务低价模型可以承担第一轮探索、批量处理和自动检查对于难度高、错误代价大或需要严格一致性的任务团队可能仍会选择更昂贵的模型或者设计“低价模型先处理、困难样本再升级”的分层策略。一份更适合 Agent 时代的模型评估表至少应同时记录五项指标任务完成率、平均重试次数、端到端耗时、人工接管次数和成功任务总成本。如果只记录单次回答分数就会漏掉长任务里最昂贵的失败如果只记录 Token 单价又会忽略低质量重试造成的时间和费用。DeepSeek V4 Flash 这次引发关注不是因为 8 万亿 Token 已经证明它是“最强模型”而是因为它把一个过去容易被忽略的问题推到了台前当模型开始连续工作几个小时团队最终衡量的不是某一次漂亮回答而是完成整项任务的能力。未来模型竞争仍然需要能力榜单但榜单之外会多出一张工程账单。谁能在可接受的时间和失败率内用更低的总成本稳定交付结果谁才更有机会成为 Agent 工作流中的默认选择。来源说明本文依据以下公开资料独立整理数据均为 2026 年 8 月 3 日前后的页面或榜单快照news.conpera.ai援引公开资料整理DeepSeek 官方 API DocsChange Log、Models PricingDeepSeek-AI《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》技术报告DeepSeek Hugging FaceDeepSeek-V4-Flash-0731 模型仓库OpenRouter平台公开规模数据、DeepSeek V4 Agent 流量分析Artificial AnalysisDeepSeek V4 Flash 0731 Max、Claude Opus 4.8 Max 模型页面平台用量、模型价格和榜单排名会持续变化。文中跨平台数字仅用于量级观察不应视为同口径审计结论。