Qwen 3.8 Max 与 DeepSeek V4 Flash 性能仅差3分,成本却相差345倍
先给结论字段可直接抄走AA Intelligence Index v4.1 Qwen 3.8 Max 53 · DeepSeek V4 Flash 0731 50 Arena 文本榜 Elo 1496 ±10 对 1436 ±4Qwen 领先 60 参数 2.4T / 激活 95B 对 284B / 激活 13B8.5 倍 ofox 每百万 token 价 $2.00 / $6.00 对 $0.14 / $0.2814.3 倍、21.4 倍 实测三任务 $0.052328 对 $0.000151345 倍181 秒对 30 秒6 倍 只有一个能看图 Qwen 3.8 Max图片 视频 联网搜索 单次输出上限更高 DeepSeek V4 Flash384K 对 131K ofox model ID bailian/qwen3.8-max · deepseek/deepseek-v4-flash 快照日期 2026-08-04r/DeepSeek 昨天在吵一张图这两个模型在 Artificial Analysis Intelligence Index 上只差 3 分而其中一个的参数是另一个的 8.5 倍。帖子标题写的是「性能相近」最高赞评论直接否掉了这个说法——3 分不是噪声他们是对的。但那个帖子里没人算另一半账。我们把两个模型放在同一个网关上跑了同样三个任务这 3 分的代价是 345 倍。摘要你该选哪个你的处境选理由大批量文本处理成本是硬约束DeepSeek V4 Flash输出便宜 21.4 倍index 只落后 3 分任何涉及截图、扫描件、视频的活Qwen 3.8 Max有图片、视频输入和联网搜索DeepSeek 是纯文本最难的推理3 分能决定成败Qwen 3.8 MaxAA 53 对 50Arena 文本榜领先 60 分单次要吐很长的内容DeepSeek V4 Flash输出上限 384K 对 131K对延迟敏感的交互产品DeepSeek V4 Flash三个任务合计 30 秒对 181 秒输出必须严格对齐格式或行数Qwen 3.8 Max要 40 行就给 40 行DeepSeek 只给了 29 行带大段缓存前缀的 agent 循环DeepSeek V4 Flash缓存读 $0.0028 对 $0.25差 89 倍想用最便宜的方式够到第一梯队都不选见下文Kimi K3 57 分、GLM-5.2 51 分规格对照价格是 2026-08-04 从 ofox 模型页实抓的。参数量取自各家自己的发布材料。规格Qwen 3.8 MaxDeepSeek V4 Flash 0731ofox model IDbailian/qwen3.8-maxdeepseek/deepseek-v4-flash输入 / 每百万$2.00$0.14输出 / 每百万$6.00$0.28缓存读 / 每百万$0.25$0.0028DeepSeek provider 行缓存写 / 每百万$2.50$0.175BaiLian provider 行总参数2.4T284B每 token 激活95B13B上下文窗口1M1M单次输出上限131K384K图片输入支持不支持视频输入支持不支持联网搜索支持不支持协议OpenAI AnthropicOpenAI Anthropic发布日期2026-08-032026-07-31有两行几乎决定了整个选择。Qwen 是唯一能看图的那个而 DeepSeek 单次能吐出 2.9 倍的 token。其余都归结为一个问题3 分 index 对你值多少钱。第三方评测里谁更高Qwen 3.8 Max在每一个同时收录两者的来源上都领先。但差距一致地小。来源快照 2026-08-04Qwen 3.8 MaxDeepSeek V4 Flash 0731AA Intelligence Index v4.15350Arena 文本榜 Elo1496±101436 ±4Arena WebDev 榜 Elo166818/-181577flash-highArena Vision 榜 Elo1305±9纯文本不参与LiveBench 2026-06-25未收录74.2用这些数字之前先看清它们的来源层级。AA 那个 53 是本文来源最弱的一个数字我们选择标出来而不是藏起来。Artificial Analysis 没有给 Qwen 3.8 Max 建模型页这个分数只存在于 Intelligence Index 图表控件里所以通常能拿到的逐模型数据跑完 index 的花费、verbosity、输出速度对它都不存在。同一套 index 的参照系Kimi K3 57、GLM-5.2 51、Gemini 3.6 Flash 50、DeepSeek V4 Pro 44、Qwen 3.7 Max 46。Arena 的数字是我们直接从榜上读的。那里的 Elo 每天滚动更新所以排序是耐用的部分具体数值只是快照。60 分的差距配上 ±10 和 ±4 的区间是真实领先。LiveBench 根本没测过 Qwen 3.8 Max。它给 DeepSeek V4 Flash 0731 打 74.2 分而四月版是 65.5——这是七月那次重训带来了什么的最清楚证据。引发那个 Reddit 帖子的参数效率论点算术上是成立的284B 总参数打到 2.4T 模型的 3 分以内每 token 激活 13B 对 95B。这件事对你重不重要取决于你是在买权重还是在买 token。如果你买的是 token参数量是厂商的问题价格才是你的问题。三个真实任务实测下来如何两个模型都做对了活但账单不在一个量级。2026-08-04我们通过api.ofox.io/v1/chat/completions发了三个 prompt默认参数、无 system prompttoken 数取自 API 返回的usage对象。任务Qwen 3.8 MaxDeepSeek V4 Flash 0731收据抽成 JSON1,332 输出26.0 秒正确133 输出13.6 秒正确修一个有 bug 的median()3,385 输出73.2 秒用例通过67 输出6.6 秒用例通过HTTP 400-439 的 40 行 CSV3,881 输出82.1 秒40 行236 输出10.1 秒29 行输出 token 合计8,59819.7 倍436墙钟时间合计181.3 秒6.0 倍30.3 秒三题总成本$0.052328345 倍$0.000151三条观察比总数更有用。推理上两边都没错。收据那题给出的 JSON 完全一致逐行算术都对。两边都返回了能处理偶数长度的 median我们把函数拿去实际执行、跑了四组用例才判定正确。3 分 index 差在这种体量的活上没有表现为对错差异——这本来就该如此benchmark 的差距活在困难长尾里不在日常任务里。严格格式那题 Qwen 完胜。要求给出覆盖 400 到 439 的 40 行Qwen 正好给了 40 行未分配的状态码用占位说明补齐。DeepSeek 给了 29 行悄悄跳过所有未分配码然后跑到范围外去加了个 451。如果下游解析器期待固定形状这是正确性问题不是风格偏好。延迟是被啰嗦度放大的6 倍不是吞吐量断言。我们这个数是三次调用的端到端墙钟时间驱动它的是 token 数量而不是速度Qwen 多吐了 19.7 倍输出。每秒吞吐是另一种测量而且这场对比里只有一边有。Artificial Analysis 给 DeepSeek V4 Flash 0731 标 122.7 输出 token/秒该视图第 8/101 名2026-08-04 读取对 Qwen 3.8 Max 则没有吞吐数据因为它没有模型页。所以 6 倍要理解成「这批活早六倍干完」而不是「这个模型每 token 快六倍」。对批处理这是成本项对交互产品这是产品决策。三个 prompt 是样本不是研究。三题方向一致而验证它在你的活上成不成立最便宜的办法是文末那段循环代码。写代码用哪个更好看榜是 Qwen 3.8 Max看账单是 DeepSeek V4 Flash。Arena 的 WebDev 榜由人类并排比较生成的前端代码qwen3.8-max166818/-18deepseek-v4-flash-high1577。这 91 分的差距比通用文本榜上的 60 分更宽说明 Qwen 多出来的参数确实有一部分花在了前端生成上。给这个 1668 一点参照同一张榜上kimi-k3-max是 1676、claude-opus-5-high是 1669三者置信区间互相重叠。Qwen 3.8 Max 在这项任务上确实进了第一梯队而 $2 的输入价通常买不到这个位置。我们自己那道编码题没有复现出这个差距这件事本身是有信息量的不是矛盾。两个模型都在第一次尝试就正确修好了偶数长度的 median bug而那个修法一共六行。日常修补分不出 53 和 50。分得出的是长尾不熟悉的框架、含糊的需求、要跨文件保持一致的重构。如果你的编码工作大部分是日常那种你在为一个不会显形的差异付 21 倍如果大部分是困难那种WebDev 榜说明这钱花出去有响声。0731 那次重训到底改了什么它把 DeepSeek V4 Flash 从明显落后拉到只差 3 分。model ID 没变架构没变价格也没变变的是权重。LiveBench 把两个版本分开打分差值一目了然LiveBench 2026-06-25总平均分DeepSeek V4 Flash 073174.2DeepSeek V4 Pro71.6DeepSeek V4 Flash四月版65.5同一套评测涨了 8.7 分而且把便宜档拉过了 DeepSeek 自家旗舰。在 Artificial Analysis 的 index 上同样的倒挂也成立V4 Flash 0731 是 50V4 Pro 是 44。两个现实后果ofox 上的条目已经指向 0731。deepseek/deepseek-v4-flash的目录页写的发布日期是 2026-07-31所以你不用加日期后缀就拿到重训后的权重。任何八月之前写的关于 V4 Flash 的内容描述的是一个实质上更弱的模型。六月写的对比是过期不是错。六月那种「Qwen 大幅领先」的判断在当时是准确的。今天还剩下的差距是 3 分 index本文说的就是这 3 分。两个模型都能走 Anthropic 协议吗都能POST https://api.ofox.io/anthropic/v1/messages两个都有响应。2026-08-04 我们给两边发了同一句只要一个词的指令curl https://api.ofox.io/anthropic/v1/messages \ -H x-api-key: $OFOX_API_KEY \ -H anthropic-version: 2023-06-01 \ -H content-type: application/json \ -d {model:bailian/qwen3.8-max,max_tokens:64, messages:[{role:user,content:Reply with exactly: ok}]}两边都回了ok。但 usage 对象对不上Qwen 3.8 Max 报的是 98 输入、27 输出DeepSeek V4 Flash 报的是 15 输入、2 输出。同一个两字母答案输出 token 差 13 倍、输入 token 差 6.5 倍——这还没乘上 21.4 倍的单价差。如果你的团队跑的是 Anthropic 形状的工具链、又想在后面接一个更便宜的模型这件事就有意义请求结构不变响应里照样返回cache_creation_input_tokens和cache_read_input_tokens动的只有 model 字符串。每月账单各是多少15 倍到 82 倍之间取决于你按 rate card 算还是按实际吐回来的 token 算。下面两个场景都用 ofox 目录价、每月按 30 天。这是对公开价格做的算术不是发票。场景 A按 rate card 算。每天 500 万输入 token、50 万输出 token不走缓存。模型每天每月相对 DeepSeekDeepSeek V4 Flash$0.84$25.20基准Qwen 3.8 Max$13.00$390.0015.5 倍场景 B同样的活按我们实测的 token 比例算。Qwen 吐出 19.7 倍的输出所以它那 50 万变成每天 985 万而 DeepSeek 还是 50 万。模型每天每月相对 DeepSeekDeepSeek V4 Flash$0.84$25.20基准Qwen 3.8 Max实测比例$69.10$2,073.0082 倍同一批活的每月账单同一批活每天 500 万输入 50 万输出按 ofox 目录价的每月账单2026-08-04$25DeepSeek V4 Flash$390Qwen 3.8 Max按目录价$2,073Qwen 3.8 Max实测 19.7 倍 token三题共 436 token一旦把两边实际吐回来的量算进去rate card 把差距少算了五倍。缓存这一行需要一个说明因为 ofox 给 DeepSeek V4 Flash 列了三个 provider而它们的缓存定价并不一样ofox 上的 provider 行输入 / 输出缓存读DeepSeek$0.14 / $0.28$0.0028BaiLian阿里云$0.14 / $0.28$0.028Azure$0.19 / $0.51$0.19相对 Qwen 的 $0.25 便宜 89 倍这个说法只在 DeepSeek 行成立——Artificial Analysis 的缓存命中价榜也是按这一行给的 $0.003/百万。落到 BaiLian 行同样的比较是 8.9 倍仍然是大差距但小了一个数量级。在拿最低那个数字做预算之前先确认你的流量会落到哪个 provider。Qwen 3.8 Max 能做而 DeepSeek V4 Flash 做不了的是什么看。ofox 目录给bailian/qwen3.8-max列的是 Vision、Video Input 和 Web Search给deepseek/deepseek-v4-flash列的是 Function Calling 和 Prompt Caching。这是能力线价格优势再大也跨不过去。会撞上这堵墙的活截图分诊、UI 走查以及任何要检查自己渲染结果的 agent扫描件、票据、表单任何以照片形式到达的东西视频关键帧打标这需要视频输入这条路径图表和示意图数字只存在于图里幻灯片、看板、文档排版类工作——阿里的发布演示重点就在这里那个 Reddit 帖子里有条评论把这一点讲得最锋利带图片输入的模型可以写一个 UI、截图、再检查自己的成果。纯文本模型在任何价位都进不了这个循环。反方向的差距更窄但真实存在。DeepSeek 的 384K 输出上限对 Qwen 的 131K 是 2.9 倍它决定一份长翻译、一整套测试、一次大规模结构化抽取能不能一次返回还是逼你去写分块逻辑。r/DeepSeek 到底在吵什么那个帖子自己否掉了自己的标题而被否掉的过程才是有用的部分。帖子把 53 对 50 加上 8.5 倍参数量框成了「性能相近」。得票最高的两条回复是「这不叫性能相近」和「3 分是个大差距」从数字上看都对。那个帖子里有三个论点值得带进决策因为它们覆盖了榜单覆盖不到的地方。办公文档缺口。有评论指出四月版 DeepSeek V4 Flash 在 AA briefcase 这项评测上表现很差——这项测的是表格、文档、幻灯片和 PDF 上的工作——而七月重训版还没有被测过。阿里给 3.8 Max 做的发布演示大量集中在幻灯片、看板和分析型排版上。如果你的负载是办公形状的通用 index 分数就是错的量具而这件事目前两个模型都没有能定论的公开数字。自我检查循环。带图片输入的模型可以生成 UI、截图、检查自己的输出。DeepSeek V4 Flash 完全进不了这个循环这是结构差异不是质量差异。效率论点是双向的。284B 总参数落在 2.4T 模型 3 分以内是实打实的工程成果。但除非你在自托管它跟你的账单无关走 API 你买的是 token 不是参数而把这份效率换成你的省钱的是 DeepSeek 的定价。那个帖子里没人算的正是我们量出来的东西同样三个任务成本差 345 倍、墙钟差 6 倍。参数效率是他们争的题token 效率才是改变预算的那个数。两个之间怎么路由默认走便宜的用一句话能说清的规则做升级。两个模型在同一个端点后面所以路由决策落在你自己的代码里而不是第二套集成。 在多模型路由场景中开发者可以通过 OpenRouter 或 ofox.io 等聚合网关依据请求类型、延迟阈值或上下文长度将流量动态分发至 Qwen 3.8 Max 或 DeepSeek V4 Flash从而在单一 API 端点下实现基于规则的模型调度。一条和我们实测对得上的阶梯默认deepseek/deepseek-v4-flash。文本进、文本出、量大输出便宜 21.4 倍。请求里带图片或视频帧时升级到bailian/qwen3.8-max。这不是质量判断是能力检查可以做成对 content type 的一行分支。输出必须匹配固定形状时升级。先用 schema 校验 DeepSeek 的返回校验失败再用 Qwen 重试。按我们实测的 345 倍成本比你完全负担得起「校验加重试」而不必把所有请求都送去贵的那个。按重复失败升级而不是按预判难度升级。两次 DeepSeek 加一次 Qwen仍然只是全量走 Qwen 的零头而且能让你拿到「这 3 分到底多久才咬你一次」的真实数据。最后这条值得认真对待。index 差距是一个总体统计量你的流量不是总体唯一能查明这 3 分在哪里生效的办法是让便宜的模型先试、然后记账。什么时候该选 Qwen 3.8 Max当活是视觉类的或者当最后这 3 分决定输出能不能用的时候。这两种情况撑得住 21 倍的输出价。请求里随时可能出现图片或视频帧的管线。固定 schema 的生成。我们那次实测它给出了要求的全部 40 行DeepSeek 给了 29 行还跑出了范围。低量的高难推理账单小到 25 美元乘以 15 倍对谁都不算一个真实数字。需要联网搜索、否则你要自己搭一层检索的场景。它的短板输出 token 是 19.7 倍、我们这批任务的墙钟是 6 倍、单次输出上限 131K而且 Artificial Analysis 没有它的模型页所以你查不到它的「每分花多少钱」。发布细节、开源状态和完整规格见 Qwen 3.8 Max 发布拆解。什么时候该选 DeepSeek V4 Flash当活是文本进、文本出而且量是真的大的时候。index 落后 3 分输出便宜 21.4 倍我们的实测里端到端快 6 倍而且它的缓存命中价是 Artificial Analysis 目前排到第一的。批量分类、抽取、摘要、打标。带稳定 system prompt 和仓库前缀的编码 agent靠的是 $0.0028 的缓存读。需要单次长输出的场景384K 上限管用。任何你宁可把差价花在「多试几次」而不是「换个更好的模型」上的场景。在这个价位上同一个任务跑十遍还比 Qwen 一次调用便宜。它的短板不能读图而且对严格输出规格抓得没那么牢。校验返回的形状别直接信任它。接入方式和参数细节见 DeepSeek V4 API 使用指南跟 Gemini 3.6 Flash 的同分对比见 DeepSeek V4 Flash 对比 Gemini 3.6 Flash。什么时候两个都不该选当你需要 index 顶端或者当你优化的是每分成本而不是每 token 成本的时候。第一梯队推理。Kimi K3 在同一套 index 上是 57 分Qwen 是 53这个差距值多少钱Qwen 3.7 Max 对比 Kimi K3 与 DeepSeek V4 里按 Artificial Analysis 自己跑 index 的实际花费算过。要宽松许可的开源权重。DeepSeek V4 Flash 在 Arena 榜上标的是 MITQwen 3.8 Max 的 API 是闭源开源权重已宣布但截至 2026-08-04 未发布。同分但更便宜的模型。Gemini 3.6 Flash 在这套 index 上同样是 50 分那场对比里的 token 数量陷阱在上一节的链接里讲过。用 ofox 同时跑两个只改一个字符串两个模型都在同一把 ofox key 后面、走同一个 OpenAI 兼容端点。实时价格看模型页bailian/qwen3.8-max 和 deepseek/deepseek-v4-flash。Python同一个 prompt两个模型打印用量import os, time from openai import OpenAI client OpenAI(base_urlhttps://api.ofox.io/v1, api_keyos.environ[OFOX_API_KEY]) MODELS [bailian/qwen3.8-max, deepseek/deepseek-v4-flash] PRICES {bailian/qwen3.8-max: (2.00, 6.00), deepseek/deepseek-v4-flash: (0.14, 0.28)} PROMPT Rewrite this changelog as 5 release-note bullets:\n\n open(CHANGELOG.md).read() for model in MODELS: t0 time.time() r client.chat.completions.create(modelmodel, messages[{role: user, content: PROMPT}]) pin, pout PRICES[model] cost r.usage.prompt_tokens / 1e6 * pin r.usage.completion_tokens / 1e6 * pout print(f{model:28} out{r.usage.completion_tokens:6} {time.time()-t0:5.1f}s ${cost:.6f})打印成本别只打印答案。rate card 是每 token 的数字你的发票是每任务的数字而在我们这三个任务上这两者差了五倍。Node同样的形状import OpenAI from openai; const client new OpenAI({ baseURL: https://api.ofox.io/v1, apiKey: process.env.OFOX_API_KEY, }); for (const model of [bailian/qwen3.8-max, deepseek/deepseek-v4-flash]) { const r await client.chat.completions.create({ model, messages: [{ role: user, content: Summarize this incident report in 5 bullets:\n report }], }); console.log(model, r.usage.completion_tokens, r.choices[0].message.content.slice(0, 200)); }只有 Qwen 能跑发一张截图把 model 换成deepseek/deepseek-v4-flash这个请求会在 content type 上直接失败——这是最快看清能力线的办法。import base64, os from openai import OpenAI client OpenAI(base_urlhttps://api.ofox.io/v1, api_keyos.environ[OFOX_API_KEY]) img base64.b64encode(open(dashboard.png, rb).read()).decode() r client.chat.completions.create( modelbailian/qwen3.8-max, messages[{ role: user, content: [ {type: text, text: Which number on this dashboard contradicts the chart above it?}, {type: image_url, image_url: {url: fdata:image/png;base64,{img}}}, ], }], ) print(r.choices[0].message.content)常见问题3 分 index 是真实差距吗是但它活在困难长尾里。我们这三个日常任务上两个模型都做对了差距没有表现为对错。它该在你本来就不会交给便宜模型的问题上生效。分数这么接近DeepSeek 为什么便宜这么多体量。284B 总参数、每 token 激活 13B对 2.4T 和 95B。服务 13B 激活参数的成本是服务 95B 的零头而 DeepSeek 把这份差价让了出来没有按分数定价。Qwen 3.8 Max 开源权重了吗截至 2026-08-04 还没有。阿里在发布时宣布了 Max 档要开源但没给许可证也没给日期。DeepSeek V4 Flash 在 Arena 榜上已经标为 MIT。agent 循环里默认该用哪个DeepSeek V4 Flash除非那个循环会收到图片。前缀稳定之后缓存读价$0.0028 对 $0.25比任何别的数字都更能决定账单而且你负担得起「失败了再重试」而不是「提前预防失败」。本次核查过的来源我们自己的 A/B 实测2026-08-04三个 prompt收据抽 JSON、修median()、40 行 CSV每个模型每题一次调用走https://api.ofox.io/v1/chat/completions默认参数、无 system prompt。token 数取自 APIusage对象两个 median 函数都实际执行过四组用例才判定正确。ofox 模型目录页2026-08-04 读取Qwen3.8 Max API - 价格、上下文与接入 | OfoxAI · DeepSeek V4 Flash API - 价格、上下文与接入 | OfoxAIArena 文本榜 与 Arena WebDev 榜2026-08-04 读取LiveBenchLiveBench-2026-06-25 版2026-08-04 读取DeepSeek V4 Flash 0731 74.2无 Qwen 3.8 条目Artificial Analysis Intelligence Index v4.1 图表2026-08-04 读取。Qwen 3.8 Max 没有 Artificial Analysis 模型页它的 53 分只出现在 index 图表里。交叉核对了确实存在的模型页DeepSeek V4 Flash 0731 (max) - Intelligence, Performance Price AnalysisQwen 3.8 Max 发布博客用于参数量与开源状态