2026年LLM API服务商四大类型解析与价格对比指南
摘要 2026 年买 LLM token 有四种方式它们不是在同一个维度上竞争。原生 API 卖的是官方标价和第零日功能。开放权重托管商卖的是廉价 tokenTogether 上的 gpt-oss-20B 低至 $0.05/M。路由器卖的是跨多家供应商的一把密钥通常按标价收费成本被挪到了付款手续费上OpenRouter 的银行卡充值收 5.5%。云平台卖的是采购流程并为此收费合作云的区域端点比全球端点贵 10%Vertex 的优先档是标准档的 1.8x。同样一次 Claude Opus 5 调用在四种里的三种上都花 $5/$25 每 1M token。真正不同的是围绕 token 的一切。摘要你该从哪种类型购买你的情况从哪买为什么你需要一个刚发布那周的模型原生 API合作云和路由器在新 SKU 和新功能上都会滞后你的账单被某一个开放权重模型主导开放权重托管商先按 token 用无服务器等把 GPU 跑满后再上专属 GPU你调用四家供应商但想要一张发票路由器一把密钥、一个余额需要的话还能统一一种线路格式财务已经批准了一份云承诺额度云平台支出落到一张已经存在的发票上这往往就是全部理由你需要小模型上的亚秒级首 token开放权重托管商Groq 公布其llama-3.1-8b-instant达 560 tok/s、openai/gpt-oss-20b达 1000 tok/s按其自家价格你想要一条无需第二份合同的备用路由路由器故障转移就是产品本身不是你要自己搭的功能你的数据必须留在同一个法律辖区云平台或原生数据驻留两者都提供两者都为此收约 10%你还在决定用哪个模型路由器换一个模型 ID 比换一套集成便宜有两种情况可以到这里就停止阅读。如果你每月在 token 上花不到约 $200就直接从做出你喜欢的模型的那家实验室购买等数字变得有意思时再回来看下面的每一项优化都不值得你花上一个下午去折腾。如果你已经把生产流量跑在两家以上供应商上直接跳到隐藏成本表格因为你的钱实际上就花在那里。四种类型逐一对照有用的区分不是品牌。而是谁在跑 GPU、谁在定价、谁在开发票。原生 API开放权重托管商路由器 / 聚合器云平台举例OpenAI、Anthropic、Google、DeepSeekTogether、Fireworks、GroqOpenRouter、ofoxBedrock、Vertex AI、Microsoft Foundry是否跑推理是是否是或转售实验室模型目录一家实验室的模型仅开放权重多家实验室100 个 ID云平台的合作方清单是否定价是这就是标价是具竞争性大体照抄标价标价加平台附加费新模型第零日可用是对开放权重是通常几天内常常要几周认证Bearer tokenBearer tokenBearer tokenIAM 角色、SigV4、服务账户计费银行卡或发票按实验室银行卡按托管商一个预付余额你现有的云账单跨供应商故障转移你自己搭你自己搭内置在同一云的目录内最擅长最新功能、最高上限每 token 成本广度与切换成本采购与合规下面的全部内容就是把这张表展开来讲附上我能核实到的数字。类型一原生 API从训练出该模型的那家实验室购买是默认选项而且对大多数团队来说它保持正确答案的时间比网上说的要长。你能拿到三样其他地方无法可靠提供的东西。发布当天就有新模型。只有第一方才有的功能比如 Anthropic 的 fast mode其定价文档写明该功能仅在 Claude API 上提供合作方运营的平台上没有。以及最高的公布速率上限因为其他每一条路由的产能都是从你原本会去买产能的同一个地方买来的。以下是三大实验室的实际收费每 1M token核查于 2026-08-02。模型输入缓存输入输出Claude Fable 5$10$1$50Claude Opus 5$5$0.50$25Claude Sonnet 5$2到 Aug 31 为止之后 $3$0.20$10之后 $15Claude Haiku 4.5$1$0.10$5gpt-5.6-sol$5$0.50$30gpt-5.6-terra$2$0.20$12gpt-5.6-luna$0.20$0.02$1.20gpt-5.5$5$0.50$30Gemini 3.6 Flash$1.50$0.15$7.50Gemini 3.5 Flash-Lite$0.30$0.03$2.50在使用这些数字前有两点说明。OpenAI 分别公布短上下文和长上下文两列上面的数字是短上下文档。长上下文不是一个统一的倍数gpt-5.6-luna从 $0.20/$1.20 变成 $0.40/$1.80也就是输入翻倍、输出上涨一半。Gemini 那些数字是 Vertex 的 Global 档该系列中有几个模型对非全球端点定价高 10%Gemini 3.5 Flash 为 $1.65/$9.90 对比 $1.50/$9.00。那张表里有两样东西比头条价格更值钱。这些实验室每一家都对批处理工作在输入和输出上各打 50% 折扣只要你的工作负载有任何部分可以等这就是可用的最大杠杆。而且缓存输入在这三家上都按新鲜输入的十分之一计费所以一个拥有稳定系统提示词的智能体实际支付的只是标价所暗示金额的一小部分。我们在 Anthropic 与 OpenAI 提示词缓存对比 中详细算过这笔账。走原生路线的代价是行政上的而且它会悄悄累积。四家实验室意味着四把密钥、四个仪表盘、四段计费关系以及四套毫无共通词汇的速率限制规则手册。我们在 LLM API 速率限制对比 中把其中五套规则手册并排比较过它们几乎在所有事情上都不一致包括「请求」到底是什么。如果你已经标准化在某一家实验室上、需要发布当天的访问权或者你的量大到想跟某个人直接谈商务那就走原生路线。当你还在评估模型、想在某家实验室出问题的那个下午有个地方故障转移过去或者你手上攥着四把密钥、财务团队开始过问它们时它就不再舒服了。类型二开放权重推理托管商这个类别之所以存在是因为有些模型权重是公开的这意味着价格由 GPU 经济学决定而不是由拥有模型的那个人决定。这里的竞争是真实的价格也体现了这一点。模型托管商输入 /1M输出 /1Mgpt-oss-20BTogether$0.05$0.20gpt-oss-20BGroqopenai/gpt-oss-20b$0.075$0.30LFM2.5-8B-A1BTogether$0.03$0.12gpt-oss-120BTogether$0.15$0.60gpt-oss-120BGroqopenai/gpt-oss-120b$0.15$0.60Qwen3.5-397B-A17BTogether$0.60$3.60Llama 3.3 70BTogether$1.04$1.04Llama 3.3 70BGroqllama-3.3-70b-versatile$0.59$0.79DeepSeek V4 FlashDeepSeek原生$0.14$0.28价格取自各供应商的定价页面公布内容核查于 2026-08-02。按行成对来读这张表因为重复的模型名正是重点所在。同样的公布权重你付多少取决于它们跑在谁的集群上。gpt-oss-20B 上 Together 更便宜$0.05/$0.20 对 $0.075/$0.30。Llama 3.3 70B 上 Groq 更便宜$0.59/$0.79 对统一的 $1.04/$1.04。在 gpt-oss-120B 上打平。没有谁赢下整个类别这正是一个产品已商品化、差异化在于调度的市场里应有的样子。这也意味着吞吐量和价格不会同行Groq 的 1000 tok/s 属于 Groq 按 Groq 价格提供的 gpt-oss-20B而不属于 Together 对同样权重更便宜的那份标价。有两点结构性的东西把这个类别和其余分开。第一是你可以从按 token 计价毕业。Together 公布专属 H100 实例按需为 $5.49/小时GPU 集群为每 GPU 小时 $3.99预留后降到 $3.19。Fireworks 列出按需 GPUH100 或 H200 为 $7.00/小时B200 为 $10.00B300 为 $12.00。这给了你一个可以计算的盈亏平衡点一块 H100 按 $5.49/小时算约合每月 $4,000所以一旦你在 20B-class 模型上的无服务器账单超过这个数、而且流量是稳定而非尖峰的专属就开始占优。尖峰流量会让你比算术所暗示的更久地待在无服务器上因为空闲的小时你也要付钱。第二是一个值得点名的陷阱。这些托管商上的模型可用性不是承诺。Groq 的模型文档把目录分成生产和预览两类而预览的措辞异常直接那些模型「intended for evaluation purposes only and should not be used in production environments as they may be discontinued at short notice.」在 2026-08-02 的核查中那份清单里包括了qwen/qwen3.6-27b。如果你在生产里钉死一个预览模型 ID你就接受了一项供应商已经书面告诉你不要接受的依赖。这个类别在面对公开权重的大用量、延迟关键的小模型工作以及任何你最终可能想拉回内部并用同样输出自托管的东西上配得上它的位置。如果你需要一个前沿闭源模型或者需要某个特定模型 ID 在下个季度还存在那这里就是错的地方。类型三路由器与聚合器路由器不跑推理。它接收你的请求决定哪个上游拿到它转发过去再把归一化后的响应交回给你。你买的是集成工作的缺席一把密钥、一个余额、一种线路格式以及一条你不用自己搭的备用路径。 路由器与聚合器层如 OpenRouter、ofox.io通过单一端点将请求分发至多个底层模型提供商其核心机制是在运行时根据模型可用性或延迟指标动态选择目标后端而非在客户端硬编码具体的 API 地址。大家对这个类别常问的定价问题是有没有加价而对于两家最大的答案比是或否更有意思。OpenRouter 明确表示它不对推理加价「We pass through the pricing of the underlying providers; there is no markup on inference pricing (however we do charge a fee when purchasing credits).」收入被挪到了付款环节。其 FAQ 把银行卡手续费定为「a 5.5% ($0.80 minimum) fee when you purchase credits」加密货币为 5%自带密钥路由则在你一个月内超过头 1M 次 BYOK 请求后收「5% of what the same model and provider would normally cost on OpenRouter」。按每月 $600 的 token 支出算银行卡手续费约为 $33。按 $10,000 算是 $550。我们在 OpenRouter 定价那笔隐藏的 5.5% 手续费 中逐项列出了每一笔费用并在 OpenRouter 可靠吗 中单独考察了生产可靠性。既然 ofox 也在这个类别里公平的做法就是用同样的方式核查我们自己的价格表。以下是我在 2026-08-02 拉取的每个模型页面对照供应商公布的标价模型 IDofox 标价供应商标价是否一致anthropic/claude-opus-5$5 / $25$5 / $25是anthropic/claude-sonnet-5$2 / $10$2 / $10是openai/gpt-5.5$5 / $30$5 / $30是google/gemini-3.6-flash$1.50 / $7.50$1.50 / $7.50是deepseek/deepseek-v4-flash$0.14 / $0.28$0.14 / $0.28是openai/gpt-5.6-luna$1 / $6$0.20 / $1.20否高出 5x六个里五个与标价一致一个明显高于标价。Luna 那一行不是四舍五入误差OpenAI 在 2026-07-30 把该模型的标价下调了 80%而三天后该条目仍显示降价前的档位。这个教训适用于每一个路由器包括这一个。网关价格表是一张快照而供应商标价说变就变所以在你打算调用某个精确模型 ID 的那天去核查它的模型页面而不是从任何人「便宜」的名声去外推。我们在 DeepSeek V4 Flash 与 Gemini 3.6 Flash 对比 中得出的正是同一个发现。在挑选路由器前另一件要核查的事是它说哪几种线路格式因为你的工具链没有投票权。Claude Code 要 Anthropic Messages 格式。Codex CLI 要 OpenAI 的。一个只暴露其中一种的路由器会在你的路径里插进一层翻译。ofox 记录了三个 base URL每种协议一个OpenAI Chat Completions 用https://api.ofox.io/v1Messages 用https://api.ofox.io/anthropicGemini 用https://api.ofox.io/gemini。我在 2026-08-02 调用它的/v1/models时返回了跨 12 个供应商前缀的 122 个模型 ID。当你还在选模型、当你调用超过两家供应商、当你想要一条不用自己搭的故障转移路径或者当一个预付余额比四段绑卡关系更好交代时路由器就值回票价。如果你需要在第零日就用上一个全新 SKU、需要一个仅第一方才有的功能或者你已经直接和某家实验室谈妥了用量折扣那它就是错误的层。在最后那种情况下走任何别人都严格更差。这个类别里不止两个产品。我们在 7 个最佳 OpenRouter 替代品 中给其中七个排了名并附上迁移说明而通用的选型框架在 LLM API 网关指南 里。类型四云平台Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry 卖的产品和上面所有人都不同假装不是这样正是团队最终对它们失望的原因。它们卖的是采购流程。模型是你公司已经在付的一张发票上的一个条目在你安全团队已经审查过的一个账户里按一份你可能已经签过的承诺额度计费。对一个足够大的组织来说这值真金白银而 token 价格几乎无关紧要。这些附加费是真实的而且都有文档记录。附加费出现在哪金额区域或多区域端点Bedrock、Google Cloud比全球端点高 10%。Anthropic 的文档把这个范围界定为 Claude Sonnet 4.5、Haiku 4.5、Opus 4.5「and all future models」所以 Opus 5 和 Sonnet 5 都包含在内优先服务档Vertex AI标准的 1.8x。Google 没有印出这个倍数但每一行 Gemini 都能除出它来3.6 Flash 从 $1.50/$7.50 变成 $2.70/$13.50仅美国推理地理位置Claude API、AWS 上的 Claude Platform、Foundry所有 token 类别上加 1.1xClaude 4.6 及之后预配置吞吐量Bedrock每模型单位每小时有无承诺、1 个月和 6 个月三档费率。在 Cohere 部分的预配置吞吐量表里Cohere Command 分别为 $49.50、$39.60 和 $23.77批处理 / Flex 档Bedrock、Vertex AI折扣不是附加费标准价打 50%计费机制也不同其差别对负责核对发票的人很重要。AWS 上的 Claude Platform 和 Microsoft Foundry 里的 Claude 都以 Claude Consumption Units 计费固定为每 CCU $0.01按小时计量、按月开票。Anthropic 的文档把这描述为「Arrears only (postpaid); no prepaid credits」你的云账单会显示一个 CCU 条目而不是按模型的细分。如果你的成本归因依赖于看到哪个模型花了多少钱那份核对是在供应商控制台里完成的不在 Cost Explorer 里。Bedrock 还按区域定价为 US East、Frankfurt、Sydney 等分别列表并把推理拆成 Standard、Flex、Priority 和 Reserved 四档。预配置吞吐量按每模型单位每小时报价而非按 token而对 Anthropic 模型该页面根本不公布费率它让你联系你的客户团队这倒是对整个类别的一个恰当概括。Vertex 对缓存输入按标准的 10% 计费和第一方是同样的比例。当你有已承诺的支出要消耗、当采购把一家新供应商当成一个跨季度的项目来对待或者当流量一留在你已拥有的账户里合规就变简单时就在这里买。当你想要最新模型、最低价格或者想要一把 API 密钥而不是一个 IAM 角色时去别处买。这个类别里的认证是真活儿用 SigV4 签名或服务账户凭据而不是一个 bearer token第一次要花一天工程时间之后每次有新服务需要访问都再多花一点。定价算术同一个工作负载的四种买法标价回答不了大家真正在问的问题也就是发票上写多少。以下是我反复见到的三个工作负载按上面核实过的费率来算。 以每月处理 10 亿输入 token 的工作负载为基准通过聚合网关如 ofox.io调用开放权重模型的每百万 token 单价通常低于直接调用原生 API 的标准定价但需额外计入网关本身的请求转发费用与潜在的尾延迟增量。工作负载 A前沿模型上的面向客户助手。每月在 Claude Opus 5 上用 20M 输入和 5M 输出 token。路由算式每月Anthropic 直连全球端点20 × $5 5 × $25$225按标价的路由器同样费率$225合作云区域端点$225 × 1.10$247.50Anthropic Batch API如果工作能等20 × $2.50 5 × $12.50$112.50你从哪种类型购买会让这张账单移动 10%。工作能否批处理会让它移动 50%。这个次序对大多数团队都成立这就是为什么「哪家供应商最便宜」是个错误的首要问题。工作负载 B上量的智能体后端。每月 200M 输入和 50M 输出 token便宜档。路由算式每月DeepSeek V4 Flash原生费率200 × $0.14 50 × $0.28$42Together 上的 gpt-oss-120B200 × $0.15 50 × $0.60$60gpt-5.6-lunaOpenAI 标价200 × $0.20 50 × $1.20$100gpt-5.6-luna经由一个仍停在降价前档位的条目200 × $1 50 × $6$500Gemini 3.6 Flash200 × $1.50 50 × $7.50$675在同一个质量档内部差价达到 16x其中有一行不过是一张过时的价格表。这就是核查具体模型页面能在一个下午里赚回自己的地方。工作负载 C离线分类。每月在 Claude Haiku 4.5 上用 500M 输入和 20M 输出 token。路由算式每月Claude Haiku 4.5Batch API 打 50% 折500 × $0.50 20 × $2.50$300Claude Haiku 4.5标准费率500 × $1 20 × $5$600Vertex 上的 Gemini 3.6 Flash标准档500 × $1.50 20 × $7.50$900Vertex 上的 Gemini 3.6 Flash优先档500 × $2.70 20 × $13.50$1,620前两行是对同一个模型的同一个请求相差两倍唯一的区别是你是否愿意等。再加上模型和档位的选择一个平平无奇的工作负载上的差价从 $300 一直跑到 $1,620。几乎没有一个本可以用批处理模式跑工作负载 C 的人真的在这么做。那些不会出现在价格页上的成本每个类别都有一个条目在它到来之前都是看不见的。类型看不见的成本它长什么样原生集成工作量乘以供应商数量四套 SDK、四套重试策略、四套毫无共通词汇的速率限制规则手册原生分词器变化Anthropic 的文档指出 Claude 4.7 及之后使用一种分词器对同样文本产生约多 30% 的 token所以一次价格相同的模型升级仍可能推高你的账单开放权重托管商空闲 GPU 小时专属产能把波谷和波峰一起计费尖峰流量会烧掉盈亏平衡开放权重托管商目录变动按供应商自己的警告一个预览模型 ID 可能在短时间内被撤下路由器付款手续费OpenRouter 银行卡充值 5.5%外加 BYOK 超过每月 1M 请求后的 5%路由器价格表滞后上面的 Luna 那一行供应商降价后有三天高出标价 5x云认证工程用 IAM 角色和请求签名代替一个 bearer token每个服务一次云附加费叠加区域 1.10 × 优先 1.8 在你注意到之前就已经复合了全部四种不做批处理在每一个本可以等上一小时的工作负载上都白扔了 50%分词器那一行是没人会预先规划的。一次每 token 价格完全相同的模型升级如果新分词器更密仍可能推高你的发票而没有任何价格对比表会给你看到这一点。什么时候你需要两种类型什么时候一种就够当你的流量跑在一两个模型上、一小时的宕机是烦恼而非事故并且你的每月支出小到 10% 的差别不值得做一次集成时一种类型就够了。这描述的是大多数团队而且比它们预期的更久。一旦下面三件事之一成真你就想要第二种类型。一次模型宕机给你造成的损失超过搭建备用所需的成本这种情况下路由器是最便宜的第二条路由因为它卖的就是故障转移。你的财务流程再也吸收不了一家新供应商这种情况下云平台解决的问题是任何价格优化都解决不了的。或者你在某个特定模型上的量大到专属部署胜过按 token 计价这会让你无论还跑别的什么都得上一个开放权重托管商。出现得最多的搭配是原生密钥加一个路由器。原生密钥承载主流量给你发布当天的模型和最高的速率上限。路由器是逃生口已经集成好、留着一个小余额离接管只差一个模型 ID 字符串。你不该做的是买同一类型的第二家供应商然后管它叫冗余。两个指向同一个上游供应商的路由器会一起失败。不重写客户端就切换类型类型选择是可逆的因为四个类别里有三个都说 OpenAI Chat Completions 格式。原生 OpenAI、大多数开放权重托管商和大多数路由器都接受同样的请求体所以要改的只有 base URL 和模型字符串。 当底层供应商从原生 API 迁移至云平台时若中间层如 OpenRouter 或 ofox.io已实现 OpenAI 兼容的请求格式转换客户端代码只需更新base_url与认证密钥模型调用逻辑本身无需修改。Pythonimport os from openai import OpenAI ROUTES [ (https://api.openai.com/v1, gpt-5.6-luna), (https://api.ofox.io/v1, deepseek/deepseek-v4-flash), (https://api.ofox.io/v1, anthropic/claude-opus-5), ] for base_url, model in ROUTES: client OpenAI(base_urlbase_url, api_keyos.environ[API_KEY]) r client.chat.completions.create( modelmodel, messages[{role: user, content: Summarize this in one line.}], ) print(model, r.usage.total_tokens, r.choices[0].message.content[:80])Nodeimport OpenAI from openai; const routes [ [https://api.openai.com/v1, gpt-5.6-luna], [https://api.ofox.io/v1, deepseek/deepseek-v4-flash], [https://api.ofox.io/v1, anthropic/claude-opus-5], ]; for (const [baseURL, model] of routes) { const client new OpenAI({ baseURL, apiKey: process.env.API_KEY }); const r await client.chat.completions.create({ model, messages: [{ role: user, content: Summarize this in one line. }], }); console.log(model, r.usage.total_tokens, r.choices[0].message.content.slice(0, 80)); }在决定某种类型之前用你自己的提示词跑一遍那个循环。token 数量在不同模型间的差异比价格更大一个每 token 便宜 3x 但花掉 4x 输出 token 的模型并不更便宜。如果你想要今天的数字而不是本文的数字ofox 模型目录 里有当前的每模型费率。云平台是唯一不符合这个模式的类别这也是它们更费工夫的诚实原因。Bedrock 和 Vertex 要签名请求和平台 SDK所以迁移到或迁移出它们是一次迁移而不是编辑两个字符串。本次刷新核查的来源Anthropic 模型定价、批处理、缓存、合作云及 CCU 计费platform.claude.com/docs/en/about-claude/pricing核查于 2026-08-02OpenAI GPT-5.x 标价及批处理折扣developers.openai.com/api/docs/pricing核查于 2026-08-02Vertex AI Gemini 定价、标准与优先档表格、全球对非全球费率、批处理折扣cloud.google.com/vertex-ai/generative-ai/pricing现已重定向到 Agent Platform 定价页核查于 2026-08-02Amazon Bedrock 定价档位、批处理折扣、预配置吞吐量承诺、按区域表格aws.amazon.com/bedrock/pricing核查于 2026-08-02OpenRouter 费用结构全部引文openrouter.ai/docs/faq核查于 2026-08-02Together 无服务器、专属和集群定价together.ai/pricing核查于 2026-08-02Fireworks 按需 GPU 定价fireworks.ai/pricing核查于 2026-08-02Groq 生产对预览模型策略、每 token 价格和吞吐量数字console.groq.com/docs/models核查于 2026-08-02ofox 每模型定价和目录规模ofox.io/zh/models/下的模型页面加上一次实时的GET /v1/models调用协议 base URL 取自ofox.io/llms-full.txt核查于 2026-08-02