摘要本文解读 arXiv 2024 论文《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》。该论文提出DeepSeek-V2 大语言模型通过融合MLA多头潜在注意力、DeepSeekMoE细粒度专家稀疏与GRPO 两阶段对齐在 236B 总参数、每 token 仅激活 21B 的条件下支持 128K 上下文其特别之处在于用低秩 KV 联合压缩把推理显存瓶颈转化为一次可被矩阵吸收的等价变换。实验表明KV 缓存减少 93.3%、训练成本节省 42.5%、最大生成吞吐提升 5.76 倍MMLU 达 78.5以最低的激活参数取得开源顶级性能为后续 DeepSeek-V3、DeepSeek-R1 奠定了架构基础。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQDeepSeek-V2 的 MLA 与 MHA、GQA 有什么区别为什么 KV 缓存是推理效率的瓶颈GRPO 与 PPO 有什么不同DeepSeek-V2 与 DeepSeek-V3、R1 是什么关系如何复现或使用 DeepSeek-V2参考链接论文基本信息项目内容标题英文DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model标题中文DeepSeek-V2经济训练与高效推理的 MoE 大语言模型作者DeepSeek-AI高华佐、曾旺鼎 等 100 贡献者机构深度求索 DeepSeek-AI会议arXiv 2024arXivhttps://arxiv.org/abs/2405.04434项目网站https://github.com/deepseek-ai/DeepSeek-V2背景与动机大语言模型的能力通常随参数规模提升而增强但训练算力需求与推理吞吐瓶颈也随之放大限制了模型的普及与部署。DeepSeek-V2 瞄准的正是这一对矛盾如何在保持强性能的同时把训练成本与推理显存同时压下来。论文的答案是双管齐下的稀疏化在注意力侧MHA 的 KV 缓存是推理效率的最大障碍——每 token 需要缓存 $2n_h d_h l$ 个元素$n_h$ 为头数、$d_h$ 为头维度、$l$ 为层数。此前的 MQA 与 GQA 通过共享 KV 头压缩缓存但论文的 7B 稠密消融显示GQA 的 MMLU 41.2、MQA 37.9都明显低于 MHA 的 45.2压缩头数路线存在无法忽视的性能代价。在 FFN 侧GShard、Switch Transformer 与 Mixtral 采用粗粒度路由专家稀疏化收益有限。从历史脉络看MLA 并非凭空出现2019 年 MQA、2023 年 GQA 持续探索缓存压缩2024 年 DeepSeek-V2 首次提出 MLA 做到不牺牲性能的压缩随后 DeepSeek-V3、DeepSeek-R1 全系标配 MLAFlashMLA 内核开源并被社区生态广泛跟进。MLA 把 KV 缓存从与头数线性相关降到与潜在维度相关让 128K 长上下文与大批次部署从显存上变得可行完成了从缓存压缩技术到推理架构标配的迁移。研究主线从问题到结论图 1Mermaid 流程图DeepSeek-V2 论文从问题到结论的研究主线。基准/方法设计DeepSeek-V2 总参数 236B、每 token 激活 21B60 层 Transformer隐藏维度 5120128 个注意力头、每头 128 维。架构上有两大支柱MLAMulti-head Latent Attention把 Key 与 Value 联合压缩进低维潜在向量 $\mathbf{c}_t^{KV}$推理时只需缓存潜在向量缓存量从 $2n_h d_h l$ 降至 $(d_cd_h^R)l \approx \frac{9}{2}d_h l$等价于只有 2.25 组的 GQA性能却强于 MHA。DeepSeekMoE每层 2 个共享专家 160 个路由专家、激活 6 个细粒度专家提升专业化共享专家隔离冗余配合设备受限路由每个 token 最多发往 $M3$ 个设备、专家级/设备级/通信级三类平衡损失与 token 丢弃策略保证稀疏训练稳定高效。图 2MMLU 精度随激活参数的增长对比以及 DeepSeek 67BDense与 DeepSeek-V2 的训练成本与推理效率arXiv 2024。分类全景图 3Mermaid 流程图注意力机制 KV 缓存压缩的四种路线分类。方法细节MLA 的三步设计。第一步低秩 KV 联合压缩$\mathbf{c}_t^{KV} W^{DKV}\mathbf{h}_t$其中 $d_c512$ 为 KV 压缩维度查询侧同样压缩到 $d_c1536$ 以省训练激活内存。第二步解耦 RoPE由于 RoPE 是位置敏感的直接作用于压缩键会阻止权重吸收MLA 用额外的解耦查询 $\mathbf{q}_t^R$ 与共享键 $\mathbf{k}_t^R$每头 $d_h^R64$单独承载位置编码。第三步权重吸收推理时 $W^{UK}$ 并入 $W^{Q}$、$W^{UV}$ 并入 $W^{O}$压缩后的注意力与标准注意力代数等价不产生任何额外计算。图 4DeepSeek-V2 整体架构MLA 显著压缩生成期 KV 缓存DeepSeekMoE 通过稀疏计算降低训练成本。图 5MHA / GQA / MQA / MLA 对比MLA 将 K、V 联合压缩为潜在向量显著削减推理 KV 缓存。各注意力机制每 token 的 KV 缓存元素数对比如下MHA 为 $2n_h d_h l$、GQA 为 $2n_g d_h l$、MQA 为 $2d_h l$而 MLA 仅为 $(d_cd_h^R)l$在 DeepSeek-V2 的配置$d_c4d_h$、$d_h^R\frac{1}{2}d_h$下相当于 GQA 2.25 组性能却更强。对齐阶段。预训练后收集 1.5M 指令实例1.2M helpfulness 0.3M safety做 SFT再用GRPOGroup Relative Policy Optimization做两阶段 RL第一阶段用代码/数学推理奖励模型做推理对齐第二阶段用 helpful、safety、rule 三个奖励模型做人类偏好对齐。GRPO 的优势在于无需与策略同规模的 critic 模型用组内奖励的均值与标准差归一化优势 $A_i (r_i - \mathrm{mean})/\mathrm{std}$显著节省 RL 训练成本工程上采用混合引擎训练/推理不同并行策略 vLLM 大批次推理 CPU 卸载调度。实验设计与结果预训练。语料 8.1T tokens中文比英文多约 12%经质量过滤与争议内容去除AdamW 优化器、最大学习率 $2.4\times10^{-4}$、批大小从 2304 逐步升至 9216训练基于 HAI-LLM 框架16 路 zero-bubble 流水并行 8 路专家并行 ZeRO-1在 H800 集群上每万亿 token 仅 172.8K GPU 小时DeepSeek 67B 需 300.6K节省 42.5%。长上下文用 YaRN 只作用于解耦共享键32K 序列续训 1000 步即扩展到 128K。图 6Needle In A Haystack 评测DeepSeek-V2 在 4K 至 128K 全区间上下文窗口表现稳定。主结果。在统一内部评测框架下对比 DeepSeek 67B、Qwen1.5 72B、Mixtral 8x22B、LLaMA3 70B基准DeepSeek 67BMixtral 8x22BLLaMA3 70BDeepSeek-V2MMLU (Acc.)71.377.678.978.5BBH (EM)68.778.981.078.9MATH (EM)18.742.542.243.6HumanEval (Pass1)45.153.148.248.8C-Eval (Acc.)66.159.667.581.7CMMLU (Acc.)70.860.069.384.0激活/总参数67B/67B39B/141B70B/70B21B/236B仅 21B 激活参数DeepSeek-V2 在 MMLU、数学与中文基准上达到开源顶级水平成为当时最强开源 MoE 模型中文能力C-Eval 81.7、CMMLU 84.0全面超越 LLaMA3 70B 与 Mixtral 8x22B。图 7训练与推理效率DeepSeek-V2 相比 DeepSeek 67B 节省 42.5% 训练成本并大幅提升推理吞吐。效率数字。部署采用 FP8 权重 平均 6-bit KV 量化单节点 8×H800 上生成吞吐超过 50K tokens/s67B 的 5.76 倍提示词输入吞吐超过 100K tokens/s。图 8HumanEval 与 LiveCodeBench2023.09–2024.04评测DeepSeek-V2 Chat 的代码能力超越部分超大模型。对齐与对话评测。GRPO 两阶段 RL 后AlpacaEval 2.0 长度控制胜率 38.9、MT-Bench 8.97、AlignBench 7.91中文开放对话全面超越开源模型甚至超过部分闭源模型LiveCodeBench2023.09–2024.04上 Pass1 超过部分超大模型。消融实验。7B 稠密模型上 MHA 的 MMLU 45.2 显著高于 GQA 41.2 与 MQA 37.9证明压缩头数有性能代价换成 MLA 后16B 规模 MMLU 50.0、250B 规模 59.0均反超同规模 MHA且 KV 缓存仅为 MHA 的 14% 与 4%。小模型验证。DeepSeek-V2-Lite15.7B 总参数/2.4B 激活27 层2 共享 64 路由专家在 5.7T tokens 上从头训练MMLU 58.3基座/55.7Chat全面超越同规模的 DeepSeekMoE 16B证明 MLA DeepSeekMoE 从小模型到大模型均可迁移复现。SFT 侧还发现指令数据少于 10K 条时 IFEval 显著下降说明大模型也需要足量数据培养技能。结果对比总结图 9Mermaid 流程图DeepSeek-V2 与三个代表基线在激活参数与关键基准上的对比总结。关键发现MLA 是注意力新范式低秩 KV 联合压缩 解耦 RoPE 权重吸收三者配合缓存仅相当于 GQA 2.25 组$d_c4d_h$、$d_h^R\frac{1}{2}d_h$性能却反超 MHA250B 规模下缓存只有 MHA 的 4%MMLU 59.0 对 57.5。经济训练兑现每万亿 token 训练成本 172.8K GPU 小时比 Dense 的 300.6K 节省 42.5%。推理效率兑现FP8 6-bit KV 量化8×H800 单节点生成吞吐超 50K tokens/s是 DeepSeek 67B 的 5.76 倍。稀疏即强21B 激活参数拿下 MMLU 78.5、MATH 43.6、CMMLU 84.0成为最强开源 MoE 模型。长上下文可靠YaRN 只改解耦共享键4K→128K 扩展后 NIAH 全区间表现稳定。创新模式清晰P9 证明等价性以统一权重吸收的代数等价、P14 刻画极限然后超越先指出 MHA 缓存瓶颈再超越、P6 重新表述为可解对象显存瓶颈重构为低秩压缩均有双规模消融与工程效率数字支撑执行质量完整。局限性知识滞后预训练后没有持续知识更新可能产生幻觉与未经证实的信息。语言覆盖有限语料以中英为主其他语言能力有限使用需注意场景。纯文本模态当前仅支持文本多模态能力列入未来计划。对齐税RL 偏好对齐会带来 BBH 等标准基准上的对齐税论文通过数据与训练策略缓解但未完全消除。常见问题FAQDeepSeek-V2 的 MLA 与 MHA、GQA 有什么区别MLA 把 Key 与 Value 联合压缩进一个低维潜在向量推理只缓存潜在向量缓存量相当于 GQA 2.25 组但性能反超 MHA——这是它与压缩头数路线的本质区别。为什么 KV 缓存是推理效率的瓶颈KV 缓存随序列长度线性增长直接决定可服务的最大批大小与序列长度MLA 把每 token 缓存从 $2n_h d_h l$ 降到 $(d_cd_h^R)l$让大批次与 128K 长上下文在显存上变得可行。GRPO 与 PPO 有什么不同GRPO 不需要与策略模型同规模的 critic 模型用组内采样输出的奖励均值与标准差归一化优势显著节省 RL 训练成本DeepSeekMath 首次提出DeepSeek-V2 用它做两阶段对齐。DeepSeek-V2 与 DeepSeek-V3、R1 是什么关系DeepSeek-V2 首次提出 MLA 与 DeepSeekMoE 的组合V3 与 R1 全系沿用 MLA 作为标配注意力架构FlashMLA 内核进一步发挥其推理潜力V2 是这条技术路线的起点。如何复现或使用 DeepSeek-V2模型权重与代码在 GitHub 仓库 开源另有 15.7B 的 DeepSeek-V2-Lite 便于小规模复现论文附录给出了完整的超参数与训练细节。参考链接DeepSeek-V2 arXiv 摘要页DeepSeek-V2 GitHub 项目权重开源DeepSeek-V3 技术报告MLA 成为标配DeepSeek-R1 推理模型DeepSeekMoE极致专家专业化FlashMLA 高效内核给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件