SPOTLIGHT / DEEPSEEK ALGORITHM × SYSTEM

一条少见的、环环相扣的
开放论文主线

DeepSeek 的价值不只在某个模型分数,而在持续公开“为什么这样设计”: 容量贵,就做细粒度 MoE;KV Cache 贵,就做 MLA;训练贵,就做 FP8 与通信重叠; 推理难,就把可验证奖励规模化。

SPAN
2024.01 → 2026.06
CORE
MoE · MLA · FP8 · GRPO
LINE
Dense → Sparse → Reasoning
K3 LINK
MLA · MoE · Muon · 1M
STATUS
重点专题 · 首版

00 THE LINEAGE

每一代都在偿还上一代最昂贵的账单

把 DeepSeek 看成模型名字序列会很乱;把它看成“容量、缓存、训练、推理、长上下文”五张账单, 技术演进就清楚了。

核心观察

DeepSeek 的强项是把模型结构和硬件约束写在同一张设计图里。MLA 不只是新 attention, 它直接针对服务时 KV Cache;FP8 不只是少用几个比特,它要求累加精度、缩放和通信共同配合; GRPO 不只是 PPO 变体,它直接移除同规模 critic 的显存负担。

01 DEEPSEEK LLM

先用 Dense 模型建立基线:规模、数据和双语能力

2024 年初的 DeepSeek LLM 发布 7B 与 67B dense 模型, 在约 2T 中英文 Token 上预训练。它的重要性不在今天看来并不夸张的参数量,而在于建立后续研究的可比基线: tokenizer、数据配方、训练稳定性、中文评测和 scaling behavior 有了统一起点。

为什么先做 Dense 很重要

MoE 同时改变总参数、激活参数、路由、通信和数据分配。没有 dense 基线,很难判断收益来自“更多容量” 还是来自别的训练差异。DeepSeek LLM 还训练小规模模型拟合 scaling laws, 再用这些规律选择 67B 的超参数;这条“先小规模试验,再外推大模型”的方法后来在 V3/K3 都持续出现。

把这一代当作实验坐标系

DeepSeek LLM 回答的是“如果我们先不引入稀疏专家和低秩缓存,一套扎实的中英 dense Transformer 能到哪里?” 后面的论文才有明确的对照物。

02 DEEPSEEKMOE

专家越大不一定越专:把一个大专家拆成许多细粒度专家

传统 MoE 往往把 FFN 分成少数大专家,每个 Token 选 1–2 个。问题是一个大专家仍可能同时处理许多无关知识, 专家之间也会重复学习公共能力。DeepSeekMoE提出两项互补策略。

CONVENTIONAL MOE

少数大专家

E1E2E3E4

每个专家覆盖面广,公共知识在多个专家中重复;可组合的专业分工有限。

DEEPSEEKMOE

细粒度 routed + shared

Se1e2e3e4e5e6e7

shared expert 吸收公共知识;更多小 routed experts 可以按 Token 组合出细分能力。

Fine-Grained Expert Segmentation

在保持单 Token 激活计算近似不变时,把专家 FFN 切得更小,同时选择更多个小专家。 组合数显著增加:同样的 Token 可以同时调用“代码语法”“Python 库”“矩阵计算”等几个子专长, 不必把它们硬塞进一个笼统的“代码专家”。

Shared Expert Isolation

某些变换几乎每个 Token 都需要。如果全部交给 routed experts,多个专家会重复学习。 DeepSeekMoE 把 shared experts 始终激活,承担公共知识;路由专家获得更强动力去形成差异化专长。 这套组织直接进入 DeepSeek-V2/V3,也成为 Kimi K3 Stable LatentMoE 的结构祖先。

MoE 的代价从 FLOPs 转移到了通信

Token 必须被发送到拥有对应专家的设备。专家越细、选择越多,all-to-all、负载波动和权重读取越可能成为瓶颈。 因此模型侧路由与系统侧 Expert Parallel 从来不能分开看。

进入 MoE 专题:比较粗专家、细粒度专家与共享专家 →

03 DEEPSEEK-V2 / MLA

训练只付一次参数成本,KV Cache 却在每个请求、每个 Token 上重复付费

DeepSeek-V2 是整条谱系的关键转折: 236B 总参数、21B 激活参数、128K 上下文,把 DeepSeekMoE 用于训练经济性, 再用 Multi-head Latent Attention(MLA)直接攻击推理服务的内存瓶颈。

−42.5%训练成本
−93.3%KV Cache
5.76×最大生成吞吐

均为 V2 报告相对 DeepSeek 67B 的特定配置结果,不应外推为任意硬件上的固定倍数。

标准 MHA 为什么会让 KV Cache 爆长

自回归生成每一步都要查询历史 Token。历史的 K/V 不变,因此缓存起来避免重算。 但 MHA 为每层、每个 Token、每个 head 保存 K 和 V;batch、序列和层数一大,缓存会吃掉大量显存, 直接限制并发和长上下文。

cₜᴷⱽ = Wᴰᴷⱽhₜ  kₜᶜ = Wᵁᴷcₜᴷⱽ  vₜᶜ = Wᵁⱽcₜᴷⱽ省略 decoupled RoPE key、各 head 展开与权重吸收细节。核心是 K/V 先联合低秩压缩,缓存 latent 而非完整多头表示。

为什么 MLA 比简单 MQA/GQA 更有野心

MQA 让所有 Query heads 共用一组 K/V,GQA 让一组 Query heads 共用 K/V,缓存更小但容量可能下降。 MLA 用低秩 latent 保留可恢复的内容子空间,并把 RoPE 相关部分分离,追求接近 MHA 的表达力与更小缓存。 它后来被 Kimi K2/K2.5 采用,并在 K3 中作为周期性全局注意力保留。

04 DEEPSEEK-V3

V3 的亮点不是一个技巧,而是四层协同

DeepSeek-V3 扩到 671B 总参数、37B 激活参数, 在 14.8T Token 上预训练。报告给出的完整训练用量约 2.788M H800 GPU hours,并称整个训练没有不可恢复的 loss spike 或回滚。 这组数字之所以引人注目,是因为它背后同时改动模型、目标、数值和系统。

MODEL

MLA + DeepSeekMoE

沿用 V2 验证过的低缓存 attention 与细粒度专家。

ROUTING

Aux-loss-free balance

用动态 expert bias 调整负载,减少辅助平衡损失对主目标的干扰。

OBJECTIVE

Multi-Token Prediction

训练时预测多个未来 Token,增加训练信号,并可转化为推测解码草稿能力。

SYSTEM

FP8 + DualPipe

低精度训练、计算通信重叠、跨节点专家并行共同压低成本。

无辅助损失负载均衡

MoE 必须避免少数专家过载。传统做法加入 load-balancing auxiliary loss, 但它与语言建模主目标可能冲突:为了均匀而把 Token 送给次优专家。V3 为每个专家维护 bias, 根据近期负载上调冷门专家、下调热门专家;bias 只影响路由选择,不直接进入最终门控权重, 从而把“系统要均衡”和“模型要准确”更松地解耦。

专题版推导会进一步区分 z-loss、辅助平衡损失、Loss-Free expert bias 与 K3 Quantile Balancing;“aux-loss-free”并不等于系统里不存在任何平衡约束。

FP8 训练真正难在哪

FP8 动态范围和有效精度有限,不能简单把所有 tensor 强转为 8 位。V3 使用细粒度量化、较高精度累加、 在线缩放和特定敏感模块的高精度保留;同时让低精度通信减少跨卡带宽。 论文最值得看的不是“首次大规模 FP8”宣传,而是哪些路径降精度、哪些路径绝不降,以及误差怎样被控制。

DualPipe:流水线的空泡是一笔真金白银

Pipeline Parallel 把层切到不同 stage;朴素调度会让设备在前向/反向依赖之间等待。 DualPipe 从流水线两端同时喂入 micro-batch,并重叠前向、反向与专家通信,尽量把空泡藏在计算后面。 它与 DeepEP 的高吞吐/低延迟 all-to-all 一起,把 MoE 理论稀疏性变成真实集群效率。

05 DEEPSEEKMATH / GRPO

GRPO:不用再养一个和策略模型同样昂贵的 Critic

DeepSeekMath 不只是数学模型论文。 它在 7B 模型和 120B 数学相关 Token 上验证数据工程,同时提出 Group Relative Policy Optimization, 为后来 DeepSeek-V2 对齐和 R1 大规模推理 RL 铺路。

PPO 的显存账单

经典 RLHF/PPO 常同时保留 policy、reference、reward model 和 value/critic model。 对大模型而言,critic 往往与 policy 同量级。GRPO 对同一道题采样一组答案, 用组内奖励的均值和标准差构造相对优势,省去单独 value model。

PROMPT证明 / 求解一道题
sample group
y₁reward 0
y₂reward 1
y₃reward 0.7
y₄reward 0.2
normalize
RELATIVE ADVANTAGE高于组均值的轨迹被鼓励
Âᵢ = (rᵢ − mean(r₁…rᴳ)) / (std(r₁…rᴳ) + ε)GRPO 完整目标仍包含 clipped policy ratio 与 KL 约束;这里只展示“组相对优势”这一核心直觉。

组相对不是免费午餐

一道题要采样多条答案,rollout 成本仍然很高;奖励若不可验证或存在偏差,组内比较也会放大奖励漏洞。 当一组奖励全相同,归一优势几乎不给学习信号。R1 的成功因此同时依赖可验证数学/代码奖励、足够多样的采样和大规模基础设施。

06 DEEPSEEK-R1

R1-Zero 最重要的实验:先不教推理格式,只给可验证结果奖励

DeepSeek-R1 的历史意义, 是把“推理可以通过大规模 RL 从强 base model 中被激发”做成公开、可研究的系统证据。

R1-Zero 做了什么

从 DeepSeek-V3 Base 出发,不先做推理 SFT,直接以 GRPO 进行大规模 RL。 奖励以答案正确性为主,并加入格式奖励。训练中出现更长推理、反思、回溯和自我验证等行为; 论文把某些突然延长思考的轨迹称为 “aha moment”。

它也明确暴露了纯 RL 的问题

R1-Zero 会重复、可读性差、混合语言。奖励只关心最终正确时,模型没有充分动力照顾人类阅读体验。 正式 R1 因而先加入少量高质量 cold-start CoT 数据,再做 reasoning-oriented RL; 随后用 rejection sampling 产生 SFT 数据,混入写作、事实问答等非推理任务,再进行第二阶段 RL 兼顾帮助性与安全。

BASEDeepSeek-V3 Base强预训练基础
COLD START少量可读 CoT稳定格式与语言
REASONING RL可验证奖励 + GRPO强化求解策略
SFT MIX拒绝采样 + 通用数据恢复广泛任务
FINAL RL帮助性与安全统一模型

Distillation 的关键发现

团队用 R1 生成的推理样本微调 Qwen/Llama dense 模型,发布 1.5B–70B 蒸馏版本。 这说明小模型不一定要自己承担完整的探索式 RL 成本,可以模仿强 reasoning teacher 的轨迹; 但蒸馏得到的是 teacher 数据分布上的能力,不等于小模型内部复现了同样的 RL 发现过程。

CoT 变长不等于推理一定更好

长轨迹可能包含有效搜索,也可能是重复与绕路。R1 证明的是在可验证任务和适当训练下, 增加推理计算可以转化为能力;不是“输出越长越聪明”。

进入推理专题:从 DeepSeekMath、R1 到 DAPO / Dr.GRPO 的完整推导 →

07 DEEPSEEK-V3.2

从会推理到会在长上下文里使用工具

DeepSeek-V3.2 把三条线合并: DeepSeek Sparse Attention(DSA)降低长上下文成本,更大规模的 RL 提升 reasoning, Agentic task synthesis 则把 reasoning 放进工具交互轨迹。

DSA 的两阶段直觉

完整注意力让每个 Query 和全部历史交互。DSA 先用轻量、可学习的 indexer 给历史 Token 评分, 选出小部分候选,再让主 attention 只在候选上做高容量计算。 关键不只是 top-k,而是 indexer 也在训练中学习“什么值得看”;这比固定窗口更能适应内容相关的远距离依赖。

123456789101112131415161718
learned indexer → top-k
2671317
main attentionQuery

Agent 方面,V3.2 的任务合成管线系统地产生复杂、交互式工具任务,让思考与 tool use 交织。 这与 K3 的 white-box harness、知识图谱任务合成和可验证环境形成同期对照:前沿模型竞争正在从静态题库转向训练环境。

08 DEEPSEEK-V4

百万上下文从“支持”变成一套专门架构

2026 年的 DeepSeek-V4 preview 包含 1.6T-A49B 的 Pro 与 284B-A13B 的 Flash,均支持 1M Token。 它使用 Compressed Sparse Attention(CSA)与 Heavily Compressed Attention(HCA)的混合注意力, Manifold-Constrained Hyper-Connections(mHC)改善深度残差,并采用 Muon 优化器。

1.6T / 49BV4-Pro total / active
284B / 13BV4-Flash total / active
>32T预训练 Token

V4 官方报告摘要数据;模型是 preview 版本,后续版本需按研究截止日重新核验。

报告称在 1M 上下文下,V4-Pro 的单 Token 推理 FLOPs 是 V3.2 的 27%,KV Cache 是 10%。 这说明长上下文竞争已从单一位置外推转向混合注意力、压缩缓存、残差、优化器和后训练的系统协同。 它也解释 K3 报告为何把 V4 列为同代开放基础模型对照。

进入长上下文专题,可以把 V4 的 CSA/HCA 与 K3 的 KDA/NoPE MLA 放进同一张“计算—缓存—状态容量”账本逐项比较。

V4 与 K3 不是同一条注意力路线

V4 用 CSA/HCA 混合压缩与稀疏注意力;K3 用 3:1 KDA/Gated MLA 混合线性递归与全局注意力。 两者目标相近——降低百万上下文成本并保留能力——但状态表示、检索方式和系统内核不同。

09 INTO KIMI K3

DeepSeek 的哪些思想直接流入 K3,哪些只是同期呼应

DeepSeek 线索K3 中的落点关系
DeepSeekMoE shared + routed expertsStable LatentMoE 保留 shared/routed 组织直接结构祖先
V2 Multi-head Latent Attention每四层一次 Gated MLA,全局注意力明确采用并改造
V3 Auxiliary-loss-free balancingQuantile Balancing 应对近千专家同一问题的新方案
V3 FP8 / 低精度协同专家 MXFP4 权重、MXFP8 激活与 QAT更低精度的延伸
DeepSeekMath / R1 的 GRPO 与 RL多 domain、多 effort RL + MOPD共享测试时扩展范式
V4 Muon 与深度残差创新Per-Head Muon + Attention Residuals同期不同设计
V3.2/V4 长上下文KDA + Gated MLA + KDA system co-design同目标、不同路线

这正是为什么 DeepSeek 值得在 LLM Atlas 中作为贯穿案例:它不是 K3 的“对手名单”之一, 而是 K3 架构里多条思想的公开祖先与同代参照。读懂 V2 的 MLA 和 DeepSeekMoE, K3 的一半架构会突然变得熟悉。

READING ORDER

建议精读顺序:不要直接从 R1 开始