00 THE LINEAGE
每一代都在偿还上一代最昂贵的账单
把 DeepSeek 看成模型名字序列会很乱;把它看成“容量、缓存、训练、推理、长上下文”五张账单, 技术演进就清楚了。
DeepSeek LLM
公开尺度规律与中英双语预训练,建立 7B / 67B dense 基线。
先弄清规模、数据与训练配方,再做稀疏化。
DeepSeekMoE
细粒度专家分割 + shared experts,让专家更专、公共知识不必重复。
把容量扩张和每 Token 计算量分开。
DeepSeek-V2
MLA 压缩 KV Cache;DeepSeekMoE 扩张稀疏容量。
训练经济性之外,开始直接优化推理内存与吞吐。
DeepSeek-V3
671B-A37B、FP8 训练、无辅助损失负载均衡、MTP 与 DualPipe。
模型算法、数值格式与集群通信共同设计。
DeepSeek-R1
R1-Zero 展示纯大规模 RL 可涌现推理;R1 用冷启动数据修复可读性与稳定性。
从“模仿答案”转向用可验证奖励塑造推理策略。
DeepSeek-V3.2
DeepSeek Sparse Attention 降低长上下文成本,并统一 thinking 与 tool use。
把推理模型推进长上下文 Agent 场景。
DeepSeek-V4
围绕百万 Token 上下文效率继续扩展,成为 K3 报告直接比较的开放前沿之一。
长上下文不再只是位置外推,而是注意力、训练与服务的全系统问题。
DeepSeek 的强项是把模型结构和硬件约束写在同一张设计图里。MLA 不只是新 attention, 它直接针对服务时 KV Cache;FP8 不只是少用几个比特,它要求累加精度、缩放和通信共同配合; GRPO 不只是 PPO 变体,它直接移除同规模 critic 的显存负担。
01 DEEPSEEK LLM
先用 Dense 模型建立基线:规模、数据和双语能力
2024 年初的 DeepSeek LLM 发布 7B 与 67B dense 模型, 在约 2T 中英文 Token 上预训练。它的重要性不在今天看来并不夸张的参数量,而在于建立后续研究的可比基线: tokenizer、数据配方、训练稳定性、中文评测和 scaling behavior 有了统一起点。
为什么先做 Dense 很重要
MoE 同时改变总参数、激活参数、路由、通信和数据分配。没有 dense 基线,很难判断收益来自“更多容量” 还是来自别的训练差异。DeepSeek LLM 还训练小规模模型拟合 scaling laws, 再用这些规律选择 67B 的超参数;这条“先小规模试验,再外推大模型”的方法后来在 V3/K3 都持续出现。
DeepSeek LLM 回答的是“如果我们先不引入稀疏专家和低秩缓存,一套扎实的中英 dense Transformer 能到哪里?” 后面的论文才有明确的对照物。
02 DEEPSEEKMOE
专家越大不一定越专:把一个大专家拆成许多细粒度专家
传统 MoE 往往把 FFN 分成少数大专家,每个 Token 选 1–2 个。问题是一个大专家仍可能同时处理许多无关知识, 专家之间也会重复学习公共能力。DeepSeekMoE提出两项互补策略。
少数大专家
每个专家覆盖面广,公共知识在多个专家中重复;可组合的专业分工有限。
细粒度 routed + shared
shared expert 吸收公共知识;更多小 routed experts 可以按 Token 组合出细分能力。
Fine-Grained Expert Segmentation
在保持单 Token 激活计算近似不变时,把专家 FFN 切得更小,同时选择更多个小专家。 组合数显著增加:同样的 Token 可以同时调用“代码语法”“Python 库”“矩阵计算”等几个子专长, 不必把它们硬塞进一个笼统的“代码专家”。
Shared Expert Isolation
某些变换几乎每个 Token 都需要。如果全部交给 routed experts,多个专家会重复学习。 DeepSeekMoE 把 shared experts 始终激活,承担公共知识;路由专家获得更强动力去形成差异化专长。 这套组织直接进入 DeepSeek-V2/V3,也成为 Kimi K3 Stable LatentMoE 的结构祖先。
Token 必须被发送到拥有对应专家的设备。专家越细、选择越多,all-to-all、负载波动和权重读取越可能成为瓶颈。 因此模型侧路由与系统侧 Expert Parallel 从来不能分开看。
03 DEEPSEEK-V2 / MLA
训练只付一次参数成本,KV Cache 却在每个请求、每个 Token 上重复付费
DeepSeek-V2 是整条谱系的关键转折: 236B 总参数、21B 激活参数、128K 上下文,把 DeepSeekMoE 用于训练经济性, 再用 Multi-head Latent Attention(MLA)直接攻击推理服务的内存瓶颈。
均为 V2 报告相对 DeepSeek 67B 的特定配置结果,不应外推为任意硬件上的固定倍数。
标准 MHA 为什么会让 KV Cache 爆长
自回归生成每一步都要查询历史 Token。历史的 K/V 不变,因此缓存起来避免重算。 但 MHA 为每层、每个 Token、每个 head 保存 K 和 V;batch、序列和层数一大,缓存会吃掉大量显存, 直接限制并发和长上下文。
每个 head 各存一份 K/V。
先存低维 joint latent,计算时再上投影。
为什么 MLA 比简单 MQA/GQA 更有野心
MQA 让所有 Query heads 共用一组 K/V,GQA 让一组 Query heads 共用 K/V,缓存更小但容量可能下降。 MLA 用低秩 latent 保留可恢复的内容子空间,并把 RoPE 相关部分分离,追求接近 MHA 的表达力与更小缓存。 它后来被 Kimi K2/K2.5 采用,并在 K3 中作为周期性全局注意力保留。
04 DEEPSEEK-V3
V3 的亮点不是一个技巧,而是四层协同
DeepSeek-V3 扩到 671B 总参数、37B 激活参数, 在 14.8T Token 上预训练。报告给出的完整训练用量约 2.788M H800 GPU hours,并称整个训练没有不可恢复的 loss spike 或回滚。 这组数字之所以引人注目,是因为它背后同时改动模型、目标、数值和系统。
MLA + DeepSeekMoE
沿用 V2 验证过的低缓存 attention 与细粒度专家。
Aux-loss-free balance
用动态 expert bias 调整负载,减少辅助平衡损失对主目标的干扰。
Multi-Token Prediction
训练时预测多个未来 Token,增加训练信号,并可转化为推测解码草稿能力。
FP8 + DualPipe
低精度训练、计算通信重叠、跨节点专家并行共同压低成本。
无辅助损失负载均衡
MoE 必须避免少数专家过载。传统做法加入 load-balancing auxiliary loss, 但它与语言建模主目标可能冲突:为了均匀而把 Token 送给次优专家。V3 为每个专家维护 bias, 根据近期负载上调冷门专家、下调热门专家;bias 只影响路由选择,不直接进入最终门控权重, 从而把“系统要均衡”和“模型要准确”更松地解耦。
专题版推导会进一步区分 z-loss、辅助平衡损失、Loss-Free expert bias 与 K3 Quantile Balancing;“aux-loss-free”并不等于系统里不存在任何平衡约束。
FP8 训练真正难在哪
FP8 动态范围和有效精度有限,不能简单把所有 tensor 强转为 8 位。V3 使用细粒度量化、较高精度累加、 在线缩放和特定敏感模块的高精度保留;同时让低精度通信减少跨卡带宽。 论文最值得看的不是“首次大规模 FP8”宣传,而是哪些路径降精度、哪些路径绝不降,以及误差怎样被控制。
DualPipe:流水线的空泡是一笔真金白银
Pipeline Parallel 把层切到不同 stage;朴素调度会让设备在前向/反向依赖之间等待。 DualPipe 从流水线两端同时喂入 micro-batch,并重叠前向、反向与专家通信,尽量把空泡藏在计算后面。 它与 DeepEP 的高吞吐/低延迟 all-to-all 一起,把 MoE 理论稀疏性变成真实集群效率。
05 DEEPSEEKMATH / GRPO
GRPO:不用再养一个和策略模型同样昂贵的 Critic
DeepSeekMath 不只是数学模型论文。 它在 7B 模型和 120B 数学相关 Token 上验证数据工程,同时提出 Group Relative Policy Optimization, 为后来 DeepSeek-V2 对齐和 R1 大规模推理 RL 铺路。
PPO 的显存账单
经典 RLHF/PPO 常同时保留 policy、reference、reward model 和 value/critic model。 对大模型而言,critic 往往与 policy 同量级。GRPO 对同一道题采样一组答案, 用组内奖励的均值和标准差构造相对优势,省去单独 value model。
组相对不是免费午餐
一道题要采样多条答案,rollout 成本仍然很高;奖励若不可验证或存在偏差,组内比较也会放大奖励漏洞。 当一组奖励全相同,归一优势几乎不给学习信号。R1 的成功因此同时依赖可验证数学/代码奖励、足够多样的采样和大规模基础设施。
06 DEEPSEEK-R1
R1-Zero 最重要的实验:先不教推理格式,只给可验证结果奖励
DeepSeek-R1 的历史意义, 是把“推理可以通过大规模 RL 从强 base model 中被激发”做成公开、可研究的系统证据。
R1-Zero 做了什么
从 DeepSeek-V3 Base 出发,不先做推理 SFT,直接以 GRPO 进行大规模 RL。 奖励以答案正确性为主,并加入格式奖励。训练中出现更长推理、反思、回溯和自我验证等行为; 论文把某些突然延长思考的轨迹称为 “aha moment”。
它也明确暴露了纯 RL 的问题
R1-Zero 会重复、可读性差、混合语言。奖励只关心最终正确时,模型没有充分动力照顾人类阅读体验。 正式 R1 因而先加入少量高质量 cold-start CoT 数据,再做 reasoning-oriented RL; 随后用 rejection sampling 产生 SFT 数据,混入写作、事实问答等非推理任务,再进行第二阶段 RL 兼顾帮助性与安全。
Distillation 的关键发现
团队用 R1 生成的推理样本微调 Qwen/Llama dense 模型,发布 1.5B–70B 蒸馏版本。 这说明小模型不一定要自己承担完整的探索式 RL 成本,可以模仿强 reasoning teacher 的轨迹; 但蒸馏得到的是 teacher 数据分布上的能力,不等于小模型内部复现了同样的 RL 发现过程。
长轨迹可能包含有效搜索,也可能是重复与绕路。R1 证明的是在可验证任务和适当训练下, 增加推理计算可以转化为能力;不是“输出越长越聪明”。
07 DEEPSEEK-V3.2
从会推理到会在长上下文里使用工具
DeepSeek-V3.2 把三条线合并: DeepSeek Sparse Attention(DSA)降低长上下文成本,更大规模的 RL 提升 reasoning, Agentic task synthesis 则把 reasoning 放进工具交互轨迹。
DSA 的两阶段直觉
完整注意力让每个 Query 和全部历史交互。DSA 先用轻量、可学习的 indexer 给历史 Token 评分, 选出小部分候选,再让主 attention 只在候选上做高容量计算。 关键不只是 top-k,而是 indexer 也在训练中学习“什么值得看”;这比固定窗口更能适应内容相关的远距离依赖。
Agent 方面,V3.2 的任务合成管线系统地产生复杂、交互式工具任务,让思考与 tool use 交织。 这与 K3 的 white-box harness、知识图谱任务合成和可验证环境形成同期对照:前沿模型竞争正在从静态题库转向训练环境。
08 DEEPSEEK-V4
百万上下文从“支持”变成一套专门架构
2026 年的 DeepSeek-V4 preview 包含 1.6T-A49B 的 Pro 与 284B-A13B 的 Flash,均支持 1M Token。 它使用 Compressed Sparse Attention(CSA)与 Heavily Compressed Attention(HCA)的混合注意力, Manifold-Constrained Hyper-Connections(mHC)改善深度残差,并采用 Muon 优化器。
V4 官方报告摘要数据;模型是 preview 版本,后续版本需按研究截止日重新核验。
报告称在 1M 上下文下,V4-Pro 的单 Token 推理 FLOPs 是 V3.2 的 27%,KV Cache 是 10%。 这说明长上下文竞争已从单一位置外推转向混合注意力、压缩缓存、残差、优化器和后训练的系统协同。 它也解释 K3 报告为何把 V4 列为同代开放基础模型对照。
进入长上下文专题,可以把 V4 的 CSA/HCA 与 K3 的 KDA/NoPE MLA 放进同一张“计算—缓存—状态容量”账本逐项比较。
V4 用 CSA/HCA 混合压缩与稀疏注意力;K3 用 3:1 KDA/Gated MLA 混合线性递归与全局注意力。 两者目标相近——降低百万上下文成本并保留能力——但状态表示、检索方式和系统内核不同。
09 INTO KIMI K3
DeepSeek 的哪些思想直接流入 K3,哪些只是同期呼应
这正是为什么 DeepSeek 值得在 LLM Atlas 中作为贯穿案例:它不是 K3 的“对手名单”之一, 而是 K3 架构里多条思想的公开祖先与同代参照。读懂 V2 的 MLA 和 DeepSeekMoE, K3 的一半架构会突然变得熟悉。
↳ READING ORDER
建议精读顺序:不要直接从 R1 开始
建立 dense、数据与 scaling 基线;精读架构与 scaling law 部分。
DeepSeekMoE精读 fine-grained segmentation、shared expert isolation 与消融。
DeepSeek-V2精读 MLA 推导、RoPE 解耦、权重吸收和 KV Cache 对比。
DeepSeek-V3分四遍读:架构、FP8、DualPipe/通信、MTP 与后训练。
DeepSeekMath先理解 PPO,再推导 GRPO 的组相对优势与 KL 项。
DeepSeek-R1对照 R1-Zero 与 R1 pipeline,区分 RL 涌现、冷启动与蒸馏。
DeepSeek-V3.2把稀疏 attention 与 agentic task synthesis 放在一起读。
DeepSeek-V4从百万上下文成本倒推 CSA/HCA、mHC 与 Muon。