SPOTLIGHT / DEEPSEEK · ROUND 08 TASK BOOTSTRAP × COMMON RANDOM NUMBERS × FULL DEPTH

不要背模型名
要看懂每次为什么转向

这不是七篇报告的摘要,而是一套可追问、可计算、可反驳的技术谱系: 容量、激活、缓存、通信、数值、奖励和长程状态各自记账,再看它们怎样从 DeepSeek LLM 一路汇入 V4,并与 Kimi K3 发生继承或分叉。

SPAN
2024.01 → 2026.06
LEDGERS
24 张问题账
LINEAGE
10 次技术转向
LABS
22 个可操作实验
EVIDENCE
60 个一手 / 官方节点
STATUS
八轮 · 864 条采样

00 THE PROBLEM COMPASS

先把二十四个对象分开,才不会被“大、快、强”三个字带走

一篇技术报告最容易制造的错觉,是把参数量、激活计算、缓存、训练成本、吞吐和能力揉成一个“效率”。 下面每张账只问一个对象,并把回答能走到哪里、不能走到哪里同时写出来。

Q01Dense 坐标系

为什么 DeepSeek LLM 不是可跳过的序章?

它固定 tokenizer、数据、架构和 scaling 试验的起点;并不单独证明后续所有设计。

Q02参数角色

671B / 37B 各表示什么?

total 是装下的容量,activated 是每 Token 经过的专家参数子集;都不等于端到端 FLOPs。

Q03专家粒度

为什么切小专家还要多选?

DeepSeekMoE 把每个专家缩成 1/m,总数和激活数同乘 m,近似保持专家计算。

Q04Shared expert

为什么把公共知识单独隔离?

始终激活的 shared experts 减少 routed experts 重复;它们仍然要付激活计算。

Q05通信税

为什么稀疏 FLOPs 不等于便宜?

路由会产生 dispatch/combine、跨节点 all-to-all、负载长尾和权重访问。

Q06均衡

aux-loss-free 到底去掉了什么?

V3 的 expert bias 影响选择、不进入最终 gate weight;仍有 sequence-wise auxiliary loss 防极端失衡。

Q07KV 状态

为什么 V2 把服务状态当架构问题?

权重只装一次,KV 随请求、层、Token 增长,直接限制并发和长上下文。

Q08Attention 压缩

MQA、GQA、MLA 的差别是什么?

MQA/GQA 共享 K/V 头;MLA 联合低秩压缩 K/V 内容并在计算中恢复。

Q09矩阵吸收

MLA 为什么不必恢复完整 content K/V?

无位置项时可利用矩阵乘结合律,把 K/V 上投影吸收到 query/output 投影。

Q10位置分叉

为什么要 decoupled RoPE?

RoPE 会阻断固定权重吸收,所以 V2 另设小 RoPE query/key 分支,并缓存 key。

Q11FP8 合同

“FP8 训练”包含哪些角色?

主要 GEMM 用 FP8,并配细粒度缩放、较高精度累加和高精度敏感算子;不是全路径 FP8。

Q12Pipeline

DualPipe 隐藏了什么?

从两端注入 micro-batch,让成对前后向 chunk 与通信重叠;它减少而非清零 bubble。

Q13MTP

训练和推理各怎样使用 MTP?

顺序模块增加未来 Token 监督;推理可丢弃,也可复用于 speculative draft。

Q14GRPO

去掉 critic 后还剩什么?

policy/reference、同题多 rollout、reward/verifier、clip 和 KL;主要省掉 value model。

Q15可验证奖励

R1-Zero 的奖励能覆盖哪些任务?

论文用数学、代码、逻辑等规则可验证域和格式奖励;开放任务仍是限制。

Q16纯 RL 实验

R1-Zero 究竟证明了什么?

强 V3 Base 在无 reasoning SFT 时可被规则奖励继续塑造;不等于没有预训练先验。

Q17R1 pipeline

正式 R1 为什么不是纯 RL?

cold start → reasoning RL → rejection/SFT mix → general RL,分别修可读性、广度和对齐。

Q18蒸馏

学生为什么不是“小号 R1-Zero”?

1.5B–70B 学生主要对约 800K 教师样本做 SFT,没有重演同一 RL 探索。

Q19复现反查

DAPO / Dr.GRPO 修的是哪类问题?

它们处理 clip、采样、聚合、截断、长度和难度偏差;是后续研究,不是已披露 R1 内部配方。

Q20DSA

可学习 indexer 为什么不是固定稀疏?

indexer 对历史内容评分,主 attention 只读 top-k;它需要专门训练,也可能漏检。

Q21Agent 数据

V3.2 怎样把 reasoning 放进环境?

specialist distillation + mixed RL;环境、工具、任务、解法和 verifier 构成数据闭环。

Q22V4 Attention

CSA 与 HCA 各压什么?

CSA 先压缩再稀疏 top-k;HCA 更强压缩后保留全部 compressed entries。

Q23V4 稳定化

mHC、Muon、QK/RMSNorm、clamp 各管什么?

它们分别管残差混合、矩阵更新、attention 尺度和 FFN 极值,不能合成一个技巧。

Q24K3 对照

哪些是祖先,哪些只是同题新解?

DeepSeekMoE/MLA 有明确继承;QB、KDA、AttnRes、SiTU、MOPD 多是新解或同期路线。

一条贯穿全文的读法

先认对象→再看瓶颈→找到机制→核对系统代价→最后看证据边界

01 TEN PROBLEM SHIFTS

时间线不是发布会日历,而是十次“问题定义”转向

把 DeepSeek 看成模型名字序列会很乱;把它看成“容量、缓存、训练、推理、长上下文”五张账单, 技术演进就清楚了。

2024.01
DS / 01

DeepSeek LLM

公开尺度规律与中英双语预训练,建立 7B / 67B dense 基线。

通向下一步

先弄清规模、数据与训练配方,再做稀疏化。

2024.01
DS / 02

DeepSeekMoE

细粒度专家分割 + shared experts,让专家更专、公共知识不必重复。

通向下一步

把容量扩张和每 Token 计算量分开。

2024.02
DS / 03

DeepSeekMath

从大规模数学数据工程走到 GRPO:用同题多条回答的相对奖励,省去独立 critic。

通向下一步

R1 的推理 RL 不是突然出现;算法与可验证数据的预演在这里发生。

2024.05
DS / 04

DeepSeek-V2

MLA 压缩 KV Cache;DeepSeekMoE 扩张稀疏容量。

通向下一步

训练经济性之外,开始直接优化推理内存与吞吐。

2024.12
DS / 05

DeepSeek-V3

671B-A37B、FP8 训练、无辅助损失负载均衡、MTP 与 DualPipe。

通向下一步

模型算法、数值格式与集群通信共同设计。

2025.01
DS / 06

DeepSeek-R1

R1-Zero 从强 V3 Base 直接做规则奖励 RL、没有 reasoning SFT;R1 再用冷启动与多阶段训练修复可读性和广度。

通向下一步

从“模仿答案”转向用可验证奖励塑造推理策略。

2025.03
PUBLIC FOLLOW-UP

DAPO / Dr.GRPO

公开后续研究分别暴露 clipping、采样、截断、响应长度与题目难度归一偏差。

通向下一步

复现不是 R1 的内部 recipe,而是一台看清 RL 优化对象的显微镜。

2025.12
DS / 08

DeepSeek-V3.2

DeepSeek Sparse Attention 降低长上下文成本,并统一 thinking 与 tool use。

通向下一步

把推理模型推进长上下文 Agent 场景。

2026.06
DS / 09

DeepSeek-V4

CSA/HCA 构成异构长状态,mHC 约束深层残差,Muon 与数值边界共同支撑百万 Token。

通向下一步

长上下文不再只是位置外推,而是注意力、训练与服务的全系统问题。

W1

Dense 坐标

先固定数据、tokenizer、训练与 scaling 对照,后面的结构收益才有可比起点。

W2

稀疏容量

细粒度 routed experts 加 shared experts,把总容量与单 Token 激活计算第一次清楚分开。

W3

服务状态

MLA 不再只优化训练 FLOPs,而是直接改写随请求增长的 KV Cache。

W4

协同训练

V3 把路由、FP8、MTP、pipeline 与通信写成同一套训练合同。

W5

推理 RL

DeepSeekMath 先减掉 critic;R1-Zero 再隔离规则奖励,R1 恢复可读性与通用性。

W6

复现显微镜

DAPO 与 Dr.GRPO 暴露 clipping、采样、截断、长度归一和题目难度偏差。

W7

稀疏检索

V3.2 用学习型 indexer 选历史,再让主 attention 读取 top-k。

W8

Agent 环境

推理从静态题目进入含工具、状态转移和 verifier 的交互数据闭环。

W9

异构长状态

V4 用 CSA 与 HCA 处理不同时间尺度,并联合 mHC、Muon 和数值约束。

W10

K3 对照

继承图必须允许没有箭头:相同的百万上下文目标,可以有完全不同的状态机器。

核心观察

DeepSeek 的强项是把模型结构和硬件约束写在同一张设计图里。MLA 不只是新 attention, 它直接针对服务时 KV Cache;FP8 不只是少用几个比特,它要求累加精度、缩放和通信共同配合; GRPO 不只是 PPO 变体,它直接移除同规模 critic 的显存负担。

02 NUMBER GRAMMAR

先学会读报告数字:总容量、激活路径和系统成本不是同一列

TOTAL PARAMETERS模型“装得下”多少容量

MoE 的绝大多数专家参数对某个 Token 并未激活,但部署时权重仍要存放、调度和读取。

ACTIVATED PARAMETERS单 Token 经过哪部分参数

它比 total 更接近稀疏计算量,却仍不包含 attention、router、通信、padding 和 kernel 效率。

STATE / BYTES请求进行时不断增长的历史

KV/latent state 与层数、上下文、batch 和存储格式相乘,是 V2 之后独立的一等架构对象。

WALL CLOCK / SCORE系统与协议共同产出的结果

GPU hours、吞吐和 benchmark 必须携带硬件、软件、预算、脚手架与比较基线。

以 V3 的 671B-A37B 为例

671B 描述总容量,37B 描述每 Token 激活的参数子集;它不等于“和 37B dense 一样便宜”, 因为 attention、专家 dispatch/combine、负载长尾、并行通信与实际 kernel 都没有被这个缩写计算进去。

03 DEEPSEEK LLM

先用 Dense 模型建立基线:规模、数据和双语能力

2024 年初的 DeepSeek LLM 发布 7B 与 67B dense 模型, 在约 2T 中英文 Token 上预训练。它的重要性不在今天看来并不夸张的参数量,而在于建立后续研究的可比基线: tokenizer、数据配方、训练稳定性、中文评测和 scaling behavior 有了统一起点。

为什么先做 Dense 很重要

MoE 同时改变总参数、激活参数、路由、通信和数据分配。没有 dense 基线,很难判断收益来自“更多容量” 还是来自别的训练差异。DeepSeek LLM 还训练小规模模型拟合 scaling laws, 再用这些规律选择 67B 的超参数;这条“先小规模试验,再外推大模型”的方法后来在 V3/K3 都持续出现。

把这一代当作实验坐标系

DeepSeek LLM 回答的是“如果我们先不引入稀疏专家和低秩缓存,一套扎实的中英 dense Transformer 能到哪里?” 后面的论文才有明确的对照物。

04 DEEPSEEKMOE

专家越大不一定越专:把一个大专家拆成许多细粒度专家

传统 MoE 往往把 FFN 分成少数大专家,每个 Token 选 1–2 个。问题是一个大专家仍可能同时处理许多无关知识, 专家之间也会重复学习公共能力。DeepSeekMoE提出两项互补策略。

CONVENTIONAL MOE

少数大专家

E1E2E3E4

每个专家覆盖面广,公共知识在多个专家中重复;可组合的专业分工有限。

DEEPSEEKMOE

细粒度 routed + shared

Se1e2e3e4e5e6e7

shared expert 吸收公共知识;更多小 routed experts 可以按 Token 组合出细分能力。

Fine-Grained Expert Segmentation

在保持单 Token 激活计算近似不变时,把专家 FFN 切得更小,同时选择更多个小专家。 组合数显著增加:同样的 Token 可以同时调用“代码语法”“Python 库”“矩阵计算”等几个子专长, 不必把它们硬塞进一个笼统的“代码专家”。

Shared Expert Isolation

某些变换几乎每个 Token 都需要。如果全部交给 routed experts,多个专家会重复学习。 DeepSeekMoE 把 shared experts 始终激活,承担公共知识;路由专家获得更强动力去形成差异化专长。 这套组织直接进入 DeepSeek-V2/V3,也成为 Kimi K3 Stable LatentMoE 的结构祖先。

MoE 的代价从 FLOPs 转移到了通信

Token 必须被发送到拥有对应专家的设备。专家越细、选择越多,all-to-all、负载波动和权重读取越可能成为瓶颈。 因此模型侧路由与系统侧 Expert Parallel 从来不能分开看。

进入 MoE 专题:比较粗专家、细粒度专家与共享专家 →

05 DEEPSEEK-V2 / MLA

训练只付一次参数成本,KV Cache 却在每个请求、每个 Token 上重复付费

DeepSeek-V2 是整条谱系的关键转折: 236B 总参数、21B 激活参数、128K 上下文,把 DeepSeekMoE 用于训练经济性, 再用 Multi-head Latent Attention(MLA)直接攻击推理服务的内存瓶颈。

−42.5%训练成本
−93.3%KV Cache
5.76×最大生成吞吐

均为 V2 报告相对 DeepSeek 67B 的特定配置结果,不应外推为任意硬件上的固定倍数。

标准 MHA 为什么会让 KV Cache 爆长

自回归生成每一步都要查询历史 Token。历史的 K/V 不变,因此缓存起来避免重算。 但 MHA 为每层、每个 Token、每个 head 保存 K 和 V;batch、序列和层数一大,缓存会吃掉大量显存, 直接限制并发和长上下文。

cₜᴷⱽ = Wᴰᴷⱽhₜ  kₜᶜ = Wᵁᴷcₜᴷⱽ  vₜᶜ = Wᵁⱽcₜᴷⱽ省略 decoupled RoPE key、各 head 展开与权重吸收细节。核心是 K/V 先联合低秩压缩,缓存 latent 而非完整多头表示。

为什么 MLA 比简单 MQA/GQA 更有野心

MQA 让所有 Query heads 共用一组 K/V,GQA 让一组 Query heads 共用 K/V,缓存更小但容量可能下降。 MLA 用低秩 latent 保留可恢复的内容子空间,并把 RoPE 相关部分分离,追求接近 MHA 的表达力与更小缓存。 它后来被 Kimi K2/K2.5 采用,并在 K3 中作为周期性全局注意力保留。

06 WEIGHT ABSORPTION × DECOUPLED ROPE

MLA 真正精巧的地方:低秩只是第一步,能否不还原才决定推理价值

V2 把历史内容压到联合 latent cₜᴷⱽ。如果每次 attention 又把它上投影回所有 head 的完整 content K/V,缓存虽然小了,解码计算和中间张量仍会把收益吃掉。线性代数的结合律允许把固定上投影移到 query 与 output 权重一侧。

KEY CONTENTqᵀ(Wᵁᴷc) = (Wᵁᴷᵀq)ᵀc

先变换当前 query,再直接与缓存 latent 相乘;不需要物化完整多头 content key。

VALUE CONTENTWᴼ(Wᵁⱽc) = (WᴼWᵁⱽ)c

value 上投影也可预先并入 output projection,计算对象仍停留在低维 latent。

POSITION BREAKS ITqᵀR(t−j)Wᵁᴷc

RoPE 的旋转依赖相对位置,不能成为一组固定吸收权重,所以 V2 把位置分支单独拆出。

cacheMLA / token / layer = dc + dhR = 512 + 64 = 576 elements这是 V2 配置的 content latent 与 decoupled RoPE key 之和。只写 512 会漏掉位置缓存;字节数还要乘 dtype、层数、上下文与 batch。
MLA、MQA、GQA 不能只比一个压缩百分比

MQA/GQA 通过共享 K/V 头减少状态;MLA 用联合低秩内容空间与独立位置分支减少状态。 表达能力、投影计算、kernel 支持和量化元数据都依配置而变,实验台会把“元素公式”与“报告数字”分开展示。

07 DEEPSEEK-V3

V3 的亮点不是一个技巧,而是四层协同

DeepSeek-V3 扩到 671B 总参数、37B 激活参数, 在 14.8T Token 上预训练。报告给出的完整训练用量约 2.788M H800 GPU hours,并称整个训练没有不可恢复的 loss spike 或回滚。 这组数字之所以引人注目,是因为它背后同时改动模型、目标、数值和系统。

MODEL

MLA + DeepSeekMoE

沿用 V2 验证过的低缓存 attention 与细粒度专家。

ROUTING

Aux-loss-free balance

用动态 expert bias 调整负载,减少辅助平衡损失对主目标的干扰。

OBJECTIVE

Multi-Token Prediction

训练时预测多个未来 Token,增加训练信号,并可转化为推测解码草稿能力。

SYSTEM

FP8 + DualPipe

低精度训练、计算通信重叠、跨节点专家并行共同压低成本。

无辅助损失负载均衡

MoE 必须避免少数专家过载。传统做法加入 load-balancing auxiliary loss, 但它与语言建模主目标可能冲突:为了均匀而把 Token 送给次优专家。V3 为每个专家维护 bias, 根据近期负载上调冷门专家、下调热门专家;bias 只影响路由选择,不直接进入最终门控权重, 从而把“系统要均衡”和“模型要准确”更松地解耦。

专题版推导会进一步区分 z-loss、辅助平衡损失、Loss-Free expert bias 与 K3 Quantile Balancing;“aux-loss-free”并不等于系统里不存在任何平衡约束。

FP8 训练真正难在哪

FP8 动态范围和有效精度有限,不能简单把所有 tensor 强转为 8 位。V3 使用细粒度量化、较高精度累加、 在线缩放和特定敏感模块的高精度保留;同时让低精度通信减少跨卡带宽。 论文最值得看的不是“首次大规模 FP8”宣传,而是哪些路径降精度、哪些路径绝不降,以及误差怎样被控制。

DualPipe:流水线的空泡是一笔真金白银

Pipeline Parallel 把层切到不同 stage;朴素调度会让设备在前向/反向依赖之间等待。 DualPipe 从流水线两端同时喂入 micro-batch,并重叠前向、反向与专家通信,尽量把空泡藏在计算后面。 它与 DeepEP 的高吞吐/低延迟 all-to-all 一起,把 MoE 理论稀疏性变成真实集群效率。

08 ROUTING WITHOUT OBJECTIVE COLLISION

让系统更均匀,但别让“均匀”改写模型真正想选的专家

路由有两种意图:模型想把 Token 交给最适合的专家,集群希望每个专家收到近似相同的负载。 传统辅助损失直接进入训练目标,均衡梯度可能与语言建模梯度争夺方向。V3 给每个 routed expert 维护动态 bias: 热门专家下调,冷门专家上调。

SELECTIONtop-k(sᵢ + bᵢ)

动态 bias 只改变谁能进入候选集合。

≠
COMBINATIONΣ gᵢEᵢ(h)

真正组合专家输出时,gate weight 不含这个 balance bias。

+
SAFETY RAILsequence-wise aux

报告仍保留序列级辅助项,防止单个序列出现极端失衡。

所以 “auxiliary-loss-free” 指主要全局负载策略不靠辅助损失,并不等于训练系统完全没有辅助均衡约束。 K3 的 Quantile Balancing 继续处理同一个问题,但面对近千专家使用不同的分位数反馈,属于同题新解。

09 FP8 ROLE CONTRACT

“用 FP8 训练”不是一个开关,而是一张谁低精度、谁负责兜底的岗位表

数值角色V3 的处理为什么不能一刀切
主要 GEMM 输入FP8 + 细粒度缩放

吞吐和通信收益最大,但要控制不同 tile/block 的动态范围。

乘加累积更高精度路径

大量小乘积累积会放大舍入误差,不能把输入 dtype 等同于累加 dtype。

master / optimizer stateBF16 / FP32 角色

权重更新需要保留微小变化,优化器矩对精度更敏感。

Norm、Softmax 等敏感算子高精度保留

尺度估计和概率归一若失真,会向全层传播。

activation 与通信按路径选择

节省保存与带宽,但要把缩放元数据和转换成本一起计入。

判断任何“低精度训练”声明时,至少问六个问题

输入是什么格式?如何缩放?在哪里累加?master weight 放哪?哪些敏感算子保留高精度?通信和缓存是否也量化?

10 DUALPIPE × DEEPEP

理论 FLOPs 不会自动变成训练吞吐:GPU 等待和跨节点搬运都要付墙钟时间

Pipeline Parallel 把连续层分给不同 stage。一次前向必须沿 stage 传播,反向又沿相反方向返回; micro-batch 不够多或调度不佳时,管线两端会出现大片空泡。DualPipe 从两端注入 micro-batch, 把成对的 forward/backward chunk 排在一起,并尝试将 MoE 的 dispatch/combine 隐藏在计算之后。

DeepEP 则负责专家并行的高吞吐/低延迟 all-to-all。两者解释了一个重要边界: DeepSeekMoE 的参数稀疏性是模型性质,真实集群效率必须由拓扑、路由分布和通信 kernel 兑现。

11 MULTI-TOKEN PREDICTION

MTP 不是把一次采样魔法般变成多 Token,而是给每层表示更多未来监督

标准 next-token prediction 每个位置只监督下一个 Token。V3 在主模型之后串联多个 MTP module: 第 k 个模块结合上一模块的状态与更远未来 Token 的 embedding,预测第 k+1 个未来目标。 embedding 与 output head 可与主模型共享。

TRAIN增加未来监督密度

每段文本为中间表示提供更多学习信号,并鼓励预先组织未来信息。

→
PLAIN INFERENCE模块可以丢弃

主模型仍按标准自回归方式运行,不必为训练辅助头永久付费。

或
DRAFT INFERENCE改作推测解码

让 MTP 给出候选未来 Token,再由主模型验证;收益依接受率与 kernel 而定。

L = LNTP + λ · meank(LMTPk)V3 的目标是顺序多未来监督;它与一次并行确定输出多个 Token、blockwise decoding 或独立 draft model 都不完全相同。

12 DEEPSEEKMATH / GRPO

GRPO:不用再养一个和策略模型同样昂贵的 Critic

DeepSeekMath 不只是数学模型论文。 它在 7B 模型和 120B 数学相关 Token 上验证数据工程,同时提出 Group Relative Policy Optimization, 为后来 DeepSeek-V2 对齐和 R1 大规模推理 RL 铺路。

PPO 的显存账单

经典 RLHF/PPO 常同时保留 policy、reference、reward model 和 value/critic model。 对大模型而言,critic 往往与 policy 同量级。GRPO 对同一道题采样一组答案, 用组内奖励的均值和标准差构造相对优势,省去单独 value model。

PROMPT证明 / 求解一道题
sample group
y₁reward 0
y₂reward 1
y₃reward 0.7
y₄reward 0.2
normalize
RELATIVE ADVANTAGE高于组均值的轨迹被鼓励
Âᵢ = (rᵢ − mean(r₁…rᴳ)) / (std(r₁…rᴳ) + ε)GRPO 完整目标仍包含 clipped policy ratio 与 KL 约束;这里只展示“组相对优势”这一核心直觉。

组相对不是免费午餐

一道题要采样多条答案,rollout 成本仍然很高;奖励若不可验证或存在偏差,组内比较也会放大奖励漏洞。 当一组奖励全相同,归一优势几乎不给学习信号。R1 的成功因此同时依赖可验证数学/代码奖励、足够多样的采样和大规模基础设施。

13 R1-ZERO / ISOLATION EXPERIMENT

它隔离掉的是 reasoning SFT,不是预训练知识、提示先验和验证器

R1-Zero 从 DeepSeek-V3 Base 开始,直接用 GRPO 与规则奖励训练,没有先用人工或教师 CoT 做 reasoning SFT。 这让研究者能单独观察:强 base model 中已有的求解分布,能否被结果奖励重新排序和继续塑造。

刻意移除reasoning SFT

不先规定“优秀推理轨迹应该长什么样”。

依然存在V3 Base

大规模预训练已经提供数学、代码、语言和潜在反思模式。

依然存在rule verifier

准确性与格式奖励定义了什么会被强化。

依然存在rollout + GRPO

同题多样采样、相对优势、clip 与 KL 仍构成优化系统。

训练中出现更长轨迹、反思、回溯与自我验证,论文把部分轨迹描述为 “aha moment”。 但公开的 Dr.GRPO 研究观察到 V3 Base 本身也能生成 “wait”等反思词,因此词面现象不能作为“RL 从零发明推理”的因果证据。

R1-Zero 证明的是可塑性,不是无中生有

更严谨的结论是:在强 base、可验证任务和大规模 rollout 条件下,无 reasoning SFT 的规则奖励 RL 能显著改变求解策略与测试时计算。开放任务、不可验证质量和 base 能力边界仍然没有被这个实验消除。

14 DEEPSEEK-R1 / USABLE PIPELINE

正式 R1 的贡献,是承认隔离实验不等于可直接使用的助手

DeepSeek-R1 的历史意义, 不只在 R1-Zero 的能力增长,也在把可读性、广度、帮助性和安全重新接回训练流程。

R1-Zero 暴露的问题决定了后面的每个阶段

R1-Zero 会重复、可读性差、混合语言。奖励只关心最终正确时,模型没有充分动力照顾人类阅读体验。 正式 R1 因而先加入少量高质量 cold-start CoT 数据,再做 reasoning-oriented RL; 随后用 rejection sampling 产生 SFT 数据,混入写作、事实问答等非推理任务,再进行第二阶段 RL 兼顾帮助性与安全。

BASEDeepSeek-V3 Base强预训练基础
→
COLD START少量可读 CoT稳定格式与语言
→
REASONING RL可验证奖励 + GRPO强化求解策略
→
SFT MIX拒绝采样 + 通用数据恢复广泛任务
→
FINAL RL帮助性与安全统一模型

Distillation 的关键发现

团队用 R1 生成并筛选的约 800K 样本微调 Qwen/Llama dense 模型,发布 1.5B–70B 蒸馏版本。 这说明小模型不一定要自己承担完整的探索式 RL 成本,可以模仿强 reasoning teacher 的轨迹; 但蒸馏得到的是 teacher 数据分布上的能力,不等于小模型内部复现了同样的 RL 发现过程。

CoT 变长不等于推理一定更好

长轨迹可能包含有效搜索,也可能是重复与绕路。R1 证明的是在可验证任务和适当训练下, 增加推理计算可以转化为能力;不是“输出越长越聪明”。

进入推理专题:从 DeepSeekMath、R1 到 DAPO / Dr.GRPO 的完整推导 →

15 PUBLIC FOLLOW-UP / DAPO × DR.GRPO

复现不是脚注:它把“R1-like 训练有效”拆成了四种优化偏差

DAPO 与Understanding R1-Zero-Like Training都是 R1 之后的公开研究,不是 DeepSeek 已披露的内部 R1 recipe。它们的价值是让研究者看到: 一条奖励曲线上升,可能同时包含能力改善、采样过滤、长度倾向和损失聚合偏差。

DAPO / CLIP-HIGHER

正向更新别太早被截断

提高正优势样本的上界,为少见但正确的长推理保留更大上升空间。

DAPO / DYNAMIC SAMPLING

全对与全错组不给相对信号

过滤组内奖励方差为零的 prompt,避免花 rollout 成本却得到近零归一优势。

DAPO / TOKEN-LEVEL LOSS

先按 Token 聚合再更新

改变不同长度响应对 batch 梯度的权重,避免 response-level aggregation 的隐含偏置。

DAPO / OVERLONG SHAPING

截断不该制造奖励悬崖

对接近长度上限的轨迹做平滑惩罚,降低突然截断带来的噪声。

DR.GRPO / TWO BIASES

响应长度偏差 + 题目难度偏差

response-level 长度归一会改变长短答案的 Token 权重;用每题组内标准差归一,又会让不同奖励方差的题目获得不同尺度。 Dr.GRPO 去掉这些归一项,追问“我们究竟在优化正确率,还是在无意中优化长度与题型权重?”

这些修正没有给出唯一正确的 RL 算法

它们给出的是审计工具:观察采样组是否有方差、clip 是否非对称、长响应怎样进入损失、截断怎样进入奖励、 不同难度题是否被标准差重新加权。页面实验台会让这些偏差在一个小样本里显形。

16 DEEPSEEK-V3.2 / DSA

从会推理到会在长上下文里使用工具

DeepSeek-V3.2 把三条线合并: DeepSeek Sparse Attention(DSA)降低长上下文成本,更大规模的 RL 提升 reasoning, Agentic task synthesis 则把 reasoning 放进工具交互轨迹。

DSA 的两阶段直觉

完整注意力让每个 Query 和全部历史交互。DSA 先用轻量、可学习的 indexer 给历史 Token 评分, 选出小部分候选,再让主 attention 只在候选上做高容量计算。 关键不只是 top-k,而是 indexer 也在训练中学习“什么值得看”;这比固定窗口更能适应内容相关的远距离依赖。

123456789101112131415161718
learned indexer → top-k
2671317
main attentionQuery

Agent 方面,V3.2 的任务合成管线系统地产生复杂、交互式工具任务,让思考与 tool use 交织。 这与 K3 的 white-box harness、知识图谱任务合成和可验证环境形成同期对照:前沿模型竞争正在从静态题库转向训练环境。进入 Agent 专题查看 V3.2 的 search/code/general-agent 合成管线 →

17 V3.2 / AGENTIC DATA LOOP

从“回答一道题”到“在环境里留下可验证的状态变化”

V3.2 的 Agent 能力不是在聊天模板上多放几个 tool token。报告把 specialist distillation 与 mixed RL 结合, 分别训练 search、code 和 general-agent 能力,再把它们蒸馏回统一模型。general-agent 部分报告了 1,827 个合成环境;这个数字只代表该报告口径,不是所有 Agent 数据的总量。

ENVIRONMENT有状态世界

文件、网页、API 或模拟器会因动作而改变。

→
TOOLS受约束动作

schema、权限、错误和延迟共同限定策略空间。

→
TASK + SOLUTION可执行轨迹

不只要语言通顺,还要工具调用能够推进状态。

→
VERIFIER检查最终世界

最终答案、测试、文件或环境状态构成奖励证据。

这条线与 K3 的 white-box harness、知识图谱任务合成和百万 Token Agentic RL 同期呼应; 两份报告都把竞争焦点从静态 benchmark 推向“环境能否生成、执行、验证和归因”。Agent 专题给出了完整环境合同与失败树 →

18 DEEPSEEK-V4

百万上下文从“支持”变成一套专门架构

2026 年的 DeepSeek-V4 preview 包含 1.6T-A49B 的 Pro 与 284B-A13B 的 Flash,均支持 1M Token。 它使用 Compressed Sparse Attention(CSA)与 Heavily Compressed Attention(HCA)的混合注意力, Manifold-Constrained Hyper-Connections(mHC)改善深度残差,并采用 Muon 优化器。

1.6T / 49BV4-Pro total / active
284B / 13BV4-Flash total / active
>32T预训练 Token

V4 官方报告摘要数据;模型是 preview 版本,后续版本需按研究截止日重新核验。

报告称在 1M 上下文下,V4-Pro 的单 Token 推理 FLOPs 是 V3.2 的 27%,KV Cache 是 10%。 这说明长上下文竞争已从单一位置外推转向混合注意力、压缩缓存、残差、优化器和后训练的系统协同。 它也解释 K3 报告为何把 V4 列为同代开放基础模型对照。

进入长上下文专题,可以把 V4 的 CSA/HCA 与 K3 的 KDA/NoPE MLA 放进同一张“计算—缓存—状态容量”账本逐项比较。

V4 与 K3 不是同一条注意力路线

V4 用 CSA/HCA 混合压缩与稀疏注意力;K3 用 3:1 KDA/Gated MLA 混合线性递归与全局注意力。 两者目标相近——降低百万上下文成本并保留能力——但状态表示、检索方式和系统内核不同。

19 V4 / HETEROGENEOUS STATE MACHINE

CSA 与 HCA 不是两个稀疏率档位,而是两种不同的历史表示

CSACompressed Sparse Attention
原序列压缩compressed KVindextop-kattend输出

先以较温和压缩率形成历史条目,再用 DSA 风格 indexer 选 top-k,让主 attention 只访问相关子集。

HCAHeavily Compressed Attention
原序列强压缩少量全局条目all全部读取

使用更激进的压缩率,把所有 compressed entries 保留下来,不再走与 CSA 相同的 top-k 稀疏路径。

为什么长上下文还需要一整套稳定性与优化器设计

ATTENTION SCALEheadwise Q/K RMSNorm

按 head 控制 query 与 compressed KV 的尺度。

POSITIONpartial RoPE · last 64 dims

只在部分维度编码旋转位置,保留内容与位置的职责分离。

RESIDUALmHC · expansion 4

把 residual mixing 映射到双随机 Birkhoff polytope,约束深层信息混合。

OPTIMIZERMuon + AdamW roles

多数二维参数用 Muon;embedding、head、RMSNorm 等角色仍由 AdamW 处理。

FFN EXTREMESSwiGLU clamp

线性分支截到 [−10, 10]、gate 设上限 10,限制极端激活。

KV SHARINGshared-KV MQA

再配 grouped output,把内容压缩与 head 组织一起设计。

V4 变体骨架稀疏 / 压缩合同
V4-Pro61 layers · width 7168 · 1.6T-A49B

top-6 routed experts;HCA rate 128、CSA rate 4、CSA top-k 1024。

V4-Flash43 layers · width 4096 · 284B-A13B

top-6 routed experts;同样混合 HCA/CSA,CSA top-k 512。

27% FLOPs 与 10% KV Cache 是报告内比较,不是通用常数

V4 报告把 Pro 在 1M context 下与 V3.2 比较。真实服务还受 batch、序列分布、量化、page allocator、 kernel、并行策略和硬件影响;这里保留“作者报告”标签,不把比例外推到任意部署。

20 INTO KIMI K3

DeepSeek 的哪些思想直接流入 K3,哪些只是同期呼应

DeepSeek 线索K3 中的落点关系
DeepSeekMoE shared + routed expertsStable LatentMoE 保留 shared/routed 组织直接结构祖先
V2 Multi-head Latent Attention每四层一次 Gated MLA,全局注意力明确采用并改造
V3 Auxiliary-loss-free balancingQuantile Balancing 应对近千专家同一问题的新方案
V3 FP8 / 低精度协同专家 MXFP4 权重、MXFP8 激活与 QAT更低精度的延伸
DeepSeekMath / R1 的 GRPO 与 RL多 domain、多 effort RL + MOPD共享测试时扩展范式
V4 的 Muon 参数分工Per-Head Muon 按 attention head 组织更新同优化器族的新粒度
V4 mHC:扩宽并约束 residual streamAttnRes:93 层按 12 层 block 路由到 9 个深度来源同期不同设计
V3.2 DSA / V4 CSA-HCA3 层 KDA + 1 层 NoPE Gated MLA 周期同目标、不同状态机器
R1 / V4 的离线教师与 RL 配方MOPD 让多教师给 on-policy Token 分布同题新解

这正是为什么 DeepSeek 值得在 LLM Atlas 中作为贯穿案例:它不是 K3 的“对手名单”之一, 而是 K3 架构里多条思想的公开祖先与同代参照。读懂 V2 的 MLA 和 DeepSeekMoE, K3 的一半架构会突然变得熟悉。

不要把 K3 报告里的两个 “block size” 混在一起

主模型 AttnRes 以 12 层为一个深度 block;报告中 block size 2 出现在芯片设计 nano-model 的 MiniTriton proof-of-concept,不是 93 层主模型结构。这类同词异义正是继承图必须保留上下文的原因。

21 FOUR INTERACTIVE LEDGERS

把四个最容易被口号遮住的对象,重新变成可以动手改的变量

稀疏容量实验区分总容量、激活计算与通信;MLA 实验给出精确缓存元素并把 RoPE key 算进去; V3 协同实验拆开 FP8、pipeline 与 MTP;RL 偏差镜则让零方差、长度偏差和难度归一在同一组样本里显形。

INTERACTIVE / DEEPSEEK SYSTEM ATLAS

四本账,把“模型创新”拆回可计算对象

这里混合精确计数与显式 toy model:参数组合和 KV 元素按公式计算;通信、bubble 与梯度权重只展示方向。 每个面板都标出证据边界,不能拿来替代真实 checkpoint 或集群复跑。

WORKBENCH 01 / SPARSE CAPACITY

总参数很大,不代表每个 Token 都经过全部专家

切换架构或自定义专家配置,分开观察总容量、激活计算和跨设备通信;组合数只是可选路径,不是能力分数。

TOKENhtrouter scores
→
→
COMBINEΣ gᵢEᵢ(h)shared + routed
TOTAL EXPERT CAPACITY33.0× FFN

按 expert width 折算,不含 attention

ACTIVE EXPERT COMPUTE2.0× FFN

每 Token 的教学 FFN 单位

ROUTE COMBINATIONS≈ 10¹⁵

只表示可组合路径,不代表专长质量

COMMUNICATION PRESSUREHIGH

教学指标;不是 GB/s 实测

DEEPSEEK-V3 / CAPACITY CONTRACT

V3 每层含 1 个 shared 与 256 个 routed experts,每 Token 激活 8 个 routed;理论稀疏计算仍需要 expert dispatch/combine 与负载均衡。

证据分层KV 元素与组合参数按公式;FP8/MTP/R1 角色来自官方报告;bubble、通信、数值风险和梯度 weight 为本站教学模型。

22 OFFICIAL WEIGHTS / EXECUTED

从“MLA 与 MoE 的概念”再往前一步:让官方 V2-Lite 权重真的跑起来

前面的四联实验负责建立公式与角色合同;下面的十三联工件实验固定官方 revision、tokenizer、 模型代码和 checkpoint 第一分片,在 RTX 5090 上连续执行 layer 0–6。它把真实观测、shape 推导、 吸收式 latent cache、长度对照、官方 chat-template 扰动、实现差距和未覆盖范围放在同一张证据图里。

X / FORWARD7 / 27 layers

1 个 dense 层 + 6 个 MoE 层;layer 7 因跨分片停止。

X / ROUTES11,289,744

三档长度、模板、消息历史、等长 filler、边界、特殊词元家族与完整角色块八格控制的真实 top-6 选择。

X / ABSORB CACHE266,240 → 29,952 B

同一真实 layer-1 权重的 naive / absorb active buffers。

X / RERUN10 / 10 EXACT

三档长度、官方模板、历史因子、等长 filler、边界、角色词头、special family 与完整角色块均 byte-exact;比较使用 paired prompt bootstrap。

REAL-WEIGHT LAB / DEEPSEEK-V2-LITE

这一次不是调公式:让官方权重真的走过七层

固定官方 revision、tokenizer、模型代码和 BF16 第一分片;RTX 5090 连续执行 layer 0–6, 从 3,240 次 token 显微轨迹扩到 11,289,744 次公开语料路由,并让 layer-1 权重继续走入官方吸收式 cache。 所有结论都带证据身份与停止线。

X本机执行真实权重与 hidden statesO官方工件配置、代码与 checkpointD确定推导从 shape 计算 bytesU未覆盖全模型、训练与生产 kernel
X / TOKEN-LEVEL ROUTES

先选层,再选 prompt 和 token

同一个 expert ID 只在当前层内有意义;跨层同号专家是不同参数,图中不会把它们连成“专长轨迹”。

PROMPT

TOKEN #0ID
ACTUAL TOP-6 / WEIGHT DESCENDING
SELECTED WEIGHT SUM配置不把 top-6 重新归一到 1
64 ROUTED EXPERTS / CURRENT PROMPT

颜色表示这条 prompt 在当前层的选择次数;空白表示本小样本未触达,不表示专家失效。

ROUTES

tokens × top-6

USED / 64

至少被选一次

CV

std ÷ mean

EFFECTIVE

exp(route entropy)

X / DESCRIPTIVE TRACE

这是 4 条固定 prompt、90 个有效 token 的前六个 MoE 层;不能据此命名专家、估计线上总体负载或判断训练均衡。

可复现入口experiments/deepseek/v2_lite_trace.py ·experiments/deepseek/v2_lite_absorb_probe.py ·experiments/deepseek/v2_lite_routing_corpus.py ·experiments/deepseek/compare_routing_length_control.py ·research/DEEPSEEK_ROUTING_LENGTH_CONTROL_AUDIT.md ·experiments/deepseek/v2_lite_routing_template_probe.py ·research/DEEPSEEK_ROUTING_TEMPLATE_AUDIT.md ·experiments/deepseek/v2_lite_routing_history_factorial_probe.py ·research/DEEPSEEK_ROUTING_HISTORY_FACTORIAL_AUDIT.md ·experiments/deepseek/v2_lite_routing_history_distance_control.py ·research/DEEPSEEK_ROUTING_HISTORY_DISTANCE_CONTROL_AUDIT.md ·experiments/deepseek/v2_lite_routing_history_boundary_token_control.py ·research/DEEPSEEK_ROUTING_HISTORY_BOUNDARY_TOKEN_AUDIT.md ·experiments/deepseek/v2_lite_routing_role_marker_head_control.py ·research/DEEPSEEK_ROUTING_ROLE_MARKER_HEAD_AUDIT.md ·experiments/deepseek/v2_lite_routing_special_token_family_control.py ·research/DEEPSEEK_ROUTING_SPECIAL_TOKEN_FAMILY_AUDIT.md ·experiments/deepseek/v2_lite_routing_role_marker_block_factorial.py ·research/DEEPSEEK_ROUTING_ROLE_MARKER_BLOCK_AUDIT.md

23 ROUTING IS NOT THE ANSWER

第七层之后不再只看 expert:加载完整 Chat 权重,实际生成 128 个输出

Base checkpoint 的路由实验回答“输入协议怎样改变专家路径”,却不能告诉我们模型最终说了什么。 这一轮固定官方 DeepSeek-V2-Lite-Chat revision 与 31,412,968,448 bytes BF16 参数, 把同一批 source 带进完整 27 层 generation。由于本机 32GB 显存低于官方 40GB 单卡边界, layers 25–26、final norm 与 LM head 明确落到 CPU;offload 事实、截断率和复跑覆盖都直接展示。

ROUND 04 / CHAT BEHAVIOR · OFFICIAL BF16

路由变了以后,模型最后真的会说出不同答案吗?

同一组 source 从 Base checkpoint 的路由显微镜进入DeepSeek-V2-Lite-Chat:system off/on × EOS/BOS/x/句点, 每条 source 的八格在同一 batch 内做 greedy generation。这里观察的是最终输出, 不再用 route TV 代替行为。

CHECKPOINTSFT CHAT · BF16

不是 Base,也不是 R1 / RL

FORMAL GRID16 × 8 = 128

四域各 4 条完整 source

EOS COMPLETE31 / 128

在 128-token 上限内结束

TRUNCATED97 / 128

能力分数不得横向解释

LONG RERUN32 / 32 EXACT

每域首条逐 token 复跑

X / GENERATED OUTPUTS

固定一条 source,再沿一条边比较两格

Exact 表示整段 generated token IDs 完全相同;similarity 是 token Levenshtein 相似度,不是语义得分。

SOURCEwikitext2/raw-validation/0443
DOMAINEnglish encyclopedia
FULL INPUT506 chars · 114 tokens
TEXT SHA-256d975cf38b1f984b0…
TOKEN EXACT—
COMMON PREFIX—tokens
EDIT DISTANCE—tokens
NORMALIZED SIMILARITY—
LEFTS0 · EOS
—
PROMPT
—
GENERATED
—
TOKEN HASH
—

RIGHTS1 · EOS
—
PROMPT
—
GENERATED
—
TOKEN HASH
—

怎么读

一处历史边界 ID 或一条 system message 可以让 greedy 轨迹分叉;分叉只说明这条固定输入、固定 checkpoint、固定解码路径发生变化。

X / OFFICIAL BF16 CHAT · DESCRIPTIVE BEHAVIOR PROBE固定 revision 85864749cd611b4353ce1decdb286193298f64c7;正式原始 JSON54496955d0dd20a3…。32 格长序列复跑逐 token exact; 其余 96 格未做完整 128-token 独立复跑。

24 COMPLETION IS NOT CORRECTNESS

把 128-token 的截断账补齐,再沿完整 27 层看差异怎样传播

上一轮证明固定 Chat checkpoint 的 greedy 输出会分叉,却有 97 / 128 格在 128-token 上限处停止。这一轮对全部 128 格统一重跑 512-token 预算,用官方 GSM8K gold 与 HumanEval tests 分开记录完成、可评测和正确;同时在相同输入上执行 prompt-only 全深度 forward,追踪 29 个隐藏状态阶段、26 个 MoE gate 与 1,918,176 次 top-6 目标路由决定。隐藏状态、路由与任务结果仍是三类证据,不互相冒充因果解释。

ROUND 05 / COMPLETION × FULL DEPTH

一句输出怎样穿过 27 层:完成、答对、表示、路由分四张账

同一官方 SFT Chat checkpoint、同 16 条完整 source、同八格输入。 先把统一预算升到 512,再沿 embedding → 27 decoder layers → final norm 追踪隐藏状态,并读取 26 个 MoE gate。每个数字都能回到原始 JSON 与独立复跑。

512 · NATURAL EOS121 / 128

128-token 时只有 31 / 128

MATH · STRICT23 / 32

4 tasks × 8 conditions

CODE · TESTS PASS24 / 32

官方 HumanEval tests

HIDDEN TRACE29 stages

embedding + 27 layers + norm

ROUTER TRACE1,918,176

target top-6 decisions

FRESH-PROCESS RERUN5,184 hashes

hidden + route + weights exact

I / STOPPING LEDGER

长度上限不是 EOS,更不是错误答案

两次运行都对全部 128 格使用统一预算;不是只给先前截断的 97 格“续杯”。 512 解决了大部分截断,但仍有 7 格没有自然结束。

MAX NEW TOKENS128
NATURAL EOS
31 / 128
BUDGET TRUNCATED
97 / 128
MAX NEW TOKENS512
NATURAL EOS
121 / 128
BUDGET TRUNCATED
7 / 128
统一重跑+90新增自然 EOS
CONDITIONNATURAL EOSMEAN TOKENSMATH STRICTCODE PASS
S0 · EOS15 / 16278.03 / 43 / 4
S1 · EOS15 / 16229.63 / 42 / 4
S0 · BOS15 / 16272.63 / 44 / 4
S1 · BOS16 / 16232.63 / 44 / 4
S0 · x13 / 16294.42 / 43 / 4
S1 · x16 / 16177.33 / 42 / 4
S0 · 句点15 / 16270.93 / 43 / 4
S1 · 句点16 / 16158.33 / 43 / 4
仍未解决的 7 格

6 个 English continuation + 1 个未闭合的 HumanEval code fence

wikitext2/raw-validation/0443S0 · BOS · 512 tokensNO EOS
wikitext2/raw-validation/0030S0 · x · 512 tokensNO EOS
wikitext2/raw-validation/2909S0 · x · 512 tokensNO EOS
wikitext2/raw-validation/2746S0 · EOS · 512 tokensNO EOS
wikitext2/raw-validation/2746S0 · x · 512 tokensNO EOS
wikitext2/raw-validation/2746S0 · 句点 · 512 tokensNO EOS
HumanEval/44S1 · EOS · 512 tokensAST FAIL · NOT RUN
BASELINE PROMPT HASH128 / 128 EXACT

输入身份没有漂移

FIRST 128 GENERATED TOKENS128 / 128 EXACT

512 运行完整复现短预算前缀

INDEPENDENT LONG RERUN32 / 32 EXACT

完整 token IDs、文本与停止状态

X / OFFICIAL BF16 CHAT · COMPLETION-AWARE FULL-DEPTH TRACErevision 85864749cd611b4353ce1decdb286193298f64c7;512 formal6af40512c5868caa…; full-depth formal 5678ed238f13e3b0…。 四域各 4 条是机制显微镜,不是 benchmark。

25 GREEDY IS NOT A DISTRIBUTION

把单条最大概率路径打开:八个预注册 seed 下,轨迹集合是否仍然分叉

上一轮的 512-token 结果仍是 deterministic greedy:它只能看到每一步概率最大的 一条路。这一轮冻结四条 source、八格 prompt batch 与八个 SHA-256 派生 seed, 启用 checkpoint 随附的 temperature=.3 / top_p=.95,生成 256 条 sampled outputs。停止、任务正确、集合相似度与新进程复现继续分账; batch-seed aligned 也明确不冒充逐行共享随机数的 paired causal design。

ROUND 06 / PREREGISTERED SAMPLING

greedy 只是一条路:固定八个 seed,打开有限的生成轨迹集合

同一官方 SFT Chat checkpoint、同四条 source、同八格 prompt batch。 只把解码切到官方 temperature=.3 · top_p=.95,显式关闭 top-k; 生成、任务评测与新进程复跑仍分三层保存。

SAMPLED OUTPUTS256

4 sources × 8 seeds × 8 cells

NATURAL EOS251 / 256

5 格在 512-token 触顶

UNIQUE TRAJECTORIES242 / 256

完整 token hash;不是语义类别

MATH · STRICT62 / 64

同一题的重复采样

CODE · TESTS63 / 64

24 个唯一执行候选

FRESH PROCESS64 / 64

八项预注册字段 exact

I / TRAJECTORY MICROSCOPE

同一格不是一个答案,而是八条有限样本

点任意 seed 查看长度、停止状态、hash 与短预览。unique 只比较完整 token IDs; pairwise similarity 用 token 编辑距离,不把同义改写冒充 exact。

DECODE CONTRACTT .3 · P .95 · K 0 · CAP 512
UNIQUE / 8—

完整 trajectory hash

NATURAL EOS / 8—

触顶与自然结束分开

GREEDY IN SET—

八样本是否抽到 mode 轨迹

PAIRWISE SIM—

28 对 mean · min–max

8 PREREGISTERED SEEDS—

EOS 512 截断 重复完整轨迹

选择一个 seed—

—

—
CONDITIONEOSMEAN TOKENSUNIQUEGREEDY SETS
S0 · EOS29 / 32290.131 / 321 / 4
S1 · EOS32 / 32241.432 / 322 / 4
S0 · BOS32 / 32265.430 / 321 / 4
S1 · BOS32 / 32221.232 / 321 / 4
S0 · x30 / 32263.632 / 320 / 4
S1 · x32 / 32146.830 / 322 / 4
S0 · 句点32 / 32259.532 / 320 / 4
S1 · 句点32 / 32121.726 / 322 / 4
证据边界4 sources × 8 seeds 不是 benchmark,也没有恢复完整生成分布。BOS / x / 句点格不是 官方有效聊天格式;unique hash 不是语义多样性;batch-seed aligned 不是逐行共享随机数。FORMAL 46c7edf…45af · EVAL 078f486…c4d8 · RERUN 72d050e…f6a0

26 SEEDS ARE NOT TASKS

同一道题抽 64 次,仍然只有一道题:把预算移到 16 条预先冻结的 source

Round 06 证明了 sampled trajectory 会跨 seed 分叉,也能在固定执行合同下逐 token 复现;但 Math 与 Code 各只有一道题。Round 07 保持 256 条正式输出的总预算不变, 改为四域各四条 source、每格四个 seed,只保留system off/on × EOS/句点 四格。source 是主要覆盖单位,seed 是题内重复; 方向先逐 source 计算,不把 64 个生成误写成 64 道独立任务。

ROUND 07 / SOURCE-BLOCKED FOLLOW-UP

seed 不是题目:把同题重复与跨题覆盖拆成两层

总预算仍是 256 条,但从上一轮的 4 sources × 8 seeds × 8 cells改成 16 sources × 4 seeds × 4 cells。source 是覆盖单位,seed 只是题内重复;所有方向都先逐 source 计算,再描述四条 source 是否同向。

SOURCES16

四域各 4 条,结果前冻结

SAMPLED OUTPUTS256

16 × 4 seeds × 4 cells

NATURAL EOS250 / 256

6 条在 512-token 触顶

MATH · STRICT47 / 64

四道 GSM8K,不是同题 64 次

CODE · TESTS52 / 64

四道 HumanEval,沙箱执行

FRESH PROCESS64 / 64

八项合同逐字段 exact

I / COVERAGE HIERARCHY

64 个 seed 输出,不会自动变成 64 道题

先选择一个域与条件。每张卡是一条独立 source,四个圆点才是该题内的四次采样。 圆点高度表示生成长度,颜色表示自然 EOS 或预算截断。

DOMAIN4 类语料

English · 中文 · Code · Math

→
PRIMARY COVERAGE UNIT4 sources / 域

跨题方向只在这一层数

→
WITHIN-SOURCE REPEAT4 seeds / 格

观察同题采样离散,不扩充题数

FIXED DECODET .3 · P .95 · K 0 · CAP 512
OUTPUTS—

4 sources × 4 seeds

NATURAL EOS—

micro count;不等于正确

BETWEEN-SOURCE RANGE—

四条 source 的平均长度跨度

WITHIN-SOURCE RANGE—

每题 seed 长度跨度的均值

证据边界16 sources 仍不是 benchmark;四题方向不推断总体。seed 是题内重复;句点不是官方聊天 边界;source-blocked contrast 是固定网格描述量,没有 p-value 与总体置信区间。FORMAL f013132…d7f7c · EVAL e88b274…b8975 · REPLAY 143dc9d…02a6

27 TASKS ARE NOT RANDOM TAPES

换一道题与换一条随机带,不是同一种不确定性:把 32 题 bootstrap 与真正的共同随机数接起来

Round 07 把 source 提升为覆盖单位,却仍只有每域四题;四行也只是共享 batch seed,不是真正共享同一概率分位。Round 08 在 HumanEval 与 GSM8K 各冻结 32 题, 主分析统一使用 T0;另取每域四题跑 T0–T3。每个 source、tape、step 的uₜ 由 SHA-256 显式派生,四个 prompt 条件读取同一个uₜ,再穿过各自的 temperature=.3 / top_p=.95CDF。这样可以把任务差异、sampling tape 差异与 prompt 条件差异放进不同账本。

ROUND 08 / TASK BOOTSTRAP × EXPLICIT CRN

把“换题”和“换随机数”拆开,再问 prompt 到底改变了什么

主分析固定 T0,在 HumanEval 与 GSM8K 各 32 道预选题上逐题配对; 另取每域 4 题跑 T0–T3。四格在第 t 步读取同一个显式uₜ,再各自穿过不同的 token CDF。

TASKS32 + 32

Code / Math 始终分开

FORMAL GRID352

256 主分析 + 96 额外 tape

PROMPT HASH256 / 256

输出前冻结并逐格 exact

UNIFORM AUDIT352 / 352

每条消费前缀重新派生

TASK BOOTSTRAP10,000×

固定 32 题框,不外推总体

FRESH PROCESS64 / 64

十二项字段全部 exact

I / COMMON RANDOM NUMBERS

同一个 seed,不一定是同一个随机冲击

旧实验把四行放在同一个 seeded batch,torch.multinomial 为不同 行消费不同 RNG 子流。本轮直接定义每一步的均匀数,所以配对对象终于可见、可重建。

ROUND 06–07 · BATCH SEED
seed→r₀r₁r₂r₃

同一 seed 与调用时序,但四行不是同一概率分位。

ROUND 08 · EXPLICIT TAPE
uₜ→uₜuₜuₜuₜ

同题、同 tape、同 step 的四格读取完全相同的 uₜ。

01 / HASHSHA-256

protocol · tape · source · step

→
02 / SHAREDuₜ ∈ (0,1)

四格同一个概率分位

→
03 / FOUR DISTRIBUTIONST .3 · P .95

prompt 改变各自 logits / CDF

→
04 / TOKENsearchsorted

同 uₜ 可以落入不同 token

REAL T0 TAPE / HumanEval/31前 8 个生成步

柱高是 float32 uₜ;hex 是冻结的 uint64 前缀。

t00.44672223b
t10.25641a829
t20.1241fc914
t30.962f6349b
t40.738bd0b25
t50.681ae6246
t60.513836e54
t70.893e47b1d
s0_eos无 system · EOS
t02158t14353t2254t32030t4262t562t66620t763
s1_eos有 system · EOS
t02158t16983t2565t3245t41604t5317t69966t711
s0_period无 system · 句点
t02158t14353t2254t32030t4262t562t66620t763
s1_period有 system · 句点
t0977t1317t262t36620t47t577t61780t7185
证据边界两个 domain 各 32 道预选题,不是完整 benchmark;selected-task band 固定 T0, 不覆盖 generation-tape uncertainty;句点是 counterfactual,不是官方聊天格式。FORMAL ea0607…1809 · EVAL 82b2fc…77ab · REPLAY 64/64

28 THE MAIN LINE IS NOT THE WHOLE TREE

如果只读 V2 → V3 → R1 → V4,会漏掉五条反过来影响主线的旁支

旁支不是“其它产品”清单:Coder-V2 检验 V2 架构如何继续预训练,ESFT 检验 expert specialization 如何进入微调,Prover 把可验证奖励推进 formal proof,DeepEP/DualPipe 把模型假设变成系统实现, Engram 则提出不同于专家和注意力的条件记忆稀疏轴。

29 EVIDENCE AUDIT

同一张页面里有三种知识,它们的语气必须不同

AUTHOR-REPORTED

作者报告或官方仓库明确写出的事实

模型配置、训练阶段、V2 的 93.3%、V3 的 2.788M H800 hours、V3.2 的 1,827 environments、V4 的 27%/10% 都属于这一层,必须携带比较对象。

FORMULA-DERIVED

从公开配置按公式重新计算

例如 MHA 的 2nₕdₕ 与 V2 MLA 的 d꜀+dᴿ 元素数。公式可以精确,换成 GiB 时仍依赖 dtype、batch、allocator 与实现。

TEACHING MODEL

为了看趋势而构造的交互近似

通信压力、pipeline bubble 和 RL 权重是方向性玩具模型;它们不冒充 H800 集群、真实 checkpoint 或论文复跑。

不写:R1-Zero 没有任何监督或先验;RL 从零发明了 “aha”。

不写:DAPO / Dr.GRPO 是 DeepSeek 官方 R1 recipe。

不写:aux-loss-free 就是完全没有辅助均衡;FP8 就是全模型都用 8 位。

不写:V4 和 K3 都是 1M,所以架构相同;蒸馏学生就是小号 R1-Zero。

↳ READING ORDER

六十个一手 / 官方节点:从祖先、对照、主线、复现到 K3 汇流点

不建议直接从 R1 开始。先读 MoE、MQA/GQA、RoPE、PPO 和 pipeline 的祖先,再进入 DeepSeek 主线; DAPO / Dr.GRPO 放在 R1 后作为反查,Kimi K2/K3 放在末端做同题对照。

Adaptive Mixtures of Local Experts

1991专家门控前史

Conditional Computation

2000条件计算

A Neural Probabilistic Language Model

2003Dense LM 坐标

Attention Is All You Need

2017Transformer 主干

Outrageously Large Neural Networks

2017稀疏 MoE

Proximal Policy Optimization

2017GRPO 对照

GPipe

2018Pipeline 前史

PipeDream

2018Pipeline schedule

Fast Transformer Decoding / MQA

2019KV 共享

Megatron-LM

2019模型并行

ZeRO

2019状态分片

RMSNorm

2019尺度控制

GShard

2020大规模 MoE

QK-Normalization

2020attention logit 稳定

Switch Transformers

2021coarse top-1 MoE

RoFormer / RoPE

2021MLA 位置分叉

ST-MoE

2022MoE 稳定性

DeepNet

2022深层残差

InstructGPT

2022SFT/RM/PPO 合同

FlashAttention

2022IO-aware exact attention

Process and Outcome Feedback

2022reasoning reward 前史

Self-Consistency

2022多采样聚合

GQA

2023KV 分组

Let's Verify Step by Step

2023verifier / PRM

Direct Preference Optimization

2023RL 外偏好路线

FlashAttention-2

2023attention kernel

PagedAttention / vLLM

2023KV 服务状态

DeepSeek LLM

2024Dense / scaling 基线

DeepSeek-Coder

2024代码数据旁支

DeepSeekMoE

2024细粒度 + shared

DeepSeekMath

2024数学数据 + GRPO

RLOO

2024critic-free 对照

DeepSeek-V2

2024MLA + MoE

Better & Faster LLMs via MTP

2024MTP 祖先

DeepSeek-Coder-V2

2024V2 continued pretrain

ESFT

2024专家特化微调

DeepSeek-Prover-V1.5

2024proof feedback RL

Hyper-Connections

2024mHC 前身

DeepSeek-V3

2024FP8 / DualPipe / MTP

DeepSeek-R1

2025R1-Zero / R1 / 蒸馏

Muon is Scalable for LLM Training

2025V4 optimizer 前史

DAPO

2025GRPO 工程修正

Understanding R1-Zero-Like Training

2025Dr.GRPO / 偏差

DeepSeek-Prover-V2

2025subgoal + RL

DeepEP

2025Expert Parallel kernel

DualPipe

2025V3/R1 pipeline 实现

DeepGEMM

2025FP8 GEMM 实现

DeepSeek-VL2

2025多模态理解旁支

Janus-Pro

2025统一理解/生成旁支

Kimi k1.5

2025同期 reasoning RL

Kimi K2

2025MLA / MoE / Muon 对照

Kimi Linear

2025KDA 前身

DeepSeek-V3.2

2025DSA + Agent

mHC

2025受约束 residual

Engram

2026条件记忆新稀疏轴

LatentMoE

2026K3 routed latent 前身

Attention Residuals

2026K3 深度路由

DeepSeek-V4

2026CSA / HCA / mHC / Muon

Kimi K3

2026对照锚点

Kimi K3 official repository

2026开放实现边界