NUMERICS / 09 PRECISION · OPTIMIZATION · STABILITY

少几个比特为什么省巨资,
也可能让训练瞬间崩掉?

一个 LLM 不是“用某种精度”训练。参数、乘法、累加、梯度、优化器状态、通信与部署权重 各有自己的数值合同;任何一环太粗、太窄或尺度错位,都可能让万亿 Token 的长跑前功尽弃。

LEDGERS
10 张不能混的账
CORE SOURCES
36 个一手节点
LINEAGE
2014 → 2026
LAB
格式 · 状态 · 更新 · 失稳
SPOTLIGHT
DeepSeek × Kimi

00 TEN LEDGERS

第一步不是选 dtype,而是给每种 Tensor 分配一份数值合同

“FP8 训练”“Muon 更高效”“没有 loss spike”都是不完整句子。 必须继续追问:什么对象、哪个阶段、怎样缩放、在哪里累加、对什么基线、观察了多久。

N1 / REPRESENT

表示

sign / exponent / mantissa 怎样决定范围、格点与特殊值?

N2 / SCALE

缩放

一个 scale 服务整 tensor、channel、token、tile 还是 32-element block?

N3 / COMPUTE

计算

哪些 GEMM 真用低精度,哪些敏感算子仍在 BF16 / FP32?

N4 / ACCUMULATE

累加

成千上万个低精度乘积在哪里、以多少位求和?

N5 / MOVE

存储与通信

参数、激活、梯度、moments、KV 与 checkpoint 各占多少字节?

N6 / UPDATE

参数更新

逐坐标自适应、矩阵预条件与正交化到底改变什么?

N7 / SCALE-UP

参数化

宽度、深度、head 分块怎样改变初始化、LR 与 update RMS?

N8 / OBSERVE

稳定信号

logit、activation、gradient、update、spectrum 与 saturation 谁先异常?

N9 / RECOVER

恢复

scale、clip、skip、rollback、确定性 replay 分别解决哪一层?

N10 / EVIDENCE

证据与经济

增益对什么模型、Token、硬件、质量与 wall-clock 基线成立?

一句话总纲

数值工程不是把所有 tensor 强行降到同一种格式;它要在速度、字节、范围、舍入误差与恢复能力之间, 为 forward、backward、optimizer、communication 和 deployment 分别选精度。

01 NUMBER ANATOMY

Exponent 决定“能装多大”,Mantissa 决定“同一数量级分多细”

二进制浮点数可以先想成一张科学计数法卡片:(−1)sign × significand × 2exponent。 减少 exponent bits 会缩窄动态范围;减少 mantissa bits 会拉大相邻格点。 scale 能移动这扇窗口,但不会增加窗内格点。

1 BITS

正负号

RANGEE

数量级与 overflow / underflow

PRECISIONM

相邻可表示值的距离

格式S / E / M最大有限值单位附近间距关键直觉
FP321 / 8 / 23≈ 3.4e38≈ 1.19e−7

范围、细度都宽;存储与带宽贵。

FP161 / 5 / 1065,504≈ 9.77e−4

比 BF16 细,但动态范围窄。

BF161 / 8 / 7≈ 3.4e38≈ 7.81e−3

保留 FP32 范围;单位附近只有 128 个刻度 / binade。

FP8 E4M31 / 4 / 34480.125

更偏细度;常给 weight / activation。

FP8 E5M21 / 5 / 257,3440.25

更偏范围;常给 gradient。

MXFP4E8M0 + 32×E2M1由 scale 决定很粗

局部共享指数,不能脱离 block 描述。

三个不同错误

Overflow 是装不下;Underflow 是小到变 0;Rounding 是还装得下,却落到邻近格点。三者需要不同监控和防线。

四十年格式演进:每次降位都伴随一层新的保护

01

FP32 成为通用基线

范围与精度宽,但训练规模扩大后,存储与数据搬运成为主要成本。

02

Stochastic rounding

低精度小 update 不必永远被 round-to-nearest 吞成 0。

03

FP16 mixed precision

FP32 master weights、loss scaling、FP32 accumulation 组成经典三件套。

04

BF16

保留 FP32 的 8-bit exponent,牺牲 mantissa,换取更容易训练的动态范围。

05

FP8 E4M3 / E5M2

前向更偏 E4M3,梯度更偏 E5M2;scale 与 higher-precision output 成为必需角色。

06

MX formats

32 个窄元素共享 E8M0 scale,把可表示窗口缩小到局部 block。

07

Fine-grained FP8

DeepSeek-V3 用 1×128 activation tile、128×128 weight block 与 FP32 promotion。

08

FP4 training / QAT

全量 FP4 训练仍在探索;V4/K3 先把专家与特定路径纳入部署感知 QAT。

02 FP16 → BF16

2017 年的突破不是“直接改 FP16”,而是让高低精度分工

Mixed Precision Training 的经典配方从一开始就有三层保护: FP16 负责大批量存储与乘法,FP32 master 保存小 update,loss scaling 把小梯度移进可表示窗口, FP32 accumulator 再把大量乘积稳定求和。

01 / FORWARD + BACKWARD

FP16 working copy

参数、激活与梯度降低存储 / 带宽;Tensor Core 做低精度乘法。

02 / PROTECT SMALL GRADIENT

Loss scaling

先放大 loss,再在 update 前 unscale;overflow 时跳过 update 并调 scale。

03 / UPDATE

FP32 master weights

FP16 中小于一个格点的 update,仍能在 FP32 参数里逐步累积。

BF16 为什么更省心?

BF16 与 FP32 都使用 8-bit exponent,所以能覆盖相似数量级;它把成本省在 mantissa。 这通常减少 FP16 式 overflow / loss-scale 调参,但并不意味着所有累加、optimizer state 和 softmax 都可以降为 BF16。DeepSeek LLM 就是 BF16 训练、FP32 累计梯度,并在 cross entropy 内把 logits 临时提升到 FP32。

错误

BF16 比 FP16“全面更精确”

BF16 范围更宽;FP16 在同一数量级的 mantissa 更细。

错误

FP32 accumulate 抵消全部误差

输入已经被量化的误差不会因为高精度相加自动消失。

错误

低位字节能直接换算速度

cast、scale、kernel、shape 与硬件原生支持共同决定端到端收益。

03 FP8

E4M3 与 E5M2 是两种取舍;真正训练时还要带上 scale 与 accumulator

2022 年 FP8 格式论文提出两个 8-bit 编码。E4M3 用一个 exponent bit 换一个 mantissa bit, 更适合相对集中的 weight / activation;E5M2 范围更宽,适合长尾更重的 gradient。 论文同时明确:FP8 input 通常要 scale,数学输出通常以更高精度产生。

E4M3
SE E E EM M M
MAX
448
MIN SUBNORMAL
2⁻⁹

较多 mantissa,较窄范围。DeepSeek-V3 依靠细粒度 scale,让 forward / backward tensor 都可统一用 E4M3。

E5M2
SE E E E EM M
MAX
57,344
MIN SUBNORMAL
2⁻¹⁶

范围更宽、格点更粗。格式论文推荐给 gradient;长程 FP8 optimizer 也发现 second moment 更需要 E5M2 范围。

FP8 不是一个 dtype 标签

至少要写成:对象 + 格式 + scale 粒度 + accumulator + 输出格式 + hardware。例如“1×128 activation tile 量化到 E4M3,每 128 个 K 元素 promotion 到 FP32”。

04 MICROSCALING

从“整张地图共用比例尺”到“每 32 个数一把尺”

per-tensor scaling 的麻烦是:一个离群值会把整张 tensor 的 scale 拉大,普通值被挤到少数格点。 Microscaling 把共享范围缩到一个小 block。OCP MX concrete formats 使用 32 个元素共享一个 E8M0 scale; MXFP4 的每个元素本体是 E2M1。

PER-TENSOR1 SCALE

一个 outlier 压缩全部普通值的有效刻度。

MICROSCALING1 SCALE / 32 ELEMENTS

异常只影响局部 block;scale 元数据、axis 和转换逻辑成为新成本。

SHARED SCALEE8M0 · 8 bits

只保存指数型比例尺。

×
32 ELEMENTSE2M1 · 4 bits each

每个值本身极粗。

=
BLOCK136 bits / 32 values

平均 4.25 bits / value,不含布局 padding。

Transpose 也会改变语义

scale 通常沿 GEMM reduction axis 共享。矩阵 transpose 后,scale axis 也要变化;“先量化再转置”不总等于“先转置再量化”。

05 MIXED-PRECISION ROLE MAP

不要问“模型是什么精度”,要问每个角色是什么精度

01 / GEMM INPUT

FP8 / MX element

缩放后进入矩阵乘;低位吞吐收益主要发生在这里。

02 / MULTIPLY

FP8 × FP8 / FP4 × FP8

硬件支持决定峰值;没有原生指令就未必更快。

03 / PARTIAL SUM

limited / FP32 promoted

内积很长时,累加精度比单次乘法更容易被忽略。

04 / OUTPUT

BF16 / FP32

下一算子、residual 或 backward 对输出范围有自己的要求。

05 / MASTER WEIGHT

FP32

保留小 update;低精度 working copy 可每 step 重新生成。

06 / GRADIENT

FP8 / BF16 / FP32

计算、累计和通信可以再次分成三种格式。

07 / OPTIMIZER STATE

FP8 / BF16 / FP32

一阶矩与二阶矩的范围需求不同,不能一刀切。

08 / CHECKPOINT

高精度或部署格式

用于恢复训练的状态与用于线上推理的权重不是同一份契约。

DeepSeek-V3 的公开 role map

BF16 INPUTFP8 FPROP GEMMBF16 / FP32 OUTPUT
FP8 ACTIVATION CACHEFP8 DGRAD / WGRADFP32 GRADIENT
BF16 m₁ / m₂+FP32 MASTERONLINE QUANTIZE

关键高精度保留项包括 embedding、output head、MoE gate、normalization 与 attention。 MoE dispatch 可以 FP8,combine 保留 BF16;attention backward 敏感 activation 甚至使用自定义 E5M6。 所以 V3 的亮点不是“大胆全降位”,而是知道哪里不能降。

06 QUANTIZATION TAXONOMY

同样写“4-bit”,可能在回答五个完全不同的问题

范畴发生时机代表优势边界
PTQ训练后GPTQ / SmoothQuant

便宜、快速

极低位、activation / KV 与分布漂移可能掉点

QAT训练 / 微调时Jacob 2018 / LLM-QAT

模型可适应 rounding / clamp

需要数据、反向和 fake/native quant 一致

LOW-BIT FINETUNEadapter 训练QLoRA

冻结 4-bit 基座,大幅省微调显存

不等于 4-bit base update 或预训练

LOW-PREC PRETRAIN从头 / 长程FP8-LM / DeepSeek-V3

训练 GEMM、激活和通信共同受益

长时 outlier、scale 与 accumulator 都需验证

FULLY QUANTIZEDW/A/G 广泛低位FP4 All the Way

继续压缩训练成本

仍属前沿;Token、模型、硬件边界严格

FP32 MASTER可连续更新

小 update 仍能积累。

FAKE / NATIVE QUANTround + clamp + scale

forward 经历部署误差。

DEQUANT / COMPUTE低精度行为

输出与 rollout 对齐。

STE近似穿过 rounding

gradient 回到 master weight。

QLoRA 的边界

QLoRA 把冻结基座以 NF4 存储,计算时 dequant 到 BF16,只训练 adapter。它证明低显存微调可行,不证明基座从头以 4-bit 更新也等价。

07 OPTIMIZER LINEAGE

优化器演进的核心不是“公式更复杂”,而是更新单位越来越贴近参数结构

01

SGD

一份梯度,直接沿下降方向走;状态最少,scale mismatch 最直接。

02

Adam

用逐坐标一阶矩与二阶矩构造自适应步长。

03

AdamW

把 weight decay 从 adaptive gradient 中解耦。

04

Adafactor

用矩阵行 / 列统计因子化 second moment,并裁真正 update。

05

Shampoo

为 tensor 各 mode 建结构化预条件器,代价是矩阵根与状态。

06

μP / μTransfer

不是 optimizer;让宽度变化时 activation / update 语义保持可迁移。

07

Muon

momentum matrix 经 Newton–Schulz 近似正交化;再补 decay 与 RMS matching。

08

MuonClip / Per-Head / Hybrid

把 attention 越界保护、head 分块与 AdamW 参数组接回生产系统。

08 ADAM → ADAMW

Adam 给每个坐标一把尺;AdamW 再把“学任务”与“缩权重”分开

FIRST MOMENTmₜ = β₁mₜ₋₁ + (1−β₁)gₜ

平滑方向。

SECOND MOMENTvₜ = β₂vₜ₋₁ + (1−β₂)gₜ²

估计逐坐标尺度。

ADAPTIVE UPDATEΔθ = −η · m̂ / (√v̂ + ε)

不同坐标获得不同有效步长。

ADAMW DECAYθ ← (1−ηλ)θ + Δθ

不让 L2 项穿过 adaptive denominator。

为什么 gradient clipping 还不够?

gradient clipping 限制的是 g;Adam 之后的真正 update 还会除以 √v。 当 second moment 低估当前 squared gradient,adaptive update 仍可能过大。Adafactor 因而提出update clipping;2023 年低精度 VLM 工作又观察到 loss spike 常在 second moment 低估后 1–8 steps 出现。

反过来,Adam 也不是不可替代

2024/2025 的系统对照在 150M–1.2B decoder-only LM 上发现,除 SGD 外,Adam、带 momentum 的 Adafactor、Lion、Signum 的最优 loss 与 LR robustness 相近。这个结果挑战“Adam 唯一最好”,但规模远小于 K3/V4,不能推翻大模型生产选择。

09 STRUCTURE & SCALE-UP

Adafactor 省状态,Shampoo 看矩阵,μP 保持放大时的更新语义

ADAFACTOR

nm 个 second moments → n+m 个行列统计

R₁…RₙC₁…Cₘ

省掉完整二阶矩;还提出 update clipping、动态 β₂ 与 relative step size。它不是无损 Adam,momentum 与稳定性配方需要重新选。

SHAMPOO

不把一张矩阵摊平成独立坐标

L⁻¼GR⁻¼

为 tensor 各 mode 做结构化预条件;更尊重矩阵几何,却带来矩阵根、blocking、低频更新与分布式成本。

μP / μTRANSFER

先让“小模型的一步”与“大模型的一步”可比

13M同一更新语义6.7B

μP 不是 optimizer;它用参数组相关的初始化 / LR scaling,让宽度变化时超参更可迁移。深度、batch、数据和 optimizer 切换仍要另外研究。

10 MUON

AdamW 问“每个坐标多大”,Muon 问“整张更新矩阵沿哪些方向走”

Muon 先做 momentum,再用 Newton–Schulz 矩阵乘迭代近似 UVᵀ。 如果原 momentum 的 SVD 是 UΣVᵀ,这个变换把非零 singular values 拉向相近尺度, 避免少数 dominant direction 吞掉全部更新。

GRADIENTGₜ

一张逻辑独立矩阵。

MOMENTUMMₜ = μMₜ₋₁ + Gₜ

可加 Nesterov look-ahead。

NEWTON–SCHULZM → UVᵀ

用矩阵乘近似,不做完整 SVD。

RMS + DECAY0.2√max(n,m) · O

Moonlight 配方匹配 AdamW 步长。

RAW MOMENTUM SPECTRUM

少数方向占主导。

Newton–Schulz
MUON UPDATE SPECTRUM

方向尺度更均衡。

为什么原始 Muon 不能直接放大?

  • 权重增长:Moonlight 报告长训时 vanilla Muon 的 weight / output RMS 持续上升,因此补 AdamW-style weight decay。
  • Shape 依赖:A×B full-rank matrix 的理论 update RMS 约为 1/√max(A,B),需要 shape-aware rescale。
  • 参数分组:embedding、LM head、norm、bias 并非都适合矩阵正交化,通常继续 AdamW。
  • 分布式:Newton–Schulz 需要完整逻辑矩阵,不能像逐元素 Adam 那样随意切开。
作者报告边界

Muon is Scalable 报告 compute-optimal scaling 下约 2× efficiency、达到相同 loss 约需 AdamW 的 52% FLOPs。这是其模型族、数据、参数组与调参协议下的结果,不是所有 LLM 的普遍定理。

11 KIMI K2 / MUONCLIP

Muon 学得快,却把少数 attention head 的 logits 推过了悬崖

K2 报告在 9B active / 53B total 中间实验中观察到 vanilla Muon 的 max attention logits 很快超过 1000, 带来 loss spike 与偶发 divergence。RMSNorm 能控制输入 x,但q·k = (xWq)(xWk)ᵀ 仍会把 Q/K weight spectral norm 的增长相乘放大。

‖Wq‖ / ‖Wk‖ ↑01
max QKᵀ ↑02
Softmax entropy ↓03
训练尖锐 / spike04

QK-Clip 不改当前 forward,而是在 optimizer step 后缩回越界权重

Smaxh = max pre-softmax logit of head hγh = min(1, τ / Smaxh)Wq, Wk ← head-specific rescale
THRESHOLDτ = 100

K2 公开设置。

FIRST 70K STEPS12.7% heads

至少触发过一次。

LATERSelf-deactivated

所有 head 曾降回阈值以下。

FULL RUN15.5T Token

报告未观察 loss spike。

K2 解释 QK-Norm 不适合其 MLA:key matrix 在 inference 不完全物化。QK-Clip 只缩 head-specificqC/kC/qR,不碰 shared rotary kR。这是一种结构相关选择, 不能简化成“clip 永远优于 normalization”。

12 KIMI K3 / PER-HEAD MUON

K3 把“按 head 监控”推进到“按 head 计算 Muon update”

完整 Q/K/V projection 的 momentum matrix 可能把多个 attention heads 耦合成一个大 block。 大尺度 head 主导共享正交化,小尺度 head 得不到充分归一。K3 把 momentum 沿 head 维切成逻辑块, 每个 head 独立 Newton–Schulz,再组合回 projection。

FULL-MATRIX MUON
H1H2H3H4
one shared orthogonalization

大 scale head 影响共同 update。

PER-HEAD MUON
NS(H1)NS(H2)NS(H3)NS(H4)
four logical matrices

每个 head 独立匹配方向与尺度。

Optimizer 只是 K3 稳定性组合的一层

UPDATE

Per-Head Muon

按 head 平衡 Q/K/V update;tall block 也降低 NS 开销。

LOGIT

K2 weight clipping

训练 recipe 明确继续使用 K2 引入的越界保护。

MoE SCALE

RMSNorm

expert aggregate 进入 up-projection 前归一。

ACTIVATION

SiTU-GLU

两支 smooth tanh cap;每坐标输出绝对值小于 100。

SWIGLU大正值近似继续增长
SITU-GLU|output coordinate| < 4 × 25 = 100

K3 的低精度落点:部署感知 post-training

从 SFT 起贯穿 RL:routed expert weights 用 MXFP4,expert input activations 以 MXFP8 计算; attention、latent MoE projection、shared expert 与 router 保持高精度。rollout 与 training 使用同一量化方案, 以减少 train–inference mismatch。K3 总预训练 Token 与完整 dtype map 未公开。

13 DEEPSEEK-V3 / FP8

DeepSeek-V3 的亮点不是“FP8 很勇”,而是把每一处误差路径写成工程选择

MODEL671B total · 37B active
DATA14.8T Token
FORMATE4M3 for all FP8 tensors
AUTHOR RESULT<0.25% relative loss error
01 / QUANTIZE SMALL GROUPS

Activation 1×128 · Weight 128×128

每 Token 的 128 channels 一把尺;每 128×128 weight block 一把尺。outlier 不再拖累整 tensor。

02 / ACCUMULATE CAREFULLY

每 128 个 K 元素 promotion

H800 Tensor Core partial sum 作者测得约 14-bit;定期移到 CUDA Core FP32 register。

03 / KEEP SENSITIVE ROLES HIGH

Attention / Norm / Router 不降

embedding、output head、MoE gate、normalization、attention 保留原精度。

04 / COMPRESS MOVEMENT

Activation cache / MoE dispatch FP8

真正节省的不只 GEMM;backward cache 与跨卡 dispatch 同时减字节,combine 仍 BF16。

APPENDIX B.2 / NEGATIVE RESULT

把 Dgrad activation gradient 也改成规整的 128×128 block,模型发散

在约 16B MoE、约 300B Token 实验中,activation gradient 的 token-correlated outlier 无法被 block-wise grouping 处理。这个失败案例比“FP8 成功”更重要: 量化粒度必须服从数据分布,不能只服从 kernel 布局。

14 DEEPSEEK-V4 / HYBRID MUON + FP4

V3 已经稳定跑完 FP8,V4 仍然遇到新的 loss spikes

V4 改变了 attention、residual、optimizer、上下文和 MoE 规模。任何一项变化都可能重开失稳路径。 报告明确写出训练遇到 notable instability,并公开两个经验补丁,而不是只展示平滑 loss。

OPTIMIZER

Majority Muon · Selected AdamW

embedding、prediction head、mHC static bias/gate、RMSNorm weights 留在 AdamW;其余逻辑矩阵 Muon。

ORTHOGONALIZATION

8 fast + 2 stable NS iterations

先快速把 singular values 拉近 1,再用稳定系数精确收尾;Q/KV 可 RMSNorm,所以不采用 QK-Clip。

SPIKE RESPONSE

Anticipatory Routing

spike 后短 rollback,暂时用历史参数预计算 routing indices,打断 router 与 expert outlier 同步反馈。

ACTIVATION

SwiGLU Clamping

linear branch 限制在 [−10,10],gate branch 上限 10;作者称无性能损失,理论机制仍开放。

POST-TRAIN

MXFP4 QAT

MoE expert weights + CSA indexer QK path;FP32 master 经 FP4 模拟,再 lossless dequant 到 FP8 compute(在报告 scale 条件下)。

DISTRIBUTED NUMERICS

BF16 sync · FP32 local sum

gradient stochastic-round 到 BF16 通信,再本地 FP32 相加,避开低精度 collective adder 长链误差。

DeepSeek 亮点

V4 最值得学的不是“Muon / FP4 都用了”,而是它公开承认:数值格式、优化器、attention、routing、activation 与 collective 必须一起设计;一个成功的上一代配方不会自动继承稳定性。

15 FIVE FEEDBACK LOOPS

Loss 是最后报警器;真正的根因常在几十步、几千步甚至几百 B Token 前出现

01 / DEPTH

深度—残差

model update 累积residual 过大gradient 消失 / 爆炸early divergence

防线:warmup · scaled init · Pre-LN / DeepNorm · mHC

02 / ATTENTION

Q/K—Softmax

Wq / Wk norm 增长QKᵀ logit 爆炸attention 近 one-hothead dynamics 继续变尖

防线:QK norm · soft-cap · QK-Clip · per-head monitor

03 / ACTIVATION

SwiGLU—低精度

两支对齐 / 增大乘积 outlierscale 被极值占满普通值失去格点

防线:Smooth-SwiGLU · clamp · SiTU-GLU · PowLU

04 / OPTIMIZER

统计量—Update

second moment 滞后adaptive update 过大loss spikemoment 继续污染

防线:update clip · β₂ / ε 审计 · update RMS · skip

05 / ROUTING

Expert—Router

expert outlier路由偏好加剧异常 expert 更热MoE spike

防线:per-expert monitor · bounded activation · Anticipatory Routing

稳定性控制室要监控十种信号

LOSSraw / EMA / per-domain

结果已受影响,不给根因

ATTN LOGITmax / p99.9 / per-head

Q/K growth 与 softmax saturation

ENTROPYper-head / layer

过尖不一定有错,但值得联查

ACTIVATIONmax / RMS / outlier channel

overflow 与 scale 风险

GRADIENTglobal / per-layer / nonfinite

backward 信号;不等于真正 update

UPDATERMS / param ratio / spectrum

optimizer 实际施加的步长

WEIGHTRMS / spectral norm

长期增长与 attention 放大

QUANTsaturation / underflow / SNR

scale、格式与 accumulator

MoEexpert load / activation / drop

router–outlier feedback

SYSTEMchecksum / replay / bad rank

kernel、collective、hardware fault

16 INTERACTIVE LAB

亲手把四张账分开:一个小误差怎样变成系统级风险

先在格式显微镜里观察格点,再看 mixed precision 状态字节;随后用同一组 head scale 对比 AdamW、Muon 与 Per-Head Muon,最后把 K2/K3/V3/V4 的公开防线装进控制室。

INTERACTIVE FOUR INDEPENDENT LEDGERS

数值工程四联实验室

四个视图彼此独立:表示误差、状态字节、更新几何和失稳信号不能合成一个“总分”。

TEACHING MODEL机制模拟,不是 GPU bit-exact kernel、真实训练预测器或厂商性能基准。
选择格式
INPUT1.300000REPRESENTED1.296875
SIGN1 bit
EXPONENT8 bits
MANTISSA7 bits
STATUS
ROUNDED
ABS ERROR
0.003125
REL ERROR
0.240%
STORAGE
2.000 B/value
为什么 BF16 能装得大,却不够细?

8-bit exponent 保留 FP32 级动态范围;7-bit mantissa 让单位附近只剩约 0.78% 的格点间距。

17 AUDIT PROTOCOL

看到“FP4 / FP8 / 2× / stable”,至少继续问十二个问题

01

对象

weight、activation、gradient、KV、moment 还是 communication?

02

阶段

pre-training、SFT、RL、rollout 还是 inference?

03

格式

INT、IEEE-like FP、E4M3/E5M2、MXFP4 还是厂商自定义?

04

粒度

tensor、channel、token、tile、block;block size 与 axis 是什么?

05

缩放

online / delayed;scale dtype;outlier / overflow 怎样处理?

06

乘法

硬件是否原生支持;实际 kernel shape 与利用率?

07

累加

partial sum 位宽、promotion interval、reduction order?

08

高精度保留

master、norm、router、attention、loss、gradient accumulation 各是什么?

09

质量基线

与 BF16 / FP16 对什么 loss、任务和训练时长比较?

10

系统基线

吞吐是 peak GEMM、MFU、tokens/s 还是完整 wall-clock?

11

稳定性

监控了哪些内部信号;是否有 rollback、skip 或隐藏恢复?

12

证据

作者报告、独立复现、标准定义,还是教学推导?

PUBLIC UNKNOWNS
  • K3 总预训练 Token、完整 dtype placement 与 Per-Head Muon 单项 ablation 未公开;
  • K3 / V4 MXFP4 QAT 相对高精度的完整质量—延迟—能耗对照未公开;
  • V4 Anticipatory Routing 的完整触发阈值、持续步数与全部 spike trace 未公开;
  • Muon 相对 AdamW 的收益依赖模型族、参数分组、调参预算与训练 regime;
  • 本章所有互动数值均为机制教学,不是生产 kernel 或真实模型预测。

18 PRIMARY-SOURCE CHAIN

36 个一手节点:先读格式与更新,再进入 Kimi / DeepSeek 生产配方

推荐顺序:Mixed Precision → BF16 → FP8 / MX → AdamW / μP / Muon → QK / SwiGLU stability → DeepSeek-V3 / K2 → K3 / V4。 每个节点只承担它真正证明的部分,不把相邻论文拼成虚假的统一结论。

01 / 2014

Adam: A Method for Stochastic Optimization

逐坐标一阶 / 二阶矩基线。

02 / 2015

Deep Learning with Limited Numerical Precision

stochastic rounding 与低精度训练前史。

03 / 2017

Mixed Precision Training

FP32 master、loss scaling、FP32 accumulate。

04 / 2017

Decoupled Weight Decay Regularization

AdamW 与 L2 / decay 边界。

05 / 2017

Quantization and Training of Neural Networks…

fake quant 与 QAT 起点。

06 / 2018

Shampoo

结构化 tensor preconditioning。

07 / 2018

Adafactor

factor second moment 与 update clipping。

08 / 2019

A Study of BFLOAT16 for Deep Learning Training

BF16 范围—精度取舍。

09 / 2020

GLU Variants Improve Transformer

SwiGLU 原始主线。

10 / 2020

Query-Key Normalization for Transformers

Q/K 余弦化与 learned scale。

11 / 2021

8-bit Optimizers via Block-wise Quantization

optimizer state 的 block-wise 量化。

12 / 2022

DeepNet: Scaling Transformers to 1,000 Layers

residual scaling 与 update bound。

13 / 2022

Tensor Programs V / μTransfer

跨宽度超参迁移。

14 / 2022

LLM.int8()

大模型 activation outlier。

15 / 2022

FP8 Formats for Deep Learning

E4M3 / E5M2 交换格式。

16 / 2022

GPTQ

近似二阶 weight-only PTQ。

17 / 2022

SmoothQuant

W8A8 activation outlier 迁移。

18 / 2023

Scaling Vision Transformers to 22 Billion Parameters

QK LayerNorm 与 logit explosion。

19 / 2023

Stable and low-precision training…

SwitchBack 与 Adam second-moment spike。

20 / 2023

QLoRA

NF4 frozen-base 微调边界。

21 / 2023

LLM-QAT

data-free W/A/KV QAT。

22 / 2023

Small-scale proxies for large-scale Transformer instabilities

高 LR 小模型研究代理。

23 / 2023

Microscaling Data Formats for Deep Learning

E8M0 + 32-element MX block。

24 / 2023

FP8-LM

FP8 compute、gradient 与通信。

25 / 2023

Spike No More

小 sublayer、大 shortcut。

26 / 2024

DeepSeek LLM

BF16 + FP32 gradient accumulation。

27 / 2024

Deconstructing What Makes a Good Optimizer…

Adam / Adafactor / Lion 对照边界。

28 / 2024

Scaling FP8 training to trillion-token LLMs

长程 SwiGLU outlier 与 Smooth-SwiGLU。

29 / 2024

DeepSeek-V3 Technical Report

fine-grained FP8 生产配方。

30 / 2024

Muon: An Optimizer for Hidden Layers

Muon 原始定义与实现。

31 / 2025

Muon is Scalable for LLM Training

decay、update RMS 与 distributed Muon。

32 / 2025

Kimi K2 Technical Report

MuonClip 与 QK-Clip。

33 / 2025

FP4 All the Way

fully quantized FP4 training。

34 / 2026

PowLU

有界 activation 稳定性对照。

35 / 2026

DeepSeek-V4

hybrid Muon、spike mitigation、FP4 QAT。

36 / 2026

Kimi K3

Per-Head Muon、SiTU-GLU、MXFP4 QAT。

来源协议

研究截止 2026-07-29。K3/K2/V3/V4 数字来自正式技术报告;Muon 原始定义来自作者技术博文, 大规模结论来自后续 Moonlight 报告。Grok 产物永久保留在未核验 leads, 正文事实逐项回查本地 PDF / 标准。论文图仅提炼机制,本页全部图形为原创简化重绘。