CURRICULUM / 00 LEARNING GRAPH

先知道自己在哪里,
再决定往哪里深入

16 个专题不是一条必须顺序走完的直线。它们组成有依赖的图: Transformer 是共同地基,MoE/长上下文/训练系统相互牵引,后训练再通向推理与 Agent。

MODULES
16 个专题
PAPER SLOTS
652 篇核心论文位
PATHS
4 条推荐路径
PROGRESS
首版平均 75%
DEPTH
L0 直觉 → L3 工程

01 DEPENDENCY GRAPH

从左到右,是知识依赖,不是历史年份

一篇论文可能跨多个专题。例如 DeepSeek-V3 同时属于 MoE、训练系统、低精度和后训练; K3 则是几乎全部主线的汇流点。

普通节点:专题章节
关键枢纽:被多条路径依赖
→建议先修方向

02 FOUR ROUTES

四条路径,四种不同的“读懂”

路线可以交叉。每条路线的终点不是记住术语,而是具备一项可验证的阅读或设计能力。

ROUTE A · BEGINNER

从零建立架构直觉

01 → 02 → 03 → 04 → 10

  1. 解释 next-token objective
  2. 手算一次 self-attention
  3. 画出 decoder block
  4. 区分 pretrain 与 post-train
ROUTE B · K3 REVERSE

从 47 页 K3 报告反向拆组件

K3 架构 → 07/06/03 → 05/04 → 11/12 → 08/14/15

  1. 沿 32 张问题账解释三维信息流
  2. 用 8 个报告实验与 4 个工件视图比较机制和真实 shape
  3. 分清 2.78T / 104.2B、2.5× 与 1M 的证据口径
  4. 读懂九专家 MOPD、混合缓存、FlashKDA 与复现边界
ROUTE C · DEEPSEEK

沿论文看算法—系统协同

04 → 06 → 07 → 09 → 11 → 12

  1. 推导 MLA 缓存压缩
  2. 理解 FP8 scaling
  3. 区分 PPO 与 GRPO
  4. 对照 V4 与 K3 长上下文
ROUTE D · SYSTEMS

跟一个 Token 穿过真实集群

02 → 04 → 08 → 09 → 14 → 15

  1. 做显存与 FLOPs 账本
  2. 选择并行切分
  3. 理解 KV Cache 与调度
  4. 设计评测 harness

03 ALL MODULES

每个专题都有问题、先修、论文和完成标准

“研究中”表示资料已建立但正文未完成;“首版可读”表示已有连贯解释,不代表内容已经停止迭代。

00ORIENTATION

先看懂一张大模型地图

首版可读

面对几百个术语,我们究竟先学什么?

建立问题链、依赖关系、论文阅读方法和证据等级;把 K3 放回完整技术地图。

四层难度一张依赖图阅读路径
01LANGUAGE MODELING

语言模型从哪里来

首版可读

预测下一个 Token,为什么能产生通用能力?

从 N-gram、神经概率语言模型、词向量一路走到 Seq2Seq,理解 Transformer 出现前的瓶颈。

概率分解分布式表示序列瓶颈
02TRANSFORMER

注意力与 Transformer

首版可读

一句话里的每个词,怎样直接找到真正相关的词?

用十张问题账与四联实验拆开 Q/K/V、Mask、多头、位置、深度、架构目标、KV/IO,并映射 DeepSeek 与 K3。

十张问题账四联实验DeepSeek / K3
03REPRESENTATION

表示、位置与残差高速公路

首版可读

模型如何知道词序,又如何让信息穿过上百层?

用二十张账与四联实验,从 Token/embedding、RoPE/NoPE、Norm 拓扑一路走到 DeepSeek mHC、K3 AttnRes 与 SiTU-GLU。

二十张表示账位置与深度四联实验DeepSeek / K3
04SCALING

Scaling Laws:规模为什么有效

首版可读

多大模型、多少数据、多少计算才是划算的?

用九张账区分参数、数据、计算、配方、外推与部署经济;理解 Kaplan、Chinchilla、DeepSeek 与 K3。

幂律曲面计算最优四联实验
05DATA

数据工程与预训练配方

首版可读

更多网页为什么不等于更好的模型?

用十二张账追踪采集、解析、过滤、去重、混合、改写、Tokenizer、Packing、课程与污染,并串起 DeepSeek / Kimi 数据谱系。

十二张账DeepSeek/Kimi 谱系四联实验
06SPARSE EXPERTS

稀疏计算与 MoE

首版可读

怎样让模型装下更多知识,却不让每个 Token 都付全部算力?

从条件计算到 DeepSeekMoE、LatentMoE 与 K3 Stable LatentMoE,解释路由、特化和负载均衡。

专家路由细粒度专家896 选 16
07LONG CONTEXT

长上下文与高效注意力

首版可读

从 8K 到 1M Token,真正昂贵的是什么?

比较稀疏/线性注意力、FlashAttention、MLA、状态空间模型、Delta Rule、KDA 与混合注意力。

KV CacheMLAKDA
08DISTRIBUTED TRAINING

大规模训练系统

首版可读

一个 2.8T 模型如何摊到成千上万张卡上?

用九张资源账串起 ZeRO、Megatron、Expert/Context Parallel、DeepSeek DualPipe 与 K3 MoonEP/百万 Token RL。

显存字节账流水线与通信MoonEP
09OPTIMIZATION

数值精度、优化器与稳定性

首版可读

为什么少几个比特能省巨资,也可能让训练瞬间崩掉?

用十张数值账解释 AdamW、μP、Muon、BF16/FP8/MXFP4、QAT 与训练失稳反馈环。

FP8MuonClipMXFP4稳定性控制室
10ALIGNMENT

指令微调与人类偏好

首版可读

会续写的 base model,怎样变成愿意协作的助手?

用十二张账拆开 instruction tuning、SFT、偏好数据、奖励模型、RLHF/PPO、RLAIF、DPO 与 RLVR,并追到 DeepSeek 和 K3。

十二张对齐账四联实验DeepSeek / K3
11REASONING

推理模型与测试时扩展

首版可读

模型如何学会多想一会儿,并检查自己的答案?

从 CoT、搜索与验证器,到 GRPO、DeepSeek-R1、Kimi k1.5 和 multi-effort RL。

GRPOR1-ZeroOn-policy 蒸馏
12AGENTS

工具使用与长程 Agent

首版可读

生成一段文字,怎样变成持续数小时的可靠行动?

用十四张账拆开模型、harness、工具、环境、验证、可靠性与安全,沿 ReAct、Agent RL、DeepSeek 与 K3 走到百万 Token 轨迹。

十四张 Agent 账四联实验DeepSeek / K3
13MULTIMODAL

原生多模态

首版可读

图像是外接插件,还是和文字一样的第一类输入?

用十六张账串起视觉 Token、CLIP、连接器、高分辨率、OCR、视频、统一理解生成,并重点拆解 DeepSeek 三分支与 Kimi 三代 MoonViT。

DeepSeek 三分支Kimi 三代 MoonViT四联实验
14INFERENCE

推理服务与低成本部署

首版可读

模型训练完以后,怎样让千万人用得起?

用十八本账拆开显存、KV Cache、PagedAttention、连续批处理、P/D 解耦、量化、推测解码与集群调度,并重点追踪 DeepSeek V2→V4 与 Mooncake→K3。

十八本服务账DeepSeek / Kimi 谱系四联实验
15EVALUATION

评测、安全与“到底强不强”

首版可读

一个榜单分数,究竟测到了模型、脚手架还是预算?

用二十二张测量账拆开任务、指标、Prompt、采样、Harness、裁判、污染、成本与威胁模型,并逐项复原 DeepSeek 与 K3 的评测协议。

二十二张测量账DeepSeek / K3 协议谱系四联实验

04 DEFINITION OF DONE

什么时候一个专题才算真正完成

完成不是“字数够长”。每个专题必须通过结构、事实、来源、教学、对照和可访问性六道闸门。

01

问题链

旧方法为何失败、新方法改变什么、怎样通向下一篇论文。

02

一手证据

8–20 篇核心论文,数字与结论链接到原始来源。

03

视觉推导

至少两张可缩放图和一个交互实验或逐步动画。

04

贯穿对照

明确回答这项技术在 K3 与 DeepSeek 中怎样出现。