CURRICULUM / 00 LEARNING GRAPH

先知道自己在哪里,
再决定往哪里深入

16 个专题不是一条必须顺序走完的直线。它们组成有依赖的图: Transformer 是共同地基,MoE/长上下文/训练系统相互牵引,后训练再通向推理与 Agent。

MODULES
16 个专题
PAPER SLOTS
341 篇核心论文位
PATHS
4 条推荐路径
PROGRESS
首版平均 42%
DEPTH
L0 直觉 → L3 工程

01 DEPENDENCY GRAPH

从左到右,是知识依赖,不是历史年份

一篇论文可能跨多个专题。例如 DeepSeek-V3 同时属于 MoE、训练系统、低精度和后训练; K3 则是几乎全部主线的汇流点。

普通节点:专题章节
关键枢纽:被多条路径依赖
建议先修方向

02 FOUR ROUTES

四条路径,四种不同的“读懂”

路线可以交叉。每条路线的终点不是记住术语,而是具备一项可验证的阅读或设计能力。

ROUTE A · BEGINNER

从零建立架构直觉

01 → 02 → 03 → 04 → 10

  1. 解释 next-token objective
  2. 手算一次 self-attention
  3. 画出 decoder block
  4. 区分 pretrain 与 post-train
ROUTE B · K3 REVERSE

从 K3 反向拆组件

K3 → 07 → 06 → 03 → 11 → 08/14

  1. 解释三维信息流
  2. 比较 KDA 与 MLA
  3. 解释 2.8T / 104B
  4. 读懂 1M Agentic RL 系统
ROUTE C · DEEPSEEK

沿论文看算法—系统协同

04 → 06 → 07 → 09 → 11 → 12

  1. 推导 MLA 缓存压缩
  2. 理解 FP8 scaling
  3. 区分 PPO 与 GRPO
  4. 对照 V4 与 K3 长上下文
ROUTE D · SYSTEMS

跟一个 Token 穿过真实集群

02 → 04 → 08 → 09 → 14 → 15

  1. 做显存与 FLOPs 账本
  2. 选择并行切分
  3. 理解 KV Cache 与调度
  4. 设计评测 harness

03 ALL MODULES

每个专题都有问题、先修、论文和完成标准

“研究中”表示资料已建立但正文未完成;“首版可读”表示已有连贯解释,不代表内容已经停止迭代。

00ORIENTATION

先看懂一张大模型地图

首版可读

面对几百个术语,我们究竟先学什么?

建立问题链、依赖关系、论文阅读方法和证据等级;把 K3 放回完整技术地图。

四层难度一张依赖图阅读路径
01LANGUAGE MODELING

语言模型从哪里来

研究中

预测下一个 Token,为什么能产生通用能力?

从 N-gram、神经概率语言模型、词向量一路走到 Seq2Seq,理解 Transformer 出现前的瓶颈。

概率分解分布式表示序列瓶颈
02TRANSFORMER

注意力与 Transformer

首版可读

一句话里的每个词,怎样直接找到真正相关的词?

用可操作的小例子拆开 Q、K、V、自注意力、多头、因果掩码、残差与前馈网络。

Q / K / V交互实验张量形状
03REPRESENTATION

表示、位置与残差高速公路

研究中

模型如何知道词序,又如何让信息穿过上百层?

从分词、位置编码、归一化与激活函数,走到深层网络的信息流和 Attention Residuals。

RoPERMSNormAttnRes
04SCALING

Scaling Laws:规模为什么有效

首版可读

多大模型、多少数据、多少计算才是划算的?

用九张账区分参数、数据、计算、配方、外推与部署经济;理解 Kaplan、Chinchilla、DeepSeek 与 K3。

幂律曲面计算最优四联实验
05DATA

数据工程与预训练配方

首版可读

更多网页为什么不等于更好的模型?

用十二张账追踪采集、解析、过滤、去重、混合、改写、Tokenizer、Packing、课程与污染,并串起 DeepSeek / Kimi 数据谱系。

十二张账DeepSeek/Kimi 谱系四联实验
06SPARSE EXPERTS

稀疏计算与 MoE

首版可读

怎样让模型装下更多知识,却不让每个 Token 都付全部算力?

从条件计算到 DeepSeekMoE、LatentMoE 与 K3 Stable LatentMoE,解释路由、特化和负载均衡。

专家路由细粒度专家896 选 16
07LONG CONTEXT

长上下文与高效注意力

首版可读

从 8K 到 1M Token,真正昂贵的是什么?

比较稀疏/线性注意力、FlashAttention、MLA、状态空间模型、Delta Rule、KDA 与混合注意力。

KV CacheMLAKDA
08DISTRIBUTED TRAINING

大规模训练系统

首版可读

一个 2.8T 模型如何摊到成千上万张卡上?

用九张资源账串起 ZeRO、Megatron、Expert/Context Parallel、DeepSeek DualPipe 与 K3 MoonEP/百万 Token RL。

显存字节账流水线与通信MoonEP
09OPTIMIZATION

数值精度、优化器与稳定性

待展开

为什么少几个比特能省巨资,也可能让训练瞬间崩掉?

解释 AdamW、μP、Muon、BF16/FP8/MXFP4 与量化感知训练的数值直觉。

FP8MuonMXFP4
10ALIGNMENT

指令微调与人类偏好

待展开

会续写的 base model,怎样变成愿意协作的助手?

从 instruction tuning、SFT、RLHF/PPO 到 DPO 与 RLAIF,区分能力学习和行为塑形。

SFT奖励模型偏好优化
11REASONING

推理模型与测试时扩展

首版可读

模型如何学会多想一会儿,并检查自己的答案?

从 CoT、搜索与验证器,到 GRPO、DeepSeek-R1、Kimi k1.5 和 multi-effort RL。

GRPOR1-ZeroOn-policy 蒸馏
12AGENTS

工具使用与长程 Agent

待展开

生成一段文字,怎样变成持续数小时的可靠行动?

讨论工具协议、行动—观察循环、环境奖励、沙箱、可验证任务与百万 Token 轨迹。

ReAct沙箱长轨迹 RL
13MULTIMODAL

原生多模态

待展开

图像是外接插件,还是和文字一样的第一类输入?

从 ViT/CLIP、连接器式 VLM 走到 Kimi-VL、MoonViT-V2 与统一主干。

ViT视觉 TokenMoonViT-V2
14INFERENCE

推理服务与低成本部署

待展开

模型训练完以后,怎样让千万人用得起?

拆解 KV Cache、PagedAttention、批处理、推测解码、PD 解耦、前缀缓存与集群调度。

vLLMMooncakeKDA 缓存
15EVALUATION

评测、安全与“到底强不强”

待展开

一个榜单分数,究竟测到了模型、脚手架还是预算?

从语言建模指标走到知识、代码、Agent 和多模态评测,识别污染、harness 与选择性报告。

基准演化Harness安全边界

04 DEFINITION OF DONE

什么时候一个专题才算真正完成

完成不是“字数够长”。每个专题必须通过结构、事实、来源、教学、对照和可访问性六道闸门。

01

问题链

旧方法为何失败、新方法改变什么、怎样通向下一篇论文。

02

一手证据

8–20 篇核心论文,数字与结论链接到原始来源。

03

视觉推导

至少两张可缩放图和一个交互实验或逐步动画。

04

贯穿对照

明确回答这项技术在 K3 与 DeepSeek 中怎样出现。