从零建立架构直觉
01 → 02 → 03 → 04 → 10
- 解释 next-token objective
- 手算一次 self-attention
- 画出 decoder block
- 区分 pretrain 与 post-train
CURRICULUM / 00 LEARNING GRAPH
16 个专题不是一条必须顺序走完的直线。它们组成有依赖的图: Transformer 是共同地基,MoE/长上下文/训练系统相互牵引,后训练再通向推理与 Agent。
01 DEPENDENCY GRAPH
一篇论文可能跨多个专题。例如 DeepSeek-V3 同时属于 MoE、训练系统、低精度和后训练; K3 则是几乎全部主线的汇流点。
02 FOUR ROUTES
路线可以交叉。每条路线的终点不是记住术语,而是具备一项可验证的阅读或设计能力。
01 → 02 → 03 → 04 → 10
K3 → 07 → 06 → 03 → 11 → 08/14
04 → 06 → 07 → 09 → 11 → 12
02 → 04 → 08 → 09 → 14 → 15
03 ALL MODULES
“研究中”表示资料已建立但正文未完成;“首版可读”表示已有连贯解释,不代表内容已经停止迭代。
面对几百个术语,我们究竟先学什么?
建立问题链、依赖关系、论文阅读方法和证据等级;把 K3 放回完整技术地图。
预测下一个 Token,为什么能产生通用能力?
从 N-gram、神经概率语言模型、词向量一路走到 Seq2Seq,理解 Transformer 出现前的瓶颈。
一句话里的每个词,怎样直接找到真正相关的词?
用可操作的小例子拆开 Q、K、V、自注意力、多头、因果掩码、残差与前馈网络。
模型如何知道词序,又如何让信息穿过上百层?
从分词、位置编码、归一化与激活函数,走到深层网络的信息流和 Attention Residuals。
多大模型、多少数据、多少计算才是划算的?
用九张账区分参数、数据、计算、配方、外推与部署经济;理解 Kaplan、Chinchilla、DeepSeek 与 K3。
更多网页为什么不等于更好的模型?
用十二张账追踪采集、解析、过滤、去重、混合、改写、Tokenizer、Packing、课程与污染,并串起 DeepSeek / Kimi 数据谱系。
怎样让模型装下更多知识,却不让每个 Token 都付全部算力?
从条件计算到 DeepSeekMoE、LatentMoE 与 K3 Stable LatentMoE,解释路由、特化和负载均衡。
从 8K 到 1M Token,真正昂贵的是什么?
比较稀疏/线性注意力、FlashAttention、MLA、状态空间模型、Delta Rule、KDA 与混合注意力。
一个 2.8T 模型如何摊到成千上万张卡上?
用九张资源账串起 ZeRO、Megatron、Expert/Context Parallel、DeepSeek DualPipe 与 K3 MoonEP/百万 Token RL。
为什么少几个比特能省巨资,也可能让训练瞬间崩掉?
解释 AdamW、μP、Muon、BF16/FP8/MXFP4 与量化感知训练的数值直觉。
会续写的 base model,怎样变成愿意协作的助手?
从 instruction tuning、SFT、RLHF/PPO 到 DPO 与 RLAIF,区分能力学习和行为塑形。
模型如何学会多想一会儿,并检查自己的答案?
从 CoT、搜索与验证器,到 GRPO、DeepSeek-R1、Kimi k1.5 和 multi-effort RL。
生成一段文字,怎样变成持续数小时的可靠行动?
讨论工具协议、行动—观察循环、环境奖励、沙箱、可验证任务与百万 Token 轨迹。
图像是外接插件,还是和文字一样的第一类输入?
从 ViT/CLIP、连接器式 VLM 走到 Kimi-VL、MoonViT-V2 与统一主干。
模型训练完以后,怎样让千万人用得起?
拆解 KV Cache、PagedAttention、批处理、推测解码、PD 解耦、前缀缓存与集群调度。
一个榜单分数,究竟测到了模型、脚手架还是预算?
从语言建模指标走到知识、代码、Agent 和多模态评测,识别污染、harness 与选择性报告。
04 DEFINITION OF DONE
完成不是“字数够长”。每个专题必须通过结构、事实、来源、教学、对照和可访问性六道闸门。
旧方法为何失败、新方法改变什么、怎样通向下一篇论文。
8–20 篇核心论文,数字与结论链接到原始来源。
至少两张可缩放图和一个交互实验或逐步动画。
明确回答这项技术在 K3 与 DeepSeek 中怎样出现。