OPEN COURSE / 2026 LARGE LANGUAGE MODELS

大模型技术全景从“预测下一个词”到 Kimi K3 的 2.8T 开放前沿

这是一套按问题脉络组织的中文开放课程。我们从最小直觉出发,追踪每篇关键论文究竟解决了什么, 再把注意力、MoE、规模化训练、多模态、推理强化学习与 Agent 系统重新汇入 Kimi K3。

研究范围

表示学习 · Transformer · Scaling · 数据工程 · MoE · 长上下文 · 训练系统 · 数值优化 · 后训练 · 推理 · Agent · 多模态 · 服务与评测

查看实时进度 →

NEW / K3 ROUND 08 TRAIN-TIME FORWARD · PREREGISTERED GATE

局部 uniform routing 进入完整训练后,六个尖峰指标格全部衰减

四个前向架构变体各跑三个 8,000-step seed,再完整 replay 主格:groups 6+7 的 contrast / peak 六格降幅为 32.3%–77.3%,BPC 质量门 4 / 4 通过。结论只限缩小 depth-32 Block 协议,不是真实 K3 checkpoint 或 Figure 5(c) 复现。

MATRIX
12 formal + 1 replay
ATTENUATION
6 / 6 pass
QUALITY
4 / 4 pass

NEW / DEEPSEEK ROUND 08 TASK BOOTSTRAP · EXPLICIT COMMON RANDOM NUMBERS

从 Dense 到百万上下文:每次创新都在偿还上一代最贵的一张账

从每域四题扩到 HumanEval / GSM8K 各 32 题,并把“同 seed”升级为显式共享 uniform tape:352 条正式输出、10,000 次选定任务配对 bootstrap 与 64 条 十二字段新进程重放。正确性区间都跨零,但输出长度揭示 Code 与 Math 方向相反。

LINEAGE
1991 → 2026 · 10 次转向
NODES
60 个一手 / 官方节点
LAB
22 · Base / Chat / sampling

NEW / CHAPTER 03 TOKEN · POSITION · DEPTH · FFN

一条 hidden state 同时沿词表、位置、深度和非线性四个坐标轴被改写

用二十张问题账从 Token、embedding 与上下文化表示,走到 RoPE / NoPE、Pre / Post-LN、 DeepSeek mHC 与 partial RoPE,以及 Kimi K3 的 9 个 AttnRes 深度来源和有界 SiTU-GLU。

LINEAGE
2003 → 2026
NODES
66 个一手节点
LAB
Token · 位置 · Norm · Residual / FFN

NEW / CHAPTER 15 SCORE · PROTOCOL · THREAT MODEL

榜单不是体检单:一个分数同时测到了模型、协议、脚手架、预算与裁判

用二十二张测量账从 PPL、MMLU、pass@k、校准与污染,走到 LLM Judge、Arena、 Agent 最终状态和安全威胁模型;逐字段复原 DeepSeek-R1 与 Kimi K3 的评测协议。

LINEAGE
2002 → 2026
NODES
80 个一手节点
LAB
指标 · Judge · 污染 · 系统边界

NEW / CHAPTER 14 MEMORY · TIME · FLEET

推理优化不是一句“更快”:显存、首字、字间、网络与 SLO 是五本不同的账

用十八本账从 KV Cache、PagedAttention、连续批处理、chunked prefill、量化和推测解码, 走到 DeepSeek V2→V4 的异构状态谱系,以及 Mooncake→Kimi K3 的混合缓存、亲和路由与预算准入。

LINEAGE
2019 → 2026
NODES
62 个一手节点
LAB
显存 · P/D · 推测 · 集群

NEW / CHAPTER 13 PIXELS · TOKENS · NATIVE MULTIMODALITY

原生多模态不等于移除视觉塔:真正改变的是数据、目标、优化与行为闭环

用语义空间、连接器、分辨率、OCR、视频、训练、幻觉、评测与 Agent 十六张账, 从 ViT、CLIP 和 LLaVA 走到 DeepSeek-VL / Janus / OCR 三分支,以及 Kimi 三代 MoonViT 与 K3 从头共同 NTP。

LINEAGE
2012 → 2026
NODES
55 个一手节点
LAB
Token · 连接器 · 光学压缩 · 视觉闭环

NEW / CHAPTER 12 AGENTS · TOOL USE · ENVIRONMENTS

Agent 不是一个循环:格式正确、执行成功和任务完成是三道不同的门

用环境、工具、循环、规划、记忆、执行、验证、轨迹、归因、分布、系统、可靠性、评测与安全十四张账, 从 TextWorld、ReAct 和 Toolformer 走到 DeepSeek-V4 DSec 与 Kimi K3 百万 Token Agentic RL。

LINEAGE
2018 → 2026
NODES
52 个一手节点
LAB
循环 · 契约 · 可靠性 · 长程 RL

NEW / CHAPTER 10 ALIGNMENT · PREFERENCE

DPO 没有“消灭 RLHF”,RLHF 也不等于只跑一次 PPO

用目标、监督、来源、SFT、偏好、奖励、更新、分布、约束、失效与证据十二张账, 从 2017 人类偏好学习一路走到 InstructGPT、Constitutional AI、DPO、DeepSeek-R1/V4 与 Kimi K3。

LINEAGE
2017 → 2026
PAPERS
44 个一手节点
LAB
SFT · RM · PPO/DPO · 配方比较

NEW / CHAPTER 02 ATTENTION · TRANSFORMER

Attention 不只是“看哪里”,Transformer 也不只有一种 Block

用信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射十张账, 从 Bahdanau 软对齐和 2017 原始 encoder–decoder,一路走到 FlashAttention、DeepSeek MLA 与 Kimi K3。

LINEAGE
2014 → 2026
PAPERS
40 个一手节点
LAB
QKV · Mask · 多头位置 · Block 成本

NEW / CHAPTER 01 LANGUAGE MODELING ORIGINS

预测下一个 Token,为什么会走到今天的大模型?

用预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导与系统成本八张账, 从 Shannon、N-gram、Kneser–Ney、Bengio、RNN/LSTM 一路走到 Seq2Seq、Attention 与 K3 / DeepSeek。

LINEAGE
1948 → 2026
PAPERS
33 个一手节点
LAB
概率 · 向量 · 记忆 · 对齐

NEW / CHAPTER 09 PRECISION · OPTIMIZATION · STABILITY

少几个比特为什么省巨资,也可能让训练瞬间崩掉?

用表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据十张账, 从 mixed precision、BF16、FP8 和 MXFP4,一路走到 AdamW、Muon、Kimi K2/K3 与 DeepSeek-V3/V4。

LINEAGE
2014 → 2026
PAPERS
36 个一手节点
LAB
格式 · 状态 · 更新 · 失稳

NEW / CHAPTER 05 DATA & PRE-TRAINING

同样一万亿 Token,可以是完全不同的训练经历

用来源、解析、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与模型感知价值十二张账, 从 C4、Pile、DoReMi 和 DCLM 一路走到 DeepSeek 五代数据工程与 Kimi K2→K3 原生多模态。

LINEAGE
2019 → 2026
PAPERS
31 个一手节点
LAB
流水线 · 去重 · 混合 · 改写

NEW / CHAPTER 04 SCALING LAWS

“大一点就会更强”,远远不够指导一次训练

用观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账, 从早期经验幂律、Kaplan、Chinchilla 与复现争议,一路走到 DeepSeek scaling study 和 Kimi K3。

LINEAGE
2017 → 2026
PAPERS
29 个一手节点
LAB
曲面 · 部署 · 重复 · 涌现

NEW / CHAPTER 08 LARGE-SCALE TRAINING SYSTEMS

一万张 GPU,为什么仍可能有一半在等?

用模型状态、激活、计算划分、气泡、collective、专家、上下文、数值与可靠性九张账, 从 ZeRO、Megatron 一路走到 DeepSeek DualPipe、Kimi MoonEP 与百万 Token Agentic RL。

LINEAGE
2012 → 2026
PAPERS
37 个一手节点
LAB
显存 · 网格 · 气泡 · 通信

NEW / CHAPTER 11 REASONING & TEST-TIME SCALING

“多想一会儿”,到底把计算花到了哪里?

把推理拆成结果、覆盖、选择、过程、预算、优化、分布与系统八张账, 从 CoT、verifier 与 GRPO 一路走到 DeepSeek-R1、Kimi k1.5 与 K3 MOPD。

LINEAGE
2021 → 2026
PAPERS
30 篇一手来源
LAB
预算 · GRPO · 九教师

NEW / CHAPTER 06 SPARSE EXPERTS

2.8T 参数,不等于每个 Token 跑 2.8T

把 MoE 拆成容量、激活计算、路由、负载、通信与稳定性六张账, 从 Switch、DeepSeekMoE、Loss-Free、LatentMoE 一路走到 K3 Stable LatentMoE。

LINEAGE
1991 → 2026
PAPERS
19 篇一手来源
LAB
8 架构 · 4 平衡策略

CHAPTER 07 LONG CONTEXT

一百万 Token,不是一扇更大的窗

把长上下文拆成计算、缓存、位置、状态容量与系统五张账, 沿 26 篇一手论文走完 FlashAttention、MLA、Delta Rule、KDA、Kimi K3 与 DeepSeek-V4。

LINEAGE
2019 → 2026
VISUALS
10+ 机制图
LAB
8 种策略 · 4 档长度

00 WHY THIS ATLAS

不是论文清单,而是一条能走通的理解路径

大模型知识最难的地方不是资料少,而是资料之间的桥断了:初学解释省略公式,论文省略历史, 系统报告又默认你已经理解模型。LLM Atlas 专门补这些桥。

课程主张

真正理解一项技术,需要同时回答:它解决什么瓶颈、核心机制如何工作、证据是否支持、 工程代价是什么,以及下一篇论文为什么自然会出现。

01 / PROBLEM

从问题开始

先看到旧方法撞上的墙,再引入新名词。KDA、MLA、MoE 都不再是凭空掉下来的缩写。

02 / LAYERS

四层解释

同一概念同时提供直觉、机制、论文和工程四层入口,允许读者在适合自己的深度停留。

03 / VISUAL

图必须能帮助推理

优先重绘可缩放、可交互的架构图;每种颜色固定含义,简化之处明确标出。

04 / EVIDENCE

事实、解释、推断分开

关键结论回到论文和官方实现。榜单写明 harness、工具预算与截止日期,未知就明确说未知。

01 LEARNING PATHS

你不必从第一页顺序读到最后

四条路径共享同一张知识图。点击路径切换,章节之间的先修关系始终可追踪。

零基础

从“下一个词”开始,不先背 Transformer 公式

先建立 Token、概率、向量和训练目标的直觉,再通过可操作的注意力实验进入架构。

  1. 01 语言模型从哪里来
  2. 02 注意力与 Transformer
  3. 03 表示、位置与残差
  4. 04 Scaling Laws
K3 反向拆解

先看全貌,再沿组件回到每条技术祖先

适合已经用过大模型、想迅速读懂 K3 报告的人。每个组件都能跳回其历史专题。

  1. 32 张问题账
  2. KDA / MLA / AttnRes / LatentMoE
  3. 预训练与 MOPD
  4. 1M RL / 服务 / 评测
DeepSeek 主线

沿一家公司,看算法—系统协同如何一步步形成

从 DeepSeek LLM 的 dense 基线,到 MoE、MLA、FP8、GRPO、R1、稀疏注意力与百万上下文。

  1. DeepSeekMoE
  2. V2 / MLA
  3. V3 / FP8 / DualPipe
  4. Math / GRPO / R1
  5. V3.2 / V4
系统工程

跟着一个 Token 穿过 GPU、网络、缓存与服务集群

适合工程背景读者,从计算与内存账本出发理解并行、低精度、通信和推理服务。

  1. 08 大规模训练
  2. 09 数值与优化
  3. 14 推理服务
  4. K3 §5 Infrastructure

02 CURRICULUM MAP

17 个专题,拼成一张完整技术地图

进度条表示内容成熟度,不代表相关领域的重要性。首版先打通全站骨架,再逐章扩写到论文与工程层。

00首版可读

先看懂一张大模型地图

面对几百个术语,我们究竟先学什么?

12 篇核心论文72%
01首版可读

语言模型从哪里来

预测下一个 Token,为什么能产生通用能力?

33 篇核心论文78%
02首版可读

注意力与 Transformer

一句话里的每个词,怎样直接找到真正相关的词?

40 篇核心论文79%
03首版可读

表示、位置与残差高速公路

模型如何知道词序,又如何让信息穿过上百层?

66 篇核心论文81%
04首版可读

Scaling Laws:规模为什么有效

多大模型、多少数据、多少计算才是划算的?

29 篇核心论文74%
05首版可读

数据工程与预训练配方

更多网页为什么不等于更好的模型?

31 篇核心论文73%
06首版可读

稀疏计算与 MoE

怎样让模型装下更多知识,却不让每个 Token 都付全部算力?

19 篇核心论文74%
07首版可读

长上下文与高效注意力

从 8K 到 1M Token,真正昂贵的是什么?

26 篇核心论文72%
08首版可读

大规模训练系统

一个 2.8T 模型如何摊到成千上万张卡上?

37 篇核心论文71%
09首版可读

数值精度、优化器与稳定性

为什么少几个比特能省巨资,也可能让训练瞬间崩掉?

36 篇核心论文75%
10首版可读

指令微调与人类偏好

会续写的 base model,怎样变成愿意协作的助手?

44 篇核心论文75%
11首版可读

推理模型与测试时扩展

模型如何学会多想一会儿,并检查自己的答案?

30 篇核心论文76%
12首版可读

工具使用与长程 Agent

生成一段文字,怎样变成持续数小时的可靠行动?

52 篇核心论文74%
13首版可读

原生多模态

图像是外接插件,还是和文字一样的第一类输入?

55 篇核心论文76%
14首版可读

推理服务与低成本部署

模型训练完以后,怎样让千万人用得起?

62 篇核心论文78%
15首版可读

评测、安全与“到底强不强”

一个榜单分数,究竟测到了模型、脚手架还是预算?

80 篇核心论文79%

03 KIMI K3 AS THE CONFLUENCE

K3 把三种信息流和一套庞大系统放进同一模型

K3 报告最好的阅读钥匙,是把架构看成 token、depth、channel 三个方向的信息流; 视觉输入与训练/服务基础设施则包住这三条轴。

Kimi K3 三维信息流简化图文字与图像进入模型后,依次通过由 KDA、Gated MLA 和 Stable LatentMoE 组成的模块;Attention Residuals 连接不同深度的表示。文字MoonViTEmbedding共享表示空间KDA线性工作记忆× 3Gated MLA压缩的全局注意力× 1下一个TokenStable LatentMoE896 → 16 expertsStable LatentMoE896 → 16 expertsAttention Residuals · 跨层选择FlashKDA · MoonEP · 1M RL · Prefix Cache · Fleet Scheduling

图 01 Kimi K3 架构的教学化简图。它强调 token、depth、channel 三个信息流维度,不代表逐算子实现;依据 K3 Technical Report Figure 2 与 §2 重绘。

K3 §2.1

KDA × Gated MLA:让一百万 Token 既高效流动,也保留全局精确交互

先用直觉说

三层 KDA 像持续更新的“工作记忆”,每四层插入一层全局 MLA,像定期把整本笔记摊开重看。

  • 3 个 KDA 层 + 1 个 Gated MLA 层为一组
  • 主干共 69 层 KDA、24 层 Gated MLA
  • KDA 线性扩展;MLA 周期性补足全局两两交互
进入完整 K3 技术报告导读 →

04 DEEPSEEK SPOTLIGHT

DeepSeek:一条极适合学习“算法—系统协同”的论文主线

从细粒度 MoE、MLA 和 FP8,到 GRPO 与 R1,DeepSeek 的每篇报告都在解决上一代留下的明确约束。 这里会给予它比普通模型谱系更细的篇幅。

2024.01
DS / 01

DeepSeek LLM

公开尺度规律与中英双语预训练,建立 7B / 67B dense 基线。

通向下一步

先弄清规模、数据与训练配方,再做稀疏化。

2024.01
DS / 02

DeepSeekMoE

细粒度专家分割 + shared experts,让专家更专、公共知识不必重复。

通向下一步

把容量扩张和每 Token 计算量分开。

2024.02
DS / 03

DeepSeekMath

从大规模数学数据工程走到 GRPO:用同题多条回答的相对奖励,省去独立 critic。

通向下一步

R1 的推理 RL 不是突然出现;算法与可验证数据的预演在这里发生。

2024.05
DS / 04

DeepSeek-V2

MLA 压缩 KV Cache;DeepSeekMoE 扩张稀疏容量。

通向下一步

训练经济性之外,开始直接优化推理内存与吞吐。

2024.12
DS / 05

DeepSeek-V3

671B-A37B、FP8 训练、无辅助损失负载均衡、MTP 与 DualPipe。

通向下一步

模型算法、数值格式与集群通信共同设计。

2025.01
DS / 06

DeepSeek-R1

R1-Zero 从强 V3 Base 直接做规则奖励 RL、没有 reasoning SFT;R1 再用冷启动与多阶段训练修复可读性和广度。

通向下一步

从“模仿答案”转向用可验证奖励塑造推理策略。

2025.03
PUBLIC FOLLOW-UP

DAPO / Dr.GRPO

公开后续研究分别暴露 clipping、采样、截断、响应长度与题目难度归一偏差。

通向下一步

复现不是 R1 的内部 recipe,而是一台看清 RL 优化对象的显微镜。

2025.12
DS / 08

DeepSeek-V3.2

DeepSeek Sparse Attention 降低长上下文成本,并统一 thinking 与 tool use。

通向下一步

把推理模型推进长上下文 Agent 场景。

2026.06
DS / 09

DeepSeek-V4

CSA/HCA 构成异构长状态,mHC 约束深层残差,Muon 与数值边界共同支撑百万 Token。

通向下一步

长上下文不再只是位置外推,而是注意力、训练与服务的全系统问题。

阅读 DeepSeek 专题 →

05 OPEN RESEARCH

课程本身也是一项开放研究工程

网站源码、路线、进度和研究规范全部公开。Grok 用来扩展检索线索,最终结论由一手论文和官方实现核验。

P0

一手论文

arXiv、会议、期刊与作者正式技术报告,承载核心机制和实验数字。

P1

官方实现

仓库、模型卡、训练与评测代码,用于确认论文描述如何落到真实系统。

P2

官方说明

实验室博客、系统卡和产品文档;尚无论文的新模型会临时使用并标明状态。

P3+

独立复现

第三方结果用于检验外部有效性;二手文章只发现线索,不承载关键事实。