OPEN COURSE / 2026 LARGE LANGUAGE MODELS

大模型技术全景从“预测下一个词”到 Kimi K3 的 2.8T 开放前沿

这是一套按问题脉络组织的中文开放课程。我们从最小直觉出发,追踪每篇关键论文究竟解决了什么, 再把注意力、MoE、规模化训练、多模态、推理强化学习与 Agent 系统重新汇入 Kimi K3。

研究范围

表示学习 · Transformer · Scaling · MoE · 长上下文 · 训练系统 · 后训练 · 推理 · Agent · 多模态 · 服务与评测

查看实时进度 →

00 WHY THIS ATLAS

不是论文清单,而是一条能走通的理解路径

大模型知识最难的地方不是资料少,而是资料之间的桥断了:初学解释省略公式,论文省略历史, 系统报告又默认你已经理解模型。LLM Atlas 专门补这些桥。

课程主张

真正理解一项技术,需要同时回答:它解决什么瓶颈、核心机制如何工作、证据是否支持、 工程代价是什么,以及下一篇论文为什么自然会出现。

01 / PROBLEM

从问题开始

先看到旧方法撞上的墙,再引入新名词。KDA、MLA、MoE 都不再是凭空掉下来的缩写。

02 / LAYERS

四层解释

同一概念同时提供直觉、机制、论文和工程四层入口,允许读者在适合自己的深度停留。

03 / VISUAL

图必须能帮助推理

优先重绘可缩放、可交互的架构图;每种颜色固定含义,简化之处明确标出。

04 / EVIDENCE

事实、解释、推断分开

关键结论回到论文和官方实现。榜单写明 harness、工具预算与截止日期,未知就明确说未知。

01 LEARNING PATHS

你不必从第一页顺序读到最后

四条路径共享同一张知识图。点击路径切换,章节之间的先修关系始终可追踪。

零基础

从“下一个词”开始,不先背 Transformer 公式

先建立 Token、概率、向量和训练目标的直觉,再通过可操作的注意力实验进入架构。

  1. 01 语言模型从哪里来
  2. 02 注意力与 Transformer
  3. 03 表示、位置与残差
  4. 04 Scaling Laws
K3 反向拆解

先看全貌,再沿组件回到每条技术祖先

适合已经用过大模型、想迅速读懂 K3 报告的人。每个组件都能跳回其历史专题。

  1. K3 三维信息流
  2. KDA 与 MLA
  3. Stable LatentMoE
  4. 1M Agentic RL 与系统
DeepSeek 主线

沿一家公司,看算法—系统协同如何一步步形成

从 DeepSeek LLM 的 dense 基线,到 MoE、MLA、FP8、GRPO、R1、稀疏注意力与百万上下文。

  1. DeepSeekMoE
  2. V2 / MLA
  3. V3 / FP8 / DualPipe
  4. Math / GRPO / R1
  5. V3.2 / V4
系统工程

跟着一个 Token 穿过 GPU、网络、缓存与服务集群

适合工程背景读者,从计算与内存账本出发理解并行、低精度、通信和推理服务。

  1. 08 大规模训练
  2. 09 数值与优化
  3. 14 推理服务
  4. K3 §5 Infrastructure

02 CURRICULUM MAP

16 个专题,拼成一张完整技术地图

进度条表示内容成熟度,不代表相关领域的重要性。首版先打通全站骨架,再逐章扩写到论文与工程层。

00首版可读

先看懂一张大模型地图

面对几百个术语,我们究竟先学什么?

12 篇核心论文72%
01研究中

语言模型从哪里来

预测下一个 Token,为什么能产生通用能力?

10 篇核心论文24%
02首版可读

注意力与 Transformer

一句话里的每个词,怎样直接找到真正相关的词?

12 篇核心论文45%
03研究中

表示、位置与残差高速公路

模型如何知道词序,又如何让信息穿过上百层?

16 篇核心论文18%
04研究中

Scaling Laws:规模为什么有效

多大模型、多少数据、多少计算才是划算的?

11 篇核心论文22%
05待展开

数据工程与预训练配方

更多网页为什么不等于更好的模型?

14 篇核心论文8%
06首版可读

稀疏计算与 MoE

怎样让模型装下更多知识,却不让每个 Token 都付全部算力?

19 篇核心论文74%
07首版可读

长上下文与高效注意力

从 8K 到 1M Token,真正昂贵的是什么?

26 篇核心论文72%
08待展开

大规模训练系统

一个 2.8T 模型如何摊到成千上万张卡上?

18 篇核心论文12%
09待展开

数值精度、优化器与稳定性

为什么少几个比特能省巨资,也可能让训练瞬间崩掉?

16 篇核心论文13%
10待展开

指令微调与人类偏好

会续写的 base model,怎样变成愿意协作的助手?

18 篇核心论文10%
11首版可读

推理模型与测试时扩展

模型如何学会多想一会儿,并检查自己的答案?

30 篇核心论文76%
12待展开

工具使用与长程 Agent

生成一段文字,怎样变成持续数小时的可靠行动?

22 篇核心论文14%
13待展开

原生多模态

图像是外接插件,还是和文字一样的第一类输入?

19 篇核心论文11%
14待展开

推理服务与低成本部署

模型训练完以后,怎样让千万人用得起?

20 篇核心论文12%
15待展开

评测、安全与“到底强不强”

一个榜单分数,究竟测到了模型、脚手架还是预算?

24 篇核心论文13%

03 KIMI K3 AS THE CONFLUENCE

K3 把三种信息流和一套庞大系统放进同一模型

K3 报告最好的阅读钥匙,是把架构看成 token、depth、channel 三个方向的信息流; 视觉输入与训练/服务基础设施则包住这三条轴。

Kimi K3 三维信息流简化图文字与图像进入模型后,依次通过由 KDA、Gated MLA 和 Stable LatentMoE 组成的模块;Attention Residuals 连接不同深度的表示。MoonViTEmbedding共享表示空间KDA线性工作记忆× 3Gated MLA压缩的全局注意力× 1下一个TokenStable LatentMoE896 → 16 expertsStable LatentMoE896 → 16 expertsAttention Residuals · 跨层选择FlashKDA · MoonEP · 1M RL · Prefix Cache · Fleet Scheduling

图 01 Kimi K3 架构的教学化简图。它强调 token、depth、channel 三个信息流维度,不代表逐算子实现;依据 K3 Technical Report Figure 2 与 §2 重绘。

K3 §2.1

KDA × Gated MLA:让一百万 Token 既高效流动,也保留全局精确交互

先用直觉说

三层 KDA 像持续更新的“工作记忆”,每四层插入一层全局 MLA,像定期把整本笔记摊开重看。

  • 3 个 KDA 层 + 1 个 Gated MLA 层为一组
  • 主干共 69 层 KDA、24 层 Gated MLA
  • KDA 线性扩展;MLA 周期性补足全局两两交互
进入完整 K3 技术报告导读 →

04 DEEPSEEK SPOTLIGHT

DeepSeek:一条极适合学习“算法—系统协同”的论文主线

从细粒度 MoE、MLA 和 FP8,到 GRPO 与 R1,DeepSeek 的每篇报告都在解决上一代留下的明确约束。 这里会给予它比普通模型谱系更细的篇幅。

阅读 DeepSeek 专题 →

05 OPEN RESEARCH

课程本身也是一项开放研究工程

网站源码、路线、进度和研究规范全部公开。Grok 用来扩展检索线索,最终结论由一手论文和官方实现核验。

P0

一手论文

arXiv、会议、期刊与作者正式技术报告,承载核心机制和实验数字。

P1

官方实现

仓库、模型卡、训练与评测代码,用于确认论文描述如何落到真实系统。

P2

官方说明

实验室博客、系统卡和产品文档;尚无论文的新模型会临时使用并标明状态。

P3+

独立复现

第三方结果用于检验外部有效性;二手文章只发现线索,不承载关键事实。