从问题开始
先看到旧方法撞上的墙,再引入新名词。KDA、MLA、MoE 都不再是凭空掉下来的缩写。
OPEN COURSE / 2026 LARGE LANGUAGE MODELS
这是一套按问题脉络组织的中文开放课程。我们从最小直觉出发,追踪每篇关键论文究竟解决了什么, 再把注意力、MoE、规模化训练、多模态、推理强化学习与 Agent 系统重新汇入 Kimi K3。
表示学习 · Transformer · Scaling · 数据工程 · MoE · 长上下文 · 训练系统 · 数值优化 · 后训练 · 推理 · Agent · 多模态 · 服务与评测
查看实时进度 →NEW / K3 ROUND 08 TRAIN-TIME FORWARD · PREREGISTERED GATE
四个前向架构变体各跑三个 8,000-step seed,再完整 replay 主格:groups 6+7 的 contrast / peak 六格降幅为 32.3%–77.3%,BPC 质量门 4 / 4 通过。结论只限缩小 depth-32 Block 协议,不是真实 K3 checkpoint 或 Figure 5(c) 复现。
NEW / DEEPSEEK ROUND 08 TASK BOOTSTRAP · EXPLICIT COMMON RANDOM NUMBERS
从每域四题扩到 HumanEval / GSM8K 各 32 题,并把“同 seed”升级为显式共享 uniform tape:352 条正式输出、10,000 次选定任务配对 bootstrap 与 64 条 十二字段新进程重放。正确性区间都跨零,但输出长度揭示 Code 与 Math 方向相反。
NEW / CHAPTER 03 TOKEN · POSITION · DEPTH · FFN
用二十张问题账从 Token、embedding 与上下文化表示,走到 RoPE / NoPE、Pre / Post-LN、 DeepSeek mHC 与 partial RoPE,以及 Kimi K3 的 9 个 AttnRes 深度来源和有界 SiTU-GLU。
NEW / CHAPTER 15 SCORE · PROTOCOL · THREAT MODEL
用二十二张测量账从 PPL、MMLU、pass@k、校准与污染,走到 LLM Judge、Arena、 Agent 最终状态和安全威胁模型;逐字段复原 DeepSeek-R1 与 Kimi K3 的评测协议。
NEW / CHAPTER 14 MEMORY · TIME · FLEET
用十八本账从 KV Cache、PagedAttention、连续批处理、chunked prefill、量化和推测解码, 走到 DeepSeek V2→V4 的异构状态谱系,以及 Mooncake→Kimi K3 的混合缓存、亲和路由与预算准入。
NEW / CHAPTER 13 PIXELS · TOKENS · NATIVE MULTIMODALITY
用语义空间、连接器、分辨率、OCR、视频、训练、幻觉、评测与 Agent 十六张账, 从 ViT、CLIP 和 LLaVA 走到 DeepSeek-VL / Janus / OCR 三分支,以及 Kimi 三代 MoonViT 与 K3 从头共同 NTP。
NEW / CHAPTER 12 AGENTS · TOOL USE · ENVIRONMENTS
用环境、工具、循环、规划、记忆、执行、验证、轨迹、归因、分布、系统、可靠性、评测与安全十四张账, 从 TextWorld、ReAct 和 Toolformer 走到 DeepSeek-V4 DSec 与 Kimi K3 百万 Token Agentic RL。
NEW / CHAPTER 10 ALIGNMENT · PREFERENCE
用目标、监督、来源、SFT、偏好、奖励、更新、分布、约束、失效与证据十二张账, 从 2017 人类偏好学习一路走到 InstructGPT、Constitutional AI、DPO、DeepSeek-R1/V4 与 Kimi K3。
NEW / CHAPTER 02 ATTENTION · TRANSFORMER
用信息路径、匹配几何、可见性、多头、位置、局部计算、深度、架构目标、系统成本与当代映射十张账, 从 Bahdanau 软对齐和 2017 原始 encoder–decoder,一路走到 FlashAttention、DeepSeek MLA 与 Kimi K3。
NEW / CHAPTER 01 LANGUAGE MODELING ORIGINS
用预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导与系统成本八张账, 从 Shannon、N-gram、Kneser–Ney、Bengio、RNN/LSTM 一路走到 Seq2Seq、Attention 与 K3 / DeepSeek。
NEW / CHAPTER 09 PRECISION · OPTIMIZATION · STABILITY
用表示、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据十张账, 从 mixed precision、BF16、FP8 和 MXFP4,一路走到 AdamW、Muon、Kimi K2/K3 与 DeepSeek-V3/V4。
NEW / CHAPTER 05 DATA & PRE-TRAINING
用来源、解析、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与模型感知价值十二张账, 从 C4、Pile、DoReMi 和 DCLM 一路走到 DeepSeek 五代数据工程与 Kimi K2→K3 原生多模态。
NEW / CHAPTER 04 SCALING LAWS
用观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账, 从早期经验幂律、Kaplan、Chinchilla 与复现争议,一路走到 DeepSeek scaling study 和 Kimi K3。
NEW / CHAPTER 08 LARGE-SCALE TRAINING SYSTEMS
用模型状态、激活、计算划分、气泡、collective、专家、上下文、数值与可靠性九张账, 从 ZeRO、Megatron 一路走到 DeepSeek DualPipe、Kimi MoonEP 与百万 Token Agentic RL。
NEW / CHAPTER 11 REASONING & TEST-TIME SCALING
把推理拆成结果、覆盖、选择、过程、预算、优化、分布与系统八张账, 从 CoT、verifier 与 GRPO 一路走到 DeepSeek-R1、Kimi k1.5 与 K3 MOPD。
NEW / CHAPTER 06 SPARSE EXPERTS
把 MoE 拆成容量、激活计算、路由、负载、通信与稳定性六张账, 从 Switch、DeepSeekMoE、Loss-Free、LatentMoE 一路走到 K3 Stable LatentMoE。
CHAPTER 07 LONG CONTEXT
把长上下文拆成计算、缓存、位置、状态容量与系统五张账, 沿 26 篇一手论文走完 FlashAttention、MLA、Delta Rule、KDA、Kimi K3 与 DeepSeek-V4。
00 WHY THIS ATLAS
大模型知识最难的地方不是资料少,而是资料之间的桥断了:初学解释省略公式,论文省略历史, 系统报告又默认你已经理解模型。LLM Atlas 专门补这些桥。
真正理解一项技术,需要同时回答:它解决什么瓶颈、核心机制如何工作、证据是否支持、 工程代价是什么,以及下一篇论文为什么自然会出现。
先看到旧方法撞上的墙,再引入新名词。KDA、MLA、MoE 都不再是凭空掉下来的缩写。
同一概念同时提供直觉、机制、论文和工程四层入口,允许读者在适合自己的深度停留。
优先重绘可缩放、可交互的架构图;每种颜色固定含义,简化之处明确标出。
关键结论回到论文和官方实现。榜单写明 harness、工具预算与截止日期,未知就明确说未知。
01 LEARNING PATHS
四条路径共享同一张知识图。点击路径切换,章节之间的先修关系始终可追踪。
先建立 Token、概率、向量和训练目标的直觉,再通过可操作的注意力实验进入架构。
适合已经用过大模型、想迅速读懂 K3 报告的人。每个组件都能跳回其历史专题。
从 DeepSeek LLM 的 dense 基线,到 MoE、MLA、FP8、GRPO、R1、稀疏注意力与百万上下文。
适合工程背景读者,从计算与内存账本出发理解并行、低精度、通信和推理服务。
02 CURRICULUM MAP
进度条表示内容成熟度,不代表相关领域的重要性。首版先打通全站骨架,再逐章扩写到论文与工程层。
面对几百个术语,我们究竟先学什么?
预测下一个 Token,为什么能产生通用能力?
一句话里的每个词,怎样直接找到真正相关的词?
模型如何知道词序,又如何让信息穿过上百层?
多大模型、多少数据、多少计算才是划算的?
更多网页为什么不等于更好的模型?
怎样让模型装下更多知识,却不让每个 Token 都付全部算力?
从 8K 到 1M Token,真正昂贵的是什么?
一个 2.8T 模型如何摊到成千上万张卡上?
为什么少几个比特能省巨资,也可能让训练瞬间崩掉?
会续写的 base model,怎样变成愿意协作的助手?
模型如何学会多想一会儿,并检查自己的答案?
生成一段文字,怎样变成持续数小时的可靠行动?
图像是外接插件,还是和文字一样的第一类输入?
模型训练完以后,怎样让千万人用得起?
一个榜单分数,究竟测到了模型、脚手架还是预算?
03 KIMI K3 AS THE CONFLUENCE
K3 报告最好的阅读钥匙,是把架构看成 token、depth、channel 三个方向的信息流; 视觉输入与训练/服务基础设施则包住这三条轴。
图 01 Kimi K3 架构的教学化简图。它强调 token、depth、channel 三个信息流维度,不代表逐算子实现;依据 K3 Technical Report Figure 2 与 §2 重绘。
三层 KDA 像持续更新的“工作记忆”,每四层插入一层全局 MLA,像定期把整本笔记摊开重看。
普通残差像接力棒,只能拿到累加后的结果;AttnRes 更像档案索引,可以挑选哪一层的中间表示最有用。
模型把“知识容量”和“本次计算量”拆开:专家库很大,但每次只激活最匹配的一小组。
视觉编码器先把图像压成一串向量,再由轻量投影器把它们放进和文字相同的表示空间。
一个公式只有在 GPU 内核、跨卡通信、显存和调度上都跑得通,才真正成为 2.8T 模型的一部分。
04 DEEPSEEK SPOTLIGHT
从细粒度 MoE、MLA 和 FP8,到 GRPO 与 R1,DeepSeek 的每篇报告都在解决上一代留下的明确约束。 这里会给予它比普通模型谱系更细的篇幅。
公开尺度规律与中英双语预训练,建立 7B / 67B dense 基线。
先弄清规模、数据与训练配方,再做稀疏化。
细粒度专家分割 + shared experts,让专家更专、公共知识不必重复。
把容量扩张和每 Token 计算量分开。
从大规模数学数据工程走到 GRPO:用同题多条回答的相对奖励,省去独立 critic。
R1 的推理 RL 不是突然出现;算法与可验证数据的预演在这里发生。
MLA 压缩 KV Cache;DeepSeekMoE 扩张稀疏容量。
训练经济性之外,开始直接优化推理内存与吞吐。
671B-A37B、FP8 训练、无辅助损失负载均衡、MTP 与 DualPipe。
模型算法、数值格式与集群通信共同设计。
R1-Zero 从强 V3 Base 直接做规则奖励 RL、没有 reasoning SFT;R1 再用冷启动与多阶段训练修复可读性和广度。
从“模仿答案”转向用可验证奖励塑造推理策略。
公开后续研究分别暴露 clipping、采样、截断、响应长度与题目难度归一偏差。
复现不是 R1 的内部 recipe,而是一台看清 RL 优化对象的显微镜。
DeepSeek Sparse Attention 降低长上下文成本,并统一 thinking 与 tool use。
把推理模型推进长上下文 Agent 场景。
CSA/HCA 构成异构长状态,mHC 约束深层残差,Muon 与数值边界共同支撑百万 Token。
长上下文不再只是位置外推,而是注意力、训练与服务的全系统问题。
05 OPEN RESEARCH
网站源码、路线、进度和研究规范全部公开。Grok 用来扩展检索线索,最终结论由一手论文和官方实现核验。
arXiv、会议、期刊与作者正式技术报告,承载核心机制和实验数字。
仓库、模型卡、训练与评测代码,用于确认论文描述如何落到真实系统。
实验室博客、系统卡和产品文档;尚无论文的新模型会临时使用并标明状态。
第三方结果用于检验外部有效性;二手文章只发现线索,不承载关键事实。