从问题开始
先看到旧方法撞上的墙,再引入新名词。KDA、MLA、MoE 都不再是凭空掉下来的缩写。
NEW / CHAPTER 11 REASONING & TEST-TIME SCALING
把推理拆成结果、覆盖、选择、过程、预算、优化、分布与系统八张账, 从 CoT、verifier 与 GRPO 一路走到 DeepSeek-R1、Kimi k1.5 与 K3 MOPD。
NEW / CHAPTER 06 SPARSE EXPERTS
把 MoE 拆成容量、激活计算、路由、负载、通信与稳定性六张账, 从 Switch、DeepSeekMoE、Loss-Free、LatentMoE 一路走到 K3 Stable LatentMoE。
CHAPTER 07 LONG CONTEXT
把长上下文拆成计算、缓存、位置、状态容量与系统五张账, 沿 26 篇一手论文走完 FlashAttention、MLA、Delta Rule、KDA、Kimi K3 与 DeepSeek-V4。
00 WHY THIS ATLAS
大模型知识最难的地方不是资料少,而是资料之间的桥断了:初学解释省略公式,论文省略历史, 系统报告又默认你已经理解模型。LLM Atlas 专门补这些桥。
真正理解一项技术,需要同时回答:它解决什么瓶颈、核心机制如何工作、证据是否支持、 工程代价是什么,以及下一篇论文为什么自然会出现。
先看到旧方法撞上的墙,再引入新名词。KDA、MLA、MoE 都不再是凭空掉下来的缩写。
同一概念同时提供直觉、机制、论文和工程四层入口,允许读者在适合自己的深度停留。
优先重绘可缩放、可交互的架构图;每种颜色固定含义,简化之处明确标出。
关键结论回到论文和官方实现。榜单写明 harness、工具预算与截止日期,未知就明确说未知。
01 LEARNING PATHS
四条路径共享同一张知识图。点击路径切换,章节之间的先修关系始终可追踪。
先建立 Token、概率、向量和训练目标的直觉,再通过可操作的注意力实验进入架构。
适合已经用过大模型、想迅速读懂 K3 报告的人。每个组件都能跳回其历史专题。
从 DeepSeek LLM 的 dense 基线,到 MoE、MLA、FP8、GRPO、R1、稀疏注意力与百万上下文。
适合工程背景读者,从计算与内存账本出发理解并行、低精度、通信和推理服务。
02 CURRICULUM MAP
进度条表示内容成熟度,不代表相关领域的重要性。首版先打通全站骨架,再逐章扩写到论文与工程层。
面对几百个术语,我们究竟先学什么?
预测下一个 Token,为什么能产生通用能力?
一句话里的每个词,怎样直接找到真正相关的词?
模型如何知道词序,又如何让信息穿过上百层?
多大模型、多少数据、多少计算才是划算的?
更多网页为什么不等于更好的模型?
怎样让模型装下更多知识,却不让每个 Token 都付全部算力?
从 8K 到 1M Token,真正昂贵的是什么?
一个 2.8T 模型如何摊到成千上万张卡上?
为什么少几个比特能省巨资,也可能让训练瞬间崩掉?
会续写的 base model,怎样变成愿意协作的助手?
模型如何学会多想一会儿,并检查自己的答案?
生成一段文字,怎样变成持续数小时的可靠行动?
图像是外接插件,还是和文字一样的第一类输入?
模型训练完以后,怎样让千万人用得起?
一个榜单分数,究竟测到了模型、脚手架还是预算?
03 KIMI K3 AS THE CONFLUENCE
K3 报告最好的阅读钥匙,是把架构看成 token、depth、channel 三个方向的信息流; 视觉输入与训练/服务基础设施则包住这三条轴。
图 01 Kimi K3 架构的教学化简图。它强调 token、depth、channel 三个信息流维度,不代表逐算子实现;依据 K3 Technical Report Figure 2 与 §2 重绘。
三层 KDA 像持续更新的“工作记忆”,每四层插入一层全局 MLA,像定期把整本笔记摊开重看。
普通残差像接力棒,只能拿到累加后的结果;AttnRes 更像档案索引,可以挑选哪一层的中间表示最有用。
模型把“知识容量”和“本次计算量”拆开:专家库很大,但每次只激活最匹配的一小组。
视觉编码器先把图像压成一串向量,再由轻量投影器把它们放进和文字相同的表示空间。
一个公式只有在 GPU 内核、跨卡通信、显存和调度上都跑得通,才真正成为 2.8T 模型的一部分。
04 DEEPSEEK SPOTLIGHT
从细粒度 MoE、MLA 和 FP8,到 GRPO 与 R1,DeepSeek 的每篇报告都在解决上一代留下的明确约束。 这里会给予它比普通模型谱系更细的篇幅。
公开尺度规律与中英双语预训练,建立 7B / 67B dense 基线。
先弄清规模、数据与训练配方,再做稀疏化。
细粒度专家分割 + shared experts,让专家更专、公共知识不必重复。
把容量扩张和每 Token 计算量分开。
MLA 压缩 KV Cache;DeepSeekMoE 扩张稀疏容量。
训练经济性之外,开始直接优化推理内存与吞吐。
671B-A37B、FP8 训练、无辅助损失负载均衡、MTP 与 DualPipe。
模型算法、数值格式与集群通信共同设计。
R1-Zero 展示纯大规模 RL 可涌现推理;R1 用冷启动数据修复可读性与稳定性。
从“模仿答案”转向用可验证奖励塑造推理策略。
DeepSeek Sparse Attention 降低长上下文成本,并统一 thinking 与 tool use。
把推理模型推进长上下文 Agent 场景。
围绕百万 Token 上下文效率继续扩展,成为 K3 报告直接比较的开放前沿之一。
长上下文不再只是位置外推,而是注意力、训练与服务的全系统问题。
05 OPEN RESEARCH
网站源码、路线、进度和研究规范全部公开。Grok 用来扩展检索线索,最终结论由一手论文和官方实现核验。
arXiv、会议、期刊与作者正式技术报告,承载核心机制和实验数字。
仓库、模型卡、训练与评测代码,用于确认论文描述如何落到真实系统。
实验室博客、系统卡和产品文档;尚无论文的新模型会临时使用并标明状态。
第三方结果用于检验外部有效性;二手文章只发现线索,不承载关键事实。