LIBRARY / 01 PRIMARY SOURCES

不是论文坟场,
而是一张演化地图

每一篇只回答两个问题:它解决了上一代路线的什么困难,又把什么新问题留给了后来者。 你可以按专题筛选,也可以沿 Kimi / DeepSeek 两条聚光主线回看技术汇流。

INDEXED
223 篇
SPAN
1948—2026
LINK CHECKED
223 篇
SPOTLIGHT
19 篇

01 CURATED INDEX

从问题出发,再去读论文

“主链接已核验”只代表题名与权威入口经过检查,不代表我们复现了全部实验。 深度精读、公式推导与架构图会逐章进入专题正文;这里先负责帮你找到正确入口。

223篇论文可见
001

让每层以 softmax 选择先前深度表示,并给出 Block AttnRes。

Transformer长上下文主链接已核验
005

四文本域与视觉语料、2.8T-A104B、KDA/MLA、Stable LatentMoE 与 1M Agentic RL。

长上下文MoE数据训练系统低精度推理Agent多模态评测主链接已核验
018

覆盖多学科的高难、抗饱和闭答与多模态题集。

评测推理主链接已核验
020

开放 1T MoE Agent 模型,以 15.5T、知识/数学改写与 verifiable gym / self-critique joint RL 协同。

MoE数据训练系统Agent后训练推理主链接已核验
025

从强教师精选 1K 道推理题蒸馏,并用 budget forcing 控制思考长度。

推理后训练主链接已核验
035

671B-A37B;FP8、MTP、无辅助损失平衡与 DualPipe。

MoEScaling数据训练系统低精度主链接已核验
050

强开放稀疏模型,普及每层 top-2 experts 的工程实践。

MoE主链接已核验
054

提出训练计算分配会改变可迁移性的争议性假说;在课程中仅作为待检验观点。

Scaling主链接已核验
056

记录 reasoning model 的能力、安全评测与测试时推理边界。

推理评测主链接已核验
090

发布 PRM800K;在 500 题 MATH 子集的 best-of-1860 选择中验证过程监督优势。

推理后训练主链接已核验
208

建立 FP32 master weights、loss scaling 与 FP32 accumulation 配方。

低精度训练系统主链接已核验

02 HOW TO READ

别从摘要一路硬啃到附录

01

先找旧瓶颈

作者认为上一代方法哪里太慢、太贵、不稳定或不够通用?

02

再看核心替换

是哪一个数据流、损失函数或系统边界被重新设计?先画图,再看公式。

03

盯住公平对照

参数量、激活量、训练 token、硬件和推理预算是否真的可比?

04

最后追后继者

真正重要的想法,会被下一篇论文复用、修正,或暴露新的代价。