LIBRARY / 01 PRIMARY SOURCES

不是论文坟场,
而是一张演化地图

每一篇只回答两个问题:它解决了上一代路线的什么困难,又把什么新问题留给了后来者。 你可以按专题筛选,也可以沿 Kimi / DeepSeek 两条聚光主线回看技术汇流。

INDEXED
486 篇
SPAN
1948—2026
LINK CHECKED
486 篇
SPOTLIGHT
35 篇

01 CURATED INDEX

从问题出发,再去读论文

“主链接已核验”只代表题名与权威入口经过检查,不代表我们复现了全部实验。 深度精读、公式推导与架构图会逐章进入专题正文;这里先负责帮你找到正确入口。

486篇论文可见
001

面向 Agentic AI 的 Firecracker microVM 环境,支持 pause、resume、fork、snapshot 与高密度运行。

Agent训练系统主链接已核验
↗
002

让每层以 softmax 选择先前深度表示,并给出 Block AttnRes。

Transformer长上下文主链接已核验
↗
008

四文本域与视觉语料、2.8T-A104B、KDA/MLA、Stable LatentMoE 与 1M Agentic RL。

基础长上下文MoE数据训练系统低精度推理Agent多模态评测主链接已核验
↗
018

DeepGEMM

DeepSeek

DeepSeek 官方开源 FP8 与低精度 GEMM kernel 库,覆盖 dense 与 MoE 形状。

推理服务低精度训练系统主链接已核验
↗
026

FlashMLA

DeepSeek

DeepSeek 官方面向 Multi-head Latent Attention prefill / decode 的高效 kernel。

推理服务长上下文训练系统主链接已核验
↗
030

覆盖多学科的高难、抗饱和闭答与多模态题集。

评测推理主链接已核验
↗
033

开放 1T MoE Agent 模型,以 15.5T、知识/数学改写与 verifiable gym / self-critique joint RL 协同。

MoE数据训练系统Agent后训练推理主链接已核验
↗
040

从头训练动态分辨率 ViT,引入绝对时间编码并强化文档和视觉 Agent。

多模态Agent主链接已核验
↗
042

从强教师精选 1K 道推理题蒸馏,并用 budget forcing 控制思考长度。

推理后训练主链接已核验
↗
044

从新近 GitHub issue 持续构建可执行软件任务,以版本化动态集降低仓库级代码评测污染。

评测Agent主链接已核验
↗
054

重新标注 MMLU 全集并分析错误、歧义与题目质量,说明静态权威基准也需要系统维护。

评测主链接已核验
↗
073

671B-A37B;FP8、MTP、无辅助损失平衡与 DualPipe。

基础MoEScaling数据训练系统低精度主链接已核验
↗
095

扩宽 residual stream 并学习层输入、流间和层输出映射,为网络深度增加新的连接轴。

表示Transformer主链接已核验
↗
122

强开放稀疏模型,普及每层 top-2 experts 的工程实践。

MoE主链接已核验
↗
127

提出训练计算分配会改变可迁移性的争议性假说;在课程中仅作为待检验观点。

Scaling主链接已核验
↗
130

记录 reasoning model 的能力、安全评测与测试时推理边界。

推理评测主链接已核验
↗
215

发布 PRM800K;在 500 题 MATH 子集的 best-of-1860 选择中验证过程监督优势。

推理后训练主链接已核验
↗
216

用约一千条精选示范检验强基座上少量高质量 SFT 的接口塑形能力,并明确其适用边界。

后训练数据主链接已核验
↗
267

NVIDIA 官方 LLM 推理运行时,整合低精度 kernel、并行、KV Cache 与动态批处理。

推理服务低精度训练系统主链接已核验
↗
399

展示 Attention 权重与特征重要性可能不相关,且不同权重可产生近似预测,划定解释边界。

Transformer评测主链接已核验
↗
400

指出解释结论依赖定义、模型整体、基线与测试协议,为 Attention 解释争论补充对照。

Transformer评测主链接已核验
↗
434

建立 FP32 master weights、loss scaling 与 FP32 accumulation 配方。

低精度训练系统主链接已核验
↗
440

通过自动搜索得到 Swish / SiLU 形式 x·sigmoid(βx),成为 SwiGLU gate 的直接函数前史。

表示Transformer主链接已核验
↗
447

在单个样本内按层输入统计量归一化,为序列模型提供训练/推理一致的尺度控制。

Transformer主链接已核验
↗
456

让 Attention 分布直接指向输入位置,展示软路由不仅能混合表示,也能定义可变输出字典。

Transformer主链接已核验
↗
474

用受门控的恒定误差通路缓解循环网络的长期依赖与衰减误差回流。

基础主链接已核验
↗
480

Elman 网络用循环 context units 在预测任务中形成序列相关的隐藏结构。

基础主链接已核验
↗

02 HOW TO READ

别从摘要一路硬啃到附录

01

先找旧瓶颈

作者认为上一代方法哪里太慢、太贵、不稳定或不够通用?

02

再看核心替换

是哪一个数据流、损失函数或系统边界被重新设计?先画图,再看公式。

03

盯住公平对照

参数量、激活量、训练 token、硬件和推理预算是否真的可比?

04

最后追后继者

真正重要的想法,会被下一篇论文复用、修正,或暴露新的代价。