让每层以 softmax 选择先前深度表示,并给出 Block AttnRes。
LIBRARY / 01 PRIMARY SOURCES
不是论文坟场,
而是一张演化地图
每一篇只回答两个问题:它解决了上一代路线的什么困难,又把什么新问题留给了后来者。 你可以按专题筛选,也可以沿 Kimi / DeepSeek 两条聚光主线回看技术汇流。
- INDEXED
- 223 篇
- SPAN
- 1948—2026
- LINK CHECKED
- 223 篇
- SPOTLIGHT
- 19 篇
01 CURATED INDEX
从问题出发,再去读论文
“主链接已核验”只代表题名与权威入口经过检查,不代表我们复现了全部实验。 深度精读、公式推导与架构图会逐章进入专题正文;这里先负责帮你找到正确入口。
以 SoftQ 和 masked-input regularization 更新有限唯一数据下的重复训练研究。
32/33T 长文与 agentic 数据、CSA/HCA、mHC、Muon 和 1M 上下文双模型。
把视觉、工具使用和并行 Agent Swarm 纳入统一后训练。
四文本域与视觉语料、2.8T-A104B、KDA/MLA、Stable LatentMoE 与 1M Agentic RL。
让学生在自己的 rollout 上接收同源领域教师的稠密逐 Token 信号,整合多项 RL 能力。
用有界幂律激活控制极值,连接 activation 设计与低精度稳定性。
要求网页 Agent 多步寻找难以直接检索的事实。
用 Clip-Higher、Dynamic Sampling、token-level loss 与 overlong shaping 稳定长 CoT RL。
提供面向 NVLink/RDMA 的高吞吐与低延迟 expert dispatch/combine kernels。
R1-Zero 从 base 直接做规则奖励 RL;R1 再加入冷启动、SFT、多阶段 RL 与蒸馏。
DeepSeek Sparse Attention、规模化 RL 与 Agentic 任务合成。
用 pass@k 检查当前 RLVR 是扩展解法覆盖,还是主要重排已有正确路径。
探索权重、激活与梯度广泛采用 FP4 的 fully quantized 训练边界。
把快速遗忘 gate 与定点纠错 delta rule 合并。
把模型感知的数据影响估计扩展到 group-level 选择。
覆盖多学科的高难、抗饱和闭答与多模态题集。
用 128K RL context、partial rollout 与 long2short 扩展长 CoT 和测试时计算。
开放 1T MoE Agent 模型,以 15.5T、知识/数学改写与 verifiable gym / self-critique joint RL 协同。
提出 KDA 并用 3:1 KDA/MLA 混合补足线性状态瓶颈。
MoonViT 原生分辨率视觉编码器与稀疏语言主干。
补足 Muon 在 LLM 规模的权重衰减与更新尺度配方。
显示更长预训练可能降低后续微调可塑性,分开 base loss 与最终产品目标。
从强教师精选 1K 道推理题蒸馏,并用 budget forcing 控制思考长度。
用 SwallowCode 与 SwallowMath 研究受控合成数据的继续预训练收益与边界。
提出 Dr.GRPO,分析 response-length 与 question-difficulty 两种优化偏置。
以只影响 top-k 选择的 expert bias 调负载,避免均衡辅助损失干扰主梯度。
把推理需求加入训练目标,说明生命周期最优模型可能小于纯训练计算最优模型。
复查原论文三种估计方法,质疑部分精确参数与置信区间但未推翻近似等比分配结论。
固定 240T candidate pool、模型尺度与 53 项评测,使数据 pipeline 可以同协议比较。
拆解 Adam、Adafactor、Lion 等方法的更新尺度、方向与超参边界。
中英 dense 基线、跨 91 个 Common Crawl dump 去重与公开 scaling-law 研究。
联合 DeepSeekMoE 与 MLA,并披露 8.1T 中英数据、过滤取舍和训练配方。
DeepSeek-V3 Technical Report
DeepSeek671B-A37B;FP8、MTP、无辅助损失平衡与 DualPipe。
从 40B HTML pages 发现 120.2B 数学语料,并提出无独立 critic 的 GRPO。
细粒度专家分割与 shared expert isolation。
开放 3T Token 语料与完整数据处理工具。
先由模型/数据预测任务 loss,再由任务 loss 预测能力,以小模型梯队降低外推成本。
Best-fit packing 减少长文档截断,在固定序列长度下保护文档完整性。
数据依赖 gate 与硬件高效 chunkwise 线性 attention。
证明线性递归与局部 attention 的混合架构可扩展。
区分 text contamination 与 ground-truth contamination,并检查 n-gram 检测的边界。
把 Transformer、Mamba 与 MoE 组合到生产级开放模型。
按 batch 的联合可学习性选择多模态样本,研究动态数据价值。
检验超过 Chinchilla 配比后的 loss 与下游趋势,并给出多项可预测缩放结果。
统一单图、多图与视频的视觉指令迁移。
以当前模型状态动态估计样本对目标验证分布的影响。
系统讨论 10K+ GPU 集群的并行、网络优化与可靠性。
强开放稀疏模型,普及每层 top-2 experts 的工程实践。
把条件计算从专家宽度扩到网络深度,让不同 Token 动态跳过或进入层。
系统消融 caption、interleaved image-text、text-only mixture 与视觉组件。
以 KV Cache 为中心解耦 prefill/decode 资源。
提出训练计算分配会改变可迁移性的争议性假说;在课程中仅作为待检验观点。
把 momentum matrix 经 Newton–Schulz 近似正交化,给出 Muon 的原始定义与参考实现。
记录 reasoning model 的能力、安全评测与测试时推理边界。
研究最优学习率等优化超参数怎样随模型规模和训练长度变化。
在真实桌面操作系统中评测视觉 Computer Use Agent。
让 DeltaNet 在序列维并行训练。
在一般文本 Token 之间学习隐式 rationale。
WRAP 用受控改写增加网页语料的表达覆盖,并研究 Token utility。
从 FLOPs 口径、warmup 与随规模调参解释 Kaplan—Chinchilla 配比差异。
研究万亿 Token 长程 FP8 训练的 SwiGLU outlier,并提出 Smooth-SwiGLU。
按模型与题目难度在修订、并行采样和 PRM 搜索之间分配测试时计算。
按常见 n-gram 频率降低样本权重,探索比硬删除更连续的去重策略。
证明专门设计的 Agent-Computer Interface 显著影响解题表现。
以大规模网页清洗消融构建 FineWeb 与教育价值子集。
大规模数据、405B dense、长上下文与多阶段后训练。
用结构化状态空间对偶统一 attention 与 SSM 算法。
开放从数据策展、SFT、偏好学习到 RLVR 的完整 post-training 配方。
在二维 mesh 上组合 Ulysses All-to-All 与 Ring P2P。
拆分 input-gradient 与 weight-gradient,并在内存约束下搜索同步零气泡调度。
以数据库最终状态和策略约束评估真实工具交互。
跨操作系统、数据库、游戏等环境统一评估 Agent。
展示不连续指标可把平滑的底层改进显示成突然涌现,要求同时检查评分函数。
保护少量高影响权重通道的 activation-aware 量化。
用轻量 Q-Former 桥接冻结视觉编码器与 LLM。
先去重再主动保留多样性,说明智能重复与随机重复并不等价。
沿 attention head 做 sequence parallel,扩展极长序列训练。
把偏好优化改写为直接分类目标,省去在线 RL loop。
用小代理模型学习 domain weights,再迁移到更大目标模型。
压缩位置索引,让 RoPE 模型稳定微调到更长窗口。
改进工作分割与并行度,提高训练和 prefill 吞吐。
把 FP8 扩展到计算、优化器与分布式通信的端到端 LLM 训练。
用连续 slot 分配替代硬 top-k,探索完全可微的专家混合。
面向大量真实 API 的工具检索与可靠函数调用。
由领域专家编写、难以搜索的研究生级科学问答。
在 MHA 表达力与 MQA 缓存效率之间分组折中。
用偏置提示实验表明,流畅的公开 CoT 可能合理化答案而不忠实披露影响因素。
发布 PRM800K;在 500 题 MATH 子集的 best-of-1860 选择中验证过程监督优势。
公开预训练、SFT、RLHF 与安全评测细节。
用更多 Token 训练较小开放模型,推动 compute-efficient 推理。
用自生成数据进行 weight、activation 与 KV cache 的量化感知训练。
让状态空间参数随输入变化,建立现代线性序列模型路线。
以 block 共享 scale 支持 MXFP4/MXFP8 等 microscaling 格式。
提出固定训练顺序、子文档去污染、细粒度 domain 和 bits-per-byte 语料评测协议。
公开训练中间 checkpoint,支持研究能力怎样随训练形成。
总结 fully sharded 参数、梯度、状态与 prefetch 的工程实践。
以 NF4、double quantization 和 paged optimizers 微调冻结的 4-bit 基座。
用语言反思和 episodic memory 改进后续尝试。
统一并行、递归和 chunkwise retention 计算。
环形传递 KV block,让序列长度随设备数扩展。
总结 59 种语言、1.6TB 多语言语料的协作建设、治理与数据文档。
区分唯一数据量与重复看到的 Token,系统研究数据受限时的多轮训练。
以 QK LayerNorm 等改动缓解超大 ViT 的 attention logit 爆炸。
由同一模型循环生成、反馈与修订,在不追加训练的情况下扩展串行测试时计算。
在预训练 embedding 空间聚类语义近重复,研究硬删除与多样性收益。
SigLIP 以成对 sigmoid loss 简化大规模图文对比。
用高学习率小模型代理复现大模型失稳,降低稳定性机制的研究成本。
从“小 sublayer、大 shortcut”原则解释并抑制预训练早期 loss spike。
用 SwitchBack 与稳定性诊断研究低精度 VLM 训练中的 outlier 和 Adam second-moment spike。
用真实仓库 issue 与测试补丁评测软件工程 Agent。
证明高质量过滤与去重的 Web 数据可以支撑强模型。
自监督筛选能降低语言建模损失的 API 调用。
显式搜索多个 thought 分支并评估中间状态。
LLaVA 用合成视觉指令数据把 CLIP 接入语言模型。
自动课程、技能库和迭代提示支持开放式长期探索。
结合频率分区与注意力温度扩展 RoPE 上下文。
用代价模型联合搜索 operator 内和 operator 间并行。
BIG-bench 汇集大量任务研究规模与能力边界。
用平滑折断幂律刻画平台、拐点、double descent 与斜率改变。
用中间推理示例显著提升大模型复杂任务表现。
用原则、自我批评和 AI feedback 减少直接人工标签。
用 DeepNorm 的残差缩放与初始化界约束深层 Transformer 更新。
组合 data、expert 与 tensor parallel,系统优化 MoE 训练和推理。
通过 PSM/SPM 数据重排获得代码中间补全能力,并消融变换率和格式。
记录若干能力随规模出现非线性跃迁的评测现象。
用 Perceiver Resampler 与 cross-attention 连接冻结视觉/语言模型。
以 IO-aware tiling 实现精确 attention,不写出完整矩阵。
定义适合训练/推理的 E4M3 与 E5M2 FP8 格式。
HELM 强调多场景、多指标、透明配置的整体评测。
用统一的 step-by-step 触发语句,在不提供 few-shot rationale 时激发多任务零样本 CoT。
先把难题分解成子问题,再按顺序利用已解结果组合答案。
分离离群通道,在保持精度下做 8-bit 推理。
用 block-sparse kernels 支持 dropless 动态 expert workloads。
把 token 选专家反转为专家选固定容量的 token,直接控制专家负载。
让模型用程序表达推理,把数值计算交给外部执行器。
交错 reasoning、action 与 observation,建立 Agent loop 范式。
以 Megatron sequence parallel 与 selective recomputation 降低激活内存和重算开销。
从模型自生成、过滤指令数据扩展 instruction tuning。
把 activation 难量化程度离线迁移到权重。
在 GSM8K 中比较过程与结果反馈,揭示最终正确率和推理轨迹错误率的不同需求。
Minerva 以技术内容继续训练语言模型,系统推进数学与科学定量推理。
系统化稀疏专家的稳定训练与迁移配方。
迭代生成、筛选并训练成功 rationale。
μP 让小代理模型调出的超参数可随宽度迁移到更大网络。
Chinchilla 修正参数/Token 配比,强调给定计算下更多数据。
InstructGPT 建立 SFT → reward model → PPO 的 RLHF 标准管线。
让 MoE parallelism、dispatch 和 kernels 自适应模型与硬件配置。
用 block-wise dynamic quantization 压缩 optimizer state,同时隔离离群值影响。
以线性分配求解专家负载平衡,减少辅助损失。
从 pipeline 两端注入 micro-batches,降低同步流水线气泡。
连接近重复、验证集重合、训练效率与逐字记忆,建立现代 fuzzy dedup 主线。
组合 TP、PP、DP,并提出 interleaved pipeline schedule。
FLAN 证明多任务指令微调可提升未见任务零样本表现。
展示 MoE 在能耗与推理计算上高效扩展语言模型。
用统一 SPMD 表达和 sharding propagation 扩展模型并行。
CLIP 以海量图文对比学习建立可迁移视觉语义空间。
把线性 attention 解释为 fast weights,并引入 delta update 视角。
T0 用大规模提示模板训练开放零样本模型。
用旋转把绝对位置注入点积并自然表达相对距离。
以 280B Gopher 系列研究规模、任务表现、训练实践与能力风险的分化。
用 top-1 路由简化稀疏模型并扩到万亿参数。
公开多域预训练语料与数据配比研究基础。
ALiBi 用线性距离偏置实现长度外推。
建立 GSM8K,并系统展示多采样后由学习式 verifier 选择答案的收益。
让模型操作浏览器检索、引用来源并用人类偏好训练。
把 GPU、CPU 与 NVMe 组成可带宽感知的异构训练内存层。
ViT 把图像 patch 视为 Token 输入 Transformer。
从 GPT-2 抽取逐字训练片段与 PII,实证训练记忆和隐私泄露风险。
系统比较 GLU 变体,SwiGLU 进入现代 FFN 配方。
把 MoE、自动切分与大规模 TPU 训练连接起来。
GPT-3 展示规模扩大后 in-context learning 的通用接口。
把人类偏好、奖励模型与策略优化应用到生成任务。
用低秩投影压缩序列维,使 attention 近似线性。
局部滑窗加少量全局 Token,将长文档 attention 稀疏化。
MMLU 用 57 学科统一衡量广泛知识与解题能力。
归一化每个 attention head 的 Q/K 并学习缩放,直接约束 Softmax logit 尺度。
LSH attention 与可逆层降低长序列时间和内存。
用随机特征近似 softmax attention,兼顾无偏与线性复杂度。
把自回归幂律扩展到图像、视频、数学和语言,显示指数依赖数据模态。
建立 loss 与参数、数据、计算之间的幂律经验关系。
核化 attention 获得线性复杂度与递归推理形式。
分片优化器、梯度与参数,消除数据并行状态冗余。
解释 BF16 保留 FP32 exponent、压缩 mantissa 的范围—精度取舍。
把去重、语言识别和 Wikipedia-like 质量过滤组织成可扩展网页语料流水线。
T5 统一 text-to-text 接口,并以 C4 建立现代 Common Crawl 清洗基线。
MQA 让 Query heads 共享 K/V,大幅缩小解码缓存。
用 micro-batch pipeline 把巨型网络跨设备切层。
GPT-2 展示规模扩大后的零样本任务迁移。
建立 Transformer tensor parallel 的高效切分方式。
不做均值中心化的轻量归一化,成为现代 LLM 常用组件。
跨 segment recurrence 与相对位置,突破固定窗口。
用行列因子近似二阶矩,并以 update clipping 降低优化器状态与失稳风险。
以 gradient noise scale 连接关键 batch size、优化步数和训练计算效率。
双向 masked language modeling 验证大规模预训练表示。
GPT-1 建立 decoder-only 生成式预训练再迁移的路线。
把 tensor dimension 的布局声明映射到逻辑 device mesh。
以 1F1B、异步 pipeline 与 weight stashing 提高 stage 利用率。
直接从原始句子训练语言无关子词模型。
沿 tensor 各 mode 构造结构化预条件器,在逐坐标自适应之外利用矩阵几何。
用多头自注意力与 FFN 取代循环,开启高度并行预训练。
AdamW 将权重衰减与梯度更新正确解耦。
跨语言、视觉、语音与翻译任务观察数据规模和误差之间的可预测幂律。
建立 FP32 master weights、loss scaling 与 FP32 accumulation 配方。
现代稀疏门控 MoE 的起点,以条件计算扩张容量。
用 clipped ratio 稳定 on-policy 策略更新。
建立 fake quantization 与量化感知训练的经典整数推理配方。
用 activation checkpointing 以额外计算换取 O(√n) feature-map memory。
系统研究定点低精度训练,并用 stochastic rounding 保住微小更新的长期积累。
把 BPE 引入神经机器翻译,形成现代子词分词主线。
自适应一阶/二阶矩估计,成为 LLM 优化器基线。
用可微软对齐让 decoder 直接检索全部 encoder state。
系统比较数据并行、模型并行及其通信边界。
Encoder—decoder 统一可变长序列映射,也暴露固定向量瓶颈。
Word2Vec 把大规模词向量训练变得简单高效。
DistBelief 与参数服务器奠定早期大规模分布式深度学习系统路线。
用分布式词表示和神经网络突破 N-gram 稀疏泛化。
以门控网络让多个局部专家竞争分工,是现代 MoE 的概念起点。
信息熵与序列概率的理论起点。
试试更短的关键词,或切换回“全部”。
02 HOW TO READ
别从摘要一路硬啃到附录
先找旧瓶颈
作者认为上一代方法哪里太慢、太贵、不稳定或不够通用?
再看核心替换
是哪一个数据流、损失函数或系统边界被重新设计?先画图,再看公式。
盯住公平对照
参数量、激活量、训练 token、硬件和推理预算是否真的可比?
最后追后继者
真正重要的想法,会被下一篇论文复用、修正,或暴露新的代价。