面向 Agentic AI 的 Firecracker microVM 环境,支持 pause、resume、fork、snapshot 与高密度运行。
LIBRARY / 01 PRIMARY SOURCES
不是论文坟场,
而是一张演化地图
每一篇只回答两个问题:它解决了上一代路线的什么困难,又把什么新问题留给了后来者。 你可以按专题筛选,也可以沿 Kimi / DeepSeek 两条聚光主线回看技术汇流。
- INDEXED
- 486 篇
- SPAN
- 1948—2026
- LINK CHECKED
- 486 篇
- SPOTLIGHT
- 35 篇
01 CURATED INDEX
从问题出发,再去读论文
“主链接已核验”只代表题名与权威入口经过检查,不代表我们复现了全部实验。 深度精读、公式推导与架构图会逐章进入专题正文;这里先负责帮你找到正确入口。
让每层以 softmax 选择先前深度表示,并给出 Block AttnRes。
Engram 把可查表的静态模式与动态计算分离,提出不同于 MoE 与 attention 的条件记忆稀疏轴。
以 SoftQ 和 masked-input regularization 更新有限唯一数据下的重复训练研究。
DeepEncoder V2 根据图像语义动态重排视觉 Token,再交给语言解码器。
32/33T 长文与 agentic 数据、CSA/HCA、mHC、Muon 和 1M 上下文双模型。
把视觉、工具使用和并行 Agent Swarm 纳入统一后训练。
四文本域与视觉语料、2.8T-A104B、KDA/MLA、Stable LatentMoE 与 1M Agentic RL。
让学生在自己的 rollout 上接收同源领域教师的稠密逐 Token 信号,整合多项 RL 能力。
用有界幂律激活控制极值,连接 activation 设计与低精度稳定性。
以强化学习研究视觉工具选择、调用与多步观察闭环。
以统一 transition 接口、分层 credit assignment 和训练—Agent 解耦连接任意运行时与 RL。
以标准化危险类别和等级报告通用聊天模型风险,同时明确通过测试不能证明系统安全。
要求网页 Agent 多步寻找难以直接检索的事实。
用 Clip-Higher、Dynamic Sampling、token-level loss 与 overlong shaping 稳定长 CoT RL。
提供面向 NVLink/RDMA 的高吞吐与低延迟 expert dispatch/combine kernels。
DeepGEMM
DeepSeekDeepSeek 官方开源 FP8 与低精度 GEMM kernel 库,覆盖 dense 与 MoE 形状。
用 DeepEncoder 将二维页面压成少量视觉 Token,研究光学长上下文压缩。
用递归子目标分解构造 cold-start 数据,再以可验证证明奖励强化 formal reasoning。
R1-Zero 从 base 直接做规则奖励 RL;R1 再加入冷启动、SFT、多阶段 RL 与蒸馏。
DeepSeek Sparse Attention、规模化 RL 与 Agentic 任务合成。
用 pass@k 检查当前 RLVR 是扩展解法覆盖,还是主要重排已有正确路径。
直接预测 Token,并融合低、中、高层特征构造更强的推测草稿。
提供面向多种 KV 布局、batch 形状与生成阶段的可组合 attention / sampling kernel。
FlashMLA
DeepSeekDeepSeek 官方面向 Multi-head Latent Attention prefill / decode 的高效 kernel。
探索权重、激活与梯度广泛采用 FP4 的 fully quantized 训练边界。
把快速遗忘 gate 与定点纠错 delta rule 合并。
把模型感知的数据影响估计扩展到 group-level 选择。
覆盖多学科的高难、抗饱和闭答与多模态题集。
延续 Janus 解耦视觉路径,改进训练策略、数据规模与模型规模。
用 128K RL context、partial rollout 与 long2short 扩展长 CoT 和测试时计算。
开放 1T MoE Agent 模型,以 15.5T、知识/数学改写与 verifiable gym / self-critique joint RL 协同。
提出 KDA 并用 3:1 KDA/MLA 混合补足线性状态瓶颈。
MoonViT 原生分辨率视觉编码器与稀疏语言主干。
在真实 MCP 工具协议与服务器生态中压力测试选择、组合和长程执行。
把 Hyper-Connections 的 residual mapping 投到特定流形,恢复 identity 性质并改善规模训练稳定性。
补足 Muon 在 LLM 规模的权重衰减与更新尺度配方。
显示更长预训练可能降低后续微调可塑性,分开 base loss 与最终产品目标。
从头训练动态分辨率 ViT,引入绝对时间编码并强化文档和视觉 Agent。
提出 StarPO,并用 Echo Trap 揭示多轮 Agent RL 的 reward cliff、梯度 spike 与 collapse。
从强教师精选 1K 道推理题蒸馏,并用 budget forcing 控制思考长度。
用 SwallowCode 与 SwallowMath 研究受控合成数据的继续预训练收益与边界。
从新近 GitHub issue 持续构建可执行软件任务,以版本化动态集降低仓库级代码评测污染。
以 AST 与执行检查覆盖串行、并行、abstention 和多轮 function calling。
在 131K context 的可执行 SWE 环境中研究终局测试奖励、长轨迹与多轮 RL。
提出 Dr.GRPO,分析 response-length 与 question-difficulty 两种优化偏置。
探索用大规模强化学习激活多模态长思维与视觉推理。
用可验证奖励训练模型自主选择视觉工具并从新图像观察继续推理。
用 Dec-POMDP 建模 Agent 与用户双方都能调用工具、共同改变环境的双控制任务。
跨 system/user prompt、工具与记忆形式化 Agent 攻击面,并联合评估效用与安全。
以 97 个任务和 629 个安全测试,在动态工具环境中同时测 utility 与间接提示注入。
以定位、修复、验证三阶段简化流程,证明复杂自治 harness 并非默认更优。
重新标注 MMLU 全集并分析错误、歧义与题目质量,说明静态权威基准也需要系统维护。
以只影响 top-k 选择的 expert bias 调负载,避免均衡辅助损失干扰主梯度。
以 leave-one-out baseline 重新建立 critic-free REINFORCE 基线,说明 PPO 不是在线 RLHF 的唯一实现。
把推理需求加入训练目标,说明生命周期最优模型可能小于纯训练计算最优模型。
公开真实服务 trace,揭示突发、长度和模型混合对容量规划的影响。
按 next-byte entropy 形成动态大小 patch,在不使用固定子词词表时按局部复杂度分配主干计算。
融合独立缓存的文本块,并选择性重算跨块依赖以接近完整 prefill。
把图像与文字离散成可交错 Token,用 early-fusion 自回归主干统一建模。
把匿名随机对战、众包投票和统计排名组成开放平台,让真实用户偏好成为动态测量信号。
复查原论文三种估计方法,质疑部分精确参数与置信区间但未推翻近似等比分配结论。
以前缀树组织共享 KV chunks,并用两阶段分区提高内存与计算复用。
用专业网络安全任务、子任务和可执行环境评测语言模型在真实攻击链中的能力与风险。
固定 240T candidate pool、模型尺度与 53 项评测,使数据 pipeline 可以同协议比较。
拆解 Adam、Adafactor、Lion 等方法的更新尺度、方向与超参边界。
中英 dense 基线、跨 91 个 Common Crawl dump 去重与公开 scaling-law 研究。
从 DeepSeek-V2 checkpoint continued pretrain,扩展代码语言、上下文和数学/代码能力。
DeepSeek-Coder: When the Large Language Model Meets Programming — The Rise of Code Intelligence
DeepSeek公开代码语料构造、fill-in-the-blank 目标与 1B–33B 模型族,建立 DeepSeek 代码能力旁支。
把 Lean proof assistant 的可验证反馈用于 formal proof RL,并结合 MCTS 扩展证明搜索。
联合 DeepSeekMoE 与 MLA,并披露 8.1T 中英数据、过滤取舍和训练配方。
DeepSeek-V3 Technical Report
DeepSeek671B-A37B;FP8、MTP、无辅助损失平衡与 DualPipe。
面向截图、PDF、OCR 与图表,用混合视觉编码器处理高分辨率并管理模态竞争。
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
DeepSeek用动态 tile、2×2 pixel shuffle、MLP adaptor、DeepSeekMoE 与 MLA 处理高分辨率输入。
从 40B HTML pages 发现 120.2B 数学语料,并提出无独立 critic 的 GRPO。
细粒度专家分割与 shared expert isolation。
以满足 TTFT / TPOT SLO 的 goodput 为目标,分离并独立扩容 prefill 与 decode。
开放 3T Token 语料与完整数据处理工具。
根据上下文置信度动态调整草稿树,而不是固定候选拓扑。
在 feature 层自回归预测并结合已知 Token,提升草稿准确率与推测解码速度。
先由模型/数据预测任务 loss,再由任务 loss 预测能力,以小模型梯队降低外推成本。
InternVL 2.5 从模型、数据与测试时配置三个轴研究多模态扩展。
Best-fit packing 减少长文档截断,在固定序列长度下保护文档完整性。
面向 Hopper 用异步、warp specialization 与低精度流水进一步优化精确注意力。
从真实用户问题中筛选高区分度难题,形成更稳定的开放回答自动比较集与构建流水线。
由专家创作高难、可验证、未公开答案的数学问题,延伸前沿推理能力的区分度。
数据依赖 gate 与硬件高效 chunkwise 线性 attention。
组合 local/global attention、pre/post normalization 与 logit soft-capping,展示现代尺度控制配方。
重构并翻译多学科题,分析文化敏感内容与机器翻译伪影,扩展多语言评测的效度边界。
证明线性递归与局部 attention 的混合架构可扩展。
统一行为、攻击、目标模型与分类器,系统比较自动红队和稳健拒答。
InternVL 1.5 结合 6B 视觉塔、最多 40 个动态 tile 与高质量双语数据。
将共享前缀与独有后缀注意力拆开,跨请求批量复用前缀计算。
扩宽 residual stream 并学习层输入、流间和层输出映射,为网络深度增加新的连接轴。
提前预测关键 KV,并从 CPU 内存选择性加载以减少 GPU 状态容量。
把恶意指令藏入 Agent 工具返回的不可信内容,测量间接 Prompt 注入与工具副作用。
区分 text contamination 与 ground-truth contamination,并检查 n-gram 检测的边界。
标准化越狱威胁模型、行为数据、攻击提交与评测流程,改善跨攻击比较的可复现性。
把 Transformer、Mamba 与 MoE 组合到生产级开放模型。
解耦理解与生成的视觉编码路径,同时共享一个自回归主干。
把语言自回归与图像 rectified flow 放进同一框架,并对齐解耦视觉表示。
按 batch 的联合可学习性选择多模态样本,研究动态数据价值。
利用 key / value 不同分布采用非对称 2-bit 量化,并保留近期高精度 residual。
用前景理论式效用处理 desirable / undesirable 二元反馈,放宽必须提供成对偏好的数据合同。
按通道量化 key、按 token 量化 value,并分离 outlier 以压缩长上下文 KV。
检验超过 Chinchilla 配比后的 loss 与下游趋势,并给出多项可预测缩放结果。
训练早退层作为同一模型的草稿,再由剩余层验证,形成自推测解码。
显式控制回答长度对自动偏好分的混杂,展示 Judge 排名可被可见风格变量显著改变。
ESFT 依据专家相关性只更新任务相关 routed experts,研究 MoE 专长怎样进入低成本微调。
从近期来源持续更新、采用客观自动判分并限制主观 Judge,探索新鲜度与可比性的平衡。
以按时间发布的新竞赛题持续测试代码生成、执行、修复和自测,降低静态公开题污染。
统一单图、多图与视频的视觉指令迁移。
用跨实例实时迁移重平衡请求、处理碎片并支持主动容错。
搜索 RoPE 维度与位置的非均匀插值,并以渐进扩展与短窗恢复延长论文模型上下文。
用 Jacobi 迭代并行发现并验证 n-gram,无需独立草稿模型。
系统观察 LLM 少数 hidden dimensions 中极端大的激活,并分析其跨层、跨 token 行为。
以当前模型状态动态估计样本对目标验证分布的影响。
在目标模型上增加多个 decoding heads,构造树状候选并减少独立 draft 成本。
系统讨论 10K+ GPU 集群的并行、网络优化与可靠性。
把独立 KV 缓存池连接到弹性 prefill / decode 服务,形成存算分离架构。
强开放稀疏模型,普及每层 top-2 experts 的工程实践。
把条件计算从专家宽度扩到网络深度,让不同 Token 动态跳过或进入层。
系统消融 caption、interleaved image-text、text-only mixture 与视觉组件。
增加推理题、扩展到十个选项并清理噪声,缓解 MMLU 饱和与提示敏感。
以 KV Cache 为中心解耦 prefill/decode 资源。
提出训练计算分配会改变可迁移性的争议性假说;在课程中仅作为待检验观点。
把 momentum matrix 经 Newton–Schulz 近似正交化,给出 Muon 的原始定义与参考实现。
把 embedding、hidden state 与主要权重向量归一化到 hypersphere,把层更新解释为球面位移。
记录 reasoning model 的能力、安全评测与测试时推理边界。
研究最优学习率等优化超参数怎样随模型规模和训练长度变化。
把 SFT 负对数似然与 odds-ratio 偏好惩罚合成单阶段、无独立 reference model 的目标。
在真实桌面操作系统中评测视觉 Computer Use Agent。
让 DeltaNet 在序列维并行训练。
在分布式 prompt 服务中联合前缀复用、实例负载与路由决策。
依据层间信息聚合现象,为不同层分配递减的 KV 容量预算。
联合 W4A8KV4、数据布局和硬件友好 kernel 优化端到端服务。
利用 page 级统计按 query 选择相关 KV pages,减少长上下文 decode 读取。
在一般文本 Token 之间学习隐式 rationale。
引入动态视觉 Token、M-RoPE 与统一图像 / 视频输入。
WRAP 用受控改写增加网页语料的表达覆盖,并研究 Token utility。
从 FLOPs 口径、warmup 与随规模调参解释 Kaplan—Chinchilla 配比差异。
按 chat、hard、safety、reasoning 与分布外样本直接评估奖励模型的成对排序能力。
用多 needle、变量追踪与聚合任务诊断声明窗口内的真实有效上下文,而不只测单针检索。
用 chunked prefill 与 stall-free scheduling 缓和长 prefill 对 decode 的干扰。
研究万亿 Token 长程 FP8 训练的 SwiGLU outlier,并提出 Smooth-SwiGLU。
按模型与题目难度在修订、并行采样和 PRM 搜索之间分配测试时计算。
用长度归一的平均 log-prob 与目标 margin 构造 reference-free implicit reward。
用 prompt 末端 observation window 选择各头重要位置,压缩长 prompt KV。
按常见 n-gram 频率降低样本权重,探索比硬删除更连续的去重策略。
探索单一 Transformer 视觉—语言架构与可稳定训练的开放配方。
区分绕过拒绝与真正提供有效有害信息,用人工标注校准 jailbreak 实效评分。
证明专门设计的 Agent-Computer Interface 显著影响解题表现。
以大规模网页清洗消融构建 FineWeb 与教育价值子集。
把 system、user 与不可信第三方指令的优先级显式化并训练,连接提示注入防御与行为评测。
大规模数据、405B dense、长上下文与多阶段后训练。
引入隐式状态依赖、on-policy 用户模拟、milestone、minefield 与动态轨迹评测。
构建 2,438 个可执行 Python 软件任务,用于训练软件 Agent 与 verifier。
用结构化状态空间对偶统一 attention 与 SSM 算法。
在同一 Transformer 上对文字做 NTP、对连续图像表示做 diffusion。
开放从数据策展、SFT、偏好学习到 RLVR 的完整 post-training 配方。
把 preference data、优化算法、奖励模型和 policy prompts 四个变量拆开,避免把配方差异误判为算法胜负。
在二维 mesh 上组合 Ulysses All-to-All 与 Ring P2P。
用 900 段短中长视频、字幕和音频条件系统评估视频理解。
让模型画线、框选并调用视觉工具,以新视觉产物继续推理。
把视觉 grounding、图片与布局信息加入可执行的真实网页任务。
以统一数据和分类模型同时识别有害提示、有害回答与拒答,支持开放安全评测与审核。
拆分 input-gradient 与 weight-gradient,并在内存约束下搜索同步零气泡调度。
以数据库最终状态和策略约束评估真实工具交互。
分析确定性偏好下 DPO 的过拟合边界,并以有限间隔回归提出 IPO。
独立建立保分布的推测采样算法,减少昂贵模型的串行调用轮数。
跨操作系统、数据库、游戏等环境统一评估 Agent。
提供模拟偏好、自动评测与多种 RLHF 基线,降低比较后训练方法的实验成本。
把统计复用、模型并行和模型放置结合,用于突发式大模型工作负载。
展示不连续指标可把平滑的底层改进显示成突然涌现,要求同时检查评分函数。
用可对话 Agent 抽象组合模型、工具、人类与多种交互拓扑。
保护少量高影响权重通道的 activation-aware 量化。
用轻量 Q-Former 桥接冻结视觉编码器与 LLM。
压缩并流式传输 KV Cache,以降低远端上下文加载延迟。
用 inception prompting 与角色扮演协议研究多 Agent 自主通信和任务协作。
先去重再主动保留多样性,说明智能重复与随机重复并不等价。
沿 attention head 做 sequence parallel,扩展极长序列训练。
把偏好优化改写为直接分类目标,省去在线 RL loop。
以五类风险和细分场景评估模型对不应直接回答请求的安全防护行为。
用小代理模型学习 domain weights,再迁移到更大目标模型。
vLLM 把 KV Cache 分页,支持非连续分配、共享与 copy-on-write。
POPE 用轮询式对象存在性问题更稳定地诊断视觉幻觉。
压缩位置索引,让 RoPE 模型稳定微调到更长窗口。
把长文本拆成原子事实并逐项验证来源支持,形成细粒度事实精确率。
借鉴多级反馈队列和抢占,降低自回归请求的 head-of-line blocking 与尾延迟。
改进工作分割与并行度,提高训练和 prefill 吞吐。
联合 GPU、CPU 与磁盘 offload,并以搜索策略优化吞吐导向的单卡大模型推理。
把 FP8 扩展到计算、优化器与分布式通信的端到端 LLM 训练。
发布可定期刷新的 FreshQA,覆盖快速变化、慢变化、不变与错误前提问题,测试知识时效与搜索增强。
用连续 slot 分配替代硬 top-k,探索完全可微的专家混合。
FIRE 以可学习函数表达相对位置并渐进插值,覆盖多种既有 relative bias 形式。
以任务说明、评价标准和 CoT 作为 Judge 提示,在摘要和对话质量上研究与人类判断的一致性。
用 466 个真实助手问题联合考察推理、检索、工具与多步执行。
用记忆流、反思与计划驱动长期社会行为,建立 Agent 记忆系统的经典结构。
面向大量真实 API 的工具检索与可靠函数调用。
由领域专家编写、难以搜索的研究生级科学问答。
在 MHA 表达力与 MQA 缓存效率之间分组折中。
识别并保留 attention heavy hitters,在有限预算下淘汰其余 KV。
用控制组问题区分语言幻觉、视觉错觉、回答倾向与逻辑一致性。
构造大规模生成与人工标注的幻觉样本,覆盖问答、对话和摘要。
以语言模型为控制器,规划并调度模型工具库完成跨模态任务。
LLaVA-1.5 用两层 MLP、更多任务数据与清晰训练配方强化简单基线。
让 Q-Former 感知指令,并系统研究跨任务视觉指令泛化。
以 EvalPlus 自动扩展 HumanEval 与 MBPP 测试,揭示弱单测会高估正确率并改变模型排序。
从竞争目标与错配泛化解释安全训练失效,并系统整理多类越狱策略。
发布多轮 MT-Bench 与 Chatbot Arena,并系统讨论位置、冗长、自增强等 LLM Judge 偏差。
用 location token 和 grounded image-text pairs 把文本指称绑定到视觉区域。
LATS 用树搜索、环境反馈和 value judgment 统一 reasoning、acting 与 planning。
用偏置提示实验表明,流畅的公开 CoT 可能合理化答案而不忠实披露影响因素。
发布 PRM800K;在 500 题 MATH 子集的 best-of-1860 选择中验证过程监督优势。
用约一千条精选示范检验强基座上少量高质量 SFT 的接口塑形能力,并明确其适用边界。
公开预训练、SFT、RLHF 与安全评测细节。
用内容 Token 与上下文 Token 压缩长视频视觉序列。
用更多 Token 训练较小开放模型,推动 compute-efficient 推理。
用自生成数据进行 weight、activation 与 KV cache 的量化感知训练。
用遵循指令但可能不华丽的回答对抗风格诱饵,专门元评测自动 evaluator 是否真正服从 rubric。
让状态空间参数随输入变化,建立现代线性序列模型路线。
用图表、几何、函数与视觉数学题联合考察感知和多步推理。
用 main、recall 与 archival memory 分层管理有效上下文,类比操作系统虚拟内存。
把软件工程 SOP、角色和中间文档写入多 Agent 协作流程。
以 block 共享 scale 支持 MXFP4/MXFP8 等 microscaling 格式。
以真实网站轨迹研究 element selection、action prediction 与跨任务/站点/领域泛化。
用少量高质量视觉对话对齐冻结视觉编码器与冻结语言模型。
用双语多选、能力分层与 CircularEval 建立综合 VLM 评测。
以 11.5K 大学级问题覆盖六大学科、183 子领域与 30 种图像类型。
联合评测文字识别、场景文字 VQA、文档 VQA、KIE 与手写公式。
开放多轮对话树、候选排序和标注流程,为可复查的助手后训练数据提供公共基线。
从组件规模与多语言任务混合两轴扩展视觉—语言模型。
提出固定训练顺序、子文档去污染、细粒度 domain 和 bits-per-byte 语料评测协议。
在固定 Token 预算内打包不同分辨率与长宽比图像的 patch 序列。
用模块化 prompt schema 标注可复用片段并缓存中间注意力状态。
公开训练中间 checkpoint,支持研究能力怎样随训练形成。
总结 fully sharded 参数、梯度、状态与 prefetch 的工程实践。
以 NF4、double quantization 和 paged optimizers 微调冻结的 4-bit 基座。
Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
把开放视觉对话、OCR 与 grounding 能力整合进 Qwen 视觉语言路线。
用语言反思和 episodic memory 改进后续尝试。
从历史语料检索连续 Token 构造免训练草稿,再由目标模型并行验证。
统一并行、递归和 chunkwise retention 计算。
先由 Planner 写含变量依赖的计划,再由 Worker 执行工具,减少重复 observation 与模型调用。
环形传递 KV block,让序列长度随设备数扩展。
在摘要、helpful 与 harmless 场景直接比较 AI 和人工偏好标签,而不是把 AI feedback 当作无价值来源。
以 segment-level 人工纠错和 dense DPO 对齐视觉忠实度。
总结 59 种语言、1.6TB 多语言语料的协作建设、治理与数据文档。
用回答序列得分的排序约束让模型学习多来源候选的相对质量。
区分唯一数据量与重复看到的 Token,系统研究数据受限时的多轮训练。
以 QK LayerNorm 等改动缓解超大 ViT 的 attention logit 爆炸。
由同一模型循环生成、反馈与修订,在不追加训练的情况下扩展串行测试时计算。
比较同一模型多次采样的一致性,在无白盒概率和外部知识库时检测可能幻觉。
将语义等价回答聚类后估计语义熵,避免把同义表述差异误当成知识不确定性。
在预训练 embedding 空间聚类语义近重复,研究硬删除与多样性收益。
用 RadixAttention 自动复用共享前缀,并为结构化生成提供语言与运行时。
SigLIP 以成对 sigmoid loss 简化大规模图文对比。
直接校准 chosen 与 rejected 回答的序列似然,为不运行在线 RL 的偏好训练提供早期路线。
用高学习率小模型代理复现大模型失稳,降低稳定性机制的研究成本。
用树状候选和并行验证扩展推测解码,使一次目标调用覆盖多条草稿分支。
从“小 sublayer、大 shortcut”原则解释并抑制预训练早期 loss spike。
将 prompt processing 与 token generation 拆到适配的硬件池并独立调度。
用 SwitchBack 与稳定性诊断研究低精度 VLM 训练中的 outlier 和 Adam second-moment spike。
保留初始 attention sinks 与近期窗口,使有限缓存支持持续流式文本。
用真实仓库 issue 与测试补丁评测软件工程 Agent。
NVIDIA 官方 LLM 推理运行时,整合低精度 kernel、并行、KV Cache 与动态批处理。
在特定 decoder-only 推理任务系统比较 APE、T5 RPE、ALiBi、RoPE 与 NoPE,并分析 NoPE 的隐式位置模式。
证明高质量过滤与去重的 Web 数据可以支撑强模型。
自监督筛选能降低语言建模损失的 API 调用。
从 16,464 个真实 REST APIs 合成指令与调用路径,并训练检索增强的 ToolLLaMA。
显式搜索多个 thought 分支并评估中间状态。
规模化生成多候选、多维度 AI 反馈,成为开放偏好训练与直接优化的重要数据来源。
以贪心坐标梯度搜索通用后缀,展示对齐模型的白盒越狱可迁移性与自动化攻击面。
在投影前对齐图像和视频表示,探索共同视觉—语言空间。
LLaVA 用合成视觉指令数据把 CLIP 接入语言模型。
自动课程、技能库和迭代提示支持开放式长期探索。
提供可自托管、功能完整的多站点环境,并以数据库和页面状态检查任务结果。
用看似敏感但实际无害的提示测量过度拒答,使安全评测同时约束有害服从和无害可用性。
结合频率分区与注意力温度扩展 RoPE 上下文。
以蒸馏式 SFT、UltraFeedback AI 偏好与直接偏好优化展示开放模型的完整对齐配方。
提出 attention resolution 指标与 xPos 等设计,面向训练短、测试长的位置外推。
用代价模型联合搜索 operator 内和 operator 间并行。
BIG-bench 汇集大量任务研究规模与能力边界。
用 captioner 生成描述、filter 清理噪声,同时服务视觉理解与生成。
用平滑折断幂律刻画平台、拐点、double descent 与斜率改变。
用中间推理示例显著提升大模型复杂任务表现。
从 BIG-bench 中筛出模型与人类差距明显的 23 个难任务,形成 BIG-Bench Hard 与 CoT 诊断坐标。
用可组合代码表达机器人策略,把自然语言任务映射到可执行控制程序。
用原则、自我批评和 AI feedback 减少直接人工标签。
用 DeepNorm 的残差缩放与初始化界约束深层 Transformer 更新。
组合 data、expert 与 tensor parallel,系统优化 MoE 训练和推理。
SayCan 将 LLM 给出的任务相关性与技能 value/affordance 相乘,过滤语言合理但世界中不可行的动作。
以真实数据科学问题和多条件测试扩展代码生成评测,覆盖七个常用 Python 库。
通过 PSM/SPM 数据重排获得代码中间补全能力,并消融变换率和格式。
记录若干能力随规模出现非线性跃迁的评测现象。
用便宜 draft model 提议多个 Token,再由目标模型并行验收且保持目标分布。
用 Perceiver Resampler 与 cross-attention 连接冻结视觉/语言模型。
以 IO-aware tiling 实现精确 attention,不写出完整矩阵。
定义适合训练/推理的 E4M3 与 E5M2 FP8 格式。
HELM 强调多场景、多指标、透明配置的整体评测。
研究语言模型对自己答案正确性的 P(True) 与 P(IK) 估计,显示自知能力可测但跨任务校准仍困难。
用统一的 step-by-step 触发语句,在不提供 few-shot rationale 时激发多任务零样本 CoT。
先把难题分解成子问题,再按顺序利用已解结果组合答案。
分离离群通道,在保持精度下做 8-bit 推理。
用 block-sparse kernels 支持 dropless 动态 expert workloads。
把 token 选专家反转为专家选固定容量的 token,直接控制专家负载。
让 LLM 作为路由器组合计算器、知识库与离散推理模块,建立模块化工具系统主线。
公开 Pre-LN decoder 训练配置与模型族,为深度、归一化和复现提供对照。
以 iteration-level scheduling 和 selective batching 奠定连续批处理主线。
让语言模型生成程序作为中间表示,再由解释器承担精确执行。
在大规模 decoder 中采用 SwiGLU、并行 block 等配方,推动门控 FFN 成为现代主线。
让参与者跨互联网协作托管模型层,暴露异构、不可靠网络下的服务边界。
让模型用程序表达推理,把数值计算交给外部执行器。
交错 reasoning、action 与 observation,建立 Agent loop 范式。
报告面向对话模型的大规模人工红队方法、扩展行为与数据使用经验,强调失败发现和缓解闭环。
用攻击语言模型自动生成测试输入,扩展人工红队覆盖并探索训练攻击生成器的路线。
以 Megatron sequence parallel 与 selective recomputation 降低激活内存和重算开销。
联合扩展 Flan 的任务混合、模型规模与 chain-of-thought 数据,研究 instruction tuning 的规模效应。
在 proxy reward 与 gold reward 的受控设置中量化 Goodhart 曲线,展示继续追高代理奖励何时反而伤害真实目标。
用需要多步实验和科学知识的文本环境评估语言 Agent 的交互推理。
从模型自生成、过滤指令数据扩展 instruction tuning。
把 activation 难量化程度离线迁移到权重。
在 GSM8K 中比较过程与结果反馈,揭示最终正确率和推理轨迹错误率的不同需求。
Minerva 以技术内容继续训练语言模型,系统推进数学与科学定量推理。
系统化稀疏专家的稳定训练与迁移配方。
迭代生成、筛选并训练成功 rationale。
把自然语言任务定义扩展到 1,600 余个任务,检验跨任务和跨类型泛化。
μP 让小代理模型调出的超参数可随宽度迁移到更大网络。
用模型生成并由人类筛选隐含仇恨与中性句,扩大毒性分类和生成安全评测的覆盖。
把 helpfulness 与 harmlessness 分开收集偏好并研究在线迭代,揭示通用助手对齐的多目标性质。
Chinchilla 修正参数/Token 配比,强调给定计算下更多数据。
InstructGPT 建立 SFT → reward model → PPO 的 RLHF 标准管线。
让 MoE parallelism、dispatch 和 kernels 自适应模型与硬件配置。
以 1.18M 商品、12K 指令和可计算 reward 构造大规模网页购物环境。
把巨量权重卸载到 CPU / NVMe,并通过分层预取和并行减少 GPU 容量门槛。
用 block-wise dynamic quantization 压缩 optimizer state,同时隔离离群值影响。
以线性分配求解专家负载平衡,减少辅助损失。
在歧义与消歧两类上下文中测试社会偏见,区分缺少证据时的刻板猜测和明确证据下的准确性。
以 UTF-8 bytes 作为模型输入输出单位,系统研究去除固定子词词表的质量与计算折中。
以字符级输入、下采样和深 Transformer 构建不依赖显式 tokenizer 的预训练 encoder。
用可学习的软子词块在字符输入上选择局部组合,探索模型内部自适应 token 边界。
从 pipeline 两端注入 micro-batches,降低同步流水线气泡。
连接近重复、验证集重合、训练效率与逐字记忆,建立现代 fuzzy dedup 主线。
以 human-and-model-in-the-loop 持续收集当前模型会错的样本,把动态造题纳入基准生命周期。
组合 TP、PP、DP,并提出 interleaved pipeline schedule。
发布 HumanEval,并以执行测试和无偏 pass@k 估计把代码评测从字符串相似度推进到功能正确性。
FLAN 证明多任务指令微调可提升未见任务零样本表现。
展示 MoE 在能耗与推理计算上高效扩展语言模型。
用统一 SPMD 表达和 sharding propagation 扩展模型并行。
CLIP 以海量图文对比学习建立可迁移视觉语义空间。
把线性 attention 解释为 fast weights,并引入 delta update 视角。
锁定强图像塔,只训练文本侧去匹配既有视觉空间。
Frozen 用视觉编码器生成连续前缀,连接冻结语言模型并激活多模态 in-context learning。
T0 用大规模提示模板训练开放零样本模型。
把任务定义写成声明式自然语言说明,系统检验模型对未见任务的 instruction generalization。
在 Pre-LN block 内增加归一化以改善层间梯度尺度与预训练稳定性。
在低层算子空间搜索 Transformer,主要收益归于 squared ReLU 与 Q/K/V 后的 depthwise convolution。
用旋转把绝对位置注入点积并自然表达相对距离。
以 280B Gopher 系列研究规模、任务表现、训练实践与能力风险的分化。
ALIGN 用超大规模噪声 web 图文对训练双编码器,展示数据规模路线。
用 top-1 路由简化稀疏模型并扩到万亿参数。
公开多域预训练语料与数据配比研究基础。
ALiBi 用线性距离偏置实现长度外推。
建立 GSM8K,并系统展示多采样后由学习式 verifier 选择答案的收益。
用人类常见误解设计问答集,区分信息性与真实性,测试模型是否复述训练分布中的流行谬误。
让模型操作浏览器检索、引用来源并用人类偏好训练。
把 GPU、CPU 与 NVMe 组成可带宽感知的异构训练内存层。
对齐抽象文本环境与具身家务环境,让文字策略能迁移到更真实的交互世界。
ViT 把图像 patch 视为 Token 输入 Transformer。
用可预测执行、集中式调度和显式模型缓存控制 DNN 服务尾延迟。
以最小句对比较刻板与反刻板文本的模型偏好,覆盖九类美国社会偏见。
在 attention 中分离内容与相对位置向量,并在解码侧增强绝对位置。
从 GPT-2 抽取逐字训练片段与 PII,实证训练记忆和隐私泄露风险。
系统比较 GLU 变体,SwiGLU 进入现代 FFN 配方。
把 MoE、自动切分与大规模 TPU 训练连接起来。
GPT-3 展示规模扩大后 in-context learning 的通用接口。
把人类偏好、奖励模型与策略优化应用到生成任务。
用低秩投影压缩序列维,使 attention 近似线性。
局部滑窗加少量全局 Token,将长文档 attention 稀疏化。
MMLU 用 57 学科统一衡量广泛知识与解题能力。
从初始化梯度分析 Post-LN 的 warm-up 需求与 Pre-LN 的优化差异。
归一化每个 attention head 的 Q/K 并学习缩放,直接约束 Softmax logit 尺度。
用来自开放网络的自然提示测量语言模型延续毒性,揭示静态语料分布下的退化风险。
LSH attention 与可逆层降低长序列时间和内存。
用随机特征近似 softmax attention,兼顾无偏与线性复杂度。
给每条 residual branch 加零初始化 scalar gate,使初始网络近似 identity 并支持更深 Transformer。
把自回归幂律扩展到图像、视频、数学和语言,显示指数依赖数据模态。
建立 loss 与参数、数据、计算之间的幂律经验关系。
用句内与篇章级任务同时考察刻板关联和语言建模能力,避免只靠去偏得分奖励无意义输出。
分析 FFN 第一层方向与输入模式、第二层方向与输出词表分布的关联,揭示逐位置非线性中的模式记忆。
核化 attention 获得线性复杂度与递归推理形式。
把训练不稳连接到 residual branch 对参数扰动的放大效应,并提出 Admin 自适应初始化。
分片优化器、梯度与参数,消除数据并行状态冗余。
解释 BF16 保留 FP32 exponent、压缩 mantissa 的范围—精度取舍。
测试时剪枝显示大量 Attention heads 存在冗余,但不证明这些 head 在训练阶段无用。
展示 Attention 权重与特征重要性可能不相关,且不同权重可产生近似预测,划定解释边界。
指出解释结论依赖定义、模型整体、基线与测试协议,为 Attention 解释争论补充对照。
用 edge probing 观察 BERT 不同层中句法与语义信息的可提取性,建立分层表示分析坐标。
把去重、语言识别和 Wikipedia-like 质量过滤组织成可扩展网页语料流水线。
T5 统一 text-to-text 接口,并以 C4 建立现代 Common Crawl 清洗基线。
MQA 让 Query heads 共享 K/V,大幅缩小解码缓存。
把偏好奖励、reference KL 与 PPO 接到生成式语言模型,是现代语言模型 RLHF 的直接前身。
以 depth-aware 初始化控制 residual update,使极深残差网络无需归一化也能稳定优化。
用 micro-batch pipeline 把巨型网络跨设备切层。
把真实交互式小说标准化为含世界状态与语言动作的强化学习环境。
GPT-2 展示规模扩大后的零样本任务迁移。
跨 ELMo、GPT 与 BERT 的层级线性 probing 比较多类语言知识与迁移特性。
建立 Transformer tensor parallel 的高效切分方式。
不做均值中心化的轻量归一化,成为现代 LLM 常用组件。
在 GLUE 接近饱和后引入更难任务、软件工具和公开排行榜,展示基准需要随能力更新。
跨 segment recurrence 与相对位置,突破固定窗口。
系统比较 PreNorm、ScaleNorm 与 FixNorm,展示归一化拓扑、尺度和 embedding 范数的不同作用。
用 Attention mask 在同一 Transformer 中切换单向、双向与序列到序列预训练。
在 BERT heads 中观察位置、分隔符、句法和共指模式,为后验分析提供系统案例。
用行列因子近似二阶矩,并以 update clipping 降低优化器状态与失稳风险。
以 gradient noise scale 连接关键 batch size、优化步数和训练计算效率。
双向 masked language modeling 验证大规模预训练表示。
ELMo 把词表示写成深双向语言模型内部状态的函数,让同一词的不同 occurrence 随上下文改变。
把九类语言理解任务、统一接口与诊断集汇成套件,推动跨任务可比的通用表示评测。
GPT-1 建立 decoder-only 生成式预训练再迁移的路线。
把 tensor dimension 的布局声明映射到逻辑 device mesh。
以 1F1B、异步 pipeline 与 weight stashing 提高 stage 利用率。
把相对距离表示引入 Self-Attention,并把方法扩展为 relation-aware attention。
直接从原始句子训练语言无关子词模型。
沿 tensor 各 mode 构造结构化预条件器,在逐坐标自适应之外利用矩阵几何。
用可程序生成的文字世界、状态与动作接口,为语言 Agent 建立可控交互环境。
用多头自注意力与 FFN 取代循环,开启高度并行预训练。
AdamW 将权重衰减与梯度更新正确解耦。
跨语言、视觉、语音与翻译任务观察数据规模和误差之间的可预测幂律。
把人类对轨迹片段的成对比较拟合成奖励预测器,再用预测奖励优化策略。
建立 FP32 master weights、loss scaling 与 FP32 accumulation 配方。
系统刻画现代神经网络的置信度失准,并以 temperature scaling 提供简单有效的后校准基线。
现代稀疏门控 MoE 的起点,以条件计算扩张容量。
用 clipped ratio 稳定 on-policy 策略更新。
建立 fake quantization 与量化感知训练的经典整数推理配方。
以 DropConnect 与 NT-ASGD 等配方建立 AWD-LSTM 强基线。
通过自动搜索得到 Swish / SiLU 形式 x·sigmoid(βx),成为 SwiGLU gate 的直接函数前史。
用字符 CNN 与 highway network 构造词表示,再交给 LSTM LM 建模。
以加法捷径学习残差映射,是 Transformer 深度信息高速公路的视觉前史。
Adaptive Softmax 利用词频长尾分配不同计算,降低全词表输出的期望成本。
在 Transformer 前夜把 RNN/CNN 词级语言模型推向大数据、大词表与大计算。
提出平滑的输入相关激活 xΦ(x),成为 BERT 等 Transformer FFN 的代表非线性。
以门控卷积建立可并行的强语言模型路线,说明历史并非 RNN 单线演进。
在单个样本内按层输入统计量归一化,为序列模型提供训练/推理一致的尺度控制。
用 activation checkpointing 以额外计算换取 O(√n) feature-map memory。
从语言模型 loss framework 得到输入词向量与输出分类器权重共享,显著减少词表接口参数。
指出语言模型输出权重矩阵也是有效 embedding,并推荐与输入 embedding 共享参数。
以 mini-batch 统计量归一化神经活动,是 LayerNorm 与后续尺度控制路线的重要前史。
系统研究定点低精度训练,并用 stochastic rounding 保住微小更新的长期积累。
残差连接让更深视觉骨干稳定优化,成为多模态视觉塔的重要前史。
系统化 global/local attention 与多种打分形式,澄清 Attention 前夜的设计空间。
把 BPE 引入神经机器翻译,形成现代子词分词主线。
让 Attention 分布直接指向输入位置,展示软路由不仅能混合表示,也能定义可变输出字典。
自适应一阶/二阶矩估计,成为 LLM 优化器基线。
在全局共现计数上拟合加权 log-bilinear 关系,连接矩阵分解与局部窗口表示。
引入 RNN encoder–decoder 与 GRU 门控,把变长源序列映射到条件生成。
用可微软对齐让 decoder 直接检索全部 encoder state。
系统比较数据并行、模型并行及其通信边界。
Encoder—decoder 统一可变长序列映射,也暴露固定向量瓶颈。
以 negative sampling、频繁词子采样和短语发现扩展高效静态词表示。
Word2Vec 把大规模词向量训练变得简单高效。
提供接近十亿词的可比 LM 基准,并并列计数、循环与组合系统。
AlexNet 以 GPU、大规模卷积网络与 ImageNet 监督推动可扩展视觉表示。
DistBelief 与参数服务器奠定早期大规模分布式深度学习系统路线。
把变长循环状态带入真实语音识别 LM,并明确暴露高训练复杂度。
用二叉词树把全词表预测改成路径二分类,直面神经 LM 的 Softmax 词表税。
以参考摘要的 n-gram、最长公共子序列等召回式重叠形成摘要自动评测工具族。
用分布式词表示和神经网络突破 N-gram 稀疏泛化。
用修正 n-gram precision 与长度惩罚构造可重复的机器翻译代理指标,也留下表面重叠不等于语义质量的边界。
组合 cache、高阶 N-gram、skipping、Kneser–Ney 与 clustering,展现计数时代的强系统基线。
用受门控的恒定误差通路缓解循环网络的长期依赖与衰减误差回流。
跨数据规模和模型阶数系统比较平滑方法,建立 modified Kneser–Ney 的实证坐标。
用不同续接上下文的数量构造低阶分布,形成 Kneser–Ney smoothing 的核心直觉。
系统阐明循环网络学习长期存储时的梯度与动力学困难。
用离散词类在 N-gram 中共享统计,是连续词向量之前的重要参数共享路线。
以门控网络让多个局部专家竞争分工,是现代 MoE 的概念起点。
Elman 网络用循环 context units 在预测任务中形成序列相关的隐藏结构。
用词—文档矩阵的低秩分解构造全局潜在语义空间。
Estimation of Probabilities from Sparse Data for the Language Model Component of a Speech Recognizer
用折扣与回退把高阶 N-gram 的未见概率质量交给低阶模型。
早期把 perplexity 用作语音识别语言约束难度的历史节点。
以 frequency of frequencies 估计低频与未见事件的概率质量,奠定 Good–Turing 主线。
用已知前文时的下一字母猜测实验估计英语熵与冗余,是 next-symbol 预测的概念先声。
信息熵与序列概率的理论起点。
试试更短的关键词,或切换回“全部”。
02 HOW TO READ
别从摘要一路硬啃到附录
先找旧瓶颈
作者认为上一代方法哪里太慢、太贵、不稳定或不够通用?
再看核心替换
是哪一个数据流、损失函数或系统边界被重新设计?先画图,再看公式。
盯住公平对照
参数量、激活量、训练 token、硬件和推理预算是否真的可比?
最后追后继者
真正重要的想法,会被下一篇论文复用、修正,或暴露新的代价。