00 / PROBLEM LEDGERS
先别背 RoPE:把一条 state 拆成二十本账
这章最危险的读法,是把 Tokenizer、位置编码、Norm、Residual 和激活函数当作五个互不相干的组件。 它们其实共同决定一件事:同一条向量在进入模型、匹配上下文、穿过深度、通过非线性时,哪些信息和尺度能被保留。
单位账
字符、byte、subword、token、patch 谁是模型一步?
边界先决定序列长度、词表和计算密度。参数账
词表变大,哪张矩阵跟着变?
输入 embedding 和输出 head 常各含 V×d 参数。静态表示账
同一个 token ID 是否永远同义?
第 0 层查表固定,深层 hidden state 随上下文变化。上下文化账
多义性在哪里被展开?
序列混合与逐位置 FFN 反复改写每次 occurrence。输出几何账
hidden state 怎样变成下一个 token?
与输出向量点积成 logits,再经 softmax。对称性账
无位置 Attention 知道先后吗?
裸算子排列等变;causal mask 只给有向可见性。绝对位置账
“第 37 位”如何进入表示?
位置向量可加到内容,但两者从入口便纠缠。相对位置账
“相隔 3”如何进入匹配?
距离表示或 bias 可直接改变位置对的 score。旋转账
RoPE 为什么要成对旋转维度?
两次绝对旋转在 Q·K 中相消为相对旋转。外推账
公式能算更长,为何模型仍可能坏?
新相位、距离、bias 与注意力分辨率可能越出训练分布。NoPE 账
无显式位置是否等于无顺序?
因果边界、递归衰减和内容统计都可能隐式带序。统计账
LayerNorm、RMSNorm、QK-Norm在管谁?
它们控制不同对象,不能互相替换名字。拓扑账
Norm 在分支前还是相加后?
位置改变 identity path、初始化梯度与深度动态。幅值账
有 Residual 为何 state 仍会长大?
固定单位累加没有自动控制总尺度。梯度账
有捷径为何仍会训练不稳?
可达性不等于各层更新和 attention logits 都平衡。稀释账
早期层为何会逐渐听不见?
总和持续增长时,单层增量的相对份额下降。拓宽账
Residual stream 必须只有一条吗?
HC 扩宽成多条流,学习跨层连接。选择账
深度能否像序列一样 Attention?
AttnRes 对历史层或块做内容相关 softmax。FFN 账
Attention 后为何还要大 MLP?
前者跨位置搬运,后者逐位置做非线性加工。极值账
乘法门控为何也会爆?
SwiGLU 两支可无界;clamp 与 SiTU 以不同方式限幅。谁是模型的一步,入口和出口各花多少参数?
位置怎样改变 token-to-token 匹配?
捷径怎样避免阻塞,又怎样避免所有层固定混成一团?
逐位置加工怎样增加容量,又怎样制造极端激活?
01 / REPRESENTATION OBJECTS
“词向量”这个词,至少藏着五个不同对象
如果不先区分对象,后面所有讨论都会滑坡:把 ID 当语义、把 embedding 当知识、把概率当一个向量固有属性。
离散索引它只说“查哪一行”,没有距离、方向或概率。
E[id]同一 ID 的第 0 层查表结果;还没有读到句内上下文。
hᶫₜ同一 ID 在不同句子、位置和层中通常不同。
Wout[v]与最终 state 点积,扮演词表 classifier 的类别向量。
softmax(logits)整个上下文计算后的分布,不是某个向量独自携带的属性。
t → eₜ = E[t] → hₜ⁰ → hₜ¹ → … → hₜᴸ → zᵥ = Wout[v]ᵀhₜᴸ → softmax(z)同一个 token ID 的 `E[t]` 固定;真正随上下文变化的是层内状态 `hᶫₜ`。输出概率还依赖整个词表的相对 logits。
02 / TOKEN AS COMPUTE UNIT
Tokenizer 不是预处理小工具,它先写下三笔架构账
embedding / output head 参数增大,常见词可用更少步表示。
Attention、状态更新、训练 token budget 与推理步数都增加。
语言、数字、代码、稀有词和拼写鲁棒性会获得不同归纳偏置。
Byte Latent Transformer 不把每个 byte 都交给大 Transformer;它按 next-byte entropy 形成动态 patch,在难预测位置分配更多计算。论文结果属于其 FLOP-controlled scaling 设置,不是“固定 tokenizer 已被淘汰”。
阅读原文 →03 / INPUT–OUTPUT GEOMETRY
模型从一张表里“读入”,也可以用同一张表“分类输出”
Press & Wolf 与 Inan et al. 在 2016 年独立把 weight tying 推到语言模型主线:Output Embedding · Tying Word Vectors
04 / CONTEXTUALIZATION
同一个 token 的“词典坐标”,怎样变成这句话里的状态?
固定查表
“bank” 无论在河岸还是金融句中先取同一行。
type-level局部与形式
邻近词、词形、标点与短程组合开始改变方向。
occurrence-level句内任务状态
与语义、指代、预测目标相关的特征继续被重组。
context-conditioned候选分布
最终 state 与全部输出向量比较,产生下一 token 分布。
decision interface不要把 probe 读成“解剖标签”。ELMo、BERT 和后续 probing 工作展示不同层可线性提取不同语言信息;它们没有证明某层只负责一种功能,也没有证明 probe 读出的关联就是模型决策的因果电路。
05 / FFN AS REPRESENTATION
Attention 负责“从哪里搬”,FFN 负责“在当前位置怎样改写”
Attention
每个位置按 Q/K 权重汇总其他位置的 Value;它重排和混合序列信息。
FFN / GLU / MoE
同一组权重逐位置应用,产生非线性特征、门控与大量参数容量。
Geva et al. 把 FFN 分析为 key-value memories:第一层方向与输入模式相关,第二层方向诱导输出词表分布; 低层更多浅层模式,高层更语义化。这个视角说明 FFN 不是“Attention 后的填充”,但也不能把每个 neuron 直接命名成一条稳定事实。
06 / EIGHT TURNS
三十年不是一条“更复杂”的直线,而是八次瓶颈迁移
从 one-hot 到连续几何
NPLM · word2vec相似上下文可共享统计,但一个词仍只有一个静态点。
开放词表与上下文化
BPE · SentencePiece · ELMo · BERT先解决边界,再让每次出现拥有不同状态。
深层捷径与单样本归一化
ResNet · LayerNorm · Transformer网络先能堆起来,固定累加的幅值问题随后出现。
把顺序写进 Attention
Relative PE · Transformer-XL · RoPE · ALiBi从绝对入口向 pair-wise 距离与旋转几何转移。
稳定训练更深 Transformer
RMSNorm · Pre-LN · ReZero · Admin · DeepNorm优化稳定、表示变化与最终质量并非同一目标。
跨出训练窗口
xPos · NoPE · PI · YaRN · FIRE · LongRoPE位置外推变成独立问题,但不替代长程数据和检索。
重写 residual stream
HC · nGPT · mHC · AttnRes一条固定总线变成多流映射或沿深度选择。
前沿模型协同设计
DeepSeek-V2/V4 · Kimi Linear/K3位置、Norm、Residual 与激活开始按缓存、低精度和系统共同设计。
07 / PERMUTATION SYMMETRY
Attention 先天会匹配内容,却先天不知道“谁在前面”
每行用同一 Q/K/V 投影
Attn(X)没有 mask / position输出跟着行顺序
输入行被同一个 P 重排
Attn(PX)= P Attn(X)只跟随排列,不知道语序差异
第 t 位只能读前缀,因此不同位置拥有不同可见集合。NoPE causal decoder 不是完全无序;但 mask 没有显式告诉 Q/K “相距多少”。
08 / ABSOLUTE POSITION
第一代答案很直接:给每个位置一张坐标卡
频率层级写进公式
原始 Transformer 使用不同频率的 sin/cos,使位置间线性关系可被学习;公式可生成未见绝对位置。
每个位置直接学一行
灵活但通常受训练最大索引约束;扩窗需要新增、插值或重训。
09 / RELATIVE POSITION
语言规律往往更像“离我三步”,而不是“绝对第 37 位”
xₜ = eₜ + pₜ入口 state直接给绝对坐标;内容与位置从入口混合。
scoreᵢⱼ += qᵢᵀaᵢ₋ⱼQ–K pair直接表达距离;可做 buckets 或截断。
qᵢᵀRⱼ₋ᵢkⱼQ / K 旋转绝对角度进入向量,相对角度留在内积。
scoreᵢⱼ − mₕ|i−j|attention logit不给 embedding 加位置,只施加 head-wise 近邻偏置。
explicit term = 0无显式插槽必须继续问 causal mask、递归状态和数据怎样提供顺序。
Shaw et al. 把相对距离表示加入 self-attention;Transformer-XL 为跨段记忆重新设计相对位置;T5 将距离分桶并作为 attention bias。它们都叫“relative”,但写入的张量与参数共享方式不同。
10 / ROTARY GEOMETRY
RoPE 的核心不是“旋转很高级”,而是一条矩阵恒等式
R(mθ) = [ cos mθ −sin mθ
sin mθ cos mθ ]每两维构成一个复平面。Q 在 m 旋转、K 在 n 旋转;做内积时,公共绝对角度相消,只剩相对位移 `n−m`。
公式可生成任何 m ≠ 模型熟悉任何 m11 / LENGTH EXTRAPOLATION
训练窗外不是“索引越界”这么简单,而是几何分布变了
重新设计距离衰减、分辨率或相对函数。
把新位置压回熟悉范围,或按频率非均匀插值。
避免位置参数外推,但仍须证明顺序和长程能力从何而来。
位置公式不替代远距离依赖数据与训练系统。
“Context window = 1M”至少有四层含义:数学上能接收、系统上能运行、训练中见过、任务上能有效利用。任何一层都不能代替其余三层。
12 / NO POSITION ENCODING
NoPE 删除的是显式插槽,不是宇宙里的“顺序”
Q/K 或 embedding 不再加人工位置函数。
每个位置的可见集合不同。
状态更新本身带方向与时间。
语言序列的条件分布并不对称。
2023 的系统研究在一组 decoder-only 推理与数学任务上发现 NoPE 优于若干显式方案,并从表示能力与 SGD 模式分析它; 这不是所有语言建模、所有架构和所有长度的普遍胜负。K3 更不能只写成“NoPE 模型”:它用 KDA 的 recurrent gating / decay 显式承担位置敏感与 recency-aware 混合。
13 / DEEPSEEK POSITION LINEAGE
DeepSeek 没有从 RoPE 走向“越用越多”,而是越拆越细
Full RoPE
标准 decoder 配方:所有相关 Q/K 维度旋转。
位置与内容共处 headDecoupled RoPE
content K/V 压入 latent;额外 shared K 与 multi-head Q 专门携带 RoPE。
为矩阵吸收和 KV cache 拆路Partial RoPE
Q、compressed KV 与 output 的最后 64 维旋转;output 用负位置抵消绝对角。
只给部分通道位置责任14 / NORMALIZATION TARGET
看到“RMSNorm”先别点头:第一问永远是“它在归一化谁?”
去均值 + 除标准差re-centering + re-scaling只除 RMSre-scaling先归一化再学习温度防 logit 任意饱和在低维状态上控制尺度不是 block PreNorm比较前先做 RMSNorm避免大幅值层靠尺度胜出LN(x) = γ ⊙ (x−μ) / √(σ²+ε) + β同时获得平移和缩放不变性;需要均值与方差。
RMS(x) = γ ⊙ x / √(mean(x²)+ε)保留均值方向,只控制 root-mean-square 尺度。
15 / PRE VS POST
Norm 的位置会改变那条“什么都不做也能通过”的路
xₗ₊₁ = Norm(xₗ + F(xₗ))相加后尺度被重置,但 identity path 每层都穿过 Norm;初始化靠近输出处的梯度可能更大。
xₗ₊₁ = xₗ + F(Norm(xₗ))裸 identity path 直接跨层,通常更易优化;所有分支固定单位累加,幅值和层贡献稀释成为新问题。
Pre-LN “更稳”不等于“全面更优”。初始化梯度、是否需要 warm-up、最终表示变化、深度收益与下游质量是不同指标。NormFormer、DeepNorm、AttnRes 正是沿不同缺口继续修补。
16 / TRAINING DEEP
从“让梯度能走”到“让每层的贡献可控”
ResNet
identity shortcut先解决深网优化退化;没有给每层贡献可学习权重。
Fixup
depth-scaled init用初始化控制初始 residual update,不依赖 Norm。
RMSNorm
scale only去掉 re-centering,简化归一化。
Pre-LN analysis
Norm before branch裸 identity path 改善初始化梯度,但会固定累加所有分支。
ReZero / Admin
gate / adaptive init从近 identity 开始,或控制 residual 对参数扰动的放大。
NormFormer
extra internal Norms修补 Pre-LN 深浅层梯度尺度不匹配。
DeepNorm
scaled Post-LN用 residual scale 与初始化稳定到 1,000 层。
HC → mHC → AttnRes
new depth topology从控制单位加法,走向多流连接或选择性深度读取。
17 / RESIDUAL STREAM
Residual 解决“到不了”,却没有自动解决“听不见”
hL = h0 + f0(Norm(h0)) + f1(Norm(h1)) + … + fL−1(Norm(hL−1))上图是“累计 state 变大时,固定大小单层增量相对占比下降”的概念图,不是实测激活。Kimi AttnRes 报告把这类现象称为 hidden-state growth 与 PreNorm dilution。
identity shortcut 的原始强项。
Norm、初始化、scale、gate 共同控制。
标准加法没有选择;HC / AttnRes 才重写拓扑。
18 / HYPER-CONNECTIONS
把一条 residual stream 展开成四条“车道”
Xl+1 = BlXl + ClFl(AlXl)实际 layer 仍只接收 d 维输入;新增的是 residual width 与连接自由度。原论文将目标描述为缓解 gradient vanishing 与 representation collapse 的跷跷板。
19 / MANIFOLD CONSTRAINT
DeepSeek 的关键追问:自由连接变多后,identity property 怎么回来?
报告据此限制 forward / backward 中 residual transformation 的扩张。
doubly stochastic 集合在乘法下封闭,支持深层连续堆叠。
输入和输出映射非负且有界,降低信号抵消风险。
以上是 mHC 论文 与 DeepSeek-V4 报告 的设计和理论主张;本站不把它扩写成任意优化器与任意网络的完备稳定性证明。
20 / ATTENTION OVER DEPTH
Kimi 的答案不同:不扩宽车道,而是让当前层选择历史出口
αᵢ→ₗ = softmax(qₗᵀ RMSNorm(kᵢ))内容相关、归一化的深度混合
memory O(Ld)depth arithmetic 为 O(L²d);不足百层时算术可接受,训练状态与 PP 通信更难。
memory O(Nd)只保存 block representations,保留大部分选择性并降低跨 stage 状态。
21 / K3 DEPTH MAP
93 层不是 93 份同时常驻:K3 把它们压成 9 个深度来源
K3 §2.2 明确写的是 12-layer block size:93 层形成 7 个完整块和 1 个尾块,另计 embedding 后共有 9 个 block-level sources。“block size 2”是早期草案误读,未进入正式页面结论。
22 / ACTIVATION LINEAGE
激活函数的演化,不只是把 ReLU 曲线画得更圆
max(0,x)单支、分段线性正向无界;负半轴为零x Φ(x)单支、平滑正向无界;负向平滑衰减g ⊙ σ(u)内容 × 有界 gate内容支仍无界Swish(g) ⊙ u两条可学习支相乘两个乘法因子都可无界cap(Swish(g)) ⊙ clamp(u)硬限幅作者配方:linear [−10,10],gate 上界 104tanh(g/4)σ(g) · 25tanh(u/25)平滑限幅逐点 |y| < 10023 / OUTLIER CONTROL
DeepSeek-V4 与 K3 都限制 SwiGLU 极值,但数学性格完全不同
SwiGLU Clamping
gate = min(Swish(g), 10)
value = clamp(u, −10, 10)报告称该配方消除 outliers、帮助稳定且不损性能。这是 V4 训练中的作者经验结论;硬 clamp 在边界外对被截分支给出零梯度。
Sigmoid Tanh Unit GLU
4 tanh(g/4) · σ(g)
× 25 tanh(u/25)两支都用 tanh 平滑压缩;β₁=4、β₂=25,所以逐点 |y|<100。靠近原点一阶近似 SwiGLU,β→∞ 时逐点恢复。
SiTU 单元输出有界,不等于整个 residual stream、loss 或 gradient 有界;K3 还在 routed expert aggregate 后加入 RMSNorm,并配合路由与系统稳定措施。
24 / DEEPSEEK FOCUS
沿 DeepSeek 六个节点,看四条轴如何逐步解耦再合流
Pre-Norm RMSNorm · SwiGLU · RoPE
建立现代 dense 基线;Norm、激活与位置是三条独立轴。
MLA · decoupled RoPE
内容 K/V 可低秩压缩并吸收投影;位置另走 shared key / multi-head query。
MLA · extra latent RMSNorm
除 block PreNorm 外,再控制 compressed latent;不要把两个 Norm 混为一处。
稀疏索引继续接入 MLA 谱系
位置、内容与索引需要在高效注意力里共同保真。
4× residual streams · Birkhoff constraint
把 HC 的自由映射投到 doubly stochastic manifold。
mHC · partial RoPE · Q/KV RMSNorm · SwiGLU clamp
最后 64 维承载旋转;残差、匹配尺度和 FFN 极值一起控制。
约束流间映射
控制 logits
partial rotation
控制 outliers
25 / KIMI K3 CONVERGENCE
K3 的四轴不是四个 patch,而是一条完整信息路径
文本与视觉 token 进入共享 backbone;接口参数和多模态配方共同决定入口。
KDA recurrent decay 提供顺序与近因;MLA NoPE 提供周期性全局内容交互。
93 层压成 8 个 layer blocks + embedding,共 9 个可选深度来源。
routed latent RMSNorm + SiTU-GLU,把稀疏专家路径的尺度和乘法极值一起控制。
NoPE 避免“修改位置参数”,却没有避免训练长上下文
报告同时使用长文档 / 视频清洗与合成、渐进扩窗课程和序列维并行。因而“K3 直接外推到 1M”不能被简化成“NoPE 单因收益”。
26 / INTERACTIVE LAB
现在亲手改四个变量:单位、位置、深度、极值
每台仪器都把论文公式和本站 toy assumption 分开标注。先找方向关系,再回到真实报告核对训练与系统边界。
INTERACTIVE / REPRESENTATION WORKBENCH
沿四个坐标轴拆开一条 hidden state
四台仪器只计算公开公式与明确标注的 toy model。它们帮助建立方向直觉,不是任何真实 tokenizer、 checkpoint、训练 loss 或梯度的复跑。
一个“词”进模型后,至少会经过五种身份
切换计算单位、词表和 weight tying,观察参数账;再让同一 token 进入两个上下文,看初始向量如何被改写。
同一句话的教学计算步数
`V × d`,不含位置和 block
共享时一张表;否则两张
只算 input / output matrix
初始 embedding 不读上下文,hidden state 会
“行”在河岸语境中被教学变换到“行走/景物”方向;这不是任何真实模型的向量,也不宣称二维投影能容纳全部语义。
- BASE E[id]
- (0.24, 0.61)
- CONTEXT hˡ
- (−0.43, 0.78)
- SHIFT
- 0.71
Tokenizer 决定计算单位,embedding 只负责入口查表;真正的上下文化表示来自后续层的序列混合与 FFN。
位置不是一个数字,而是它进入匹配公式的方式
移动 Q / K 的位置,比较绝对相加、RoPE 旋转、ALiBi 距离偏置与没有显式项的 NoPE。
RoPE 让两次绝对旋转在点积中相消,只留下相对位移;这里仅画一个二维频率对。
`j − i`,方向也属于信息
当前方案写入匹配的量
单个二维内容向量的示意
可计算不等于训练分布熟悉
每个位置有自己的向量;相对规律需由网络再组合。
距离在 Q–K 匹配时才出现,不必污染 Value。
绝对角度进入 Q/K,相对角度留在内积。
不能据此断言 causal / recurrent model 没学顺序。
当前位置仍在训练窗口内;把任一位置移到 64 之外,就进入 toy extrapolation 区。公式仍能算,但相位组合未必训练过。
先问 Norm 控制谁,再问它放在哪里
同一条 residual branch,Norm 的对象和位置会改变 identity path、累计幅值和 attention logit 饱和。
xₗ₊₁ = xₗ + F(Norm(xₗ))
假设分支近似正交的教学估计
捷径上的局部教学系数
一个 logit 高于其余 0 的 toy 分布
位置与对象不能只看名字
(x−μ) / √(σ²+ε)x / √mean(x²)q̂ · k̂ × γNorm(cKV)Pre-LN 保留裸 identity path;toy RMS 用独立分支近似展示固定相加为何可能随深度增长,不能预测真实 checkpoint。
一条状态既要穿过深度,也要穿过乘法门控
左侧选择深度路径,右侧选择激活;把 DeepSeek-V4 的 mHC / clamp 与 K3 的 AttnRes / SiTU 放在同一张机制图中。
谁能进入当前层?
hₗ = Σ softmax(qₗᵀ RMSNorm(kᵢ)) · vᵢK3 把 93 层按 12 层组织为 8 个 layer blocks;加上 embedding,共有 9 个 block-level 来源。
教学状态数;不是显存字节
固定相加还是按内容选择
乘法门控怎样处理极值?
4 tanh(g/4) · σ(g) · 25 tanh(u/25)两条线性支路都用 tanh 平滑压缩;β₁=4、β₂=25 时,逐点绝对值严格小于 100。
在当前绘图区间采样
函数性质或“无有限上界”
扩宽深度路,再把它投回稳定流形
- mHC residual expansion = 4
- Birkhoff polytope / doubly stochastic B
- Q / compressed KV 各做 head-wise RMSNorm
- 最后 64 维 partial RoPE
- SwiGLU linear `[-10,10]`、gate upper cap `10`
沿深度做注意力,再给乘法输出平滑上界
- Block AttnRes over 9 depth sources
- RMSNorm(keys) 抵消幅值支配
- KDA 隐式位置 + MLA NoPE
- routed latent 后额外 RMSNorm
- SiTU-GLU:β₁β₂ = 100 bound
mHC 学习受约束的多流映射;AttnRes 对先前层或 block 表示做内容相关选择。二者改变的是不同拓扑,不能只用“谁更先进”概括。
27 / ARCHITECTURE AUDIT
以后再看任何架构图,用这十二问防止“名字读懂、路径读错”
单位
原始字符串怎样分成模型一步?训练和推理使用同一 tokenizer / patcher 吗?
接口参数
V、d、input embedding、output head 是否 tying?参数和显存怎样算?
状态
图里画的是初始 embedding、某层 hidden state、KV latent 还是 logits?
位置入口
位置加在 embedding、Q/K、logit、Value、递归 gate 还是完全隐式?
相对性
“relative”来自公式恒等式、learned bias、bucket 还是模型经验模式?
外推
训练长度、微调长度、测试长度和真实利用长度是否分开报告?
Norm 对象
state、Q/K、latent、expert aggregate、depth key 中哪一个被归一化?
Norm 拓扑
Pre、Post、sandwich、parallel 或额外 latent Norm 放在计算图哪里?
Residual
固定单位相加、可学习 scalar、多流矩阵还是沿深度 attention?
状态成本
需要保留 1 条 stream、n 条 stream、所有层还是 block summaries?
激活
单支还是门控双支?是否有数学上界、硬 clamp 或只是一项经验稳定措施?
证据
结论是函数性质、论文理论、作者自报实验、第三方复跑还是本站教学推导?
Token 决定“一步”,Position 决定“先后”,Norm 决定“尺度”,Residual 决定“深度可达”,FFN 决定“逐位置改写”。
现代 LLM 的架构创新,往往不是发明一个孤立 block,而是重新分配这五种责任,再让算法、低精度、缓存和通信能够承受它。
PAPER CHAIN / 2003–2026
六十六个节点,不按热度,按“前一篇留下什么问题”排列
页面只写每个节点在本章问题链上的位置;点击进入论文原文或正式页面。具体数字不脱离模型、任务和训练设定外推。
A Neural Probabilistic Language Model
离散词查表进入共同学习的连续表示。
↗02 / 2013Efficient Estimation of Word Representations
以高效目标大规模学习静态词向量。
↗03 / 2015Batch Normalization
归一化神经活动的 batch 统计前史。
↗04 / 2015Deep Residual Learning
identity shortcut 把深度优化改写为 residual learning。
↗05 / 2015BPE for Neural Machine Translation
以子词处理稀有词和开放词表。
↗06 / 2016Layer Normalization
单样本内按整层特征统计归一化。
↗07 / 2016Using the Output Embedding
输出 classifier 也是 embedding,并可与输入表共享。
↗08 / 2016Tying Word Vectors and Word Classifiers
从 loss framework 得到 weight tying。
↗09 / 2016Gaussian Error Linear Units
以输入大小做平滑、概率式加权。
↗10 / 2016Language Modeling with Gated ConvNets
GLU 用内容分支乘 sigmoid gate。
↗11 / 2017Attention Is All You Need
sinusoid、Post-LN residual 与逐位置 FFN 的原始组合。
↗12 / 2017Searching for Activation Functions
搜索得到 Swish:x·sigmoid(βx)。
↗13 / 2018SentencePiece
从原始句子训练语言无关子词模型。
↗14 / 2018Deep Contextualized Word Representations
同一词的表示变成深双向 LM 状态的函数。
↗15 / 2018Self-Attention with Relative Position
把相对距离表示加入 attention 的 key/value 路径。
↗16 / 2018BERT
深双向 Transformer 上下文化表示成为迁移接口。
↗17 / 2019Transformer-XL
跨段 recurrence 与相对位置共同延长依赖。
↗18 / 2019Fixup Initialization
用初始化缩放训练无归一化 residual networks。
↗19 / 2019RMSNorm
去掉 re-centering,只保留 RMS re-scaling。
↗20 / 2019T5
以 bucketed relative bias 进入统一 text-to-text 系统。
↗21 / 2019Transformers without Tears
PreNorm、ScaleNorm 与 FixNorm 的系统比较。
↗22 / 2020On Layer Normalization in Transformers
分析 Post-LN / Pre-LN 的初始化梯度与 warm-up。
↗23 / 2020GLU Variants Improve Transformer
GEGLU / SwiGLU 等门控 FFN 变体。
↗24 / 2020ReZero
零初始化 residual gate 让网络从 identity 开始。
↗25 / 2020Understanding Training Difficulty / Admin
把不稳连接到 residual 对参数扰动的放大。
↗26 / 2020Query-Key Normalization
直接控制 Q/K 尺度和 softmax 饱和。
↗27 / 2020FFN Layers Are Key-Value Memories
分析 FFN 方向与输入模式、输出词表的关联。
↗28 / 2021RoFormer / RoPE
绝对旋转在 Q·K 中形成相对位置。
↗29 / 2021ALiBi
直接给 attention logits 添加距离惩罚。
↗30 / 2021NormFormer
以额外内部 Norm 修补 Pre-LN 梯度尺度。
↗31 / 2021Primer
搜索得到 squared ReLU 与 depthwise QKV conv。
↗32 / 2021ByT5
无固定子词词表的 byte-to-byte 预训练。
↗33 / 2021CANINE
字符级 encoder 避免显式 tokenizer。
↗34 / 2021Charformer
学习软子词块的 token-free 路线。
↗35 / 2022DeepNet / DeepNorm
residual scale 与初始化把 Transformer 堆到 1,000 层。
↗36 / 2022A Length-Extrapolatable Transformer
以 attention resolution 与 xPos 改善长度外推。
↗37 / 2023LLaMA
RMSNorm、SwiGLU、RoPE 的代表性现代配方。
↗38 / 2023Impact of Positional Encoding
在特定推理任务系统比较 APE、RPE、RoPE、ALiBi、NoPE。
↗39 / 2023Position Interpolation
把扩展位置映回训练过的 RoPE 区间。
↗40 / 2023YaRN
分频率插值并调节 attention 温度。
↗41 / 2023FIRE
学习 relative position 函数并渐进插值。
↗42 / 2024LongRoPE
搜索非均匀插值并渐进扩展到论文设定的 2,048K。
↗43 / 2024DeepSeek LLM
Pre-Norm RMSNorm、SwiGLU 与 RoPE 的 DeepSeek 基线。
↗44 / 2024DeepSeek-V2
MLA 以 decoupled RoPE 分离内容压缩与位置。
↗45 / 2024DeepSeek-V3
在 compressed latent 后增加 RMSNorm。
↗46 / 2024Hyper-Connections
扩宽 residual stream 并动态学习层间映射。
↗47 / 2024nGPT
让表示、hidden state 与权重在 hypersphere 上学习。
↗48 / 2024Byte Latent Transformer
按 next-byte entropy 形成动态 patches。
↗49 / 2025Kimi Linear
KDA 隐式位置与 MLA NoPE 的 3:1 混合。
↗50 / 2025DeepSeek-V3.2
稀疏注意力继续接入 MLA 与长上下文谱系。
↗51 / 2025mHC
把 HC residual mapping 投到受约束流形。
↗52 / 2026Attention Residuals
对先前层或 block 表示做内容相关深度聚合。
↗53 / 2026DeepSeek-V4
mHC、partial RoPE、Q/KV Norm 与 clamp 合流。
↗54 / 2026Kimi K3
NoPE hybrid、Block AttnRes 与 SiTU-GLU 合流。
↗55 / 2018GPT-1
causal decoder hidden state 成为迁移表示。
↗56 / 2019BERT Rediscovers the NLP Pipeline
用 probes 观察语言信息在层间的分布。
↗57 / 2019Linguistic Knowledge in Contextual Representations
跨 ELMo、GPT、BERT 做分层线性 probing。
↗58 / 2020DeBERTa
把内容与位置表示解耦进 attention。
↗59 / 2022PaLM
大规模 decoder 采用 SwiGLU 等配方。
↗60 / 2022OPT
公开 Pre-LN decoder 的规模复现坐标。
↗61 / 2023LLaMA 2
延续 RoPE、RMSNorm 与 SwiGLU 配方。
↗62 / 2023Small-Scale Proxies for Training Instabilities
以 QK-LayerNorm 等干预研究规模训练不稳。
↗63 / 2024Gemma 2
组合 pre/post normalization 与 logit soft-capping。
↗64 / 2024Massive Activations in LLMs
系统观察少量异常大的 hidden activations。
↗65 / 2025Kimi K2
K3 之前的 MLA、RMSNorm 与稳定训练配方。
↗66 / 2026Stable LatentMoE / K3 §2.3
把 routed latent Norm 与有界 SiTU-GLU 放进专家路径。
↗