CHAPTER 03 REPRESENTATION · POSITION · DEPTH

表示、位置与
残差高速公路

Token 不是词,embedding 不是知识,位置也不是一串神秘正弦。真正的问题是: 一条离散符号怎样获得上下文、顺序和深度,又怎样在 93 层与乘法门控中不被放大或稀释?

ONE SENTENCE

模型的 hidden state 同时沿 词表接口、序列位置、网络深度、局部非线性 四个坐标轴被改写;K3 正是把四轴分别重做后再拼成一套系统。

00 / PROBLEM LEDGERS

先别背 RoPE:把一条 state 拆成二十本账

这章最危险的读法,是把 Tokenizer、位置编码、Norm、Residual 和激活函数当作五个互不相干的组件。 它们其实共同决定一件事:同一条向量在进入模型、匹配上下文、穿过深度、通过非线性时,哪些信息和尺度能被保留。

Q01 / UNIT

单位账

字符、byte、subword、token、patch 谁是模型一步?

边界先决定序列长度、词表和计算密度。
Q02 / PARAM

参数账

词表变大,哪张矩阵跟着变?

输入 embedding 和输出 head 常各含 V×d 参数。
Q03 / STATIC

静态表示账

同一个 token ID 是否永远同义?

第 0 层查表固定,深层 hidden state 随上下文变化。
Q04 / CONTEXT

上下文化账

多义性在哪里被展开?

序列混合与逐位置 FFN 反复改写每次 occurrence。
Q05 / OUTPUT

输出几何账

hidden state 怎样变成下一个 token?

与输出向量点积成 logits,再经 softmax。
Q06 / SYMMETRY

对称性账

无位置 Attention 知道先后吗?

裸算子排列等变;causal mask 只给有向可见性。
Q07 / ABSOLUTE

绝对位置账

“第 37 位”如何进入表示?

位置向量可加到内容,但两者从入口便纠缠。
Q08 / RELATIVE

相对位置账

“相隔 3”如何进入匹配?

距离表示或 bias 可直接改变位置对的 score。
Q09 / ROTATION

旋转账

RoPE 为什么要成对旋转维度?

两次绝对旋转在 Q·K 中相消为相对旋转。
Q10 / LENGTH

外推账

公式能算更长,为何模型仍可能坏?

新相位、距离、bias 与注意力分辨率可能越出训练分布。
Q11 / NOPE

NoPE 账

无显式位置是否等于无顺序?

因果边界、递归衰减和内容统计都可能隐式带序。
Q12 / TARGET

统计账

LayerNorm、RMSNorm、QK-Norm在管谁?

它们控制不同对象,不能互相替换名字。
Q13 / TOPOLOGY

拓扑账

Norm 在分支前还是相加后?

位置改变 identity path、初始化梯度与深度动态。
Q14 / SCALE

幅值账

有 Residual 为何 state 仍会长大?

固定单位累加没有自动控制总尺度。
Q15 / GRADIENT

梯度账

有捷径为何仍会训练不稳?

可达性不等于各层更新和 attention logits 都平衡。
Q16 / DILUTION

稀释账

早期层为何会逐渐听不见?

总和持续增长时,单层增量的相对份额下降。
Q17 / WIDTH

拓宽账

Residual stream 必须只有一条吗?

HC 扩宽成多条流,学习跨层连接。
Q18 / SELECT

选择账

深度能否像序列一样 Attention?

AttnRes 对历史层或块做内容相关 softmax。
Q19 / FFN

FFN 账

Attention 后为何还要大 MLP?

前者跨位置搬运,后者逐位置做非线性加工。
Q20 / OUTLIER

极值账

乘法门控为何也会爆?

SwiGLU 两支可无界;clamp 与 SiTU 以不同方式限幅。
VOCABULARY AXISID → vector → logits

谁是模型的一步,入口和出口各花多少参数?

SEQUENCE AXIScontent + order

位置怎样改变 token-to-token 匹配?

DEPTH AXISlayer 0 → layer L

捷径怎样避免阻塞,又怎样避免所有层固定混成一团?

NONLINEAR AXISFFN / GLU / experts

逐位置加工怎样增加容量,又怎样制造极端激活?

01 / REPRESENTATION OBJECTS

“词向量”这个词,至少藏着五个不同对象

如果不先区分对象,后面所有讨论都会滑坡:把 ID 当语义、把 embedding 当知识、把概率当一个向量固有属性。

01
TOKEN ID离散索引

它只说“查哪一行”,没有距离、方向或概率。

02
INPUT EMBEDDINGE[id]

同一 ID 的第 0 层查表结果;还没有读到句内上下文。

03
HIDDEN STATEhᶫₜ

同一 ID 在不同句子、位置和层中通常不同。

04
OUTPUT VECTORWout[v]

与最终 state 点积,扮演词表 classifier 的类别向量。

05
PROBABILITYsoftmax(logits)

整个上下文计算后的分布,不是某个向量独自携带的属性。

MINIMUM PIPELINEt → eₜ = E[t] → hₜ⁰ → hₜ¹ → … → hₜᴸ → zᵥ = Wout[v]ᵀhₜᴸ → softmax(z)

同一个 token ID 的 `E[t]` 固定;真正随上下文变化的是层内状态 `hᶫₜ`。输出概率还依赖整个词表的相对 logits。

02 / TOKEN AS COMPUTE UNIT

Tokenizer 不是预处理小工具,它先写下三笔架构账

VOCABULARYV 大

embedding / output head 参数增大,常见词可用更少步表示。

SEQUENCET 长

Attention、状态更新、训练 token budget 与推理步数都增加。

BOUNDARY切在哪里

语言、数字、代码、稀有词和拼写鲁棒性会获得不同归纳偏置。

WORD少步 / 大词表 / OOV
SUBWORD固定折中 / 现代主流
CHAR / BYTE小词表 / 长序列
DYNAMIC PATCH按局部熵分配步数
BLT / 2024

Byte Latent Transformer 不把每个 byte 都交给大 Transformer;它按 next-byte entropy 形成动态 patch,在难预测位置分配更多计算。论文结果属于其 FLOP-controlled scaling 设置,不是“固定 tokenizer 已被淘汰”。

阅读原文 →

03 / INPUT–OUTPUT GEOMETRY

模型从一张表里“读入”,也可以用同一张表“分类输出”

INPUTE[t]按 ID 查一行
BACKBONEcontext → h反复改写 state
OUTPUTE[v]ᵀh与每个候选行点积
设计接口参数直觉边界
Untied2Vd输入与输出各学一套几何更自由,也更昂贵
TiedVd读入和分类共享类别向量角色仍不同,不等于计算相同

Press & Wolf 与 Inan et al. 在 2016 年独立把 weight tying 推到语言模型主线:Output Embedding · Tying Word Vectors

04 / CONTEXTUALIZATION

同一个 token 的“词典坐标”,怎样变成这句话里的状态?

LAYER 0

固定查表

“bank” 无论在河岸还是金融句中先取同一行。

type-level
LOWER LAYERS

局部与形式

邻近词、词形、标点与短程组合开始改变方向。

occurrence-level
MIDDLE / UPPER

句内任务状态

与语义、指代、预测目标相关的特征继续被重组。

context-conditioned
LM HEAD

候选分布

最终 state 与全部输出向量比较,产生下一 token 分布。

decision interface
不要把 probe 读成“解剖标签”。ELMo、BERT 和后续 probing 工作展示不同层可线性提取不同语言信息;它们没有证明某层只负责一种功能,也没有证明 probe 读出的关联就是模型决策的因果电路。

05 / FFN AS REPRESENTATION

Attention 负责“从哪里搬”,FFN 负责“在当前位置怎样改写”

CROSS-TOKEN

Attention

ABCD

每个位置按 Q/K 权重汇总其他位置的 Value;它重排和混合序列信息。

WITHIN-TOKEN

FFN / GLU / MoE

d≈4dd

同一组权重逐位置应用,产生非线性特征、门控与大量参数容量。

Geva et al. 把 FFN 分析为 key-value memories:第一层方向与输入模式相关,第二层方向诱导输出词表分布; 低层更多浅层模式,高层更语义化。这个视角说明 FFN 不是“Attention 后的填充”,但也不能把每个 neuron 直接命名成一条稳定事实。

Transformer Feed-Forward Layers Are Key-Value Memories →

06 / EIGHT TURNS

三十年不是一条“更复杂”的直线,而是八次瓶颈迁移

01 / 2003–13

从 one-hot 到连续几何

NPLM · word2vec

相似上下文可共享统计,但一个词仍只有一个静态点。

02 / 2015–18

开放词表与上下文化

BPE · SentencePiece · ELMo · BERT

先解决边界,再让每次出现拥有不同状态。

03 / 2015–17

深层捷径与单样本归一化

ResNet · LayerNorm · Transformer

网络先能堆起来,固定累加的幅值问题随后出现。

04 / 2018–21

把顺序写进 Attention

Relative PE · Transformer-XL · RoPE · ALiBi

从绝对入口向 pair-wise 距离与旋转几何转移。

05 / 2019–22

稳定训练更深 Transformer

RMSNorm · Pre-LN · ReZero · Admin · DeepNorm

优化稳定、表示变化与最终质量并非同一目标。

06 / 2021–24

跨出训练窗口

xPos · NoPE · PI · YaRN · FIRE · LongRoPE

位置外推变成独立问题,但不替代长程数据和检索。

07 / 2024–26

重写 residual stream

HC · nGPT · mHC · AttnRes

一条固定总线变成多流映射或沿深度选择。

08 / 2024–26

前沿模型协同设计

DeepSeek-V2/V4 · Kimi Linear/K3

位置、Norm、Residual 与激活开始按缓存、低精度和系统共同设计。

07 / PERMUTATION SYMMETRY

Attention 先天会匹配内容,却先天不知道“谁在前面”

ORIGINAL[猫, 追, 狗]

每行用同一 Q/K/V 投影

Attn(X)没有 mask / position
OUTPUT[h猫, h追, h狗]

输出跟着行顺序

同时重排 P
PERMUTED[狗, 猫, 追]

输入行被同一个 P 重排

Attn(PX)= P Attn(X)
OUTPUT[h狗, h猫, h追]

只跟随排列,不知道语序差异

Causal mask 已经提供一部分顺序结构

第 t 位只能读前缀,因此不同位置拥有不同可见集合。NoPE causal decoder 不是完全无序;但 mask 没有显式告诉 Q/K “相距多少”。

08 / ABSOLUTE POSITION

第一代答案很直接:给每个位置一张坐标卡

CONTENTetoken
POSITIONp37
STATEx37
FIXED SINUSOID

频率层级写进公式

原始 Transformer 使用不同频率的 sin/cos,使位置间线性关系可被学习;公式可生成未见绝对位置。

LEARNED TABLE

每个位置直接学一行

灵活但通常受训练最大索引约束;扩窗需要新增、插值或重训。

09 / RELATIVE POSITION

语言规律往往更像“离我三步”,而不是“绝对第 37 位”

Absolute addxₜ = eₜ + pₜ入口 state

直接给绝对坐标;内容与位置从入口混合。

Relative repr.scoreᵢⱼ += qᵢᵀaᵢ₋ⱼQ–K pair

直接表达距离;可做 buckets 或截断。

RoPEqᵢᵀRⱼ₋ᵢkⱼQ / K 旋转

绝对角度进入向量,相对角度留在内积。

ALiBiscoreᵢⱼ − mₕ|i−j|attention logit

不给 embedding 加位置,只施加 head-wise 近邻偏置。

NoPEexplicit term = 0无显式插槽

必须继续问 causal mask、递归状态和数据怎样提供顺序。

Shaw et al. 把相对距离表示加入 self-attention;Transformer-XL 为跨段记忆重新设计相对位置;T5 将距离分桶并作为 attention bias。它们都叫“relative”,但写入的张量与参数共享方式不同。

10 / ROTARY GEOMETRY

RoPE 的核心不是“旋转很高级”,而是一条矩阵恒等式

RₘqRₙk(n−m)θRₘᵀ Rₙ = Rₙ₋ₘqₘᵀkₙ = qᵀRₙ₋ₘk高频维度对:近距离分辨低频维度对:长尺度变化一个 head 同时叠加多组频率
2D PAIRR(mθ) = [ cos mθ −sin mθ
     sin mθ  cos mθ ]

每两维构成一个复平面。Q 在 m 旋转、K 在 n 旋转;做内积时,公共绝对角度相消,只剩相对位移 `n−m`。

公式可生成任何 m ≠ 模型熟悉任何 m

11 / LENGTH EXTRAPOLATION

训练窗外不是“索引越界”这么简单,而是几何分布变了

TRAIN / 0–8K模型见过的相位组合与距离
TEST / 8K–1M公式可算,但组合可能陌生
近邻训练边缘新周期组合极长距离
CHANGE GEOMETRYxPos · ALiBi · FIRE

重新设计距离衰减、分辨率或相对函数。

MAP BACKPI · YaRN · LongRoPE

把新位置压回熟悉范围,或按频率非均匀插值。

REMOVE EXPLICIT TERMNoPE

避免位置参数外推,但仍须证明顺序和长程能力从何而来。

TRAIN THE REGIME长数据 · 渐进扩窗

位置公式不替代远距离依赖数据与训练系统。

“Context window = 1M”至少有四层含义:数学上能接收、系统上能运行、训练中见过、任务上能有效利用。任何一层都不能代替其余三层。

12 / NO POSITION ENCODING

NoPE 删除的是显式插槽,不是宇宙里的“顺序”

EXPLICIT PE0

Q/K 或 embedding 不再加人工位置函数。

但仍有
CAUSAL PREFIX{0…t}

每个位置的可见集合不同。

RECURRENT STATESₜ = f(Sₜ₋₁,xₜ)

状态更新本身带方向与时间。

DATA STATISTICSorder patterns

语言序列的条件分布并不对称。

2023 的系统研究在一组 decoder-only 推理与数学任务上发现 NoPE 优于若干显式方案,并从表示能力与 SGD 模式分析它; 这不是所有语言建模、所有架构和所有长度的普遍胜负。K3 更不能只写成“NoPE 模型”:它用 KDA 的 recurrent gating / decay 显式承担位置敏感与 recency-aware 混合。

13 / DEEPSEEK POSITION LINEAGE

DeepSeek 没有从 RoPE 走向“越用越多”,而是越拆越细

LLM / 2024

Full RoPE

标准 decoder 配方:所有相关 Q/K 维度旋转。

位置与内容共处 head
V2 / MLA

Decoupled RoPE

content K/V 压入 latent;额外 shared K 与 multi-head Q 专门携带 RoPE。

为矩阵吸收和 KV cache 拆路
V4 / CSA·HCA

Partial RoPE

Q、compressed KV 与 output 的最后 64 维旋转;output 用负位置抵消绝对角。

只给部分通道位置责任
CONTENT PATHh → cKV → KC, VC低秩 latent 可缓存、可吸收投影
POSITION PATHh → RoPE(KR)额外 shared key + per-head query
ATTENTION KEY[KC; KR]内容与位置在 score 前拼接

14 / NORMALIZATION TARGET

看到“RMSNorm”先别点头:第一问永远是“它在归一化谁?”

方法 / 插槽对象动作主要目的
LayerNorm单 token 的全部特征去均值 + 除标准差re-centering + re-scaling
RMSNorm单 token 的全部特征只除 RMSre-scaling
QK-Norm每个 attention head 的 Q / K先归一化再学习温度防 logit 任意饱和
Latent Norm压缩后的 cKV / routed latent在低维状态上控制尺度不是 block PreNorm
AttnRes key Norm不同深度来源的 keys比较前先做 RMSNorm避免大幅值层靠尺度胜出
LAYERNORMLN(x) = γ ⊙ (x−μ) / √(σ²+ε) + β

同时获得平移和缩放不变性;需要均值与方差。

RMSNORMRMS(x) = γ ⊙ x / √(mean(x²)+ε)

保留均值方向,只控制 root-mean-square 尺度。

15 / PRE VS POST

Norm 的位置会改变那条“什么都不做也能通过”的路

POST-LN / 2017 TRANSFORMERxₗ₊₁ = Norm(xₗ + F(xₗ))
xFNormy

相加后尺度被重置,但 identity path 每层都穿过 Norm;初始化靠近输出处的梯度可能更大。

PRE-LN / MODERN DECODERxₗ₊₁ = xₗ + F(Norm(xₗ))
xNormFy

裸 identity path 直接跨层,通常更易优化;所有分支固定单位累加,幅值和层贡献稀释成为新问题。

Pre-LN “更稳”不等于“全面更优”。初始化梯度、是否需要 warm-up、最终表示变化、深度收益与下游质量是不同指标。NormFormer、DeepNorm、AttnRes 正是沿不同缺口继续修补。

16 / TRAINING DEEP

从“让梯度能走”到“让每层的贡献可控”

2015

ResNet

identity shortcut

先解决深网优化退化;没有给每层贡献可学习权重。

2019

Fixup

depth-scaled init

用初始化控制初始 residual update,不依赖 Norm。

2019

RMSNorm

scale only

去掉 re-centering,简化归一化。

2020

Pre-LN analysis

Norm before branch

裸 identity path 改善初始化梯度,但会固定累加所有分支。

2020

ReZero / Admin

gate / adaptive init

从近 identity 开始,或控制 residual 对参数扰动的放大。

2021

NormFormer

extra internal Norms

修补 Pre-LN 深浅层梯度尺度不匹配。

2022

DeepNorm

scaled Post-LN

用 residual scale 与初始化稳定到 1,000 层。

2024–26

HC → mHC → AttnRes

new depth topology

从控制单位加法,走向多流连接或选择性深度读取。

17 / RESIDUAL STREAM

Residual 解决“到不了”,却没有自动解决“听不见”

PRENORM UNROLLEDhL = h0 + f0(Norm(h0)) + f1(Norm(h1)) + … + fL−1(Norm(hL−1))
L0L1L2L3L4L5L6L7L8L9L10L11

上图是“累计 state 变大时,固定大小单层增量相对占比下降”的概念图,不是实测激活。Kimi AttnRes 报告把这类现象称为 hidden-state growth 与 PreNorm dilution。

REACHABILITY信息能否跨层?

identity shortcut 的原始强项。

MAGNITUDE累计 state 会多大?

Norm、初始化、scale、gate 共同控制。

SELECTIVITY当前层想读哪一层?

标准加法没有选择;HC / AttnRes 才重写拓扑。

18 / HYPER-CONNECTIONS

把一条 residual stream 展开成四条“车道”

Xₗ ∈ Rn×dstream 1stream 2stream 3stream 4
Aₗ4 streams → layer input d
FₗAttention / MoE
Cₗlayer output → 4 streams
Bₗstream-to-stream mixing
HYPER-CONNECTION UPDATEXl+1 = BlXl + ClFl(AlXl)

实际 layer 仍只接收 d 维输入;新增的是 residual width 与连接自由度。原论文将目标描述为缓解 gradient vanishing 与 representation collapse 的跷跷板。

19 / MANIFOLD CONSTRAINT

DeepSeek 的关键追问:自由连接变多后,identity property 怎么回来?

RAW B̃
0.8-0.40.20.90.60.1-0.70.30.50.20.4-0.10.90.20.10.6
可能放大 / 抵消
PROJECTexp → row norm → col norm× 20DeepSeek-V4 实际设置
B ∈ BIRKHOFF POLYTOPE
0.420.180.250.150.160.480.120.240.220.140.460.180.20.20.170.43
非负 · 行和=1 · 列和=1
NON-EXPANSIVE‖B‖₂ ≤ 1

报告据此限制 forward / backward 中 residual transformation 的扩张。

CLOSED UNDER PRODUCTB₁B₂ ∈ 𝓜

doubly stochastic 集合在乘法下封闭,支持深层连续堆叠。

BOUNDED A / CSigmoid constraints

输入和输出映射非负且有界,降低信号抵消风险。

以上是 mHC 论文DeepSeek-V4 报告 的设计和理论主张;本站不把它扩写成任意优化器与任意网络的完备稳定性证明。

20 / ATTENTION OVER DEPTH

Kimi 的答案不同:不扩宽车道,而是让当前层选择历史出口

EMBv₀
L1v₁
L2v₂
L−1vₗ₋₁
LAYER-SPECIFIC QUERY qₗ
.08.15.36.10.31
αᵢ→ₗ = softmax(qₗᵀ RMSNorm(kᵢ))
CURRENT INPUThₗ = Σ αᵢ→ₗvᵢ

内容相关、归一化的深度混合

FULL ATTNRES保存全部层输出memory O(Ld)

depth arithmetic 为 O(L²d);不足百层时算术可接受,训练状态与 PP 通信更难。

BLOCK ATTNRES块内求和、块间 Attentionmemory O(Nd)

只保存 block representations,保留大部分选择性并降低跨 stage 状态。

21 / K3 DEPTH MAP

93 层不是 93 份同时常驻:K3 把它们压成 9 个深度来源

SOURCE 0Token Embedding始终可被读取
SOURCE 1L1–L12
12-layer block
SOURCE 2L13–L24
12-layer block
SOURCE 3L25–L36
12-layer block
SOURCE 4L37–L48
12-layer block
SOURCE 5L49–L60
12-layer block
SOURCE 6L61–L72
12-layer block
SOURCE 7L73–L84
12-layer block
SOURCE 8L85–L93
partial / 9 layers
勘误 / 本章研究阶段已更正

K3 §2.2 明确写的是 12-layer block size:93 层形成 7 个完整块和 1 个尾块,另计 embedding 后共有 9 个 block-level sources。“block size 2”是早期草案误读,未进入正式页面结论。

22 / ACTIVATION LINEAGE

激活函数的演化,不只是把 ReLU 曲线画得更圆

方法公式结构极值
ReLUmax(0,x)单支、分段线性正向无界;负半轴为零
GELUx Φ(x)单支、平滑正向无界;负向平滑衰减
GLUg ⊙ σ(u)内容 × 有界 gate内容支仍无界
SwiGLUSwish(g) ⊙ u两条可学习支相乘两个乘法因子都可无界
V4 clampcap(Swish(g)) ⊙ clamp(u)硬限幅作者配方:linear [−10,10],gate 上界 10
K3 SiTU4tanh(g/4)σ(g) · 25tanh(u/25)平滑限幅逐点 |y| < 100
GATE BRANCHg = WgxSwish(g)
VALUE BRANCHu = Wuxlinear u
SwiGLUunbounded × unbounded大规模 / MoE / 低精度下会放大 outlier 风险

23 / OUTLIER CONTROL

DeepSeek-V4 与 K3 都限制 SwiGLU 极值,但数学性格完全不同

DEEPSEEK-V4 / HARD BOUNDARY

SwiGLU Clamping

gate = min(Swish(g), 10)
value = clamp(u, −10, 10)

报告称该配方消除 outliers、帮助稳定且不损性能。这是 V4 训练中的作者经验结论;硬 clamp 在边界外对被截分支给出零梯度。

KIMI K3 / SMOOTH BOUNDARY

Sigmoid Tanh Unit GLU

4 tanh(g/4) · σ(g)
× 25 tanh(u/25)

两支都用 tanh 平滑压缩;β₁=4、β₂=25,所以逐点 |y|<100。靠近原点一阶近似 SwiGLU,β→∞ 时逐点恢复。

FUNCTION PROPERTY ≠ WHOLE-NETWORK GUARANTEE

SiTU 单元输出有界,不等于整个 residual stream、loss 或 gradient 有界;K3 还在 routed expert aggregate 后加入 RMSNorm,并配合路由与系统稳定措施。

24 / DEEPSEEK FOCUS

沿 DeepSeek 六个节点,看四条轴如何逐步解耦再合流

DeepSeek LLM / 2024

Pre-Norm RMSNorm · SwiGLU · RoPE

建立现代 dense 基线;Norm、激活与位置是三条独立轴。

DeepSeek-V2 / 2024

MLA · decoupled RoPE

内容 K/V 可低秩压缩并吸收投影;位置另走 shared key / multi-head query。

DeepSeek-V3 / 2024

MLA · extra latent RMSNorm

除 block PreNorm 外,再控制 compressed latent;不要把两个 Norm 混为一处。

DeepSeek-V3.2 / 2025

稀疏索引继续接入 MLA 谱系

位置、内容与索引需要在高效注意力里共同保真。

mHC / 2025

4× residual streams · Birkhoff constraint

把 HC 的自由映射投到 doubly stochastic manifold。

DeepSeek-V4 / 2026

mHC · partial RoPE · Q/KV RMSNorm · SwiGLU clamp

最后 64 维承载旋转;残差、匹配尺度和 FFN 极值一起控制。

DEEPSEEK-V4 BLOCK表示稳定控制室
DEPTHmHC ×4

约束流间映射

MATCHQ / KV RMSNorm

控制 logits

POSITIONlast 64 dims RoPE

partial rotation

FFNSwiGLU clamp

控制 outliers

25 / KIMI K3 CONVERGENCE

K3 的四轴不是四个 patch,而是一条完整信息路径

01 / TOKEN160K vocabulary

文本与视觉 token 进入共享 backbone;接口参数和多模态配方共同决定入口。

02 / SEQUENCE3× KDA + 1× Gated MLA

KDA recurrent decay 提供顺序与近因;MLA NoPE 提供周期性全局内容交互。

03 / DEPTHBlock AttnRes

93 层压成 8 个 layer blocks + embedding,共 9 个可选深度来源。

04 / LOCALStable LatentMoE

routed latent RMSNorm + SiTU-GLU,把稀疏专家路径的尺度和乘法极值一起控制。

K3 §3.4 / LONG-CONTEXT BOUNDARY

NoPE 避免“修改位置参数”,却没有避免训练长上下文

8K64K256K1M

报告同时使用长文档 / 视频清洗与合成、渐进扩窗课程和序列维并行。因而“K3 直接外推到 1M”不能被简化成“NoPE 单因收益”。

26 / INTERACTIVE LAB

现在亲手改四个变量:单位、位置、深度、极值

每台仪器都把论文公式和本站 toy assumption 分开标注。先找方向关系,再回到真实报告核对训练与系统边界。

INTERACTIVE / REPRESENTATION WORKBENCH

沿四个坐标轴拆开一条 hidden state

四台仪器只计算公开公式与明确标注的 toy model。它们帮助建立方向直觉,不是任何真实 tokenizer、 checkpoint、训练 loss 或梯度的复跑。

WORKBENCH 01 / REPRESENTATION

一个“词”进模型后,至少会经过五种身份

切换计算单位、词表和 weight tying,观察参数账;再让同一 token 进入两个上下文,看初始向量如何被改写。

RAW“我在河岸看见一座银行”字符串不是模型一步
SEGMENT9 tokens0.64 token / 字
LOOKUPID → E[id]固定的第 0 层向量
CONTEXThltoken随句子、位置、层而变
LOGITSWouth再成为词表分类分数
01234看见5678
SEQUENCE STEPS9

同一句话的教学计算步数

EMBEDDING PARAMS1.15B

`V × d`,不含位置和 block

INPUT + OUTPUT1.15B

共享时一张表;否则两张

BF16 FOOTPRINT2.14 GiB

只算 input / output matrix

SAME TOKEN / DIFFERENT STATE
初始 embedding 不读上下文,hidden state 会

“行”在河岸语境中被教学变换到“行走/景物”方向;这不是任何真实模型的向量,也不宣称二维投影能容纳全部语义。

BASE E[id]
(0.24, 0.61)
CONTEXT hˡ
(−0.43, 0.78)
SHIFT
0.71
E[id]river hˡ
先记住

Tokenizer 决定计算单位,embedding 只负责入口查表;真正的上下文化表示来自后续层的序列混合与 FFN。

教学模拟公式和机制来自已核验论文;二维向量、RMS 曲线、source scores 与采样范围由本站构造,目的是让变量关系可操作。

27 / ARCHITECTURE AUDIT

以后再看任何架构图,用这十二问防止“名字读懂、路径读错”

01

单位

原始字符串怎样分成模型一步?训练和推理使用同一 tokenizer / patcher 吗?

02

接口参数

V、d、input embedding、output head 是否 tying?参数和显存怎样算?

03

状态

图里画的是初始 embedding、某层 hidden state、KV latent 还是 logits?

04

位置入口

位置加在 embedding、Q/K、logit、Value、递归 gate 还是完全隐式?

05

相对性

“relative”来自公式恒等式、learned bias、bucket 还是模型经验模式?

06

外推

训练长度、微调长度、测试长度和真实利用长度是否分开报告?

07

Norm 对象

state、Q/K、latent、expert aggregate、depth key 中哪一个被归一化?

08

Norm 拓扑

Pre、Post、sandwich、parallel 或额外 latent Norm 放在计算图哪里?

09

Residual

固定单位相加、可学习 scalar、多流矩阵还是沿深度 attention?

10

状态成本

需要保留 1 条 stream、n 条 stream、所有层还是 block summaries?

11

激活

单支还是门控双支?是否有数学上界、硬 clamp 或只是一项经验稳定措施?

12

证据

结论是函数性质、论文理论、作者自报实验、第三方复跑还是本站教学推导?

THE CHAPTER IN ONE MAP

Token 决定“一步”,Position 决定“先后”,Norm 决定“尺度”,Residual 决定“深度可达”,FFN 决定“逐位置改写”。

现代 LLM 的架构创新,往往不是发明一个孤立 block,而是重新分配这五种责任,再让算法、低精度、缓存和通信能够承受它。

PAPER CHAIN / 2003–2026

六十六个节点,不按热度,按“前一篇留下什么问题”排列

页面只写每个节点在本章问题链上的位置;点击进入论文原文或正式页面。具体数字不脱离模型、任务和训练设定外推。

01 / 2003

A Neural Probabilistic Language Model

离散词查表进入共同学习的连续表示。

02 / 2013

Efficient Estimation of Word Representations

以高效目标大规模学习静态词向量。

03 / 2015

Batch Normalization

归一化神经活动的 batch 统计前史。

04 / 2015

Deep Residual Learning

identity shortcut 把深度优化改写为 residual learning。

05 / 2015

BPE for Neural Machine Translation

以子词处理稀有词和开放词表。

06 / 2016

Layer Normalization

单样本内按整层特征统计归一化。

07 / 2016

Using the Output Embedding

输出 classifier 也是 embedding,并可与输入表共享。

08 / 2016

Tying Word Vectors and Word Classifiers

从 loss framework 得到 weight tying。

09 / 2016

Gaussian Error Linear Units

以输入大小做平滑、概率式加权。

10 / 2016

Language Modeling with Gated ConvNets

GLU 用内容分支乘 sigmoid gate。

11 / 2017

Attention Is All You Need

sinusoid、Post-LN residual 与逐位置 FFN 的原始组合。

12 / 2017

Searching for Activation Functions

搜索得到 Swish:x·sigmoid(βx)。

13 / 2018

SentencePiece

从原始句子训练语言无关子词模型。

14 / 2018

Deep Contextualized Word Representations

同一词的表示变成深双向 LM 状态的函数。

15 / 2018

Self-Attention with Relative Position

把相对距离表示加入 attention 的 key/value 路径。

16 / 2018

BERT

深双向 Transformer 上下文化表示成为迁移接口。

17 / 2019

Transformer-XL

跨段 recurrence 与相对位置共同延长依赖。

18 / 2019

Fixup Initialization

用初始化缩放训练无归一化 residual networks。

19 / 2019

RMSNorm

去掉 re-centering,只保留 RMS re-scaling。

20 / 2019

T5

以 bucketed relative bias 进入统一 text-to-text 系统。

21 / 2019

Transformers without Tears

PreNorm、ScaleNorm 与 FixNorm 的系统比较。

22 / 2020

On Layer Normalization in Transformers

分析 Post-LN / Pre-LN 的初始化梯度与 warm-up。

23 / 2020

GLU Variants Improve Transformer

GEGLU / SwiGLU 等门控 FFN 变体。

24 / 2020

ReZero

零初始化 residual gate 让网络从 identity 开始。

25 / 2020

Understanding Training Difficulty / Admin

把不稳连接到 residual 对参数扰动的放大。

26 / 2020

Query-Key Normalization

直接控制 Q/K 尺度和 softmax 饱和。

27 / 2020

FFN Layers Are Key-Value Memories

分析 FFN 方向与输入模式、输出词表的关联。

28 / 2021

RoFormer / RoPE

绝对旋转在 Q·K 中形成相对位置。

29 / 2021

ALiBi

直接给 attention logits 添加距离惩罚。

30 / 2021

NormFormer

以额外内部 Norm 修补 Pre-LN 梯度尺度。

31 / 2021

Primer

搜索得到 squared ReLU 与 depthwise QKV conv。

32 / 2021

ByT5

无固定子词词表的 byte-to-byte 预训练。

33 / 2021

CANINE

字符级 encoder 避免显式 tokenizer。

34 / 2021

Charformer

学习软子词块的 token-free 路线。

35 / 2022

DeepNet / DeepNorm

residual scale 与初始化把 Transformer 堆到 1,000 层。

36 / 2022

A Length-Extrapolatable Transformer

以 attention resolution 与 xPos 改善长度外推。

37 / 2023

LLaMA

RMSNorm、SwiGLU、RoPE 的代表性现代配方。

38 / 2023

Impact of Positional Encoding

在特定推理任务系统比较 APE、RPE、RoPE、ALiBi、NoPE。

39 / 2023

Position Interpolation

把扩展位置映回训练过的 RoPE 区间。

40 / 2023

YaRN

分频率插值并调节 attention 温度。

41 / 2023

FIRE

学习 relative position 函数并渐进插值。

42 / 2024

LongRoPE

搜索非均匀插值并渐进扩展到论文设定的 2,048K。

43 / 2024

DeepSeek LLM

Pre-Norm RMSNorm、SwiGLU 与 RoPE 的 DeepSeek 基线。

44 / 2024

DeepSeek-V2

MLA 以 decoupled RoPE 分离内容压缩与位置。

45 / 2024

DeepSeek-V3

在 compressed latent 后增加 RMSNorm。

46 / 2024

Hyper-Connections

扩宽 residual stream 并动态学习层间映射。

47 / 2024

nGPT

让表示、hidden state 与权重在 hypersphere 上学习。

48 / 2024

Byte Latent Transformer

按 next-byte entropy 形成动态 patches。

49 / 2025

Kimi Linear

KDA 隐式位置与 MLA NoPE 的 3:1 混合。

50 / 2025

DeepSeek-V3.2

稀疏注意力继续接入 MLA 与长上下文谱系。

51 / 2025

mHC

把 HC residual mapping 投到受约束流形。

52 / 2026

Attention Residuals

对先前层或 block 表示做内容相关深度聚合。

53 / 2026

DeepSeek-V4

mHC、partial RoPE、Q/KV Norm 与 clamp 合流。

54 / 2026

Kimi K3

NoPE hybrid、Block AttnRes 与 SiTU-GLU 合流。

55 / 2018

GPT-1

causal decoder hidden state 成为迁移表示。

56 / 2019

BERT Rediscovers the NLP Pipeline

用 probes 观察语言信息在层间的分布。

57 / 2019

Linguistic Knowledge in Contextual Representations

跨 ELMo、GPT、BERT 做分层线性 probing。

58 / 2020

DeBERTa

把内容与位置表示解耦进 attention。

59 / 2022

PaLM

大规模 decoder 采用 SwiGLU 等配方。

60 / 2022

OPT

公开 Pre-LN decoder 的规模复现坐标。

61 / 2023

LLaMA 2

延续 RoPE、RMSNorm 与 SwiGLU 配方。

62 / 2023

Small-Scale Proxies for Training Instabilities

以 QK-LayerNorm 等干预研究规模训练不稳。

63 / 2024

Gemma 2

组合 pre/post normalization 与 logit soft-capping。

64 / 2024

Massive Activations in LLMs

系统观察少量异常大的 hidden activations。

65 / 2025

Kimi K2

K3 之前的 MLA、RMSNorm 与稳定训练配方。

66 / 2026

Stable LatentMoE / K3 §2.3

把 routed latent Norm 与有界 SiTU-GLU 放进专家路径。