ANCHOR REPORT / ROUND 08 KIMI K3 · REPORT → ARTIFACTS → INDEPENDENT PROBE

不把报告压成摘要
把每个因果环节
重新展开

K3 同时扩展序列、深度、宽度、视觉与 Agent 轨迹。真正值得读的不是 2.8T 这个最大数字, 而是每种状态为什么出现、放在哪里、怎样被训练,以及作者证据究竟支持到哪一步。

QUESTIONS
32 张问题账
REPORT
16 Figures · 5 Tables
LABS
8 + 4 + 5 + 5 + 5 + 5 个交互视图
READING
100 个一手 / 官方节点
MODEL
2.78T total / 104.2B active
ARTIFACTS
96 shards · 497,220 tensors
STATUS
K3 八轮 · 训练期消融审计

00 THIRTY-TWO QUESTION LEDGERS

先把三十二个对象拆开,才不会把“规模、效率、能力”揉成一句话

技术报告最容易制造一种错觉:看完所有术语,却没有建立可追问的对象。 下面每张账只回答一个问题,同时写出答案不能被扩张到哪里。

Q01参数角色

2.78T / 104.2B 各表示什么?

total 是总容量,active 是一条 Token 路径经过的参数规模;二者都不等于端到端 FLOPs。

Q02效率口径

约 2.5× 究竟是什么?

它是架构、数据与 recipe 共同形成的相对 K2 scaling efficiency,不是推理速度或 KDA 单项收益。

Q03混合节奏

3 KDA + 1 MLA 如何落到 93 层?

Table 1 给出 69 KDA + 24 MLA,最后一层也是 MLA;另有一层 dense。

Q04序列状态

KDA 保存了什么?

它维护固定形状 recurrent state,而不是所有历史 Token 的两两配对。

Q05纠错写入

Delta Rule 为什么不是简单累加?

先减掉 state 对当前 key 的已有预测,再写真实 value 与预测的差。

Q06数值下界

gmin = −5 在解决什么?

它限制 chunk 内累计衰减倒数,令关键 tile 可落在 BF16 Tensor Core 范围。

Q07并行算法

递归状态如何训练并行?

chunk 间传状态,chunk 内改写成并行矩阵乘;decode 仍逐步更新固定状态。

Q08读出门

KDA / MLA 的 output gate 是 router 吗?

不是;它按输入控制 attention 读出通道,MoE router 则选择专家。

Q09位置来源

NoPE 是否意味着没有顺序?

没有显式位置 embedding;KDA 的门控与衰减隐式传递顺序,MLA 负责全局内容匹配。

Q10舍入合同

为什么 attention output 保留 FP32?

报告用它修正 FlashAttention 有偏舍入,并为片上 tile buffer 重新排布。

Q11深度路由

AttnRes 怎样改变 residual?

每层用 pseudo-query 选择早层来源;Block 版用块内累加换取更低内存与跨 stage 通信。

Q12主模型边界

12 层一块还是 2 层一块?

K3 主模型为 12;§7 芯片 nano case 的 2 不能写回主规格。

Q13路由宽度

LatentMoE 为什么先压到 3584?

shared path 保留 7168,routed path 在较窄空间执行,以降低多专家激活的 payload 与权重流。

Q14专家角色

896、16、2 怎样读?

896 routed 中每 Token 选 16,另有 2 shared;稀疏不等于消费级硬件轻松运行。

Q15有界激活

SiTU-GLU 在稳定什么?

它限制 routed path 大正输入的幅值,同时近似 SwiGLU 在原点附近的形状。

Q16路由分位

Quantile Balancing 怎样更新 bias?

用 Top-(k+1) score cutoff 的全局分位量做下一步更新;最终 bias 冻结用于推理。

Q17平衡层次

QB 与 MoonEP 是同一件事吗?

QB 调模型路由偏置;MoonEP 调系统执行与通信形状;二者互补但不能合并。

Q18原生视觉

视觉塔是否后接到预训练 LLM?

不是。MoonViT-V2 从头训练,视觉与文本从训练开始就在同一 NTP objective 联合优化。

Q19视觉流

图像和视频怎样进入主干?

401M / 27 层编码器共享图像视频参数,经时空分解、pooling、pixel shuffle 与 projector 进入主干。

Q20优化器

Per-Head Muon 为什么按 head 分组?

多头投影按相对独立的 head 组织矩阵更新;它只是完整训练 recipe 的一部分。

Q21数据披露

我们知道和不知道哪些语料事实?

知道四类文本、视觉种类与清洗/重写流程;不知道完整来源、精确配比和总训练 Token。

Q22长度课程

1M 是怎样训练出来的?

pretrain 8K→64K,cooldown 256K→1M,并配长数据清洗、上采样和跨全局证据的合成任务。

Q23SFT 冷启动

Agent 轨迹从哪里来?

前代 Kimi 专家合成,经多阶段验证与 HITL 标注,再用 XTML 序列化;SFT 起即做 QAT。

Q24九位老师

3 × 3 专家是否在线投票?

不是。它们是三领域 × 三 effort 的训练策略,最终经 MOPD 整合进一个学生。

Q25思考预算

low / high / max 如何定义?

每题从 cold-start 估计 b₀(x),按 domain 退火 τ;超过 τb₀ 的轨迹 reward 改为 −1。

Q26长尾轨迹

Partial rollout 暂停了什么?

N×K 轨迹中 λ 比例完成就更新,未完轨迹下轮优先恢复;代价是 stale/off-policy。

Q27蒸馏信号

MOPD 为什么是 on-policy?

学生生成自己会访问的 prefix,匹配的 teacher 在该 prefix 上给 clipped token log-ratio reward。

Q28部署约束

量化与 speculative draft 何时进入?

SFT/RL 全程 experts MXFP4/activations MXFP8 QAT;MTP 后调为 EAGLE-3 draft 并优化 LK loss。

Q29Harness

Agent 能力属于模型还是脚手架?

系统结果来自模型与 tool、prompt、context、skills、memory、subagent、verifier 的组合。

Q30状态寿命

训练、RL、服务分别搬运什么?

参数/优化器、KDA/MLA 序列状态、KV/轨迹、sandbox 与 prefix 的寿命完全不同。

Q31混合缓存

KDA state 与 MLA KV 怎样共同命中?

统一页池;细 hash boundary 与粗 physical block 解耦,命中点必须两类 cache 同时有效。

Q32评测协议

一个分数至少需要哪些脚注?

effort、tool、harness、fallback/guard、日期;报告也明确总体仍落后最强闭源模型。

贯穿全页的读法

先认状态→找到瓶颈→看机制怎样改写状态→核对系统代价→最后读评测

01 REPORT MAP

47 页不是一条直线:先知道每章在回答哪一层问题

§1
Introduction

四条扩展轴与总体结论

Figure 1
§2
Architecture

KDA、AttnRes、Stable LatentMoE、MoonViT、Muon

Figures 2–6 · Table 1
§3
Pre-Training

数据、scaling law、联合训练、1M curriculum

Figure 7
§4
Post-Training

SFT、9 experts、partial rollout、MOPD、QAT、环境

Figures 8–10
§5
Infrastructure

FlashKDA/KCP、MoonEP、RL 系统、AgentENV、serving

Figures 11–12
§6
Evaluations

四能力轴、第三方结果、成本与协议

Figure 13 · Tables 2–5
§7
Case Studies

kernel、MiniTriton、chip、research、knowledge、video

Figures 14–15
§8
Conclusion

开放权重与剩余差距

—
App.
A–F

KDA/AttnRes 细节、评测补充、XTML

Figure 16
报告结构里的隐藏主线

§2 并不独立于 §5:KDA 的 recurrent state 决定 context parallelism 与 prefix cache; 极稀疏 LatentMoE 决定 expert communication;长 Agent 轨迹又决定 partial rollout 与可恢复 sandbox。 架构、训练、系统是同一条状态链的不同截面。

02 THREE-DIMENSIONAL INFORMATION FLOW

K3 的统一设计语言:Token、Layer、Channel 三个方向的信息流

Kimi K3 三维信息流简化图文字与图像进入模型后,依次通过由 KDA、Gated MLA 和 Stable LatentMoE 组成的模块;Attention Residuals 连接不同深度的表示。文字MoonViTEmbedding共享表示空间KDA线性工作记忆× 3Gated MLA压缩的全局注意力× 1下一个TokenStable LatentMoE896 → 16 expertsStable LatentMoE896 → 16 expertsAttention Residuals · 跨层选择FlashKDA · MoonEP · 1M RL · Prefix Cache · Fleet Scheduling

图 01 Kimi K3 架构的教学化简图。它强调 token、depth、channel 三个信息流维度,不代表逐算子实现;依据 K3 Technical Report Figure 2 与 §2 重绘。

K3 §2.1

KDA × Gated MLA:让一百万 Token 既高效流动,也保留全局精确交互

先用直觉说

三层 KDA 像持续更新的“工作记忆”,每四层插入一层全局 MLA,像定期把整本笔记摊开重看。

  • 3 个 KDA 层 + 1 个 Gated MLA 层为一组
  • 主干共 69 层 KDA、24 层 Gated MLA
  • KDA 线性扩展;MLA 周期性补足全局两两交互
SEQUENCE / TOKEN

KDA + Gated MLA

低成本持续状态与周期性全局回看分工,不要求单一 attention 同时擅长所有时间尺度。

DEPTH / LAYER

Block AttnRes

当前层不只接收统一 residual sum,而能选择早期 block 的表示。

WIDTH / CHANNEL

Stable LatentMoE

shared path 保留完整宽度,routed path 压到 latent space 后从 896 个专家选 16 个。

MODALITY / OBSERVATION

MoonViT-V2

视觉与文本从训练开始共享 backbone 与 NTP objective,使 screenshot 能成为 Agent 轨迹里的连续 observation。

KDAKDAKDAMLAB1
KDAKDAKDAMLAB2
KDAKDAKDAMLAB3
KDAKDAKDAMLAB4
KDAKDAKDAMLAB5
KDAKDAKDAMLAB6
… 69 KDA + 24 MLA · 最后一层全局 attention
不要把 2.5× 贴到其中一个方块上

报告把约 2.5× overall scaling efficiency 归因于 KDA、AttnRes、Stable LatentMoE、 训练 recipe 和数据的组合。它不是 KDA 单项消融,也不是线上推理 2.5×。

03 TABLE 1 / EXACT SPECIFICATION

从 K2 到 K3:每个数字改变的是哪一本账

FIELDKIMI K2KIMI K3HOW TO READ
Transformer layers6193+32
Total parameters1.04T2.78T容量约 2.67×
Activated parameters32.6B104.2B路径约 3.20×
Hidden dimension71687168主干不变
Routed latent dimension—3584主干的 0.5×
MoE expert hidden20483072专家内部更宽
Routed experts384896池更大
Activated routed816每 Token 多选
Shared experts12完整宽度公共路径
Attention heads6496+32
Dense layers11不变
Vocabulary160K160K不变
Context128K1M四阶段扩展
Attention61 MLA69 KDA + 24 MLA3:1 hybrid
ActivationSwiGLUSiTU-GLU有界乘积分支
MTP layers11后调为 draft
Vision encoder—401M / 27L / p14 / 12H从头联合训练

2.78T 是总容量,104.2B 是激活路径规模;部署仍需放置大量 expert weights, 推理仍需 attention、router、shared experts、dispatch/combine 与 kernel。把 active parameters 直接当成 dense 等价成本,会漏掉系统账。

04 KIMI DELTA ATTENTION

KDA 不保存每个历史配对,而是维护一份会遗忘、会纠错的工作记忆

标准 attention 让新 Query 直接查看许多历史 Key/Value;KDA 将历史压入固定形状矩阵状态 St∈Rdₖ×dᵥ。状态更便宜,但压缩也意味着它不是无损数据库。

REPORT EQ. 1 / SINGLE HEADSₜ = (I − βₜkₜkₜᵀ) Diag(αₜ) Sₜ₋₁ + βₜkₜvₜᵀõₜ = Sₜᵀqₜ

α∈(0,1)dₖ 逐 key channel 保留旧状态;β∈(0,1) 控制写入;Query 从更新后的 state 读取。

01

先遗忘

Diag(α) 让不同 key channel 有不同记忆时长。

02

再擦除旧预测

(I−βkkᵀ) 抑制当前 key 在旧 state 中已经对应的内容。

03

写入新 value

βkvᵀ 把新关联写入;等价直觉是只补预测误差。

04

按 Query 读取

Sᵀq 从固定状态返回 value-space 表示,再经 RMSNorm 与 full-rank gate。

为什么 chunkwise form 是工程关键

纯递归适合 decode,却会让训练沿序列串行。KDA 让 chunk 之间递归传 S, chunk 内把 inter-chunk 与 causal intra-chunk 两部分改写成矩阵乘。 于是训练/prefill 能吃到并行硬件,decode 仍只更新固定 state。

S[t]→
CHUNK tparallel Q/K/V + causal tile
→S[t+1]→
CHUNK t+1parallel inside / recurrent across

05 FIGURE 3 / LOWER-BOUNDED DECAY

一个看似细小的函数改动,为什么会改变 diagonal tile 能否上 Tensor Core

chunkwise 公式需要用累计 retention Γ 缩放 Key;因为 Γ 是许多 (0,1) 数的乘积,1/Γ 可能爆大。 Kimi Linear 用负 Softplus,log-decay 下界为 −∞;K3 改成 scaled sigmoid:

KIMI LINEARg = −exp(A) Softplus(z) ∈ (−∞, 0)
KIMI K3 / EQ. 5g = gmin Sigmoid(exp(A)z) ∈ (−5, 0)α = exp(g) ∈ (e⁻⁵, 1)
ONE STEPα > e⁻⁵ ≈ 6.7×10⁻³
× 16-token tile
CUMULATIVE LOGΣg > −80
take reciprocal
RESCALE1/Γ < e⁸⁰ ≈ 5.54×10³⁴

BF16 最大有限量级约 3.39×10³⁸,因此报告默认最坏 rescale 仍在动态范围内。 这让 diagonal 和 off-diagonal causal tiles 都可使用稠密 Tensor Core 矩阵乘, 消除显式 position-pair diagonal path。动态范围内不等于无舍入误差,二者要分开。

06 GATED MLA / GLOBAL LOOKBACK

工作记忆之外,K3 仍然周期性把全局历史摊开来看

固定状态擅长持续压缩,弱点是精确回看遥远 Token。K3 因而保留周期性 MLA: 每个历史 Token 的多头 K/V 先压成 latent ct,服务时缓存 latent,再恢复 attention 所需内容。 这条机制来自 DeepSeek‑V2,是 K3 与 DeepSeek 最明确的继承边。

KDA / RECURRENT

固定状态

成本随 decode step 近似固定;历史被压缩,位置与近因通过递归门控保留。

MLA / GLOBAL

随 Token 增长的 latent cache

仍做全局 token-to-token 内容交互;缓存比 MHA 小,但不固定。

HYBRID

3:1 分工

KDA 负责低成本连续混合,MLA 定期校正和全局检索,最后一层保证全局 attention。

NoPE 不是“没有位置”

K3 的 MLA Query/Key 不加显式位置编码;穿插的 KDA 提供位置敏感、近因敏感的序列混合。 MLA 因此专注全局内容匹配,也避免扩展到 1M 时调整 RoPE base 或 YaRN。 这是一种跨模块分工,不是证明纯 MLA 可以忽略顺序。

FP32 attention output 是独立的数值合同

报告为纠正 FlashAttention 中有偏舍入误差,在训练中保留 FP32 attention output。 它会把输出 tile 的片上 footprint 加倍,所以 kernel 改为与 KV staging buffers 重叠, 腾出更深 KV pipeline 的共享内存。算法精度和 tile 排布在这里直接耦合。

07 ATTENTION RESIDUALS

把 attention 从时间轴旋转到深度轴:当前层选择自己要读的早层

普通 residual 把所有历史层持续压进一个 hl;这很利于梯度传播,却也让早期表示统一累加。 AttnRes 把 embedding 与早层输出当成一组 depth sources。

REPORT EQ. 8–9 / FULL ATTNRESαᵢ→ₗ = exp(qₗᵀ RMSNorm(kᵢ)) / Σⱼ exp(qₗᵀ RMSNorm(kⱼ))hₗ = Σᵢ αᵢ→ₗvᵢ

qₗ 是 layer-specific learnable pseudo-query,不随当前 Token 内容改变;RMSNorm 防止大幅值来源垄断权重。

EMBEDb₀
12 LAYERSb1
12 LAYERSb2
12 LAYERSb3
12 LAYERSb4
12 LAYERSb5
12 LAYERSb6
12 LAYERSb7
12 LAYERSb8
→ final layer attends over 9 block-level sources

Full 版的 O(L²d) 算术在 L<100 时尚可,实际压力是所有层输出必须存活,以及 pipeline 跨 stage 通信。 Block 版在 12 层内部求 partial sum,跨 block 才做完整深度 attention: K3 有 8 个 layer blocks,加 embedding 共 9 个来源。报告 §7 芯片 nano 模型的 block size=2 只是案例配置,不能写回 2.78T 主模型。

证据边界

Attention Residuals 独立预印本在 48B-total / 3B-active、1.4T Token 等设置上做 scaling 与消融;K3 报告证明它进入了更大系统。 作为 2026 新方法,跨团队复现仍有限。

08 STABLE LATENTMOE

896 选 16 的真正难点,不只在稀疏 FLOPs,而在 payload、权重流和激活稳定

conventional MoE 把完整 d 维 Token 发给每个选中专家;激活专家数变多时, dispatch payload 与 expert-weight traffic 一起增长。LatentMoE 把公共与专业路径拆开:

FULL 7168Token x共享表示
↗
ALWAYS ON2 shared expertsfull-width common path
W↓3584 latentrouted payload
→
TOP-K896 choose 16sparsity 56
→
RMSNORM + W↑back to 7168combine with shared
REPORT EQ. 11 / ROUTED + SHAREDu = Σᵢ∈Tk(x) pᵢ Eᵢʳᵒᵘᵗᵉᵈ(W↓x)y = Σⱼ₌₁² Eⱼˢʰᵃʳᵉᵈ(x) + W↑ RMSNorm(u)

新增 RMSNorm 位于 routed aggregate 与 up-projection 之间,控制不同专家组合产生的尺度变化。

routed branch 接近四次连续矩阵乘,2.8T 规模与极端稀疏会放大内部 activation explosion。 Stable LatentMoE 不是一个技巧,而是三件事的组合:Normalized LatentMoE、SiTU‑GLU、Quantile Balancing。

进入 MoE 专题:比较 DeepSeekMoE、LatentMoE、QB 与系统通信 →

09 FIGURE 4–5 / ACTIVATION × ROUTING

SiTU 管数值幅值,QB 管专家负载;两者不能互相替代

SITU-GLU / EQ. 12

给两个乘积分支分别加 smooth cap

[β₁ tanh(Wg x/β₁) ⊙ Sigmoid(Wg x)] ⊙ [β₂ tanh(Wu x/β₂)]

报告用 β₁=4、β₂=25,标量切片满足 |f(x)|≤100;近原点保持近似线性与 SwiGLU 局部形状。

QUANTILE BALANCING / EQ. 14

一次 forward 估计每个 expert 的进入门槛

b̃ⱼ(t+1) ← −quantile₁₋ₖ/ₙ(s:,j − α(t))

Top-(k+1) 的最后一项给 token cutoff α;新 bias 下一 step 生效,最终 bias 冻结用于 inference。

QB 的 bias 进入 Top-k 选择,但从最终 mixture weight p 中移除,因此调 dispatch 而不直接改 mixture 权重。 全局 batch 的数百万 margin 不宜 gather,实际用每 expert histogram:各 rank 只 all-reduce bin counts, quantile 误差受 bin width 限制。

MODEL / QB谁被选中

router score、cutoff、quantile、bias。

RUNTIME / MOONEP怎样平衡执行

static shape、expert execution、zero-copy communication。

FLEET / ADMISSION谁先进入系统

按 request class 给资源预算,避免 1M burst 饿死短请求。

10 NATIVE VISION / FIGURE 6

关键纠正:K3 不是“冻结语言模型、接上视觉塔、再逐步解冻”

错误心智模型pretrained LLM + attached vision encoder

先做 post-hoc modality alignment,再逐步解冻。

≠
K3 REPORT §2.4 / §3.3vision + language jointly optimized from start

MoonViT‑V2 从头训练;视觉/文本 Token 交错在同一个 next-token prediction objective。

MoonViT‑V2 约 401M、27 层、patch 14、12 heads;使用 RMSNorm,linear/attention projections 无 bias。 图像和视频共享参数,以 spatial/temporal factorized attention 处理时空关系, temporal pooling 压视频长度,2×2 pixel shuffle 减少送入主干的视觉 Token,输入最高 3584×3584。

IMAGE / VIDEOdynamic resolution
→
MOONVIT-V2space × time factorized
→
POOL / SHUFFLEtemporal + 2×2 pixels
→
PROJECTORshared embedding
→
K3 BACKBONEone NTP stream
Figure 6 能支持到哪里

作者消融中,从头训练的 MoonViT‑V2 比 SigLIP 初始化的 MoonViT‑3D 有更低 gradient norm 与更少 spike, 并在其视觉评测中匹配 baseline。这是特定大规模联合训练配置的结果,不是“视觉预训练普遍无用”。

11 PRE-TRAINING DATA

数据不是一个总 Token 数,而是五个域、清洗、重写与采样实验共同组成的配方

WEB TEXT

网页正文与长文档

规则、质量分类、exact/fuzzy dedup;长文档单独清洗与上采样。

CODE

代码、仓库与可执行材料

不仅生成文本,还支撑 kernel、web、软件工程和 programmatic vision。

MATHEMATICS

数学推理与重写材料

K2 参与多风格、多视角 rephrasing,并做 fidelity verification。

KNOWLEDGE

知识密集语料

chunk-wise 自回归改写,尽量在扩展表达的同时保留事实。

VISION

caption / OCR / video / visual coding

图文交错、绝对与归一坐标、SVG/3D/Web/Game/CAD 等程序化视觉。

团队先用规则、质量分类器和去重筛数据,再用小模型 ablation 调不同 domain sampling。 Knowledge / Mathematics 使用 K2 生成多风格、多视角改写:长材料采用 chunk-wise 自回归生成, 最后做 fidelity verification。视觉坐标同时提供绝对值与 [0,1] 归一值, programmatic data 覆盖 SVG、3D、Webpage、Game、CAD。

报告没有公开的,网站不会补写

完整语料来源、精确域配比、总训练 Token、版权构成与完整过滤阈值均不足以独立复现;参数量不能填补这些空白。

进入数据专题:从去重、质量过滤到合成数据与污染审计 →

12 FIGURE 7 / SCALING & RECIPE

Scaling law 在 K3 中是实验导航器,不是“参数越大越好”的口号

团队在小规模模型上共同重调 batch size、learning rate、tokens per parameter 与 model shape, 并在 held-out OOD data 上比较候选。cosine 与 WSD 各自独立搜索最优超参, 作者设置中 cosine 最终 loss 更低。约 2.5× 的含义是:相对 K2, K3 的架构、数据与 recipe 组合在 compute–loss scaling 上更有效。

可以说同等 compute 下经验 loss 更低,或同等 loss 所需 compute 更少
不可以说推理快 2.5×
不可以说KDA 单独贡献 2.5×
不可以说所有下游分数提升 2.5×

完整训练 recipe 还有哪些角色

Per-Head Muon + K2 weight clipping;QB 负责 MoE load balance;cosine schedule、1% linear warmup、 weight decay=0.1。Per-Head 表示 Q/K/V 等多头矩阵按 head 分组应用 Muon, 不能把整体 scaling 收益单独归到 optimizer。

进入 Scaling 专题:读懂 loss、compute、数据与外推误差 →

13 FOUR-STAGE CONTEXT CURRICULUM

1M 不是配置文件里的一行数字,而是数据、算法和系统共同完成的四阶段课程

PRETRAIN / 018K

低成本建立基础能力。

→
PRETRAIN / 0264K

在预训练后段延长。

→
COOLDOWN / 03256K

集中投入昂贵长序列。

→
COOLDOWN / 041M

适应目标窗口。

自然长文档/视频要做 exact/fuzzy dedup、frame perceptual hashing、heuristic/classifier filtering 与 structural validation,并因稀缺而上采样。长度本身不训练跨远距离依赖,所以又把多模态文档/子任务 置换、拼接,要求答案依赖散落在整段 1M 中的证据。

窗口容量 ≠ 使用能力

一百万 Token 像允许把整间资料室搬进考场;能否跨文档找到证据、维持任务状态、在恰当时机压缩, 才是模型和 harness 是否真正会用它。

进入长上下文专题:比较 KDA、MLA、CSA/HCA 与 context management →

14 SFT COLD START

SFT 的任务不是教完所有能力,而是给长程 RL 一个可读、可调用工具的起点

K3 扩展前代 Kimi SFT pipeline,由 domain-specialized models 合成长 agent trajectory, 经多阶段验证与 human-in-the-loop annotation。所有复杂轨迹用 XTML 统一序列化, 使 reasoning、response、tool call 与动态工具边界保持一致。

PRIOR KIMI EXPERTStrajectory synthesis
→
VERIFYmulti-stage checks
→
HITLannotation
→
XTMLserialize channels
→
SFTcold-start policy + QAT

MXFP4 expert weights / MXFP8 expert activations 的 QAT 从 SFT 开始,而不是在全部 RL 完成后临时量化。

15 FIGURE 8 / NINE RL EXPERTS

三类领域 × 三种思考强度:九位老师,最后进入一个学生

DOMAIN × EFFORT
LOWHIGHMAXGENERAL TASKSreasoning · vision · searchknowledge · faithfulnessmax-budget generalGENERAL AGENTSassistantdeep researchlong-horizon agentCODING AGENTScoding experienceSWE · webkernel · hardest coding

Figure 8 中,随着 RL FLOPs 增长,多个公开/内部评测分数与平均 assistant steps 同时上升。 这支持作者在其训练过程里的 scaling 观察,但不能直接推出“任何任务多走几步都会更好”。

Reasoning effort 是每题预算,不是三个固定长度

PER-PROBLEM BUDGETif T(y) > τ · b₀(x), override task reward with −1

b₀(x) 由 cold-start model 估计;general task 主要计 thinking tokens, agentic task 计 reasoning trace、tool-call arguments 等累计输出。τ 按 domain 由人工指导退火。

16 PARTIAL ROLLOUT × MOPD

一个机制解决长尾等待,另一个解决九位老师怎样教同一个学生

Partial rollout:不等最慢轨迹

每轮 N 个 prompts、每题 K 条 completion,保持 N×K 条 active trajectories。 当 λN K 条完成就暂停 generation,先进行 policy optimization;未完成轨迹进队列, 下一轮优先恢复。好处是减少 straggler,代价是同一长轨迹跨多个 iteration, 数据变 stale/off-policy;报告用 per-token regularization 把更新限制在局部邻域。

MOPD:学生走自己的 prefix,老师在那个位置给 dense reward

REPORT EQ. 15 / TOKEN REWARDrᵈₒₚd(yₜ|e,x,y<t) = clip(sg log[πteacherᵈ,ᵉ(yₜ|x,y<t) / πθ(yₜ|e,x,y<t)], −Rmax, Rmax)

domain d 与 effort e 选择对应 teacher;stop-gradient 防 teacher ratio 被学生优化反向改变。

STUDENTgenerate current prefix
→
SELECTdomain d × effort e
→
TEACHERscore next-token distribution
→
DENSE REWARDclipped log-ratio
→
ONE MODELconsolidated policy

九个 expert models 是训练老师,不是推理时投票。on-policy 的意义是教师覆盖学生真正访问的 prefix, 避免只模仿固定离线答案;它仍受 teacher 质量、domain mapping 与 compute 约束。

进入推理专题:比较 GRPO、R1、effort control 与蒸馏 →

17 DEPLOYMENT-AWARE POST-TRAINING

部署精度和 speculative acceptance 在训练中就成为目标

ROUTED EXPERT WEIGHTSMXFP4

占大多数参数内存。

EXPERT ACTIVATIONSMXFP8

rollout 与 training 同方案。

NON-EXPERThigher precision

attention、latent projections、shared experts、router。

LIFECYCLESFT + RL

全 post-training QAT,减少 train–inference mismatch。

预训练 MTP 层结构与 EAGLE‑3 的单 decoder draft 相近,因此冻结 target model, 只调 draft layer 和 feature-fusion projection。输入融合第 1、第 4、最后 AttnRes blocks 的低/中/高层特征, 训练展开 7 steps,逼近真实 recurrent drafting。

REPORT EQ. 16 / LK LOSSLᴸᴷ = −log Σₓ∈V min(p(x), q(x))

p/q 是 target/draft next-token distribution;直接优化无损 speculative sampling 的接受率,而不是只用 KL surrogate。

18 UNIFIED WHITE-BOX RL ENVIRONMENT

Agent harness 被拆成可组合模块,避免模型只会一种工具口音

固定 harness 会让模型过拟合 tool schema、system prompt、context management 与 interaction protocol。 K3 把 harness 表示为配置化模块集合,训练时按 task group 动态组合, 可实例化 Kimi Code、Claude Code、Codex、OpenClaw、Hermes 等风格或全新组合。

01TOOLS
02SYSTEM PROMPT
03CONTEXT
04SKILLS
05MEMORY
06SUBAGENTS
07PROTOCOL
08VERIFIER
评测时也要记住这件事

代码/Agent 分数是 model × harness × environment × verifier 的系统结果。模型名不是完整实验条件。

19 FIGURE 9–10 / TASKS & ENVIRONMENTS

可靠 Agent 的学习单位,是状态、动作与独立验证组成的一整段轨迹

01

Verifiable search & professional work

多步搜索、投行、法律、数据分析与办公交付物;证据和最终产物都能检查。

02

Vision reasoning

在隔离 Python 环境裁剪、放大、计算,再把新图像作为 observation 回到同一轨迹。

03

GPU kernel

先过数值正确性,再比较专家实现和硬件 roofline,同时检测缓存/降精度作弊。

04

Long-term assistant

Gmail、Notion、Slack 等 mock app 跨多日演进,单任务可含数千次工具调用。

05

Autonomous Execution

只给初始状态、目标、约束、工具和 verifier,不给参考轨迹;奖励最终环境状态。

06

Web development

容器内构建网页、游戏、3D 与可视化,由功能、结构/像素和模型检查共同评分。

Knowledge-graph-guided task synthesis

CONCEPT GRAPH细粒度关键词与层级
→
MATERIAL论文 · 博客 · 代码仓库
→
TASK TYPEknowledge · coding · vision
→
VERIFY规则 / 测试 / 独立 judge

Autonomous Execution Tasks

AET 只给初始环境、目标、约束、工具和 verifier,不提供 reference trajectory。 public verifier 给诊断,hidden verifier 检查保留场景,并限制提交预算降低 reward hacking。 奖励落在独立读取的环境结果,而不是 Agent 自己说“完成了”。

进入 Agent 专题:完整拆解 white-box harness、AET 与 verifier →

20 PRE-TRAINING INFRASTRUCTURE

从算子到 pipeline:先问每种 state 放在哪里、什么时候移动

PRETRAIN

参数 / optimizer / activation / KDA state / vision tokens

FlashKDA · KCP · MoonEP · pipeline/offload

AGENTIC RL

policy / reference / KV / trajectory / sandbox / files

partial rollout · throttling · AgentENV

SERVING ENGINE

KDA recurrent state / MLA KV / prefix hash

unified page pool · sparse checkpoints · COW

DEVICE

projected replay input / AttnRes block / expert weights

fused KDA · SP · WarpDecode-like kernel

FLEET

session affinity / request-class budget

primary+secondary hash · budget admission

FlashKDA 与 KDA Context Parallelism

bounded decay 让全部 causal tiles 使用 dense Tensor Core path; KCP 则沿 sequence dimension 分片 1M Token。不同 sequence regime 需要不同 fused kernel, 算法公式、secondary tile 与设备内存共同决定实现。

多模态 pipeline 不是均匀 decoder stack

vision encoder 的计算形状和 decoder 不同,会制造 pipeline bubble。 §5.2 / Figure 11 的重点是重新安排 encoder、pipeline 与 offload,让参数/activation 的放置不把 3T 训练拖成等待链。 报告没有公开完整 GPU 数和总训练成本,页面不从示意图反推。

21 MOONEP / EXPERT PARALLEL

模型路由“尽量均衡”以后,系统还要把不规则 Token 变成可执行的静态形状

MoE 的理论 FLOPs 不包含 all-to-all、专家权重读取、padding 与慢 expert 长尾。 MoonEP 追求 balanced expert execution,以 static computation shape 与 zero-copy communication 处理 dispatch/combine,并让通信与 shared-expert 等计算重叠。

ROUTERtoken → expert IDs
→
DISPATCHzero-copy communication
→
STATIC SHAPEbalanced execution
→
COMBINEoverlap communication
三种“平衡”必须分开

QB 让 router 负载接近目标;MoonEP 让设备执行可预测;fleet admission 让不同请求类不互相饿死。

22 LONG-HORIZON RL STATE

一条轨迹跨多个训练 step 时,语言上下文和外部世界都必须能够暂停与恢复

重新生成已经调用数百次工具、积累几十万 Token 的轨迹极其浪费。K3 将 KV retention 外置, partial rollout 可暂停/续接;AgentENV 用 Firecracker microVM 保存代码、文件、应用与系统状态。

PAUSE / RESUME等待 inference 时释放 CPU / memory

报告称等待可占 sandbox 生命周期 98%。

FORK从完全相同状态分叉

可让 reward judge 检查而不污染原环境。

SNAPSHOT定期恢复点

错误后不必从任务最初重来。

INCREMENTAL只保存 dirty pages

报告最低 checkpoint / resume 133ms / 49ms。

SANDBOXES51,219,741
IMAGES1,505,678
MEMORY OVERCOMMITup to 6.5×

均为 K3 报告的训练/评测基础设施数字,本站未独立复跑。

23 FIGURE 12 / KDA-AWARE PREFIX CACHE

MLA KV 随 Token 增长,KDA state 固定却很大;一个 prefix 只有两者同时恢复才可复用

分开 manager 会重复 allocation、eviction、transfer。K3 把 KDA states 与 MLA KV 放进同字节大小的统一 page pool, 共享 allocation、reference counting、eviction;KDA 各 head byte stream 连续,跨 prefill/decode 不同 TP 时在 transfer path re-layout。

PHYSICAL BLOCK / 6144 TOKENS12 × 512-token hash blocks
1512○
21024○
31536○
42048○
52560● KDA
63072○
73584○
84096○
94608○
105120○
115632○
126144○

Figure 12 示例:请求匹配到 2800,最长 joint hit 在 B=2560;复用五个 MLA hash blocks 与该处 KDA checkpoint。

为什么 hash granularity 与 physical allocation 要解耦

KDA checkpoint 大,只能稀疏保存;若把 hash 也绑到 1024–6144 的物理块,短请求几乎无法命中, chunked prefill 也要等完整块。K3 允许 512-token hash endpoint 落在粗 physical block 内, KDA checkpoint 只存可查询 endpoint 的稀疏子集。

并发一致性还需要三条约束

  1. 所有 cache group 分配前先 pin 全部 hit blocks,避免一个 group 的 COW 驱逐另一个刚命中的块;
  2. 当前 scheduling step 新分配/注册的块在 GPU copy 落地前不可匹配;
  3. 一个 KDA group checkpoint 被驱逐时,siblings 原子失效:要么每组都有,要么全部不可命中。

24 DEVICE KERNELS × FLEET SCHEDULING

服务端的目标从“平均快”变成:状态正确、单 Token 低延迟、长短请求互不拖垮

KDA DECODE

缓存 projected inputs,不缓存每个 draft state

speculative rejection 后 state 难回滚;重新在片上 replay accepted prefix,再写 verified/bonus states。

BLOCK ATTNRES

prefill 用 SP,decode 用 side stream + fusion

避免每个 TP rank 复制 block representations;inter-block overlap,intra-block merge/RMSNorm fusion。

LATENTMOE

融合 down-projection/router 与通信

latent weight 分片,output all-gather 进 GEMM epilogue;小 batch routed experts 用 token-centric kernel。

FLEET

cache affinity + budget admission

session 绑定 primary/secondary clusters;长请求只消耗自己的 class budget,不饿死短请求。

为什么 prefix affinity 如此重要

报告给出 typical coding input:400K prefix、只增加 4K。cache hit 可避免重做整个 prefill; 而生产请求从 <2K 到 1M,单请求成本跨约三个数量级,按“平均请求”规划会失效。

进入推理系统专题:KV、prefix cache、speculative 与调度 →

25 FIGURE 1 & 13 / TABLE 2–5

先读协议,再读分数:K3 报告自己的总体结论比单榜截图更克制

报告结论是:K3 在其套件中领先被比较的其他开放与部分闭源模型, 但整体仍落后 Claude Fable 5 与 GPT‑5.6 Sol。任何单项第一都不能覆盖这句总体判断。

REASONING & KNOWLEDGEGPQA · HLE · AA-LCR · CritPt
CODINGDeepSWE · Terminal-Bench · SciCode · FrontierSWE
AGENTICBrowseComp · DeepSearchQA · OSWorld · Office · SaaS
VISIONWorldVQA · OmniDoc · Video-MME · MMMU-Pro · Math-Vision
01

Reasoning effort

K3 主结果多用 max;比较模型尽量用 max/xhigh。成本与延迟不相等。

02

Harness

代码/Agent 结果携带 Codex、Kimi Code、Claude Code 等脚手架。

03

Tool augmentation

HLE、视觉数学等有/无工具必须分列,不可把工具增强写成纯模型能力。

04

Fallback / guard

闭源 fallback、拒答或 cyber guard 会改变特定任务结果。

05

Date / service

模型、价格和服务行为会变,第三方比较必须附评测日期。

06

Cost / output

Figure 13 同时画 score 与 token/cost,能力不该脱离预算阅读。

BROWSECOMP / CONTEXT MANAGEMENT300K + compression: 91.2 vs full 1M without management: 90.4

这是报告设置里的工程信号:更大窗口不自动消灭 context management,适时压缩可能更有效。

局限必须与亮点同页

报告与外部材料还提示 research reasoning、cyber 等能力边界;新架构缺少广泛第三方复现,完整训练数据、集群与成本未披露。

26 §7 CASE STUDIES

案例展示“Agent 能走多远”,但每个数字都必须带着硬件、时间和任务边界

KERNEL / 24H PER TASK

AttnRes 283.6 → 114.4 ms

报告还给出 DSA/KDA reductions 55.1%/73.6%,MLA 超过一半 peak;均为作者个案。

MINITRITON / L20

从 compiler 到 distributed stack

模型构建 tensor library、autograd、compiler 与 distributed;roofline 结果只限报告硬件/任务。

CHIP / 48H

nano-kpu 与 RTL simulation

nano model 同型但 AttnRes block size=2;4mm²、100MHz、>8700 tok/s 等不是主模型推理规格。

KNOWLEDGE / RESEARCH / VIDEO

长程交付物与视觉闭环

展示工具、证据、迭代与产物;属于作者选择的 case study,不是平均成功率。

案例的正确用途

用来研究 trajectory、工具与 verifier 怎样协作;不能用一个成功案例推断所有真实任务的可靠性。

27 APPENDIX F / XTML

消息格式不是装饰:它决定选项放在哪里、哪些 prefix 可以复用、工具何时动态出现

GLOBAL OPTIONShistory 之前

tool declarations · reasoning effort

[open]
HISTORYmessages + channels

think · response · tools

[sep]
ONE-SHOT OPTIONShistory 之后

避免破坏已有 KV prefix

[close]
NEW INPUTdynamic tools

会话中可加入 input options

[end_of_msg]

XTML 用 `[open]`、`[sep]`、`[close]`、`[end_of_msg]` 标消息边界; think / response / tools 分 channel;thinking / instruct 由 prefix 选择。 global options 放历史前,one-shot options 放历史后,是为了既传控制又保留 KV cache。

28 EIGHT INTERACTIVE WORKBENCHES

现在动手:从标量递推一路算到混合 prefix cache

八张实验台各自声明“精确计算”和“教学模型”的边界。 重点不是玩滑条,而是看哪个量发生变化、哪个结论仍然不能推出。

INTERACTIVE / EIGHT REPORT WORKBENCHES

把八个容易误读的机制,拆成可以动手验算的对象

数学输出按页面公式实时计算;风险、通信与吞吐标签只是显式 toy model。 本实验没有复跑 K3 checkpoint、FlashKDA kernel、MoonEP 集群或线上 cache。

WORKBENCH 01 / DELTA RULE

同一个 key 反复出现时,累加和纠错写入会走向完全不同的 state

为便于看懂,这里把矩阵 state 压成“当前 key 对应的标量预测”。真实 KDA 是每个 head 的矩阵状态。

NAIVE ADDITIVEs ← s + βv
3.00

每次都继续追加;重复 key 会把同一 value 越写越大。

DELTA UPDATEs ← s + β(v − s)
0.98

只写“目标与旧预测的差”;在这个 toy key 上逐步逼近目标。

ADDITIVE ERROR2.00

|state − target|

DELTA ERROR0.02

|state − target|

REAL KDAmatrix state

S ∈ Rdₖ×dᵥ,另有 α 与 key geometry

精确标量递推 / 教学降维

这个实验只解释“纠错写入”直觉,不证明固定状态能无损回忆任意历史。

29 OPEN ARTIFACT FORENSICS

从“报告说了什么”走到“公开 checkpoint 实际长什么样”

第三轮固定到官方 Hugging Face revision,读取 config、remote code、60 MB tensor index、 四个 safetensors headers 和两个小范围参数切片。原始权重不进入本站仓库; 结构、shape、计数、参数统计、隔离 wheel 与 RTX 5090 执行结果都可以从公开脚本重复生成。

O / OBSERVED1.4196 TiB tensor data

96 shards、497,220 entries;不是运行显存,也不是参数量口径。

D / CLOSED LOOP69 KDA · 24 MLA · 92 MoE

配置、tensor names 与 header shape 三方闭合。

X / RTX 5090exact 6/6 · max error 0

官方 torch reference;fixed BF16 mean 2.6210 ms。

U / MAIN UNRESOLVEDA_log [128] ≠ expected [96]

main 未修;#144 改成 128,#150 验零后裁成 96,两个社区 PR 都未合并。

ROUND 03 / OPEN ARTIFACT FORENSICS

不加载 1.56 TB,也能从 config、tensor header 与小范围权重读出真实结构

HF revision 9f62e4e9f · FlashKDA 1ce47ea3b。 原始权重不进仓库;真实观测、推导、执行、合成探针与未决矛盾分别标记。

O / CONFIG → EXECUTION STRIP

拖动一层:同时看 attention、FFN 与 AttnRes block

层号按人类阅读使用 1–93;公开 Python 实现内部使用 0-based index。L92 与 L93 连续两个 MLA 是真实配置。

KDA · 69MLA · 24AttnRes source · 8
LAYER01

首层 dense;后续 92 层进入 MoE。

SEQUENCE MIXERKDA

96 heads × 128 dims · recurrent state

WIDTH MIXERDENSE

33792 intermediate · BF16

DEPTH SOURCEB1 · OPEN

这一层把 prefix sum 写入 block-level source。

O / exact public config

条带不代表每层 FLOPs 相同;KDA、MLA、dense 与 896→16 MoE 的状态和执行代价不同。

OOFFICIAL ARTIFACT

官方 config、code、index、header 或参数字节直接观测。

DDERIVATION

由公开 shape 与计数做确定性算术。

XEXECUTED

本站机器实际执行并留下环境与结果。

SSYNTHETIC

真实权重加合成输入;只测试边界,不代表真实 token。

UUNRESOLVED

工件之间存在不一致,当前不擅自补解释。

30 REDUCED ATTENTION RESIDUALS STUDY

真实 K3 权重还不能诚实 forward;先把一个可证伪的 AttnRes 问题完整做完

checkpoint 的 A_log [128] 与 main 代码期望的 96 heads 仍没有官方转换合同; 社区 #144 / #150 提出相反修复,均未合并。本轮不把候选 patch 冒充 K3 官方 forward,而是预注册一个从零训练的缩小实验: 相同 16-block Transformer、相同数据窗口与相同初始化,只改变 residual source 的读取拓扑。

F / FROZEN3 structures × 3 seeds

9 格各 2,000 steps;每格 16,384,000 target bytes。

X / OBSERVEDFull −0.01457 BPC

三个 paired seed 同为负,达到预注册 −0.010 判据。

X / OBSERVEDBlock −0.04247 BPC

同样满足本 reduced protocol 内的方向支持规则。

B / BOUNDARYgradient CV 未复现

Baseline 0.3447;Full 0.5087;Block 0.6306。

ROUND 04 / REDUCED INDEPENDENT MECHANISM PROBE

不裁剪 K3 的冲突权重:从零训练一个可以完整审计的深度路由实验

WikiText-2 byte LM · 16 blocks / 32 residual sublayers · 3 structures × 3 seeds。 这是缩小机制探针,不是 K3 checkpoint forward,也不是论文规模复现。

FORMAL GRID3 × 3

9 个 2,000-step runs

TARGET BYTES147.456M

每格 16,384,000

SHARED CORE9.542M

同 seed 公共初始化 exact

FULL Δ BPC−0.01457

3 / 3 paired negative

BLOCK Δ BPC−0.04247

3 / 3 paired negative

FRESH REPLAY8 / 8 exact

timing 明确不要求 exact

I / PREREGISTERED PRIMARY ENDPOINT

先看三条完整曲线,再放大最后一个配对点

BPC 越低越好。主判据只读 step 2000:三个 seed 必须同方向,且 mean paired delta 至少达到 −0.010;中途曲线不用于改终点。

VALIDATION BPC0 → 2,000 TRAINING STEPS
234680500100015002000
BaselineFull AttnResBlock AttnRes
STEP 2000 / SELECTED VIEW
Baseline1.99913
Full AttnRes1.98457
Block AttnRes1.95667

三 seed 均值;正式判据使用逐 seed paired delta,不把三次运行当成 benchmark 样本总体。

SEED 01BASE 2.00054
FULL − BASE−0.01600
BLOCK − BASE−0.05266
SEED 02BASE 1.99844
FULL − BASE−0.01321
BLOCK − BASE−0.04135
SEED 03BASE 1.99842
FULL − BASE−0.01450
BLOCK − BASE−0.03339
FROZEN RULE3 / 3 + |MEAN| ≥ .010
DIRECTIONAL SUPPORT

只在这个 reduced protocol 内;不是总体显著性,也不外推 paper scale。

31 GRADIENT DEFINITION × DEPTH SCALE

“论文说梯度更均匀”,和上一轮参数梯度反结果,测的是同一件事吗?

第五轮先审计 Attention Residuals 官方论文与仓库:Figure 5(c) 没有公开 gradient tensor、 norm、reduction、diagnostic batch、AMP / clipping 时点或统计代码。本站因此冻结一个可复现的 post-MLP output activation-gradient 定义,把深度扩到 16 / 32 blocks、预算扩到 8,000 steps, 再用三 seed 检查“首尾平衡”和“全层离散度”是否真的同方向。

F / FROZEN12 × 8,000 steps

786,432,000 formal target bytes;两深度、两结构、三 seed。

X / OBSERVEDfirst/last 6 / 6 改善

depth-16 平均 61.0%;depth-32 平均 72.0%。

X / COUNTEREVIDENCECV 6 / 6 恶化

局部尖峰让 depth-16 / 32 平均相对恶化 10.3% / 60.0%。

R / REPLAYmodel + optimizer exact

指定 32-layer Block 格从零重训 8,000 steps,冻结字段逐项一致。

ROUND 05 / GRADIENT DEFINITION × DEPTH SCALE

“早层不再过大”与“整条谱更均匀”不是同一件事

16 / 32 Transformer blocks · Baseline / Block · 3 seeds · 8,000 steps。 被测对象是 post-MLP output activation gradient,不冒充论文未公开的 Figure 5 实现。

FORMAL GRID2 × 2 × 3

12 个独立训练格

TARGET BYTES786.432M

每格 65,536,000

DEPTH16 → 32

宽度固定 192

CV6 / 6 更差

中后段局部尖峰

FIRST ↔ LAST6 / 6 更近

失衡改善 56%–81%

FULL REPLAYexact

model + optimizer state

I / DEFINITION AUDIT

论文画出一条“梯度曲线”,却没有给出足以唯一重算的测量合同

Figure 5(c) 只写 “Each transformer block’s gradient magnitude”。 官方仓库没有训练代码、checkpoint、统计脚本或原始数组。

OFFICIAL / KNOWN
图与文字能确认
  • 横轴是 Transformer block index。
  • Figure 5(b) 同时画 block output magnitude。
  • 正文说 Baseline 早层梯度过大,Block 更均匀。
  • 最终模型约 27 blocks / 54 residual layers。
OFFICIAL / UNDERDEFINED
无法从公开工件唯一恢复
  • activation、branch 还是 parameter gradient?
  • L2、RMS、mean absolute 还是别的 norm?
  • batch / token / channel 怎样 reduction?
  • 哪个 checkpoint、AMP / clip 前还是后?
FIXED INPUT16 × 256 bytes

同一 diagnostic tensor

→
POST-MLP OUTPUTh₁ … hL

每个 Transformer block 一个

→
TOKEN-MEAN CEℒ

FP32 cross entropy

→
MEASURERMS(∂ℒ/∂hl)

B × T × C 联合 RMS

ROUND 04∇θlℒ

核心参数梯度:权重收到多大更新信号。

≠
ROUND 05∂ℒ/∂hl

activation gradient:损失对这一深度表示有多敏感。

两种对象都公开;新指标不会覆盖上一轮反结果。

能说

“这是与 Figure 5 叙述对齐的一种公开 operationalization。”

不能说

“论文作者就是这样算的,或本站复画了 Figure 5(c)。”

32 SPIKE TRAJECTORY × BACKWARD PATH

layer 21–25 的尖峰从什么时候出现,又对 mixer 的哪条反向路径敏感?

第六轮不把上一轮的局部尖峰直接解释成机制。本站预注册六个训练时点、六个张量位置、 四种 confirmatory reduction 与三种 same-forward backward rule;正式训练严格复用 Round 05 depth-32 Block 的模型、数据、optimizer 与 schedule,诊断全部位于 optimizer 之外。 结果显示尖峰在 step 500 后才形成、六个位置均可见;切断 softmax / query / key 源梯度没有降低尖峰, 而把全局 learned value-backward coefficients 改成均匀后,contrast 平均下降 70.2%。

F / FROZEN3 formal + 1 replay

196,608,000 formal target bytes;完整重放再加 65,536,000。

X / DEVELOPMENTstep 500 → 2,000

三 seed 的尖峰 contrast 从 0.524× 跃到平均 2.233×。

X / ROBUSTNESS12 / 12 PASS

四种预注册 reduction 都保留 layer 21–25 集中。

B / BOUNDARYglobal sensitivity

不是训练变体、因果贡献百分比或局部 mixer 归因。

ROUND 06 / SPIKE TRAJECTORY × BACKWARD PATH

尖峰不是出生时就有;它在训练中形成,并对 value 路径敏感

固定 Round 05 的 depth-32 Block 训练格,只在 optimizer 之外增加诊断。 3 个正式 seed、1 个完整重放;所有前向值完全相同,只改变同一次反向传播的局部导数规则。

FORMAL TARGET BYTES196.608M

3 × 8,000 steps

FULL REPLAYexact

16 组冻结字段

VISIBLE POSITIONS6 / 6

每个位置 3 / 3 seed

REDUCTIONS12 / 12

预注册家族内稳健

KEY / SOFTMAX PATH−2.0%

移除后反而略升

VALUE COEFFICIENTS−70.2%

平均 contrast 降幅

I / DEVELOPMENT

先问“训练到什么时候出现”,再问“由哪条路径放大”

尖峰集合 S 固定为 layer 21–25。纵轴 contrast = S 内均值 ÷ 其余层均值: 1 表示没有集中,越大表示梯度越集中在这五层。

SPIKE CONTRAST · S / REST3-SEED MEAN
post-MLP activation-gradient预注册可见阈值 1.5
STEP 00.757×

三 seed 均低于 1;layer 21–25 并不特殊。

→
STEP 5000.524×

学习已经发生,但尖峰尚未出现。

→
STEP 2,0002.233×

峰值层同时迁移到 layer 21,结构开始显形。

→
STEP 8,0002.754×

seed 3 只有 1.881×:方向一致,强度并不整齐。

通俗读法

这不像一个由初始化直接写死的“坏层”;它更像训练动力学与 Block mixer 共同塑出的深度模式。

33 LOCAL MIXER PATH × BIDIRECTIONAL GATE

全局 value-route 很敏感;能不能把它诚实地缩到 group 6 / 7?

第七轮先冻结 14 种 same-forward mask:在 learned 背景只把固定 scope 改成 uniform, 测 sufficiency;再从 all-uniform 背景只恢复同一 scope 的 detached-learned coefficients, 测 restoration。groups 6+7 的 16 个 depth mixers 在 sufficiency 的两个指标、三个 seed 全部复现至少一半 global log gap;但 restoration 只在 contrast 通过,peak 三 seed 均低于 50%。 因而主结论不是“定位成功”,而是强单侧证据与未闭合的双向 localization。

F / FROZEN14 masks · 65 visits

每次 forward 审计 exact identity set、顺序、唯一性与 census。

X / SUFFICIENCY6 / 6 PASS

groups 6+7 mean S:contrast .677;peak 1.700。

X / RESTORATION3 / 6 FAIL

contrast mean .650;peak 仅 .380,三 seed 均未过 .50。

B / VERDICTone-sided evidence

双向 localization 未建立;group 7 MLP 只作次级 sufficiency 发现。

ROUND 07 / LOCAL MIXER PATHS

把“全局敏感”缩到 16 个 mixer:为什么单侧很强,双向门仍然不让过?

同一 forward · 14 个冻结 mask · 3 seeds · sufficiency × restoration · 完整 replay

REDUCED-MODEL DIAGNOSTIC
TOPOLOGY64 + 1

depth mixers + output

MATRIX14 modes

exact selector sets

GLOBAL GAP6 / 6

two metrics × three seeds

SUFFICIENCY6 / 6

Groups 6+7 ≥ 50%

RESTORATION3 / 6

contrast pass · peak fail

LOCALIZATIONNOT ESTABLISHED

one-sided evidence

I / FIXED TOPOLOGY

先画清 65 个 intervention nodes,再谈“局部”

layer 21–25 是 Round 05 看过数据后冻结的 spike set;Round 07 预先选择完整 group 6 / 7。group 7 还包含 S 外的 layers 26–28,所以不是事后只挑尖峰层。

GROUP 1L1–4
1234
8 MIXERS
GROUP 2L5–8
5678
8 MIXERS
GROUP 3L9–12
9101112
8 MIXERS
GROUP 4L13–16
13141516
8 MIXERS
GROUP 5L17–20
17181920
8 MIXERS
GROUP 6L21–24
21222324
8 MIXERS
GROUP 7L25–28
25262728
8 MIXERS
GROUP 8L29–32
29303132
8 MIXERS
→
OUTPUT#65

9 sources

预注册局部 scope:groups 6+7 / 16 mixers固定 spike set:layers 21–25其他 49 mixers
A / SUFFICIENCY
其他 49:learned+G6+7:uniform
Sₓ = ln(Xref / Xm) ÷ Gₓ

只改这 16 个,能否复现全局下降的一半?

⇄
B / RESTORATION
其他 49:uniform+G6+7:learned
Rₓ = ln(Xr / Xall) ÷ Gₓ

只恢复这 16 个,能否把全局 gap 恢复一半?

为什么要两个方向?

mixer 路径非线性交互。一个 scope 在 learned 背景“足够强”,不代表它在 uniform 背景“恢复得回来”。

34 TRAIN-TIME FORWARD INTERVENTION

诊断期的局部敏感性进入完整训练后,尖峰指标还会衰减吗?

第八轮不再只改 diagnostic backward,而是让 group 6 / 7 的 parameter-free uniform mixer 进入每一次 train、eval 与 diagnostic forward。四个变体各跑三个 8,000-step seed,并把同 seed 的 Round 05 learned run 锁为历史配对 reference; 主变体 groups 6+7 的 contrast 与 peak 六格降幅全部超过 20%,同时 BPC 质量门 4 / 4 通过,指定 seed 的完整重训 scientific payload exact。

F / FROZEN12 formal + 1 replay

851,968,000 个新 target bytes;每格 65,536,000。

X / ATTENUATION6 / 6 PASS

contrast drop 62.1%–77.3%;peak drop 32.3%–62.0%。

X / QUALITY4 / 4 PASS

三 seed ΔBPC 最大 +0.00960;均值 +0.00658。

B / BOUNDARYreduced protocol only

训练期架构消融;不是 K3 checkpoint 或 Figure 5(c) 复现。

ROUND 08 / TRAIN-TIME FORWARD

不再只改 diagnostic backward:让局部 uniform routing 真正进入 8,000-step 训练

4 variants × 3 seeds · 1 historical paired reference · 1 full replay · frozen analyzer

REDUCED-MODEL ARCHITECTURE ABLATION
NEW BYTES851.968M

12 formal + 1 replay

PRIMARY CELLS6 / 6

contrast + peak

QUALITY4 / 4

BPC degradation screen

REPLAYEXACT

scientific payload

SELECTED PARAMSUNREACHABLE

0 hooks · 0 optimizer state

STATUSPASS

reduced protocol only

I / WHAT ACTUALLY CHANGED

这是训练期架构消融,不是“只改变 forward”的纯因果实验

选中 mixer 每一次 train / eval / diagnostic 都改成参数无关的均匀读取;新的表示自然改变 backward 与后续更新。

LEARNED DEPTH MIXERkeys = RMSNorm(sources)w = softmax(query · keys)output = Σ wᵢ · sourceᵢ
→
SELECTED UNIFORM MIXERlogits = zeros(N, B, T)w = softmax(logits) = 1 / Noutput = Σ sourceᵢ / N
GROUP 1L1–4
1234
LEARNED
GROUP 2L5–8
5678
LEARNED
GROUP 3L9–12
9101112
LEARNED
GROUP 4L13–16
13141516
LEARNED
GROUP 5L17–20
17181920
LEARNED
GROUP 6L21–24
21222324
#40–47
GROUP 7L25–28
25262728
#48–55
GROUP 8L29–32
29303132
LEARNED
SECONDARYGROUP 6 · UNIFORM FORWARD
CONTRAST
+56.1%
PEAK
+32.9%
STATUS
PASS
SECONDARYGROUP 7 · UNIFORM FORWARD
CONTRAST
+53.6%
PEAK
+37.5%
STATUS
PASS
PRIMARYGROUPS 6+7 · UNIFORM FORWARD
CONTRAST
+71.0%
PEAK
+49.9%
STATUS
PASS
SECONDARYGROUP 7 MLP · UNIFORM FORWARD
CONTRAST
+51.3%
PEAK
+34.6%
STATUS
PASS
SELECTED QUERY / KEY NORM留在 AdamW param groups

保持 optimizer 结构与 reference 一致。

×
COMPUTATION GRAPH没有被 forward 调用

不是 stop-gradient;参数结构性不可达。

→
FINAL AUDIT0 hook · 0 state · byte-exact init

不能写成“训练了但没有移动”。

35 FIGURE & TABLE AUDIT

Figure 1–16、Table 1–5:每张图究竟支持什么,不能支持什么

F01Figure 1

主结果

四能力轴必须与总体仍落后 Claude Fable 5 / GPT-5.6 Sol 的结论同屏。

F02Figure 2

完整架构

把视觉入口、3:1 hybrid stack、Block AttnRes 与 Stable LatentMoE 分成不同信息流。

F03Figure 3

Bounded decay

展示下界、累计倒数与 BF16 风险,不承诺任意配置绝对稳定。

F04Figure 4

SiTU-GLU

对比 GLU / SwiGLU / SiTU 的函数形状,不从曲线直接推训练 loss。

F05Figure 5

Quantile Balancing

Top-(k+1) cutoff → global quantile → expert bias → next step。

F06Figure 6

原生视觉

只在作者消融配置内说明 from-scratch MoonViT-V2 梯度更平稳。

F07Figure 7

Scaling law

约 2.5× 是相对 K2 的整体 scaling efficiency,不是 inference speedup。

F08Figure 8

RL scaling

RL FLOPs、平均 steps 与能力共同增长;相关性不自动成为跨域因果律。

F09Figure 9

任务合成

知识图谱 → 材料检索 → knowledge/coding/vision task → verification。

F10Figure 10

AET

初始状态、动作、独立 verifier 与 curriculum,奖励落在环境结果。

F11Figure 11

训练系统

画状态的放置与移动,不补写报告未公开的总集群规模。

F12Figure 12

Prefix cache

6144 physical / 512 hash / sparse KDA checkpoint 是报告示例。

F13Figure 13

分数与成本

score 与 output token / cost 同图,并保留比较协议。

F14Figure 14

Kernel agent

283.6→114.4 ms 等数字限定在作者 24h/task 个案。

F15Figure 15

MiniTriton

L20 实测点对 roofline;不推广到其他硬件和工作负载。

F16Figure 16

XTML

global / one-shot / input options、channel 和 message boundary 分层。

T01Table 1

K2 → K3

精确逐字段规格,hero 的 2.8T / 104B 只作易读四舍五入。

T02Table 2

Reasoning / Coding

把 effort、harness、tool 与 fallback 变成表头的一部分。

T03Table 3

Agentic

分数是 model × harness × environment × verifier 的系统结果。

T04Table 4

Vision

有/无 Python tool 必须分列。

T05Table 5

第三方 / 成本

价格点只描述当时服务条件,不作为架构因果证据。

RREPORT

作者直接陈述或报告数字。

PPRIMARY

原论文、官方代码或 benchmark。

DDERIVATION

由公开公式确定性计算。

TTOY

帮助理解方向,不是实测。

↳ ONE HUNDRED PRIMARY NODES

不要一次读完:沿着正在困惑的那条机制往回走

这 100 个节点经过标题、年份、作用与 URL 核对;优先采用论文原页、官方仓库与 benchmark 官方入口。 它们不是“引用越多越好”,而是把 K3 放回 attention、MoE、数值、RL、系统与评测的历史脉络。