00 THIRTY-TWO QUESTION LEDGERS
先把三十二个对象拆开,才不会把“规模、效率、能力”揉成一句话
技术报告最容易制造一种错觉:看完所有术语,却没有建立可追问的对象。 下面每张账只回答一个问题,同时写出答案不能被扩张到哪里。
2.78T / 104.2B 各表示什么?
total 是总容量,active 是一条 Token 路径经过的参数规模;二者都不等于端到端 FLOPs。
约 2.5× 究竟是什么?
它是架构、数据与 recipe 共同形成的相对 K2 scaling efficiency,不是推理速度或 KDA 单项收益。
3 KDA + 1 MLA 如何落到 93 层?
Table 1 给出 69 KDA + 24 MLA,最后一层也是 MLA;另有一层 dense。
KDA 保存了什么?
它维护固定形状 recurrent state,而不是所有历史 Token 的两两配对。
Delta Rule 为什么不是简单累加?
先减掉 state 对当前 key 的已有预测,再写真实 value 与预测的差。
gmin = −5 在解决什么?
它限制 chunk 内累计衰减倒数,令关键 tile 可落在 BF16 Tensor Core 范围。
递归状态如何训练并行?
chunk 间传状态,chunk 内改写成并行矩阵乘;decode 仍逐步更新固定状态。
KDA / MLA 的 output gate 是 router 吗?
不是;它按输入控制 attention 读出通道,MoE router 则选择专家。
NoPE 是否意味着没有顺序?
没有显式位置 embedding;KDA 的门控与衰减隐式传递顺序,MLA 负责全局内容匹配。
为什么 attention output 保留 FP32?
报告用它修正 FlashAttention 有偏舍入,并为片上 tile buffer 重新排布。
AttnRes 怎样改变 residual?
每层用 pseudo-query 选择早层来源;Block 版用块内累加换取更低内存与跨 stage 通信。
12 层一块还是 2 层一块?
K3 主模型为 12;§7 芯片 nano case 的 2 不能写回主规格。
LatentMoE 为什么先压到 3584?
shared path 保留 7168,routed path 在较窄空间执行,以降低多专家激活的 payload 与权重流。
896、16、2 怎样读?
896 routed 中每 Token 选 16,另有 2 shared;稀疏不等于消费级硬件轻松运行。
SiTU-GLU 在稳定什么?
它限制 routed path 大正输入的幅值,同时近似 SwiGLU 在原点附近的形状。
Quantile Balancing 怎样更新 bias?
用 Top-(k+1) score cutoff 的全局分位量做下一步更新;最终 bias 冻结用于推理。
QB 与 MoonEP 是同一件事吗?
QB 调模型路由偏置;MoonEP 调系统执行与通信形状;二者互补但不能合并。
视觉塔是否后接到预训练 LLM?
不是。MoonViT-V2 从头训练,视觉与文本从训练开始就在同一 NTP objective 联合优化。
图像和视频怎样进入主干?
401M / 27 层编码器共享图像视频参数,经时空分解、pooling、pixel shuffle 与 projector 进入主干。
Per-Head Muon 为什么按 head 分组?
多头投影按相对独立的 head 组织矩阵更新;它只是完整训练 recipe 的一部分。
我们知道和不知道哪些语料事实?
知道四类文本、视觉种类与清洗/重写流程;不知道完整来源、精确配比和总训练 Token。
1M 是怎样训练出来的?
pretrain 8K→64K,cooldown 256K→1M,并配长数据清洗、上采样和跨全局证据的合成任务。
Agent 轨迹从哪里来?
前代 Kimi 专家合成,经多阶段验证与 HITL 标注,再用 XTML 序列化;SFT 起即做 QAT。
3 × 3 专家是否在线投票?
不是。它们是三领域 × 三 effort 的训练策略,最终经 MOPD 整合进一个学生。
low / high / max 如何定义?
每题从 cold-start 估计 b₀(x),按 domain 退火 τ;超过 τb₀ 的轨迹 reward 改为 −1。
Partial rollout 暂停了什么?
N×K 轨迹中 λ 比例完成就更新,未完轨迹下轮优先恢复;代价是 stale/off-policy。
MOPD 为什么是 on-policy?
学生生成自己会访问的 prefix,匹配的 teacher 在该 prefix 上给 clipped token log-ratio reward。
量化与 speculative draft 何时进入?
SFT/RL 全程 experts MXFP4/activations MXFP8 QAT;MTP 后调为 EAGLE-3 draft 并优化 LK loss。
Agent 能力属于模型还是脚手架?
系统结果来自模型与 tool、prompt、context、skills、memory、subagent、verifier 的组合。
训练、RL、服务分别搬运什么?
参数/优化器、KDA/MLA 序列状态、KV/轨迹、sandbox 与 prefix 的寿命完全不同。
KDA state 与 MLA KV 怎样共同命中?
统一页池;细 hash boundary 与粗 physical block 解耦,命中点必须两类 cache 同时有效。
一个分数至少需要哪些脚注?
effort、tool、harness、fallback/guard、日期;报告也明确总体仍落后最强闭源模型。
先认状态→找到瓶颈→看机制怎样改写状态→核对系统代价→最后读评测
01 REPORT MAP
47 页不是一条直线:先知道每章在回答哪一层问题
四条扩展轴与总体结论
KDA、AttnRes、Stable LatentMoE、MoonViT、Muon
数据、scaling law、联合训练、1M curriculum
SFT、9 experts、partial rollout、MOPD、QAT、环境
FlashKDA/KCP、MoonEP、RL 系统、AgentENV、serving
四能力轴、第三方结果、成本与协议
kernel、MiniTriton、chip、research、knowledge、video
开放权重与剩余差距
KDA/AttnRes 细节、评测补充、XTML
§2 并不独立于 §5:KDA 的 recurrent state 决定 context parallelism 与 prefix cache; 极稀疏 LatentMoE 决定 expert communication;长 Agent 轨迹又决定 partial rollout 与可恢复 sandbox。 架构、训练、系统是同一条状态链的不同截面。
02 THREE-DIMENSIONAL INFORMATION FLOW
K3 的统一设计语言:Token、Layer、Channel 三个方向的信息流
图 01 Kimi K3 架构的教学化简图。它强调 token、depth、channel 三个信息流维度,不代表逐算子实现;依据 K3 Technical Report Figure 2 与 §2 重绘。
KDA × Gated MLA:让一百万 Token 既高效流动,也保留全局精确交互
三层 KDA 像持续更新的“工作记忆”,每四层插入一层全局 MLA,像定期把整本笔记摊开重看。
- 3 个 KDA 层 + 1 个 Gated MLA 层为一组
- 主干共 69 层 KDA、24 层 Gated MLA
- KDA 线性扩展;MLA 周期性补足全局两两交互
Attention Residuals:每一层不只接住上一步,而是有选择地回看更早层
普通残差像接力棒,只能拿到累加后的结果;AttnRes 更像档案索引,可以挑选哪一层的中间表示最有用。
- 学习 pseudo-query,计算跨层注意力权重
- 覆盖 embedding、当前 block 与先前 block
- 目标是改善 93 层网络中的信息与梯度流
Stable LatentMoE:896 位专家里,每个 Token 只请 16 位
模型把“知识容量”和“本次计算量”拆开:专家库很大,但每次只激活最匹配的一小组。
- 2.8T 总参数,约 104B 激活参数
- 896 个 routed experts,另有 2 个 shared experts
- Normalized LatentMoE、SiTU-GLU、Quantile Balancing 稳住极稀疏路由
MoonViT-V2:图像不是外部 OCR 结果,而是进入同一主干的视觉 Token
视觉编码器先把图像压成一串向量,再由轻量投影器把它们放进和文字相同的表示空间。
- 401M 参数视觉编码器
- 训练中联合文本、图像与视频数据
- 支持视觉反馈闭环:看截图、改代码、再次验证
算法—系统协同:模型结构必须能在真实集群上被训练、强化学习和服务
一个公式只有在 GPU 内核、跨卡通信、显存和调度上都跑得通,才真正成为 2.8T 模型的一部分。
- FlashKDA 与 KDA Context Parallelism
- MoonEP 的平衡专家并行与零拷贝通信
- 长上下文 RL 的外置 KV Cache、可恢复 microVM 沙箱与部分 rollout
KDA + Gated MLA
低成本持续状态与周期性全局回看分工,不要求单一 attention 同时擅长所有时间尺度。
Block AttnRes
当前层不只接收统一 residual sum,而能选择早期 block 的表示。
Stable LatentMoE
shared path 保留完整宽度,routed path 压到 latent space 后从 896 个专家选 16 个。
MoonViT-V2
视觉与文本从训练开始共享 backbone 与 NTP objective,使 screenshot 能成为 Agent 轨迹里的连续 observation。
报告把约 2.5× overall scaling efficiency 归因于 KDA、AttnRes、Stable LatentMoE、 训练 recipe 和数据的组合。它不是 KDA 单项消融,也不是线上推理 2.5×。
03 TABLE 1 / EXACT SPECIFICATION
从 K2 到 K3:每个数字改变的是哪一本账
| FIELD | KIMI K2 | KIMI K3 | HOW TO READ |
|---|---|---|---|
| Transformer layers | 61 | 93 | +32 |
| Total parameters | 1.04T | 2.78T | 容量约 2.67× |
| Activated parameters | 32.6B | 104.2B | 路径约 3.20× |
| Hidden dimension | 7168 | 7168 | 主干不变 |
| Routed latent dimension | — | 3584 | 主干的 0.5× |
| MoE expert hidden | 2048 | 3072 | 专家内部更宽 |
| Routed experts | 384 | 896 | 池更大 |
| Activated routed | 8 | 16 | 每 Token 多选 |
| Shared experts | 1 | 2 | 完整宽度公共路径 |
| Attention heads | 64 | 96 | +32 |
| Dense layers | 1 | 1 | 不变 |
| Vocabulary | 160K | 160K | 不变 |
| Context | 128K | 1M | 四阶段扩展 |
| Attention | 61 MLA | 69 KDA + 24 MLA | 3:1 hybrid |
| Activation | SwiGLU | SiTU-GLU | 有界乘积分支 |
| MTP layers | 1 | 1 | 后调为 draft |
| Vision encoder | — | 401M / 27L / p14 / 12H | 从头联合训练 |
2.78T 是总容量,104.2B 是激活路径规模;部署仍需放置大量 expert weights, 推理仍需 attention、router、shared experts、dispatch/combine 与 kernel。把 active parameters 直接当成 dense 等价成本,会漏掉系统账。
04 KIMI DELTA ATTENTION
KDA 不保存每个历史配对,而是维护一份会遗忘、会纠错的工作记忆
标准 attention 让新 Query 直接查看许多历史 Key/Value;KDA 将历史压入固定形状矩阵状态 St∈Rdₖ×dᵥ。状态更便宜,但压缩也意味着它不是无损数据库。
Sₜ = (I − βₜkₜkₜᵀ) Diag(αₜ) Sₜ₋₁ + βₜkₜvₜᵀõₜ = Sₜᵀqₜα∈(0,1)dₖ 逐 key channel 保留旧状态;β∈(0,1) 控制写入;Query 从更新后的 state 读取。
先遗忘
Diag(α) 让不同 key channel 有不同记忆时长。
再擦除旧预测
(I−βkkᵀ) 抑制当前 key 在旧 state 中已经对应的内容。
写入新 value
βkvᵀ 把新关联写入;等价直觉是只补预测误差。
按 Query 读取
Sᵀq 从固定状态返回 value-space 表示,再经 RMSNorm 与 full-rank gate。
为什么 chunkwise form 是工程关键
纯递归适合 decode,却会让训练沿序列串行。KDA 让 chunk 之间递归传 S, chunk 内把 inter-chunk 与 causal intra-chunk 两部分改写成矩阵乘。 于是训练/prefill 能吃到并行硬件,decode 仍只更新固定 state。
继续读:Kimi Linear 给出 KDA 前身与完整 UT transform;FlashKDA 是官方 kernel 入口。
05 FIGURE 3 / LOWER-BOUNDED DECAY
一个看似细小的函数改动,为什么会改变 diagonal tile 能否上 Tensor Core
chunkwise 公式需要用累计 retention Γ 缩放 Key;因为 Γ 是许多 (0,1) 数的乘积,1/Γ 可能爆大。 Kimi Linear 用负 Softplus,log-decay 下界为 −∞;K3 改成 scaled sigmoid:
g = −exp(A) Softplus(z) ∈ (−∞, 0)g = gmin Sigmoid(exp(A)z) ∈ (−5, 0)α = exp(g) ∈ (e⁻⁵, 1)BF16 最大有限量级约 3.39×10³⁸,因此报告默认最坏 rescale 仍在动态范围内。 这让 diagonal 和 off-diagonal causal tiles 都可使用稠密 Tensor Core 矩阵乘, 消除显式 position-pair diagonal path。动态范围内不等于无舍入误差,二者要分开。
06 GATED MLA / GLOBAL LOOKBACK
工作记忆之外,K3 仍然周期性把全局历史摊开来看
固定状态擅长持续压缩,弱点是精确回看遥远 Token。K3 因而保留周期性 MLA: 每个历史 Token 的多头 K/V 先压成 latent ct,服务时缓存 latent,再恢复 attention 所需内容。 这条机制来自 DeepSeek‑V2,是 K3 与 DeepSeek 最明确的继承边。
固定状态
成本随 decode step 近似固定;历史被压缩,位置与近因通过递归门控保留。
随 Token 增长的 latent cache
仍做全局 token-to-token 内容交互;缓存比 MHA 小,但不固定。
3:1 分工
KDA 负责低成本连续混合,MLA 定期校正和全局检索,最后一层保证全局 attention。
NoPE 不是“没有位置”
K3 的 MLA Query/Key 不加显式位置编码;穿插的 KDA 提供位置敏感、近因敏感的序列混合。 MLA 因此专注全局内容匹配,也避免扩展到 1M 时调整 RoPE base 或 YaRN。 这是一种跨模块分工,不是证明纯 MLA 可以忽略顺序。
FP32 attention output 是独立的数值合同
报告为纠正 FlashAttention 中有偏舍入误差,在训练中保留 FP32 attention output。 它会把输出 tile 的片上 footprint 加倍,所以 kernel 改为与 KV staging buffers 重叠, 腾出更深 KV pipeline 的共享内存。算法精度和 tile 排布在这里直接耦合。
07 ATTENTION RESIDUALS
把 attention 从时间轴旋转到深度轴:当前层选择自己要读的早层
普通 residual 把所有历史层持续压进一个 hl;这很利于梯度传播,却也让早期表示统一累加。 AttnRes 把 embedding 与早层输出当成一组 depth sources。
αᵢ→ₗ = exp(qₗᵀ RMSNorm(kᵢ)) / Σⱼ exp(qₗᵀ RMSNorm(kⱼ))hₗ = Σᵢ αᵢ→ₗvᵢqₗ 是 layer-specific learnable pseudo-query,不随当前 Token 内容改变;RMSNorm 防止大幅值来源垄断权重。
Full 版的 O(L²d) 算术在 L<100 时尚可,实际压力是所有层输出必须存活,以及 pipeline 跨 stage 通信。 Block 版在 12 层内部求 partial sum,跨 block 才做完整深度 attention: K3 有 8 个 layer blocks,加 embedding 共 9 个来源。报告 §7 芯片 nano 模型的 block size=2 只是案例配置,不能写回 2.78T 主模型。
Attention Residuals 独立预印本在 48B-total / 3B-active、1.4T Token 等设置上做 scaling 与消融;K3 报告证明它进入了更大系统。 作为 2026 新方法,跨团队复现仍有限。
08 STABLE LATENTMOE
896 选 16 的真正难点,不只在稀疏 FLOPs,而在 payload、权重流和激活稳定
conventional MoE 把完整 d 维 Token 发给每个选中专家;激活专家数变多时, dispatch payload 与 expert-weight traffic 一起增长。LatentMoE 把公共与专业路径拆开:
u = Σᵢ∈Tk(x) pᵢ Eᵢʳᵒᵘᵗᵉᵈ(W↓x)y = Σⱼ₌₁² Eⱼˢʰᵃʳᵉᵈ(x) + W↑ RMSNorm(u)新增 RMSNorm 位于 routed aggregate 与 up-projection 之间,控制不同专家组合产生的尺度变化。
routed branch 接近四次连续矩阵乘,2.8T 规模与极端稀疏会放大内部 activation explosion。 Stable LatentMoE 不是一个技巧,而是三件事的组合:Normalized LatentMoE、SiTU‑GLU、Quantile Balancing。
进入 MoE 专题:比较 DeepSeekMoE、LatentMoE、QB 与系统通信 →09 FIGURE 4–5 / ACTIVATION × ROUTING
SiTU 管数值幅值,QB 管专家负载;两者不能互相替代
给两个乘积分支分别加 smooth cap
[β₁ tanh(Wg x/β₁) ⊙ Sigmoid(Wg x)] ⊙ [β₂ tanh(Wu x/β₂)]报告用 β₁=4、β₂=25,标量切片满足 |f(x)|≤100;近原点保持近似线性与 SwiGLU 局部形状。
一次 forward 估计每个 expert 的进入门槛
b̃ⱼ(t+1) ← −quantile₁₋ₖ/ₙ(s:,j − α(t))Top-(k+1) 的最后一项给 token cutoff α;新 bias 下一 step 生效,最终 bias 冻结用于 inference。
QB 的 bias 进入 Top-k 选择,但从最终 mixture weight p 中移除,因此调 dispatch 而不直接改 mixture 权重。 全局 batch 的数百万 margin 不宜 gather,实际用每 expert histogram:各 rank 只 all-reduce bin counts, quantile 误差受 bin width 限制。
router score、cutoff、quantile、bias。
static shape、expert execution、zero-copy communication。
按 request class 给资源预算,避免 1M burst 饿死短请求。
10 NATIVE VISION / FIGURE 6
关键纠正:K3 不是“冻结语言模型、接上视觉塔、再逐步解冻”
先做 post-hoc modality alignment,再逐步解冻。
MoonViT‑V2 从头训练;视觉/文本 Token 交错在同一个 next-token prediction objective。
MoonViT‑V2 约 401M、27 层、patch 14、12 heads;使用 RMSNorm,linear/attention projections 无 bias。 图像和视频共享参数,以 spatial/temporal factorized attention 处理时空关系, temporal pooling 压视频长度,2×2 pixel shuffle 减少送入主干的视觉 Token,输入最高 3584×3584。
作者消融中,从头训练的 MoonViT‑V2 比 SigLIP 初始化的 MoonViT‑3D 有更低 gradient norm 与更少 spike, 并在其视觉评测中匹配 baseline。这是特定大规模联合训练配置的结果,不是“视觉预训练普遍无用”。
11 PRE-TRAINING DATA
数据不是一个总 Token 数,而是五个域、清洗、重写与采样实验共同组成的配方
网页正文与长文档
规则、质量分类、exact/fuzzy dedup;长文档单独清洗与上采样。
代码、仓库与可执行材料
不仅生成文本,还支撑 kernel、web、软件工程和 programmatic vision。
数学推理与重写材料
K2 参与多风格、多视角 rephrasing,并做 fidelity verification。
知识密集语料
chunk-wise 自回归改写,尽量在扩展表达的同时保留事实。
caption / OCR / video / visual coding
图文交错、绝对与归一坐标、SVG/3D/Web/Game/CAD 等程序化视觉。
团队先用规则、质量分类器和去重筛数据,再用小模型 ablation 调不同 domain sampling。 Knowledge / Mathematics 使用 K2 生成多风格、多视角改写:长材料采用 chunk-wise 自回归生成, 最后做 fidelity verification。视觉坐标同时提供绝对值与 [0,1] 归一值, programmatic data 覆盖 SVG、3D、Webpage、Game、CAD。
完整语料来源、精确域配比、总训练 Token、版权构成与完整过滤阈值均不足以独立复现;参数量不能填补这些空白。
12 FIGURE 7 / SCALING & RECIPE
Scaling law 在 K3 中是实验导航器,不是“参数越大越好”的口号
团队在小规模模型上共同重调 batch size、learning rate、tokens per parameter 与 model shape, 并在 held-out OOD data 上比较候选。cosine 与 WSD 各自独立搜索最优超参, 作者设置中 cosine 最终 loss 更低。约 2.5× 的含义是:相对 K2, K3 的架构、数据与 recipe 组合在 compute–loss scaling 上更有效。
完整训练 recipe 还有哪些角色
Per-Head Muon + K2 weight clipping;QB 负责 MoE load balance;cosine schedule、1% linear warmup、 weight decay=0.1。Per-Head 表示 Q/K/V 等多头矩阵按 head 分组应用 Muon, 不能把整体 scaling 收益单独归到 optimizer。
进入 Scaling 专题:读懂 loss、compute、数据与外推误差 →13 FOUR-STAGE CONTEXT CURRICULUM
1M 不是配置文件里的一行数字,而是数据、算法和系统共同完成的四阶段课程
低成本建立基础能力。
在预训练后段延长。
集中投入昂贵长序列。
适应目标窗口。
自然长文档/视频要做 exact/fuzzy dedup、frame perceptual hashing、heuristic/classifier filtering 与 structural validation,并因稀缺而上采样。长度本身不训练跨远距离依赖,所以又把多模态文档/子任务 置换、拼接,要求答案依赖散落在整段 1M 中的证据。
一百万 Token 像允许把整间资料室搬进考场;能否跨文档找到证据、维持任务状态、在恰当时机压缩, 才是模型和 harness 是否真正会用它。
14 SFT COLD START
SFT 的任务不是教完所有能力,而是给长程 RL 一个可读、可调用工具的起点
K3 扩展前代 Kimi SFT pipeline,由 domain-specialized models 合成长 agent trajectory, 经多阶段验证与 human-in-the-loop annotation。所有复杂轨迹用 XTML 统一序列化, 使 reasoning、response、tool call 与动态工具边界保持一致。
MXFP4 expert weights / MXFP8 expert activations 的 QAT 从 SFT 开始,而不是在全部 RL 完成后临时量化。
15 FIGURE 8 / NINE RL EXPERTS
三类领域 × 三种思考强度:九位老师,最后进入一个学生
Figure 8 中,随着 RL FLOPs 增长,多个公开/内部评测分数与平均 assistant steps 同时上升。 这支持作者在其训练过程里的 scaling 观察,但不能直接推出“任何任务多走几步都会更好”。
Reasoning effort 是每题预算,不是三个固定长度
if T(y) > τ · b₀(x), override task reward with −1b₀(x) 由 cold-start model 估计;general task 主要计 thinking tokens, agentic task 计 reasoning trace、tool-call arguments 等累计输出。τ 按 domain 由人工指导退火。
16 PARTIAL ROLLOUT × MOPD
一个机制解决长尾等待,另一个解决九位老师怎样教同一个学生
Partial rollout:不等最慢轨迹
每轮 N 个 prompts、每题 K 条 completion,保持 N×K 条 active trajectories。 当 λN K 条完成就暂停 generation,先进行 policy optimization;未完成轨迹进队列, 下一轮优先恢复。好处是减少 straggler,代价是同一长轨迹跨多个 iteration, 数据变 stale/off-policy;报告用 per-token regularization 把更新限制在局部邻域。
MOPD:学生走自己的 prefix,老师在那个位置给 dense reward
rᵈₒₚd(yₜ|e,x,y<t) = clip(sg log[πteacherᵈ,ᵉ(yₜ|x,y<t) / πθ(yₜ|e,x,y<t)], −Rmax, Rmax)domain d 与 effort e 选择对应 teacher;stop-gradient 防 teacher ratio 被学生优化反向改变。
九个 expert models 是训练老师,不是推理时投票。on-policy 的意义是教师覆盖学生真正访问的 prefix, 避免只模仿固定离线答案;它仍受 teacher 质量、domain mapping 与 compute 约束。
进入推理专题:比较 GRPO、R1、effort control 与蒸馏 →17 DEPLOYMENT-AWARE POST-TRAINING
部署精度和 speculative acceptance 在训练中就成为目标
占大多数参数内存。
rollout 与 training 同方案。
attention、latent projections、shared experts、router。
全 post-training QAT,减少 train–inference mismatch。
预训练 MTP 层结构与 EAGLE‑3 的单 decoder draft 相近,因此冻结 target model, 只调 draft layer 和 feature-fusion projection。输入融合第 1、第 4、最后 AttnRes blocks 的低/中/高层特征, 训练展开 7 steps,逼近真实 recurrent drafting。
Lᴸᴷ = −log Σₓ∈V min(p(x), q(x))p/q 是 target/draft next-token distribution;直接优化无损 speculative sampling 的接受率,而不是只用 KL surrogate。
18 UNIFIED WHITE-BOX RL ENVIRONMENT
Agent harness 被拆成可组合模块,避免模型只会一种工具口音
固定 harness 会让模型过拟合 tool schema、system prompt、context management 与 interaction protocol。 K3 把 harness 表示为配置化模块集合,训练时按 task group 动态组合, 可实例化 Kimi Code、Claude Code、Codex、OpenClaw、Hermes 等风格或全新组合。
代码/Agent 分数是 model × harness × environment × verifier 的系统结果。模型名不是完整实验条件。
19 FIGURE 9–10 / TASKS & ENVIRONMENTS
可靠 Agent 的学习单位,是状态、动作与独立验证组成的一整段轨迹
Verifiable search & professional work
多步搜索、投行、法律、数据分析与办公交付物;证据和最终产物都能检查。
Vision reasoning
在隔离 Python 环境裁剪、放大、计算,再把新图像作为 observation 回到同一轨迹。
GPU kernel
先过数值正确性,再比较专家实现和硬件 roofline,同时检测缓存/降精度作弊。
Long-term assistant
Gmail、Notion、Slack 等 mock app 跨多日演进,单任务可含数千次工具调用。
Autonomous Execution
只给初始状态、目标、约束、工具和 verifier,不给参考轨迹;奖励最终环境状态。
Web development
容器内构建网页、游戏、3D 与可视化,由功能、结构/像素和模型检查共同评分。
Knowledge-graph-guided task synthesis
Autonomous Execution Tasks
AET 只给初始环境、目标、约束、工具和 verifier,不提供 reference trajectory。 public verifier 给诊断,hidden verifier 检查保留场景,并限制提交预算降低 reward hacking。 奖励落在独立读取的环境结果,而不是 Agent 自己说“完成了”。
进入 Agent 专题:完整拆解 white-box harness、AET 与 verifier →20 PRE-TRAINING INFRASTRUCTURE
从算子到 pipeline:先问每种 state 放在哪里、什么时候移动
参数 / optimizer / activation / KDA state / vision tokens
FlashKDA · KCP · MoonEP · pipeline/offload
policy / reference / KV / trajectory / sandbox / files
partial rollout · throttling · AgentENV
KDA recurrent state / MLA KV / prefix hash
unified page pool · sparse checkpoints · COW
projected replay input / AttnRes block / expert weights
fused KDA · SP · WarpDecode-like kernel
session affinity / request-class budget
primary+secondary hash · budget admission
FlashKDA 与 KDA Context Parallelism
bounded decay 让全部 causal tiles 使用 dense Tensor Core path; KCP 则沿 sequence dimension 分片 1M Token。不同 sequence regime 需要不同 fused kernel, 算法公式、secondary tile 与设备内存共同决定实现。
多模态 pipeline 不是均匀 decoder stack
vision encoder 的计算形状和 decoder 不同,会制造 pipeline bubble。 §5.2 / Figure 11 的重点是重新安排 encoder、pipeline 与 offload,让参数/activation 的放置不把 3T 训练拖成等待链。 报告没有公开完整 GPU 数和总训练成本,页面不从示意图反推。
21 MOONEP / EXPERT PARALLEL
模型路由“尽量均衡”以后,系统还要把不规则 Token 变成可执行的静态形状
MoE 的理论 FLOPs 不包含 all-to-all、专家权重读取、padding 与慢 expert 长尾。 MoonEP 追求 balanced expert execution,以 static computation shape 与 zero-copy communication 处理 dispatch/combine,并让通信与 shared-expert 等计算重叠。
QB 让 router 负载接近目标;MoonEP 让设备执行可预测;fleet admission 让不同请求类不互相饿死。
22 LONG-HORIZON RL STATE
一条轨迹跨多个训练 step 时,语言上下文和外部世界都必须能够暂停与恢复
重新生成已经调用数百次工具、积累几十万 Token 的轨迹极其浪费。K3 将 KV retention 外置, partial rollout 可暂停/续接;AgentENV 用 Firecracker microVM 保存代码、文件、应用与系统状态。
报告称等待可占 sandbox 生命周期 98%。
可让 reward judge 检查而不污染原环境。
错误后不必从任务最初重来。
报告最低 checkpoint / resume 133ms / 49ms。
均为 K3 报告的训练/评测基础设施数字,本站未独立复跑。
23 FIGURE 12 / KDA-AWARE PREFIX CACHE
MLA KV 随 Token 增长,KDA state 固定却很大;一个 prefix 只有两者同时恢复才可复用
分开 manager 会重复 allocation、eviction、transfer。K3 把 KDA states 与 MLA KV 放进同字节大小的统一 page pool, 共享 allocation、reference counting、eviction;KDA 各 head byte stream 连续,跨 prefill/decode 不同 TP 时在 transfer path re-layout。
Figure 12 示例:请求匹配到 2800,最长 joint hit 在 B=2560;复用五个 MLA hash blocks 与该处 KDA checkpoint。
为什么 hash granularity 与 physical allocation 要解耦
KDA checkpoint 大,只能稀疏保存;若把 hash 也绑到 1024–6144 的物理块,短请求几乎无法命中, chunked prefill 也要等完整块。K3 允许 512-token hash endpoint 落在粗 physical block 内, KDA checkpoint 只存可查询 endpoint 的稀疏子集。
并发一致性还需要三条约束
- 所有 cache group 分配前先 pin 全部 hit blocks,避免一个 group 的 COW 驱逐另一个刚命中的块;
- 当前 scheduling step 新分配/注册的块在 GPU copy 落地前不可匹配;
- 一个 KDA group checkpoint 被驱逐时,siblings 原子失效:要么每组都有,要么全部不可命中。
24 DEVICE KERNELS × FLEET SCHEDULING
服务端的目标从“平均快”变成:状态正确、单 Token 低延迟、长短请求互不拖垮
缓存 projected inputs,不缓存每个 draft state
speculative rejection 后 state 难回滚;重新在片上 replay accepted prefix,再写 verified/bonus states。
prefill 用 SP,decode 用 side stream + fusion
避免每个 TP rank 复制 block representations;inter-block overlap,intra-block merge/RMSNorm fusion。
融合 down-projection/router 与通信
latent weight 分片,output all-gather 进 GEMM epilogue;小 batch routed experts 用 token-centric kernel。
cache affinity + budget admission
session 绑定 primary/secondary clusters;长请求只消耗自己的 class budget,不饿死短请求。
报告给出 typical coding input:400K prefix、只增加 4K。cache hit 可避免重做整个 prefill; 而生产请求从 <2K 到 1M,单请求成本跨约三个数量级,按“平均请求”规划会失效。
25 FIGURE 1 & 13 / TABLE 2–5
先读协议,再读分数:K3 报告自己的总体结论比单榜截图更克制
报告结论是:K3 在其套件中领先被比较的其他开放与部分闭源模型, 但整体仍落后 Claude Fable 5 与 GPT‑5.6 Sol。任何单项第一都不能覆盖这句总体判断。
Reasoning effort
K3 主结果多用 max;比较模型尽量用 max/xhigh。成本与延迟不相等。
Harness
代码/Agent 结果携带 Codex、Kimi Code、Claude Code 等脚手架。
Tool augmentation
HLE、视觉数学等有/无工具必须分列,不可把工具增强写成纯模型能力。
Fallback / guard
闭源 fallback、拒答或 cyber guard 会改变特定任务结果。
Date / service
模型、价格和服务行为会变,第三方比较必须附评测日期。
Cost / output
Figure 13 同时画 score 与 token/cost,能力不该脱离预算阅读。
这是报告设置里的工程信号:更大窗口不自动消灭 context management,适时压缩可能更有效。
报告与外部材料还提示 research reasoning、cyber 等能力边界;新架构缺少广泛第三方复现,完整训练数据、集群与成本未披露。
26 §7 CASE STUDIES
案例展示“Agent 能走多远”,但每个数字都必须带着硬件、时间和任务边界
AttnRes 283.6 → 114.4 ms
报告还给出 DSA/KDA reductions 55.1%/73.6%,MLA 超过一半 peak;均为作者个案。
从 compiler 到 distributed stack
模型构建 tensor library、autograd、compiler 与 distributed;roofline 结果只限报告硬件/任务。
nano-kpu 与 RTL simulation
nano model 同型但 AttnRes block size=2;4mm²、100MHz、>8700 tok/s 等不是主模型推理规格。
长程交付物与视觉闭环
展示工具、证据、迭代与产物;属于作者选择的 case study,不是平均成功率。
用来研究 trajectory、工具与 verifier 怎样协作;不能用一个成功案例推断所有真实任务的可靠性。
27 APPENDIX F / XTML
消息格式不是装饰:它决定选项放在哪里、哪些 prefix 可以复用、工具何时动态出现
tool declarations · reasoning effort
think · response · tools
避免破坏已有 KV prefix
会话中可加入 input options
XTML 用 `[open]`、`[sep]`、`[close]`、`[end_of_msg]` 标消息边界; think / response / tools 分 channel;thinking / instruct 由 prefix 选择。 global options 放历史前,one-shot options 放历史后,是为了既传控制又保留 KV cache。
28 EIGHT INTERACTIVE WORKBENCHES
现在动手:从标量递推一路算到混合 prefix cache
八张实验台各自声明“精确计算”和“教学模型”的边界。 重点不是玩滑条,而是看哪个量发生变化、哪个结论仍然不能推出。
INTERACTIVE / EIGHT REPORT WORKBENCHES
把八个容易误读的机制,拆成可以动手验算的对象
数学输出按页面公式实时计算;风险、通信与吞吐标签只是显式 toy model。 本实验没有复跑 K3 checkpoint、FlashKDA kernel、MoonEP 集群或线上 cache。
同一个 key 反复出现时,累加和纠错写入会走向完全不同的 state
为便于看懂,这里把矩阵 state 压成“当前 key 对应的标量预测”。真实 KDA 是每个 head 的矩阵状态。
s ← s + βv3.00每次都继续追加;重复 key 会把同一 value 越写越大。
s ← s + β(v − s)0.98只写“目标与旧预测的差”;在这个 toy key 上逐步逼近目标。
|state − target|
|state − target|
S ∈ Rdₖ×dᵥ,另有 α 与 key geometry
这个实验只解释“纠错写入”直觉,不证明固定状态能无损回忆任意历史。
关键不是“衰减得慢”,而是让 16-token tile 的最坏 rescale 有有限上界
K3 报告固定 gmin=−5;此时 α>e⁻⁵,16 步累计 log-decay>−80,倒数小于 e⁸⁰。
αmin = exp(gmin)
tile × gmin
exp(−tile × gmin)
报告默认 −5 × 16 = −80,理论倒数仍低于 BF16 最大有限值。
能落进动态范围不等于精度误差为零;报告的系统收益还来自把 diagonal tile 改成 Tensor Core 稠密矩阵乘。
把“保存每一层”改成“保存每一块”,再看深度来源数量怎样变化
计数是确定性的;内存只用“每 Token 每 hidden element 的来源份数”表示,不冒充真实运行时 GiB。
L 层输出 + embedding
ceil(L/S) + embedding
来源份数的确定性比较
12 层/块 · 8 个 layer blocks · 含 embedding 共 9 来源
报告称 Full 的算术因 L<100 尚可,真正代价在存活 activation 和 pipeline 跨 stage 通信。
激活更多专家时,先缩窄 routed representation 能省下多少 dispatch payload?
元素数与字节数按选择精确计算;真实成本还含 router、all-to-all、权重读取、shared experts 与拓扑。
tokens × k × d × bytes
tokens × k × ℓ × bytes
只比较 routed token elements
K3 expert pool / active routed
公共变换仍要付激活计算
实际系统由 MoonEP 静态 shape、zero-copy communication 与专家执行共同决定。
在原点附近保留 SwiGLU 的形状,在大正输入处给乘积明确上界
报告配置 β₁=4、β₂=25,因此标量切片的 |f(x)|≤100。曲线是函数,不是 validation loss。
σ(x) · x
[xσ(x)] · x
[β₁tanh(x/β₁)σ(x)]·β₂tanh(x/β₂)
β₁ × β₂
真实模型的 Wg x 与 Wu x 并不相同;本图复现报告 Figure 4 的共同标量切片。
一次 forward 里先照常路由,再用“进入 Top-k 还差多少”决定下一步 bias
固定使用报告 Figure 5 的 m=8、n=4、k=1 规模;score 是本站构造,不是 K3 trace。
loads = (4, 3, 1, 0)
每个 expert 取目标 q=mk/n=2 对应的分位阈值,再移除公共 offset。
loads = (2, 2, 2, 2)
8 tokens × top-1 / 4 experts
居中后用于 next step
after max − min
通信近似只保证 bin-width 级
bias 只影响 Top-k selection,不进入最终 mixture weight;当前 batch 不能使用由自身算出的新 bias。
长程 RL 同时要记三本账:每题预算、完成阈值、教师密集信号
三块标量计算互不替代:budget 管过度思考,λ 管 straggler,MOPD reward 管学生当前 prefix。
12K ≤ 2.0 × 8K:保留任务 reward
64 paused / resume next iteration
clip(log pteacher/pstudent, ±Rmax)
实际系统还有 per-token regularization、domain/effort teacher selection、sandbox state 与 group completion dispatch。
MLA prefix 对上了还不够:同一边界必须有每个 KDA group 的 state checkpoint
默认复现报告 Figure 12 的 6144-token physical block 与 512-token hash block;checkpoint 周期是教学变量。
floor(match/hash) × hash
最长同时存在的 state 边界
两类 cache 的共同最长前缀
matched − joint hit
真实系统还需 pin、copy-on-write、跨 KDA group 原子失效、调度 step 可见性和 prefill/decode TP re-layout。
29 OPEN ARTIFACT FORENSICS
从“报告说了什么”走到“公开 checkpoint 实际长什么样”
第三轮固定到官方 Hugging Face revision,读取 config、remote code、60 MB tensor index、 四个 safetensors headers 和两个小范围参数切片。原始权重不进入本站仓库; 结构、shape、计数、参数统计、隔离 wheel 与 RTX 5090 执行结果都可以从公开脚本重复生成。
96 shards、497,220 entries;不是运行显存,也不是参数量口径。
配置、tensor names 与 header shape 三方闭合。
官方 torch reference;fixed BF16 mean 2.6210 ms。
main 未修;#144 改成 128,#150 验零后裁成 96,两个社区 PR 都未合并。
ROUND 03 / OPEN ARTIFACT FORENSICS
不加载 1.56 TB,也能从 config、tensor header 与小范围权重读出真实结构
HF revision 9f62e4e9f · FlashKDA 1ce47ea3b。 原始权重不进仓库;真实观测、推导、执行、合成探针与未决矛盾分别标记。
拖动一层:同时看 attention、FFN 与 AttnRes block
层号按人类阅读使用 1–93;公开 Python 实现内部使用 0-based index。L92 与 L93 连续两个 MLA 是真实配置。
首层 dense;后续 92 层进入 MoE。
96 heads × 128 dims · recurrent state
33792 intermediate · BF16
这一层把 prefix sum 写入 block-level source。
条带不代表每层 FLOPs 相同;KDA、MLA、dense 与 896→16 MoE 的状态和执行代价不同。
497,220 个 entries 里,绝大多数为什么来自 experts?
entry count、dtype、shape 与 byte offsets 来自公开 index/header;占比是确定性算术,不是运行显存。
96 个公开 safetensors
1.561 TB decimal
不是 parameter count
D / packed weights + scales
92 layers × 896 experts × w1/w2/w3
每个 packed matrix 独立保存 group scales
每层 attention + MLP 两次读取,再加 output
MoonViT-V2 与 shared embedding bridge
w1.weight_packedU83072 × 17925.25 MiBw1.weight_scaleU83072 × 112344,064 Bw2.weight_packedU83584 × 15365.25 MiBw2.weight_scaleU83584 × 96344,064 Bw3.weight_packedU83072 × 17925.25 MiBw3.weight_scaleU83072 × 112344,064 Bkv_a_proj_with_mqa.weightBF16576 × 71687.88 MiBkv_b_proj.weightBF1624576 × 51224.00 MiBq_a_proj.weightBF161536 × 716821.00 MiBq_b_proj.weightBF1618432 × 153654.00 MiBg_proj.weightBF1612288 × 7168168.00 MiBpatch_embed.proj.weightBF161024 × 3 × 14 × 141.15 MiBpatch_embed.pos_emb.weightBF1664 × 64 × 10248.00 MiBencoder.blocks.0.wqkv.weightBF164608 × 10249.00 MiBencoder.blocks.26.wqkv.weightBF164608 × 10249.00 MiBencoder.final_layernorm.weightBF1610242,048 BMXFP4 packed shape 不是原始逻辑矩阵 shape;必须结合 latent width、group size 与 loader 格式解释。
几十 KB 真实参数,首先暴露的是一个不能擅自修掉的矛盾
只读 shard 1 的 49,664 bytes 与 shard 2 的 13.49 MB prefix;统计可复现,原始参数不再分发。
q/k/v projection = 12,288
真实 shard header
remote code 与 C++ TORCH_CHECK
[128] F32128 values
mean -0.16895 · std 0.36675
mean -4.57477 · std 1.42369
mean 0.00000 · std 0.02035
mean 4.94963 · std 0.89509
若把 checkpoint `[128]` 临时当作 channel-wise 参数
0.8841one-step median retention
3.76e-464-step median retention
不能定案公开 loader / 官方解释仍缺失
本站只报告形状冲突;不宣布 checkpoint 损坏,也不把 channel-wise 猜测冒充真实 K3 forward。
作者表、本机 RTX 5090 实测与合成 router 反例,三条证据各自归位
FlashKDA 已用 CUDA 13.0 容器编译为 sm_120a wheel,并在本站 RTX 5090 上通过 exact-match 与 K3 形状计时;输入仍是合成 tensor,不是 checkpoint hidden state。
O / author repository
O / same author table
不能外推到 RTX 5090
与本站环境分开比较
X / 300 CUDA-event samples
BF16 state · fixed
8192 sequence tokens / latency
该 case 三种 state mode 合并峰值
one chunk、tail、multi-head、96 heads、varlen。
BF16 output 与 final state 均逐元素相等。
CUDA 13.0 · sm_120
1ce47ea3b · CPython 3.12
CUDA math headers 与系统 `rsqrt/rsqrtf` exception declarations 冲突。
CUDA 13.0.2 · Ubuntu 24.04 · glibc 2.39;wheel 3.81 MB。
fixed / varlen K3 形状各 900 次计时,三种 state mode。
随机 RMS=1 输入为什么不能评价 Quantile Balancing
2,048 个固定 seed 向量通过真实 `896×7168` router;它们不是模型 token hidden states。
LOAD CV2.085
GINI0.831
ZERO EXPERTS558
TOP-16 OVERLAP2.17 / 16
本机 kernel 实测只验证公开 FlashKDA API 与合成合法 shape;没有加载 K3 checkpoint。官方 main 仍存在 `A_log [128]` 与 API `[96]` 的冲突;社区 #144 与 #150 给出两种未合并候选,本站不替官方裁决。Router counterexample 仍只证明 hidden distribution 不可省略。
30 REDUCED ATTENTION RESIDUALS STUDY
真实 K3 权重还不能诚实 forward;先把一个可证伪的 AttnRes 问题完整做完
checkpoint 的 A_log [128] 与 main 代码期望的 96 heads 仍没有官方转换合同; 社区 #144 / #150 提出相反修复,均未合并。本轮不把候选 patch 冒充 K3 官方 forward,而是预注册一个从零训练的缩小实验: 相同 16-block Transformer、相同数据窗口与相同初始化,只改变 residual source 的读取拓扑。
9 格各 2,000 steps;每格 16,384,000 target bytes。
三个 paired seed 同为负,达到预注册 −0.010 判据。
同样满足本 reduced protocol 内的方向支持规则。
Baseline 0.3447;Full 0.5087;Block 0.6306。
ROUND 04 / REDUCED INDEPENDENT MECHANISM PROBE
不裁剪 K3 的冲突权重:从零训练一个可以完整审计的深度路由实验
WikiText-2 byte LM · 16 blocks / 32 residual sublayers · 3 structures × 3 seeds。 这是缩小机制探针,不是 K3 checkpoint forward,也不是论文规模复现。
9 个 2,000-step runs
每格 16,384,000
同 seed 公共初始化 exact
3 / 3 paired negative
3 / 3 paired negative
timing 明确不要求 exact
先看三条完整曲线,再放大最后一个配对点
BPC 越低越好。主判据只读 step 2000:三个 seed 必须同方向,且 mean paired delta 至少达到 −0.010;中途曲线不用于改终点。
三 seed 均值;正式判据使用逐 seed paired delta,不把三次运行当成 benchmark 样本总体。
只在这个 reduced protocol 内;不是总体显著性,也不外推 paper scale。
普通 residual 一路累加;Block 每四层重新混合
下面是三个 seed 在固定 16 个诊断窗口上的均值。RMS 只描述幅值,不等于信息量、有效秩或因果重要性。
块内通常向上累积;下一块重新读取历史 block sources 后,partial state 出现重置。锯齿是拓扑痕迹,不是自动等价于“更稳定”。
横轴是历史 source,纵轴是当前 residual sublayer
每格颜色按“实际权重 ÷ 均匀权重”归一:深色代表比该行均匀读取更强。灰格表示那一层尚看不到该 source。
BPC 支持,不代表每一种机制解释都同时得到支持
指标是每个 Transformer block 的公共核心参数 gradient RMS,再看 16 个 block 的变异系数。 CV 越低,按这一定义才越均匀。
seed CV · 0.354 / 0.341 / 0.340
seed CV · 0.489 / 0.510 / 0.527
seed CV · 0.662 / 0.685 / 0.545
本指标下 AttnRes 更不均匀,不能写成论文梯度结果复现。
16 blocks · fixed diagnostic batch · reduced model
尺度、训练阶段与聚合对象都可能不同
下一步应先对齐论文实际 activation / residual-output gradient 定义,再增加 depth 与训练预算;不能先换指标再只展示好看的图。
近似同参数,不是同计算;数值 exact,不要求计时 exact
Full / Block 只增加 12,672 个 mixer 参数,但教学实现必须保存、归一化并混合历史 states, 所以参数开销小不等于执行开销小。
1.00× time · 1.00× memory
6.79× time · 4.70× memory
2.53× time · 2.15× memory
81521a70ec61… schedule
eight frozen fields exact
budget · init · finite checks
2,000 steps · 8 / 8 exact
9778ade5b1c9dd7676d2cdc52b4e4e7ff5ae513cb56c667974e2422702f9dc2b5df870369d9a86ccb4ba4191fbd1d6f3642893dd47a60f8f6d1143006bdfbdafe74d3323e5fe31378bb8aad7a8efa2fb91995cd7224c158cf03006466cdea2a7da86221c5bc56d9d09747b72c06ccd77a5d4b49bcdaab9be5712cbf6e668a77c- 冻结的缩小协议中,两种 AttnRes 的 BPC 配对方向都为负。
- Block partial-state RMS 每四层出现与拓扑一致的重置。
- 指定 2,000-step run 在全新进程中数值与哈希字段 exact。
- K3 checkpoint 已 forward,或论文规模收益已经复现。
- 这是同 FLOPs / 同 wall-time 优势,或 Block 普遍优于 Full。
- AttnRes 梯度更均匀;本轮预注册指标恰好给出相反结果。
31 GRADIENT DEFINITION × DEPTH SCALE
“论文说梯度更均匀”,和上一轮参数梯度反结果,测的是同一件事吗?
第五轮先审计 Attention Residuals 官方论文与仓库:Figure 5(c) 没有公开 gradient tensor、 norm、reduction、diagnostic batch、AMP / clipping 时点或统计代码。本站因此冻结一个可复现的 post-MLP output activation-gradient 定义,把深度扩到 16 / 32 blocks、预算扩到 8,000 steps, 再用三 seed 检查“首尾平衡”和“全层离散度”是否真的同方向。
786,432,000 formal target bytes;两深度、两结构、三 seed。
depth-16 平均 61.0%;depth-32 平均 72.0%。
局部尖峰让 depth-16 / 32 平均相对恶化 10.3% / 60.0%。
指定 32-layer Block 格从零重训 8,000 steps,冻结字段逐项一致。
ROUND 05 / GRADIENT DEFINITION × DEPTH SCALE
“早层不再过大”与“整条谱更均匀”不是同一件事
16 / 32 Transformer blocks · Baseline / Block · 3 seeds · 8,000 steps。 被测对象是 post-MLP output activation gradient,不冒充论文未公开的 Figure 5 实现。
12 个独立训练格
每格 65,536,000
宽度固定 192
中后段局部尖峰
失衡改善 56%–81%
model + optimizer state
论文画出一条“梯度曲线”,却没有给出足以唯一重算的测量合同
Figure 5(c) 只写 “Each transformer block’s gradient magnitude”。 官方仓库没有训练代码、checkpoint、统计脚本或原始数组。
图与文字能确认
- 横轴是 Transformer block index。
- Figure 5(b) 同时画 block output magnitude。
- 正文说 Baseline 早层梯度过大,Block 更均匀。
- 最终模型约 27 blocks / 54 residual layers。
无法从公开工件唯一恢复
- activation、branch 还是 parameter gradient?
- L2、RMS、mean absolute 还是别的 norm?
- batch / token / channel 怎样 reduction?
- 哪个 checkpoint、AMP / clip 前还是后?
同一 diagnostic tensor
每个 Transformer block 一个
FP32 cross entropy
B × T × C 联合 RMS
核心参数梯度:权重收到多大更新信号。
activation gradient:损失对这一深度表示有多敏感。
两种对象都公开;新指标不会覆盖上一轮反结果。
“这是与 Figure 5 叙述对齐的一种公开 operationalization。”
不能说“论文作者就是这样算的,或本站复画了 Figure 5(c)。”
同一条梯度谱,绝对值与归一化形状要一起看
竖线是 8 个 AttnRes aggregation groups 的边界;Baseline 也画同位置,方便逐层配对。
Baseline 的早层整体隆起被削弱。
中后段少数位置形成更尖的峰。
“更均匀”必须拆成至少两个指标。
Block 的中期优势会反转;不能挑一个 checkpoint 讲故事
横轴按六个预注册诊断时点等距排列;标签保留真实 step,不暗示实际时间等距。
step 2,000:Block 已显著更尖。
同一时点复现恶化方向。
中期反例:Block 此时反而更平。
到 8,000 step 才轻微反转。
梯度结论 mixed,不代表论文所有训练动力学叙述都没有出现
同一个 post-MLP 位置计算 output RMS;这里不做 backward,也不改变主判定。
Block 限制 output magnitude 持续跨深度增长;这一方向与 Figure 5(b) 叙述一致。
粗分隔线是 group boundary;柱高来自当前选择的 checkpoint / seed,不是示意动画。
一个正结果、两个反结果和一张成本账,要同时摆在桌面上
Round 05 的主判定只读 activation CV + imbalance;BPC、参数梯度与成本是必须公开的次要结果。
| Depth | Δ BPC | Activation CV | First/last imbalance | Mean grad scale | Parameter CV | Verdict |
|---|---|---|---|---|---|---|
| 16 | −0.00894 | -10.3% reduction | +61.0% | 57.4% of Base | 0.416 → 0.683 | mixed |
| 32 | −0.00987 | -60.0% reduction | +72.0% | 54.4% of Base | 0.397 → 0.772 | mixed |
6 / 6 配对更接近 1。
6 / 6 配对 CV 更高。
0.416→0.683;0.397→0.772。
6 / 6 配对为负;非同算力。
约 2.55× time · 2.15× memory
约 2.60× time · 2.16× memory
不能写成同 FLOPs、同 wall time,或 K3 生产成本。
8,000 steps from initialization
额外 65,536,000 target bytes
3f0b97ece3…14892f59
080afb17d1e036c0bba0a799fdb8b98ee4ad652bd42dd1b3b67110dd2ede63715041e09b167f229248d2462324e8c254b8f5938975f135dcd8192b00a54a4f4e8cdb71808a429e5f9513c1c6c9426bdc93e30f237001a1b47a2a2fba574a044fdepth-dependent or inconclusive- 在公开定义下,Block 改写了梯度失衡的形态。
- 早/晚深度更接近,但中后段局部峰更尖。
- Output RMS 的跨深度增长显著受限。
- 复现论文 Figure 5(c) 的数值或隐藏实现。
- 测到 K3 checkpoint 的真实梯度。
- 证明 AttnRes 一般更稳定或更省算力。
32 SPIKE TRAJECTORY × BACKWARD PATH
layer 21–25 的尖峰从什么时候出现,又对 mixer 的哪条反向路径敏感?
第六轮不把上一轮的局部尖峰直接解释成机制。本站预注册六个训练时点、六个张量位置、 四种 confirmatory reduction 与三种 same-forward backward rule;正式训练严格复用 Round 05 depth-32 Block 的模型、数据、optimizer 与 schedule,诊断全部位于 optimizer 之外。 结果显示尖峰在 step 500 后才形成、六个位置均可见;切断 softmax / query / key 源梯度没有降低尖峰, 而把全局 learned value-backward coefficients 改成均匀后,contrast 平均下降 70.2%。
196,608,000 formal target bytes;完整重放再加 65,536,000。
三 seed 的尖峰 contrast 从 0.524× 跃到平均 2.233×。
四种预注册 reduction 都保留 layer 21–25 集中。
不是训练变体、因果贡献百分比或局部 mixer 归因。
ROUND 06 / SPIKE TRAJECTORY × BACKWARD PATH
尖峰不是出生时就有;它在训练中形成,并对 value 路径敏感
固定 Round 05 的 depth-32 Block 训练格,只在 optimizer 之外增加诊断。 3 个正式 seed、1 个完整重放;所有前向值完全相同,只改变同一次反向传播的局部导数规则。
3 × 8,000 steps
16 组冻结字段
每个位置 3 / 3 seed
预注册家族内稳健
移除后反而略升
平均 contrast 降幅
先问“训练到什么时候出现”,再问“由哪条路径放大”
尖峰集合 S 固定为 layer 21–25。纵轴 contrast = S 内均值 ÷ 其余层均值: 1 表示没有集中,越大表示梯度越集中在这五层。
三 seed 均低于 1;layer 21–25 并不特殊。
学习已经发生,但尖峰尚未出现。
峰值层同时迁移到 layer 21,结构开始显形。
seed 3 只有 1.881×:方向一致,强度并不整齐。
这不像一个由初始化直接写死的“坏层”;它更像训练动力学与 Block mixer 共同塑出的深度模式。
从一个 Block 向前追:尖峰在六个候选张量上都已经可见
“最早观测到”是沿本站采样点的相对顺序;两个采样点之间仍有 mixer、归一化与残差运算, 所以它不是尖峰的物理出生点。
pre_attention_input 是本站六点链中最早的可见位置。
观测链不是干预链;更早 mixer 与跨层回传已经作用于该张量。
把 “RMS” 拆成四种合理算法,layer 21–25 仍然突出
预注册主家族只包含四种 reduction。每个 seed × reduction 必须同时满足: contrast ≥ 1.5、top-5 与 S 至少重叠 3 层、相对 element RMS 的 Spearman ≥ .8。
| SEED | REDUCTION | CONTRAST | TOP-5 ∩ S | SPEARMAN | VERDICT |
|---|---|---|---|---|---|
| 2026073001 | 全元素 RMS | 3.046× | 4 / 5 | 1.000 | PASS |
| 2026073001 | Token RMS 均值 | 2.869× | 4 / 5 | 0.958 | PASS |
| 2026073001 | Token RMS 中位数 | 2.646× | 4 / 5 | 0.901 | PASS |
| 2026073001 | Token RMS P95 | 3.143× | 4 / 5 | 0.997 | PASS |
| 2026073002 | 全元素 RMS | 3.333× | 5 / 5 | 1.000 | PASS |
| 2026073002 | Token RMS 均值 | 3.182× | 5 / 5 | 0.973 | PASS |
| 2026073002 | Token RMS 中位数 | 2.905× | 4 / 5 | 0.895 | PASS |
| 2026073002 | Token RMS P95 | 3.532× | 5 / 5 | 0.997 | PASS |
| 2026073003 | 全元素 RMS | 1.881× | 3 / 5 | 1.000 | PASS |
| 2026073003 | Token RMS 均值 | 1.808× | 3 / 5 | 0.988 | PASS |
| 2026073003 | Token RMS 中位数 | 1.666× | 3 / 5 | 0.934 | PASS |
| 2026073003 | Token RMS P95 | 2.012× | 3 / 5 | 0.993 | PASS |
robust within the preregistered reduction family——只对这四种、这三个 seed、这个诊断 batch 成立。
前向数值一字不动,只问梯度经过 mixer 时沿哪条边回去
干预覆盖全部 64 个 depth mixer 与 output mixer。它能定位“反向路径敏感性”, 不能替代重新训练,更不能把降幅解释成因果贡献百分比。
正常回传:权重路径和值路径都保留。
α 数值不变,但切断 softmax / query / key 源梯度。
前向仍用 learned α;仅 value-backward 系数改成均匀。
contrast “降幅”为负;移除 key / softmax 路径后,峰值在 3 / 3 seed 略微上升。
contrast 在 3 / 3 seed 至少下降 20%,达到预注册 material sensitivity 阈值。
均匀 value-backward 后,三个 seed 的最高层都从中后段移到 layer 2。
该尖峰对“全局 learned value-backward coefficients”具有材料级敏感性;softmax / query / key 源梯度路径没有显示同方向材料级作用。
不是训练出的 uniform 模型 · 不是 70.2% 因果贡献 · 不是某个局部 mixer 的归因mixer 权重给出一条可追的线索;干预才把它推进到“路径敏感”
每个点是 layer 19–28 的一个 layer × seed。横轴是 MLP mixer 的统计量, 纵轴是归一化梯度;相关性仍然只是观察关系。
六位置、四 reduction、三 seed 都能看见。
相关性提供候选机制,不承担因果结论。
全局反向规则干预支持路径敏感性。
groups 6+7 的 sufficiency 通过;restoration peak 未过,localization 未建立。
model、optimizer、history、六个 BPC 与全部 post-MLP 数组一致。
compare hash 05396eaf56…cedcbb87
query-zero 与 loss×2 gate 在三 seed 全部通过。
尖峰集合来自 Round 05;本轮不是盲发现研究。
llm-atlas-k3-attnres-spike-path-v1REPLAY 05396eaf56…cedcbb87COMPACT a430dd26f5…f13126cd33 LOCAL MIXER PATH × BIDIRECTIONAL GATE
全局 value-route 很敏感;能不能把它诚实地缩到 group 6 / 7?
第七轮先冻结 14 种 same-forward mask:在 learned 背景只把固定 scope 改成 uniform, 测 sufficiency;再从 all-uniform 背景只恢复同一 scope 的 detached-learned coefficients, 测 restoration。groups 6+7 的 16 个 depth mixers 在 sufficiency 的两个指标、三个 seed 全部复现至少一半 global log gap;但 restoration 只在 contrast 通过,peak 三 seed 均低于 50%。 因而主结论不是“定位成功”,而是强单侧证据与未闭合的双向 localization。
每次 forward 审计 exact identity set、顺序、唯一性与 census。
groups 6+7 mean S:contrast .677;peak 1.700。
contrast mean .650;peak 仅 .380,三 seed 均未过 .50。
双向 localization 未建立;group 7 MLP 只作次级 sufficiency 发现。
把“全局敏感”缩到 16 个 mixer:为什么单侧很强,双向门仍然不让过?
同一 forward · 14 个冻结 mask · 3 seeds · sufficiency × restoration · 完整 replay
depth mixers + output
exact selector sets
two metrics × three seeds
Groups 6+7 ≥ 50%
contrast pass · peak fail
one-sided evidence
先画清 65 个 intervention nodes,再谈“局部”
layer 21–25 是 Round 05 看过数据后冻结的 spike set;Round 07 预先选择完整 group 6 / 7。group 7 还包含 S 外的 layers 26–28,所以不是事后只挑尖峰层。
9 sources
Sₓ = ln(Xref / Xm) ÷ Gₓ只改这 16 个,能否复现全局下降的一半?
Rₓ = ln(Xr / Xall) ÷ Gₓ只恢复这 16 个,能否把全局 gap 恢复一半?
mixer 路径非线性交互。一个 scope 在 learned 背景“足够强”,不代表它在 uniform 背景“恢复得回来”。
把 14 个 mask 全部摆出来,不只展示通过的 scope
条形长度是 global log gap 的归一化 score,不是贡献率;负值和大于 1 都保留。
learned 背景 → scope uniform
uniform 背景 → scope learned
超过 all-uniform endpoint;不是 >100% 贡献
contrast 双向过线;peak 只在 sufficiency 方向过线
主门要求两个方向、两个指标、三个 seed 全部 ≥ .50;均值只用于视觉摘要。
| SEED | S / CONTRAST | S / PEAK | R / CONTRAST | R / PEAK | DUAL |
|---|---|---|---|---|---|
| 2026073001 | 0.697 ✓ | 1.817 ✓ | 0.649 ✓ | 0.372 × | FAIL |
| 2026073002 | 0.676 ✓ | 1.783 ✓ | 0.621 ✓ | 0.355 × | FAIL |
| 2026073003 | 0.658 ✓ | 1.501 ✓ | 0.680 ✓ | 0.413 × | FAIL |
| MEAN | 0.677 | 1.700 | 0.650 | 0.380 | 3 / 6 |
16 个 mixer 足以把两项都推过 50% global log gap。
contrast 回升;peak 三 seed 都稳定停在 50% 以下。
Groups 6+7 在 learned 背景足以复现全局下降的大部分。
预注册 restoration peak 门没有通过;双向证据不闭合。
group 7 的 MLP 分支过闸;group 6 差一格,output 远不到一半
branch 判定只有 sufficiency 方向,证据等级低于双向 localization。
seed 3 contrast S=.177;低于 material .20,不能宣布 dominance。
两个指标、三个 seed 自身 material,且领先 attention 至少 15pp。
contrast / peak mean sufficiency;0 / 6 达到 50%。
depth path 已复现绝大多数 gap;peak 超过 global endpoint。
只作 log-gap bookkeeping;不是加和分解或 hypothesis test。
同一个 score 背后,32 层峰值究竟移到哪里?
谱按每个 mode 自己的 layer mean 归一化。位置变化帮助理解,但不替代双向 score gate。
三个 seed 的最高层都是 layer 21。
peak 强度压到 global endpoint 以下,但位置不统一。
位置回归不等于强度恢复超过 50%。
model、optimizer、history、BPC 与 parent diagnostics。
7dbd15ad03…35d6b9cf
logits、loss、activations 与 parent summaries exact。
不是 K3 checkpoint、训练变体或 additive attribution。
llm-atlas-k3-attnres-local-path-v1AGGREGATE b86d119cd2…3fc6f215COMPACT 2aff9288f5…aaabd83534 TRAIN-TIME FORWARD INTERVENTION
诊断期的局部敏感性进入完整训练后,尖峰指标还会衰减吗?
第八轮不再只改 diagnostic backward,而是让 group 6 / 7 的 parameter-free uniform mixer 进入每一次 train、eval 与 diagnostic forward。四个变体各跑三个 8,000-step seed,并把同 seed 的 Round 05 learned run 锁为历史配对 reference; 主变体 groups 6+7 的 contrast 与 peak 六格降幅全部超过 20%,同时 BPC 质量门 4 / 4 通过,指定 seed 的完整重训 scientific payload exact。
851,968,000 个新 target bytes;每格 65,536,000。
contrast drop 62.1%–77.3%;peak drop 32.3%–62.0%。
三 seed ΔBPC 最大 +0.00960;均值 +0.00658。
训练期架构消融;不是 K3 checkpoint 或 Figure 5(c) 复现。
不再只改 diagnostic backward:让局部 uniform routing 真正进入 8,000-step 训练
4 variants × 3 seeds · 1 historical paired reference · 1 full replay · frozen analyzer
12 formal + 1 replay
contrast + peak
BPC degradation screen
scientific payload
0 hooks · 0 optimizer state
reduced protocol only
这是训练期架构消融,不是“只改变 forward”的纯因果实验
选中 mixer 每一次 train / eval / diagnostic 都改成参数无关的均匀读取;新的表示自然改变 backward 与后续更新。
keys = RMSNorm(sources)w = softmax(query · keys)output = Σ wᵢ · sourceᵢlogits = zeros(N, B, T)w = softmax(logits) = 1 / Noutput = Σ sourceᵢ / N- CONTRAST
- +56.1%
- PEAK
- +32.9%
- STATUS
- PASS
- CONTRAST
- +53.6%
- PEAK
- +37.5%
- STATUS
- PASS
- CONTRAST
- +71.0%
- PEAK
- +49.9%
- STATUS
- PASS
- CONTRAST
- +51.3%
- PEAK
- +34.6%
- STATUS
- PASS
保持 optimizer 结构与 reference 一致。
不是 stop-gradient;参数结构性不可达。
不能写成“训练了但没有移动”。
不是只看终点:局部前向干预从什么时候开始分化?
纵轴是相对同 seed historical learned reference 的下降;正值表示 attenuation,负值表示 amplification。
主 status 只读取 step 8,000;中间 checkpoint 用来观察适应过程,不能挑一个最好看的时点替代终点。
20% attenuation 与 BPC degradation screen 必须同时通过
任何结构、hash、selector、finite 或 replay 错误都会让 analyzer 直接失败,不进入下表的科学状态。
| SEED | METRIC | REFERENCE | VARIANT | DROP | ≥20% |
|---|---|---|---|---|---|
| 2026073001 | CONTRAST | 3.046× | 0.806× | +73.5% | PASS |
| 2026073001 | PEAK | 3.219× | 1.436× | +55.4% | PASS |
| 2026073002 | CONTRAST | 3.333× | 0.758× | +77.3% | PASS |
| 2026073002 | PEAK | 3.619× | 1.375× | +62.0% | PASS |
| 2026073003 | CONTRAST | 1.881× | 0.713× | +62.1% | PASS |
| 2026073003 | PEAK | 2.288× | 1.548× | +32.3% | PASS |
报告 mean(g[S]),但不单独作为 status。
layers 26–28 也被 joint intervention 改写。
下降可能来自 S 降、R 升,或两者同时发生。
只限这个固定缩小模型、数据、预算、seed 与 operational metric。
没有真实 2.8T checkpoint forward,也没有复现未公开 Figure 5(c) telemetry。
joint effect 等不等于两个 single-run effects 相加?
三条 effect 来自三套独立训练;这里画的是跨 run 的 bookkeeping residual,不是因果 interaction 或 Shapley contribution。
E = ln(Xref / Xvariant);I > 0 表示 joint log attenuation 大于两个 single-run effects 的和。
I₆₇ 只报告原值、三 seed mean 与 range;正负都不能翻译成 group 6 / 7 的真实贡献。
终点平均数之外:峰值移动、S/R 分拆与完整 replay
每条谱按自身 32-layer mean 归一化;选择 reference 或任一训练变体,不改变 analyzer 的正式 status。
logits、CE、validation、32-layer diagnostic 与 capture summary。
20-step model、optimizer、history、evaluations 与 hashes。
b85563ca5c…a7f0c051
历史 references 的 196,608,000 bytes 单列、不重复计入。
A_log [128]↔[96] 尚无官方裁决。
llm-atlas-k3-attnres-forward-training-v1AGGREGATE eecf05c623…206d50c8COMPACT c3e672adb6…a002784b35 FIGURE & TABLE AUDIT
Figure 1–16、Table 1–5:每张图究竟支持什么,不能支持什么
主结果
四能力轴必须与总体仍落后 Claude Fable 5 / GPT-5.6 Sol 的结论同屏。
完整架构
把视觉入口、3:1 hybrid stack、Block AttnRes 与 Stable LatentMoE 分成不同信息流。
Bounded decay
展示下界、累计倒数与 BF16 风险,不承诺任意配置绝对稳定。
SiTU-GLU
对比 GLU / SwiGLU / SiTU 的函数形状,不从曲线直接推训练 loss。
Quantile Balancing
Top-(k+1) cutoff → global quantile → expert bias → next step。
原生视觉
只在作者消融配置内说明 from-scratch MoonViT-V2 梯度更平稳。
Scaling law
约 2.5× 是相对 K2 的整体 scaling efficiency,不是 inference speedup。
RL scaling
RL FLOPs、平均 steps 与能力共同增长;相关性不自动成为跨域因果律。
任务合成
知识图谱 → 材料检索 → knowledge/coding/vision task → verification。
AET
初始状态、动作、独立 verifier 与 curriculum,奖励落在环境结果。
训练系统
画状态的放置与移动,不补写报告未公开的总集群规模。
Prefix cache
6144 physical / 512 hash / sparse KDA checkpoint 是报告示例。
分数与成本
score 与 output token / cost 同图,并保留比较协议。
Kernel agent
283.6→114.4 ms 等数字限定在作者 24h/task 个案。
MiniTriton
L20 实测点对 roofline;不推广到其他硬件和工作负载。
XTML
global / one-shot / input options、channel 和 message boundary 分层。
K2 → K3
精确逐字段规格,hero 的 2.8T / 104B 只作易读四舍五入。
Reasoning / Coding
把 effort、harness、tool 与 fallback 变成表头的一部分。
Agentic
分数是 model × harness × environment × verifier 的系统结果。
Vision
有/无 Python tool 必须分列。
第三方 / 成本
价格点只描述当时服务条件,不作为架构因果证据。
作者直接陈述或报告数字。
原论文、官方代码或 benchmark。
由公开公式确定性计算。
帮助理解方向,不是实测。
↳ ONE HUNDRED PRIMARY NODES
不要一次读完:沿着正在困惑的那条机制往回走
这 100 个节点经过标题、年份、作用与 URL 核对;优先采用论文原页、官方仓库与 benchmark 官方入口。 它们不是“引用越多越好”,而是把 K3 放回 attention、MoE、数值、RL、系统与评测的历史脉络。
基础
02 NODES序列状态
10 NODES递归的并行扫描
Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention线性状态视角
Linear Transformers Are Secretly Fast Weight ProgrammersDelta memory 直觉
Griffinrecurrent + attention hybrid
Mamba-2 / Transformers are SSMs状态空间二元性
HGRN2gated recurrence 与 state expansion
Gated Linear Attention Transformers硬件友好 GLA
Parallelizing Linear Transformers with the Delta Rulechunkwise delta rule
Gated Delta NetworksKDA 机制近邻
Gated Attention for Large Language Modelsattention output gating
稀疏宽度
06 NODES数值
07 NODESScaling
02 NODES长上下文
05 NODESKimi 谱系
08 NODESDeepSeek 交叉线
06 NODES后训练
01 NODESAgent 环境
02 NODES部署
05 NODES系统
16 NODESonline-softmax merge
GPipepipeline schedule 前史
Tritontile compiler 前史
ZeRO训练状态分片
MLIRMiniTriton 编译基础
FlashAttentionIO-aware exact attention
MooncakeKV-centric serving
Optimus多模态训练 bubble
Flash Linear Attention线性注意力实现生态
SonicMoEIO / tile-aware MoE
TileLangtile programming 对照
ThunderKittensGPU kernel DSL 对照
FlashKDAKDA 官方 kernel
UltraEPrack-scale expert parallel
Megatron Core MoEMoE 系统复现坐标
Warp Decodetoken-centric MoE decode
评测
28 NODES视频评测
MMMU-Pro稳健多学科视觉评测
CharXiv图表理解评测
Math-Vision视觉数学评测
OmniDocBench文档解析评测
Humanity's Last Exam高难知识推理评测
BrowseComp浏览与 context management
SciCode科研编码评测
Tool Decathlon长程工具使用评测
DeepSearchQA深度研究覆盖度
OSWorld-Verified电脑使用验证
Terminal-Bench终端 Agent 评测
GDPval经济价值任务
ZeroBench高难视觉基准
MCP-AtlasMCP 工具能力评测
MCPMark真实 MCP 压力测试
ResearchRubrics深度研究 rubric
AutomationBench自动化 Agent 评测
SaaS-Bench专业 SaaS workflow
Agents' Last Exam通用 Agent 压力测试
APEX-Agents跨域 Agent 评测
OSWorld 2.0长程电脑使用
OfficeQA Pro企业知识工作
SpreadsheetBench 2端到端表格工作
BabyVision超越语言先验的视觉推理
MMVU专家级视频理解
WorldVQA原子视觉世界知识
Preliminary Assessment of Kimi K3's Cyber Capabilities独立安全评估边界