DATA / 05 CORPUS → TOKEN → GRADIENT

模型吃下的不是网页,
而是一套被安排过的经历。

同样是一万亿 Token,可以是独特知识、重复模板、忠实改写、错误合成或被截断的碎片。 本章沿一份原始文档走完整条流水线,再看 DeepSeek 与 Kimi 如何把数据、模型和训练阶段一起设计。

LEDGERS
12 张独立数据账
SOURCES
31 个一手节点
LINEAGE
2019 → 2026
LAB
4 个独立实验
SPOTLIGHT
DeepSeek × Kimi

00 TWELVE LEDGERS

先把“数据质量”拆成十二个可以追问、可以失败的问题

数据工程最危险的表达是“我们使用了高质量、多样、去重的数据”。它没有说明来源、单位、阈值, 也没有告诉你少数语言、隐私、benchmark 和文档结构发生了什么。下面十二张账是本章的防混淆协议。

L1 / SOURCE

来源与治理

URL、快照、许可、robots、地域和删除请求能否追溯?

L2 / PARSING

提取与解析

网页、PDF、代码、OCR 的结构有没有在转文本时被破坏?

L3 / LANGUAGE

语言与领域

混语、方言、代码注释与跨域文档怎样多标签识别?

L4 / QUALITY

质量与安全

规则、分类器、人工标注分别在判断什么,误删率多大?

L5 / UNIQUENESS

唯一性

完全重复、表面近似和语义相似是否被混成一种重复?

L6 / CONTAMINATION

污染与隐私

题干、答案、语义改写、PII 和 secret 分别怎样检查?

L7 / MIXTURE

混合与采样

每个领域最终看多少 Token、相当于多少 effective epoch?

L8 / TRANSFORM

数据变换

改写、翻译、FIM 和合成后还保留 source lineage 吗?

L9 / TOKENIZER

Token 计量

相同字节被切成多少 Token,跨模型 loss 是否还能比较?

L10 / PACKING

序列与可见性

文档是否被截断;packed sample 能否互相 attention?

L11 / CURRICULUM

课程与配方

什么数据在什么 LR、batch、context 和阶段进入训练?

L12 / VALUE

模型感知价值

样本对哪个模型、验证域和训练阶段真正有用?

CORE MODEL

算力账数模型处理了多少 Token;唯一性账数真正不同的材料;价值账问这些材料对当前模型与目标有没有用;治理账决定即使有用,是否应该进入训练。

1 文档

可能是 80 字短帖,也可能是 400 页技术手册。

1 Token

由 tokenizer 定义;不同语言与词表的压缩率不同。

1 学习信号

重复、噪声、结构完整性和课程都会改变边际价值。

01 DOCUMENT LIFE CYCLE

一份网页走到一次梯度更新,中间至少经过十二道门

这不是所有团队唯一的顺序:安全、去重与污染检查可能多次发生,代码和视觉也有专门分支。 但如果一份技术报告完全跳过其中某一步,读者至少应该知道自己失去了哪种证据。

01
SOURCE SNAPSHOT

来源快照

保存 URL / dump / commit、抓取时间、原始哈希和权利信息。

治理账
02
EXTRACT

正文与结构

去 boilerplate,恢复 PDF 阅读顺序,保留代码、表格、图注与坐标。

解析账
03
LANGUAGE

语言识别

文档级只是起点;混语与代码注释需要段落级、多标签判断。

覆盖账
04
DOMAIN

领域识别

Web、Code、Math、Knowledge、Vision 并非互斥桶。

混合账
05
QUALITY

质量筛选

硬故障用规则,软价值用分类器,最终用小模型消融校验。

误删账
06
SAFETY

安全与隐私

检测 PII、secret、恶意内容与价值敏感样本;高风险进入隔离区。

治理账
07
DEDUP

唯一性

先 exact,再 fuzzy / semantic;cluster 保留策略同样影响长尾。

唯一性账
08
DECONTAM

评测隔离

题干、答案、解释、翻译与时间边界分开检查。

评测账
09
MIX

领域采样

权重决定 seen Token 与 effective epoch,而不只是 corpus 占比。

能力账
10
TRANSFORM

改写与重排

rephrase、translation、FIM 都要携带源文、teacher 与 verifier 版本。

变换账
11
TOKENIZE

分词

vocab、normalizer、pretokenizer 改变压缩率、边界与 loss 单位。

计量账
12
PACK & TRAIN

组序列与课程

文档边界、mask、长度、LR、batch 和阶段共同定义实际训练经历。

配方账
每一步都应留下input idcode / config versiondecision + reasonoutput id

02 EXTRACTION & STRUCTURE

“下载成功”离“得到一个文档”还很远

HTML boilerplate 会把导航模板重复数万次;PDF 双栏若按横向坐标读取,会把两列句子交错; 代码离开仓库与依赖后,可能只剩无法执行的片段。解析质量是数据质量的地基。

载体典型破坏最低检查
WEB

导航、cookie banner、推荐栏、SEO 聚合、隐藏文本

正文率、DOM 密度、重复块、编码、标题—正文一致性

PDF

双栏错序、页眉页脚、公式拆散、表格与图注失联

layout parser、页级结构、公式/图/引用锚点

CODE

vendor、generated、minified、secret、仓库上下文丢失

语言 parser、repo/commit、license、依赖和测试关系

OCR

错字、bbox 漂移、阅读顺序、截图与文本不匹配

OCR confidence、坐标系、视觉—文本对齐

VIDEO

重复帧、字幕错时、短 clip 拼接、镜头语义断裂

perceptual hash、timestamp、shot boundary、轨迹完整性

LONG ≠ COHERENT

长文件可能只是更大的垃圾袋

binary blob、截断日志、复制页面与无效生成记录可以很长,却没有远距离依赖。

  1. 完整性开头、结尾、章节、引用与文件格式一致
  2. 结构性任务需要跨段落、跨帧或跨子任务连接信息
  3. 唯一性exact / fuzzy;视频还要做 frame perceptual hash

K3 §3.4 正式列出 exact / fuzzy dedup、视频帧感知哈希、规则 / 分类器过滤和 structural validation; 这也是它在 1M context 前先处理“长而无效”材料的原因。

03 QUALITY IS A VECTOR

规则能发现坏文件,分类器能猜测价值,真正的答案还要回到训练消融

“像百科”“像教科书”“语言流畅”只是 proxy。论坛中的稀有工程经验可能不像教科书, 低资源语言的分类器置信度也可能更低。好的 pipeline 必须展示整体收益与分域伤害。

HARD FAILURE

规则

乱码、极短、重复行、无效结构、明确 secret

强项
可解释、便宜
风险
规则外噪声漏过;特殊体裁误删
SOFT QUALITY

分类器

连贯、教育价值、专业度、模板生成概率

强项
可扩大到海量语料
风险
继承标注者与 teacher 偏好
CAUSAL CHECK

小模型消融

同预算 A/B pipeline 对 held-out slices 的影响

强项
最接近训练目标
风险
昂贵;小模型排序未必迁移
GOVERNANCE

人工与策略

许可、隐私、价值冲突、长尾文化

强项
能处理不可约规范问题
风险
分歧必须披露,不能藏进单一分数
NOT A REAL FORMULAquality ≠ fluency × prestige × benchmark score

这是禁止性表达:如果用已有模型偏好筛数据,再用同类 benchmark 证明数据“高质量”,会形成循环定义。

最小可信 A/B
  1. 同原始 pool 与同 Token 预算;
  2. 只改变一个 pipeline 阶段;
  3. 两边分别调必要超参;
  4. 同时报告 overall loss、语言 / 领域 slices、误删样本与置信区间;
  5. 把 classifier / parsing 的额外计算计入。

04 EXACT → FUZZY → SEMANTIC

去重越“聪明”,越需要回答它把哪些真正差异看成了重复

Exact dedup 处理字节 / 规范化字符串;fuzzy dedup 比较 shingles;semantic dedup 在表示空间找近邻。 三种方法不是替代关系,也不共享同一个阈值含义。

01 / EXACT

哈希相等

看得见
镜像、重复抓取、完全相同文件
看不见
空格 / 页眉变化、截断、改写、翻译
危险
误伤少,但把“未命中”误当“唯一”
02 / FUZZY

Shingle + MinHash / LSH

看得见
正文相同但模板变化、局部增删
看不见
跨语翻译与深度复述
危险
共享模板的独立病例、代码样板可能被合并
03 / SEMANTIC

Embedding 近邻

看得见
表面不同但内容相似、语义改写
看不见
encoder 不擅长的语言与专业域
危险
相反立场、近题、翻译和文化长尾被误删
DEEPSEEK LLM · TABLE 1

比较范围从 1 个 dump 扩到 91 个,重复才真正显形

报告按文档给出去重率:单 dump 为 22.2%,跨 91 个 Common Crawl dump 为 89.8%。 作者将其描述为删除文档数约为单 dump 方法的四倍。

22.2%1
46.7%2
55.7%6
69.9%12
75.7%16
76.3%22
81.6%41
89.8%91
DUMPS USED · 这是该 pipeline 的文档比例,不是 Token 比例,更不是“互联网 89.8% 无价值”。

05 CONTAMINATION · MEMORY · RIGHTS

评测污染、训练记忆和数据权利相关,却必须分开审计

一道题出现在训练集,不必然意味着模型会逐字复现;模型能复现一段 PII,也不要求它来自 benchmark。 许可允许访问,也不自动回答能否训练、再分发数据或发布权重。

TEXT

题干 / 上下文逐字或近似出现

exact、n-gram、shingle
GROUND TRUTH

标签、答案、标准解或评分脚本出现

答案规范化、结构匹配
SEMANTIC

题目 / 答案被改写或翻译

retrieval + 人工复核
TEMPORAL

训练快照晚于评测截止或结果公布

版本 / 时间戳
MEMORIZATION

稀有长串、PII、secret 可被诱导复现

canary、extraction audit
TRAIN SNAPSHOT先冻结版本

没有时间戳,就无法判定 benchmark 公布前后。

MATCH LAYERS由 exact 到 semantic

每层报告阈值、候选数与人工复核。

QUARANTINE隔离而非消失

保留触发原因,才能复盘误报与删除请求。

REPORT披露剩余风险

“未命中”不能写成“完全无污染”。

Carlini et al. 2020 的正确边界

作者从 GPT-2 中抽取出数百个逐字训练片段,包含 PII;其设置还观察到单文档序列也可能被抽取、 更大模型更易受影响。这是风险实证,不是所有模型的固定泄露率。

06 DOMAIN MIXTURE

Corpus 占比、采样权重和训练遍数,是三个不同数字

一个 120B Token 的数学桶在 1T 训练中拿到 20% 权重,会被看约 1.67 遍; 一个 800B 的 Web 桶拿到同样 20%,只覆盖约四分之一。权重相同,不等于 exposure 相同。

SAMPLINGΣ wᵢ = 1

每一步从哪个 domain 取样

SEENDᵢ = D × wᵢ

训练实际处理的 Token

EPOCHeᵢ = Dᵢ / Uᵢ

相对 unique corpus 的遍数

MANUAL

人工配比

能加入产品、语言和治理约束;需要大量消融,且最优点会随规模和阶段移动。

TEMPERATURE

按体量平滑

pᵢ ∝ nᵢα;α<1 抬高小域,但不判断小域质量。

DOREMI

代理模型学权重

280M proxy → 8B;作者摘要在 Pile 设置报告 +6.5pp 与 2.6× fewer steps。

MATES / JEST

模型感知选择

估计当前样本 / batch 对目标 validation 的价值;选择开销、目标偏差和可迁移性必须记账。

WHY DCLM MATTERS

DCLM 固定 240T-token candidate pool、模型尺度和 53 项评测,让不同数据 pipeline 在同协议竞争。 作者摘要中的 7B / 2.6T baseline 达 64% 5-shot MMLU、比 MAP-Neo 高 6.6pp 且少 40% compute; 这些数字只属于 DCLM 协议。

07 REPEAT · REPHRASE · SYNTHESIZE

改写不是免费新知识,而是用生成成本换取更多语言表面

原文重复保留事实形式但边际收益下降;忠实改写希望保持事实 / 推理结构并改变表述; 从零合成则可能创造新组合,也最容易继承 teacher 的错误、风格和偏见。

LOW GENERATION COST

原文多 epoch

没有生成误差;增加记忆与过拟合风险,不增加表面多样性。

CONTROLLED SURFACE

忠实改写 / 翻译

必须保留 source lineage、teacher、prompt 与 fidelity verifier。

NEW COMPOSITION

合成任务 / 轨迹

可以程序化验证,也可能产生 teacher monoculture 与 feedback loop。

4096-TOKEN SOURCE
chunk 1rewrite 1
chunk 2 + previous contextrewrite 2
… autoregressiveconcat
FIDELITY CHECK ↔ SOURCE
KIMI K2 · TABLE 1

一个很有价值、也很容易被过度外推的实验

配置改写epochSimpleQA
raw wiki-text01023.76
改写一次后重复11027.39
十种改写各一遍10128.94

这是 early checkpoint、单一 SimpleQA 与三种组合配置;生产扩展中每个 corpus 最多改写两次。 它不证明“改写越多永远越好”。

改写 pipeline 仍需回答事实是否保持?原语言是否消失?teacher 风格是否坍缩?答案改写是否躲过污染检查?生成 FLOPs 是否计入?删除请求能否沿 lineage 传播?

08 TOKENIZER AS A METER

Tokenizer 既是压缩器,也是训练数据的计量仪和边界偏置

Perplexity 是平均 token NLL 的指数。同一句话被切成 5 或 12 个 Token,分母已经变了; 跨 tokenizer 更适合看 bits-per-byte 或 byte-normalized loss。

SAME BYTESDeepSeek-V3 fixes
multi-line prompts.
TOKENIZER ADeep · Seek · - · V · 3 · fixes · …更多 Token / 不同边界
TOKENIZER BDeepSeek · -V3 · fixes · ↵ · multi-line · …更少 Token / 合并换行
01100,015 → pad 102,400

BBPE;newline、punctuation、CJK 分开;数字逐位;约 24GB multilingual tokenizer corpus。

02100K

沿用 BBPE;8.1T tokenized corpus,报告中文 Token 约比英文多 12%。

03128K

优化 multilingual compression;合并 punctuation + newline,又以随机 token splitting 修复 boundary bias。

04128K

继承 V3、FIM 与 token splitting;新增少量 context construction special tokens。

05160K

报告给出词表规模;完整 tokenizer 训练语料与跨语言压缩表未公开。

V3 的好教材:优化也会制造 bug

punctuation + newline 合并 Token 提高某些 multilingual compression,却在没有终止换行的 multi-line few-shot prompt 上产生 boundary bias。 V3 训练时随机拆开一部分合并 Token,让模型见到更多边界变体。

09 PACKING · MASK · FIM

把文档塞满序列,不能顺手改变“谁能看见谁”

Packing 解决 padding 与 truncation;attention mask 决定跨样本可见性;FIM 改变 token 顺序以学习中间补全。 三者经常一起出现,却不是同一个优化。

01 / NAIVE CONCAT
Doc ADoc BDoc C…

尾部截断少量 padding,但跨文档形成伪上下文。

02 / SAMPLE MASK
Doc A │Doc B │Doc C

同序列提升利用率,attention 只在各 sample 内因果可见。

03 / BEST-FIT
Long Doc AShort B + CMedium D

按长度装箱,减少长文档被反复截断。

04 / FIM / PSM
prefixsuffixmiddle

数据重排获得补中间能力;不是新增架构或新事实。

DEEPSEEK-V3

Packing · 无 cross-sample mask

前面的 packed document 可进入后面 Token 的 causal context。

DEEPSEEK-V4

Packing · sample-level mask

仍提高序列利用率,但不同 sample 的注意力被分块隔离。

DEEPSEEK-V3 · DOCUMENT LEVEL · RATE 0.1<fim_begin> prefix <fim_hole> suffix <fim_end> middle <eos>

`0.1` 是 V3 的公开设置,不是所有语言模型或代码数据的通用最优 FIM 率。

10 TRAINING IS A TIMELINE

总 Token 是一张收据;课程才告诉你什么时候学了什么

预训练时间轴至少要叠加 learning rate、batch、context、domain mixture、synthetic / FIM 和 loss coefficient。 “14.8T 支持 128K”绝不等于 14.8T 全部在 128K 上训练。

Kimi K215.5T 主语料 / schedule

MuonClip、67M Token global batch;末期阶段按报告表述,不擅自重算成新的官方总量。

500 stepswarmup
10T2e-4 stable
5.5Tcosine → 2e-5
400B + 60Banneal 4K → 32K
targetYaRN 128K
Kimi K3总训练 Token 未披露

Cosine;Per-Head Muon、weight clipping、QB;语言与视觉从头共同优化。

1%linear warmup
pretrain8K
pretrain64K
cooldown256K
target1M
DeepSeek-V314.8T

主预训练 4K;MTP loss weight 0.3 → 0.1,batch 在前 469B 墤大。

2K stepswarmup
→10T2.2e-4
4.3Tcosine → 2.2e-5
500B2-stage final LR
2×1K steps32K → 128K
DeepSeek-V432T / 33T

* Flash 报告明确前 1T dense;Pro dense stage 更长但未给同一简化数值。

first 1T*dense warmup
length4K → 16K
64Kindexer warmup
mainsparse attention
target1M
FAIR COMPARISON

K3 比较 cosine 与 WSD 时发现两者的最优 peak LR 和 batch 明显不同;分别独立搜索后 cosine 的最终 loss 更低。 共享一套超参可能只是让其中一种 schedule 穿了不合脚的鞋。

11 DEEPSEEK DATA LINEAGE

DeepSeek 的数据主线不是“8T、14T、32T”,而是每代解决了新的语料问题

从跨 dump 去重,到数学域发现、中文恢复、FIM / packing,再到自动生成互联网、agentic mid-training 和百万上下文, 这条谱系展示了数据工程怎样随模型能力边界一起移动。

01

DeepSeek LLM

2T(模型训练)dedup → filter → remix

跨 91 个 Common Crawl dump 去重,Table 1 的文档去重率从单 dump 22.2% 增到 89.8%;BBPE 100K。

仍未公开
最终 source mixture、各过滤器误删率与完整许可表。
02

DeepSeekMath

120.2B Math corpusseed classifier → domain expansion

从约 40B deduplicated HTML pages 出发,迭代 URL / domain 发现并去污染;7B 继续训练 500B 的 mixture 公开。

仍未公开
完整 URL 清单、分类器阈值和所有来源权利映射。
03

DeepSeek-V2

8.1T Token恢复误删 + 更多中文

改进 cleaning 与 quality filter,增加中文并过滤 contentious content;附录承认区域 benchmark 代价与标注分歧。

仍未公开
价值过滤完整政策、每语言 source 与最终比例。
04

DeepSeek-V3

14.8T TokenMath / Code + multilingual

减少冗余但保留多样性;best-fit packing;无 cross-sample mask;document-level PSM FIM rate 0.1;128K BBPE。

仍未公开
精确 domain mixture、unique Token、FIM 各域比例。
05

DeepSeek-V4

Flash 32T · Pro 33T长文 + agentic mid-training

过滤批量自动生成 / 模板页,扩文化长尾;sample-level mask;4K → 16K → 64K → 1M,并在 64K 后引入 sparse attention。

仍未公开
自动生成检测器细节、agentic 占比、每阶段 Token 和 source map。
DEEPSEEKMATH · CORPUS DISCOVERY

从能力目标反推数据,而不是只给网页打一个“优质”分

  1. 约 40B deduplicated HTML pages
  2. 数学 seed → fastText classifier
  3. 迭代发现 URL / domain
  4. benchmark decontamination
  5. 120.2B multilingual math corpus
DEEPSEEKMATH-BASE 7B · 500B CPT
  • 56% DeepSeekMath
  • 20% GitHub code
  • 10% arXiv
  • 10% 中英 Common Crawl
  • 4% AlgebraicStack

领域模型仍保留代码和自然语言;“数学强化”并不等于 100% 数学。

12 KIMI K2 → K3

K2 先提高每个 Token 的利用率,K3 再把文本、视觉与长上下文从头合并

K2 的贡献是把“高质量 Token 稀缺”变成 rephrasing 的受控问题;K3 沿用这条文本 pipeline, 扩进大规模 vision corpus,并选择 native multimodal pretraining。

KIMI K2 · 2025

15.5T curated Token

  • Web Text · Code · Mathematics · Knowledge
  • 知识:多风格 / 多视角 + chunk-wise AR + fidelity
  • 数学:learning-note style + 翻译
  • MuonClip · 4K 主训练 · WSD
  • 生产中每 corpus 最多改写两次
继承 pipeline
扩大模态与长度
KIMI K3 · 2026

总训练 Token 未披露

  • 同四文本域 + large-scale vision corpus
  • caption · interleaved · OCR · perception · video · visual coding
  • 绝对坐标 + [0,1] 归一化坐标
  • SVG · 3D · Webpage · Game · CAD code-render pair
  • 8K → 64K → 256K → 1M
NATIVE MULTIMODALvision token+text token+code tokenone next-token objective

语言和视觉从训练开始共同优化,而不是在一个完成的语言模型后面再接 connector 做 post-hoc alignment。

K3 FIGURE 7 · 2.5×

这是新模型族的 overall scaling efficiency,不是“改写数据让模型快 2.5×”

报告明确说 architecture、data、training improvements 共同定义 K3 family,并重新搜索 batch、LR、TPP 和 shape; 比较发生在 held-out OOD validation loss–FLOPs 曲线。它不是吞吐、参数、单组件或所有 benchmark 的 2.5×。

13 MULTIMODAL DATA TAXONOMY

多模态数据不是“图片 + 一句 caption”,而是六种监督结构

Caption 教物体与属性,interleaved document 教跨段关系,OCR / perception 教读取和定位, video 教时间,visual code 则提供可执行程序与渲染结果之间的结构对应。

CAPTION

图片 ↔ 描述

学到:物体与属性

风险:短、弱关系、易模板化

INTERLEAVED

图文交错文档

学到:跨段落图文依赖

风险:解析和对齐困难

OCR

像素 ↔ 文字 / bbox

学到:读图与定位

风险:识别错误与坐标漂移

PERCEPTION

区域 / 坐标 / 类别

学到:空间与检测

风险:标注体系不一致

VIDEO

帧 + 时间 + 文本

学到:动态过程

风险:重复帧、字幕错时、Token 巨大

VISUAL CODE

程序 ↔ 渲染

学到:结构、布局、可编辑生成

风险:renderer / 模板偏差

PROGRAMSVG · HTML · Game · CAD · 3D
render
PIXELSlayout · shape · frame · schematic
verify / edit
SUPERVISIONcode ↔ visual ↔ coordinate
MM1 与 K3 的互补读法

MM1 用较受控实验说明 caption、interleaved、text-only mixture 非常关键,并报告 image encoder、resolution、visual Token 数 在其设置中比 connector 更重要;K3 则展示 frontier native-multimodal taxonomy。二者规模和数据不同,不能直接比榜单。

14 FOUR INDEPENDENT EXPERIMENTS

亲手改变阈值、权重和课程,看“更多数据”为什么不是一个单调旋钮

四个实验分别付体量、唯一性、混合和变换账;数值是为解释关系设计的确定性教学模拟。 K2、K3、DeepSeek 的公开数字只在对应预设和证据说明中出现。

INTERACTIVE / DATA & PRE-TRAINING LAB

同一个“数据量”,可以藏着四种完全不同的训练经历

四个实验均为确定性教学模型。论文中的公开数字只在预设与说明中按原范围引用; 互动输出不预测 Kimi、DeepSeek 或任何真实模型的 loss、能力与数据配方。

PIPELINE LEDGER

删除 80% 不一定更好,保留 80% 也不一定更安全

各阶段按顺序作用:解析 → 质量过滤 → 去重 → 许可 / PII / 污染隔离。 图中统计按文档计;Token、字节与语言保留率必须另记。

TRAINABLE DOCS456K

通过全部阶段的文档

RETENTION45.6%

按文档,不是按 Token

QUARANTINED19K

可审计隔离,不是静默删除

EST. TOKENS0.57B

按 1,250 Token / 文档估算

多数语言保留55%
长尾语言保留39%
代码 / 数学保留50%
怎样读保留率整体保留率只是体量账;长尾语言的模拟保留率更低,提示必须做分域审计。

隔离区应保留 source id 与触发原因;删除后无法追溯,会让许可更新、误删复盘和 benchmark 修正都失去入口。

15 EVIDENCE & AUDIT

一条数据结论要进入正文,至少要携带单位、范围和未知项

A / FULL TEXT

正文 / 表 / 附录已读

K3、K2、DeepSeek LLM / Math / V2 / V3 / V4 的数据章节属于这一层。

B / OFFICIAL ABSTRACT

官方摘要已核对

只能支持摘要明确写出的模型、预算与作者结果;不能补造正文细节。

C / DISCOVERY LEAD

只知道值得查

Grok、搜索结果或二手综述只能进入研究队列,不能承担正文数字。

U / UNDISCLOSED

公开未知

最终工业 mixture、完整 source map、阈值与 contamination audit 不以猜测填空。

KNOWN
  • K2 15.5T 与 rephrasing 表
  • DeepSeek LLM 91-dump dedup 表
  • V2 8.1T、V3 14.8T、V4 32/33T
  • DeepSeekMath 120.2B 与 500B mixture
  • K3 文本 / 视觉 taxonomy 与 context stages
PUBLICLY UNKNOWN
  • K3 总训练 Token
  • K2 / K3 最终 source-level mixture
  • K3 各视觉域数量与 synthetic 比
  • DeepSeek 各代完整许可 / source map
  • 工业过滤阈值、误删率与污染清单
看到“X T 高质量 Token”,逐项追问
  1. unique 还是 seen?
  2. 哪个 tokenizer?
  3. 原始 pool 多大?
  4. 过滤按文档还是 Token?
  5. 去重范围多大?
  6. 各语言 / 域保留多少?
  7. synthetic 如何标 lineage?
  8. 污染怎样定义?
  9. 许可与 PII 如何处理?
  10. 在哪个模型 / 预算上消融?
  11. 额外 pipeline compute 是否计入?
  12. 没有公开什么?

16 2019 → 2026

数据技术的主线:能清洗 → 能比较 → 能按模型和阶段安排

01

T5 / C4

Common Crawl 清洗成为现代预训练入口。

02

CCNet

去重、语言识别与 Wikipedia-like quality pipeline。

03

The Pile

825GiB、22 个异质子集,mixture 公开化。

04

Training-data extraction

逐字记忆、PII 与模型抽取成为实证风险。

05

ROOTS

多语言、协作治理与数据卡进入中心。

06

Deduplication

近重复、validation overlap 与记忆被统一研究。

07

FIM

通过数据重排获得代码补中间能力。

08

DoReMi

280M proxy 学 domain weights,再迁移到 8B。

09

SemDeDup / D4

语义去重与去重后的多样性选择。

10

Dolma / FineWeb / DCLM

开放工具、网页消融与统一数据实验协议。

11

WRAP / SoftDedup / MATES

改写、降权和模型感知选择三条路线。

12

DeepSeek LLM → V3

全局去重、Math corpus、语言再平衡、FIM 与 packing。

13

MM1

多模态 data mixture 的受控消融。

14

Kimi K2 / Swallow

Token utility、知识 / 数学改写与合成持续预训练。

15

DeepSeek-V4 / Kimi K3

自动生成互联网、agentic、原生多模态与百万上下文课程。

17 PRIMARY-SOURCE READING CHAIN

31 个节点:先读流水线,再读去重 / mixture,最后进入 DeepSeek 与 Kimi

初学路径:C4 / CCNet → Pile → Dedup → DoReMi → DCLM → DeepSeek LLM / Math / V3 → Kimi K2 / K3。 治理、污染、多模态和动态选择可以作为四条平行支线。

01Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

T5 与 C4。

02CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data

网页清洗、语言识别与去重。

03The Pile: An 800GB Dataset of Diverse Text for Language Modeling

22 子集 mixture。

04Extracting Training Data from Large Language Models

记忆、抽取与 PII。

05Deduplicating Training Data Makes Language Models Better

近重复与记忆。

06ROOTS: One Massive Multilingual Dataset

59 种语言与治理。

07Efficient Training of Language Models to Fill in the Middle

FIM 数据变换。

08DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining

代理模型学习配比。

09SemDeDup

语义去重。

10D4: Improving LLM Pretraining via Document De-Duplication and Diversification

去重 + 多样性。

11PALOMA

细粒度语料评测与 BPB。

12Dolma: an Open Corpus of Three Trillion Tokens

开放语料与工具。

13The FineWeb Datasets

网页过滤消融。

14DataComp-LM

统一 pool、训练和评测。

15Rephrasing the Web

WRAP 与改写。

16Fewer Truncations Improve Language Modeling

Best-fit packing。

17SoftDedup

按频率降权。

18MATES

模型感知数据选择。

19Investigating Data Contamination in Modern Benchmarks

text 与 ground-truth contamination。

20MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training

多模态 mixture。

21JEST

多模态联合样本选择。

22DeepSeek LLM

dedup、filter、remix 与 tokenizer。

23DeepSeekMath

120.2B 数学语料与公开 mixture。

24DeepSeek-V2

8.1T、中文与过滤取舍。

25DeepSeek-V3

14.8T、packing、FIM 与 128K tokenizer。

26Group-MATES

group-level data influence。

27Swallow: Continued Pre-training with Synthetic Data

Code / Math 合成数据。

28Kimi K2

15.5T、rephrasing 与 WSD。

29Kimi K2.5

原生多模态数据 taxonomy 的前代。

30DeepSeek-V4

32/33T、长文、agentic 与 1M curriculum。

31Kimi K3

四文本域、视觉语料与原生多模态。

NEXT / CHAPTER 06

数据决定模型看见什么;MoE 决定每个 Token 会调用哪一部分参数。

下一章进入稀疏计算:路由、专家特化、负载均衡与集群通信。

进入 MoE 专题 →