00 TWELVE LEDGERS
先把“数据质量”拆成十二个可以追问、可以失败的问题
数据工程最危险的表达是“我们使用了高质量、多样、去重的数据”。它没有说明来源、单位、阈值, 也没有告诉你少数语言、隐私、benchmark 和文档结构发生了什么。下面十二张账是本章的防混淆协议。
来源与治理
URL、快照、许可、robots、地域和删除请求能否追溯?
提取与解析
网页、PDF、代码、OCR 的结构有没有在转文本时被破坏?
语言与领域
混语、方言、代码注释与跨域文档怎样多标签识别?
质量与安全
规则、分类器、人工标注分别在判断什么,误删率多大?
唯一性
完全重复、表面近似和语义相似是否被混成一种重复?
污染与隐私
题干、答案、语义改写、PII 和 secret 分别怎样检查?
混合与采样
每个领域最终看多少 Token、相当于多少 effective epoch?
数据变换
改写、翻译、FIM 和合成后还保留 source lineage 吗?
Token 计量
相同字节被切成多少 Token,跨模型 loss 是否还能比较?
序列与可见性
文档是否被截断;packed sample 能否互相 attention?
课程与配方
什么数据在什么 LR、batch、context 和阶段进入训练?
模型感知价值
样本对哪个模型、验证域和训练阶段真正有用?
算力账数模型处理了多少 Token;唯一性账数真正不同的材料;价值账问这些材料对当前模型与目标有没有用;治理账决定即使有用,是否应该进入训练。
可能是 80 字短帖,也可能是 400 页技术手册。
由 tokenizer 定义;不同语言与词表的压缩率不同。
重复、噪声、结构完整性和课程都会改变边际价值。
01 DOCUMENT LIFE CYCLE
一份网页走到一次梯度更新,中间至少经过十二道门
这不是所有团队唯一的顺序:安全、去重与污染检查可能多次发生,代码和视觉也有专门分支。 但如果一份技术报告完全跳过其中某一步,读者至少应该知道自己失去了哪种证据。
来源快照
保存 URL / dump / commit、抓取时间、原始哈希和权利信息。
正文与结构
去 boilerplate,恢复 PDF 阅读顺序,保留代码、表格、图注与坐标。
语言识别
文档级只是起点;混语与代码注释需要段落级、多标签判断。
领域识别
Web、Code、Math、Knowledge、Vision 并非互斥桶。
质量筛选
硬故障用规则,软价值用分类器,最终用小模型消融校验。
安全与隐私
检测 PII、secret、恶意内容与价值敏感样本;高风险进入隔离区。
唯一性
先 exact,再 fuzzy / semantic;cluster 保留策略同样影响长尾。
评测隔离
题干、答案、解释、翻译与时间边界分开检查。
领域采样
权重决定 seen Token 与 effective epoch,而不只是 corpus 占比。
改写与重排
rephrase、translation、FIM 都要携带源文、teacher 与 verifier 版本。
分词
vocab、normalizer、pretokenizer 改变压缩率、边界与 loss 单位。
组序列与课程
文档边界、mask、长度、LR、batch 和阶段共同定义实际训练经历。
02 EXTRACTION & STRUCTURE
“下载成功”离“得到一个文档”还很远
HTML boilerplate 会把导航模板重复数万次;PDF 双栏若按横向坐标读取,会把两列句子交错; 代码离开仓库与依赖后,可能只剩无法执行的片段。解析质量是数据质量的地基。
导航、cookie banner、推荐栏、SEO 聚合、隐藏文本
正文率、DOM 密度、重复块、编码、标题—正文一致性
双栏错序、页眉页脚、公式拆散、表格与图注失联
layout parser、页级结构、公式/图/引用锚点
vendor、generated、minified、secret、仓库上下文丢失
语言 parser、repo/commit、license、依赖和测试关系
错字、bbox 漂移、阅读顺序、截图与文本不匹配
OCR confidence、坐标系、视觉—文本对齐
重复帧、字幕错时、短 clip 拼接、镜头语义断裂
perceptual hash、timestamp、shot boundary、轨迹完整性
长文件可能只是更大的垃圾袋
binary blob、截断日志、复制页面与无效生成记录可以很长,却没有远距离依赖。
- 完整性开头、结尾、章节、引用与文件格式一致
- 结构性任务需要跨段落、跨帧或跨子任务连接信息
- 唯一性exact / fuzzy;视频还要做 frame perceptual hash
K3 §3.4 正式列出 exact / fuzzy dedup、视频帧感知哈希、规则 / 分类器过滤和 structural validation; 这也是它在 1M context 前先处理“长而无效”材料的原因。
03 QUALITY IS A VECTOR
规则能发现坏文件,分类器能猜测价值,真正的答案还要回到训练消融
“像百科”“像教科书”“语言流畅”只是 proxy。论坛中的稀有工程经验可能不像教科书, 低资源语言的分类器置信度也可能更低。好的 pipeline 必须展示整体收益与分域伤害。
规则
乱码、极短、重复行、无效结构、明确 secret
- 强项
- 可解释、便宜
- 风险
- 规则外噪声漏过;特殊体裁误删
分类器
连贯、教育价值、专业度、模板生成概率
- 强项
- 可扩大到海量语料
- 风险
- 继承标注者与 teacher 偏好
小模型消融
同预算 A/B pipeline 对 held-out slices 的影响
- 强项
- 最接近训练目标
- 风险
- 昂贵;小模型排序未必迁移
人工与策略
许可、隐私、价值冲突、长尾文化
- 强项
- 能处理不可约规范问题
- 风险
- 分歧必须披露,不能藏进单一分数
这是禁止性表达:如果用已有模型偏好筛数据,再用同类 benchmark 证明数据“高质量”,会形成循环定义。
- 同原始 pool 与同 Token 预算;
- 只改变一个 pipeline 阶段;
- 两边分别调必要超参;
- 同时报告 overall loss、语言 / 领域 slices、误删样本与置信区间;
- 把 classifier / parsing 的额外计算计入。
04 EXACT → FUZZY → SEMANTIC
去重越“聪明”,越需要回答它把哪些真正差异看成了重复
Exact dedup 处理字节 / 规范化字符串;fuzzy dedup 比较 shingles;semantic dedup 在表示空间找近邻。 三种方法不是替代关系,也不共享同一个阈值含义。
哈希相等
- 看得见
- 镜像、重复抓取、完全相同文件
- 看不见
- 空格 / 页眉变化、截断、改写、翻译
- 危险
- 误伤少,但把“未命中”误当“唯一”
Shingle + MinHash / LSH
- 看得见
- 正文相同但模板变化、局部增删
- 看不见
- 跨语翻译与深度复述
- 危险
- 共享模板的独立病例、代码样板可能被合并
Embedding 近邻
- 看得见
- 表面不同但内容相似、语义改写
- 看不见
- encoder 不擅长的语言与专业域
- 危险
- 相反立场、近题、翻译和文化长尾被误删
比较范围从 1 个 dump 扩到 91 个,重复才真正显形
报告按文档给出去重率:单 dump 为 22.2%,跨 91 个 Common Crawl dump 为 89.8%。 作者将其描述为删除文档数约为单 dump 方法的四倍。
05 CONTAMINATION · MEMORY · RIGHTS
评测污染、训练记忆和数据权利相关,却必须分开审计
一道题出现在训练集,不必然意味着模型会逐字复现;模型能复现一段 PII,也不要求它来自 benchmark。 许可允许访问,也不自动回答能否训练、再分发数据或发布权重。
题干 / 上下文逐字或近似出现
exact、n-gram、shingle标签、答案、标准解或评分脚本出现
答案规范化、结构匹配题目 / 答案被改写或翻译
retrieval + 人工复核训练快照晚于评测截止或结果公布
版本 / 时间戳稀有长串、PII、secret 可被诱导复现
canary、extraction audit没有时间戳,就无法判定 benchmark 公布前后。
每层报告阈值、候选数与人工复核。
保留触发原因,才能复盘误报与删除请求。
“未命中”不能写成“完全无污染”。
作者从 GPT-2 中抽取出数百个逐字训练片段,包含 PII;其设置还观察到单文档序列也可能被抽取、 更大模型更易受影响。这是风险实证,不是所有模型的固定泄露率。
06 DOMAIN MIXTURE
Corpus 占比、采样权重和训练遍数,是三个不同数字
一个 120B Token 的数学桶在 1T 训练中拿到 20% 权重,会被看约 1.67 遍; 一个 800B 的 Web 桶拿到同样 20%,只覆盖约四分之一。权重相同,不等于 exposure 相同。
每一步从哪个 domain 取样
训练实际处理的 Token
相对 unique corpus 的遍数
人工配比
能加入产品、语言和治理约束;需要大量消融,且最优点会随规模和阶段移动。
按体量平滑
pᵢ ∝ nᵢα;α<1 抬高小域,但不判断小域质量。
代理模型学权重
280M proxy → 8B;作者摘要在 Pile 设置报告 +6.5pp 与 2.6× fewer steps。
模型感知选择
估计当前样本 / batch 对目标 validation 的价值;选择开销、目标偏差和可迁移性必须记账。
DCLM 固定 240T-token candidate pool、模型尺度和 53 项评测,让不同数据 pipeline 在同协议竞争。 作者摘要中的 7B / 2.6T baseline 达 64% 5-shot MMLU、比 MAP-Neo 高 6.6pp 且少 40% compute; 这些数字只属于 DCLM 协议。
07 REPEAT · REPHRASE · SYNTHESIZE
改写不是免费新知识,而是用生成成本换取更多语言表面
原文重复保留事实形式但边际收益下降;忠实改写希望保持事实 / 推理结构并改变表述; 从零合成则可能创造新组合,也最容易继承 teacher 的错误、风格和偏见。
原文多 epoch
没有生成误差;增加记忆与过拟合风险,不增加表面多样性。
忠实改写 / 翻译
必须保留 source lineage、teacher、prompt 与 fidelity verifier。
合成任务 / 轨迹
可以程序化验证,也可能产生 teacher monoculture 与 feedback loop。
一个很有价值、也很容易被过度外推的实验
| 配置 | 改写 | epoch | SimpleQA |
|---|---|---|---|
| raw wiki-text | 0 | 10 | 23.76 |
| 改写一次后重复 | 1 | 10 | 27.39 |
| 十种改写各一遍 | 10 | 1 | 28.94 |
这是 early checkpoint、单一 SimpleQA 与三种组合配置;生产扩展中每个 corpus 最多改写两次。 它不证明“改写越多永远越好”。
08 TOKENIZER AS A METER
Tokenizer 既是压缩器,也是训练数据的计量仪和边界偏置
Perplexity 是平均 token NLL 的指数。同一句话被切成 5 或 12 个 Token,分母已经变了; 跨 tokenizer 更适合看 bits-per-byte 或 byte-normalized loss。
multi-line prompts.
BBPE;newline、punctuation、CJK 分开;数字逐位;约 24GB multilingual tokenizer corpus。
沿用 BBPE;8.1T tokenized corpus,报告中文 Token 约比英文多 12%。
优化 multilingual compression;合并 punctuation + newline,又以随机 token splitting 修复 boundary bias。
继承 V3、FIM 与 token splitting;新增少量 context construction special tokens。
报告给出词表规模;完整 tokenizer 训练语料与跨语言压缩表未公开。
punctuation + newline 合并 Token 提高某些 multilingual compression,却在没有终止换行的 multi-line few-shot prompt 上产生 boundary bias。 V3 训练时随机拆开一部分合并 Token,让模型见到更多边界变体。
09 PACKING · MASK · FIM
把文档塞满序列,不能顺手改变“谁能看见谁”
Packing 解决 padding 与 truncation;attention mask 决定跨样本可见性;FIM 改变 token 顺序以学习中间补全。 三者经常一起出现,却不是同一个优化。
尾部截断少量 padding,但跨文档形成伪上下文。
同序列提升利用率,attention 只在各 sample 内因果可见。
按长度装箱,减少长文档被反复截断。
数据重排获得补中间能力;不是新增架构或新事实。
Packing · 无 cross-sample mask
前面的 packed document 可进入后面 Token 的 causal context。
Packing · sample-level mask
仍提高序列利用率,但不同 sample 的注意力被分块隔离。
<fim_begin> prefix <fim_hole> suffix <fim_end> middle <eos>`0.1` 是 V3 的公开设置,不是所有语言模型或代码数据的通用最优 FIM 率。
10 TRAINING IS A TIMELINE
总 Token 是一张收据;课程才告诉你什么时候学了什么
预训练时间轴至少要叠加 learning rate、batch、context、domain mixture、synthetic / FIM 和 loss coefficient。 “14.8T 支持 128K”绝不等于 14.8T 全部在 128K 上训练。
MuonClip、67M Token global batch;末期阶段按报告表述,不擅自重算成新的官方总量。
Cosine;Per-Head Muon、weight clipping、QB;语言与视觉从头共同优化。
主预训练 4K;MTP loss weight 0.3 → 0.1,batch 在前 469B 墤大。
* Flash 报告明确前 1T dense;Pro dense stage 更长但未给同一简化数值。
K3 比较 cosine 与 WSD 时发现两者的最优 peak LR 和 batch 明显不同;分别独立搜索后 cosine 的最终 loss 更低。 共享一套超参可能只是让其中一种 schedule 穿了不合脚的鞋。
11 DEEPSEEK DATA LINEAGE
DeepSeek 的数据主线不是“8T、14T、32T”,而是每代解决了新的语料问题
从跨 dump 去重,到数学域发现、中文恢复、FIM / packing,再到自动生成互联网、agentic mid-training 和百万上下文, 这条谱系展示了数据工程怎样随模型能力边界一起移动。
DeepSeek LLM
2T(模型训练)dedup → filter → remix跨 91 个 Common Crawl dump 去重,Table 1 的文档去重率从单 dump 22.2% 增到 89.8%;BBPE 100K。
- 仍未公开
- 最终 source mixture、各过滤器误删率与完整许可表。
DeepSeekMath
120.2B Math corpusseed classifier → domain expansion从约 40B deduplicated HTML pages 出发,迭代 URL / domain 发现并去污染;7B 继续训练 500B 的 mixture 公开。
- 仍未公开
- 完整 URL 清单、分类器阈值和所有来源权利映射。
DeepSeek-V2
8.1T Token恢复误删 + 更多中文改进 cleaning 与 quality filter,增加中文并过滤 contentious content;附录承认区域 benchmark 代价与标注分歧。
- 仍未公开
- 价值过滤完整政策、每语言 source 与最终比例。
DeepSeek-V3
14.8T TokenMath / Code + multilingual减少冗余但保留多样性;best-fit packing;无 cross-sample mask;document-level PSM FIM rate 0.1;128K BBPE。
- 仍未公开
- 精确 domain mixture、unique Token、FIM 各域比例。
DeepSeek-V4
Flash 32T · Pro 33T长文 + agentic mid-training过滤批量自动生成 / 模板页,扩文化长尾;sample-level mask;4K → 16K → 64K → 1M,并在 64K 后引入 sparse attention。
- 仍未公开
- 自动生成检测器细节、agentic 占比、每阶段 Token 和 source map。
从能力目标反推数据,而不是只给网页打一个“优质”分
- 约 40B deduplicated HTML pages
- 数学 seed → fastText classifier
- 迭代发现 URL / domain
- benchmark decontamination
- 120.2B multilingual math corpus
- 56% DeepSeekMath
- 20% GitHub code
- 10% arXiv
- 10% 中英 Common Crawl
- 4% AlgebraicStack
领域模型仍保留代码和自然语言;“数学强化”并不等于 100% 数学。
12 KIMI K2 → K3
K2 先提高每个 Token 的利用率,K3 再把文本、视觉与长上下文从头合并
K2 的贡献是把“高质量 Token 稀缺”变成 rephrasing 的受控问题;K3 沿用这条文本 pipeline, 扩进大规模 vision corpus,并选择 native multimodal pretraining。
15.5T curated Token
- Web Text · Code · Mathematics · Knowledge
- 知识:多风格 / 多视角 + chunk-wise AR + fidelity
- 数学:learning-note style + 翻译
- MuonClip · 4K 主训练 · WSD
- 生产中每 corpus 最多改写两次
扩大模态与长度
总训练 Token 未披露
- 同四文本域 + large-scale vision corpus
- caption · interleaved · OCR · perception · video · visual coding
- 绝对坐标 + [0,1] 归一化坐标
- SVG · 3D · Webpage · Game · CAD code-render pair
- 8K → 64K → 256K → 1M
语言和视觉从训练开始共同优化,而不是在一个完成的语言模型后面再接 connector 做 post-hoc alignment。
这是新模型族的 overall scaling efficiency,不是“改写数据让模型快 2.5×”
报告明确说 architecture、data、training improvements 共同定义 K3 family,并重新搜索 batch、LR、TPP 和 shape; 比较发生在 held-out OOD validation loss–FLOPs 曲线。它不是吞吐、参数、单组件或所有 benchmark 的 2.5×。
13 MULTIMODAL DATA TAXONOMY
多模态数据不是“图片 + 一句 caption”,而是六种监督结构
Caption 教物体与属性,interleaved document 教跨段关系,OCR / perception 教读取和定位, video 教时间,visual code 则提供可执行程序与渲染结果之间的结构对应。
图片 ↔ 描述
学到:物体与属性风险:短、弱关系、易模板化
图文交错文档
学到:跨段落图文依赖风险:解析和对齐困难
像素 ↔ 文字 / bbox
学到:读图与定位风险:识别错误与坐标漂移
区域 / 坐标 / 类别
学到:空间与检测风险:标注体系不一致
帧 + 时间 + 文本
学到:动态过程风险:重复帧、字幕错时、Token 巨大
程序 ↔ 渲染
学到:结构、布局、可编辑生成风险:renderer / 模板偏差
MM1 用较受控实验说明 caption、interleaved、text-only mixture 非常关键,并报告 image encoder、resolution、visual Token 数 在其设置中比 connector 更重要;K3 则展示 frontier native-multimodal taxonomy。二者规模和数据不同,不能直接比榜单。
14 FOUR INDEPENDENT EXPERIMENTS
亲手改变阈值、权重和课程,看“更多数据”为什么不是一个单调旋钮
四个实验分别付体量、唯一性、混合和变换账;数值是为解释关系设计的确定性教学模拟。 K2、K3、DeepSeek 的公开数字只在对应预设和证据说明中出现。
INTERACTIVE / DATA & PRE-TRAINING LAB
同一个“数据量”,可以藏着四种完全不同的训练经历
四个实验均为确定性教学模型。论文中的公开数字只在预设与说明中按原范围引用; 互动输出不预测 Kimi、DeepSeek 或任何真实模型的 loss、能力与数据配方。
PIPELINE LEDGER
删除 80% 不一定更好,保留 80% 也不一定更安全
各阶段按顺序作用:解析 → 质量过滤 → 去重 → 许可 / PII / 污染隔离。 图中统计按文档计;Token、字节与语言保留率必须另记。
通过全部阶段的文档
按文档,不是按 Token
可审计隔离,不是静默删除
按 1,250 Token / 文档估算
隔离区应保留 source id 与触发原因;删除后无法追溯,会让许可更新、误删复盘和 benchmark 修正都失去入口。
DEDUP LENS
能找到更多近邻,也就更容易把“相似但不同”删掉
这里给六对已标注教学样本。模式决定相似度来源,阈值决定是否判重; precision、recall 与长尾误伤必须同时看。
被删样本中真重复占比
真实重复被找到的占比
相似但不应删除
被误伤的长尾样本
实际 pipeline 还要定义 shingle、文档分段、候选召回与 cluster representative;这里只演示最后一层判定。
MIXTURE STUDIO
领域权重决定每个数据桶被看几遍,而不只是“占多少”
五个 slider 会归一化为 100%。独立 validation slice 使用一张明确标为教学假设的 transfer matrix; 页面不会把它聚成一个伪“通用能力总分”。
K2、K3 与 DeepSeek 的最终工业 mixture 未完整公开;这些预设只用于理解权重、unique size 与 effective epoch 的关系。
REWRITE × CURRICULUM
改写能增加表达表面,也能把一个错误复制成十种说法
fidelity 与 teacher error 分开控制;下方 curriculum 只展示公开阶段顺序。 synthetic cost 和错误扩增被显式计入,不把生成 Token 当免费新事实。
通过 verifier 的语言表面
教学期望值,不是真实测量
相对原文 Token 的额外生成
当前公开课程阶段
8K → 64K 在预训练;256K → 1M 在 cooldown。报告没有公开各阶段 Token 数和最终文本 / 视觉 mixture。
K2 Table 1 的十次改写是早期 checkpoint / SimpleQA 对照,不是 K3 或 K2 最终生产配方。
15 EVIDENCE & AUDIT
一条数据结论要进入正文,至少要携带单位、范围和未知项
正文 / 表 / 附录已读
K3、K2、DeepSeek LLM / Math / V2 / V3 / V4 的数据章节属于这一层。
官方摘要已核对
只能支持摘要明确写出的模型、预算与作者结果;不能补造正文细节。
只知道值得查
Grok、搜索结果或二手综述只能进入研究队列,不能承担正文数字。
公开未知
最终工业 mixture、完整 source map、阈值与 contamination audit 不以猜测填空。
- K2 15.5T 与 rephrasing 表
- DeepSeek LLM 91-dump dedup 表
- V2 8.1T、V3 14.8T、V4 32/33T
- DeepSeekMath 120.2B 与 500B mixture
- K3 文本 / 视觉 taxonomy 与 context stages
- K3 总训练 Token
- K2 / K3 最终 source-level mixture
- K3 各视觉域数量与 synthetic 比
- DeepSeek 各代完整许可 / source map
- 工业过滤阈值、误删率与污染清单
- unique 还是 seen?
- 哪个 tokenizer?
- 原始 pool 多大?
- 过滤按文档还是 Token?
- 去重范围多大?
- 各语言 / 域保留多少?
- synthetic 如何标 lineage?
- 污染怎样定义?
- 许可与 PII 如何处理?
- 在哪个模型 / 预算上消融?
- 额外 pipeline compute 是否计入?
- 没有公开什么?
16 2019 → 2026
数据技术的主线:能清洗 → 能比较 → 能按模型和阶段安排
T5 / C4
Common Crawl 清洗成为现代预训练入口。
CCNet
去重、语言识别与 Wikipedia-like quality pipeline。
The Pile
825GiB、22 个异质子集,mixture 公开化。
Training-data extraction
逐字记忆、PII 与模型抽取成为实证风险。
ROOTS
多语言、协作治理与数据卡进入中心。
Deduplication
近重复、validation overlap 与记忆被统一研究。
FIM
通过数据重排获得代码补中间能力。
DoReMi
280M proxy 学 domain weights,再迁移到 8B。
SemDeDup / D4
语义去重与去重后的多样性选择。
Dolma / FineWeb / DCLM
开放工具、网页消融与统一数据实验协议。
WRAP / SoftDedup / MATES
改写、降权和模型感知选择三条路线。
DeepSeek LLM → V3
全局去重、Math corpus、语言再平衡、FIM 与 packing。
MM1
多模态 data mixture 的受控消融。
Kimi K2 / Swallow
Token utility、知识 / 数学改写与合成持续预训练。
DeepSeek-V4 / Kimi K3
自动生成互联网、agentic、原生多模态与百万上下文课程。
17 PRIMARY-SOURCE READING CHAIN
31 个节点:先读流水线,再读去重 / mixture,最后进入 DeepSeek 与 Kimi
初学路径:C4 / CCNet → Pile → Dedup → DoReMi → DCLM → DeepSeek LLM / Math / V3 → Kimi K2 / K3。 治理、污染、多模态和动态选择可以作为四条平行支线。
T5 与 C4。
02CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data网页清洗、语言识别与去重。
03The Pile: An 800GB Dataset of Diverse Text for Language Modeling22 子集 mixture。
04Extracting Training Data from Large Language Models记忆、抽取与 PII。
05Deduplicating Training Data Makes Language Models Better近重复与记忆。
06ROOTS: One Massive Multilingual Dataset59 种语言与治理。
07Efficient Training of Language Models to Fill in the MiddleFIM 数据变换。
08DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining代理模型学习配比。
09SemDeDup语义去重。
10D4: Improving LLM Pretraining via Document De-Duplication and Diversification去重 + 多样性。
11PALOMA细粒度语料评测与 BPB。
12Dolma: an Open Corpus of Three Trillion Tokens开放语料与工具。
13The FineWeb Datasets网页过滤消融。
14DataComp-LM统一 pool、训练和评测。
15Rephrasing the WebWRAP 与改写。
16Fewer Truncations Improve Language ModelingBest-fit packing。
17SoftDedup按频率降权。
18MATES模型感知数据选择。
19Investigating Data Contamination in Modern Benchmarkstext 与 ground-truth contamination。
20MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training多模态 mixture。
21JEST多模态联合样本选择。
22DeepSeek LLMdedup、filter、remix 与 tokenizer。
23DeepSeekMath120.2B 数学语料与公开 mixture。
24DeepSeek-V28.1T、中文与过滤取舍。
25DeepSeek-V314.8T、packing、FIM 与 128K tokenizer。
26Group-MATESgroup-level data influence。
27Swallow: Continued Pre-training with Synthetic DataCode / Math 合成数据。
28Kimi K215.5T、rephrasing 与 WSD。
29Kimi K2.5原生多模态数据 taxonomy 的前代。
30DeepSeek-V432/33T、长文、agentic 与 1M curriculum。
31Kimi K3四文本域、视觉语料与原生多模态。