POST-TRAINING / 10 ALIGNMENT · PREFERENCE

模型会续写之后,
怎样学会真正与人协作?

“对齐”不是一瓶最后倒进去的价值药水。本章从自然语言任务接口开始, 把示范、偏好、奖励、策略更新、约束与证据拆成十二张账, 最后看 DeepSeek 怎样混合 GRPO / verifier / GRM,以及 Kimi K3 怎样用九个 RL 专家和 MOPD 整合能力。

LEVEL
L0 直觉 → L3 系统
LEDGERS
12 张独立问题账
PAPERS
44 个一手节点
LAB
4 个交互实验
TIME
约 160–220 分钟
VERIFIED
2026-07-29

00 COMPASS

先拆成十二张账:SFT、RLHF、DPO、RLVR 从来不是同一个问题

初学者常把所有 post-training 都理解成“让回答更好”。但如果不先问目标、监督单位、反馈来源和证据, 同一个 win-rate 上升可能来自事实改善、表达变长、拒答更多,甚至更会迎合 judge。

RELATED / CHAPTER 09
数值精度、优化器与稳定性

如果 PPO、GRPO 的更新与低精度训练还不熟,可先看优化器和训练状态账。

回看训练底座 →
01 / TARGET

行为目标

帮助、安全、诚实、格式还是能力?

02 / UNIT

监督单位

Token、回答、pair、步骤还是轨迹?

03 / SOURCE

反馈来源

人、AI、原则、规则还是环境?

04 / SFT

示范模仿

teacher forcing 实际学到什么?

05 / MEASURE

偏好测量

chosen 的“更好”怎样定义?

06 / REWARD

奖励模型

比较怎样压成一个标量?

07 / POLICY

策略更新

PPO、RLOO、GRPO 怎样移动分布?

08 / DIRECT

直接偏好

DPO 家族消掉了哪些组件?

09 / DISTRIBUTION

数据分布

online/offline 与 on/off-policy。

10 / CONTROL

约束

KL、replay、预算和安全边界。

11 / FAILURE

失效

Goodhart、迎合、长度与拒答。

12 / EVIDENCE

证据

什么结果能证明真的更好?

ONE-SENTENCE MODEL

Post-training 是把“模型能生成什么”重新分配成“在什么条件下更愿意生成什么”;反馈定义方向,优化器负责移动,证据负责检查有没有走歪。

01 BASE MODEL → ASSISTANT

Base model 学的是文本分布;助手还必须学会一套交互合同

预训练看到的互联网文本里同时有事实、广告、争论、角色扮演、错误答案和有害内容。 next-token prediction 能学到广泛能力,却没有理由自动把“用户问题”解释为“请给出最有帮助且安全的回答”。

BASE DISTRIBUTION文章续写论坛争论代码虚构对白错误信息教程

目标:复现训练文本中条件分布

+ post-training
ASSISTANT CONTRACT
听懂任务instruction
服从约束format / tool / budget
权衡目标helpful / honest / safe
承认边界uncertainty / refusal

“能力”与“行为”不要硬切成两半

能力显露

模型可能早已知道答案,只是不懂用户接口;少量 SFT 就能把能力叫出来。

能力注入

高质量代码、数学和工具轨迹也会教新技能,不只是改语气。

行为重排

偏好优化更多是在候选分布里提高受偏好路径、压低其他路径。

一口人话

预训练像读遍图书馆;post-training 像学习接电话、理解委托、遵守流程并对结果负责。

02 INSTRUCTION TUNING

FLAN 与 T0 的关键贡献:把“任务编号”换成可泛化的自然语言接口

传统多任务学习常把任务身份藏在数据集名、输出 head 或特殊标签里。 Instruction tuning 则把任务目标、输入与输出格式写进人能读懂的 prompt, 再在许多任务混合上做监督微调。

NLIpremise / hypothesis

判断 entailment

QAquestion / passage

回答问题

SUMdocument

生成摘要

STRUCTtable / triples

转成自然语言

PROMPT TEMPLATE“请根据以下材料……”

把不同 schema 映射成 text → text

HELD-OUT TASK未见过整类任务

根据自然语言说明尝试 zero-shot 泛化

Natural Instructions

任务说明成为数据对象

FLAN

多任务指令微调

T0

公开 prompt templates

Flan / SNI

扩任务、模型与 CoT

03 SUPERVISED FINE-TUNING

SFT 没有换掉 next-token objective;它换的是条件、样本与 loss mask

给定 prompt x 和参考回答 y,最常见目标仍是 response Token 的负对数似然:

LSFT = − Σt mt log πθ(yt | x, y<t)

mₜ 决定 system/user/padding 是否参与损失;teacher forcing 让每一步看到参考前缀。

CONDITIONSystem + User + history

告诉模型角色、任务、上下文与已经发生的对话。

TARGETAssistant response

参考回答中的每个有效 Token 产生模仿梯度。

UPDATERaise target likelihood

模型不会自动知道参考答案是否唯一、事实是否正确。

LIMA 证明了什么,又没有证明什么

LIMA 在强 LLaMA-65B base 上使用约 1,000 条精心策展示范,不使用 RM 或 RL, 展示少量高质量数据可教会很强的交互风格与任务接口。它支持“预训练承担了大量知识”的假说, 但不能外推成安全、复杂工具使用和所有 base model 都只需 1K 数据。

错误理解

“SFT loss 很低,所以答案事实正确。”

实际能说

模型能高概率复现这组 demonstrations。

还要检查

自由生成、未见任务、事实、安全、拒答和长度。

04 DEMONSTRATION DATA

示范数据的真正稀缺物不是 Token,而是覆盖、质量和“谁来定义好”

InstructGPT 的三类数据具有不同角色:约 13K SFT prompts 带人工示范, 33K RM prompts 带候选排序,31K PPO prompts 只提供 policy rollout 的输入。 把它们合写成“77K RLHF 数据”会丢掉监督结构。

HUMAN EXPERT

人工示范

质量高、贵、覆盖慢;专家也会有单一路径偏好。

USER LOG

真实请求

贴近部署分布,但涉及隐私、选择偏差和快速变化。

SELF-INSTRUCT

模型自举

扩规模与多样性;错误、模板和 teacher 风格会被复制。

EXECUTION

环境轨迹

代码、搜索、工具结果可验证;沙箱和任务覆盖成为瓶颈。

175 SEEDS少量人工任务
GENERATEInstruction / input / output
FILTER格式、重复、有效性
SFT扩大任务接口

05 PREFERENCE MEASUREMENT

人更容易比较两个回答,但“比较容易”不等于“偏好客观”

Christiano 等人在 2017 年选择短轨迹 pairwise comparison, 因为人通常比给稳定绝对分数更擅长回答“哪一个更好”。 到语言模型时代,同一 prompt 生成 2–9 个候选,标注者排序后可展开为 pair。

PROMPT x解释为什么海是蓝色
y₁短且准确policy A · temp .7
y₂长但编造policy B · temp 1.0
y₃安全但回避policy C · temp .7
y₄有帮助但太技术policy D · temp .8
LABELy₁ ≻ y₄ ≻ y₃ ≻ y₂

排序只在这四个候选和 rubric 下成立

每个 preference dataset 都必须附带七个问题

  1. 01候选由谁生成?

    弱 policy 的“赢家”可能仍很差。

  2. 02temperature 与长度上限?

    它们改变候选分布。

  3. 03是否允许 tie / both bad?

    强迫二选一会制造伪信号。

  4. 04rubric 是一维还是多维?

    总体质量会隐藏冲突目标。

  5. 05位置是否随机化?

    AI 与人类都有顺序偏置。

  6. 06多人怎样聚合?

    多数票会抹掉真实分歧。

  7. 07是否来自当前 policy?

    旧 pairs 对新 policy 可能已太容易或 OOD。

06 REWARD MODEL

Bradley–Terry 的作用:把“谁赢”解释成潜在 reward difference

P(yw ≻ yl | x) = σ(rφ(x,yw) − rφ(x,yl))LRM = −log σ(rw − rl)

只识别差值:对同一 prompt 的所有 reward 同加常数,不改变偏好概率。

PAIRchosen / rejected

来自某个候选分布

SHARED RM同一网络分别读两条回答

最后输出一个 scalar

DIFFERENCErw − rl

sigmoid 变成选择概率

Reward model 的两重身份

MEASUREMENT

偏好测量器

在固定 pair test set 上,它像一个分类器;可报告准确率、校准与分组性能。

OPTIMIZATION TARGET

被 policy 主动寻找的地形

一旦拿它训练 policy,模型会寻找高分区域,可能走出 RM 见过的分布。

分类准确率不是全部

99% 的简单 pairs 可能掩盖两个强回答之间的细微失真;RewardBench 因此专门加入 hard、safety、reasoning 与 OOD comparisons。

07 PPO / RLHF

InstructGPT 的三阶段管线,每一段在解决不同的优化困难

STAGE 1

SFT POLICY

人工 demonstration 给出稳定 cold start 和交互格式。

稠密 Token loss
STAGE 2

REWARD MODEL

K-way ranking 变成 pairwise preference classifier。

完整回答 scalar
STAGE 3

PPO-PTX

向当前 policy 采样,优化 RM,同时加 KL 与 pretraining mix。

on-policy rollout
max E[rθ(x,y) − β log(πRL(y|x) / πSFT(y|x))] + γ E[log πRL(xpretrain)]

论文默认的 InstructGPT 指 PPO-ptx;纯 PPO 令 γ=0

POLICY生成新回答

需要反向更新

REFERENCE计算 KL

冻结 SFT policy

REWARD MODEL给整段打分

冻结偏好代理

VALUE / CRITIC估计 advantage

降低 policy-gradient 方差

PPO 是通用 RL 算法,不等于 RLHF。RLHF 还包括如何采集反馈、训练 RM、定义 reference、 组织 rollout、计算 return、处理长度与评价最终模型。RLOO、GRPO 可以省 critic, 却不会自动修复有偏 reward。

08 CONSTRAINTS

KL 不是“防止模型学太多”,而是给代理奖励画一条可控活动半径

πref语言质量与已知行为
高分未知 OOD 峰Shortcut
低 KL中 KL高 KL
REFERENCE KL

分布锚

限制 policy 离开 RM 训练支持区的速度。

PPO CLIP

单步锚

限制新旧 policy ratio 的一次更新。

PTX / SFT REPLAY

能力锚

保留预训练知识与基础语言能力。

BUDGET / RULE

行为锚

限制长度、语言、提交次数与安全边界。

Alignment tax 是一个需要测量的 trade-off,不是口号

InstructGPT 用 pretraining mix 缓解部分 public NLP 回退;DeepSeek-V2 也明确报告 human preference alignment 对部分标准 benchmark 的负面影响。必须同时看目标行为改善与基础能力退化,不能只看 chat preference。

09 RLAIF · CONSTITUTION

AI Feedback 扩大的是监督吞吐;“应该奖励什么”仍要由人定义边界

Constitutional AI 包含两个不同阶段,不能只记住“AI 自己评价自己”:

HUMAN INPUT一组书面原则

定义 harmlessness 与应答边界

SL-CAI生成 → 自我批评 → 修订

修订回答成为 supervised data

RL-CAIAI 比较候选 → preference model

再用 RL 优化 policy

HUMAN原则、rubric、种子与最终验收

决定目标与不可接受边界。

AI LABELER扩展 critiques、revisions、preferences

提高覆盖和速度,也复制 teacher 偏差。

POLICY学习 AI 标签压缩后的行为分布

不能超出评价器能可靠区分的区域太远。

10 DIRECT PREFERENCE OPTIMIZATION

DPO 的妙处不是“不要 reward”,而是把 reward 写成 policy 相对 reference 的 log-ratio

从 KL-regularized reward maximization 的最优 policy 出发:

π*(y|x) ∝ πref(y|x) · exp(r(x,y) / β)r(x,y) = β log(π*(y|x) / πref(y|x)) + β log Z(x)

同一 prompt 内比较两回答时,log Z(x) 抵消。

PREFERENCE MODELBradley–Terry

reward difference → 选择概率

CONTROLKL to reference

定义可接受 policy 距离

DIRECT LOSSΔ log(π / πref)

直接训练 policy 排序 pairs

LDPO = −log σ(β[(logπθ−logπref)w − (logπθ−logπref)l])

DPO 通常使用固定 pair dataset;它省去显式 RM、value 和在线 PPO loop。

一口人话

不要只问“模型现在更喜欢 A 还是 B”,而问“相对出发模型,A 的概率涨幅是否比 B 更大”。

11 DIRECT PREFERENCE FAMILY

DPO 之后不是“每篇都更简单更强”,而是在修改四个不同假设

方法反馈格式Reference核心变化最容易误写
DPO

chosen / rejected pair

需要

policy/reference log-ratio

不是没有 reward 假设
IPO

pair

需要

有限 margin 回归

τ 不等于 DPO β
KTO

可非成对 binary

通常需要

prospect-theoretic utility

不要求同 prompt pair
ORPO

pair + target

不需要

NLL + odds ratio

仍包含 SFT 部分
SimPO

pair

不需要

平均 log-prob + margin

长度归一不能漏
RRHF

ranking / 多候选

不需要

序列分数排序

不是 DPO 特例

比较算法时必须固定四个变量

01Preference data

同一 prompts、pairs、候选质量与过滤。

02Algorithm

目标、reference、长度与 β / margin。

03Reward model

PPO 使用哪个 RM,如何训练和验证。

04Policy prompts

在线 RL 实际从什么分布采样。

没有这些控制,“DPO 赢 PPO”或“PPO 赢 DPO”都可能只是数据、实现或在线探索差异。

12 DISTRIBUTION

Online / Offline 与 On-policy / Off-policy 是两张坐标轴

FEEDBACK × ROLLOUT
接近当前 Policy
旧 Policy / 固定数据
反馈持续更新
Online preference + on-policy

当前 policy 采样、即时获取新标签;贵但贴近部署分布。

Online feedback + stale rollout

长轨迹跨迭代;需要 importance correction / clipping。

反馈固定
Fixed RM + fresh rollout

典型 PPO:rollout 新,reward proxy 固定;仍可能优化出 RM OOD。

Offline pairs

经典 DPO:便宜稳定;pairs 对新 policy 可能太旧或太容易。

DPO固定 pairs

训练时不需要采样当前 policy

PPO近 on-policy rollout

需要 rollout / reward / value loop

K3 PARTIAL ROLLOUT超长轨迹跨迭代

自然产生 extreme off-policy

13 FAILURE MODES

Reward hacking 不是模型“邪恶”,而是代理目标允许更便宜的高分路径

PROXY REWARDGOLD / HUMAN过优化区优化强度 / KL / BoN
CONTROLLED EVIDENCE

Gao et al. 2022

论文用固定 gold RM 模拟“人”,再训练较弱 proxy RM。曲线是受控 synthetic setup,不是所有真实 RLHF 的通用函数。

LENGTH

越长越高分

完整感、分点和重复成为 shortcut;K3 GRM 明确加入 verbosity budget。

SYCOPHANCY

迎合错误前提

用户 approval 与 honesty 冲突时,单一总体偏好会奖励附和。

OVER-REFUSAL

安全等于全拒

只测 should-refuse 会鼓励对无害请求也拒绝。

FORMAT HACK

命中解析器

规则 verifier 可能被答案格式、测试覆盖或沙箱漏洞利用。

RM OOD

走出评分器视野

policy 主动寻找 RM 没见过的高分文本。

COLLAPSE

偏好单一风格

离线 pairs 可能让回答变得同质,覆盖和多样性下降。

14 EVIDENCE LADDER

“模型变好了”必须同时穿过训练、代理、行为和外部结果四层证据

01TRAINING SIGNAL

SFT loss、DPO loss、PPO reward

只证明优化器在工作
02PROXY VALIDATION

RM pair accuracy、RewardBench

只证明代理在测试 pairs 上排序
03BEHAVIOR

blind human / LLM judge / safety suites

证明指定人群或 judge 的偏好
04OUTCOME

单元测试、用户成功率、环境结果

最接近任务目标,仍受 verifier 定义限制
PAIR ACCURACY能否挑对这对回答

不能证明 policy 生成的新分布。

WIN-RATE谁在指定 rubric 下更受偏好

要控制长度、位置、judge 和 sampling。

KL离 reference 多远

不是好坏分数,只是距离/约束口径。

PASS RATE环境定义的结果是否成功

开放式帮助、安全仍需额外评价。

15 DEEPSEEK / EARLY ALIGNMENT

DeepSeek 的演化不是“DPO 换成 GRPO”,而是反馈来源和任务结构一起改变

SFT → DPO

1M+ SFT;helpfulness / harmlessness pairs;DPO 一轮。

开放聊天偏好

Two-stage GRPO

reasoning alignment 后接 helpful / safety / rule 多奖励。

critic-free group relative

SFT + RM + GRPO

expert distillation、规则 RM、模型 RM 与 GRM 探索。

规则优先
BASEDeepSeek-V2 Base
SFTInstruction / reasoning / writing
RL 1Reasoning reward
RL 2Helpful + Safety + Rule

DeepSeek-V2 自己指出的三个边界

  • SFT 数量与质量都重要:少量数据可起步,开放写作的覆盖仍需要规模。
  • Alignment tax:human preference alignment 会伤害部分标准 benchmark,需要显式缓解。
  • Online / offline 结论依情境:不能从单一实验宣布一种制度永远更好。

16 DEEPSEEK / R1 → V4

从 R1 到 V4:可验证任务用规则,难验证任务转向生成式 rubric

R1-ZERO

Base → rule-based RL

没有初始 SFT;研究规则奖励能否直接激发 reasoning behavior。

DEEPSEEK-R1

Cold start → RL → SFT → broader RL

加入少量高质量 CoT、拒绝采样、约 800K supervised data 与通用对齐。

DISTILLED MODELS

Teacher data → SFT

只做 SFT,不等于复制 R1 的 RL 训练路径。

EASY TO VERIFY

数学 · 代码 · Kernel

ground truthcompilerunit testsnumeric error

奖励便宜、清晰,但测试覆盖和解析器仍可被利用。

HARD TO VERIFY

写作 · 研究 · 开放帮助

rubricGRM reasoningscorepadconstraints

V4 明确放弃传统 scalar RM,改用 rubric-guided generative reward model。

Reasoning + Agent + Alignment

合并进一段大规模 GRPO

Curated SFT

能力与行为 cold start

Rules + GRM → GRPO

按可验证性选择反馈

17 KIMI / K2 → K3

Kimi 的主线从“聊天偏好”走向长轨迹执行、预算控制与能力整合

Long-CoT RL

128K RL context、partial rollout、long2short 与 online mirror-descent surrogate。

Agentic Post-training

verifiable reward gym、self-critique rubric、PTX、预算与 temperature decay。

Unified Agent RL

视觉、工具与并行 agents;100K concurrent tasks 与 token-level clipping。

Multi-effort Experts

九个专门 policy、百万 Token agentic RL 与 MOPD consolidation。

反馈源随任务改变

18 KIMI K3 / THREE STAGES

K3 的 post-training 要分成三份看:冷启动、专家成长、统一整合

STAGE 1 · SFT

建立可用起点

扩展 Kimi 既有 SFT 数据,覆盖 general、agentic、coding;从这一阶段开始做 MXFP4/MXFP8 QAT。

稠密 demonstration loss
STAGE 2 · RL

九个专门专家

3 domains × low / high / max;各自学习任务与 Token 预算的最优策略。

outcome / GRM / environment reward
STAGE 3 · MOPD

回到一个统一模型

student 自己 rollout;对应 teacher 对每个 Token 提供 clipped log-ratio reward。

dense per-token teacher signal
DOMAIN × EFFORT
LOW
HIGH
MAX
GENERAL
T₁T₂T₃
GENERAL AGENT
T₄T₅T₆
CODING
T₇T₈T₉
rOPD(yt) = clip(sg[log πteacher(yt|prefix) / πstudent(yt|prefix)], −Rmax, Rmax)

teacher 不替 student 生成整条轨迹;student 在自己访问到的状态上接受稠密信号。

Partial rollout

同一长轨迹跨训练迭代,解决 long-tail latency,却产生 extreme off-policy。

MOPD

当前 student rollout 上的多教师能力整合;不是普通离线 teacher-forcing。

QAT

服务成本约束贯穿 SFT/RL;它不定义 helpfulness 或 reasoning reward。

INTERACTIVE / FOUR-VIEW LAB

把“对齐”拆成四个不相互冒充的实验

所有数字都是教学模拟,用来展示目标函数和反馈结构;不是任何模型的训练日志或产品指标。

QUESTION

SFT 到底在模仿 prompt,还是只模仿 assistant?

真实 chat template 会把角色标记也编码成 Token;是否计入 loss 由 mask 决定,而不是由颜色决定。

CONDITION<system>94%
CONDITION请简洁回答66%
CONDITION<user>91%
CONDITION为什么海是蓝色?42%
TARGET<assistant>87%
TARGET阳光72%
TARGET进入海水后58%
TARGET红光更易被吸收36%
TARGET蓝光更易散射返回29%
TARGET因此看起来偏蓝63%
LOSS TOKENS6 / 10

真正进入交叉熵求和的 Token

MEAN NLL0.72

只反映这条示范的拟合难度

TEACHER FORCINGON

第 t 步总能看到参考答案的前缀

SFT 正在学习一条高质量示范,但它没有直接比较其他可能回答。

如果 demonstration 本身错误,交叉熵仍会忠实提高错误 Token 的概率;loss 并不知道“事实正确”。

交互图 10四个实验依次回答:示范怎样产生 Token 梯度、偏好怎样变成代理标量、policy 怎样更新,以及现代配方怎样组合多种反馈。

19 READING CHECKLIST

遇到一个新的“对齐算法”,先问这十四个问题

01目标行为是什么?
02base / SFT 起点是谁?
03监督落在 Token、pair 还是 outcome?
04反馈来自人、AI、规则还是环境?
05候选由哪个 policy 生成?
06允许 tie / both bad 吗?
07显式 RM 如何验证?
08是否有 reference / KL?
09online、offline、on/off-policy?
10长度与 mask 怎样处理?
11训练时需要几个模型?
12最可能的 reward shortcut?
13是否报告 alignment tax?
14最终证据来自谁的评价?
FAST REJECTION RULE

如果一篇论文只给训练 reward、RM score 或单一 LLM judge,而没有控制长度、reference、候选分布与外部结果, 那么“alignment improved”仍是待证明结论。

20 READING PATH

按四层进入,不需要第一天就推完 PPO 与 DPO

L0 · 25 MIN

先看反馈角色

本章 00、01、05、09、13;能说清人、AI、规则和环境分别给什么信号。

L1 · 45 MIN

掌握四个目标

读 03、06、07、10;能区分 SFT、RM、KL-RL 与 DPO loss。

L2 · 70 MIN

回到关键论文

Christiano → Stiennon → InstructGPT → DPO → CAI → Reward Overoptimization。

L3 · 90 MIN

拆现代系统

DeepSeek-V2/V3/R1/V4 与 K2/K3;同时核对 rollout、模型数、约束和 verifier。

PRIMARY PAPER CHAIN

44 个关键节点:按问题接力,不按年份堆名字

每个链接指向论文、会议页或官方技术报告;它们承担不同证据角色,不能只按 benchmark 排序。

01
Deep Reinforcement Learning from Human Preferences

把人类对轨迹片段的比较拟合成 reward predictor,再优化行为 policy。

02
Proximal Policy Optimization Algorithms

用 clipped surrogate 限制 on-policy 更新幅度;原论文没有语言模型或人类偏好。

03
Fine-Tuning Language Models from Human Preferences

把 reward model、reference KL 与 PPO 接到生成式语言模型。

04
Learning to Summarize from Human Feedback

在摘要任务完整验证 comparison → RM → PPO,并展示过度优化边界。

05
Natural Instructions

用声明式任务说明研究跨任务泛化,建立 instruction interface 数据范式。

06
Finetuned Language Models Are Zero-Shot Learners

FLAN 证明多任务 instruction tuning 可改善未见任务的 zero-shot 表现。

07
Multitask Prompted Training Enables Zero-Shot Task Generalization

T0 用 prompt templates 统一 62 个数据集,并严格留出整类任务。

08
WebGPT

把浏览器行动、引用回答与人类偏好训练接入同一 Agent 前身。

09
Training Language Models to Follow Instructions with Human Feedback

InstructGPT 建立 demonstration SFT → RM → PPO-ptx 的通用助手管线。

10
Training a Helpful and Harmless Assistant with RLHF

把 helpfulness 与 harmlessness 明确分账,并实验在线迭代偏好。

11
Super-NaturalInstructions

以 1,600+ tasks 检验根据自然语言指令泛化的边界。

12
Scaling Instruction-Finetuned Language Models

扩展 Flan task mixture、模型规模与 CoT 数据,研究 instruction scaling。

13
Scaling Laws for Reward Model Overoptimization

在 proxy–gold 受控设置量化 Goodhart 曲线,区分 BoN 与 RL。

14
Constitutional AI

以书面原则驱动自我批评、修订和 AI preference,再做 RLAIF。

15
Self-Instruct

用 175 个 seeds 自举生成、过滤 instruction/input/output,再做 SFT。

16
OpenAssistant Conversations

开放多轮对话树、ranking 与标注流程,降低 post-training 数据门槛。

17
RRHF

用回答序列得分的排序损失对齐多来源候选。

18
SLiC-HF

用 sequence likelihood calibration 直接推动 chosen 与 rejected 分离。

19
LIMA

用约 1K 精选示范检验强 base 上少量高质量 SFT 的接口作用。

20
AlpacaFarm

提供 AI 模拟反馈、自动评测与 PPO/DPO/BoN 基线实现。

21
Direct Preference Optimization

在 Bradley–Terry 与 KL-regularized optimum 下,用 policy/reference log-ratio 消去显式 RM+RL。

22
RLAIF vs. RLHF

在摘要、helpful、harmless 三类任务直接比较 AI 与人工 preference labels。

23
UltraFeedback

规模化多候选、多维度 AI feedback,成为开放偏好训练的重要数据源。

24
A General Theoretical Paradigm to Understand Learning from Human Preferences

分析确定性偏好与 DPO 过拟合,并提出有限间隔的 IPO。

25
Zephyr

以 dSFT + UltraFeedback AI preference + dDPO 展示开放蒸馏式对齐。

26
KTO

用 prospect-theoretic utility 处理可非成对的 desirable / undesirable 信号。

27
Back to Basics: REINFORCE Leave-One-Out

说明 critic-free RLOO 可成为更简单的在线 RLHF 基线。

28
ORPO

把 SFT NLL 与 odds-ratio preference penalty 合成无 reference 单阶段目标。

29
RewardBench

直接测试 RM 在 chat、hard、safety、reasoning 与 OOD pairs 上的排序能力。

30
SimPO

用长度归一平均 log-prob 与目标 margin 构造 reference-free implicit reward。

31
Unpacking DPO and PPO

把 preference data、算法、RM 和 policy prompts 四个变量拆开做公平比较。

32
Tülu 3

开放数据策展、SFT、偏好训练、RLVR 与评测的完整 recipe。

33
DeepSeek LLM

公开 1M+ SFT、helpful/harmless preference 与 DPO 的早期 DeepSeek 管线。

34
DeepSeekMath

提出 GRPO,用同题成组相对奖励替代 learned critic。

35
DeepSeek-V2

把 reasoning alignment 与 human preference alignment 分成两个 GRPO 阶段。

36
DeepSeek-V3

组合 expert distillation、SFT、规则/模型 RM、GRPO 与生成式 reward 探索。

37
DeepSeek-R1

分清 base→rule RL 的 R1-Zero,与 cold-start/SFT/多阶段 RL 的正式 R1。

38
DAPO

用 Clip-Higher、Dynamic Sampling、token loss 与 overlong shaping 稳定长 CoT RL。

39
Kimi K2

把 verifiable rewards、self-critique rubric、预算与 PTX 放入 agentic post-training。

40
DeepSeek-V3.2

把 reasoning、agent 与 human alignment 数据合并进大规模 GRPO。

41
Kimi K2.5

扩展 unified multimodal/agentic RL、token-level off-policy clipping 与并行 agent。

42
DeepSeek-V4

以 SFT→GRPO 为主线,规则验证 easy tasks、GRM 处理 hard-to-verify tasks。

43
MOPD

学生在自己的 rollout 上接受多教师逐 Token log-ratio signal。

44
Kimi K3

SFT→九个领域/effort RL experts→MOPD,并扩展到百万 Token agentic RL。