EVALUATION / 15 SCORE · PROTOCOL · THREAT MODEL

一个模型到底强不强,
不能只看那一个粗体数字

从 perplexity、BLEU 和 MMLU 走到代码 Verifier、LLM Judge、Arena、动态基准、 Agent 最终状态与安全威胁模型;最后逐字段复原 DeepSeek-R1 与 Kimi K3 的评测协议, 学会把“谁更强”改写成一条有限、可复核、带成本的结论。

LEVEL
L0 直觉 → L3 审计
LEDGERS
22 张测量账
NODES
80 个一手节点
LAB
4 台互动测量仪
TIME
约 300–420 分钟
VERIFIED
2026-07-29

00 TWENTY-TWO LEDGERS

看到排行榜,先把一个数字拆成二十二张账

“A 比 B 高 3 分”把测量对象、样本、提示、采样、工具、裁判、统计与成本压成了一个标量。 这句话可能有用,但只有把下面二十二张账补齐,才知道它允许多强的结论。

Q1 / CONSTRUCT

构念

到底想测知识、推理、行动、偏好还是风险?

指标名不是能力本身;先写出目标能力的可观察定义。

Q2 / UNIT

测量单位

token、题、回答、episode 还是完整系统?

不同单位不能因都叫百分比就直接平均。

Q3 / DISTRIBUTION

任务分布

样本代表哪些用户、领域、语言、难度和时间?

测试集只是现实分布的一份带偏样本。

Q4 / METRIC

指标

loss、accuracy、F1、win rate、resolved 各丢掉什么?

每个指标都把一部分目标写进了分母。

Q5 / PROMPT

提示

shots、CoT、模板和答案抽取是否一致?

同名 benchmark 不会自动生成相同协议。

Q6 / DECODING

解码

temperature、top-p、长度与 seed 怎样进入成绩?

解码是被测系统的一部分,不是脚注。

Q7 / SAMPLING

重复采样

pass@1、pass@k、cons@k 与 pass^k 测什么?

搜索能力、投票能力和可靠性是三个方向。

Q8 / HARNESS

脚手架

system prompt、工具和上下文管理贡献多少?

Agent 分数不能全部归到 checkpoint。

Q9 / VERSION

环境版本

数据、容器、网站、依赖和 verifier 是哪个快照?

动态环境会漂移,复跑必须带日期。

Q10 / JUDGE

裁判

exact match、单测、人类和 LLM Judge 谁定义好?

裁判也有误差、偏好和覆盖盲区。

Q11 / AGGREGATE

聚合

macro、micro、权重和缺失项怎样处理?

总分永远包含价值判断。

Q12 / UNCERTAINTY

不确定性

样本数、方差和区间足以支持排名吗?

0.1 分差不等于确定的能力差。

Q13 / LEAK

污染

原文、答案、格式、语义与时间泄漏怎样分?

n-gram 无重合只能排除一小类泄漏。

Q14 / QUALITY

饱和与错误

高分是能力强、题太易还是标签错?

基准不是发布后永远正确的法规。

Q15 / FRESH

动态性

怎样保持新鲜,又保留跨时间可比?

纯动态题也会引入难度漂移。

Q16 / PREFERENCE

偏好与 Arena

谁在投票、看见什么、被怎样配对?

Elo 是相对排序,不是绝对智力单位。

Q17 / COST

成本

用了多少 token、工具、重试、延迟与金钱?

最高准确率未必是可部署的最优点。

Q18 / ROBUST

鲁棒与子群

换语言、提示、长度或扰动后是否稳定?

平均值不能代表每个用户群。

Q19 / FACT

事实性

长回答中的原子事实被哪些来源支持?

流畅、自洽与有引用都不自动等于正确。

Q20 / THREAT

威胁模型

攻击者能改什么、访问几次、目标是什么?

不同攻击权限下的 ASR 不能直接横比。

Q21 / BOUNDARY

安全边界

危险服从与无害过拒怎样同时测?

什么都拒绝不等于安全又有用。

Q22 / DISCLOSURE

披露与审计

配置、输出、代码、版本和来源能否复核?

一张排行榜不能替代完整实验记录。

ONE-SENTENCE MODEL

评测是一项测量工程:先定义想测什么,再固定任务分布、系统边界、资源预算与裁判,最后用不确定性和证据等级限制结论。

01 MEASUREMENT PROTOCOL

Benchmark 不是一张题单,而是一份十二字段合同

在物理测量里,我们不会只写“温度 25”,却省略摄氏、测量位置、时间和仪器。 LLM 榜单同样需要单位。最小的完整表达不是 score(model),而是:

OBSERVED SCOREmeasure(task distribution, dataset/split, model/wrapper, prompt/shots, decoding/samples, effort/tools, harness/context, environment/verifier, judge/rubric, aggregation/uncertainty, cost)
01

构念效度

我们说要测“推理”,题目是否只靠记忆或格式线索就能做对?

题目真的测到了目标吗?
02

内部效度

差异是否被污染、Prompt、Harness、Judge 或样本预算劫持?

分数真由所声称的变量造成吗?
03

外部效度

实验室高分能否迁移到真实用户、语言、工具、时间与风险环境?

结论能走出测试集多远?
弱写法“K3 在 HLE 得 56,所以知识推理是 56。”
可审计写法“K3 报告在 max effort、给定工具与采样协议下作者自报 HLE 56.0;无工具设置为 43.5,二者测的是不同系统条件。”

02 SEVEN SHIFTS

评测史不是“题越来越难”,而是测量边界不断外扩

每一代 benchmark 都修复了旧盲区,也创造了新盲区。自动代理便宜,却离真实偏好远; 人类和 LLM Judge 能看开放回答,却带来人群、风格与裁判偏差;Agent 更接近真实工作, 却把整个运行系统带进了分数。

01

先用便宜代理加速迭代

BLEU · ROUGE

参考重叠让翻译与摘要可大规模回归,但表面相似不等于语义、事实和风格质量。

02

把通用性做成多任务套件

GLUE · SuperGLUE · MMLU

同一模型跨任务比较成为可能;任务权重、格式敏感和公开题污染开始显现。

03

整体性、动态性与风险进场

Dynabench · BIG-bench · HELM

evaluation 被重新写成场景、适配、指标与报告的组合。

04

可执行结果重新成为硬裁判

HumanEval · DS-1000 · EvalPlus · LiveCodeBench

代码和数学能用测试或 verifier 判分,但测试覆盖和规格质量仍是测量边界。

05

开放回答交给偏好与模型裁判

MT-Bench · Arena · G-Eval · AlpacaEval

没有唯一参考答案的问题可比较了,同时引入顺序、长度、自偏与 Judge 能力。

06

测量单位从回答变成系统

SWE-bench · OSWorld · τ-bench · BrowseComp

Harness、工具、环境、上下文、重试和最终状态共同决定 Agent 成绩。

07

安全从内容标签走向产品威胁模型

RealToxicity · GCG · HarmBench · InjecAgent · AILuminate

发现失败能证明漏洞,没发现失败却不能证明系统安全。

便宜、固定、可重复参考重叠 → 静态题集 → 自动 Verifier
同时推进,而非线性替代
真实、开放、系统化人类偏好 → 动态环境 → 长程 Agent

03 METRICS ARE QUESTIONS

PPL、BLEU 与 ROUGE 都很重要,但它们从未等于“整体能力”

NEGATIVE LOG-LIKELIHOODNLL = −Σt log p(xt | x<t)
CROSS-ENTROPYH = NLL / T
PERPLEXITYPPL = exp(H)
TOKENIZER-ROBUST UNITBPB = NLL / (ln 2 × bytes)

PPL 的直觉是模型在每一步面对的“等效平均分支数”。它只对同一 tokenizer、同一文本预处理、 同一测试分布具有直接可比性。把一句话切成 6 个 token 或 12 个 token,平均单位已经变了; 因此 PALOMA 等工作在 tokenizer 不同时使用 bits per byte。

NLL / PPL

模型给测试序列多大概率?

适合同 tokenizer、同分布的语言建模比较;不直接测指令、事实、工具或安全。

BLEU / ROUGE

输出和参考表面上多相似?

便宜、确定、适合回归;多种合理答案、语义与事实会被压扁。

ACCURACY / EM

最终标签或字符串是否匹配?

清晰但依赖答案 parser、选项顺序、标签质量和格式策略。

PASS@K

k 次尝试里至少一次通过吗?

衡量有 verifier 搜索的潜力,不代表默认单次体验。

WIN RATE

在给定展示下谁更受偏好?

依赖题分布、裁判人群、顺序、长度、风格和对手集合。

RESOLVED

环境最终状态是否满足目标?

更接近真实行动,但强依赖 Harness、权限、版本、预算与 verifier。

没有“最先进指标”

BLEU / ROUGE 仍适合确定性回归;PPL 仍适合语言建模诊断。错误不是使用代理,而是忘记代理和目标之间的距离。

04 BENCHMARK SUITES

把很多任务放到一张表,不会自动得到“通用智能”

GLUE

统一九种 NLU 任务、接口与诊断集,让通用表示可比较。

新盲区:很快饱和。

SuperGLUE

替换为更难任务,并把人类基线、排行榜和工具一并发布。

新盲区:静态公开题仍被生态吸收。

MMLU

57 个学科把知识与解题能力扩到高中、大学和专业考试。

新盲区:选择题格式、题质与文化分布。

BIG-bench

社区汇集数百种任务,寻找规模带来的涌现与失败。

新盲区:任务异质,聚合解释困难。

HELM

把场景、适配、准确、校准、鲁棒、公平、毒性与效率写进透明报告。

新盲区:覆盖越全,协议维护成本越高。

套件总分至少藏着三次选择:选哪些任务、每个任务如何归一、每个任务占多大权重。 因此应先看每个子项与最差切片,再看总分。总分可以用于导航,不能替代诊断。

05 BENCHMARK LIFECYCLE

一个基准会出生、流行、饱和、被污染、修复,也可能退休

01设计定义构念、任务、样本与裁判
02发布代码、数据与 leaderboard 加速采用
03优化模型与 Prompt 围绕公开协议进步
04失真饱和、污染、标签错与生态博弈
05维护重标、加难、动态刷新或退役
故障看起来像维修方法
题目错误

能力强的系统也被判错

专家重标、保留争议、多正确答案

饱和

前沿模型分差趋近噪声

增加难度和区分度,不只增加冷知识

污染

公开题变成训练材料

时间切分、私有题、动态刷新、数据谱系

环境腐烂

依赖、网站或容器无法重跑

镜像、版本、定期重建与可执行快照

目标错位

高分不再代表真实用户价值

重新定义构念,加入现场与纵向效度

06 PROMPT IS PART OF THE TEST

改一个模板,可能既改变模型“理解了什么”,也改变 parser“看见了什么”

01System prompt

角色、安全、工具和输出原则。

02Chat template

special tokens、role 边界和 assistant 起始。

03Shots

示例数量、身份、顺序与是否包含推理。

04Task instruction

direct answer、CoT、结构化格式与语言。

05Parser

从自然输出抽取选项、数字、代码或动作。

协议 AAnswer with A, B, C, or D only.

测得更接近选项选择,但可能压制 reasoning model 的自然轨迹。

协议 BThink step by step, then put \boxed{answer}.

给了额外计算与格式要求;parser 失败和长输出上限会进入分数。

DeepSeek LLM 明确给出 base 与 chat 在部分任务上的 shots 差异;DeepSeek-R1 又因为 few-shot CoT 可能伤害 reasoning model 而采用若干 zero-shot 协议。这里没有一个抽象的“绝对公平 Prompt”: 正确做法是公开、固定,并用多模板敏感性分析说明结论是否稳健。

07 SAMPLING CHANGES THE QUESTION

pass@1、pass@k、cons@k、best-of-N 与 pass^k 不能互换

ONE-SHOT

Greedy / 一次运行

默认产品体验:不给搜索和选择器,只看一次能否成功。

MEAN PASS@1

采样分布下一次成功

对每题多次采样后取正确率均值,能比一次随机运行更稳。

PASS@K

至少一个候选通过

适合有单测或 verifier 的搜索系统;k 越大,成本和成功率都增。

CONS@K

多数答案正确

自一致依赖正确轨迹能汇聚到同一答案;不等于候选覆盖。

BEST-OF-N

选择器挑中最好答案

总成绩同时测生成器和 reward / Judge 的排序能力。

PASS^K

连续 k 次全部成功

测可靠性而非探索;k 增大时分数通常下降。

HUMANEVAL UNBIASED ESTIMATORpass@k = 1 − C(n−c, k) / C(n, k)
INDEPENDENCE INTUITIONat least one = 1−(1−p)k · all = pk
一次成功率 80% 的 Agent
5 次至少一次成功99.97%
连续 5 次全部成功32.77%

同一个 p、同一个 k,两个看似都叫“5 次”的指标却给出相反故事。真实运行还可能相关,所以要报告经验重复分布。

08 CALIBRATION & SELECTIVE RISK

答对多少,和“知道自己什么时候会错”,是两种能力

实际正确率
预测置信度 →

完美校准

P(correct | confidence=q) = q

声称 80% 置信的答案,长期应约有 80% 正确。高准确率不自动校准;校准好也不自动准确率高。

  • reliability diagram 看局部偏差;
  • ECE 把置信桶误差压成一个代理;
  • Brier score 同时惩罚概率误差;
  • risk–coverage 曲线观察拒答后的质量;
  • semantic entropy 合并同义答案再估不确定性。

Kadavath 等人的结果说明,在其任务和格式中,更大模型能给出有希望的自评估; 但 P(IK) 跨任务仍难校准,不能被简写为“模型普遍知道自己什么时候错”。 真正的产品问题往往不是强迫每题都答,而是:在多少覆盖率下,把错误风险压到可接受范围?

09 FIVE LEAKAGE LAYERS

污染不是一个开关,也不能靠一次字符串搜索结案

01

原文污染

测试题、上下文或 benchmark 文件原样出现

exact / fuzzy n-gram 能发现一部分
02

答案污染

题—答配对、解析器、隐藏单测或参考补丁出现

只搜题面会漏掉
03

格式污染

模板、选项位置、verbalizer 或固定答案模式出现

文本相似度通常不充分
04

语义污染

改写题、同一事实、算法或等价证明出现

需要语义、来源与人工审计
05

时间污染

发布后进入继续预训练、SFT、RL 或合成数据

需要数据谱系与时间戳

“干净子集分数低于污染子集”也不能独自证明记忆带来提升,因为两组题可能难度不同。 最低限度要同时披露匹配定义、覆盖率、人工抽检、来源时间、效应量与不确定性。 DeepSeek-R1 明确承认 n-gram 去污染无法阻止测试集改写,这是一条应被保留的诚实边界。

常见错误推理no exact overlap ⇒ no contamination

正确结论只能是:“在当前语料覆盖、归一化与匹配阈值下,未发现这种表面重叠。”

10 FRESHNESS × COMPARABILITY

动态题解决“见过”,却可能失去“同一把尺”

STATIC PUBLIC

固定公开题

任何模型都能复跑,解释清晰;但会被训练生态吸收,且容易饱和。

纵向可比强 · 新鲜度弱
PRIVATE SNAPSHOT

私有时间切片

泄漏风险较低;外部读者无法看题,错误与构念效度更难审计。

新鲜度中 · 透明度弱
FULLY DYNAMIC

持续生成 / 收集

能追新知识和新失败;不同月份题目难度、用户构成与环境都会漂移。

新鲜度强 · 纵向可比弱

Dynabench 用人机闭环造当前难例;FreshQA 刷新快速变化知识;LiveBench 用近期来源与客观判分按月更新; LiveCodeBench 和 SWE-bench Live 利用题目或 issue 的时间切分。它们没有“终结污染”,而是把数据时间和版本 提升为一等协议字段。

11 EXECUTABLE VERIFIERS

代码能运行是巨大进步,但“通过当前测试”仍不等于“完全正确”

L0字符串 / AST

便宜,容易漏掉语义错误。

L1示例单测

能执行,但覆盖路径有限。

L2属性 / 变异测试

扩大输入空间与边界条件。

L3独立实现 / 隐藏测试

更强,仍依赖规格正确。

L4形式化证明器

对形式规格最硬;规格本身仍需正确。

EvalPlus 将 HumanEval / MBPP 的测试大幅扩充,并发现许多原测试未捕获的错误,模型排序也会改变。 DS-1000 又把库 API、数值约束、禁止操作等多条件写进判分。Verifier 的真正优势不是“绝不会错”, 而是它的判分程序更明确、更容易审计和改进。

12 A BENCHMARK REPAIRS ITSELF

SWE-bench 是理解“基准生命周期”最好的完整案例

SWE-bench

从真实 GitHub issue、仓库与合并补丁构造软件工程任务;把评测单位从函数改为仓库状态。

SWE-bench Verified

专业开发者检查任务是否可解、规格是否明确、FAIL_TO_PASS 测试是否公平,保留 500 个高质量样本。

SWE-bench Live

持续从新 issue 构建可执行任务,用时间版本降低静态题被训练吸收的风险。

公开退役信号

OpenAI 官方说明 Verified 已越来越受污染,转而推荐更难、更新、覆盖不同语言的 SWE-bench Pro。

不是“旧成绩作废”

旧分数仍描述当时协议下的历史观察;错误是把它当成 2026 年仍等效、仍干净、仍能区分前沿能力的当前证据。

13 DIAGNOSTIC CHAINS

1M 窗口和一个多模态总分,都必须拆成瓶颈链

LONG CONTEXT

声明窗口 ≠ 有效窗口

检索位置鲁棒多跳整合长输出

Needle 主要测找到一段信息;RULER 增加多 needle、变量追踪与聚合;仍要报告 tokenizer、位置、截断、输出与长度曲线。

MULTIMODAL

总分 ≠ 每个模态环节都强

感知 / OCRGrounding融合推理 / 行动

OCRBench、MMBench、MMMU、Video-MME 的输入与构念不同;图像尺寸、tile、帧采样、工具和 Judge 必须披露。

14 MODEL IS NOT THE AGENT

Agent 的最小测量单位,是“模型—脚手架—工具—环境”

MODEL生成策略

checkpoint、effort、解码

×
HARNESS控制循环

prompt、规划、上下文、恢复

×
TOOLS行动契约

schema、权限、错误反馈

×
ENVIRONMENT世界状态

版本、网络、账户、随机性

×
VERIFIER成功定义

最终状态与禁止副作用

同一个模型换 system prompt、文件编辑器、浏览器工具、上下文压缩策略、重试次数或容器镜像, 就是另一个被测系统。公平比较可以固定 Harness 测模型,也可以允许每家最优 Harness 测产品上限; 但两种赛道必须命名不同,不能混入同一列后只写模型名。

01model ID02system prompt03harness commit04tool schema / permission05environment image / date06context policy07max steps / tokens / wall time08retry / reset09parallel rollouts10verifier11cost12failure taxonomy

15 VERIFY OUTCOMES, NOT THEATER

轨迹像专家,不等于事情真的完成了

弱裁判

读轨迹打分

“分析得很合理”“命令看起来正确”“步骤接近 gold trajectory”。

容易奖励表演、冗长和唯一范例路径。
更强裁判

验证最终状态

仓库测试通过、文件存在、订单状态正确、禁止副作用未发生。

允许多条有效路径,但 verifier 仍需覆盖目标。
单步动作 99%×100 个关键步骤=约 36.6% 全程无错

这是教学独立近似,不是通用 Agent 定律;现实错误会相关,恢复机制也会修复。 但它揭示一个方向:长程任务应报告完成率、失败阶段、重试后成功、连续重复可靠性和尾部成本, 而不仅是平均一步准确率。

16 HUMAN EVALUATION

“人类偏好”不是一个天然、统一、无噪声的真值

至少回答十个问题

  1. 目标用户是谁,标注者是谁?
  2. 需要什么专业资格与语言文化背景?
  3. 如何培训、校准并支付标注者?
  4. 模型身份是否盲化,顺序是否随机?
  5. 允许 tie、both bad、不可判断吗?
  6. rubric 是整体偏好还是逐维评分?
  7. 每项由几人评,分歧是否保留?
  8. 一致性和置信区间怎样计算?
  9. 展示长度、格式和引用是否一致?
  10. 伦理、隐私与有害内容暴露怎样处理?
正确的表述“在这组提示、这类目标用户、这套展示与 rubric 下,A 被该标注者群体偏好。”不是:“人类证明 A 客观更智能。”

17 JUDGE THE JUDGE

LLM-as-a-Judge 解决了规模,却没有消灭测量误差

POSITION

位置偏好

相同答案交换 A/B 顺序,结论会不会翻转?

随机交换、双向评、报告 flip rate
VERBOSITY

长度偏好

更长回答获得更多分,是信息更全还是风格红利?

长度控制、配对短长反例
SELF

自我偏好

Judge 是否偏爱与自身家族或风格相近的回答?

多 Judge、盲化、跨家族元评测
CAPABILITY

能力上限

Judge 自己不会数学、代码或视觉时,如何判别人?

参考答案、工具、专家抽检、分任务裁判
RUBRIC

标准漂移

“helpful”是否偷带风格、安全或篇幅偏好?

逐维 rubric、锚点样例、版本冻结
STOCHASTICITY

采样与版本

同一 Judge 多次结果和线上模型版本是否稳定?

重复采样、日期、模型 ID、解析失败率

MT-Bench / Chatbot Arena 系统讨论了位置、冗长和自增强偏差;G-Eval 说明 rubric 与推理提示 可以提高与人类的一致性,也指出偏好 LLM 文本的可能;LLMBar 则用“真正遵循指令但风格不讨巧” 的答案专门测试 evaluator。结论很清楚:Judge 本身必须有 benchmark。

18 ARENA IS A RELATIVE GRAPH

Elo / Bradley–Terry 是比较图上的相对位置,不是“智力点数”

真实用户提示题目分布
A ↔ BB ↔ CA ↔ DC ↔ D匿名配对 + 投票
统计模型相对强度 + 区间
排行榜某个时间窗的排序
01用户问题分布02配对与曝光策略03投票者 / 专家一致性04tie 与 style 控制05模型精确版本06投票时间窗07bootstrap 区间08分类榜与总榜09异常票清理10成本与长度

Arena 的价值是把真实开放问题和相对偏好带进评测,不是把它神化成无偏真值。 当两个模型区间重叠、题目类别不同或版本更新时,应说“当前数据不足以确定排序”, 而不是强行用小数位制造确定性。

19 AVERAGES HIDE VALUES

平均数不仅压缩数据,也压缩了“谁重要”的价值判断

模型英语中文低资源语言总体 micromacro
A9278318867
B8481728279

如果样本 80% 是英语,micro average 会让 A 看起来领先;给每种语言相同权重的 macro average 则可能让 B 领先。两者都不是“数学上错误”,而是回答了不同分布下的问题。公平、安全和文化评测尤其要:

  • 同时报总体、关键子群、最差组与组间差;
  • 公开权重、缺失项、拒答和无效输出处理;
  • 避免用一个总分抵消某个群体的严重失败;
  • 对多指标、多子组和多次提交处理选择性报告与多重比较。

20 ACCURACY × COST × LATENCY

测试时扩展时代,不报预算的“最高分”越来越难解释

任务成功 ↑
Token / 工具 / 延迟 / ¥ →
NonthinkHighMaxMax + tools被支配:更贵且更弱
输入 token隐藏思考 / 输出 token并行 samples工具调用与网络最大步数 / 重试wall-clock latency金钱 / 能耗满足 SLO 的成功任务

合理比较不一定强迫所有系统同预算。可以报告固定预算下的能力,也可以画完整 Pareto frontier: 在每一个成本点上,谁提供最高成功率?DeepSeek-V4 的 Nonthink / High / Max,以及 K3 的 max effort, 都说明“模型能力”正在变成一条由测试时资源参数化的曲线。

21 WHAT IS THE SAFETY OBJECT?

基础模型、对齐行为、产品防线与部署环境,必须分四层测

L0

Base model

在给定上下文下会生成什么能力和内容?

模型权重本体
L1

Aligned behavior

SFT / RL 后如何遵循、拒绝、校准和解释?

checkpoint 行为
L2

Product wrapper

system prompt、分类器、过滤、监控和速率限制怎样改变行为?

产品防线
L3

Deployment

工具权限、数据、用户、网络、日志与人工升级路径是什么?

真实风险系统

在裸模型上做攻击可以测权重层的稳健性;在产品 API 上做攻击可以测防御总和。两者都有效, 但不能互相冒充。DeepSeek-R1 报告中安全评测所用 wrapper 与裸 reasoning checkpoint 的差异, 正是为什么要先命名对象。

22 THREAT MODEL FIRST

在报攻击成功率之前,先回答攻击者是谁

KNOWLEDGE

知道什么?

黑盒、logprobs、梯度、权重、system prompt、过滤器规则。

CONTROL

能改什么?

用户文本、图片、网页内容、工具返回、记忆、文件、环境状态。

BUDGET

可试多少次?

单次、固定 queries、自适应搜索、多人长期攻击。

GOAL

想达到什么?

非拒绝、有效有害知识、越权动作、泄露秘密、持久化控制。

ACCESS

拥有什么权限?

只聊天、上传文件、联网、执行代码、调用高风险工具。

SUCCESS

怎样才算成功?

Judge 标签、人工效用、真实副作用、最终状态或损失上界。

最小攻击护照target × attacker knowledge × controllable channel × query budget × adaptation × success criterion × defense stack × date

23 SAFETY GENEALOGY

安全评测从“内容像不像毒性”走到“系统是否真的被攻破”

CONTENT & BIAS

RealToxicity · StereoSet · CrowS · BBQ

测生成内容、刻板关联与歧义场景偏差。

RED TEAMING

LM-generated attacks · human red teams

主动寻找模型当前会暴露的有害失败。

JAILBREAK & OVER-REFUSAL

GCG · Jailbroken · XSTest · Do-Not-Answer

同时暴露绕过安全与错误拒绝无害请求。

STANDARDIZATION

HarmBench · StrongREJECT · JailbreakBench · WildGuard

统一行为、攻击、分类器与有害有效性。

AGENT & PRODUCT

InjecAgent · AgentDojo · Cybench · AILuminate

把不可信内容、工具权限、环境行动和标准风险等级带进来。

AILUMINATE 的重要边界

发现失败,可以证明存在漏洞;没有发现失败,不能证明系统安全。

安全测试具有强负向预测力,但覆盖永远有限。一个好等级只描述当前测试范围内的观察。

24 NON-REFUSAL IS NOT HARM

越狱“成功”至少有四道门

01模型没有拒绝refusal bypass
02内容与目标相关relevance
03信息具体、可用utility
04造成能力或现实影响impact under threat model

一些攻击让模型输出很长、看似顺从,却只有空洞警告或错误信息。若分类器只看“是否拒绝”, 就会把这些当成功。StrongREJECT 的核心贡献正是用人工标注关注有害回答的相关性与可用性。 因此最低限度同时报:

unsafe complianceharmful utilityrobust refusalbenign answerover-refusalattack queries / cost

25 UNTRUSTED DATA BECOMES INSTRUCTION

Agent 安全的核心变化:模型开始读取外部世界,并有权限改变它

USER GOAL“总结邮件并生成日程”
TOOL RESULT邮件正文藏有恶意指令
MODEL误把数据当高优先级命令
TOOL ACTION外发数据 / 越权修改

InjecAgent

把恶意指令嵌入工具返回,系统化测间接 Prompt 注入。

AgentDojo

在动态工具环境中同时测实用任务效用与攻击成功。

Cybench

用可执行网络安全任务和子任务诊断真实攻击链能力。

Instruction Hierarchy

把 system / user / third-party 指令优先级显式训练与评测。

这里的防线不是“让模型更会拒绝”一句话:还包括最小权限、数据—指令分离、动作确认、 工具参数验证、秘密隔离、网络策略、审计日志、速率限制和人工升级。安全评测必须覆盖整条链。

26 SAFETY × UTILITY FRONTIER

拒绝越多并不等于越安全:无害可用性必须进入同一张图

模型回答
模型拒绝
有害请求
危险服从需要压低
正确拒绝需要提高
无害请求
正常帮助需要保留
过度拒答XSTest 关注

安全阈值移动会在危险服从和过度拒答之间形成前沿。更好的系统不是简单把阈值调高, 而是提升区分能力、澄清意图、提供安全替代、按权限分级,并对不确定高风险动作升级给人。

27 DEEPSEEK PROTOCOL LINEAGE

沿 DeepSeek 七篇报告,看“模型分数”一步步变成“系统曲线”

DeepSeek LLM / 2024

公开集 + held-out + safety;base/chat 使用不同 shots

证明“同一张表”内部也可能有不同 prompting;需要逐列读脚注。

DeepSeekMath / 2024

Maj@K 提升而 Pass@K 未同步提升

多数投票变好不等于候选覆盖变广;采样指标必须分开。

DeepSeek-V2 / 2024

语言、代码、数学与开放对话分协议评测

架构收益要和训练 token、激活参数、上下文及对话协议共同解释。

DeepSeek-V3 / 2024

Base、Chat、推理、代码与安全分表

一个 checkpoint 的单步能力与产品包装后的行为不是同一对象。

DeepSeek-R1 / 2025

非零温多次采样的 mean pass@1;不同任务 k 不同

表中的 pass@1 不是一次 greedy;采样池和温度属于核心结论。

DeepSeek-V3.2 / 2025

长上下文与 reasoning effort 继续分档

窗口声明、有效利用和测试时计算预算必须一起看。

DeepSeek-V4 / 2026

Nonthink / High / Max;8K / 128K / 384K;Agent 可到 500 tools/steps

所谓模型分数已显式成为 effort、context 与 Harness 条件下的系统曲线。

DeepSeek 特别适合作为评测教学主线,因为它同时公开了 dense、MoE、数学、reasoning、长上下文和 Agent 演化。最值得学的不是记住某张表,而是观察协议怎样随着能力形态改变: shots 分开、Maj@K / Pass@K 分开、采样 pass@1、effort 分档、上下文分档,最后把工具数和步数写进报告。

28 DEEPSEEK-R1 CASE STUDY

R1 的“pass@1”不是一次 greedy;安全评测也不是裸模型行为

WHY SAMPLE?

Greedy 对长推理出现重复与 checkpoint 变异

报告改用 temperature 0.6、top-p 0.95 多次采样,再取样本正确率均值。

HOW MANY?

不同 benchmark 的样本预算不同

AIME / GPQA 64;MATH / Codeforces 16;LiveCodeBench 8。k 不是无关脚注。

PROMPT

部分任务采用 zero-shot

作者指出 few-shot CoT 可能损伤 reasoning model,因此调整协议;比较时必须披露适配。

AGENT HARNESS

SWE-bench 使用 Agentless

成绩同时属于模型与固定脚手架;换搜索、编辑和上下文管理会改变系统。

SAFETY WRAPPER

安全表中的对象含额外包装

不能把产品安全行为直接归因到裸 R1 checkpoint。

CONTAMINATION

n-gram 无法阻止改写污染

作者边界本身就是重要证据,避免把检测写成“已证明无泄漏”。

R1 TABLE CELLcheckpoint × zero/few-shot × T=.6 × top-p=.95 × samples/task × parser/verifier × wrapper

29 KIMI K3 §6

逐字段复原 K3 的公开评测:它报告的已经是多种系统设置

字段报告设置怎样正确解读
MODEL

Kimi K3 Thinking

明确 checkpoint / 产品形态;不可和不同 wrapper 混称“K3”。

EFFORT

reasoning effort = max

比较对象必须使用同等测试时计算,或把它作为成本维度。

SAMPLING

temperature = 1.0

无工具单步题 top-p=.95,Agent 任务 top-p=1;不是默认 greedy。

TOOLS

HLE 同时报无工具 / 有工具

43.5 与 56.0 回答的是两个系统设置,不是同一个模型常数。

HARNESS

任务采用各自脚手架

SWE、终端、浏览、GUI 与自动化任务必须分别披露 harness。

SWE

DeepSWE v1.1;官方 mini-SWE-agent 另报 67.3

同模型换脚手架就是一次重要消融,不应把差异藏掉。

ENV

H20 校准 SWE-Marathon;FrontierSWE 于 2026-07-16 重算

硬件、环境和评测日期都是结果的一部分。

JUDGE

部分任务使用 Gemini 3.1 Pro 裁判

Judge 版本、prompt、rubric 与抽样复核决定开放回答效度。

DATA

AutomationBench 600 个公开任务;内部集频繁刷新

公开与内部、静态与动态必须用不同证据标签。

COST

引用第三方排名与成本时保留来源和时点

外部榜单是带日期的观察,不是永久属性。

AUTHOR-REPORTED / PROTOCOL-BOUND

公开结果只能连同协议引用

下列是 K3 技术报告在其公开设置下自报的点估计,不是本站复跑,也不是脱离 Harness 与预算的模型常数。

93.5GPQA43.5 / 56.0HLE 无 / 有工具67.5DeepSWE81.2FrontierSWE42.0SWE-Marathon91.2BrowseComp84.8OSWorld Verified58.3OSWorld 2.0

最有教学价值的不是哪一项第一,而是报告主动暴露了 Harness 敏感性:DeepSWE v1.1 与官方 mini-SWE-agent 可分别观察;Terminal-Bench 会跨 Harness 报告;BrowseComp 的上下文策略、 SWE-Marathon 的硬件校准、FrontierSWE 的重算日期都进入了分数。这正是未来评测报告应该走的方向。

30 INTERACTIVE LAB

亲手改一次协议,比背十张排行榜更有用

四台测量仪分别对应本章最容易混淆的四组变量。每次只改一个控件,然后先说出 “我改变的是模型、协议、系统、裁判还是威胁模型”,再观察结果。

INTERACTIVE / MEASUREMENT WORKBENCH

把榜单拆回四台测量仪

所有输出都是公开公式上的教学模型,用来观察协议变量怎样改变结论;它们不是任何真实模型的复跑成绩, 也不把相关性写成因果。

WORKBENCH 01 / METRIC

同一个“80%”,可能回答四个不同问题

先看一次成功率,再分别计算“至少一次”“全部成功”和选择性回答;同时观察 tokenizer 对 PPL 的影响。

THREE DIFFERENT QUESTIONSat least one = 1 − (1 − p)k · all succeed = pk · ECEtoy = |confidence − accuracy|

pass@k 的严格无偏估计还需要每题 n 个样本中通过数 c;这里用独立同分布近似建立方向直觉。

ONE TRY80.0%

一次随机尝试成功率

AT LEAST ONE / k80.0%

有 verifier 时的搜索价值

ALL k SUCCEED80.0%

连续任务的可靠性压力

TOY ECE8.0 pp

单桶校准差,仅作直觉

SELECTIVE VIEW80% / 100%

准确率 / 覆盖率

SAME BYTE LOSS1.18 bits / byte

按原始字节归一,跨 tokenizer 的单位更稳定。

TOKENIZER A / PPL16.3

细粒度 token:每 token 承载的字节更少。

TOKENIZER B / PPL91.0

粗粒度 token:即使 byte loss 相同,PPL 也会变。

结论边界

一次成功率和多次搜索成功率目前相同,因为 k=1;把 k 调大后,搜索分会升,连续可靠性会降。

怎么使用:先改变一个变量,口述“我究竟换了模型、测量协议、系统预算还是威胁模型”; 如果一句比较没有这些字段,就先把结论降级为“在该公开设置下的观察值”。

31 REUSABLE AUDIT CARD

以后看任何模型报告,先填完这十四行

01对象

模型 checkpoint、产品 wrapper、Harness 与完整系统分别叫什么?

02构念

要测的能力或风险能否写成可观察行为?有哪些替代解释?

03样本

来源、版本、时间、语言、领域、难度、子群和排除规则是什么?

04Prompt

system/chat template、shots、CoT、答案格式与 parser 是否完整公开?

05解码

temperature、top-p、长度、samples、seed、effort、timeout 和 invalid policy 是什么?

06工具

工具 schema、权限、上下文管理、网络、重试、并行 rollout 与缓存怎样设?

07环境

容器、仓库、网站、依赖、数据快照与重置逻辑能否复现?

08裁判

单测、formal verifier、人类或 LLM Judge 的覆盖、偏差和版本是什么?

09统计

样本量、点估计、区间、paired test、多重比较与缺失项怎样处理?

10污染

原文、答案、格式、语义、时间五层分别有哪些证据?

11可靠性

一次成功、至少一次成功、全部重复成功和尾部失败是否分报?

12安全

威胁模型、攻击预算、有害有效性、无害回答率和过拒是否同表?

13成本

输入/输出 token、思考预算、工具、延迟、金钱和能耗是否有共同分母?

14边界

作者自报、第三方复跑、内部评测、教学推导和线上动态值是否分层?

L0 / 描述

“报告在协议 P 上自报分数 S。”

L1 / 有限比较

“在关键字段相同的 P 上,A 的点估计高于 B,但区间 / 成本为……”

L2 / 稳健比较

“跨 Prompt、seed、Harness 或子群敏感性分析后,差异仍稳定。”

L3 / 外部结论

“在目标用户与真实环境的纵向验证中,差异迁移到产品结果。”

FINAL RULE

最可信的评测不是拥有最多小数位,而是让读者知道:测了什么、没测什么、花了多少、谁来判、结论能走多远。

PRIMARY-SOURCE CHAIN

80 个关键节点:从概率代理到 Kimi K3 系统评测

这条链只收录本章实际使用的一手论文、官方技术报告或作者入口。每个节点先回答“它把哪条测量边界向外推了一步”, 再决定是否进入精读;全站论文库现已扩充至 450 篇。

01 · 1951Perplexity / Prediction and Entropy

以序列预测和熵建立语言模型内在评测直觉。

02 · 2002BLEU

用 n-gram precision 与长度惩罚代理翻译质量。

03 · 2004ROUGE

以召回式参考重叠代理摘要质量。

04 · 2017On Calibration

把准确率与置信度可靠性拆成两件事。

05 · 2018GLUE

统一多任务语言理解评测接口。

06 · 2019SuperGLUE

饱和后以更难任务更新测量范围。

07 · 2020MMLU

用多学科选择题扩大知识与问题求解覆盖。

08 · 2020RealToxicityPrompts

以自然提示测模型的毒性延续。

09 · 2020StereoSet

联合测刻板偏好与语言建模能力。

10 · 2020CrowS-Pairs

用最小句对测社会刻板关联。

11 · 2021HumanEval

执行测试与无偏 pass@k 进入代码评测。

12 · 2021TruthfulQA

测试模型是否复述人类常见谬误。

13 · 2021Dynabench

用人机闭环持续寻找当前模型难例。

14 · 2021BBQ

在歧义与消歧上下文中分别测偏见。

15 · 2022BIG-bench

大规模协作汇集数百种能力任务。

16 · 2022BIG-Bench Hard

从套件中筛选前沿模型仍困难的任务。

17 · 2022HELM

用场景、适配、指标与透明报告定义整体性评测。

18 · 2022Language Models Mostly Know

研究模型能否估计自身知识与答案正确性。

19 · 2022ToxiGen

扩展隐含仇恨与中性文本的对抗覆盖。

20 · 2022Red Teaming with LMs

用语言模型自动生成红队输入。

21 · 2022Red Teaming to Reduce Harms

总结大规模人工红队和缓解闭环。

22 · 2022DS-1000

用真实数据科学问题与多条件测试扩展代码评测。

23 · 2023PALOMA

以域、格式、去污染和 bits-per-byte 改善 LM 可比性。

24 · 2023Training Data Contamination

系统调查预训练数据与评测集重叠的影响。

25 · 2023Semantic Uncertainty

按语义等价类估计生成不确定性。

26 · 2023MT-Bench / LLM Judge

开放回答自动裁判与偏差成为中心问题。

27 · 2023G-Eval

以 rubric 和推理提示提升 NLG 自动评价。

28 · 2023LLMBar

用风格诱饵元评测 evaluator 的指令遵循。

29 · 2023EvalPlus

扩充代码测试覆盖并暴露原测试漏错。

30 · 2023FActScore

把长回答拆为原子事实逐项核验。

31 · 2023SelfCheckGPT

用黑盒多次采样不一致检测幻觉。

32 · 2023HaluEval

构造问答、对话和摘要幻觉数据。

33 · 2023GCG

自动搜索通用可迁移对抗后缀。

34 · 2023Jailbroken

从竞争目标和泛化解释安全训练失效。

35 · 2023XSTest

专门测看似敏感但应正常回答的无害请求。

36 · 2023Do-Not-Answer

细分不应直接回答的风险场景。

37 · 2023FreshLLMs / FreshQA

用持续更新问题测知识时效与搜索增强。

38 · 2023LongBench

以双语多任务评估长上下文能力。

39 · 2023GPQA

专家级、Google-proof 的研究生科学问答。

40 · 2023RewardBench

对偏好与奖励模型进行多类别压力测试。

41 · 2023AgentBench

跨八种交互环境评测 LLM Agent。

42 · 2023SWE-bench

以真实 GitHub issue 和仓库状态测软件修复。

43 · 2023OSWorld

在真实计算机环境中测多模态 GUI Agent。

44 · 2024Chatbot Arena

把匿名人类偏好、配对图和动态排名平台化。

45 · 2024Length-Controlled AlpacaEval

控制长度混杂后重新估计自动偏好。

46 · 2024Arena-Hard

从真实流量筛高区分度开放问题。

47 · 2024LiveBench

用近期来源、客观判分和月度更新降低污染。

48 · 2024LiveCodeBench

以新竞赛题和时间切分构建代码动态评测。

49 · 2024RULER

用检索、追踪和聚合诊断真实有效上下文。

50 · 2024HarmBench

标准化自动红队和稳健拒答框架。

51 · 2024StrongREJECT

区分绕过拒绝与真正有效有害回答。

52 · 2024JailbreakBench

统一越狱威胁模型、行为、攻击与提交。

53 · 2024InjecAgent

评测工具返回中的间接 Prompt 注入。

54 · 2024AgentDojo

在动态工具环境中联合测效用与注入安全。

55 · 2024Cybench

在可执行网络安全环境中测能力与风险。

56 · 2024Agent Security Bench

从攻击与防御维度系统评测 LLM Agent 安全。

57 · 2024Instruction Hierarchy

训练模型区分 privileged 与不可信指令。

58 · 2024Global MMLU

审计多语言翻译与文化偏差。

59 · 2024FrontierMath

用专家原创可验证难题延伸数学区分度。

60 · 2024WildGuard

统一有害提示、回答与拒答的开放审核。

61 · 2024MMLU-Pro

以更多选项、推理题和清理缓解饱和。

62 · 2024MMLU-Redux

重标全集并揭示错误与歧义。

63 · 2024τ-bench

在工具与用户交互中测 Agent 状态一致性。

64 · 2024OCRBench

细分多模态模型的 OCR 感知能力。

65 · 2023MMBench

用能力矩阵和循环评测诊断多模态理解。

66 · 2023MMMU

用大学级多学科视觉问题测专家知识与推理。

67 · 2024Video-MME

跨视频时长和模态信息测视频理解。

68 · 2025Humanity's Last Exam

用专家原创高难题继续拓展知识推理上限。

69 · 2025AILuminate

标准化风险类别,同时声明通过不等于安全。

70 · 2025SWE-bench Live

持续从新 issue 构建版本化可执行任务。

71 · 2025BrowseComp

用难检索、可验证问题测浏览 Agent。

72 · 2024DeepSeek LLM

分开 base/chat、shots、开放集与安全评测。

73 · 2024DeepSeekMath

用 Maj@K 与 Pass@K 的分离揭示采样协议差异。

74 · 2024DeepSeek-V2

在架构、训练与多类评测协议中报告效率—能力。

75 · 2024DeepSeek-V3

将 base、chat、推理、代码与安全分层评测。

76 · 2025DeepSeek-R1

公开非零温多采样 pass@1 和安全包装差异。

77 · 2025DeepSeek-V3.2

按长上下文与推理设置继续展开能力曲线。

78 · 2026DeepSeek-V4

把 effort、context、工具数和步数写进前沿 Agent 协议。

79 · 2025Kimi k1.5

把长上下文强化学习与测试时扩展放入同一评测框架。

80 · 2026Kimi K3

以 max effort、任务特定 Harness、工具和动态环境报告前沿系统结果。