00 TWENTY-TWO LEDGERS
看到排行榜,先把一个数字拆成二十二张账
“A 比 B 高 3 分”把测量对象、样本、提示、采样、工具、裁判、统计与成本压成了一个标量。 这句话可能有用,但只有把下面二十二张账补齐,才知道它允许多强的结论。
先区分能力曲线、计算预算和外推边界。
PREREQUISITE / 10指令与偏好理解 base model、对齐行为与产品包装不是同一对象。
PREREQUISITE / 12工具与长程 AgentAgent 成绩属于模型、Harness、工具和环境的乘积。
构念
到底想测知识、推理、行动、偏好还是风险?指标名不是能力本身;先写出目标能力的可观察定义。
测量单位
token、题、回答、episode 还是完整系统?不同单位不能因都叫百分比就直接平均。
任务分布
样本代表哪些用户、领域、语言、难度和时间?测试集只是现实分布的一份带偏样本。
指标
loss、accuracy、F1、win rate、resolved 各丢掉什么?每个指标都把一部分目标写进了分母。
提示
shots、CoT、模板和答案抽取是否一致?同名 benchmark 不会自动生成相同协议。
解码
temperature、top-p、长度与 seed 怎样进入成绩?解码是被测系统的一部分,不是脚注。
重复采样
pass@1、pass@k、cons@k 与 pass^k 测什么?搜索能力、投票能力和可靠性是三个方向。
脚手架
system prompt、工具和上下文管理贡献多少?Agent 分数不能全部归到 checkpoint。
环境版本
数据、容器、网站、依赖和 verifier 是哪个快照?动态环境会漂移,复跑必须带日期。
裁判
exact match、单测、人类和 LLM Judge 谁定义好?裁判也有误差、偏好和覆盖盲区。
聚合
macro、micro、权重和缺失项怎样处理?总分永远包含价值判断。
不确定性
样本数、方差和区间足以支持排名吗?0.1 分差不等于确定的能力差。
污染
原文、答案、格式、语义与时间泄漏怎样分?n-gram 无重合只能排除一小类泄漏。
饱和与错误
高分是能力强、题太易还是标签错?基准不是发布后永远正确的法规。
动态性
怎样保持新鲜,又保留跨时间可比?纯动态题也会引入难度漂移。
偏好与 Arena
谁在投票、看见什么、被怎样配对?Elo 是相对排序,不是绝对智力单位。
成本
用了多少 token、工具、重试、延迟与金钱?最高准确率未必是可部署的最优点。
鲁棒与子群
换语言、提示、长度或扰动后是否稳定?平均值不能代表每个用户群。
事实性
长回答中的原子事实被哪些来源支持?流畅、自洽与有引用都不自动等于正确。
威胁模型
攻击者能改什么、访问几次、目标是什么?不同攻击权限下的 ASR 不能直接横比。
安全边界
危险服从与无害过拒怎样同时测?什么都拒绝不等于安全又有用。
披露与审计
配置、输出、代码、版本和来源能否复核?一张排行榜不能替代完整实验记录。
评测是一项测量工程:先定义想测什么,再固定任务分布、系统边界、资源预算与裁判,最后用不确定性和证据等级限制结论。
01 MEASUREMENT PROTOCOL
Benchmark 不是一张题单,而是一份十二字段合同
在物理测量里,我们不会只写“温度 25”,却省略摄氏、测量位置、时间和仪器。 LLM 榜单同样需要单位。最小的完整表达不是 score(model),而是:
measure(task distribution, dataset/split, model/wrapper, prompt/shots, decoding/samples, effort/tools, harness/context, environment/verifier, judge/rubric, aggregation/uncertainty, cost)构念效度
我们说要测“推理”,题目是否只靠记忆或格式线索就能做对?
题目真的测到了目标吗?内部效度
差异是否被污染、Prompt、Harness、Judge 或样本预算劫持?
分数真由所声称的变量造成吗?外部效度
实验室高分能否迁移到真实用户、语言、工具、时间与风险环境?
结论能走出测试集多远?02 SEVEN SHIFTS
评测史不是“题越来越难”,而是测量边界不断外扩
每一代 benchmark 都修复了旧盲区,也创造了新盲区。自动代理便宜,却离真实偏好远; 人类和 LLM Judge 能看开放回答,却带来人群、风格与裁判偏差;Agent 更接近真实工作, 却把整个运行系统带进了分数。
先用便宜代理加速迭代
BLEU · ROUGE参考重叠让翻译与摘要可大规模回归,但表面相似不等于语义、事实和风格质量。
把通用性做成多任务套件
GLUE · SuperGLUE · MMLU同一模型跨任务比较成为可能;任务权重、格式敏感和公开题污染开始显现。
整体性、动态性与风险进场
Dynabench · BIG-bench · HELMevaluation 被重新写成场景、适配、指标与报告的组合。
可执行结果重新成为硬裁判
HumanEval · DS-1000 · EvalPlus · LiveCodeBench代码和数学能用测试或 verifier 判分,但测试覆盖和规格质量仍是测量边界。
开放回答交给偏好与模型裁判
MT-Bench · Arena · G-Eval · AlpacaEval没有唯一参考答案的问题可比较了,同时引入顺序、长度、自偏与 Judge 能力。
测量单位从回答变成系统
SWE-bench · OSWorld · τ-bench · BrowseCompHarness、工具、环境、上下文、重试和最终状态共同决定 Agent 成绩。
安全从内容标签走向产品威胁模型
RealToxicity · GCG · HarmBench · InjecAgent · AILuminate发现失败能证明漏洞,没发现失败却不能证明系统安全。
03 METRICS ARE QUESTIONS
PPL、BLEU 与 ROUGE 都很重要,但它们从未等于“整体能力”
NLL = −Σt log p(xt | x<t)H = NLL / TPPL = exp(H)BPB = NLL / (ln 2 × bytes)PPL 的直觉是模型在每一步面对的“等效平均分支数”。它只对同一 tokenizer、同一文本预处理、 同一测试分布具有直接可比性。把一句话切成 6 个 token 或 12 个 token,平均单位已经变了; 因此 PALOMA 等工作在 tokenizer 不同时使用 bits per byte。
模型给测试序列多大概率?
适合同 tokenizer、同分布的语言建模比较;不直接测指令、事实、工具或安全。
输出和参考表面上多相似?
便宜、确定、适合回归;多种合理答案、语义与事实会被压扁。
最终标签或字符串是否匹配?
清晰但依赖答案 parser、选项顺序、标签质量和格式策略。
k 次尝试里至少一次通过吗?
衡量有 verifier 搜索的潜力,不代表默认单次体验。
在给定展示下谁更受偏好?
依赖题分布、裁判人群、顺序、长度、风格和对手集合。
环境最终状态是否满足目标?
更接近真实行动,但强依赖 Harness、权限、版本、预算与 verifier。
BLEU / ROUGE 仍适合确定性回归;PPL 仍适合语言建模诊断。错误不是使用代理,而是忘记代理和目标之间的距离。
04 BENCHMARK SUITES
把很多任务放到一张表,不会自动得到“通用智能”
GLUE
统一九种 NLU 任务、接口与诊断集,让通用表示可比较。
新盲区:很快饱和。SuperGLUE
替换为更难任务,并把人类基线、排行榜和工具一并发布。
新盲区:静态公开题仍被生态吸收。MMLU
57 个学科把知识与解题能力扩到高中、大学和专业考试。
新盲区:选择题格式、题质与文化分布。BIG-bench
社区汇集数百种任务,寻找规模带来的涌现与失败。
新盲区:任务异质,聚合解释困难。HELM
把场景、适配、准确、校准、鲁棒、公平、毒性与效率写进透明报告。
新盲区:覆盖越全,协议维护成本越高。套件总分至少藏着三次选择:选哪些任务、每个任务如何归一、每个任务占多大权重。 因此应先看每个子项与最差切片,再看总分。总分可以用于导航,不能替代诊断。
05 BENCHMARK LIFECYCLE
一个基准会出生、流行、饱和、被污染、修复,也可能退休
能力强的系统也被判错
专家重标、保留争议、多正确答案
前沿模型分差趋近噪声
增加难度和区分度,不只增加冷知识
公开题变成训练材料
时间切分、私有题、动态刷新、数据谱系
依赖、网站或容器无法重跑
镜像、版本、定期重建与可执行快照
高分不再代表真实用户价值
重新定义构念,加入现场与纵向效度
06 PROMPT IS PART OF THE TEST
改一个模板,可能既改变模型“理解了什么”,也改变 parser“看见了什么”
角色、安全、工具和输出原则。
special tokens、role 边界和 assistant 起始。
示例数量、身份、顺序与是否包含推理。
direct answer、CoT、结构化格式与语言。
从自然输出抽取选项、数字、代码或动作。
Answer with A, B, C, or D only.测得更接近选项选择,但可能压制 reasoning model 的自然轨迹。
Think step by step, then put \boxed{answer}.给了额外计算与格式要求;parser 失败和长输出上限会进入分数。
DeepSeek LLM 明确给出 base 与 chat 在部分任务上的 shots 差异;DeepSeek-R1 又因为 few-shot CoT 可能伤害 reasoning model 而采用若干 zero-shot 协议。这里没有一个抽象的“绝对公平 Prompt”: 正确做法是公开、固定,并用多模板敏感性分析说明结论是否稳健。
07 SAMPLING CHANGES THE QUESTION
pass@1、pass@k、cons@k、best-of-N 与 pass^k 不能互换
Greedy / 一次运行
默认产品体验:不给搜索和选择器,只看一次能否成功。
采样分布下一次成功
对每题多次采样后取正确率均值,能比一次随机运行更稳。
至少一个候选通过
适合有单测或 verifier 的搜索系统;k 越大,成本和成功率都增。
多数答案正确
自一致依赖正确轨迹能汇聚到同一答案;不等于候选覆盖。
选择器挑中最好答案
总成绩同时测生成器和 reward / Judge 的排序能力。
连续 k 次全部成功
测可靠性而非探索;k 增大时分数通常下降。
pass@k = 1 − C(n−c, k) / C(n, k)at least one = 1−(1−p)k · all = pk同一个 p、同一个 k,两个看似都叫“5 次”的指标却给出相反故事。真实运行还可能相关,所以要报告经验重复分布。
08 CALIBRATION & SELECTIVE RISK
答对多少,和“知道自己什么时候会错”,是两种能力
完美校准
P(correct | confidence=q) = q声称 80% 置信的答案,长期应约有 80% 正确。高准确率不自动校准;校准好也不自动准确率高。
- reliability diagram 看局部偏差;
- ECE 把置信桶误差压成一个代理;
- Brier score 同时惩罚概率误差;
- risk–coverage 曲线观察拒答后的质量;
- semantic entropy 合并同义答案再估不确定性。
Kadavath 等人的结果说明,在其任务和格式中,更大模型能给出有希望的自评估; 但 P(IK) 跨任务仍难校准,不能被简写为“模型普遍知道自己什么时候错”。 真正的产品问题往往不是强迫每题都答,而是:在多少覆盖率下,把错误风险压到可接受范围?
09 FIVE LEAKAGE LAYERS
污染不是一个开关,也不能靠一次字符串搜索结案
原文污染
测试题、上下文或 benchmark 文件原样出现
答案污染
题—答配对、解析器、隐藏单测或参考补丁出现
格式污染
模板、选项位置、verbalizer 或固定答案模式出现
语义污染
改写题、同一事实、算法或等价证明出现
时间污染
发布后进入继续预训练、SFT、RL 或合成数据
“干净子集分数低于污染子集”也不能独自证明记忆带来提升,因为两组题可能难度不同。 最低限度要同时披露匹配定义、覆盖率、人工抽检、来源时间、效应量与不确定性。 DeepSeek-R1 明确承认 n-gram 去污染无法阻止测试集改写,这是一条应被保留的诚实边界。
no exact overlap ⇒ no contamination正确结论只能是:“在当前语料覆盖、归一化与匹配阈值下,未发现这种表面重叠。”
10 FRESHNESS × COMPARABILITY
动态题解决“见过”,却可能失去“同一把尺”
固定公开题
任何模型都能复跑,解释清晰;但会被训练生态吸收,且容易饱和。
纵向可比强 · 新鲜度弱私有时间切片
泄漏风险较低;外部读者无法看题,错误与构念效度更难审计。
新鲜度中 · 透明度弱持续生成 / 收集
能追新知识和新失败;不同月份题目难度、用户构成与环境都会漂移。
新鲜度强 · 纵向可比弱版本化动态题 + 固定锚点
按月更新主体,同时保留一组受控 anchor;分报当期能力和历史曲线。
两本账,不强行压成一个分数Dynabench 用人机闭环造当前难例;FreshQA 刷新快速变化知识;LiveBench 用近期来源与客观判分按月更新; LiveCodeBench 和 SWE-bench Live 利用题目或 issue 的时间切分。它们没有“终结污染”,而是把数据时间和版本 提升为一等协议字段。
11 EXECUTABLE VERIFIERS
代码能运行是巨大进步,但“通过当前测试”仍不等于“完全正确”
便宜,容易漏掉语义错误。
能执行,但覆盖路径有限。
扩大输入空间与边界条件。
更强,仍依赖规格正确。
对形式规格最硬;规格本身仍需正确。
EvalPlus 将 HumanEval / MBPP 的测试大幅扩充,并发现许多原测试未捕获的错误,模型排序也会改变。 DS-1000 又把库 API、数值约束、禁止操作等多条件写进判分。Verifier 的真正优势不是“绝不会错”, 而是它的判分程序更明确、更容易审计和改进。
12 A BENCHMARK REPAIRS ITSELF
SWE-bench 是理解“基准生命周期”最好的完整案例
SWE-bench
从真实 GitHub issue、仓库与合并补丁构造软件工程任务;把评测单位从函数改为仓库状态。
SWE-bench Verified
专业开发者检查任务是否可解、规格是否明确、FAIL_TO_PASS 测试是否公平,保留 500 个高质量样本。
SWE-bench Live
持续从新 issue 构建可执行任务,用时间版本降低静态题被训练吸收的风险。
公开退役信号
OpenAI 官方说明 Verified 已越来越受污染,转而推荐更难、更新、覆盖不同语言的 SWE-bench Pro。
旧分数仍描述当时协议下的历史观察;错误是把它当成 2026 年仍等效、仍干净、仍能区分前沿能力的当前证据。
13 DIAGNOSTIC CHAINS
1M 窗口和一个多模态总分,都必须拆成瓶颈链
声明窗口 ≠ 有效窗口
Needle 主要测找到一段信息;RULER 增加多 needle、变量追踪与聚合;仍要报告 tokenizer、位置、截断、输出与长度曲线。
总分 ≠ 每个模态环节都强
OCRBench、MMBench、MMMU、Video-MME 的输入与构念不同;图像尺寸、tile、帧采样、工具和 Judge 必须披露。
14 MODEL IS NOT THE AGENT
Agent 的最小测量单位,是“模型—脚手架—工具—环境”
checkpoint、effort、解码
prompt、规划、上下文、恢复
schema、权限、错误反馈
版本、网络、账户、随机性
最终状态与禁止副作用
同一个模型换 system prompt、文件编辑器、浏览器工具、上下文压缩策略、重试次数或容器镜像, 就是另一个被测系统。公平比较可以固定 Harness 测模型,也可以允许每家最优 Harness 测产品上限; 但两种赛道必须命名不同,不能混入同一列后只写模型名。
15 VERIFY OUTCOMES, NOT THEATER
轨迹像专家,不等于事情真的完成了
读轨迹打分
“分析得很合理”“命令看起来正确”“步骤接近 gold trajectory”。
容易奖励表演、冗长和唯一范例路径。验证最终状态
仓库测试通过、文件存在、订单状态正确、禁止副作用未发生。
允许多条有效路径,但 verifier 仍需覆盖目标。这是教学独立近似,不是通用 Agent 定律;现实错误会相关,恢复机制也会修复。 但它揭示一个方向:长程任务应报告完成率、失败阶段、重试后成功、连续重复可靠性和尾部成本, 而不仅是平均一步准确率。
16 HUMAN EVALUATION
“人类偏好”不是一个天然、统一、无噪声的真值
至少回答十个问题
- 目标用户是谁,标注者是谁?
- 需要什么专业资格与语言文化背景?
- 如何培训、校准并支付标注者?
- 模型身份是否盲化,顺序是否随机?
- 允许 tie、both bad、不可判断吗?
- rubric 是整体偏好还是逐维评分?
- 每项由几人评,分歧是否保留?
- 一致性和置信区间怎样计算?
- 展示长度、格式和引用是否一致?
- 伦理、隐私与有害内容暴露怎样处理?
正确的表述“在这组提示、这类目标用户、这套展示与 rubric 下,A 被该标注者群体偏好。”不是:“人类证明 A 客观更智能。”
17 JUDGE THE JUDGE
LLM-as-a-Judge 解决了规模,却没有消灭测量误差
位置偏好
相同答案交换 A/B 顺序,结论会不会翻转?
随机交换、双向评、报告 flip rate长度偏好
更长回答获得更多分,是信息更全还是风格红利?
长度控制、配对短长反例自我偏好
Judge 是否偏爱与自身家族或风格相近的回答?
多 Judge、盲化、跨家族元评测能力上限
Judge 自己不会数学、代码或视觉时,如何判别人?
参考答案、工具、专家抽检、分任务裁判标准漂移
“helpful”是否偷带风格、安全或篇幅偏好?
逐维 rubric、锚点样例、版本冻结采样与版本
同一 Judge 多次结果和线上模型版本是否稳定?
重复采样、日期、模型 ID、解析失败率MT-Bench / Chatbot Arena 系统讨论了位置、冗长和自增强偏差;G-Eval 说明 rubric 与推理提示 可以提高与人类的一致性,也指出偏好 LLM 文本的可能;LLMBar 则用“真正遵循指令但风格不讨巧” 的答案专门测试 evaluator。结论很清楚:Judge 本身必须有 benchmark。
18 ARENA IS A RELATIVE GRAPH
Elo / Bradley–Terry 是比较图上的相对位置,不是“智力点数”
Arena 的价值是把真实开放问题和相对偏好带进评测,不是把它神化成无偏真值。 当两个模型区间重叠、题目类别不同或版本更新时,应说“当前数据不足以确定排序”, 而不是强行用小数位制造确定性。
19 AVERAGES HIDE VALUES
平均数不仅压缩数据,也压缩了“谁重要”的价值判断
如果样本 80% 是英语,micro average 会让 A 看起来领先;给每种语言相同权重的 macro average 则可能让 B 领先。两者都不是“数学上错误”,而是回答了不同分布下的问题。公平、安全和文化评测尤其要:
- 同时报总体、关键子群、最差组与组间差;
- 公开权重、缺失项、拒答和无效输出处理;
- 避免用一个总分抵消某个群体的严重失败;
- 对多指标、多子组和多次提交处理选择性报告与多重比较。
20 ACCURACY × COST × LATENCY
测试时扩展时代,不报预算的“最高分”越来越难解释
合理比较不一定强迫所有系统同预算。可以报告固定预算下的能力,也可以画完整 Pareto frontier: 在每一个成本点上,谁提供最高成功率?DeepSeek-V4 的 Nonthink / High / Max,以及 K3 的 max effort, 都说明“模型能力”正在变成一条由测试时资源参数化的曲线。
21 WHAT IS THE SAFETY OBJECT?
基础模型、对齐行为、产品防线与部署环境,必须分四层测
Base model
在给定上下文下会生成什么能力和内容?
模型权重本体Aligned behavior
SFT / RL 后如何遵循、拒绝、校准和解释?
checkpoint 行为Product wrapper
system prompt、分类器、过滤、监控和速率限制怎样改变行为?
产品防线Deployment
工具权限、数据、用户、网络、日志与人工升级路径是什么?
真实风险系统在裸模型上做攻击可以测权重层的稳健性;在产品 API 上做攻击可以测防御总和。两者都有效, 但不能互相冒充。DeepSeek-R1 报告中安全评测所用 wrapper 与裸 reasoning checkpoint 的差异, 正是为什么要先命名对象。
22 THREAT MODEL FIRST
在报攻击成功率之前,先回答攻击者是谁
知道什么?
黑盒、logprobs、梯度、权重、system prompt、过滤器规则。
能改什么?
用户文本、图片、网页内容、工具返回、记忆、文件、环境状态。
可试多少次?
单次、固定 queries、自适应搜索、多人长期攻击。
想达到什么?
非拒绝、有效有害知识、越权动作、泄露秘密、持久化控制。
拥有什么权限?
只聊天、上传文件、联网、执行代码、调用高风险工具。
怎样才算成功?
Judge 标签、人工效用、真实副作用、最终状态或损失上界。
target × attacker knowledge × controllable channel × query budget × adaptation × success criterion × defense stack × date23 SAFETY GENEALOGY
安全评测从“内容像不像毒性”走到“系统是否真的被攻破”
RealToxicity · StereoSet · CrowS · BBQ
测生成内容、刻板关联与歧义场景偏差。
LM-generated attacks · human red teams
主动寻找模型当前会暴露的有害失败。
GCG · Jailbroken · XSTest · Do-Not-Answer
同时暴露绕过安全与错误拒绝无害请求。
HarmBench · StrongREJECT · JailbreakBench · WildGuard
统一行为、攻击、分类器与有害有效性。
InjecAgent · AgentDojo · Cybench · AILuminate
把不可信内容、工具权限、环境行动和标准风险等级带进来。
发现失败,可以证明存在漏洞;没有发现失败,不能证明系统安全。
安全测试具有强负向预测力,但覆盖永远有限。一个好等级只描述当前测试范围内的观察。
24 NON-REFUSAL IS NOT HARM
越狱“成功”至少有四道门
一些攻击让模型输出很长、看似顺从,却只有空洞警告或错误信息。若分类器只看“是否拒绝”, 就会把这些当成功。StrongREJECT 的核心贡献正是用人工标注关注有害回答的相关性与可用性。 因此最低限度同时报:
25 UNTRUSTED DATA BECOMES INSTRUCTION
Agent 安全的核心变化:模型开始读取外部世界,并有权限改变它
InjecAgent
把恶意指令嵌入工具返回,系统化测间接 Prompt 注入。
AgentDojo
在动态工具环境中同时测实用任务效用与攻击成功。
Cybench
用可执行网络安全任务和子任务诊断真实攻击链能力。
Instruction Hierarchy
把 system / user / third-party 指令优先级显式训练与评测。
这里的防线不是“让模型更会拒绝”一句话:还包括最小权限、数据—指令分离、动作确认、 工具参数验证、秘密隔离、网络策略、审计日志、速率限制和人工升级。安全评测必须覆盖整条链。
26 SAFETY × UTILITY FRONTIER
拒绝越多并不等于越安全:无害可用性必须进入同一张图
安全阈值移动会在危险服从和过度拒答之间形成前沿。更好的系统不是简单把阈值调高, 而是提升区分能力、澄清意图、提供安全替代、按权限分级,并对不确定高风险动作升级给人。
27 DEEPSEEK PROTOCOL LINEAGE
沿 DeepSeek 七篇报告,看“模型分数”一步步变成“系统曲线”
公开集 + held-out + safety;base/chat 使用不同 shots
证明“同一张表”内部也可能有不同 prompting;需要逐列读脚注。
Maj@K 提升而 Pass@K 未同步提升
多数投票变好不等于候选覆盖变广;采样指标必须分开。
语言、代码、数学与开放对话分协议评测
架构收益要和训练 token、激活参数、上下文及对话协议共同解释。
Base、Chat、推理、代码与安全分表
一个 checkpoint 的单步能力与产品包装后的行为不是同一对象。
非零温多次采样的 mean pass@1;不同任务 k 不同
表中的 pass@1 不是一次 greedy;采样池和温度属于核心结论。
长上下文与 reasoning effort 继续分档
窗口声明、有效利用和测试时计算预算必须一起看。
Nonthink / High / Max;8K / 128K / 384K;Agent 可到 500 tools/steps
所谓模型分数已显式成为 effort、context 与 Harness 条件下的系统曲线。
DeepSeek 特别适合作为评测教学主线,因为它同时公开了 dense、MoE、数学、reasoning、长上下文和 Agent 演化。最值得学的不是记住某张表,而是观察协议怎样随着能力形态改变: shots 分开、Maj@K / Pass@K 分开、采样 pass@1、effort 分档、上下文分档,最后把工具数和步数写进报告。
28 DEEPSEEK-R1 CASE STUDY
R1 的“pass@1”不是一次 greedy;安全评测也不是裸模型行为
Greedy 对长推理出现重复与 checkpoint 变异
报告改用 temperature 0.6、top-p 0.95 多次采样,再取样本正确率均值。
不同 benchmark 的样本预算不同
AIME / GPQA 64;MATH / Codeforces 16;LiveCodeBench 8。k 不是无关脚注。
部分任务采用 zero-shot
作者指出 few-shot CoT 可能损伤 reasoning model,因此调整协议;比较时必须披露适配。
SWE-bench 使用 Agentless
成绩同时属于模型与固定脚手架;换搜索、编辑和上下文管理会改变系统。
安全表中的对象含额外包装
不能把产品安全行为直接归因到裸 R1 checkpoint。
n-gram 无法阻止改写污染
作者边界本身就是重要证据,避免把检测写成“已证明无泄漏”。
29 KIMI K3 §6
逐字段复原 K3 的公开评测:它报告的已经是多种系统设置
Kimi K3 Thinking
明确 checkpoint / 产品形态;不可和不同 wrapper 混称“K3”。
reasoning effort = max
比较对象必须使用同等测试时计算,或把它作为成本维度。
temperature = 1.0
无工具单步题 top-p=.95,Agent 任务 top-p=1;不是默认 greedy。
HLE 同时报无工具 / 有工具
43.5 与 56.0 回答的是两个系统设置,不是同一个模型常数。
任务采用各自脚手架
SWE、终端、浏览、GUI 与自动化任务必须分别披露 harness。
DeepSWE v1.1;官方 mini-SWE-agent 另报 67.3
同模型换脚手架就是一次重要消融,不应把差异藏掉。
H20 校准 SWE-Marathon;FrontierSWE 于 2026-07-16 重算
硬件、环境和评测日期都是结果的一部分。
部分任务使用 Gemini 3.1 Pro 裁判
Judge 版本、prompt、rubric 与抽样复核决定开放回答效度。
AutomationBench 600 个公开任务;内部集频繁刷新
公开与内部、静态与动态必须用不同证据标签。
引用第三方排名与成本时保留来源和时点
外部榜单是带日期的观察,不是永久属性。
最有教学价值的不是哪一项第一,而是报告主动暴露了 Harness 敏感性:DeepSWE v1.1 与官方 mini-SWE-agent 可分别观察;Terminal-Bench 会跨 Harness 报告;BrowseComp 的上下文策略、 SWE-Marathon 的硬件校准、FrontierSWE 的重算日期都进入了分数。这正是未来评测报告应该走的方向。
30 INTERACTIVE LAB
亲手改一次协议,比背十张排行榜更有用
四台测量仪分别对应本章最容易混淆的四组变量。每次只改一个控件,然后先说出 “我改变的是模型、协议、系统、裁判还是威胁模型”,再观察结果。
INTERACTIVE / MEASUREMENT WORKBENCH
把榜单拆回四台测量仪
所有输出都是公开公式上的教学模型,用来观察协议变量怎样改变结论;它们不是任何真实模型的复跑成绩, 也不把相关性写成因果。
同一个“80%”,可能回答四个不同问题
先看一次成功率,再分别计算“至少一次”“全部成功”和选择性回答;同时观察 tokenizer 对 PPL 的影响。
at least one = 1 − (1 − p)k · all succeed = pk · ECEtoy = |confidence − accuracy|pass@k 的严格无偏估计还需要每题 n 个样本中通过数 c;这里用独立同分布近似建立方向直觉。
一次随机尝试成功率
有 verifier 时的搜索价值
连续任务的可靠性压力
单桶校准差,仅作直觉
准确率 / 覆盖率
按原始字节归一,跨 tokenizer 的单位更稳定。
细粒度 token:每 token 承载的字节更少。
粗粒度 token:即使 byte loss 相同,PPL 也会变。
一次成功率和多次搜索成功率目前相同,因为 k=1;把 k 调大后,搜索分会升,连续可靠性会降。
Judge 不是尺子,它也是一个会偏的模型
用可见混杂做压力测试:回答顺序、长度差、自我偏好、Judge 能力与票数怎样改变胜率和不确定性。
短而直接
先给结论,再列证据边界;不重复问题。
长而铺陈
提供更多背景、分点、例子与总结;可能更完整,也可能只是更长。
混入顺序、长度、自偏后的观察值
移除教学模型中的长度项
交换先后可造成的差
二项近似;真实 Arena 图更复杂
观察胜率 长度控制后的估计
当前协议里,较长的 B 获得长度红利;交换顺序或控制长度,排名可能翻转。
“没搜到 n-gram”不能推出“没有污染”
把五层泄漏、检测能力、题目刷新与历史锚点分开,观察新鲜度和纵向可比性的冲突。
教学设定中未受泄漏影响的题
五层污染中可被当前扫描发现的比例
存在但未被当前方法捕获
刷新速度与未泄漏比例的教学合成
固定锚点越多,跨月纵向比较越稳
当前只启用原文与答案泄漏;n-gram 对原文较敏感,对答案代码与语义改写仍不充分。
Agent 分数属于“模型 × Harness × 环境”,安全分也属于威胁模型
把模型、脚手架、工具、预算、Verifier、产品安全壳和攻击强度放到同一张成本—能力—风险图。
不含 Harness / 工具 / 多试
教学独立近似,不能当真实复跑
重试 × Token 预算的相对成本
在当前攻击与安全壳设定下
安全壳也会损失无害可用性
四次尝试和 32K 预算把系统成功率推高,但应同时披露成本;安全壳压低危险服从,也带来过拒。
31 REUSABLE AUDIT CARD
以后看任何模型报告,先填完这十四行
模型 checkpoint、产品 wrapper、Harness 与完整系统分别叫什么?
要测的能力或风险能否写成可观察行为?有哪些替代解释?
来源、版本、时间、语言、领域、难度、子群和排除规则是什么?
system/chat template、shots、CoT、答案格式与 parser 是否完整公开?
temperature、top-p、长度、samples、seed、effort、timeout 和 invalid policy 是什么?
工具 schema、权限、上下文管理、网络、重试、并行 rollout 与缓存怎样设?
容器、仓库、网站、依赖、数据快照与重置逻辑能否复现?
单测、formal verifier、人类或 LLM Judge 的覆盖、偏差和版本是什么?
样本量、点估计、区间、paired test、多重比较与缺失项怎样处理?
原文、答案、格式、语义、时间五层分别有哪些证据?
一次成功、至少一次成功、全部重复成功和尾部失败是否分报?
威胁模型、攻击预算、有害有效性、无害回答率和过拒是否同表?
输入/输出 token、思考预算、工具、延迟、金钱和能耗是否有共同分母?
作者自报、第三方复跑、内部评测、教学推导和线上动态值是否分层?
“报告在协议 P 上自报分数 S。”
“在关键字段相同的 P 上,A 的点估计高于 B,但区间 / 成本为……”
“跨 Prompt、seed、Harness 或子群敏感性分析后,差异仍稳定。”
“在目标用户与真实环境的纵向验证中,差异迁移到产品结果。”
最可信的评测不是拥有最多小数位,而是让读者知道:测了什么、没测什么、花了多少、谁来判、结论能走多远。
↳ PRIMARY-SOURCE CHAIN
80 个关键节点:从概率代理到 Kimi K3 系统评测
这条链只收录本章实际使用的一手论文、官方技术报告或作者入口。每个节点先回答“它把哪条测量边界向外推了一步”, 再决定是否进入精读;全站论文库现已扩充至 450 篇。
以序列预测和熵建立语言模型内在评测直觉。
02 · 2002BLEU用 n-gram precision 与长度惩罚代理翻译质量。
03 · 2004ROUGE以召回式参考重叠代理摘要质量。
04 · 2017On Calibration把准确率与置信度可靠性拆成两件事。
05 · 2018GLUE统一多任务语言理解评测接口。
06 · 2019SuperGLUE饱和后以更难任务更新测量范围。
07 · 2020MMLU用多学科选择题扩大知识与问题求解覆盖。
08 · 2020RealToxicityPrompts以自然提示测模型的毒性延续。
09 · 2020StereoSet联合测刻板偏好与语言建模能力。
10 · 2020CrowS-Pairs用最小句对测社会刻板关联。
11 · 2021HumanEval执行测试与无偏 pass@k 进入代码评测。
12 · 2021TruthfulQA测试模型是否复述人类常见谬误。
13 · 2021Dynabench用人机闭环持续寻找当前模型难例。
14 · 2021BBQ在歧义与消歧上下文中分别测偏见。
15 · 2022BIG-bench大规模协作汇集数百种能力任务。
16 · 2022BIG-Bench Hard从套件中筛选前沿模型仍困难的任务。
17 · 2022HELM用场景、适配、指标与透明报告定义整体性评测。
18 · 2022Language Models Mostly Know研究模型能否估计自身知识与答案正确性。
19 · 2022ToxiGen扩展隐含仇恨与中性文本的对抗覆盖。
20 · 2022Red Teaming with LMs用语言模型自动生成红队输入。
21 · 2022Red Teaming to Reduce Harms总结大规模人工红队和缓解闭环。
22 · 2022DS-1000用真实数据科学问题与多条件测试扩展代码评测。
23 · 2023PALOMA以域、格式、去污染和 bits-per-byte 改善 LM 可比性。
24 · 2023Training Data Contamination系统调查预训练数据与评测集重叠的影响。
25 · 2023Semantic Uncertainty按语义等价类估计生成不确定性。
26 · 2023MT-Bench / LLM Judge开放回答自动裁判与偏差成为中心问题。
27 · 2023G-Eval以 rubric 和推理提示提升 NLG 自动评价。
28 · 2023LLMBar用风格诱饵元评测 evaluator 的指令遵循。
29 · 2023EvalPlus扩充代码测试覆盖并暴露原测试漏错。
30 · 2023FActScore把长回答拆为原子事实逐项核验。
31 · 2023SelfCheckGPT用黑盒多次采样不一致检测幻觉。
32 · 2023HaluEval构造问答、对话和摘要幻觉数据。
33 · 2023GCG自动搜索通用可迁移对抗后缀。
34 · 2023Jailbroken从竞争目标和泛化解释安全训练失效。
35 · 2023XSTest专门测看似敏感但应正常回答的无害请求。
36 · 2023Do-Not-Answer细分不应直接回答的风险场景。
37 · 2023FreshLLMs / FreshQA用持续更新问题测知识时效与搜索增强。
38 · 2023LongBench以双语多任务评估长上下文能力。
39 · 2023GPQA专家级、Google-proof 的研究生科学问答。
40 · 2023RewardBench对偏好与奖励模型进行多类别压力测试。
41 · 2023AgentBench跨八种交互环境评测 LLM Agent。
42 · 2023SWE-bench以真实 GitHub issue 和仓库状态测软件修复。
43 · 2023OSWorld在真实计算机环境中测多模态 GUI Agent。
44 · 2024Chatbot Arena把匿名人类偏好、配对图和动态排名平台化。
45 · 2024Length-Controlled AlpacaEval控制长度混杂后重新估计自动偏好。
46 · 2024Arena-Hard从真实流量筛高区分度开放问题。
47 · 2024LiveBench用近期来源、客观判分和月度更新降低污染。
48 · 2024LiveCodeBench以新竞赛题和时间切分构建代码动态评测。
49 · 2024RULER用检索、追踪和聚合诊断真实有效上下文。
50 · 2024HarmBench标准化自动红队和稳健拒答框架。
51 · 2024StrongREJECT区分绕过拒绝与真正有效有害回答。
52 · 2024JailbreakBench统一越狱威胁模型、行为、攻击与提交。
53 · 2024InjecAgent评测工具返回中的间接 Prompt 注入。
54 · 2024AgentDojo在动态工具环境中联合测效用与注入安全。
55 · 2024Cybench在可执行网络安全环境中测能力与风险。
56 · 2024Agent Security Bench从攻击与防御维度系统评测 LLM Agent 安全。
57 · 2024Instruction Hierarchy训练模型区分 privileged 与不可信指令。
58 · 2024Global MMLU审计多语言翻译与文化偏差。
59 · 2024FrontierMath用专家原创可验证难题延伸数学区分度。
60 · 2024WildGuard统一有害提示、回答与拒答的开放审核。
61 · 2024MMLU-Pro以更多选项、推理题和清理缓解饱和。
62 · 2024MMLU-Redux重标全集并揭示错误与歧义。
63 · 2024τ-bench在工具与用户交互中测 Agent 状态一致性。
64 · 2024OCRBench细分多模态模型的 OCR 感知能力。
65 · 2023MMBench用能力矩阵和循环评测诊断多模态理解。
66 · 2023MMMU用大学级多学科视觉问题测专家知识与推理。
67 · 2024Video-MME跨视频时长和模态信息测视频理解。
68 · 2025Humanity's Last Exam用专家原创高难题继续拓展知识推理上限。
69 · 2025AILuminate标准化风险类别,同时声明通过不等于安全。
70 · 2025SWE-bench Live持续从新 issue 构建版本化可执行任务。
71 · 2025BrowseComp用难检索、可验证问题测浏览 Agent。
72 · 2024DeepSeek LLM分开 base/chat、shots、开放集与安全评测。
73 · 2024DeepSeekMath用 Maj@K 与 Pass@K 的分离揭示采样协议差异。
74 · 2024DeepSeek-V2在架构、训练与多类评测协议中报告效率—能力。
75 · 2024DeepSeek-V3将 base、chat、推理、代码与安全分层评测。
76 · 2025DeepSeek-R1公开非零温多采样 pass@1 和安全包装差异。
77 · 2025DeepSeek-V3.2按长上下文与推理设置继续展开能力曲线。
78 · 2026DeepSeek-V4把 effort、context、工具数和步数写进前沿 Agent 协议。
79 · 2025Kimi k1.5把长上下文强化学习与测试时扩展放入同一评测框架。
80 · 2026Kimi K3以 max effort、任务特定 Harness、工具和动态环境报告前沿系统结果。