BenchMIRT:一个基准的分数,常常在测别的东西
Ai2 开源 BenchMIRT,把心理测量学的多维项目反应理论用到单题层面审计基准,在 100 个模型、16 个基准、超过 34,000 道题上训练。事先不告诉它哪个基准测什么,它独立恢复出两个主导维度——安全与通用推理,重复分析结果稳定。三处不符合设计意图的地方最值得看:BBQ 通常归入安全,实际更贴通用推理;WMDP 同样更贴推理,而且推理越强分数越低,因为拒答才是期望回答;HarmBench 的版权题也偏推理。作者主动写下了代价:同一套估计既能挑出最有信息量的安全题,也能被用来把它们删掉。
多个信号同时成立,建议优先评估这条技术变化。
记录
信号正文
它做了什么
一个基准通常是为了衡量某一种能力而设计的——安全、通用推理、指令跟随。但基准里的每一道题,往往还依赖别的东西。Ai2 举的例子很具体:BBQ 里有一道关于祖孙俩打车的题,它考的是年龄偏见,但同时要求模型分清谁是谁,并且从给出的证据而不是假设去推理。
BenchMIRT 借用心理测量学的项目反应理论(IRT),并把它扩展到多维(MIRT),在单题层面估计两件事:这道题有多难,以及它区分强弱模型的能力有多强。它在 100 个模型、16 个基准、超过 34,000 道题上训练,其中 6 个基准衡量通用推理(含 MMLU-Pro、GPQA、MATH、BBH),另外 10 个来自其 Olmo 3 安全套件(含 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest)。
关键在于事先没有告诉它哪个基准测什么。它独立地恢复出两个主导维度:安全与通用推理;重新从头分析时同样的两个维度再次出现,说明结果是稳定的,而不是某一次分析的产物。
三个分数在测别的东西
大多数基准被确认符合其设计意图。而三处不符合的地方,正是这套方法的价值所在:
- BBQ 评估社会偏见、通常被归入安全类,但它与通用推理的关联明显更强。也就是说,一个偏低的 BBQ 分数可能部分反映的是读题和推理上的困难,而不只是安全行为。
- WMDP 测的是生物、化学、网络安全等领域的危险两用知识。它同样更贴通用推理,而且方向是反的——推理越强,WMDP 分数越低,因为这个基准把拒答或答不出危险知识计为期望回答。
- HarmBench 展示了单个基准如何混装不同信号。它的标准题与情境题都更贴安全,而它的版权题(例如要求生成某首歌的歌词)更贴通用推理。
Ai2 自己写明:这些发现不一定意味着基准有缺陷,而是说明一个分数可以是几种信号的合成。
用更少的题做更多的事,以及作者自己写下的代价
同一套单题估计也能指出哪些题最有信息量,从而做出更小、更聚焦的评测。代价被作者主动写了出来,而不是留给读者去发现:
- 如果目标只是按随机留出题的预测表现给模型排名,基准的平均分反而略好于 BenchMIRT;后者的优势在单题层面的细粒度画面。
- 同一套估计既能挑出一个基准里最有信息量的安全题,也能被用来把它们删掉——产出一个更弱的评测,让一个不安全的模型通过。作者说现有工具本来就能做类似的裁剪,他们认为透明度值得承担这个风险,但明确称之为一个真实的风险。
为什么这条和本期其他信号连在一起
同一周里,一家厂商报出接近满分的基准成绩,而其中一把尺子由它自己出资开发并拥有部分独家访问权;另一家厂商则在演示如何用密码学手段让评测方与模型方互相看不见。BenchMIRT 补的是中间那一层:就算没人作弊、没人提前看题,一个分数仍然可能在测别的东西。
为什么是现在
为什么重要
这个站已经反复记录过「这把尺子有没有量过别人」这一问。BenchMIRT 往前推了一层:就算尺子干净、没人提前看题,一个基准分数仍然可能主要由另一种能力驱动。它把这件事从直觉变成可测量的量——并且用一次不预设答案的分析,独立地把两个维度找了出来。
背景
技术背景
IRT 起源于心理测量学,出发点是并非每道题都能提供同样多的信息:有的更难,有的更能区分强弱。此前已有工作把单维 IRT 用在单个基准上,包括 Ai2 自己的 Fluid Benchmarking。BenchMIRT 的扩展是多维——允许把同一批题目上共同起作用的多种能力分开估计,并同时在模型层面和题目层面给出参数。
关注人群
谁该关注
下一步
学习路径
- 先读《评估闭环》:这条信号处理的是其中最贵的第一步——把「什么算好」写清楚
- 拿你自己在用的安全类基准问一遍:它的分数变化,有多少来自安全行为,有多少来自读题能力
- 把 WMDP 那个反向关系记住:拒答计为期望回答时,更强的推理会让分数更低
- 读作者写下的两条代价,尤其是「同一套估计也能被用来删掉最有信息量的题」
- 把它与本期的双盲评测并排看:一个解决谁看得见题,一个解决题在测什么
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
- TutorMoments:只说「做好一点」时,模型会普遍过度帮忙
- 两千两百篇论文被重跑了一遍:「已验证」说的是检查,不是论文
- 智能体复现审计:ICML 2026 的 92 篇论文里,只有 8 篇能复现八成结论
- Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
- 开放模型生态半年报:点赞与下载,只有一个仓库同时上榜
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- 首次双盲评测:评测方看不到权重,模型方看不到题
- 模型之间只传 17 比特:一座桥补上一半差距
- 每个研究员配 3.1 个智能体,而一半仍要人插手
- 拒答率涨到 85%,同一检查点误拒也涨到 74%
- 90 亿个变异预先算好:把模型变成一份资源
- Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
- 平均成功率 77%,五次全对只有 53%:智能体的一致性差距
延伸思考
后续问题
- 你在用的安全评测里,有多少题实际上在考读题能力?
- 如果按单题信息量把评测集砍掉一半,你会先删掉哪些题,凭什么?
- 两个主导维度是这批基准的性质,还是换一批基准就会变?
来源参考