为什么需要看"题目级别"的信号
一个常见的假设是:一个名字叫"安全"的基准,分数就代表模型安全能力;一个名字叫"推理"的基准,分数就代表模型推理能力。但实际数据往往更复杂。
例如 BBQ 这类被归入安全类的社会偏见基准,其中一道关于祖孙预约网约车的题目,既在探测年龄偏见,也要求模型理解人物关系并基于证据推理;WildJailbreak 同时混入"有害越狱提示"和"良性提示"两类题目,前者更贴近安全,后者更贴近通用推理。直接把这些题目取平均,会掩盖不同信号之间的差异。
对于真正在意"模型在某项能力上到底处于什么水平"的团队而言,这种信号混淆会带来误判:分数低的模型,可能并不是这项能力不行,而是被题目里混入的其他要求拉低了表现。
BenchMIRT 是什么:基于多维项目反应理论的评测审计方法
BenchMIRT 的核心思路来自心理测量学中的项目反应理论(Item Response Theory, IRT)。IRT 的基本假设是:不同题目对被试者的区分力不一样,有些更难,有些更能分辨强弱的差距。
BenchMIRT 将这一思路扩展到多维(Multidimensional IRT,即 MIRT),允许同一道题同时受多种能力影响。在模型层面,它估计每个模型在不同能力维度上的强弱;在题目层面,它估计每道题的难度,以及它对不同能力维度上强弱模型的区分力。
训练数据来自 100 个大语言模型在 16 个基准、超过 3.4 万道题目上的评测结果。其中 6 个基准衡量通用推理(如 MMLU-Pro、GPQA、MATH、BBH 等),另外 10 个来自一个安全评测套件,涵盖 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest 等。值得注意的是,研究者在训练时并没有告诉 BenchMIRT 哪些基准测什么能力,但模型自行稳定地恢复出两个主导维度——安全与通用推理,多次重复分析都能得到相同结论。
它揭示了什么:基准分数背后的能力混淆
BenchMIRT 的分析对很多基准的"自称方向"给出了确认:推理类基准的得分与推理能力相关,越狱与有害内容类基准的得分与安全能力相关。
但它也揭示出更复杂的画面:
- BBQ 被普遍归为安全类基准,但分析显示其得分与通用推理的相关性远高于与安全的相关性。也就是说,一个低 BBQ 分数可能部分反映的是"理解与推理这道题有难度",而不完全是"安全行为不到位"。
- WMDP 测试生化、网络安全等"危险双重用途"知识,其得分与通用推理的相关性更强。同时由于该基准把"拒答或答不出"视为期望结果,推理能力越强的模型反而越容易给出危险知识,得分越低。
- HarmBench 把不同性质的信号混在一起:标准题与上下文题更贴近安全维度,而涉及版权的题目(如要求生成某首歌的歌词)则更贴近通用推理维度。
这些发现并不意味着相关基准本身有问题,而是提醒使用者:一个总分常常是多种信号的加权混合,需要在解读时区分。
用更少的题目做更高效的评测
BenchMIRT 还能识别每道题的信息量,从而压缩评测规模。
- 在同样的 16 个基准上,仅保留约 10% 的题目,对模型在底层能力上的相对强弱排序基本保持不变;保留约 50% 的题目时,能力画像通常与完整基准更为一致。
- 在预测模型对未观测题目的表现方面,BenchMIRT 在留出题目上的正确率约为 79%,而仅用基准平均分做粗略预测的简单方法约为 70%。
对评测预算紧张的团队来说,这意味着可以用更小的题目集合得到接近全量的判别力,对老模型的回顾性分析尤其有用。
如何用起来
BenchMIRT 的代码以开源形式发布,使用者可以根据自己的评测数据进行复用与定制。
- 代码:开源仓库中提供了训练、分析与可视化脚本,可在自有评测结果上运行。
- 数据:相关数据集与基准元数据已整理为集合形式,方便下载与复现实验。
- 技术报告:提供了方法细节、实验设置与完整结果,可作为复现与扩展的参考。
基本流程为:准备模型在多个基准上的逐题作答记录 → 用脚本完成模型与题目维度的能力估计 → 查看每个基准与各能力维度的相关性图,识别被混淆的信号 → 按信息量排序题目,挑出最具备区分力的子集用于精简评测。
局限与适用建议
BenchMIRT 也有明确的边界,使用时应结合自身需求判断。
- 模型覆盖范围:训练与评估所用模型均发布于 2025 年 3 月之前,对更新一代大模型的表现需要重新校验。
- 维度依赖输入:所发现的能力维度取决于所选基准组合。当前的"安全 + 通用推理"双维度是在所选 16 个基准下得到的,换一组基准可能浮现其他能力维度。
- 总分排序场景不占优:如果目标仅仅是按"随机抽题预测总分"对模型排序,原始基准平均分的表现反而略好;BenchMIRT 的优势在于题目级别的精细信号。
- 双刃剑:题目级估计既可用来挑出最有信息量的安全题,也可被用来剔除这些题目、构造更容易通过的弱评测,使用者需要建立相应的伦理与流程约束。
选型建议如下:
- 当你需要理解"为什么这个基准的分数是这样"——例如排查模型在安全套件中某一项异常时,优先用 BenchMIRT 做信号分解。
- 当你需要做大规模回归式评测、预算有限——可以用其题目排序能力压缩评测集,但应保留与全量基准的对照数据,用于周期性校验压缩后集合的有效性。
- 当你的目标就是给出一个总榜排名——直接使用基准平均分更简单,且当前略优于 BenchMIRT。
- 在使用前,建议先确认所用模型的发布时间晚于 2025 年 3 月的程度,必要时用一部分新模型做能力维度稳定性验证。
总体而言,BenchMIRT 适合作为评测体系的"诊断工具"而非替代品:先用它看清每个基准在测什么,再决定是否、如何简化或重组评测流程。