Inspect 评 分 系统 入口: 八 篇 文 档 各自 管 哪 一段
Inspect 的评分页把原始输出收成 Score,再汇总成指标。这一页按原表指向标准评分器、自定义评分器、失败如何入账、模型评分、指标、多个评分器、补评分,以及困惑度。

评分
评分把模型为每个样本产出的原始 output 变成一个 Score,再把这些分数汇总成概括一次评测的指标。评分(scoring)是给输出打分并汇总。样本(sample)是数据集里的一道题。指标(metric)是对许多分数做的汇总,例如正确率。评分系统写在下面这些文章里:
| 文章 | 说明 |
|---|---|
| 标准评分器 | 内置评分器(文本匹配、选择题、数学、模型评分、困惑度)以及如何在其中选择。评分器(scorer)负责给模型输出打分。 |
| 自定义评分器 | 用 Score、Value 和 Target 类型写自己的评分器,包括会调用模型或检查沙箱的评分器。沙箱(sandbox)是与宿主机隔离的运行环境。Target 是样本的标准答案。 |
| 评分策略 | 把一次使样本结束的失败送到正确的结局(给它打分、raise,或 Score.unscored()),让指标反映的是模型,而不是运行机器本身。 |
| 模型评分 | 用另一个模型给开放式回答打分;可以定制模板、说明、评分模型以及对话历史。 |
| 评分指标 | 内置指标、分组、聚类标准误、自定义指标,以及如何归并多个 epoch。epoch 是同一题的重复试验。 |
| 多个评分器 | 把几个评分器一起用,从一个评分器打出多个分数,并把多个分数收成一个。 |
| 评分工作流 | 用 --no-score 推迟评分,用 inspect score 给日志重新评分,以及修改分数。 |
| 困惑度 | 用提示词的对数概率,给模型预测文本的好坏打分。困惑度(perplexity)越低,表示模型越觉得这段文本在预料之中。 |
要复查转录里可能动摇结果的问题(拒绝回答、发现自己在被评测、环境配错),而不是给任务成功打分,见 扫描器。转录(transcript)是一次试验的完整消息记录。要定制分数在日志查看器里如何显示,见 任务视图。
UK AI Security Institute,Scoring,2026-09-09,https://inspect.aisi.org.uk/scoring.html,MIT License
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。