CodexQA

行业与实践研究与基准测试

METR 前沿风险试点:内部 Agent 有没有手段、动机和机会

CodexQA 团队阅读约 2 分钟

2026 年 2 月到 3 月,METR 在 Anthropic、Google、Meta、OpenAI 参与下评估内部 Agent 的失控部署风险。判断是:小规模失控部署当时说得通,做成很稳固则还没有手段。

来源:METR,评估窗口 2026 年 2 月 16 日至 3 月 16 日,公开报告《Frontier Risk Report》。参与方为 Anthropic、Google、Meta 和 OpenAI。除报告明确写出的地方外,METR 称没有为了结论而额外隐去重要信息。

这不是又一份模型卡

从 2026 年 2 月起,METR 做了一次试点:评估前沿实验室内部正在使用的 AI Agent 带来的失准风险。报告自称有三块贡献。

第一块是把过程写清楚。每家参与方提供当时最强的内部模型访问,包括原始思维链,以及一批非公开材料:共享模型的能力、AI 在内部怎么被使用和监控、进展速度的趋势。METR 先给每家写私下报告,再由参与方批准哪些非公开信息可以披露,最后形成这份公开报告。它按机构而不是按某一个公开模型来做,并且设计成周期重复,而不是绑在每次公开发布上。

第二块是六条关键事实,用来支撑评估。材料来自对共享模型的评测、对公开模型的评测、参与方提供的信息、一次嵌入式红队(见 METR 2026 年 3 月 25 日关于 Anthropic Agent 监控的记录)、系统卡和其他公开文献。事实按三类组织:手段(Agent 能采取哪些有害动作)、动机(它会不会试图这么做)、机会(在现有防护下,尝试能否成功)。

第三块是评估本身:2026 年 2 月到 3 月,这些内部 Agent 是否有手段、动机和机会,启动一次「失控部署」——一组在人类不知情、也未许可的情况下自主运行的 Agent——并让它经受不同程度的安全与监控。

结论怎么读

METR 的总体判断是:评估当时,内部 Agent 看来同时具备手段、动机和机会,可以启动小规模失控部署;但它们还没有把这种部署做得高度稳固的手段。

这句话的信息量在后半句。它不是「已经发生了不受控的大规模部署」,也不是「现有监控已经足够」。它是一次有访问权限的试点:小规模启动在当时的能力、动机和防护组合下说得通,做到很稳、很难被停掉,则还不成立。

对做评测的人,这份报告的方法比某一条分数更值得拿走。它不把公开榜单当风险结论,而是把内部使用方式、监控是否真的看得到行为、以及模型在共享权重上的表现放在一起。周期重做、按机构而不是按发布日切,是为了避免「模型卡出来那天的分数」代替「这套系统这几个月实际怎么被用」。

公开页:https://metr.org/blog/2026-05-19-frontier-risk-report

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误