研究与基准测试/2026-10-07/28 分钟推理时算力如何改写前沿模型评测:固定预算会低估新模型英国 AI Security Institute 在七个基准上比较最多 12 个前沿模型。更大的 token 预算、上下文压缩和反复提交表明:FrontierMath 与 HLE 在通常预算外仍有约 12 个百分点余量,软件工程基准余量很小,跨代进步主要来自触及范围和可靠性,而不是 token 效率。