研究与基准测试/2026-10-02/25 分钟普林斯顿提出 Agent 可靠性科学:12 个指标证明能力提升带不来可靠普林斯顿团队把安全关键工程的可靠性理念引入 AI agent 评测:一致性、鲁棒性、可预测性、安全四个维度共 12 个指标,在 τ-bench 与 GAIA 上测了 15 个模型。结论是 24 个月的能力飞跃只带来微小的可靠性改进——准确率大涨的模型依旧多次运行不一致、对提示词改写脆弱、常常不知道自己何时会失败。本卷为正文(含参考文献),附录见下两卷。