Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “Princeton”
Research & Benchmarks//24 min
《普林斯顿提出 Agent 可靠性科学》附录 F–G 中译:τ-bench 与 GAIA 基准的详细描述、agent 实现、提示词扰动/故障注入/环境扰动/置信度估计/安全评测五个协议,以及连接真实失败案例、跨时间趋势、一致性与可预测性完整结果等扩展图表。
Research & Benchmarks//33 min
《普林斯顿提出 Agent 可靠性科学》附录 A–E 中译:四条建议的展开、五类局限与两个异议的回应、十二个指标的直觉示例、航空/核电/汽车等安全关键领域的可靠性实践对照,以及覆盖长程可靠性、多 agent、在线监控等八个方向的研究议程。
Research & Benchmarks//25 min
普林斯顿团队把安全关键工程的可靠性理念引入 AI agent 评测:一致性、鲁棒性、可预测性、安全四个维度共 12 个指标,在 τ-bench 与 GAIA 上测了 15 个模型。结论是 24 个月的能力飞跃只带来微小的可靠性改进——准确率大涨的模型依旧多次运行不一致、对提示词改写脆弱、常常不知道自己何时会失败。本卷为正文(含参考文献),附录见下两卷。