Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “τ-bench”
Research & Benchmarks//16 min
把智能体固定为 GPT-5.5、只换用户代理,375 道企业任务的平均奖励变动 15.2 分。成功回合里 24.4% 违反用户合同,主因是过早披露;它几乎不改变奖励,却让智能体平均少做 1.06 次工具调用。
Research & Benchmarks//8 min
Sierra 与普林斯顿的 CC BY 论文把「构建 Agent」本身做成任务。53 道题、四个领域里,最强配置 Claude Opus 5 加 Claude Code 只通过 23.9% 的评测仿真,专家参考上限是 82.2%。
Research & Benchmarks//6 min
Sierra 的 τ-bench 从 2024 年 6 月起测工具、Agent 和用户的多轮交互,并用重复成功率暴露一次通过掩盖的不稳定。它后来成为研究和行业评测的参照。