研究与基准测试/2026-09-30/8 分钟τ^τ-Bench:评的不是当客服,而是能不能把客服 Agent 做出来Sierra 与普林斯顿的 CC BY 论文把「构建 Agent」本身做成任务。53 道题、四个领域里,最强配置 Claude Opus 5 加 Claude Code 只通过 23.9% 的评测仿真,专家参考上限是 82.2%。