研究与基准测试/2026-10-11/8 分钟τ³-Bench:把智能体基准评测推进到知识与语音Sierra 发布 τ³-Bench。知识任务上,最好的前沿模型只完成约 25%;即便给到正确文档,也只有 40%。现实噪声和打断下,语音完成率落到 26%–38%。