研究与基准测试/2026-09-28/18 分钟Agents' Last Exam:面向职业工作流的智能体基准ALE 用 1490 个来自真实职业项目的任务实例,覆盖 55 个子领域。最强的 Codex 加 GPT-5.5 在 Terminal-Bench 上有 82%,在 ALE 最难一档的完全通过率低于 10%,多数主流配置在该档接近零。