Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “Berkeley”
Research & Benchmarks//21 min
《Agents' Last Exam》附录 C–D 完整中译:任务规格协议、执行位置与产物模式全分类、gate-and-score 等分数组合模式、证据锚定的 LLM 评审探针设计与评审类型经验分布、GCUA harness 内部结构与 14 个桌面动作工具;以及公开子集代表性验证、超时分析、两级失败分类法(理解与方法类失败占约四分之三)、模型效应约为 harness 效应 3 倍的分解、成本效率与逐任务分数热力图。
Research & Benchmarks//14 min
《Agents' Last Exam》参考文献与附录 A–B 完整中译:SOC/O*NET 分类法推导、制造与工业运营/生物分子结构与设计/3D 动画与交互媒体/机器人与自主系统等六大行业版图综述、五道关卡任务构建流水线,以及制造 G-code、音频转写、色键合成、游戏骨骼动画、放射影像五个代表性任务卡片。
Research & Benchmarks//18 min
UC Berkeley 联合 250 多位行业专家推出 Agents' Last Exam(ALE):55 个子领域、13 个行业集群、1490 个来自专家真实交付项目的任务实例,全部用确定性脚本自动验证。最强配置 Codex+GPT-5.5 总体通过率仅 24%,最难的末考层大面积挂零——基准成功与 GDP 相关影响之间的鸿沟,第一次被完整量化。本卷为正文,参考文献与附录见下两卷。