Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “附录”
Research & Benchmarks//21 min
《Agents' Last Exam》附录 C–D 完整中译:任务规格协议、执行位置与产物模式全分类、gate-and-score 等分数组合模式、证据锚定的 LLM 评审探针设计与评审类型经验分布、GCUA harness 内部结构与 14 个桌面动作工具;以及公开子集代表性验证、超时分析、两级失败分类法(理解与方法类失败占约四分之三)、模型效应约为 harness 效应 3 倍的分解、成本效率与逐任务分数热力图。
Research & Benchmarks//14 min
《Agents' Last Exam》参考文献与附录 A–B 完整中译:SOC/O*NET 分类法推导、制造与工业运营/生物分子结构与设计/3D 动画与交互媒体/机器人与自主系统等六大行业版图综述、五道关卡任务构建流水线,以及制造 G-code、音频转写、色键合成、游戏骨骼动画、放射影像五个代表性任务卡片。
Research & Benchmarks//24 min
《普林斯顿提出 Agent 可靠性科学》附录 F–G 中译:τ-bench 与 GAIA 基准的详细描述、agent 实现、提示词扰动/故障注入/环境扰动/置信度估计/安全评测五个协议,以及连接真实失败案例、跨时间趋势、一致性与可预测性完整结果等扩展图表。
Research & Benchmarks//33 min
《普林斯顿提出 Agent 可靠性科学》附录 A–E 中译:四条建议的展开、五类局限与两个异议的回应、十二个指标的直觉示例、航空/核电/汽车等安全关键领域的可靠性实践对照,以及覆盖长程可靠性、多 agent、在线监控等八个方向的研究议程。