研究与基准测试/2026-09-27/22 分钟LLM Agent 的评测与基准:一篇综述SAP Labs 四位作者的 KDD '25 综述全译:按「评什么」和「怎么评」两条轴整理 Agent 评测,并指出企业场景特有的访问控制、可靠性和合规挑战。原文 CC BY 4.0。
研究与基准测试/2026-09-27/40 分钟基于 (M)LLM 的 GUI Agent 综述GUI Agent 综述全译:把架构拆成感知、探索、规划、交互四个模块,梳理移动/桌面/网页/游戏四类应用、基准与评测策略,并指出元素定位、长时程规划与安全执行等挑战。原文 CC BY 4.0。
研究与基准测试/2026-09-27/22 分钟XRepoTest:面向大语言模型的多语言仓库级单元测试生成基准河内科技大学与 L'Aquila 大学论文全译:Rust/Go/Julia/PHP/Ruby 五语言、3,642 个焦点函数、14 个模型。提出调用率 IR 识别「通过却没真正测到焦点函数」,标准设置下最强模型 TPR 也仅约 27%。原文 CC BY 4.0。