研究与基准测试/2026-09-27/22 分钟LLM Agent 的评测与基准:一篇综述SAP Labs 四位作者的 KDD '25 综述全译:按「评什么」和「怎么评」两条轴整理 Agent 评测,并指出企业场景特有的访问控制、可靠性和合规挑战。原文 CC BY 4.0。
研究与基准测试/2026-09-27/35 分钟用于软件测试的大语言模型:一份研究路线图Oviedo 大学与意大利 CNR 五位的半系统性综述全译:130 篇文章归成七类,逐类给出过程示意,并提出准备-交互-验证三阶段挑战与四个软件测试梦想。原文 CC BY 4.0。
研究与基准测试/2026-09-27/40 分钟基于 (M)LLM 的 GUI Agent 综述GUI Agent 综述全译:把架构拆成感知、探索、规划、交互四个模块,梳理移动/桌面/网页/游戏四类应用、基准与评测策略,并指出元素定位、长时程规划与安全执行等挑战。原文 CC BY 4.0。
研究与基准测试研究与基准测试/2026-09-27/12 分钟用于软件测试的大语言模型:研究路线图·下下篇:准备、交互、验证三阶段的技术挑战与社会挑战,以及 LLM 对四个软件测试梦想的长期影响。上篇见 llm-software-testing-roadmap-zh。
研究与基准测试研究与基准测试/2026-09-27/15 分钟基于 (M)LLM 的 GUI Agent 综述·下下篇:数据集与基准(环境、任务、评测策略、成本/多样性/安全挑战)与未来方向。上篇见 gui-agents-survey-zh。