研究与基准测试/2026-09-27/28 分钟软件演化下的 LLM 测试生成评测Virginia Tech 与 CMU 的大规模实证研究全译:8 个模型、22,374 个程序变体。基线 79% 行覆盖,代码一改就掉——超过 99% 的失败测试在原始代码上能通过。
研究与基准测试/2026-09-27/35 分钟用于软件测试的大语言模型:一份研究路线图Oviedo 大学与意大利 CNR 五位的半系统性综述全译:130 篇文章归成七类,逐类给出过程示意,并提出准备-交互-验证三阶段挑战与四个软件测试梦想。原文 CC BY 4.0。
研究与基准测试/2026-09-27/40 分钟基于 (M)LLM 的 GUI Agent 综述GUI Agent 综述全译:把架构拆成感知、探索、规划、交互四个模块,梳理移动/桌面/网页/游戏四类应用、基准与评测策略,并指出元素定位、长时程规划与安全执行等挑战。原文 CC BY 4.0。
研究与基准测试研究与基准测试/2026-09-27/12 分钟用于软件测试的大语言模型:研究路线图·下下篇:准备、交互、验证三阶段的技术挑战与社会挑战,以及 LLM 对四个软件测试梦想的长期影响。上篇见 llm-software-testing-roadmap-zh。
研究与基准测试研究与基准测试/2026-09-27/15 分钟基于 (M)LLM 的 GUI Agent 综述·下下篇:数据集与基准(环境、任务、评测策略、成本/多样性/安全挑战)与未来方向。上篇见 gui-agents-survey-zh。
研究与基准测试/2026-09-27/10 分钟Tokenomics:量化 Agent 软件工程中的 token 都花在哪了Concordia 大学 MSR 2026 论文全译:ChatDev + GPT-5 跑 30 个开发任务,代码评审吃掉平均 59.4% 的 token,输入 token 占 53.9%——agent 协作的主要成本在精炼与验证,不在写代码。原文 CC BY 4.0。
研究与基准测试研究与基准测试/2026-09-27/20 分钟理解 LLM 驱动的测试 Oracle 生成奥克兰大学与 KCL 的 AIware 2025 论文全译:2,160 次运行、36 个真实 Java 缺陷。CUT 上下文把 oracle 准确率提到 53.64%;zero-shot/few-shot 胜过 CoT/ToT;提示技术比模型选择影响更大。原文 CC BY 4.0。
研究与基准测试/2026-09-27/18 分钟NeuroTestGen:用大语言模型做神经符号引导的测试生成York 大学论文全译:符号执行(Z3)解数值路径 + LLM 解对象路径的混合测试生成。Defects4J 14 项目上,Claude 3.5 下行覆盖 70.88%→75.87%、分支 65.15%→70.87%,胜过 SOTA Panta。原文 CC BY 4.0。
研究与基准测试/2026-09-27/22 分钟XRepoTest:面向大语言模型的多语言仓库级单元测试生成基准河内科技大学与 L'Aquila 大学论文全译:Rust/Go/Julia/PHP/Ruby 五语言、3,642 个焦点函数、14 个模型。提出调用率 IR 识别「通过却没真正测到焦点函数」,标准设置下最强模型 TPR 也仅约 27%。原文 CC BY 4.0。