研究与基准测试/2026-09-27/28 分钟软件演化下的 LLM 测试生成评测Virginia Tech 与 CMU 的大规模实证研究全译:8 个模型、22,374 个程序变体。基线 79% 行覆盖,代码一改就掉——超过 99% 的失败测试在原始代码上能通过。
研究与基准测试/2026-09-27/18 分钟NeuroTestGen:用大语言模型做神经符号引导的测试生成York 大学论文全译:符号执行(Z3)解数值路径 + LLM 解对象路径的混合测试生成。Defects4J 14 项目上,Claude 3.5 下行覆盖 70.88%→75.87%、分支 65.15%→70.87%,胜过 SOTA Panta。原文 CC BY 4.0。
方法与教程/2026-09-27/24 分钟RAG-Tester:检索增强大语言模型的自动化端到端测试Mondragon 大学论文全译:自动生成检索文档和测试输入,72,000 次执行检出 21,633 个失败,24 个配置中 20 个胜过基线;LLM 裁判 oracle 精确率 80.6%。真实 PDF 比 AI 生成 PDF 多暴露 64.4% 失败。原文 CC BY 4.0。