研究与基准测试/2026-09-27/18 分钟NeuroTestGen:用大语言模型做神经符号引导的测试生成York 大学论文全译:符号执行(Z3)解数值路径 + LLM 解对象路径的混合测试生成。Defects4J 14 项目上,Claude 3.5 下行覆盖 70.88%→75.87%、分支 65.15%→70.87%,胜过 SOTA Panta。原文 CC BY 4.0。
研究与基准测试/2026-09-27/22 分钟XRepoTest:面向大语言模型的多语言仓库级单元测试生成基准河内科技大学与 L'Aquila 大学论文全译:Rust/Go/Julia/PHP/Ruby 五语言、3,642 个焦点函数、14 个模型。提出调用率 IR 识别「通过却没真正测到焦点函数」,标准设置下最强模型 TPR 也仅约 27%。原文 CC BY 4.0。