研究与基准测试/2026-09-27/28 分钟软件演化下的 LLM 测试生成评测Virginia Tech 与 CMU 的大规模实证研究全译:8 个模型、22,374 个程序变体。基线 79% 行覆盖,代码一改就掉——超过 99% 的失败测试在原始代码上能通过。
研究与基准测试研究与基准测试/2026-09-27/20 分钟理解 LLM 驱动的测试 Oracle 生成奥克兰大学与 KCL 的 AIware 2025 论文全译:2,160 次运行、36 个真实 Java 缺陷。CUT 上下文把 oracle 准确率提到 53.64%;zero-shot/few-shot 胜过 CoT/ToT;提示技术比模型选择影响更大。原文 CC BY 4.0。