研究与基准测试/2026-09-27/28 分钟软件演化下的 LLM 测试生成评测Virginia Tech 与 CMU 的大规模实证研究全译:8 个模型、22,374 个程序变体。基线 79% 行覆盖,代码一改就掉——超过 99% 的失败测试在原始代码上能通过。