研究与基准测试研究与基准测试/2026-09-27/20 分钟理解 LLM 驱动的测试 Oracle 生成奥克兰大学与 KCL 的 AIware 2025 论文全译:2,160 次运行、36 个真实 Java 缺陷。CUT 上下文把 oracle 准确率提到 53.64%;zero-shot/few-shot 胜过 CoT/ToT;提示技术比模型选择影响更大。原文 CC BY 4.0。