方法与教程/2026-09-27/24 分钟RAG-Tester:检索增强大语言模型的自动化端到端测试Mondragon 大学论文全译:自动生成检索文档和测试输入,72,000 次执行检出 21,633 个失败,24 个配置中 20 个胜过基线;LLM 裁判 oracle 精确率 80.6%。真实 PDF 比 AI 生成 PDF 多暴露 64.4% 失败。原文 CC BY 4.0。