测试一个“听起来对、实际上错”的 RAG 流水线
把检索指标和生成指标分开,否则你会花一周时间去调优错误的那个阶段。
- 作者
- QASkill Hub
- 发布于
- 9 分钟
- 阅读约 9 分钟
先拆开流水线,再做度量
上下文精确率高、忠实度低,说明检索找到了正确的段落,而生成器忽略了它们。上下文召回率低,说明问题在索引。把两者揉进一个总的质量分数,就看不出到底是哪一边出了问题。
一套可行的组合
检索专项指标用 Ragas;断言需要和其他测试一起放在 pytest 里时用 DeepEval;需要通过追踪定位是哪一步质量下降时用 Phoenix。
先构建黄金数据集
这里提到的每一个框架都需要黄金数据集,它的质量决定了下游一切结果的上限。五十条精心整理的问答对,胜过五百条爬来的。