OpenQASoftware verification infrastructure for the AI era
Techniques & Tutorials

测试一个“听起来对、实际上错”的 RAG 流水线

把检索指标和生成指标分开,否则你会花一周时间去调优错误的那个阶段。

By
QASkill Hub
Published
9 min
9 min read

先拆开流水线,再做度量

上下文精确率高、忠实度低,说明检索找到了正确的段落,而生成器忽略了它们。上下文召回率低,说明问题在索引。把两者揉进一个总的质量分数,就看不出到底是哪一边出了问题。

一套可行的组合

检索专项指标用 Ragas;断言需要和其他测试一起放在 pytest 里时用 DeepEval;需要通过追踪定位是哪一步质量下降时用 Phoenix。

先构建黄金数据集

这里提到的每一个框架都需要黄金数据集,它的质量决定了下游一切结果的上限。五十条精心整理的问答对,胜过五百条爬来的。

Skills

Registry entries used in this piece

LLM Evaluation

DeepEval

Skill

原生基于 pytest 的 LLM 评测,60 多种指标。

Open CoreFreemiumApache-2.0Homepage
LLM Observability

Arize Phoenix

Skill

LLM 追踪与评测,可在 ELv2 许可下自托管。

Elastic License 2.0,并非 OSI 认可的开源许可:允许自托管,不允许作为托管服务转售。

Open CoreFreemiumELv2Homepage

All pieces