方法与教程/2026-09-28/3 分钟先看一条轨迹,再给对话打分GitHub 上的 Arize Phoenix 用来把一次模型调用拆开:输入、工具、检索和最终回答。适合已经有对话功能、但还不知道坏在哪一步的人。不打榜,也不代替 Promptfoo 的规则断言。
方法与教程/2026-09-28/4 分钟有检索才用 RAGAS:知识库问答的第一条检查只给会先查文档再回答的系统。用官方 ragas quickstart 生成项目,人写问题和当时检索到的原文。它看回答有没有贴着查出来的文字,不证明业务规则,也不代替接口测试。
方法与教程/2026-09-28/10 分钟功能测试的第一条 AI 门禁:Promptfoo 管死规矩,DeepEval 管答得像不像给刚转行的功能测试一条能变红的检查。Promptfoo 用 contains 和 not-contains 守退货规则里必须说和绝不能说的句子,先用 echo 不花钱看失败。DeepEval 只用几条人手写的标准答案看意思对不对。不讲榜单,不把模型的回答当成预期。