智测·OpenQA面向 AI 软件交付的证据化变更验收平台

OpenQA · Verification Capability

大模型应用评测:给 LLM、RAG 与 Agent 功能加上质量门禁

智测 OpenQA 用数据集、LLM-as-judge 与规则断言评测大模型应用的准确性、幻觉、检索质量、工具调用轨迹与安全性,把评测接入 CI,让 Prompt 或模型变更在上线前得到量化反馈。

在产品中接入 LLM 或 RAG 的研发团队需要为 AI 功能设定发布标准的质量团队构建 Agent 产品、关心工具调用可靠性的团队
什么是大模型应用评测

大模型应用评测是对基于 LLM 的功能——问答、RAG、Agent、多模态——进行系统化测试的方法。它不只检查单次输出对不对,而是用固定数据集与多种指标衡量准确性、忠实度、幻觉率、检索命中、工具调用正确性和安全边界,并在每次 Prompt、模型或知识库变更后重复运行。

核心能力

数据集与基准管理

维护带标注的评测集,按版本记录 Prompt、模型和知识库配置,让每次结果可对比。

多指标评测

结合 LLM-as-judge、规则断言和检索指标(上下文精确率、召回率、忠实度)衡量输出质量。

Agent 轨迹评测

按 Agent 的工具调用路径、参数和中间状态打分,而不只看最终答案。

安全与红队

用对抗性提示探测越狱、提示注入、敏感信息泄露,并把失败作为发布阻断条件。

工作流程
  1. 定义评测集

    从真实问题、历史对话和边界案例整理数据集并标注期望。

  2. 选择指标

    按功能类型组合准确性、忠实度、检索、轨迹和安全指标。

  3. 接入 CI

    Prompt、模型或知识库变更时自动运行评测,输出与基线的差异。

  4. 归因与修复

    按失败样本定位到检索、Prompt、模型还是工具问题,形成修复任务。

可以获得什么
  • 多维度量化看板:涵盖准确率、召回率、幻觉率、上下文忠实度、回答相关性与安全越狱率等核心指标
  • Prompt 调优版本对比:每次提示词修改或知识库微调均可自动化生成 Benchmark 对比报告与胜率矩阵
  • 轨迹诊断:全面捕获 Agent 规划、思考、工具调用(Function Calling)与参数生成的每一步执行日志
  • 发布质量门禁:将评测指标设为自动化阻断阈值,防止劣质模型输出流入生产环境
常见问题
大模型应用评测包含哪些关键评测维度?

通常覆盖四大体系:1) RAG 检索与生成指标(检索精确率、召回率、Faithfulness 忠实度、Answer Relevance 相关性);2) 业务准确性(Ground Truth 命中率、语义相似度);3) Agent 工具调用评测(工具选型正确率、参数填充准确率、规划路径步数);4) 安全红队评测(越狱、提示词注入、毒性与隐私泄露)。

LLM-as-judge 自动评测真的可信吗?

在设计了结构化评分维度、Few-Shot 示例并配合基准判定模型时,LLM-as-judge 与人工专家评分的一致性可达 85%~92%。最佳工程实践是将规则断言(正则/JSON Schema)、LLM 打分与专家抽检三者结合。

RAG 检索增强生成系统最核心测什么?

重点分层测试:检索层关注 Top-K 召回率与排序质量,生成层关注模型是否严格基于召回上下文回答(杜绝幻觉),端到端关注用户问题解决率与响应延迟。

大模型评测和传统软件测试如何协同?

传统测试保障接口协议、鉴权、限流、数据库存储等确定性系统链路;大模型评测保障概率性文本生成的质量下限。两者均集成在 CI/CD 中作为双重质量保障。