数据集与基准管理
维护带标注的评测集,按版本记录 Prompt、模型和知识库配置,让每次结果可对比。
OpenQA · Verification Capability
智测 OpenQA 用数据集、LLM-as-judge 与规则断言评测大模型应用的准确性、幻觉、检索质量、工具调用轨迹与安全性,把评测接入 CI,让 Prompt 或模型变更在上线前得到量化反馈。
大模型应用评测是对基于 LLM 的功能——问答、RAG、Agent、多模态——进行系统化测试的方法。它不只检查单次输出对不对,而是用固定数据集与多种指标衡量准确性、忠实度、幻觉率、检索命中、工具调用正确性和安全边界,并在每次 Prompt、模型或知识库变更后重复运行。
维护带标注的评测集,按版本记录 Prompt、模型和知识库配置,让每次结果可对比。
结合 LLM-as-judge、规则断言和检索指标(上下文精确率、召回率、忠实度)衡量输出质量。
按 Agent 的工具调用路径、参数和中间状态打分,而不只看最终答案。
用对抗性提示探测越狱、提示注入、敏感信息泄露,并把失败作为发布阻断条件。
从真实问题、历史对话和边界案例整理数据集并标注期望。
按功能类型组合准确性、忠实度、检索、轨迹和安全指标。
Prompt、模型或知识库变更时自动运行评测,输出与基线的差异。
按失败样本定位到检索、Prompt、模型还是工具问题,形成修复任务。
通常覆盖四大体系:1) RAG 检索与生成指标(检索精确率、召回率、Faithfulness 忠实度、Answer Relevance 相关性);2) 业务准确性(Ground Truth 命中率、语义相似度);3) Agent 工具调用评测(工具选型正确率、参数填充准确率、规划路径步数);4) 安全红队评测(越狱、提示词注入、毒性与隐私泄露)。
在设计了结构化评分维度、Few-Shot 示例并配合基准判定模型时,LLM-as-judge 与人工专家评分的一致性可达 85%~92%。最佳工程实践是将规则断言(正则/JSON Schema)、LLM 打分与专家抽检三者结合。
重点分层测试:检索层关注 Top-K 召回率与排序质量,生成层关注模型是否严格基于召回上下文回答(杜绝幻觉),端到端关注用户问题解决率与响应延迟。
传统测试保障接口协议、鉴权、限流、数据库存储等确定性系统链路;大模型评测保障概率性文本生成的质量下限。两者均集成在 CI/CD 中作为双重质量保障。