Industry & PracticeResearch & Benchmarks
500 条 模拟 工 单: 腾 讯 云 ADP 把 判断 模型 和 通用 模型 拆开 比
腾讯云 ADP 用 500 条模拟客服工单对比 Jev 和通用模型:意图准确率 88.2% 对 93.2%,空响应 5.6% 对 0,500 条成本 0.0103 美元对估算的约 2.45 美元。

In this piece
500 条模拟工单:腾讯云 ADP 把判断模型和通用模型拆开比
腾讯云 ADP 团队在 2026 年 9 月 20 日用同一份工单集对比了 Jev 和通用大模型。Jev 是 TypeSafe AI 的 System One Model,只做判断,返回类型化结果、概率和置信度,不写长文。ADP(Agent Development Platform)是腾讯云的智能体开发平台。这组数字来自 500 条自建模拟客服工单,不是线上真实流量。
判断要进流程,文字生成不够用
文章把企业里的高频问题收成四句:分到哪个队列、要不要人工复核、风险是哪一档、这条能不能过。工单路由、内容预筛、线索分级、质检判定、审核分流的结果会触发自动处理、复核或升级。通用大模型擅长对话、写作、总结和解释。即便开了 JSON Mode,也还是在生成模型上套格式。Jev 的口径是 Decisions, not strings:软件给状态和问题,模型回可执行判断,并带校准概率。
三件事故此分开:结果能不能直接被规则、工作流和数据库字段消费;不确定性能不能设灰度;每天十万到百万次调用时,单价能不能承受。
三类问题:Choice、Score、Noul
- Choice:最多 255 个选项里选一个,并返回概率。例子是退款、物流、账务、技术故障、投诉。
- Score:在 2 到 10 级的语义轴上打分。例子是情绪、风险和质检缺陷等级。
- Noul:判断一个陈述真不真,概率在 0 到 1。例子是有没有明确退款意愿、要不要转人工。
接入指南写的工程口径:放弃文本生成和对话,目标延迟 70 到 500 毫秒,输入 0.042 美元 / 百万 token,输出免费。官网另一口径是 42 美元 / 十亿输入 token,数量级一致。2026 年 9 月 21 日起取消 Waitlist,可直接注册。第三方通道的模型 ID 包括 typesafe/jev 和 typesafe/jev-latest,后者是聚合平台 ID,不是官方请求体里的 model。官方请求体用 jev-latest。这些是接入说明,不是这次评测的得分。
对照实验只改模型,不改题
ADP 上搭了两个对称应用,都是单工作流,都做三项判断:意图分类、情绪分级、是否转人工。数据集 500 条,覆盖退款、技术故障、账单咨询、售前咨询、投诉。并发 10 路,按样本 ID 对齐。Jev 成本用 API 返回的输入 token。LLM 成本按单次输入约 500 token、输出约 80 token 估算,文中标明是量级参考,不是账单。
| 指标 | Jev | LLM |
|---|---|---|
| 意图分类准确率 | 88.2% | 93.2% |
| 去掉空结果后的意图准确率 | 约 93.5% | 93.2% |
| 情绪评分 MAE | 0.29 | 0.16 |
| 转人工准确率 | 86.6% | 89.8% |
| 速度 | 0.38 秒/条 | 0.57 秒/条 |
| 500 条成本 | 0.0103 美元 | 约 2.45 美元 |
| 置信度 | 有,均值 0.96 | 无校准置信度 |
| 可分流灰度区 | 31.4% | 无,常见二值输出 |
| 空结果或失败率 | 5.6% | 0 |
读表时要分开三件事。准确率上 LLM 略高;去掉 Jev 的空响应后,意图分类接近。成本差大约 238 倍,但 LLM 一侧是估算。速度上 Jev 快约 33%。Jev 对「是否转人工」给 0 到 1 的概率,才能做三段分流。
这批样本的转人工概率是:
- 低于 0.3:151 条,30.2%,建议自动处理。
- 0.3 到 0.7:157 条,31.4%,建议人工复核。
- 大于等于 0.7:192 条,38.4%,建议转人工。
短板也写了:5.6% 空响应;情绪激烈的退款和技术故障容易被判成投诉。缓解办法是改 criteria 措辞、加重试、设兜底模型,并继续评测。没有给出重试之后的空响应率。
选型不看单次准确率
判断模型适合选项稳定、结果要被程序执行、调用量高、需要灰度的任务。通用模型适合开放问题、要解释、要生成回复。同一条链路可以组合:Jev 先判断,低风险再让通用模型写标准回复,中风险进复核,高风险直接转人工并标优先级。后面记下判断、置信度、动作和人工结果,再按阈值比较准确率、召回率、人工节省率和体验。人工节省率在建议清单里,这次 500 条实验没有报这个数。
最小闭环六步:标注集要有主类、边界、异常和高风险;指标包括分类准确率、召回、误拦、漏放、情绪 MAE、人工节省、延迟和单位成本;阈值分成自动、复核、升级;空响应、低置信和接口失败进人工或备用模型;日志留输入、输出、概率、阈值、动作和人工反馈;复核结果回流成新评测集。
FAQ 把不能做的事写清楚。Jev 不能替换所有通用模型调用。JSON Mode 仍是生成,Jev 是判断接口,效果仍要在业务数据上测。概率不能未经评测就当决策依据,要先看不同阈值下的准确率、漏判率和复核量。调用量低、现有方案又稳,不必为了换模型而换。概率的校准是否可靠,通用模型如果只靠提示词输出置信度,要单独验证。文中没有做这项验证。
这组 88.2%、93.2%、0.29、0.16、5.6% 和 0.0103 美元都绑在 500 条模拟工单上。不能写成生产准确率,也不能把约 2.45 美元写成实付账单。
出处:腾讯云 ADP,腾讯云 ADP 团队,Jev对比通用大模型:自动判断任务怎么选,2026-09-20,https://adp.tencent.com/zh/blog/jev-vs-general-llm-automated-decision-selection
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.