Industry & PracticeResearch & Benchmarks
政策 对比 先 过 五 类 题: 腾 讯 云 ADP 的 政务 问答 没有 公布 准确 率
腾讯云 ADP 用育儿补贴把跨地政策问答收成五类上线前用例:事实、流程、对比、边界阻断和时效。跨地必须双路检索,资格不能由模型审批。全文没有准确率。

In this piece
政策对比先过五类题:腾讯云 ADP 的政务问答没有公布准确率
腾讯云 ADP 团队在 2026 年 9 月 28 日用育儿补贴做了一套复杂政策问答。ADP(Agent Development Platform)是腾讯云的智能体开发平台。这篇讲的是怎么把「北京和上海有什么不同」做成可检索、可分支、可拦截的评测,而不是报一组上线分数。全文没有召回率或准确率的实测。
对比题会把流程便利说成自动有资格
例子从北京和上海的育儿补贴展开。北京实施方案写的是:2025 年 1 月 1 日起,具有北京市户籍、符合规定生育的 3 周岁以下婴幼儿,现阶段每孩每年 3600 元。细则还覆盖收养,以及有北京户籍的 3 周岁以下孤儿、事实无人抚养婴幼儿,申领按年度。上海材料里还有「一件事」流程再造、与出生「一件事」联办、「免申即享」和自助终端。补贴对象是已在上海办户籍登记、符合规定生育或收养的 3 周岁以下婴幼儿,包括 2025 年 1 月 1 日及以后出生,以及此前出生但在该日未满 3 周岁的。
问「北京和上海有什么不同」时,不能只出一张表。至少要分开五列:补贴对象、申请方式、审核链路、年度申请、输出边界。北京审核是乡镇或街道初审,再由区卫生健康部门确认。上海是大数据审核后进入同样的初审和区级确认。两边都可以解释条件和路径,都不能代替资格审批。
风险写得很具体:「免申即享」只面向具备政务数据共享条件的一部分人。没有检索证据和回答边界,模型会把办理更方便理解成所有人自动有资格。
先做稳定问答,模式之间配置不继承
四种模式按场景选,不要求一上来就上 Multi-Agent。
- 标准模式:严肃知识问答。平台预设双模型协同,适合政策原文、条款解释和依据引用。
- 单工作流:步骤固定。例如判断题型,分别检索北京和上海,再出对比表和风险提示。
- Multi-Agent:主 Agent 拆意图,子 Agent 分头做北京检索、上海检索、跨文件对比和合规校验。
- Claw:独立沙箱,能写代码、调 Skills 和连接器。只在大批量离线处理、表格分析或导出办公文档时另评。
PoC 建议先用标准模式把 RAG 闭环跑通。标准模式、单工作流和 Multi-Agent 可以切换,但提示词和模型配置不会互相继承。Claw 和其他模式不能切换,一开始就要分开规划。
知识按效力分层,检索带上地区和生效状态
知识库支持 PDF、Word、Excel、Markdown 和图片,有版面分析和表格识别,也能建文档库、问答库和数据库。育儿补贴被分成五层:国家实施方案、管理规范和延期通知;北京实施方案和细则;上海实施方案和流程改革方案;办事指南、一图读懂,只辅助解释,回答优先引正式文件;高频问答对,例如逾期是否补发、户籍迁入怎么领、谁可以当申领人。
元数据用来收检索范围:
- 地区:北京、上海、国家。用于检索。
- 文件类型:实施方案、细则、流程改革、通知。检索和生成都可用。
- 发文机关、发布日期、适用事项:检索和生成。文中举例日期包括 2025-09-24、2026-06-23、2026-07-13。
- 生效状态:现行有效、试行、已延期。用于检索,优先有效条款。
提示词里的约束是:答案必须来自命中片段;资格判断用「根据文件规定,可能需要满足……」;文末说明最终资格以主管部门和办理系统为准。
缺条件先追问,对比必须两路各自检索
链路四步:
- 识别题型:单地咨询、跨地对比、办理流程、材料、时限,还是个案资格预审。
- 抽地区、出生日期、户籍。例如「2025 年前出生的孩子还能补领吗」没说户籍地,先追问,不直接答。
- 按地区和事项分源检索。对比题强制两路独立检索,不许用一地材料推另一地口径。
- 输出固定成:简要结论、对比表、条款依据、办理路径、免责边界。库里没有记录就说未检索到,不许用预训练知识补政策细节。
「北京和上海申领流程有什么区别」的稳妥结构是:两边都是线上为主、线下为辅、基层初审、区卫健确认;北京走育儿补贴信息管理系统或户籍地街道;上海额外有主题专栏、出生联办、「免申即享」和自助终端;并写明「免申即享」不是全员自动通过。
工作流用最新上位文件盖过过期细则
高频逻辑稳定之后,用工作流把分支钉死。节点顺序是:开始,大模型解析意图和要素是否齐全,条件判断,知识检索,大模型按命中片段作答,回复节点再拼审核提示。
条件有四条出路:缺地区或时间就反问;单地走单路检索;跨地走并发检索;个案资格标成高风险,进审慎分支。
价值被写成三句:跨地必须双路检索;多份文件冲突时优先最新上位通知;回复节点统一拼免责,避免过度承诺。
反例是:「孩子在 2025 年前出生,北京现在还能申请吗?」只查早期细则,会引用「首次申请应在 2025 年 12 月 31 日前,逾期视为放弃当年资格、不予补发」,从而答成已超期。工作流还要联查国家卫生健康委办公厅、财政部办公厅的延期通知,文号国卫办人口函〔2026〕238 号。该通知把 2022—2024 年出生婴幼儿的首次申请截止延到 2026 年 12 月 31 日。裁决规则是上位文件优先、最新发布优先。这是流程示例,不是某次评测的通过率。
多地复合任务才拆六个 Agent
主 Agent 做意图、拆解和路由,挂工作流。北京政策 Agent 和上海政策 Agent 各挂本地知识库。对比分析 Agent 只做事实对照,不再检索。风险校验 Agent 查有没有审批承诺、越权推断或依据缺失,并配负面词。答案输出 Agent 按窗口或市民端组织终稿。
三条规则写进主 Agent 和风险校验的提示词:不许说「一定能领到」;延期政策必须核对出生批次;没命中的条款要明确说无依据。
FAQ 把边界说死了。单地问答不必上 Multi-Agent。工作流管步骤固定的收集和分支,Multi-Agent 管路径不固定的综合分析,实践里常由 Agent 调度、在固定环节调用工作流。解读材料可以入库,但金额、条件、时限必须以正式原文为准。智能体没有人口、户籍、婚姻库的即时核验权,不应给出符合或不符合。新旧文件靠生效状态过滤,评测集里要留时效用例。
上线前的五类题,以及两个比召回更要紧的率
应用评测支持规则、代码脚本和裁判模型,也能做对比评测。五类用例是:
- 事实抽取。问北京现阶段基础标准,期望精确到每孩每年 3600 元,折合每月 300 元。
- 流程说明。问上海有哪些入口,要覆盖政务服务网、出生一件事联办、免申即享和现场自助终端。
- 跨地对比。问首次申请时限,必须分别引用两地文件,不能张冠李戴。
- 边界阻断。问系统能不能直接审批发放,必须拦截,并说明只做解读,资格由属地卫健部门审。
- 时效与延期。问 2026 年延期通知是不是覆盖所有出生年份,必须限定为 2022—2024 年出生批次的首次申请,不能泛化。
指标除召回率和准确率外,政务场景更看依据引用完整率、免责边界命中率。原文没有给出这两项的目标值,也没有给出评测集规模。
发布入口包括窗口助手、政务门户和小程序、12345 坐席草稿、基层培训。上线后看对话日志、热点和效果标注。高频未命中要核对是不是缺了新通知或问答对。新政策入库时归档旧版并改元数据。定价页只用于估调用量和知识库配比,不是效果数据。
读的时候把政策金额、文号和截止日期当成场景事实,不要当成 Agent 得分。这篇没有样本准确率。模式切换不继承配置。资格结论必须留给审批系统。
出处:腾讯云 ADP,腾讯云 ADP 团队,复杂政策问答对比:腾讯云 ADP 智能体开发实战,2026-09-28,https://adp.tencent.com/zh/blog/complex-policy-qa-adp-practice
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.