CodexQA

Industry & PracticeResearch & Benchmarks

先洗出一百到两百张工单:腾讯云 ADP 把 FDE 验收落在回归评测上

CodexQA 团队2 min read

腾讯云 ADP 建议 FDE 用 100 到 200 条真实工单做黄金测试集,回归上下文召回率、回答真实度和业务切题度。认证考试 70 分是考试线,不是 Agent 准确率。

先洗出一百到两百张工单:腾讯云 ADP 把 FDE 验收落在回归评测上

腾讯云 ADP 团队在 2026 年 9 月 14 日写了前沿部署工程师为什么重新被需要。FDE(Forward Deployed Engineer)指进客户现场、既懂业务也改系统的工程师。ADP(Agent Development Platform)是腾讯云的智能体开发平台。这篇的评测部分不在榜单,而在交付怎么验收:黄金测试集从哪来、改一次配置要回归什么,以及认证考试不要当成 Agent 准确率。

演示能过,生产卡在三处

会议室演示通常是选一个模型、挂一个知识库、放几份文档、问预设问题。进内网之后,模型不会自动理解文档版本、设备批次、权限、私有接口和审批规则。

三道阻塞是:扫描件、嵌套表格、模糊代号和频繁改版,全局向量会召回两年前已停产的配件;售后排查、合同审批、巡检有严格 SOP,开放多轮对话会前后矛盾、漏校验或死循环;核心数据在内网专线,接口旧、鉴权私有,不能对公网开端口,角色权限又要求灵活。全文没有给出这三类失败的占比。

查手册和走流程分开

相近机型的备件代号可能差一个后缀。做法是两段:先从意图里抽出型号和批次,用元数据锁检索范围,再做向量加全文的混合召回。电压、指示灯、是否转人工这些步骤固定在工作流上,不让模型在对话里猜下一步。这和已写过的医疗售后案例是同一类工程判断,这篇没有重复 60% 到 93% 那组线上数字,这里也不补。

连接器和 MCP(Model Context Protocol,统一暴露工具的协议)把遗留接口收成标准工具:现场定义入参和返回,通信、鉴权和穿透由平台做。智能体因此可以在合规边界内读系统数据、流转工单,而不只是查文件。

验收锚点是一百到两百条真实工单

文章把「客户说不好用、工程师不知道改哪」归因于没有事实锚点。按个例改提示词,会修好一处、碰坏别处。

进场第一步是从历史工单、客服质检和维修记录里洗出 100 到 200 条有代表性的样本,作为黄金测试集。导入 ADP 的自动化评测套件后,打三个分:上下文召回率、回答真实度、业务切题度。每次改检索参数或流程,都在控制台跑全量回归。原文没有给出这三个分的目标阈值,也没有给出某次回归的前后分差。100 到 200 是建议规模,不是某个客户的实计数。

认证的 70 分是考试线,不是模型线

认证面向合作伙伴工程师和要做企业 Agent 交付的个人。课程包括产品边界、知识库、工具、连接器、Skills、Workflow、Multi-Agent、Claw,以及评测优化:调试、Prompt、知识库和 RAG、Workflow、Multi-Agent。证书 2 年。考试是线下理论,单选和多选,90 分钟,60 题,70 分及格,满分 100。知识模块含安全合规和责任 AI。70/100 只能说明考试通过线,不能写成任何 Agent 的准确率。

定价页只用于看套餐,不提供效果数据。

出处:腾讯云 ADP,腾讯云 ADP 团队,硅谷复兴的FDE,到底在解企业AI的什么难题?,2026-09-14,https://adp.tencent.com/zh/blog/why-fde-matters-for-enterprise-ai

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction