CodexQA

Industry & PracticeResearch & Benchmarks

能跑通还不够:腾讯云 ADP 用五件事判断 Agent 能不能进生产

CodexQA 团队7 min read

腾讯云 ADP 从 DeepSeek Harness 的插件、动态装载和会话日志,整理进生产前的治理检查。文末五条是成功率稳定、失败可恢复、调用可审计、权限清楚、成本延迟可接受。没有给出阈值。

In this piece

能跑通还不够:腾讯云 ADP 用五件事判断 Agent 能不能进生产

腾讯云 ADP 团队在 2026 年 8 月 14 日写了 DeepSeek Harness 进入企业之后还缺什么。DeepSeek Harness 是模型之外的 Agent 运行层:工具、状态、权限、上下文、沙箱、恢复、评估和观测都放在这里。文章的评测价值不在某一组榜单分数,而在它把「能不能进生产」收成可检查的治理项,并在文末给出五条生产化条件。ADP(Agent Development Platform)是腾讯云的智能体开发平台,文中的 4.0 是用来对照的企业落地路径,不是一份已公布的准确率报告。

模型只是链路中间的一环

只回答问题时,提示词、模型和知识库就能做出可演示应用。一旦要读写文件、调用工具、执行代码、拆任务、派子 Agent、处理失败、等待外部事件再继续,就需要运行外壳。原文把外壳叫做 Agent Harness。

它先解决 Agent 怎么跑。进企业之后,问题变成低门槛构建、安全授权、审计追踪、长期稳定和规模化管理。开发者看自由度,企业看确定性、权限边界、审计、成本控制和长期稳定性。

真实链路被写成:用户目标、规划任务、组织上下文工具和权限、模型决策、执行工具或代码、读结果、更新状态,然后继续、等待、恢复或终止。模型只是其中一环。长任务还依赖上下文管理、工具编排、权限、状态持久化、错误恢复、可观测性和成本控制。

插件能换能力,也把供应链和审计变成必查项

DeepSeek Harness 以 Everything is a Plugin 把模型、工具、技能、会话、沙箱、存储、Agent 循环、任务调度和界面拆成可加载、可卸载、可替换的插件。对开发者有三类好处:同一套工具和权限下只换模型,或固定模型去比上下文、工具加载和 Agent Loop;沙箱、存储、凭证、审计、审批、遥测理论上都能以插件接入;工具和技能可以独立发布,不必长期维护分叉版本。

治理难度同时被放大。工具插件可能访问文件和外部服务,存储插件可能保存完整会话,循环插件可能改变决策路径。企业评估时要同时问六件事:

  1. 插件来源是否可信,有没有安全扫描、维护者和版本记录。
  2. 权限边界:能访问哪些文件、API、网络和凭证。
  3. 依赖是否可审计,有没有冲突或供应链风险。
  4. 版本兼容:Harness 升级后插件还能不能跑。
  5. 审计:执行了什么、何时执行、谁授权、结果是什么。
  6. 回滚:升级失败能不能退回。

开放程度越高,权限、审批、审计和运维越要一起设计。原文没有给出某一插件的扫描通过率。

按任务装载,避免把几十个工具一次交给模型

普通构建器常把固定系统提示、固定工具列表、固定知识库和固定上下文一次交给模型。简单场景够用。用户只是要整理一封客户跟进邮件时,不必同时加载 CRM、数据库、浏览器、网盘、工单、知识库和几十个 Tool Schema。工具和上下文过多会增加 Token,也会干扰判断。

更合理的顺序是:请求进来,运行时判断任务类型和风险级别,只选必要的 Context、Skill 和 Tool,模型再规划和执行,再按中间结果调整装载。工程动作有五步:裁剪当前需要的历史、文件片段、工具结果和知识;长会话做摘要和压缩;按目标路由工具;Skill 把领域知识、流程、工具说明和脚本封成可复用技能,需要时再注入;超大返回放到文件、对象存储或会话事件引用,避免上下文无限膨胀。

ADP 4.0 的 Claw 模式被写成可以挂多类原生 Skills,并支持企业共享、安全报告、提示词模板和连接器。重点被改写成「这一轮到底该给哪些能力」,不是「能接多少工具」。原文没有给出裁剪前后的 Token 对照。

会话日志要能回放,也能变成评测样本

企业任务往往一次调用结束不了。例子包括:分析销售数据后发现异常再写报告;查线上日志定位故障;改代码、跑测试、交修复建议;处理多段会议录音,抽出议题、时间线和责任人;跨系统做审批前的信息准备。Agent 要观察、计划、调用、读结果、改策略,直到完成、中断、失败或等人确认。

DeepSeek Harness 把一次运行收成按顺序追加的事件流。模型消息、工具调用、工具结果、上下文注入、子 Agent 调度都可以记录,用于恢复和回放。对企业的五用途被分开写:

  • 回放:复盘某一步看到的上下文和工具结果。
  • 审计:确认高风险操作的授权、执行和结果。
  • 调试:判断问题来自模型、提示词、工具、权限还是数据。
  • 恢复:中断后按 Session 继续。
  • 评测:把真实轨迹沉淀成优化和评测样本。

完整事件流可能含内部文档、代码、工具返回、业务数据甚至凭证线索。所以日志还要脱敏、访问控制、保留周期、审计权限和数据出境策略。这是使用限制,不是可选项。ADP 4.0 被写成把运行、工具调用、权限、日志审计和资源调度放进云端治理,并支持长任务续跑和链路追踪。原文没有公布续跑成功率。

MCP 和连接器都不代替运行循环

MCP(Model Context Protocol,把工具和资源按统一方式暴露给模型的协议)回答有哪些工具、参数 Schema 是什么、怎么读资源、怎么调用。Harness 回答另一组问题:什么时候把工具交给模型,调用前要不要审批,结果怎么写入会话,失败后要不要重试,要不要派子 Agent,何时停止,怎么记录和恢复。

连接器处理认证、API 封装、权限映射、数据格式和业务语义,把 CRM、ERP、OA、工单、网盘、文档和数据库变成可调用工具。三者关系被写成:连接器接入系统,MCP 标准化暴露,Harness 组织模型、工具、上下文、权限、状态和运行循环。ADP 4.0 还提到连接器和工具上限扩展、知识库问答支持 JSONL、多模态解析升级。这些是能力说明,没有配评测数字。

从 Demo 到生产要过五道关

多数企业的目标不是自己设计 Agent Loop,而是让销售、客服、研究、质检、法务或数据分析 Agent 稳定跑。五道关按顺序是:

  1. 构建。不要把主要精力耗在循环、压缩、路由、Session、重试、沙箱这些底层上。平台要用自然语言或可视化描述业务目标,并完成需求理解、配置、工具选择、流程生成、测试验证和发布接入。例子是每天读昨日销售、识别异常、生成经营分析、重大异常等主管确认再发送。
  2. 运行。要定时、事件触发、等人审批、多系统调用、失败重试和断点续跑,而不能只做一次请求响应。
  3. 效率。几十个工具、多个知识库和大量历史会同时打到成本和稳定性。需要按任务装载、提示词缓存、结果压缩、Token 预算和成本观测。
  4. 治理。能调用系统只是第一步。还要确认谁授权、什么情况允许、调用后能否追溯、失败后谁负责。
  5. AgentOps。内部到 100 个甚至更多 Agent 时,生命周期、版本、灰度、评测、监控、日志、成本、审计和组织权限要有统一承接。100 是规模量级,不是 ADP 已管理的 Agent 计数。

落地路径,以及生产化的五条检查

ADP 4.0 把生命周期写成构建、评测、集成、分发、治理、观测、优化。四步是:用 Claw 在云端沙箱里写和跑 Python、读写文件、做长任务;用 Skills、连接器、知识库和工作流接入企业能力;工作流和 Claw 双向调用,工作流管稳定流程,Agent 管异常解释、报告、方案和多轮问答;用 AgentOps 看调用量、报错率、算力成本、活跃度、版本效果和运行日志,并用评测体系比较不同模型、提示词和版本。工业质检和 B2B 贸易只是试点方向,不是这篇里的成绩单。

和开放 Runtime 的对照也被写成一张表:Harness 问怎么运行,企业平台问怎么进生产;前者可编程、插件化,后者云端托管;前者开发者自己配上下文和工具,后者把自动优化、接入和治理产品化;运维责任从开发者转到平台上的 AgentOps。适合的团队也不同:一边是 Infra 和框架开发者,一边是企业开发者、业务团队和平台负责人。

FAQ 把边界说清楚。固定流程、规则清楚、输入输出稳定的任务,工作流仍然更合适;Harness 适合目标开放、步骤不固定、要动态调用工具的任务。生产里通常组合,而不是互相替代。MCP 也不能替代 Harness。DeepSeek Harness 当时的定位是开发者预览,后续可能有兼容性变更,适合研究 Runtime,不能直接当成企业生产环境。进生产还要另评权限、审计、日志脱敏、凭证托管、供应链安全、版本兼容和运维保障。

试点建议从低风险、边界清楚、价值可衡量的场景开始:会议总结、销售数据分析、知识库问答增强、报表、工单辅助、质检数据分析。先做信息整理、分析建议和辅助决策,再引入高权限操作和自动化闭环。

生产化条件被收成五条,这是全文最接近验收清单的一段:任务成功率是否稳定,失败是否可恢复,工具调用是否可审计,权限边界是否清晰,成本与延迟是否可接受。涉及业务系统写入、发消息、删资源、改配置时,还要人工审批和分级授权。原文没有给出这五项的阈值,例如成功率要到多少、延迟要低于多少。

读的时候不要把平台能力写成已测结果。全文没有任务成功率、审计拦截率或成本下降的实测。DeepSeek Harness 被明确限制在开发者预览。会话日志既能做评测样本,也扩大了数据治理面,脱敏和保留周期没有默认值。

出处:腾讯云 ADP,腾讯云 ADP 团队,从 DeepSeek Harness 看企业级 Agent:为什么“能运行”之后,还要“可治理、可生产”,2026-08-14,https://adp.tencent.com/zh/blog/deepseek-harness-enterprise-agent-governance-production

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction