CodexQA

行业与实践研究与基准测试

HSCodeComp:复杂层级规则,才是深度搜索 Agent 的硬考场

CodexQA 团队阅读约 2 分钟

阿里巴巴团队公开的 HSCodeComp 把深度搜索 Agent 放进跨境贸易商品编码场景:不是找到一段相关文本就算完成,而是要从真实商品信息和多层关税规则中推导出准确的十位 HS Code。

HSCodeComp:复杂层级规则,才是深度搜索 Agent 的硬考场

阿里巴巴团队公开的 HSCodeComp 把深度搜索 Agent 放进跨境贸易商品编码场景:不是找到一段相关文本就算完成,而是要从真实商品信息和多层关税规则中推导出准确的十位 HS Code。

一、为什么要测层级规则

许多搜索基准主要考察信息找到没有、答案对不对,但专业工作往往要求同时满足多个条件。跨境商品编码就是典型例子:商品描述可能含噪,规则来自不同来源,条款之间存在层级关系,还需要结合官方裁定和领域知识。

这类任务与法律合规、税务审核、医疗路径判断有共同结构:Agent 必须搜索证据、解释规则、处理例外,并把证据链收束成一个可审计结论。

二、HSCodeComp 的任务设计

基准包含 632 个真实电商商品,覆盖 32 个类别,目标是预测准确的十位 HS Code。任务保留真实数据中的噪声元数据,并要求 Agent 使用 eWTP、官方海关裁定等来源理解多层规则。

论文和数据集已经开源,配套代码与数据分别发布在 GitHub 和 Hugging Face。其价值不只在于榜单,而在于将“规则应用”拆成可复核的深度搜索工作流。

三、现有 Agent 与专家的差距

阿里巴巴公开结果显示,参测前沿 Agent 的最高准确率约为 49.4%,人类专家约为 95.0%。差距说明问题不是单纯的检索速度,而是层级规则应用仍是系统性瓶颈。

常见失败包括:过度推理导致不必要的自我修正、推理幻觉、领域知识不足,以及把相互关联的规则拆散后无法重新组合。实验还显示,单纯增加推理时计算量并不能稳定改善结果。

四、Qwen Agent 框架的启示

阿里巴巴同时给出了面向数字化通关的 Qwen Agent 框架,在 HSCodeComp 上达到 65.0% 准确率。这个结果不应被理解为“一个框架解决了所有问题”,但它说明模型、检索、规则组织和执行框架需要协同设计。

对企业来说,专业 Agent 不能只接一个搜索工具。更可靠的结构应包含:证据检索、规则分层、冲突检测、结论生成、引用回溯和人工升级。每一步都应留下可检查的中间状态。

五、对评测工程的三个建议

  1. 保留真实噪声:过度清洗数据会把评测变成教科书题,无法代表生产环境;
  2. 评估过程证据:不仅检查最终编码,也检查引用是否支撑结论、规则是否逐层应用;
  3. 区分能力瓶颈:把检索失败、规则理解失败、领域知识不足和输出格式错误分开统计。

HSCodeComp 的核心贡献,是把“会搜索”推进到“能在复杂规则中做出可审计决定”。这也是专业 Agent 从演示走向生产必须跨过的一道门槛。

出处:Alibaba Cloud Community,《Alibaba's Latest AI Agent Benchmark Awarded Best Resource Paper at ACL 2026》,2026 年,https://www.alibabacloud.com/blog/alibabas-latest-ai-agent-benchmark-awarded-best-resource-paper-at-acl-2026_603341

出处:阿里云,Alibaba Cloud Community,《Alibaba's Latest AI Agent Benchmark Awarded Best Resource Paper at ACL 2026》,2026-08-01,https://www.alibabacloud.com/blog/alibabas-latest-ai-agent-benchmark-awarded-best-resource-paper-at-acl-2026_603341。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误