HSCodeComp揭示AI Agent层级规则应用瓶颈

深度检索Agent在各类公开榜单上的表现愈发亮眼,被视作大模型落地的核心突破口之一。但当这些模型被投入真实的专业业务场景时,实际表现是否依然能达标?一项针对跨境贸易海关编码分类的研究,揭开了当前AI Agent的能力盲区。
全球每年超26万亿美元的跨境货物贸易中,每一笔通关流程都离不开一个看似普通却至关重要的环节:确定商品的海关编码(HS Code)。这串编码是全球商品的“数字身份证”,直接决定关税计算与合规审核的结果,一旦编码报错,轻则导致企业多缴税款,重则造成货物滞留甚至触发合规风险。
如果让当前最顶尖的一批AI Agent来完成资深关务专员每天都在做的工作——为商品匹配正确的10位海关编码,结果会如何?
答案却出人意料:即便是表现最优的AI系统,准确率也仅约49.4%,而一位拥有十年经验的资深关务专家的正确率可达95%,两者差距接近一倍。这道近乎腰斩的差距背后,暴露出当前深度检索Agent长期被忽视的能力短板:面对人类专家编写的层级化专业规则,顶尖的Deep Search Agent集体“失灵”。
这项研究的成果,正是斩获ACL 2026最佳资源论文奖的HSCodeComp基准,它是全球首个针对真实、专家级场景的深度检索Agent层级规则应用评测数据集。该研究完全来自真实业务落地场景,也是某科技企业算法团队的重要突破。
ACL 2026 Best Resource Paper Award 相关信息
论文标题:HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application
在本届全球仅4篇的最佳资源论文中,HSCodeComp有着独特的分量:是唯一来自中国公司的获奖成果,也是该企业首个ACL Best系列奖项,所有研究均来自真实业务落地提炼。
奖项的背后,是一个看似不起眼却让最强AI Agent集体折戟的问题。这到底是一项什么样的任务,能同时撑起26万亿美元的全球贸易、又让人类专家与顶尖Agent拉开近一倍的差距?
一、海关编码分类:隐藏在全球贸易中的专业任务
在跨境电商的海关编码场景中,这项任务需要将商品沿着人类专家编写的规则树逐层向下推导,精准匹配到唯一的国际通用编码。研究团队将其定义为层级规则应用(Hierarchical Rule Application),这恰恰是当前Agent评测的关键盲区。
在实际申报中,资深关务专家需要依据严密的层级关税规则,把一件商品精准映射到唯一的10位细分编码,逐级细化:
2位|章(Chapter) → 4位|品目(Heading) → 6位|子目(Sub-heading) → 8/10位|国别码(Country-specific)
这本质上是一条必须满足规则树上所有约束的合法路径:只有每一层判定都正确,最终10位编码才成立。以常见的「AirPods硅胶保护套」为例,申报时就要逐层回答一连串专业问题:它的材质「硅胶」该归入塑料(第39章)还是橡胶(第40章)?它算「表面覆盖物」还是「携带盒」?是「配件」还是「零件」?任何一层判错,最终10位编码就全盘皆错。
它的本质:一个「检索 + 推理」的深度检索任务
本质上,这是一个专家级的Deep Search任务。因为Agent无法只靠内部知识作答,它必须像人类专家一样,逐级调用工具去检索最新的相关专家规则与知识,再一步步向下推导找到最终的10位HS Code。形式化来看,这是一个映射函数 f: (X, R, K) → Y:
X 多模态商品档案:标题、结构化属性(如材质、包装尺寸)、平台类目、商品图片(捕捉文本缺失的纹理/形态等视觉特征)、价格与币种。
R 分层规则:包含官方层级关税规则(源自权威聚合的税则),以及关税专家多年积累的专业决策规则。
K 领域知识库:历史海关裁定库,作为few-shot范例帮助处理规则模糊的边缘情况。
Y 唯一的10位HS Code:必须是分类树上满足所有约束的一条合法路径。
以菜刀分类为例,这个映射并非一步到位的分类,而是一个多步「检索 — 推理 — 回溯」循环:每往下推一层(锁定两位编码),都同时依赖逐位推理与调用工具读取规则/裁定(GRI规则、历史裁定、属性核对)。一旦某一层判错,后续每一位都建立在错误前提之上,一位错,全码错。
二、Agent所需的三层知识复杂度:被忽视的第三层
这类专家级Deep Search与已有的Deep Search任务有本质差异。研究团队将Agent所需的知识复杂度划分为递进的三个层次:
Level 1 开放域数据:理解与使用海量真实世界网络数据的能力,代表工作有BrowseComp、WebArena、GAIA。
Level 2 结构化数据:精确利用数据库、知识图谱等结构化资源,代表工作有MedBrowseComp、FinSearchComp。
Level 3 分层规则数据(本文焦点):在前两者之上,精准应用人类专家撰写的层级专业规则。这正是当前评测的关键盲区。
Level 3之所以困难,源于分层规则天然带着三大挑战:
层级深、一步错步步错:上层一旦判错(如把硅胶误归入橡胶第40章),错误会沿路径级联放大为整体失败。
语义边界模糊:规则里充斥「除……以外」「其他」「主要用于」等自然语言限定,边界模糊且高度依赖上下文。
逻辑高度耦合:规则间充满例外条款与交叉引用,某个品目能否成立往往取决于另一条注释是否被触发,牵一发而动全身。
而这三大挑战并非HS Code独有。分层规则应用是众多高价值专业垂类的共性挑战:从法律合规、税务审计到医疗编码,凡是依据人类专家编写的层级规则的任务,都会遇到同样的困境。一个典型例子是WHO的ICD-10疾病编码,它与HS Code拥有几乎完全相同的分层规则结构,而这些编码直接决定患者的保险覆盖。因此解决层次规则应用在真实世界应用中会产生巨大的价值。
三、打造专家级的评测基准:HSCodeComp的设计理念
要可靠评估Level 3能力,就必须获得高质量的编码标注。由于任务的专业性与复杂度,HSCodeComp刻意回避了常见的众包标注与LLM自动生成,转而追求真正的专家标注。它有三大设计特征:
真实世界噪声:HSCodeComp数据来源于真实的大规模全球电商平台,从平台销量、评论数、热销榜单等维度综合采样构建数据集,以尽可能还原真实世界分布。并且刻意保留冗长标题、错填属性、误导关键词等噪声,逼近电商「In-The-Wild」复杂度。
专家级标注:组建26位关务专家(平均从业5年以上)的标注团队,按6步pipeline标注,最终专家分歧率仅约2%。
真实规模:最终包含632个真实商品,自然横跨32个大类,商品与编码覆盖范围广。
标注遵循「双人独立标注 — 高级仲裁 — 抽样复核」的六步专业工作流:前四步覆盖商品档案抽取与分层规则应用,后两步做严格的专家交叉验证,两位专家独立标注、编码一致才接受,分歧由资深专家仲裁,另有第四位资深专家对随机10%样本重标,最终分歧率仅2%。
在评测指标上,HSCodeComp使用Exact Match Accuracy,报告2/4/6/8/10位准确率,其中10位准确率是对端到端层级推理最严格的衡量。
四、前沿AI Agent的集体表现:差距悬殊的鸿沟
研究团队在HSCodeComp上评测了28个最先进系统,涵盖多款基础模型、开源Agent框架以及闭源商用系统。
核心发现:一道接近腰斩的鸿沟
直接看10位编码的Exact Match Accuracy,结论指向同一个方向:
显著鸿沟:表现最好的Agent也只有约49.4%,远远落后于人类专家的95%,几乎腰斩。而且随着规则层级加深,Agent性能持续衰减:在2位「章」级别尚能保持较高准确率,但推进到10位完整编码时急剧坍塌。
增益微弱:这些前沿系统甚至只是勉强超过传统机器学习方法(基于专家规则的决策树系统约45.0%),却付出了高得多的算力与推理成本。
结构性瓶颈:在6k条专家标注数据上做SFT和Agentic RL训练,也只能把Qwen Agent提升到约65%。这说明层级规则利用对当前AI Agent是一个结构性瓶颈,并非简单扩展数据规模或模型参数就能解决。
为什么「多想几次」反而更糟?
一个常见直觉是「多算几次、多反思几次总会更好」。但在HSCodeComp上,两种标准的Test-Time Scaling策略均告失效:多数投票几乎不带来提升(Agent无法区分「正确路径」与「自信的错误」,投票只是在同源错误里挑众数);自我反思也非常微弱(模型既会纠正错误,也会把正确样本改错,更像盲目重试)。
更有意思的是,团队发现了一种推理漂移(Reasoning Drift)现象:强迫模型「想得更多」(增大reasoning effort)非但不涨反而下滑,GPT-5的10位准确率随推理深度从40.82%一路跌到35.44%。根本原因在于,当有价值信息位于领域知识与规则中时,缺乏准确工具反馈的「自由发挥」会让Agent幻觉出并不存在的约束。这启发我们:对于有价值信息位于规则与知识中的专业任务,应优先做检索利用,而非让模型自己「想」。
到底哪些知识真正有用?
既然靠「想」和「投票」都不行,那到底哪些信息真正驱动性能?答案清晰地指向三点,重要性排序为:规则/知识检索(+8.5pt,地基)> CROSS历史裁定(+5~10pt,稳定可靠)> 视觉信息(+4pt且仅限强VLM,边际补充)。
其一,Agent Harness是不可或缺的地基。把裸模型包进能「检索并应用最新专家规则与知识」的Agent框架后,10位准确率从28.96%抬升到37.42%(6个GPT-5骨干Agent系统的平均,+8.5pt)。关键并不在模型「记得多少」,而在于能否即时检索到最新的分层规则、并按优先级逐层套用。规则不是简单塞进上下文就行,只有让Agent主动检索、动态裁决,才能把知识真正转化为准确率。
其二,CROSS历史裁定库带来最稳定可靠的增益。三个骨干模型接入后10位准确率无一例外大幅提升(GLM-5.2 +9.65、DeepSeek-V4-Pro +7.76、Qwen3.7-Max +5.38)。因为真实历史裁定天然是高质量的few-shot先例:当规则语义模糊、多个品目看似都成立时,Agent可以直接检索相似判例、参照海关既往逻辑来消解歧义,相当于给模型配了一本「判例词典」。
其三,视觉信息有用,但只是边际补充。图像能补齐文本缺失的物理细节(材质、表面工艺、形态等),但增益有限且高度依赖骨干的视觉能力:GPT-5 +4.11(42.72%→46.83%),而Claude-4-Sonnet仅+0.95、GPT-4o几乎纹丝不动(+0.28)。也就是说,只有足够强的VLM才能真正「看懂」并用上图里的信息,视觉是有益补充,却替代不了对规则的精确应用。
这再次印证HSCodeComp是一个「规则/知识中心」而非「检索算力中心」的任务:决定成败的不是算得多快、想得多深,而是能否检索到正确的专家规则与判例,并严格、逐层地把它们应用到位。
难度从何而来?集中在长尾品类
最后把视角拉回数据本身:HSCodeComp的难度是天然的,还是被数据倾斜人为制造的?跨32个一级品类,团队统计了两条互补分布:CID(最难样本分布):所有基线都判错的「硬骨头」样本在各品类上的占比;APD(平均性能分布):各品类上所有基线的平均10位准确率。
两条分布共同揭示两点:其一,最难的样本高度集中在长尾类目。CID显示,全军覆没的样本扎堆在Novelty & Special Use(数据占比仅1.3%)、Men's Clothing(2.2%)等长尾品类,它们描述非标、样本稀疏,恰好暴露了Agent「把规则泛化到数据稀疏领域」的短板;其二,整体准确率普遍偏低。绝大多数品类的平均10位准确率不足25%,即便是数据占比最高的主流品类也低于18%。这说明难度是分层规则本身固有的,且与品类是否高频无关:越是长尾、越是非标描述,规则应用就越容易崩塌。
五、从基准到落地:真实业务的优化闭环
HSCodeComp不止是一篇评测论文。基于基准上获得的洞见,团队进一步在跨境贸易数字关务真实垂类场景中,落地了面向HS Code智能分类的Agent系统,验证了「先评测、后落地」的完整闭环。
团队先用HSCodeComp量化了「当前最强Agent远低于人类专家」的现状,随后设计了以Qwen为基座的Agent框架:多模态输入解析 → 基于Deep Search的检索增强推理(历史标签、专家知识、海关裁定)→ 工具集成的逐级校验 → 带可审计证据链的结构化输出。通过在6k个专家标注数据上做SFT + Agentic RL优化,团队设计的Agent框架和模型以约65%的准确率稳居AI Agent系统第一位,大幅领先最强通用Agent(约49.4%)。
但需清醒看到:即便如此,距离人类专家的95%仍有明显差距。这说明分层规则应用对当前AI Agent属于结构性挑战,下一步的关键在于强化错误回溯、规则优先级动态判定,以及把推理牢牢锚定在专家规则与动态知识之上的能力。
而正如前文所述,分层规则应用是众多高价值垂类的共性挑战:ICD-10医疗编码、美国《联邦法规》(CFR)、法律合规与税务审计等等。HSCodeComp揭示的能力边界与诊断方法具备天然的跨垂类可迁移性,同一套「先评测、后优化」的闭环,可以复用到这些同构任务之上。
六、Marco-DeepResearch系列研究
HSCodeComp出自某科技企业ATH-MaaS应用算法团队,是其Marco-DeepResearch系列工作的一部分。该团队长期投入Deep Research Agent方向,致力于推动智能体在真实、专业的高价值垂类场景(跨境电商、数字关务等)中的可靠落地。近期,团队在该方向持续产出系列成果,相关工作均已开源:
Agent记忆UMEM(ICML 2026录用):提出统一的记忆抽取与管理框架,让Agent在自我进化中学到可泛化的记忆而非实例噪声,在多轮交互任务上最高提升10.67%。
复杂深宽搜索DeepWideSearch:构建首个同时考察「深度多跳推理」与「广度大规模信息收集」的评测基准,揭示即便最强Agent平均成功率也仅2.39%。
Table-as-Search(ACL 2026录用):将信息检索重构为「表格填充」任务,以结构化外部表格管理搜索状态,统一深搜、宽搜与深宽搜,显著超越主流基线与商用系统。
Marco DeepResearch:以「验证为中心」的设计贯通数据合成、轨迹构建与测试时扩展,让8B模型在BrowseComp等高难基准上比肩甚至超越约30B规模的Deep Research模型。
结语
在深度检索Agent高歌猛进的当下,HSCodeComp像一记冷静的提醒:当Agent学会了「用工具」,下一道更高的门槛,是学会「敬畏规则」。HSCodeComp的实验结果显示层级规则应用是一个无法靠单纯Scaling填平的结构性瓶颈。
它的价值不止于揭示问题,更在于给出了一套可复用的诊断方法与优化闭环:先用专家级基准照出能力边界,再通过检索并严格应用规则/判例来对症下药。面向未来,团队希望构建能够将推理牢牢锚定在专家规则与动态知识之上的Agent:让模型不再依赖内部记忆去「猜」,而是像专家一样逐级检索、严格应用规则,并在出错时可靠回溯。


