![]()
過去一年,Deep Research Agent 被視為大模型落地的下一個突破口,它們會檢索、能用工具、可多步推理,在一個個榜單上高歌猛進。但把它們放到真實世界的專業場景里,表現是否也同樣亮眼?
先從一個每天都在發生、卻少有人細想的問題說起:每一筆跨境貨物通關,都必須先回答一個看似不起眼、卻牽動巨大利益的問題:這件商品的海關編碼(HS Code,商品名稱及編碼協調制度)是什么?這串編碼是支撐全球每年約 26 萬億美元貿易的商品「唯一數字身份證」,直接決定關稅計算與合規成敗。如果報錯,輕則多繳稅款,重則貨物滯留、觸發合規風險。
那么,如果讓今天最強的一批 AI Agent 去做這件跨境電商關務專員每天都在做的工作:給一件商品報出正確的海關編碼,結果會怎樣?
答案可能出乎意料:表現最好的系統也只能做對約 49.4%,而一位從業十年的人類專家能達到 95%。這道接近腰斬的差距背后,藏著當前 AI Agent 一塊被長期忽視的能力盲區,面對人類專家編寫的層級規則,先進的 Deep Search Agent 集體「失靈」了。
正是這項工作,讓阿里巴巴 ATH-MaaS(Alibaba Token Hub Model-as-a-Service)應用算法團隊摘得了ACL 2026 最佳資源論文獎(Best Resource Paper Award)。他們構建的HSCodeComp,是首個面向真實、專家級場景的深度檢索 Agent 層級規則應用基準。
![]()
- 論文標題:HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application
- 論文鏈接:https://aclanthology.org/2026.acl-long.937
- 代碼鏈接:https://github.com/ATH-MaaS/Marco-DeepResearch
- 數據集地址:https://huggingface.co/datasets/ATH-MaaS/HSCodeComp
![]()
ACL 2026 Best Resource Paper Award 獲獎證書以及現場頒獎。
在本屆全球僅 4 篇的最佳資源論文中,HSCodeComp 有著獨特的分量:
- ACL 2026 Best Resource Awards 中唯一的中國公司;
- 阿里巴巴首個 ACL Best 系列獎項;
- 該研究完全由阿里巴巴 ATH-MaaS 團隊從真實業務落地中提煉和沉淀。
獎項的背后,是一個看似不起眼、卻讓最強 AI Agent 集體折戟的問題。那么,這到底是一項什么樣的任務,能同時撐起 26 萬億美元的全球貿易、又讓人類專家與頂尖 Agent 拉開近一倍的差距?下面,我們就從這項工作本身說起。
一、26 萬億美元貿易背后的「專家級」任務
被忽視的層級規則應用
回到任務本身。前面提到,HS Code 是決定這 26 萬億美元貿易如何通關、如何計稅的關鍵,但真正報出它的過程,遠比想象中專業。在阿里巴巴跨境電商的海關商品編碼場景中,這一專家級任務需要將商品沿著人類專家編寫的規則樹逐層向下推導、精確歸類到唯一的國際通用編碼上。團隊將其定義為層級規則應用(Hierarchical Rule Application),并發現它恰恰是當前 Agent 評測的一塊關鍵盲區。
![]()
Figure 1|HS Code 是全球跨境貿易的基石,反映了理解真實商品世界所需的復雜度與專業性。
在實際申報中,資深關務專家需要依據嚴密的層級關稅規則,把一件商品精準映射到唯一的10 位細分編碼,逐級細化:
2位|章(Chapter)→4 位|品目(Heading)→6 位|子目(Sub-heading)→8/10 位|國別碼(Country-specific)
這本質上是一條必須滿足規則樹上所有約束的合法路徑:只有每一層判定都正確,最終 10 位編碼才成立。以常見的「AirPods 硅膠保護套」為例,申報時就要逐層回答一連串專業問題:它的材質「硅膠」該歸入塑料(第 39 章)還是橡膠(第 40 章)?它算「表面覆蓋物」還是「攜帶盒」?是「配件」還是「零件」?任何一層判錯,最終 10 位編碼就全盤皆錯。
![]()
Figure 2|AirPods 硅膠保護套分類樣例。
它的本質:一個「檢索 + 推理」的深度檢索任務
本質上,這是一個專家級的 Deep Search 任務。因為 Agent 無法只靠內部知識作答,它必須像人類專家一樣,逐級調用工具去檢索最新的相關專家規則與知識,再一步步向下推導找到最終的 10 位 HS Code。形式化來看,這是一個映射函數:
- X 多模態商品檔案:標題、結構化屬性(如材質、包裝尺寸)、平臺類目、商品圖片(捕捉文本缺失的紋理 / 形態等視覺特征)、價格與幣種。
- R 分層規則:包含官方層級關稅規則(源自 eWTP 平臺聚合的權威美國 HTSUS 稅則),以及關稅專家多年積累的專業決策規則。
- K 領域知識庫:歷史海關裁定庫(美國CROSS系統),作為 few-shot 范例幫助處理規則模糊的邊緣情況。
- Y 唯一的 10 位 HS Code:必須是分類樹上滿足所有約束的一條合法路徑。
如下圖的菜刀案例所示,f 并非一步到位的分類,而是一個多步「檢索 — 推理 — 回溯」循環:每往下推一層(鎖定兩位編碼),都同時依賴逐位推理與調用工具讀取規則 / 裁定(GRI 規則、CROSS 裁定、屬性核對)。一旦某一層判錯,后續每一位都建立在錯誤前提之上。一位錯,全碼錯。
![]()
Figure 3|每一步向下鉆取都同時依賴「逐位推理」與「工具調用讀規則」。
Level 3:被忽視的第三層能力
那么,這類專家級 Deep Search 與已有的 Deep Search 任務有何本質差異?團隊把 Agent 所需的知識復雜度劃分為遞進的三個層次:
- Level 1 開放域數據:理解與使用海量真實世界網絡數據的能力,代表工作有 BrowseComp、WebArena、GAIA。
- Level 2 結構化數據:精確利用數據庫、知識圖譜等結構化資源,代表工作有 MedBrowseComp、FinSearchComp。
- Level 3 分層規則數據(本文焦點):在前兩者之上,精準應用人類專家撰寫的層級專業規則。這正是當前評測的關鍵盲區。
![]()
Figure 4|三級知識復雜度:從「讀懂網頁」到「用好結構化知識」,再到「精確應用分層專家規則」,能力要求逐級遞增;Level 3 仍是空白。
Level 3 之所以困難,源于分層規則天然帶著三大挑戰:
1.層級深、一步錯步步錯:上層一旦判錯(如把硅膠誤歸入橡膠第 40 章),錯誤會沿路徑級聯放大為整體失敗。
2.語義邊界模糊(如下圖藍框):規則里充斥「除…… 以外」「其他」「主要用于」等自然語言限定,邊界模糊且高度依賴上下文。
3.邏輯高度耦合(如下圖紅框):規則間充滿例外條款與交叉引用,某個品目能否成立往往取決于另一條注釋是否被觸發,牽一發而動全身。
![]()
Figure 5|層次化關稅規則示例。
而這三大挑戰并非 HS Code 獨有。分層規則應用是眾多高價值專業垂類的共性挑戰:從法律合規、稅務審計到醫療編碼,凡是依據人類專家編寫的層級規則的任務,都會遇到同樣的困境。一個典型例子是 WHO 的ICD-10 疾病編碼,它與 HS Code 擁有幾乎完全相同的分層規則結構,而這些編碼直接決定患者的保險覆蓋。因此解決層次規則應用在真實世界應用中會產生巨大的價值。
![]()
Figure 6|共性挑戰案例:WHO ICD-10 層次化疾病編碼決定了各個國家患者醫保報銷情況。
二、如何做出一把「專家級」標尺?
要可靠評估 Level 3 能力,就必須獲得高質量的編碼標注。由于任務的專業性與復雜度,HSCodeComp刻意回避了常見的眾包標注與 LLM 自動生成,轉而追求真正的專家標注。它有三大設計特征:
- 真實世界噪聲:HSCodeComp 數據來源于真實的大規模全球電商平臺,從平臺銷量、評論數、熱銷榜單等維度綜合采樣構建數據集,以盡可能還原真實世界分布。并且刻意保留冗長標題、錯填屬性、誤導關鍵詞等噪聲,逼近電商「In-The-Wild」復雜度。
- 專家級:組建26 位關務專家(平均從業 5 年以上)的標注團隊,按 6 步 pipeline 標注,最終專家分歧率僅約 2%。
- 真實規模:最終包含632 個真實商品,自然橫跨32 個大類,商品與編碼覆蓋范圍廣。
標注遵循「雙人獨立標注 — 高級仲裁 — 抽樣復核」的六步專業工作流:前四步覆蓋商品檔案抽取與分層規則應用,后兩步做嚴格的專家交叉驗證,兩位專家獨立標注、編碼一致才接受,分歧由資深專家仲裁,另有第四位資深專家對隨機 10% 樣本重標,最終分歧率僅 2%。
![]()
Figure 7|六步專家標注流程。
![]()
Figure 8|品類與章節分布:貼合真實貿易分布;最具挑戰的樣本恰恰集中在長尾類目(如 Novelty & Special Use 1.3%、Men's Clothing 2.2%)。
在評測指標上,HSCodeComp 使用Exact Match Accuracy,報告 2/4/6/8/10 位準確率,其中 10 位準確率是對端到端層級推理最嚴格的衡量。
三、前沿 AI Agent 系統,集體「翻車」
團隊在 HSCodeComp 上評測了28個最先進系統,涵蓋 GPT-5.5、Claude-Opus-4.8、GLM-5.2、DeepSeek-V4-Pro、Qwen3.7-Max 等基礎模型,Hermes-Agent、SmolAgents、AWorld、AgentOrchestra、OWL、WebSailor 等開源 Agent 框架,以及 Manus、Gemini Deep Research、Grok DeepSearch 等閉源商用系統。(在論文原有 23 個系統評測的基礎上,團隊進一步補充了 Hermes-Agent、最新 GLM-5.2、DeepSeek-V4-Pro、Qwen3.7-Max、GPT-5.5 等模型的評測,將規模擴展到 28 個。)
核心發現:一道接近腰斬的鴻溝
![]()
Figure 9|核心結果:最強 Agent(10 位~49.4%)遠遠落后于人類專家(95.0%)。
直接看 10 位編碼的 Exact Match Accuracy,結論指向同一個方向:
- 顯著鴻溝:表現最好的 Agent 也只有約49.4%,遠遠落后于人類專家的95%,幾乎腰斬。而且隨著規則層級加深,Agent 性能持續衰減:在 2 位「章」級別尚能保持較高準確率,但推進到 10 位完整編碼時急劇坍塌。
- 增益微弱:這些前沿系統甚至只是勉強超過傳統機器學習方法(基于專家規則的決策樹系統約45.0%),卻付出了高得多的算力與推理成本。
- 結構性瓶頸: 在 6k 條專家標注數據上做 SFT 和 Agentic RL 訓練,也只能把 Qwen Agent 提升到約65%。這說明層級規則利用對當前 AI Agent 是一個結構性瓶頸,并非簡單擴展數據規模或模型參數就能解決。
為什么「多想幾次」反而更糟?
一個常見直覺是「多算幾次、多反思幾次總會更好」。但在 HSCodeComp 上,兩種標準的 Test-Time Scaling 策略均告失效:多數投票幾乎不帶來提升(Agent 無法區分「正確路徑」與「自信的錯誤」,投票只是在同源錯誤里挑眾數);自我反思也非常微弱(模型既會糾正錯誤,也會把正確樣本改錯,更像盲目重試)。
![]()
Figure 10|Test-Time Scaling 難以彌合差距:投票曲線趨于平臺,自反思不升反降。
更有意思的是,團隊發現了一種推理漂移(Reasoning Drift)現象:強迫模型「想得更多」(增大 reasoning effort)非但不漲反而下滑,GPT-5 的 10 位準確率隨推理深度從 40.82% 一路跌到 35.44%。根本原因在于,當有價值信息位于領域知識與規則中時,缺乏準確工具反饋的「自由發揮」會讓 Agent 幻覺出并不存在的約束。這啟發我們:對于有價值信息位于規則與知識中的專業任務,應優先做檢索利用,而非讓模型自己「想」。
到底哪些知識真正有用?
既然靠「想」和「投票」都不行,那到底哪些信息真正驅動性能?答案清晰地指向三點,重要性排序為:規則 / 知識檢索(+8.5pt,地基)> CROSS 歷史裁定(+5~10pt,穩定可靠)> 視覺信息(+4pt 且僅限強 VLM,邊際補充)。
其一,Agent Harness 是不可或缺的地基。 把裸模型包進能「檢索并應用最新專家規則與知識」的 Agent 框架后,10 位準確率從28.96%抬升到37.42%(6 個 GPT-5 骨干 Agent 系統的平均,+8.5pt)。關鍵并不在模型「記得多少」,而在于能否即時檢索到最新的分層規則、并按優先級逐層套用。規則不是簡單塞進上下文就行,只有讓 Agent 主動檢索、動態裁決,才能把知識真正轉化為準確率。
![]()
Figure 11|Agent scaffold 抬升 +8.5pt:6 個 GPT-5 骨干 Agent 系統的平均 10 位準確率(37.42%)顯著高于裸 GPT-5(28.96%)。
其二,CROSS 歷史裁定庫帶來最穩定可靠的增益。 三個骨干模型接入后 10 位準確率無一例外大幅提升(GLM-5.2 +9.65、DeepSeek-V4-Pro +7.76、Qwen3.7-Max +5.38)。因為真實歷史裁定天然是高質量的 few-shot 先例:當規則語義模糊、多個品目看似都成立時,Agent 可以直接檢索相似判例、參照海關既往邏輯來消解歧義,相當于給模型配了一本「判例詞典」。
![]()
Figure 12|CROSS 歷史裁定庫帶來一致增益:三個骨干模型接入后 10 位準確率均顯著提升。
其三,視覺信息有用,但只是邊際補充。 圖像能補齊文本缺失的物理細節(材質、表面工藝、形態等),但增益有限且高度依賴骨干的視覺能力:GPT-5 +4.11(42.72%→46.83%),而 Claude-4-Sonnet 僅 +0.95、GPT-4o 幾乎紋絲不動(+0.28)。也就是說,只有足夠強的 VLM 才能真正「看懂」并用上圖里的信息,視覺是有益補充,卻替代不了對規則的精確應用。
![]()
Figure 13|視覺信號僅帶來邊際增益:GPT-5 +4.11,Claude-4-Sonnet、GPT-4o 幾乎無提升,越弱的骨干越用不上圖像里的物理細節。
這再次印證 HSCodeComp 是一個「規則 / 知識中心」而非「檢索算力中心」的任務:決定成敗的不是算得多快、想得多深,而是能否檢索到正確的專家規則與判例,并嚴格、逐層地把它們應用到位。
難度從何而來?集中在長尾品類
最后把視角拉回數據本身:HSCodeComp 的難度是天然的,還是被數據傾斜人為制造的?跨32 個一級品類,團隊統計了兩條互補分布:CID(最難樣本分布):所有基線都判錯的「硬骨頭」樣本在各品類上的占比;APD(平均性能分布):各品類上所有基線的平均 10 位準確率。
兩條分布共同揭示兩點:其一,最難的樣本高度集中在長尾類目。CID 顯示,全軍覆沒的樣本扎堆在 Novelty & Special Use(數據占比僅 1.3%)、Men's Clothing(2.2%)等長尾品類,它們描述非標、樣本稀疏,恰好暴露了 Agent「把規則泛化到數據稀疏領域」的短板;其二,整體準確率普遍偏低。絕大多數品類的平均 10 位準確率不足 25%,即便是數據占比最高的 Jewelry & Accessories、Home & Garden、Tools 等主流品類也低于 18%。這說明難度是分層規則本身固有的,且與品類是否高頻無關:越是長尾、越是非標描述,規則應用就越容易崩塌。
![]()
Figure 14|按一級品類的難度分布。左:最難樣本分布(CID);右:平均性能分布(APD);兩側藍色細條為該品類的數據占比。最難樣本集中在 Novelty & Special Use、Men's Clothing 等長尾類目。
四、從基準到落地:先評測、后優化
HSCodeComp 不止是一篇評測論文。基于基準上獲得的洞見,團隊進一步在跨境貿易數字關務真實垂類場景中,落地了面向 HS Code 智能分類的 Agent 系統,驗證了「先評測、后落地」的完整閉環。
團隊先用 HSCodeComp 量化了「當前最強 Agent 遠低于人類專家」的現狀,隨后設計了以 Qwen 為基座的 Agent 框架:多模態輸入解析 → 基于 Deep Search 的檢索增強推理(歷史標簽、專家知識、海關裁定)→ 工具集成的逐級校驗 → 帶可審計證據鏈的結構化輸出。通過在 6k 個專家標注數據上做 SFT + Agentic RL 優化,團隊設計的 Agent 框架和模型 以約 65% 的準確率穩居 AI Agent 系統第一位,大幅領先最強通用 Agent(約 49.4%)。
但需清醒看到:即便如此,距離人類專家的 95% 仍有明顯差距。這說明分層規則應用對當前 AI Agent 屬于結構性挑戰,下一步的關鍵在于強化錯誤回溯、規則優先級動態判定,以及把推理牢牢錨定在專家規則與動態知識之上的能力。
而正如前文所述,分層規則應用是眾多高價值垂類的共性挑戰:ICD-10 醫療編碼、美國《聯邦法規》(CFR)、法律合規與稅務審計等等。HSCodeComp 揭示的能力邊界與診斷方法具備天然的跨垂類可遷移性,同一套「先評測、后優化」的閉環,可以復用到這些同構任務之上。
五、Marco-DeepResearch 系列
HSCodeComp 出自阿里巴巴ATH-MaaS(Alibaba Token Hub Model-as-a-Service)應用算法團隊,是其 Marco-DeepResearch 系列工作的一部分。該團隊長期投入 Deep Research Agent 方向,致力于推動智能體在真實、專業的高價值垂類場景(跨境電商、數字關務等)中的可靠落地。近期,團隊在該方向持續產出系列成果,相關工作均已開源:
- Agent 記憶 UMEM(ICML 2026 錄用): 提出統一的記憶抽取與管理框架,讓 Agent 在自我進化中學到可泛化的記憶而非實例噪聲,在多輪交互任務上最高提升 10.67%。
- 復雜深寬搜索 DeepWideSearch: 構建首個同時考察「深度多跳推理」與「廣度大規模信息收集」的評測基準,揭示即便最強 Agent 平均成功率也僅 2.39%。
- Table-as-Search(ACL 2026 錄用): 將信息檢索重構為「表格填充」任務,以結構化外部表格管理搜索狀態,統一深搜、寬搜與深寬搜,顯著超越主流基線與商用系統。
- Marco DeepResearch: 以「驗證為中心」的設計貫通數據合成、軌跡構建與測試時擴展,讓 8B 模型在 BrowseComp 等高難基準上比肩甚至超越約 30B 規模的 Deep Research 模型。
結語
在深度檢索 Agent 高歌猛進的當下,HSCodeComp 像一記冷靜的提醒:當 Agent 學會了「用工具」,下一道更高的門檻,是學會「敬畏規則」。HSCodeComp 的實驗結果顯示層級規則應用是一個無法靠單純 Scaling 填平的結構性瓶頸。
它的價值不止于揭示問題,更在于給出了一套可復用的診斷方法與優化閉環:先用專家級基準照出能力邊界,再通過檢索并嚴格應用規則 / 判例來對癥下藥。面向未來,團隊希望構建能夠將推理牢牢錨定在專家規則與動態知識之上的 Agent:讓模型不再依賴內部記憶去「猜」,而是像專家一樣逐級檢索、嚴格應用規則,并在出錯時可靠回溯。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.