欢迎光临北京软件和信息服务业协会官方网站
国内唯一!阿里斩获ACL 2026最佳资源论文奖
发布日期:2026-07-14    来源:阿里云    分享到:

刚刚,国际AI顶级学术会议ACL 2026最佳论文奖出炉!


阿里研究团队在Deep Research Agent方向的研究成果从全球一万多篇投稿中脱颖而出,获评最佳资源论文奖(Best Resource Paper),是国内唯一获得该奖项的中国公司。


该论文首次系统揭示了当前Agent在真实世界复杂规则推理中面临的巨大缺陷,并提出了全新的专家Agent评测基准,为提升大模型在真实场景的可靠性指明了新方向。


d647abe9-bfcd-4c9f-93a7-f10f8d4c04dd.png


ACL(国际计算语言学协会)是自然语言处理和计算语言学领域中历史最悠久、最具权威性的国际学术组织,ACL 2026共收到12148篇投稿,仅19%被主会录用,最终仅有4篇论文获评Best Resource Paper。


为什么这项研究值得关注?


想象一位跨境电商卖家,要把一件商品出口到海外——他必须先给这件商品找到一个精确的10位海关编码(HS Code)。


听上去只是"分类",实际上却要在一棵层层嵌套的规则树里一路推理下去:材质、用途、加工方式、使用场景……任何一个环节判断错误,整批货就可能被扣关或罚款。这项工作在现实中通常需要经验丰富的关务专家来完成。


阿里此次获奖的论文以此为切入点,提出了针对真实场景和专家水平的智能体新基准 HSCodeComp:它要求Agent像资深关务专家一样,将商品模糊的属性与严格的关税归类规则对齐,为商品精准映射到10位细分编码。研究团队对14个主流大模型和9个先进Agent框架进行了全面评测。


结果令人意外:表现最好的Agent系统准确率仅为约45%,而人类专家的准确率高达95%。更值得注意的是,研究还发现——单纯堆更多推理时间(inference-time scaling)并不能显著缩小这道鸿沟,说明这不是"算力问题",而是 Agent 架构本身的结构性瓶颈。


该研究还进一步揭示了导致Agent系统缺陷的原因:首先过长的推理链导致Agent在中途偏离正确路径,其次是领域知识不足导致规则误用,最后由于推理幻觉造成Agent生成缺乏事实依据的分类判断。这些发现为Agent能力提升指明了方向。


a0a44926-11b5-4945-b959-b3795c979a8c.png


据介绍,阿里已基于该研究成果,在跨境贸易数字关务等场景中设计了以Qwen基座为核心的Agent框架,在HSCodeComp基准(10位编码准确率)上的测试结果显示,该Agent以65.0%的准确率稳居AI系统第一位。


ACL评审委员会表示:“该基准切中了Agent应用的高度重要挑战——考察Agent对严格层级化自然语言规则的遵循能力,研究动机极具说服力;严谨的人类专家评测流程提供了高度可靠的能力上界。”


目前,HSCodeComp基准的数据集与评测代码已在Hugging Face和GitHub全面开源。我们希望这项工作将会启发学术界和工业界持续进行探索,一起推动Agent走向真正可用的"专家级"。

你知道你的Internet Explorer是过时了吗?

为了得到我们网站最好的体验效果,我们建议您升级到最新版本的Internet Explorer或选择另一个web浏览器.一个列表最流行的web浏览器在下面可以找到.