国内唯一!阿里斩获ACL 2026最佳资源论文奖利好

2026-07-08 16:45:44
来源:阿里云
分享
文章提及标的

刚刚,国际AI顶级学术会议ACL 2026最佳论文奖出炉!

阿里研究团队在Deep Research Agent方向的研究成果从全球一万多篇投稿中脱颖而出,获评最佳资源论文奖(Best Resource Paper),是国内唯一获得该奖项的中国公司。

该论文首次系统揭示了当前Agent在真实世界复杂规则推理中面临的巨大缺陷,并提出了全新的专家Agent评测基准,为提升大模型在真实场景的可靠性指明了新方向。

ACL(国际计算语言学协会)是自然语言处理和计算语言学领域中历史最悠久、最具权威性的国际学术组织,ACL 2026共收到12148篇投稿,仅19%被主会录用,最终仅有4篇论文获评Best Resource Paper。

为什么这项研究值得关注?

想象一位跨境电商(885642)卖家,要把一件商品出口到海外——他必须先给这件商品找到一个精确的10位海关编码(HS Code)。

听上去只是"分类",实际上却要在一棵层层嵌套的规则树里一路推理下去:材质、用途、加工方式、使用场景……任何一个环节判断错误,整批货就可能被扣关或罚款。这项工作在现实中通常需要经验丰富的关务专家来完成。

阿里此次获奖的论文以此为切入点,提出了针对真实场景和专家水平的智能体新基准 HSCodeComp:它要求Agent像资深关务专家一样,将商品模糊的属性与严格的关税归类规则对齐,为商品精准映射到10位细分编码。研究团队对14个主流大模型和9个先进Agent框架进行了全面评测。

结果令人意外:表现最好的Agent系统准确率仅为约45%,而人类专家的准确率高达95%。更值得注意的是,研究还发现——单纯堆更多推理时间(inference-time scaling)并不能显著缩小这道鸿沟,说明这不是"算力问题",而是 Agent 架构本身的结构性瓶颈。

该研究还进一步揭示了导致Agent系统缺陷的原因:首先过长的推理链导致Agent在中途偏离正确路径,其次是领域知识不足导致规则误用,最后由于推理幻觉造成Agent生成缺乏事实依据的分类判断。这些发现为Agent能力提升指明了方向。

据介绍,阿里已基于该研究成果,在跨境贸易数字关务等场景中设计了以Qwen基座为核心的Agent框架,在HSCodeComp基准(10位编码准确率)上的测试结果显示,该Agent以65.0%的准确率稳居AI系统第一位。

ACL评审委员会表示:“该基准切中了Agent应用的高度重要挑战——考察Agent对严格层级化自然语言规则的遵循能力,研究动机极具说服力;严谨的人类专家评测流程提供了高度可靠的能力上界。”

目前,HSCodeComp基准的数据集与评测代码已在Hugging Face和GitHub全面开源。我们希望这项工作将会启发学术界和工业界持续进行探索,一起推动Agent走向真正可用的"专家级"。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME