据腾讯混元消息,腾讯混元团队、清华大学智能产业研究院与东南大学联合推出智能体评测基准E-Bench,模拟腾讯真实业务场景对11个前沿大模型进行测试。结果显示,即便能力最强的模型成功率也仅有73.79%,所有模型平均成功率低至54.56%,意味着智能体在近一半的多步骤真实任务中会失败。其中,腾讯混元Hy3在保持高性价比方面表现突出。
E-Bench以王者荣耀、QQ音乐、腾讯会议三款产品为原型,构建了包含323个任务、41张数据库表、超7.6万行数据的全合成虚拟世界,专门考核AI智能体(886099)的多步骤工具使用能力。与仅测试单步调用或静态问答的基准不同,E-Bench要求模型在信息不全、数据海量且充满干扰的环境中,像真人一样连续完成“识别信息缺口、调用工具、整合结果、修改环境状态”的完整链条。
评测揭示了多项关键发现:
- 整体表现堪忧,可靠性是核心瓶颈:11个前沿模型的平均成功率仅为54.56%。在衡量“稳定靠谱”的Pass 指标(同一任务独立尝试三次全部成功)上,最强模型也仅有58.82%,远未达到可放心交付的水平。
- “信息鸿沟”是最大挑战:E-Bench通过让出题模型拥有查看完整数据库的特权,而被测模型只能使用受限工具,制造了信息不对称。测试表明,模型最常见的失败模式是“过早行动”,即在信息搜集不全时就草率动手。数据规模与干扰信息本身就是区分模型能力的关键。
- 代码执行提升计算型任务,但无法弥补推理短板:在开放代码执行工具的E-Bench-Code版本中,模型在“多条件过滤、全量获取”等计算密集型任务上获益明显,但在“跨步依赖、精确边界判断”等推理决策型任务上提升有限,说明“想清楚该取什么”才是真正的瓶颈。
- 成本效益比成为产品化关键:腾讯混元Hy3展现出显著的成本优势,在E-Bench-Code中取得64.40%的平均成功率,而每任务成本处于全部模型的最低一档(低至约0.029美元),实现了“又省又不差”的平衡。在基础版测试中,Hy3也能一气呵成地完成跨越多个实体、环环相扣的复杂长链路任务。
E-Bench采用确定性数据库状态差异作为评分标准,智能体必须使最终数据库状态精确匹配标准答案才算通过,单次任务平均涉及24.9处行级改动。其核心方法论是将环境合成与任务合成解耦,先构建可复用的完整产品环境,再批量生成任务,确保了评测的可控性、可扩展性和低成本。研究团队计划未来将E-Bench拓展至命令行界面等更多产品后端及跨领域场景,并将其作为训练数据来源,持续提升智能体的多步工具调用能力。
原文:E-Bench :以腾讯产品为原型的 AI 智能体大考(来源:腾讯混元)
