据通义实验室消息,PawBench评测基准正式推出,旨在解决通用智能体任务失败时难以界定是模型能力不足还是运行框架(Harness)问题的痛点。该基准将底座模型与运行框架纳入同一评测体系,通过构建包含150道真实任务、4050个测试单元的评测集,对“模型、Harness、任务”进行交叉评测,以评估LLM与Harness的联合效果并帮助开发者精准定位问题。
PawBench v1.0 构建了 9 个模型 × 3 个 Harness × 150 道任务的评测矩阵,共计 4,050 个测试单元。所有任务在 Docker 沙箱中运行,执行轨迹、评分产物和环境快照均被保留以供复盘。评测任务来自6个高质量Agent评测集,并按照5个维度打标:应用场景、原子能力、复杂度、输入模态和运行环境。最终得分由自动评分器和 LLM-as-judge 两部分组成,采用混合权重计算,分数范围为0到1。
从本次评测结果中,可以得出两个明显结论:
1. Harness 间存在稳定分差:QwenPaw(76.4)、OpenClaw(75.4)、Hermes(70.4),最高极差达6.4分。
2. 好 Harness 能让模型“以下克上”:例如,在 QwenPaw 环境下,Qwen3.6-35b-a3b 的得分(70.4分)超过了在 Hermes 环境下的 GLM 5.1(68.2分),证明 Harness 环境可能比底座模型本身更关键。
通过深入的切片分析,PawBench 揭示了以下重要发现:
发现一:Harness机制能左右模型表现
以 qwen3.6-35b-a3b 为例,仅更换 Harness 导致分数差距达11.5分。复盘发现可能原因包括:(1)缺乏对工作区产物的实质性校验,导致“虚假完工”;(2)路径感知与约束宽松,导致产物未被正确识别;(3)默认装载工具数量过多,增加模型决策负担。
发现二:Skill主动发现是Harness能力短板
在测试 Harness 主动发现和应用项目专属 Skills 的能力时,三家 Harness 在17道 Skill 任务上的表现均较为吃力。这暴露出 Harness 主动发现能力不足以及模型自身长链路推理的瓶颈。
发现三:Web搜索任务很依赖默认可用性
在侧重网页检索与内容抓取的任务中,评测还原了开发者的默认配置体验。结果显示,Harness 是否将关键工具(如搜索)设置为“默认可用”直接影响任务表现,而不仅反映模型能力。
基于上述发现,PawBench 为 Harness 设计提出了四条原则:
1. Inform Fully(充分告知):明确告知模型当前运行环境的所有关键上下文。
2. Equip on Demand(按需装备):确保关键工具默认可用,且工具数量需匹配模型上下文预算。
3. Monitor Actively(主动监控):应检查任务产物是否真实落地,而非仅听模型声明。
4. Recover Gracefully(弹性恢复):在出现异常时,为模型提供有信息量的续推和纠偏机会。
PawBench 对不同用户具有实用价值:对于智能体用户,可帮助选择更合适的模型与Harness组合;对于Harness开发者,则提供了横向自检、失败画像和回归验证的深度诊断工具。PawBench v1.0 已开源,并鼓励社区贡献新的 Harness、模型评测结果、任务及诊断报告。该项目是 OpenJudge 生态的一部分,致力于共建 Agent 评测生态。
项目地址:https://github.com/agentscope-ai/PawBench
榜单地址:https://agentscope-ai.github.io/PawBench
原文:PawBench:给通用智能体一把可度量的尺(来源:通义实验室)
