据中兴通讯(HK0763)消息,近日,SuperCLUE发布手机助手GUI智能体6月测评榜单。中兴gui手机智能体以91.29分的总成绩位列第一,在全部评测维度中均保持领先,展现出接近商业可用水平的端到端能力。
本次测评涵盖6款手机助手GUI智能体产品,在统一的ADB手机交互环境与纯视觉输入条件下,从复杂意图拆解与动态规划、多模态GUI感知与理解、跨应用全链路执行三大维度进行横向度量。
总成绩格局:一家领跑、三家胶着、两家追赶
从总成绩来看,参评产品呈现明显梯队分化:
第一梯队(>90分):仅中兴gui手机智能体一家,以91.29分绝对优势领跑。
第二梯队(65-75分):Open-AutoGLM(73.11分)、Mobile(BEEP)-Agent-3.5(67.74分)、MAI-UI(65.91分)形成胶着中游集团。
第三梯队(<<60分):GELab-Zero(54.26分)与UI-TARS(30.19分)处于追赶阶段,其中UI-TARS与榜首差距超过60分。
部分智能体困难任务反超中等任务
柱状图显示,中兴以接近满分的简单任务(96.99分)和85分以上的困难任务得分,实现“全难度通吃”。Open-AutoGLM与Mobile(BEEP)-Agent-3.5出现“难度逆序”:困难任务得分(76.71分/73.09分)反超中等任务(68.68分/58.17分),说明中等任务中的多意图并行与隐式判断对规划稳定性的挑战更甚。
中兴gui手机智能体完成率高且步数少
从“结果”与“过程”两个维度评估:中兴表现最佳,完成率93%,平均每题仅10.83步,决策质量高,极少冗余或回退。第二梯队完成率56%-60%,步数差异较大。第三梯队均为低完成率、高步数,UI-TARS平均20.62步仅换回18%成功率。整体趋势显示,完成率越高,步数越少。
27B模型优势明显,7B模型表现弱于4B模型
散点图显示,27B的中兴以91.29分断层领先,较第二名(9B/73.11分)拉开18分差距。7B的UI-TARS仅得30.19分,低于4B的GELab-Zero(54.26分),说明架构与任务适配度比参数量更重要。
中兴gui智能体全面领先,UI-TARS整体偏弱
热力图显示,中兴几乎所有维度得分均高于85分,端到端完成率93%,是唯一在简单、中等、困难、意图拆解、GUI感知、跨应用执行六个维度上均突破85分的产品。第二梯队多数维度得分在60–80分,但在跨应用执行维度得分偏低。第三梯队整体能力较弱,UI-TARS除GUI感知(46.06分)外,其余六个维度均低于31分,完成率仅18%。
对比示例展示
测评报告以“高德搜索‘海底捞(HDL)’并导航去最近一家,然后打开微信在‘产品交流群’发位置共享”任务为例,对比了中兴gui手机智能体与GELab-Zero的表现。中兴在15步内准确完成所有操作,获得满分100分;GELab-Zero因未选择最近门店、错误选择“发送位置”而非“位置共享”功能,最终得分53.85分。
