阿里通义千问发布Qwen-Robot系列模型 打通大模型到物理世界行动鸿沟

2026-06-16 14:30:57
来源:AI观察
分享
文章提及标的

据通义实验室消息,阿里通义千问团队今日正式发布Qwen-Robot(LAWR)系列模型,旨在通过模块化协同,解决大语言模型从“认知”到“物理行动”的核心挑战。该系列包含三个专业基础模型,分别针对导航、操作与世界模拟,致力于弥合智能体在复杂物理世界中执行任务的鸿沟。

Qwen-Robot(LAWR)系列包含三个核心模型,各自聚焦关键能力并已实现技术突破:

Qwen-Robot(LAWR)Nav:物理智能体的行动入口

该模型通过自适应的视觉分配策略和工具接口,将视觉语言能力接入移动控制,统一了指令跟随、点/目标导航、目标追踪和自动驾驶四类任务。其核心是将视觉分配策略参数化,通过任务模式与可调节参数动态决定视觉历史的编码方式。模型在1560万条样本上训练,使用单一模型、单组权重,在多个导航领域达到领先水平:VLN-CE RxR 76.5% SR、HM3Dv2目标搜索75.6% SR、EVT-Bench 90.0%跟踪率、NAVSIM 91.4 PDMS,并在3个EQA基准创下新纪录。该模型已成功零样本部署于宇树Go2四足机器人,仅使用单个低分辨率相机,在开放真实环境中完成跨房间的指令跟随任务。

Qwen-Robot(LAWR)Manip:物理智能体的交互基石

该模型旨在解决不同形态机器人间的操作兼容性问题。它通过统一的80维状态-动作表示、相机坐标系下的末端执行器增量位姿以及上下文策略自适应三种机制,屏蔽机器人本体形态差异,实现跨本体一致信号提取。模型基于完全由开源数据构建的超过38,100小时操作数据训练,数据来源包括11,320小时开源机器人数据、1,933小时第一人称人类视频,以及通过人-机迁移数据合成管线从人类视频合成的跨15个本体的24,808小时机器人数据。其在多项基准测试中表现优异,如LIBERO-Plus 91.4%、Robot(LAWR)win-C2R Hard 69.4%。在真实环境测试中,于RoboChallenge Table30 v1通用赛道以45%成功率排名第一。

Qwen-Robot(LAWR)World:物理智能体的无限世界

该模型通过学习世界的状态转移函数来预测未来状态,以弥补真实世界经验的稀缺。其关键设计是将所有动作以自然语言表达,从而将末端执行器位姿、转向指令和导航路标点统一为单一接口,使得20余种本体类型和500余个动作类别得以在包含860万视频-文本对的语料库下协同训练。模型采用60层双流MMDiT架构,并以完整的Qwen2.5-VL多模态大语言模型作为动作编码器,内化物理世界知识。该模型在EWMBench总分及DreamGen Bench排名第一,在开源模型中于WorldModelBench及PBBench排名第一。它具备细粒度语言控制能力,并能实现跨8种以上本体的人机迁移。

从模型到智能体:形成闭环

三个模型均提供语言优先的接口,可被通用Qwen模型作为物理世界工具进行组合。团队内部项目Qwen-Robot(LAWR)Claw作为一个机器人智能体框架,使Qwen VLM智能体能够调用Qwen-Robot(LAWR)系列模型,并管理长程任务所需的上下文与记忆。目前已在开放式任务执行、智能体导航与具身问答等场景实现早期应用演示。例如,智能体可在真实建筑中通过视觉证据寻找可用卫生间,或在开放园区中自主探索并找回物品。

团队还提供了实验性功能Chat2Robot(LAWR),用户可在浏览器中输入自然语言指令,与机器人进行交互,目前主要展示Qwen-Robot(LAWR)Manip的指令跟随能力。团队表示,具身智能尚在起步阶段,Qwen-Robot(LAWR)是迈向让AI走进物理世界的第一步。

原文:Qwen-Robot 发布:打通大模型到物理世界的最后一公里(来源:通义实验室)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME