无问芯穹联合清华大学开源具身智能云原生平台RLark:5分钟完成设备纳管、10秒启动跨集群任务

2026-09-24 12:59:20
来源:AI观察
分享
AIME

问财摘要

1、无问芯穹与清华大学合作开源了面向具身智能的云原生纳管平台RLark,实现了跨地域任务的统一调度、部署与运行。 2、RLark通过具身设备运行时和任务级跨集群网络互联技术,将云端算力、边缘节点、机器人和相机等设备纳入统一资源体系,实现了设备纳管时间缩短至5分钟,任务提交后可在10秒内启动。
免责声明 内容由AI生成

据无问芯穹消息,无问芯穹与清华大学共同打造并开源面向具身智能的云原生纳管平台RLark,通过具身设备运行时和任务级跨集群网络互联技术,将云端算力、边缘节点、机器人和相机等设备纳入统一资源体系,实现跨地域任务的统一调度、部署与运行。目前,RLark已完成3个集群、近百个云边端节点的统一纳管,覆盖4种型号具身设备,设备纳管时间由小时级缩短至约5分钟,任务提交后可在10秒内启动。

具身智能任务通常涉及机器人、相机、云端GPU、训练与推理程序等多个角色。随着设备数量和任务复杂度增加,设备接入、任务部署、网络配置及故障排查的成本不断上升。RLark通过统一组织分散的算力、设备和执行程序,让机器人等具身设备像GPU一样能够被申请、调度和复用,并以完整任务为单位实现资源配置和运行管理。

在一次跨地域真机实测中,团队将RLark与强化学习基础设施框架RLinf结合,在广东云端GPU集群与北京机器人现场之间开展实验。现场机器人和相机负责交互及数据采集,云端GPU承担训练计算,RLark负责设备申请、跨集群部署、任务实例互联和状态汇集,RLinf负责训练计算与数据协作。

1. 5分钟完成设备纳管

实验中,云端GPU集群和现场设备所在集群接入RLark后,各集群Agent同步节点容量、资源信息和运行状态。通过具身设备运行时embodied-runtime,双臂机器人和相机等真实硬件被注册为可申请、可调度的任务资源。

在测试环境下,具身设备纳管时间从传统的1小时缩短至5分钟。设备接入后,研究人员能够统一查看两地资源的位置、类型和可用情况,并在后续实验中持续申请和复用,无需重复接入。

2. 10秒内启动跨集群任务

研究人员通过一份任务配置,定义训练、推理和真机交互等执行角色,并声明各角色所需资源、实例数量和部署位置。任务提交后,RLark将配置下发至相应集群,由Agent创建执行实例并建立跨集群通信关系。

在资源已接入且具备运行条件的测试环境中,任务提交后10秒内即可在平台侧启动,无需逐台登录设备或分别部署程序。

3. 跑通采集—训练—真机验证闭环

任务启动后,现场机器人和相机持续产生交互数据并回传云端,由RLinf用于训练;更新后的策略再用于后续真机交互,形成采集、训练和验证的持续循环。

本次实验连续运行约36分钟,训练推进至323个全局训练步骤,完整跑通设备申请、跨集群调度、真机数据回传、云端训练和策略更新等环节。研究人员还可以从同一任务入口查看各角色状态,并沿执行实例、节点、设备和日志定位异常。更换设备、调整角色规模或算法参数时,可直接修改并复用任务配置。

4. 通信优化提升跨地域运行效率

RLark结合虚拟寻址、gVisor用户态网络栈和SSH安全隧道,为分布在云端与现场的执行实例建立通信通道,并统一维护路由、隧道和转发关系。结合RLinf的分布式通信方式,平台对任务级跨集群通信和数据流转进行优化。

专项测试显示,在受限网络环境下,RLark大包单流吞吐较测试所用VPN方案提升约49%,小包单流吞吐提升约14%;在高带宽环境下,大包单流吞吐接近2Gbps。与EasyTier方案相比,RLark减少了跨地域真机任务运行过程中因网络传输造成的卡顿。

RLark采用控制面与数据面分离的架构,主要由四项技术能力构成:

一是具身设备插件与运行时。平台通过统一硬件抽象,将机器人、相机等真实设备转化为云原生系统中可识别、可申请和可调度的资源,使用户能够在同一份任务配置中声明GPU、机械臂和相机的类型与数量。

二是任务级跨集群通信。平台通过虚拟地址和SSH安全隧道连接分布在不同集群的执行实例,并利用通信域、成员关系和证书认证控制互联范围。RLinf则将观测数据处理、推理和真机交互等环节尽量部署在边缘侧,减少原始观测数据全量回传带来的带宽开销。

三是声明式任务编排。RLark以Job、Task和Worker三层模型描述具身实验,分别对应整项任务、训练或真机交互等执行角色,以及实际执行实例。用户通过一份配置声明资源、实例数量和部署位置,并可通过Workflow组织具有阶段依赖的多个Job。

四是任务级运行观测。平台将Job、Task、Worker与节点、设备、事件和日志关联,用户能够沿“任务—角色—执行实例”逐层排查异常。同时,RLark提供Web Terminal和TensorBoard入口,支持检查运行环境、设备访问和训练过程。

目前,RLark已开放从用户界面、API、后端服务,到任务编排、跨集群互联和具身设备运行时的整套能力,旨在降低具身智能基础设施的使用门槛。后续项目将继续完善设备与芯片适配、轻量运行时、跨域通信、任务异常恢复和实验配置复用,并面向开源社区推进共同建设。

项目地址:github.com/RLinf/RLark

项目文档:rlark.readthedocs.io

快速开始:github.com/RLinf/RLark#quick-start

原文:5 分钟完成机器人纳管、10 秒启动跨集群任务,无问芯穹联合清华大学开源具身智能云原生平台 RLark(来源:无问芯穹)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME