据潞晨科技消息,具身智能行业瓶颈正从数据匮乏转向训练基础设施能力,基于视频生成模型的世界模型路线对训练系统提出严苛要求。潞晨开源项目OpenSora及配套技术栈已被微软(MSFT)研究院、字节跳动Seed团队、阿里达摩院等多家顶级机构选为基础底座,成为该领域的事实标准。
世界模型被视为机器人学习在模仿学习和真机强化学习之外的第三条路径,能够让机器人在虚拟环境中低成本试错并学会自我纠错,但需要视频生成模型训练、超大batch稳定训练和训推一体工程闭环三大能力。
微软(MSFT)研究院具身智能旗舰项目IGOR明确从预训练OpenSora起步,而非从零构建底座。字节跳动Seed团队在WMPO和IRASim两个项目中均继承或初始化自OpenSora权重,其中WMPO将Mimicgen四任务成功率从33.6%提升至57.6%,真机插销任务从53%提升至70%,机器人在虚拟环境中涌现出自我纠错能力。IRASim作为策略评估器,与Mujoco真值仿真器相关系数达0.99,Push-T IoU从0.637提升至0.961。阿里达摩院RynnWorld-4D、鉴智机器人、极佳科技等团队的世界模型工作同样引用或基于OpenSora。
在大batch训练方面,LAMB优化器成为解决数万级batch size下训练不稳定问题的关键。SpatialActor(AAAI 2026 Oral,当前机器人操作SOTA)采用LAMB训练,在RLBench 18任务249变体上达到87.4%成功率,Insert Peg任务领先53.3%。机器人模型多分支异构、梯度尺度差异大的特性,使LAMB的逐层自适应成为刚需,更高的学习率也意味着更少的迭代次数和更低的算力成本。
潞晨通过四层全栈垂直整合,将训练OpenSora过程中在超长时空序列显存管理、DiT张量并行、大batch通信优化等方面积累的经验沉淀为系统能力,帮助具身智能团队跳过从零到一的底座搭建,直接推进业务创新。
原文:潞晨技术栈:具身智能世界模型训练优选底座(来源:潞晨科技)
