IT之家8月12日消息,比亚迪(002594)汽车新技术研究院AI团队上个月发表了其首篇研究论文,介绍了一种用于自动驾驶的混合世界模型HyWorldVLA。该模型结合了像素级和潜在空间世界建模,并采用视觉-语言-动作(VLA)架构。
该模型在自动驾驶公开基准测试NAVSIM v1中取得了90.59的PDMS评分,刷新了该基准的历史最佳成绩。在指标更全面的NAVSIM v2上,HyWorldVLA同样取得了89.71分的领先成绩。
IT之家注:PDMS指标综合考察碰撞安全性、可行驶区域合规性、安全距离、目标完成度和运动舒适性等多维度实际驾驶质量。
HyWorldVLA的核心思路是“两条腿走路”。像素级世界模型逐帧预测未来路况,细节丰富但计算昂贵、对视觉噪声敏感;潜在空间模型在压缩的抽象表征中运行,效率高却容易丢失关键细节。比亚迪(002594)的方案在训练阶段用像素级监督充当“看门狗”,强制潜在空间保留足够的环境信息,实际推理时则只用轻量的潜在空间模型保证效率。
消融实验验证了两者缺一不可:移除像素级预测,PDMS从90.59跌至87.50;移除潜在空间处理,则降至89.91。在655个雨雾噪声场景测试中,HyWorldVLA得分86.87,比最强基线高出19分以上。
今年5月28日,比亚迪(002594)发布了中国首款4nm车规级智驾芯片“璇玑A3”。该芯片采用4nm制程,集成16核CPU,DMIPS达420K,带宽273GB/s,达到ASIL-D最高功能安全等级。单颗芯片算力约700TOPS,支持三颗芯片并联,整车智驾算力最高可超2100TOPS。从算法到芯片的完整闭环,被视为比亚迪(002594)为L3级自动驾驶进行的关键技术储备。
