让大模型少等待、快输出,中科曙光发布Token加速技术体系

2026-09-11 18:07:37
分享
AIME

问财摘要

1、中科曙光发布scaleFabric Token加速技术体系,以scaleFabric原生无损RDMA高速网络为核心,通过计算、存储与网络协同,提升大模型运行效率。其中,支持GPU直接发起网络通信的IBGDA技术已实现国内首次规模化落地。 2、Token是大模型处理和输出内容的基本单位,其生成效率直接影响模型响应速度与服务能力。 3、算存传的紧密协同,降低了数据经过多级交换设备时的传输时延,有效减少大规模集群中的通信等待,进而提升Token生成效率。
免责声明 内容由AI生成
文章提及标的
中科曙光--
海量数据--
查看股票机会下载客户端

近日,中科曙光(603019)发布scaleFabric Token加速技术体系。该体系以scaleFabric原生无损RDMA高速网络为核心,通过计算、存储与网络协同,减少数据传输和读取过程中的等待,提升大模型运行效率。其中,支持GPU直接发起网络通信的IBGDA技术,已在十万卡级集群中完成验证,实现国内首次规模化落地。

▍Token效率成大模型竞争新标尺

Token是大模型处理和输出内容的基本单位,其生成效率直接影响模型响应速度与服务能力。从大模型训练到推理阶段,海量数据(603138)需要在多块GPU间传输、交换。如果通信调度慢、数据读取不及时,GPU就要停下来等待,影响Token产出效率,增加运行成本。

针对这些问题,中科曙光(603019)以scaleFabric原生无损RDMA网络为基础,打通计算、存储和传输环节,让数据更快到达、GPU少些等待,将更多算力用于实际计算。

▍“算存传”三级紧耦合加速Token流转

在计算环节,GDR技术让网卡可直接读写GPU显存,减少CPU内存中转。IBGDA技术则进一步让GPU直接驱动网卡、管理数据传输,消除传统路径中CPU调度带来的开销,让计算与通信衔接更顺畅。

在存储环节,scaleFabric通过NVMe over RDMA、XDS和NFS over RDMA技术,加快远端存储访问,支持GPU直接读取远端数据,并提升文件传输效率,缩短数据从存储到计算的路径。

算存传的紧密协同,降低了数据经过多级交换设备时的传输时延。测试显示,其单跳转发时延低至260纳秒,端到端时延低于1微秒;在部分场景的三跳基准时延性能测试中,端到端时延较主流RoCE方案降低约63%,有效减少大规模集群中的通信等待,进而提升Token生成效率。

▍IBGDA迈出规模应用关键一步

MoE(混合专家)模型需要将任务分配给不同“专家”处理,再汇总结果。这一过程会产生大量并发的小消息,通信调度效率直接影响模型运行速度。IBGDA让GPU直接发起通信,减少CPU在关键通信路径中的参与,提升多GPU之间的协同效率。

依托scaleFabric,中科曙光(603019)自研IBGDA技术已在十万卡级集群中完成验证。

目前,scaleFabric已完成与DeepEP等通信框架的适配,便于相关技术融入现有大模型应用环境。

从减少单次通信等待,到提升大规模集群协同效率,中科曙光(603019)持续推进计算、存储与网络优化,为国产AI基础设施提供更高效的系统支撑。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME