据百灵大模型消息,百灵新一代原生混合推理模型Ling-3.0-flash现已正式开源,采用124B总参数、5.1B激活参数的MoE架构,并同步提供基础版本及FP8、FP4、INT4等多个量化版本,方便开发者根据硬件条件、推理成本和数据安全(885942)要求灵活部署。
Ling-3.0-flash为不同规模业务系统提供了三种落地方式。一是API调用,面向希望快速接入、无需自建推理服务的开发者,在Artificial Analysis榜单中,其输出速度达353 tokens/s,每项任务加权平均调用成本约0.04美元,适合Coding Agent、搜索调研及多智能体协作等场景。二是单机私有化部署,通过MXFP4与INT4量化版本,模型可在单台配备128GB LPDDR5x内存的NVIDIA DGX Spark上完成端到端推理,生成速度约80 tokens/s,支持约3至4人使用,让敏感数据留在本地,适用于医疗研究、金融法务等对数据安全(885942)要求高的场景。三是高性能部署,在指定GPU配置下,通过推理系统优化和DSpark投机解码,平均输出速率突破1100 tokens/s,平均TPOT低至约0.8ms,专为实时代码补全、高频Agent调用等对单请求时延极度敏感的业务设计。
此外,百灵同步推出“真实世界智能共创计划”,面向开发者、AI创业者等招募100位共创者,每人免费提供1亿Token,总计100亿Token,支持将模型应用于真实业务。Ling Studio也推出限时2.5折优惠,持续降低开发者使用成本。
原文:Ling-3.0-flash 开源:为真实世界而生的开放智能(来源:百灵大模型)
