百灵原生混合推理模型Ling-3.0-flash正式开源,提供多种部署方式

2026-08-07 20:30:29
来源:AI观察
分享
AIME

问财摘要

1、百灵大模型开源了新一代原生混合推理模型Ling-3.0-flash,采用MoE架构,提供基础版本及多个量化版本,方便开发者灵活部署。该模型为不同规模业务系统提供了三种落地方式:API调用、单机私有化部署和高性能部署。 2、此外,百灵大模型还推出“真实世界智能共创计划”,面向开发者、AI创业者等招募100位共创者,每人免费提供1亿Token,总计100亿Token,支持将模型应用于真实业务。
免责声明 内容由AI生成
文章提及标的

据百灵大模型消息,百灵新一代原生混合推理模型Ling-3.0-flash现已正式开源,采用124B总参数、5.1B激活参数的MoE架构,并同步提供基础版本及FP8、FP4、INT4等多个量化版本,方便开发者根据硬件条件、推理成本和数据安全(885942)要求灵活部署。

Ling-3.0-flash为不同规模业务系统提供了三种落地方式。一是API调用,面向希望快速接入、无需自建推理服务的开发者,在Artificial Analysis榜单中,其输出速度达353 tokens/s,每项任务加权平均调用成本约0.04美元,适合Coding Agent、搜索调研及多智能体协作等场景。二是单机私有化部署,通过MXFP4与INT4量化版本,模型可在单台配备128GB LPDDR5x内存的NVIDIA DGX Spark上完成端到端推理,生成速度约80 tokens/s,支持约3至4人使用,让敏感数据留在本地,适用于医疗研究、金融法务等对数据安全(885942)要求高的场景。三是高性能部署,在指定GPU配置下,通过推理系统优化和DSpark投机解码,平均输出速率突破1100 tokens/s,平均TPOT低至约0.8ms,专为实时代码补全、高频Agent调用等对单请求时延极度敏感的业务设计。

此外,百灵同步推出“真实世界智能共创计划”,面向开发者、AI创业者等招募100位共创者,每人免费提供1亿Token,总计100亿Token,支持将模型应用于真实业务。Ling Studio也推出限时2.5折优惠,持续降低开发者使用成本。

原文:Ling-3.0-flash 开源:为真实世界而生的开放智能(来源:百灵大模型)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME