据百灵大模型消息,百灵正式发布新一代原生混合推理模型Ling-3.0-flash。该模型总参数量为124B,激活参数量仅5.1B,却在多项关键能力上对标甚至超越了参数量达1T级别的上一代旗舰模型Ring-2.6-1T,实现了以极致智能密度驱动的高性能与高性价比。
Ling-3.0-flash的能力跃迁源于底层架构升级与Agent定向优化的双轮驱动。其核心改进体现在以下方面:
混合线性架构,原生进化:模型从预训练阶段即采用原生混合线性注意力架构,以5:1的比例交替堆叠KDA线性注意力层与MLA层。同时,升级了细粒度对角门控的KDA状态记忆机制,并将每个Token的专家激活比例降至1/64的稀疏MoE。三者协同,大幅提升了参数向实际能力的转化效率。
极致智能密度,越级挑战:模型追求“快、省、可落地”的智能密度与智效比极限。仅凭5.1B激活参数,便在传统推理、指令遵循与长文本能力上展现出向更大体量模型对标甚至越级挑战的可能,全面赋能复杂Agent场景的高效落地。
Agent全面进化,长程闭环:围绕真实生产力场景,模型扩展了10,000余个可交互训练环境,实现了Coding、General与Deep Research Agent任务的全程闭环,做到“能力强、响应快、协同稳”。同时,创新接入SGLang HiCache与Mooncake分级缓存架构,使长程交互无需重算,长输入下首Token延迟降低60%至80%以上。
在Agent场景中,Ling-3.0-flash展现了扎实的落地能力。在训练上,针对长程任务引入了完整执行轨迹复盘和步骤贡献评估机制,生成更细粒度的训练信号。相比上一代旗舰,其Agent能力在多项指标上对齐甚至超越体量达其2至3倍的开源及闭源模型。在真实APP生成需求检验中,模型在MiniAppBench上的通过率达到25.3%,与总参数规模约为其两倍的开源SOTA模型持平,远超16个主流模型17%的平均通过率。
为提升长会话交互效率,模型基于SGLang HiCache与Mooncake构建了集群级分层缓存体系,将缓存从“实例私有”升级为“集群共享”,显著提升了长上下文的Token效率。此外,面对复杂任务,Ling-3.0-flash升级了多智能体协同架构“Ling Multi-Agent”,通过多层级分工、交叉验证与协同纠错,降低单一推理路径的偏差,在BrowseComp等评测上可获得对数线性的性能提升。
在具体生产力场景中,Ling-3.0-flash能够通过Blender MCP接口控制3D软件自动建模并渲染航拍视频;可搭建自主多智能体科研大盘,进行文献检索、数据质询并合成论文与报告;能基于Office MCP接口自动排版Word文档、核算Excel数据并输出规范文件;还可批量生成不同设计流派的纯代码美学网页,或开发网页版电子琴与合成器等多媒体应用。
目前,Ling-3.0-flash已在OpenRouter与百灵官方平台开放限时免费API调用,免费期截至北京时间8月3日23:00。模型权重将在免费期结束后正式开源。
原文:Ling-3.0-flash:智以密胜(来源:百灵大模型)
