大模型圈有一个心照不宣的潜规则:能力最强的模型,永远是用不起的那个。
GPT-4刚出来那会儿,开发者圈流行一句话:“调用之前先算一下这道题值多少钱”。
一道复杂推理题跑下来,几美元就没了。企业级接入更夸张,一个月API账单能烧掉一个初创团队的季度预算。
不是没人想过办法。量化、蒸馏、小模型微调、MoE架构,各路招数轮番上阵,目标只有一个:把旗舰能力的成本打下来。
但折腾来折腾去,效果总是差那么一口气,要么能力打折,要么稳定性不够,要么长上下文直接崩。
直到DeepSeek横空出世,行业第一次有了“斩杀线”这个说法。
但这条线,在8月26日晚被往上挪了一大截。
阿里(BABA)千问团队发布Qwen3.8-Flash,同步开源。
千亿总参数,仅激活60亿,性能超越Claude Opus4.6;每百万Tokens输入1元、输出3元,价格最低至DeepSeek-V4-Flash 的三分之一。
这不是又一次常规的参数竞赛,而是大模型效率赛道上,一次真正意义上的“降维打击”。
01
旗舰级的能力,打到了“日常价”区间
先说清楚什么叫“斩杀线”。
它不是单纯的价格低。
真正的斩杀线,是把原本只有高价旗舰模型才能提供的能力,拉进多数开发者和企业都能长期使用的成本区间。
DeepSeek此前被社区公认为“模型斩杀线”,核心也不是便宜,而是它的出现迫使市场面对一个尖锐的问题:大家究竟愿意为相同水平的智能,付多少钱?
Qwen3.8-Flash把这个问题又往前推了一步。
先看性能。
这是一个多模态混合专家(MoE)模型,采用了与此前所有千问大模型完全不同的下一代(Next)架构——Transformer参125B,仅激活6B,整体表现超越Opus4.6、接近Opus4.8。
仅完成预训练的基座模型,在通用能力SuperGPQA、数学推理GSM8K、编程SWEBench-Pretrain等基础评测上,就已经超过了3倍其大小的Qwen3.7-Plus基座。
经后训练后,性能跃迁更为明显。
智能体编 SWE-bench Pro评测领先Opus4.6多达9.1分;长程专业任务CoWorkBench、真实工具调用Toolathlon Verified均超越DeepSeek-V4-Flash;专业工作任务JobBench智能体评测超出Opus4.6近20分。
多模态领域差距拉得更大。移动端智能体AndroidWorld高出22.5分,视觉推理MathVision 超出25.1分,具身智能 ERQA 领先31.5分。
再看价格。
每百万Tokens输入仅1元、输出3元,是Claude Opus4.6价格的3%,是DeepSeek-V4-Flash闲时价格的三分之二、忙时价格的三分之一。训练成本同样骤降近90%,性能与上一代 Qwen3.7-Plus接近,但仅用九分之一的资源便完成了训练。
图源:机器之心
旗舰级的能力,打到了“日常价”区间。
这直接动摇了一个行业默认假设:昂贵的企业级模型,是否还天然拥有企业的“默认调用权”?
大量日常的Agent任务已经能被低价模型高质量完成,企业就得做选择把贵模型留给少数极难任务,还是继续让它承担所有请求?
答案正在变得清晰。默认调用权不会永远属于最贵的那个,而会属于“够用且足够便宜”的那个。
02
Token 单价之外,那本没人算的账
但Qwen3.8-Flash真正的杀伤力,不只是把Token单价打下来了。
它在迫使行业重新定义“斩杀线”本身。
过去这条线怎么划?
很简单,看每百万Tokens多少钱。输入多少钱、输出多少钱,拉个表一比,谁便宜谁就是斩杀线。
DeepSeek就是这么赢的,同等能力档位,价格直接打到对手的零头。
但这个衡量标准,正在失效。
因为一次真实任务的成本,远不止API调用费。
过程中的等待时间是成本,失败后的重复调用是成本,多个Agent之间来回协同的轮次是成本,最后人工接管、逐条修正结果更是成本。
一个模型如果单价便宜但经常出错、需要反复重试,跑下来真实任务成本可能反而更高。
这就像打车,不能只看每公里单价,还得看等车时间、堵不堵车、绕不绕路。
单价最低的那辆车,如果每次都迟到、还得你自己走两公里,总成本未必划算。
所以斩杀线需要被重新定义,不再只是看Token单价,而是升级到任务总成本,即完成一件真实的工作,到底要花多少钱、多少时间、多少人力。
Qwen3.8-Flash的价值,正在于同时压低这几项隐性成本。
架构层面的革新是关键。
注意力方面,引入独特的QSA(Qwen Sparse Attention机制,与GDN高效融合形成混合注意力架构,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上。
又准又快,直接压缩等待时间。
模型内部信息传递方面,自研的Gated Residual方法将传统Transforme的1条信息主通道拆分拓展为4条,让模型动态决定读写信息,信息传递更高效,训练也更稳定。
参数扩展方面更具巧思。引入51B的N-gram Embedding参数,为Transformer参数提供更高效的查表寻址,每次token计算时无需参与,以极少的资源消耗“外挂”了一个大规模的“记忆指南手册”。
模型结构和训练优化协同进行,收敛效率和训练吞吐大幅提升。
说人话就是:不仅单次调用便宜,而且完成任务的轮次更少、失败率更低、长上下文处理更快。
Qwen团队和“千问办公”团队还对模型和Harness框架做了协同联合优化,Agentic能力进一步提升。
在真实的智能体工作流里,它不只是“理论上强”,而是在实际调用链路里被调过、被磨过的。
大模型的斩杀线,正在从“每百万token值多少钱”,转向“每块钱最终能完成多少工作”。
上游硬件产业的竞争重点也会跟着变。
未来决定推理效率的,不只是GPU拥有多少FLOPS,还包括HBM的容量与带宽、CPU与GPU之间的互联速度、KV Cache 的管理效率,以及推理框架能否减少数据搬运。
大模型竞争正从单一的算力竞赛,走向模型架构、芯片、内存和推理系统的协同竞争。
03
越便宜,越费卡?
模型效率提高、单次调用成本下降,看起来行业需要的GPU会减少。
但更可能出现的,是类似“杰文斯悖论”的结果:单位使用成本越低,使用总量反而越大。
19世纪经济学家威廉 杰文斯观察到,煤炭(850105)使用效率提高后,煤炭(850105)的消耗量非但没有下降,反而大幅上升,这是因为效率提升降低了成本,刺激了更多场景的使用。
大模型正在重演这一逻辑。
过去由于成本限制,用户可能只让 I回答一个问题;现在人们已经逐渐习惯让Agent帮自己处理各种工作。
每次任务变得更便宜后,用户不会只节省原来的预算,反而会把AI部署到更多流程中。
单次任务消耗下降,但任务数量、调用轮次和上下文长度可能更快增长。
Qwen3.8-Flash 首发上线“千问办公”,“标准模式”内置该模型,可完成95%的日常办公任务;开发者和企业同时可通过千问AI平台获取新模型API服务。
一个能处理95%日常办公的模型,价格只有旗舰模型的3%,企业的理性选择不是减少AI使用,而是把AI铺进每一个还没被自动化的角落。
Qwen3.8-Flash对产业链的影响,可能不是减少算力需求,而是改变算力需求的结构:从集中于模型训练的大规模算力投入,进一步扩展到海量、持续、高并发的推理负载。
更便宜的模型不是GPU需求的终点,反而可能成为推理需求真正爆发的起点。
Next新架构据透露将是全新一代千问大模型Qwen4的雏形——Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源。
截至目前,Qwen3.8已开源发布2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,Qwen模型全球下载量突破30亿次,衍生模型数超30万个。
斩杀线被一次次刷新的背后,是中国大模型在效率赛道上的集体突进。
大模型的终极竞争,从来不是谁能造出最聪明的模型,而是谁能让聪明变得足够便宜、足够普及。
一旦“又好又便宜”不再是矛盾,真正被改变的,是整个智能经济的成本结构以及所有还在为“智能溢价”买单的人。
智能的溢价,终有一天会被效率抹平。而抹平它的人,正在写下新的规则。
