据千问大模型消息,阿里巴巴(BABA)正式发布Qwen家族迄今最强大的模型Qwen3.8-Max,其参数规模扩展至2.4万亿,激活参数95B,支持100万上下文Tokens,在编程、办公、科研及长周期(883436)任务等方面实现全面提升。模型权重将于下周开源,同时开源的还有Qwen3.8-27B模型。
Qwen3.8-Max基于Qwen 3.5架构基础构建,现已通过千问AI平台提供API服务:国内每百万Tokens输入12元、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元。
编程能力方面,Qwen3.8-Max展现出独立交付项目的能力。在“从零到有”构建自进化Harness项目案例中,模型从零创建oh-my-cli项目,完全自主运行约16天后,仓库累计留下265次commits、127个PR和151个issues。在最新研究论文复现与超越任务中,模型连续独立工作约五天,用约37小时完整复现论文六项主要结论,随后在88小时内独立提出并测试18种改进方向,最终在AIME24基准上再提升2.7分,累计写下约7600行代码、执行超1100步操作、跑33轮GPU训练。
办公助手能力方面,团队通过三项技术创新实现突破:让环境解耦,将任务、工作空间、工具链拆分为独立维度以自然扩展环境数量;建立统一奖励系统,将执行校验、文本评判、视觉检查、行为审计整合为一套评分标准;实现在线数据均衡,确保训练信号均匀稳定。在覆盖数百种职业的压力测试中,企业合规律师场景下,模型单次通读即标出1284条相关条款,一小时内完成通常需一周的审查工作;结构工程师场景下,仅凭图纸便在浏览器中还原30层写字楼抗震结构模型;体育(884258)数据分析师场景下,数十分钟内将每名球员约8400个攻防回合解析为战术画像与教练报告。
在量化策略构建中,Qwen3.8-Max从动量、价值、质量等6个方向出发,同时调度约330个子智能体并行跑完约6000次历史回测,入选因子Sharpe达到0.64–1.48,IC一致为正介于0.010–0.014。
长程任务方面,Qwen3.8-Max独立完成GCD/RSA密码硬件加速器设计,历经约500轮交互、71次评估、13个关键里程碑,将设计从8298门优化至678门。在模拟365天电商经营的E-Commerce Bench中,模型以 416,252总现金胜出,比第二名高出38%,相较上一代旗舰模型提升152%。
多模态智能体方面,Qwen3.8-Max可处理超200页财报、超100小时长视频等海量信息,并能将素材转化为Vlog、教学动画、前端项目、3D装修效果等可交付成果。模型还具备混合智能体能力,在RecreationBench基准上展现前沿水准。此外,团队推出Qwen-MM-Plugins多模态扩展库,让不同Agent框架直接获得图像处理、视频剪辑、3D建模等视觉能力。
原文:Qwen3.8-Max:编程与办公,全面跃升(来源:千问大模型)
