Qwen3.8-27B开源当天即完成端侧适配 后摩智能M50实现Day 0部署

2026-08-15 00:30:15
来源:AI观察
分享
AIME

问财摘要

1、阿里巴巴通义实验室开源Qwen3.8-27B,后摩智能完成该模型在后摩漫界M50芯片上的深度适配,实现Day 0部署。开发者通过后摩大道工具链,即可在M50上完成从量化编译到推理部署的全流程,将Qwen3.8-27B以单M50或双M50方案运行于端侧设备。 2、Qwen3.8-27B是原生多模态稠密模型,支持262K原生上下文,通过YaRN技术可外推至1M Tokens上下文。 3、在端侧部署方面,Qwen3.8-27B的4-bit量化版约占17GB,M50单芯片功耗仅10至15W,双芯片功耗不到30W,一个移动电源即可为运行该模型的端侧设备供电,在本地跑通千问目前最强的开源27B模型。 4、后摩大道工具链覆盖从模型量化到编译再到推理服务的全链路。
免责声明 内容由AI生成
文章提及标的

据后摩智能消息,8月14日晚,阿里巴巴(BABA)通义实验室正式开源Qwen3.8-27B,后摩智能同步完成该模型在后摩漫界M50芯片上的深度适配,将27B级别大模型的端侧部署时效性首次推到Day 0。开发者通过后摩大道工具链,即可在M50上完成从量化编译到推理部署的全流程,将Qwen3.8-27B以单M50或双M50方案运行于端侧设备。

Qwen3.8-27B是原生多模态稠密模型,支持262K原生上下文,通过YaRN技术可外推至1M Tokens上下文。较Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现超越了Qwen3.7-Plus;同时新增reasoning_effort功能,可根据任务难度控制思考深度,更省资源。该模型也具备Qwen3.8系列的共性,能够端到端完成复杂任务,直接交付可靠成果。

在端侧部署方面,Qwen3.8-27B的4-bit量化版约占17GB,M50单芯片功耗仅10至15W,双芯片功耗不到30W,一个移动电源即可为运行该模型的端侧设备供电,在本地跑通千问目前最强的开源27B模型。

Day 0适配的实现得益于后摩大道工具链以模型架构为单位的适配策略。同一架构的模型共享相同的ONNX导出图,量化编译流程可直接复用。Qwen3.8-27B与后摩智能已支持的Qwen3.6系列共享底层架构,模型权重发布后无需重新做底层适配,直接进入量化编译阶段。在生态层面,后摩大道工具链已内置Qwen系列的完整算子优化,支持PyTorch、vLLM等主流框架;编译产物可通过llama.cpp、vLLM、SGLang等推理引擎部署为标准化API服务,与OpenClaw等Agent框架无缝对接。搭载M50芯片的量产终端设备同步支持Qwen3.8-27B本地推理。

后摩大道工具链覆盖从模型量化到编译再到推理服务的全链路。部署流程包括:从后摩开发者社区下载工具链资源包,从Hugging Face或ModelScope获取模型权重;采用GPTQ后训练量化方案进行逐层量化,将FP16权重压缩为4-bit,并通过余弦相似度校验确保精度无偏差;编译阶段将量化后的模型转化为M50可执行的HMM文件,支持单芯片或双芯片部署,编译时上下文窗口设为32K以优化速度,M50实际可支持更大窗口;编译完成后在M50设备上进行推理测试;最后可将编译产物转换为GGUF格式,通过llama-server部署为生产推理服务,并通过OpenAI兼容API接入Agent框架,实现从模型推理到业务落地的完整闭环。

原文:Day 0 支持丨后摩智能M50完成Qwen3.8-27B大模型适配(来源:后摩智能)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME