据后摩智能消息,8月14日晚,阿里巴巴(BABA)通义实验室正式开源Qwen3.8-27B,后摩智能同步完成该模型在后摩漫界M50芯片上的深度适配,将27B级别大模型的端侧部署时效性首次推到Day 0。开发者通过后摩大道工具链,即可在M50上完成从量化编译到推理部署的全流程,将Qwen3.8-27B以单M50或双M50方案运行于端侧设备。
Qwen3.8-27B是原生多模态稠密模型,支持262K原生上下文,通过YaRN技术可外推至1M Tokens上下文。较Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现超越了Qwen3.7-Plus;同时新增reasoning_effort功能,可根据任务难度控制思考深度,更省资源。该模型也具备Qwen3.8系列的共性,能够端到端完成复杂任务,直接交付可靠成果。
在端侧部署方面,Qwen3.8-27B的4-bit量化版约占17GB,M50单芯片功耗仅10至15W,双芯片功耗不到30W,一个移动电源即可为运行该模型的端侧设备供电,在本地跑通千问目前最强的开源27B模型。
Day 0适配的实现得益于后摩大道工具链以模型架构为单位的适配策略。同一架构的模型共享相同的ONNX导出图,量化编译流程可直接复用。Qwen3.8-27B与后摩智能已支持的Qwen3.6系列共享底层架构,模型权重发布后无需重新做底层适配,直接进入量化编译阶段。在生态层面,后摩大道工具链已内置Qwen系列的完整算子优化,支持PyTorch、vLLM等主流框架;编译产物可通过llama.cpp、vLLM、SGLang等推理引擎部署为标准化API服务,与OpenClaw等Agent框架无缝对接。搭载M50芯片的量产终端设备同步支持Qwen3.8-27B本地推理。
后摩大道工具链覆盖从模型量化到编译再到推理服务的全链路。部署流程包括:从后摩开发者社区下载工具链资源包,从Hugging Face或ModelScope获取模型权重;采用GPTQ后训练量化方案进行逐层量化,将FP16权重压缩为4-bit,并通过余弦相似度校验确保精度无偏差;编译阶段将量化后的模型转化为M50可执行的HMM文件,支持单芯片或双芯片部署,编译时上下文窗口设为32K以优化速度,M50实际可支持更大窗口;编译完成后在M50设备上进行推理测试;最后可将编译产物转换为GGUF格式,通过llama-server部署为生产推理服务,并通过OpenAI兼容API接入Agent框架,实现从模型推理到业务落地的完整闭环。
原文:Day 0 支持丨后摩智能M50完成Qwen3.8-27B大模型适配(来源:后摩智能)
