据趋境科技消息,近日,趋境科技技术专家做客vLLM Office Hours全球直播间,分享了Mooncake与vLLM/llm-d在大规模AI Serving场景中的技术集成与生态协作。Mooncake作为面向分布式推理的高性能通信与存储基础设施,已与vLLM/llm-d在Prefill-Decode解耦、分布式KV Cache、多模态推理及投机推理训练等关键场景完成深度集成,并在生产环境中实现日均处理超1万亿Token的规模化验证。
vLLM社区近期动态
Red Hat AI资深首席工程师、vLLM核心维护者Michael Goin介绍了vLLM的最新进展。vLLM持续拓展模型支持与推理优化能力,v0.26版本共包含来自212位贡献者的411项提交。新版本新增对Kimi K3、Inkling Small、MiniMax H3等模型的支持,并在Attention/FFN优化、KV Cache管理增强及硬件支持扩展等方面取得进展。
Mooncake的核心架构与实践
Mooncake核心贡献者杨珂指出,随着LLM服务规模增长,计算节点间的数据传输效率、KV Cache跨节点管理与复用成为决定推理效率的关键。Mooncake通过高性能通信与分布式存储,为分布式推理提供高效的数据传输与KV Cache共享,并将通信、存储与缓存管理解耦,为大规模系统提供灵活、可扩展的基础设施支撑。在实际应用中,Mooncake作为Kimi背后的推理基础设施之一,已支持超过80%的Kimi流量;在趋境科技的生产环境中,其为旗舰级万亿参数开放权重模型提供底层支撑,日均处理Token数超过1万亿。
Mooncake与vLLM/llm-d的深度集成
自2024年12月起,Mooncake与vLLM生态展开合作,目前在多个关键场景形成深度集成:
在Prefill-Decode解耦推理场景中,Mooncake提供高性能KV Cache跨节点传输能力,使Prefill与Decode阶段可独立部署与扩展;
在分布式KV Cache场景中,Mooncake Store支持跨实例缓存共享与复用;
在多模态推理场景中,Mooncake可作为vLLM-Omni不同推理阶段之间的数据传输层;
在投机推理训练场景中,Mooncake通过RDMA在vLLM节点与Speculators之间高效传输hidden state。
基于vLLM KVConnector接口,Mooncake实现了两类核心能力:MooncakeConnector基于Mooncake Transfer Engine,借助GPUDirect RDMA等技术实现GPU与远端节点间的直接数据传输,并利用单机多网卡资源提升跨节点通信带宽;MooncakeStoreConnector构建了可跨实例共享的KV Cache池,通过将KV Cache卸载至CPU内存或磁盘,突破单卡HBM容量限制,并结合哈希去重与前缀缓存机制,提升缓存命中率和资源利用效率。
llm-d与Mooncake的协同
Red Hat AI资深机器学习工程师、llm-d核心贡献者Greg Pereira介绍了llm-d作为Kubernetes原生的分布式LLM推理框架,通过模块化架构整合智能路由、KV Cache管理、Prefill-Decode解耦等能力。在与Mooncake的协同中,llm-d通过智能Router根据请求特征进行调度,结合Mooncake Transfer Engine实现跨节点KV Cache高效传输,使Prefill与Decode阶段可分别部署、独立调度,进一步提升GPU资源利用率和系统弹性,满足复杂Agent工作负载对长上下文缓存复用和低延迟响应的需求。
通过此次全球直播,趋境科技进一步展示了Mooncake在高性能通信、分布式KV Cache以及解耦式推理基础设施等方向的技术探索与实践成果。未来,趋境科技将继续深化与全球开源社区的协作,推动高性能、低成本、可扩展的大模型Serving技术发展。
原文:趋境科技做客 vLLM 直播间,分享 Mooncake 与 vLLM/llm-d 的技术集成与生态协作(来源:趋境科技)
