据智谱(HK2513)消息,智谱(HK2513)AI今日面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,其模型输出速度达到每秒400个token,刷新了当前全球大模型厂商API的速度上限。该版本首次在国产大模型中,将旗舰级模型能力与极致低延迟同时带入生产环境,无需为响应速度牺牲模型质量。
GLM-5.1高速版在完整保留GLM-5.1能力的基础上,实现了“即问即答”的响应速度,显著提升了AI编程、实时交互等高延迟敏感场景的体验。在长程任务中,该模型能在30秒内完成复杂网页生成;在Agent Swarm场景中,可瞬间调度50个不同人格并行回答。
速度提升带来了全新的应用体感和可能性。在实测中,模型写代码如同开启10倍速,能一边理解工程上下文一边持续生成代码与修改方案;在实时3D场景构建中,可根据文字输入瞬时建模,实现此前因延迟而无法实现的产品形态;它还能在用户提出需求的瞬间生成匹配的工具与交互,展现出新型操作系统的雏形。
GLM-5.1高速版的速度突破得益于其背后的TileRT高性能推理引擎。该引擎由智谱(HK2513)GLM团队与TileRT团队联合打造,在推理引擎、调度系统与底层基础设施三个层面进行了系统级优化:
1. 推理引擎层:针对GLM-5.1的架构特点重写了核心推理路径,提升了单卡吞吐能力。
2. 调度系统层:通过动态批处理、请求合并和KV缓存调度优化,显著降低高并发场景下的尾延迟。
3. 基础设施层:围绕推理集群部署、网络链路、负载均衡进行协同优化,确保400 TPS是稳定可用的生产级能力。
GLM-5.1高速版适用于AI编程、实时交互、商业决策、实时语音等对响应延迟要求极高的场景,现已面向智谱(HK2513)MaaS平台部分企业客户开放服务。智谱(HK2513)AI表示将持续推进推理引擎的工程优化,进一步扩大高速模型的服务能力。
