GLM-5.1高速版API发布:旗舰模型实现全球最快400 tokens/s输出速度

2026-05-22 09:59:30
来源:AI观察
分享
文章提及标的

智谱(HK2513)消息,智谱(HK2513)AI今日面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,其模型输出速度达到每秒400个token,刷新了当前全球大模型厂商API的速度上限。该版本首次在国产大模型中,将旗舰级模型能力与极致低延迟同时带入生产环境,无需为响应速度牺牲模型质量。

GLM-5.1高速版在完整保留GLM-5.1能力的基础上,实现了“即问即答”的响应速度,显著提升了AI编程、实时交互等高延迟敏感场景的体验。在长程任务中,该模型能在30秒内完成复杂网页生成;在Agent Swarm场景中,可瞬间调度50个不同人格并行回答。

速度提升带来了全新的应用体感和可能性。在实测中,模型写代码如同开启10倍速,能一边理解工程上下文一边持续生成代码与修改方案;在实时3D场景构建中,可根据文字输入瞬时建模,实现此前因延迟而无法实现的产品形态;它还能在用户提出需求的瞬间生成匹配的工具与交互,展现出新型操作系统的雏形。

GLM-5.1高速版的速度突破得益于其背后的TileRT高性能推理引擎。该引擎由智谱(HK2513)GLM团队与TileRT团队联合打造,在推理引擎、调度系统与底层基础设施三个层面进行了系统级优化:

1. 推理引擎层:针对GLM-5.1的架构特点重写了核心推理路径,提升了单卡吞吐能力。

2. 调度系统层:通过动态批处理、请求合并和KV缓存调度优化,显著降低高并发场景下的尾延迟。

3. 基础设施层:围绕推理集群部署、网络链路、负载均衡进行协同优化,确保400 TPS是稳定可用的生产级能力。

GLM-5.1高速版适用于AI编程、实时交互、商业决策、实时语音等对响应延迟要求极高的场景,现已面向智谱(HK2513)MaaS平台部分企业客户开放服务。智谱(HK2513)AI表示将持续推进推理引擎的工程优化,进一步扩大高速模型的服务能力。

原文:GLM-5.1高速版:400 tokens/s,顶尖模型跑出最快速度(来源:智谱(HK2513)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME