智谱发布GLM-5.3-Flash原生多模态模型,商汤国产算力支撑上线
8月26日,智谱上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,AA指数57分,与Claude Opus 4.8持平。商汤大装置提供国产算力支持,端到端性能提升3倍,Token成本比肩英伟达GPU,标志着国产算力规模化商用新突破。
8月26日晚间,智谱正式推出并开源了GLM-5.3-Flash(320B-A18B),作为GLM-5系列的首个原生多模态模型,该模型总参数规模达320B,性能超越前代GLM-5.2。在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)评测中,GLM-5.3-Flash取得57分,与Anthropic旗下热门模型Claude Opus 4.8持平,跻身全球前沿模型能力区间。
该模型架构专为极低推理成本设计,结合智谱最新30T Token多模态预训练语料,能以更少计算资源实现更强性能。商汤大装置依托国产异构混推技术,为GLM-5.3-Flash上线提供大规模国产算力支持与Token服务,成为国产算力规模化商用的又一标杆案例。
商汤方面介绍,其核心能力体系为“一套模型、一座Token工厂、一套智能体管控系统”。Token工厂通过多模态模型与大装置基础设施联合优化,整合不同芯片、集群、能源及交付节点,持续生产高质量、低成本Token,并与大模型形成双向反哺闭环,适配原生多模态模型迭代需求。
在正式发布前,GLM-5.3-Flash以匿名模型Ox-Alpha(中文社区称“牛来”)在OpenCode和OpenRouter上进行大规模测试,Token调用量达62T,全部由国产芯片提供算力。相较同一硬件环境初始基线,基于国产芯片集群的端到端服务性能提升3倍,硬件效率和单Token成本已达到主流英伟达GPU相当水平。
这一实践印证国产算力已能在真实业务场景中高效、经济地支撑前沿大模型推理。商汤大装置持续推动国产算力从“单点可用”走向“大规模商用”,通过异构混合推理技术,整体推理性价比达NVIDIA H系列1.25倍,同等成本下Token产能扩大约2.5倍。7月日均Token服务量达2.42万亿,预计2026年底突破日均10万亿。