GLM-5.3-Flash(Ox-Alpha):
定价为GLM-5.3的1/10,是GLM-5系列的首个原生多模态模型。
跑在国产芯片上:过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。
为克服单张芯片算力与内存容量相对有限的问题,我们在SGLang 基础上构建了专用的推理引擎。值得一提的是,整个构建工作由GLM-5.3驱动的infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。
这些芯片主要瓶颈在于内存容量与带宽,尤其是支持长达1M上下文长度很有挑战。这要求我们针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。我们的技术栈结合了用于线性注意力和LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化,以及Layer Split等技术。
在集群层面,我们采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。
与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。
mp.weixin.qq.com