来源:新浪港股
8 月 26 日晚间,智谱官微发布,为收集广大用户的广泛、专业反馈,GLM-5.3-Flash 在正式发布前,以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 上进行了大规模测试。
Ox-Alpha 迅速成为当周最受欢迎的模型,创下双平台调用量新高。
而这些请求流量全部由国产芯片提供算力支持。
" 过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。" 智谱表示。
在集群层面,该公司采用生产级 Encode – Prefill – Decode 分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。" 与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。
这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。" 智谱称。