关于ZAKER Skills 合作
全天候科技 3小时前

智谱新模型“牛来”跑在 10 万国产卡上,SemiAnalaysis 评价“英伟达护城河再受考验”

8 月 26 日,智谱正式确认:此前在开发者社区引发热议的匿名模型 Ox Alpha(中文社区称 " 牛来 "),就是其最新发布的 GLM-5.3-Flash。模型代号灵感来源于国内近期热映电影《牛来》。

这个模型在正式亮相前,以匿名形式在 OpenRouter 和 OpenCode 上免费开放测试,5 天内流量累计超过 50 万亿 token,刷新了两个平台的流量增长纪录,当前使用量已超过 DeepSeek 的两倍以上。但真正引发市场关注的,是智谱随后披露的一个细节:这些流量,全部由国产芯片承载。

智谱在官方技术文档中表示,调用超过 10 万张国产芯片集群用于该模型推理服务," 硬件效率及单 token 成本已经达到了与主流英伟达 GPU 相当的水平 "。

半导体研究机构 SemiAnalysis 随即在 X 平台发文评论:"所有流量均由国产芯片承载,硬件效率和单 token 成本已可与英伟达 GPU 相媲美。继 Jalape o(OpenAI 自研推理芯片)昨日宣布之后,CUDA 护城河再度受到考验。"

10 万张国产卡:从测试到生产

智谱在技术文档中描述了这套国产芯片集群的部署细节。

单张芯片的主要瓶颈在于内存容量与带宽,支持长达 100 万 token 的上下文长度尤为困难。为此,智谱在 SGLang 基础上构建了专用推理引擎,采用 W8A8 量化、INT8/FP8/BF16 混合缓存量化,以及节点内张量并行等技术,并引入生产级 Encode – Prefill – Decode(EPD)分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度的工作池。

智谱称,与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍。

据《晚点 LatePost》了解,这批芯片的供应商或来自华为、摩尔线程与海光。智谱官方对此未予置评,技术文档中也未明确具体芯片型号。

SemiAnalysis 在评论中特别指出,此前有观点认为只有顶级前沿实验室才具备每日 100 万亿 token 的算力规模," 而这里每日 100 万亿 token 的免费流量,全部跑在国产芯片上。"

模型本身:对标 DeepSeek,定价是 Claude Opus 4.8 的 1/40

GLM-5.3-Flash 的参数规模为 320B 总参数,激活参数 18B,参数量约为上一代旗舰 GLM-5.3 的 40%,与 DeepSeek V4 Flash 几乎持平。

性能方面,智谱官方评测显示,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 57 分,超过上一代旗舰 GLM-5.2,与 Anthropic 的 Claude Opus 4.8 持平,也高于 DeepSeek 旗舰模型 V4 Pro 正式版的 53 分。

定价方面,GLM-5.3-Flash 每百万 token 输入 0.8 元,输出 2.8 元,缓存命中价格 0.23 元,为 GLM-5.3 的十分之一。上线前两周实行半价。

智谱表示,GLM-5.3-Flash 定价为 GLM-5.3 的 1/10,限时折扣内为 GLM-5.3 的 1/20,为 Claude Opus 4.8 的 1/40。

与调价后的 DeepSeek V4 Flash 相比(谷时输入 1.5 元、输出 4.5 元),GLM-5.3-Flash 在绝大多数常规调用场景下更便宜。

架构创新:激活参数和层数近乎减半

GLM-5.3-Flash 采用了与 GLM-5.3 完全不同的架构设计,这也是其能够以更低成本实现更高性能的核心原因。

与 GLM-4.5 相比,GLM-5.3-Flash 总参数量相近(355B vs. 320B),但激活参数量从 32B 降至 18B,层数从 92 层减至 45 层,几乎减半。

智谱称,GLM-5.3-Flash 是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。相较于 GLM-5.3,其注意力计算量与 KV 缓存大小分别降低了 3.01 倍和 4.44 倍。

此外,该模型是 GLM-5 系列首个原生多模态模型,支持图像和视频输入,也是智谱战略聚焦 coding 以来首次推出具备多模态能力的新模型。

涨价潮中的低价突围

GLM-5.3-Flash 的发布,发生在中国 AI 模型市场一轮集体涨价之后。

Kimi K3 输出价格高达每百万 token 100 元,超过前代 K2.6 三倍以上;智谱上半年提价后输出价格也达到 28 元;DeepSeek V4 Pro 从 6 元涨至 13.5 元,高峰时段 27 元;DeepSeek V4 Flash 输出价格从 2 元涨至 4.5 元,高峰时段 9 元。

涨价的直接后果是需求外溢。《晚点 LatePost》指出,DeepSeek V4 Flash 提价后,在 OpenCode 平台上的调用量下滑了一半,这部分需求成为国产模型厂商新的增长空间。

GLM-5.3-Flash 的定价策略,正是瞄准了这一缺口。

相关标签
全天候科技

全天候科技

提供专业快速完整的科技商业资讯

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容