关于ZAKER Skills 合作
钛媒体 40分钟前

GLM-5.3-Flash 发布,多模态终于来了

不久前,在 OpenCode 和 OpenRouter 上进行了出现了一个名为 Ox-Alpha(中文社区称作牛来)的模型,并迅速成为当周最受欢迎的模型。而就在近日,智谱 AI 出面认领了这个中文名为 " 牛来 " 的模型,就是其最新发布的 GLM-5.3-Flash。值得注意的是,GLM-5.3-Flash 是 GLM-5 系列的首个原生多模态模型。

重新定义模型 " 斩杀线 "

Ox-Alpha 上线首日即冲至 OpenRouter 榜首,并刷新单日 tokens 用量历史纪录,相较 OpenRouter 平台之前最大 tokens 量提升 4 倍。

能力强只是 GLM-5.3-Flash 最不值得一提的一个环节,GLM-5.3-Flash 带来的惊喜之一就是将模型的价格 " 打下来 "。原先,大模型有着参数越大、能力越强、价格越贵的定律,OpenAI 的 GPT-4 系列、Anthropic 的 Claude Opus 系列,无不遵循这一定律。就连智谱自己的 GLM-5.3,上半年提价后输出价格也达到了 28 元。

GLM-5.3-Flash 的出现,打破了这条曲线。GLM-5.3 Flash 的 Artificial Analysis Intelligence 分数为 57 分,超过了上一代旗舰模型 GLM-5.2,也高于 DeepSeek 旗舰模型 V4 Pro 正式版的 53 分。在 Artificial Analysis Intelligence Index 的公开榜单上,GLM-5.3-Flash 的 57 分 " 远高于同类模型的中间值(18 分)"。

而就是这种比肩主流闭源模型的能力,其价格主流模型的四十分之一。官方数据显示,GLM-5.3-Flash 每百万 Token 输入 0.8 元、输出 2.8 元、缓存命中价格 0.23 元。横向对比调价后的 DeepSeek V4 Flash ——其谷时价格分别为输入 1.5 元、输出 4.5 元。综合输入和输出成本,GLM-5.3-Flash 在绝大多数常规调用场景下比 DeepSeek V4 Flash 更便宜。

而对比 Claude Opus 4.8,差距更加悬殊。按当时汇率折算,Opus 4.8 每百万 Token 输入约 35 元、输出约 175 元。GLM-5.3-Flash 的价格仅为对方的四十分之一左右。

" 同样智力,1/40 价格,前沿智能,第一次不需要省着用。" 智谱在发布公告中这样写道。

8 月,DeepSeek V4 Flash 已经完成了一轮提价。涨价说明市场有强劲需求——也说明 " 便宜 " 这件事,在商业上不可持续太久。而智谱在 GLM-5.3-Flash 上选择的路径恰恰相反:用更低的成本结构,支撑更低的价格,同时不牺牲模型能力。这不再是一个单纯的市场营销动作,而是一次工程能力的验证。

多模态终于来了

此前,智谱首席科学家唐杰在社交平台上发起全球意见征集,为 GLM-5.3 收集功能建议,浏览量超过 40 万。评论区被一个词刷屏了:视觉。

GLM-5.3-Flash 是 GLM-5 系列的首个原生多模态模型。视觉编码(Visual Coding)并不只是处理图像,它拓展编程所能触及的边界。对于前端开发、游戏开发、3D 仿真等任务而言,最终产物包括用户能够感知的界面、交互或虚拟世界,视觉能力被原生集成进模型中,使其能够自主判断何时需要 " 观察 ",并利用视觉反馈来指导下一步行动。

GLM-5.3-Flash 的多模态能力,最直接的落点是 Coding。

传统编程模型的工作方式是:你给它需求,它输出代码,然后你拿去跑、去看效果、发现问题、再把问题喂回给它。这是一个 " 人 " 在闭环里当裁判的流程。GLM-5.3-Flash 把裁判也交给了模型自己——视觉能力被原生融入 Coding 循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。

这意味着什么?模型写完前端代码,可以自己 " 看 " 一下渲染出来的页面长什么样;做完一个游戏功能,可以自己 " 玩 " 一下看看有没有 bug;搭完一个 3D 场景,可以自己 " 转 " 一圈检查各个视角是否协调。

智谱针对视觉编码开发了专门的数据合成流水线,重点训练模型的自我视觉判断与测试时改进能力。最终生成的轨迹要求模型与环境交互、检视自身输出,并进行迭代式改进。这不再是 " 生成代码 " 的单向输出,而是一个 " 生成 - 观察 - 修正 " 的闭环。

智谱官方展示:GLM-5.3-Flash 在 Blender 中自主运行了 16 个小时,没有任何外部素材,从零搭建了一套约 400 平方米的专业主厨自宅与测试厨房。

这个任务远不止 " 写代码 " 那么简单。在 Blender 中构建一个连贯的 3D 场景,需要把几何、材质、光照与空间等知识转化为一个在不同视角下都保持一致的 3D 结构。模型需要判断什么时候该 " 看一眼 " 渲染结果,再用看到的结果决定下一步该做什么。它要自己决定墙怎么砌、光怎么打、厨房动线怎么规划——然后看到效果,再调整,再看到效果,再调整。16 个小时,一个模型在虚拟世界里当了一次建筑师兼室内设计师兼施工队。

另一个官方展示的案例是复刻游戏《泰拉瑞亚》。从图像到可运行工程,从两小时电影到 8 分钟成片,这些实测合集展示的,是一个不仅能写代码、还能 " 看懂 " 自己写了什么的模型。

跑在国产卡上

GLM-5.3-Flash 最不寻常的地方,或许不在模型本身,而在它跑在什么上面。

过去一周,智谱首次尝试用一个大规目国产芯片集群,直接承载来自全球开发者的真实线上负载。据了解,官方没有确认具体供应商,也没有公布具体芯片数量,但据某些媒体报道,其调用超过 10 万张国产芯片,算力供应商或来自华为、摩尔线程与海光,有知情人士透露,训练或由海光 DCU 等国产芯片支持。

但可以确认的是:Ox-Alpha 在 OpenCode 和 OpenRouter 上的所有请求流量,全部由国产芯片提供算力支持。这是一次真实的、持续的压力测试——不是在实验室里跑几个峰值数据,而是让全球开发者用脚投票。用户不知道模型背后是谁、用的是什么芯片,只根据速度、稳定性和效果决定是否继续调用。

结果,Ox-Alpha 成了当周最受欢迎的两个平台上的调用冠军。

国产芯片跑前沿大模型,这件事本身就很有挑战性。单张国产芯片当前面对的主要瓶颈是内存容量和带宽,而 GLM-5.3-Flash 又原生支持最长 1M 上下文,对显存和通信提出了更高要求。

智谱的解法是在 SGLang 基础上构建专用推理引擎,并做了一系列激进的内存优化。包括节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化以及 Layer Split 等技术。核心思路是 " 以算力换带宽、以通信换显存 " ——用国产芯片相对充裕的算力,去弥补内存上的短板。

在集群层面,智谱采用了 Encode-Prefill-Decode(EPD)分离式架构。多模态编码、Prompt 预填充和逐 Token 解码被拆分为三个可以独立调度和扩缩容的工作池,让不同阶段按照各自的算力特征运行。

这套方案的效果是:与同一批硬件上的初始基线相比,端到端服务性能提升了 3 倍。智谱称,最终硬件效率和单 Token 成本已经达到与主流英伟达 GPU 相当的水平。

这里需要做一个重要区分。所谓 "1/40",并不是说国产芯片的硬件推理成本只有海外 GPU 的 1/40。目前并没有公开数据支持这样的比较。更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了 Claude Opus 4.8 的大约 1/40。

但这已经足够说明问题。国产芯片不仅可以跑前沿大模型,而且可以在大规模真实流量下跑得稳定、跑得经济。

更值得关注的是智谱形成的一个正向循环。整个推理引擎的构建工作,由 GLM-5.3 驱动的 infra agent 大大加速——它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈。" 模型优化系统,系统承载模型 ",这句话不再是一个愿景,而是已经跑通的现实。

过去一年,中国大模型公司一直在做两件事:把模型能力往前推,把推理成本往下压。GLM-5.3-Flash 在这两个方向上都迈出了一步——用更少的参数激活、更低的计算量、更高效的注意力机制,实现了与 Claude Opus 4.8 持平的综合智能评分;然后用国产芯片集群承接大规模真实流量,把价格压到了对方的四十分之一。

这不再是一个 " 追赶 " 的故事。当一款开源、原生多模态、全部跑在国产芯片上的模型,在第三方综合评测中与全球最受欢迎的闭源旗舰得分持平,而价格只有对方的四十分之一——行业竞争的规则,正在被重新书写。

GLM-5.3-Flash 的模型权重已通过 MIT 许可证在 Hugging Face 等平台开源,API 同步开放。任何人都可以下载、使用、二次开发。(本文首发于钛媒体 APP,文|Leo 张 ToB 杂谈,作者|张申宇,编辑丨盖虹达)

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容