过去一周,AI 开发者圈子里一直在传一个叫"牛来"的神秘模型。没人知道它出自哪家,参数多少,甚至连技术报告都没有。它悄悄爬上 OpenRouter 和 OpenCode 的调用榜首,单日吃掉了 62 万亿 tokens。直到 8 月 26 日晚,智谱发文认领——原来"牛来"就是 GLM-5.3-Flash。
这篇稿子,把这件事从头到尾讲清楚:它为什么强,为什么便宜到离谱,以及普通人现在怎么用上它。
一、"牛来"是谁:一场事先张扬的匿名发布
8 月 20 日前后,一个叫 Ox-Alpha 的模型以匿名身份登陆 OpenRouter。它不披露厂商、不写参数、不发技术报告,纯靠硬实力冲榜。结果很猛:只用了 6 天就处理超过 20 万亿 tokens,登顶当周最受欢迎模型,还顺手刷新了 OpenRouter 和 OpenCode 双平台的历史调用纪录。Stripe 联合创始人 Patrick Collison 在用过之后,公开评价"very impressive"。
这其实是智谱的老套路了。今年春节前,OpenRouter 上也冒出一个性能突出的匿名模型叫 Pony Alpha,被全网竞猜到底是谁家的,最后证实是智谱的 GLM-5。先匿名测榜、让开发者用真实体验投票,再出来认领,这套"盲测营销"正在变成头部模型厂的习惯动作。
8 月 26 日晚,谜底揭晓:Ox-Alpha 就是智谱新发布的 GLM-5.3-Flash(320B-A18B),而且直接开源。它是 GLM-5 系列里第一个原生多模态模型,意味着视觉能力不是外挂一个视觉编码器,而是长在模型本体里。
二、它强在哪:和 Claude Opus 4.8 站到了同一档

判断一个大模型强不强,最常被引用的第三方榜单是 Artificial Analysis 的 Intelligence Index。GLM-5.3-Flash 拿到了 57 分,这个数字的意义在于,它和 Anthropic 最受欢迎的 Claude Opus 4.8 得分持平,正式进入了全球第一梯队。
更关键的是编程和智能体(Agent)任务,这恰恰是开发者最关心的场景。几个硬指标摆出来:
DeepSWE v1.1(代码生成 / SWE 任务):63.4,而上一代 GLM-5.2 只有 46.2;
AutomationBench(自动化智能体):48.8,GLM-5.2 是 26.2;
Terminal-Bench 2.1(终端操作):84.3;
在智谱自研的 Z.ai Code Bench v1.0(跑在 Claude Code 2.1.207 上)里,最高档努力下 GLM-5.3-Flash 拿到 29.0,Opus 4.8 是 29.5,几乎贴脸。
换句话说,它全面超过了参数量多出整整一倍的 GLM-5.2,并且在编程这条最难、也最值钱的赛道上,追到了和 Opus 4.8 一个身位。
三、为什么敢卖 1/40 的价格:架构层面的"降维"
这才是整件事最值得聊的地方。GLM-5.3-Flash 的定价是:输入 0.15 美元 / 百万 tokens,输出 0.50 美元,命中缓存的输入只要 0.03 美元。对比下来,它是 GLM-5.3 的 1/10,限时折扣阶段能到 1/20,而对照 Opus 4.8,只有它的 1/40。
便宜不是赔本赚吆喝,而是架构真的改了。
它用了 320B 总参数,但每次推理只激活 18B,是典型的 MoE(混合专家)思路。和 GLM-4.5 相比,激活参数从 32B 砍到 18B,层数从 92 层降到 45 层,几乎减半。参数少了,算力就省了。
真正的技术亮点在注意力机制。GLM-5.3-Flash 是第一个把"稀疏注意力 + 线性注意力"混合架构落到开源前沿模型上的。线性注意力用递归状态抓局部依赖,稀疏注意力用一个轻量索引器去捞全局相关的上下文。官方给出的对比是:相比 GLM-5.3,注意力计算量降了 3.01 倍,KV 缓存小了 4.44 倍,换算下来,省掉了大约 67% 的运算量和超过 77% 的显存开销。为了压住百万级上下文下索引器的开销,他们还加了 IndexPool,把四个索引器 key 向量加权 pooling 成一个。
另外两项改动也值得记一笔:mHC(流形约束超连接)用来提升模型的 scaling 能力;预训练语料换成了 30T tokens 的多模态数据,让它在更少算力下吃到更多智能。
四、横向比一下:同价位还有谁
把注意力算力摊开比,GLM-5.3-Flash 在几个同代开源模型里是最省的。智谱给出的对比里,它和 DeepSeek-V4-Flash、Kimi-K3 摆在一起,每 token 注意力算力最低;KV 缓存虽然还略大于这两者,但官方也明说"还有继续优化的空间"。所以如果你是在长上下文、高并发场景下算成本,它目前的性价比位置很靠前。
五、藏在背后的国产算力:10 万张芯片撑起全球顶流
还有一个容易被忽略、但分量很重的细节。GLM-5.3-Flash 在匿名测试期间的所有线上流量,全部由 10 万张国产 AI 芯片承载。这不是小打小闹,而是国产算力芯片第一次在大规模、高并发的真实流量里集体"出海"。
智谱透露,他们用自研的高带宽互联网络把这批芯片连起来,并在 SGLang 基础上搭了一套专用推理引擎。和同一硬件上的初始基线比,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已经摸到主流英伟达 GPU 的水平。换句话说,这件事证明了一件事:国产芯片在大规模场景下,确实能经济、高效地撑住前沿模型的推理。
六、现在怎么用:入口都在这(不涉及任何下载存储)
如果你看完想上手,下面是官方入口,全部导流到对应平台,本文不提供任何安装包或资源下载:
在线聊:chat.z.ai(Z.ai 网页版),或者手机端"智谱清言"App;
接 API:走 Z.ai 官方接口,或者直接在 OpenRouter 上调;
本地部署:权重已经在 Hugging Face 上以 MIT 协议开源,支持 SGLang、vLLM 等框架自己跑;
体验额度:目前每天有万张级别的体验卡放出,新用户可以先白嫖一轮。
它的原生多模态能力特别适合三类活:前端页面开发、游戏和 3D 仿真,以及需要"看图办事"的文档类任务。在金融研报、法律文书这类专业场景里,也有不少人拿它做辅助。
七、谁该现在上,谁可以先观望
该上:做 AI 应用、智能体、代码助手的中小团队;预算敏感、又想要 Opus 4.8 那档能力的个人开发者;想在本地用开源权重搭服务的。
先别急:重度依赖超长多模态上下文、且对 KV 缓存极度敏感的场景,可以等下一轮优化;另外它是 8 月 26 日才开源,生态和周边工具还在补,踩坑概率略高。
尾声:便宜这件事本身,就是壁垒
把"Opus 4.8 同档能力"和"1/40 价格"放在一起看,GLM-5.3-Flash 的意义不只是一时便宜。它把前沿模型的门槛,从大厂和少数团队够得着的地方,砍到了中小团队、甚至个人开发者都摸得到的位置。如果你一直在等一个"能写代码、能跑长任务、账单又不会吓死人"的模型,现在是个不错的入手时机。
