同一个模型,官方说 1/40,有人喊 1/100

Hello,我是飞飞。
智谱今天放了个哑谜。
同一个 GLM-5.3-Flash,官方博客说价格是 Opus 4.8 的 1/40,我朋友圈那位转发的大佬又喊 1/100。两个数差着 2.5 倍,总有一个在糊弄我。
先说一个更早的伏笔。我写 GLM-5.2 那篇的时候,官方写得很提气,说发布首日就能在国产算力上跑,还有一幕真机调试闭环。我当时的判断是,这些全是官方说法,第三方还没核实过,我不敢拿没人复现的数字下结论。今天这个 GLM-5.3-Flash,恰恰把「国产芯片跑大规模」亮在了台面上。那我这篇,就把这笔账对一遍。
三个价,谁是真的
三个数字,其实都是真的,只是比的不是一个东西。
官网那个 1/40,是跟 Opus 4.8 比,按「每跑一个任务」算的。促销价约 0.045 美元一个任务,Opus 差不多 1.8 美元,正好 40 倍。这是最抓眼球的一句,也是官方最先喊的。
但你去查标准 API 价,没那么夸张。输入 0.15 美元、输出 0.5 美元每百万 token,是 GLM-5.3 的 1/10,促销期内再打 5 折,才是 1/20 那个数。
那位大佬喊的 1/100,也不算错,只是换了套比法。多半是拿标准价去跟某个旗舰按输出计费、或者让它把思考拉满的场景比,口径一换,数字就变。
写给你,我列张表,你对着自己的用量看:
| 这个价 | 比的是谁 | 按什么算 |
|---|---|---|
| 1/40 | Opus 4.8 | 每任务,促销价 |
| 1/10 | GLM-5.3 | 每百万 token,标准价 |
| 1/100 | 更贵的旗舰 | 输出计费 / 思考拉满 |
一句说人话:价格屠夫的数,全看它跟谁比、按哪种口径、含不含折扣。你要真开票,别听 1/40 还是 1/100,自己拿输入输出价乘以你的用量,那才是你的账。
追平 Opus,先打个折
「追平 Opus 4.8」这句看着提气,但得打个折。
官方那个 57 分,是 AA 智能指数,说人话就是一份第三方给各家模型排智商的表,57 是跟 Opus 4.8 持平的第一梯队。这块我信,因为它是独立机构测的。
但要打动我这种开发者,单看智商分没用,得看它能不能替你干活。编程、智能体相关的几个硬数:Terminal-Bench 2.1 得 84.3,DeepSWE 63.4。还有个智谱自家 Z.ai Code Bench,说 Flash 最高档 29.0 分,Opus 4.8 是 29.5,就差半个点。
这里我必须停下来说实话。这个 29.0,是智谱用自己的 Z.ai Code Bench、在 Claude Code 那套外壳里跑的,自家出卷自家考。更关键是它没跟你说代价:Flash 冲到 29.0 分,一次要烧将近 14 万 token;同一个榜,GLM-5.3 本体是 34.5 分,输出还更短。
所以「追平 Opus」这话,准确的说法是,它在一个自家出的、能拼到接近的分上,用的是海量 token 换的。跑分高,跟顺手,是两码事。我天天拿模型改真实仓库的。看到「一个任务烧 14 万 token」,我先皱眉头。我盯的是产出,不是分。
我早年也犯过只看单价的毛病。后来自己算了一笔账:一个 agent 挂一晚上跑,token 消耗是我一年前手动打字时的 50 到 100 倍。真正让账单变贵的,其实是你用它的强度,单价标多少反而次要。所以这台 Flash 单看价格是 1/40,可要是它每个任务都烧 14 万 token,那个便宜不一定落到你账上。这也是为什么我说,别光听 1/40,先看看你自己打算怎么用它。
还有一件事得说清。320B 的权重,FP8 光权重就 300 多 G,压到 8 bit 也在 300G 上下,你没那个显存,本地压根跑不动,只能走 API。所以它再便宜再开源,对绝大多数人来说是一堆数字,你真正用的是云上那个端点。
国产芯片,这次是真的
我写 GLM-5.2 时最嘀咕的就是这句,这次它把一切落了地。
过去一周,那个匿名模型 Ox-Alpha 的全部流量,由国产芯片集群承载。数万张国产加速卡,自研高带宽互联。智谱在 SGLang 基础上,给国产芯片专门搭了套推理引擎,把预处理、预填充、生成拆成独立的工作池,再配量化,最后端到端性能比基线提升了 3 倍,单 token 成本做到跟主流英伟达 GPU 一个水平。摩尔线程的 MTT S5000 当天就完成了适配。
说人话就是:国产「芯片、框架、模型、应用」这条全栈,第一次在一个前沿模型的大规模场景里,自己把自己跑通了。这不是口号。从硬件到软件到模型,全归它自己,中间没有一道绕不开的英伟达。
我同样得诚实。这套工程细节官方和第三方都写了,但有没有宣传里那么丝滑,我没亲手跑一遍。那个「3 倍」「追平英伟达」的具体弹性,我标成官方口径,我没复现,不替它担保。
到底该不该换
回到我自己。
我其实早就在用国产模型了。我那套知识库大脑的对话就走 DeepSeek,embedding 走火山方舟,每天在跑。但那是替它顶活,家我可没搬,我真正不离手的主力还是 Opus。每次动用前,我心里先过一杆秤:这活错一点会不会返工,我一天要跑多少次,单价多少。我对国产开源模型的态度,一直是一句,它顶得了「活」,顶不了「底座」。
那 GLM-5.3-Flash 这种「对标 Opus、1/40 价」的,最该接的是高频、量大、但对质量不那么苛刻的活。比如把一个陌生的大仓库整个喂进去做初步梳理,把模块关系理清;比如大段日志、长文档先过一遍,把重点捞出来。这类活一天跑几十上百次,用 Opus 顶档纯属烧钱,交给它又便宜又懂代码,账一下就平了。
这里有个大多数人都忽略的坑。国内那些 Agent 外壳,早期大半是照着 Claude 优化出来的开源实现,你直接把国产模型换上去,工具调用协议、出错恢复都对不上,效果先打个折。智谱这次把 GLM-5.3-Flash 接进自己 ZCode 那套,模型和外壳同门对齐,才是它落地顺手的分水岭。所以不是换一个 API key 就完事,得看你的工具吃不吃这一套。
写稿、润色、关键重构这种错一步就得返工的,我暂时一个都不动。它行不行还两说,是我还没拿它在我那条跑了两百多篇的流水线上连跑一周验证过。我宁可让便宜模型在我手里干点重活试试水,也不想拿核心的活去赌。
我前阵子拿模型把一个七千行的 SpringBoot 老项目整库翻成 Kotlin,最磨人的是它上下文不够,得手动切文件一段段喂,切着切着它把我前面改过的字段忘了,回头又改坏一处。这种错一步就得返工整片仓库的活,我宁愿多花点钱让顶级模型一次吃进去,也不想为了省那口 token,拿一个晚上去擦它弄乱的 git 历史。
更别说真要换底座。光把我那十几个 skill 的描述重写到不误触发、把那套防 AI 味的 grep 规则对准新模型的写字口癖,一周两周下不来。模型能换,底座搬不动。这也是我一直说的那句,它顶得了「活」,顶不了「底座」。
绕一圈,你觉得最该盯的,其实不是那个 1/40 还是 1/100,是同一个价下面,你打算把哪种活交给它。
你心里那杆秤,最舍不得交给便宜模型的是哪一笔?是写稿,还是让 agent 动你那个仓库?评论区聊聊,我想看看是不是只有我把核心活攥得死死的。