K3 权重真放出来了,可那箱子有 594G,我搬不动

哈喽,我是飞飞。
十天前我写过一篇 K3,当时它刚在前端榜单登顶,朋友圈全是「开源终于翻天」。我扒了半个下午,最后给的判断是四个字:值得关注,不值得动。
那篇结尾我给自己留了一句话,原话是这样的:7/27 开权重之后我可能会去跑一轮真活对照。
今天就是 7 月 27 号。权重昨晚放出来了。
所以这篇要干的事很窄,就是回头验我自己那句话。当时我列了几个条件,说等那天到了才算数。现在到了,我得回来数一数,兑现了几条。
先说结论。让我改主意的,不在我列的那几条兑现了没有,在我当时压根没问的一条。
那天我给自己留了话
先把旧账翻出来,免得你觉得我事后诸葛亮。
那篇里我写得很具体,说 7/27 那天有几件东西才会到位:本地跑测的独立数据、社区在真实业务前端项目上的实测、榜单之外多一两份独立 benchmark。
还有一条我说是我最关心的:K3 能不能塞进 Claude Code 当备用底座跑,就是改一个环境变量把后端换掉。GLM-5.2 那次我在这条路上是走通了的,K3 我当时不确定。
不搬家的理由我也列了四条。订阅补贴那本账、十几个 skill 的迁移成本、K3 只有一档思考力度导致账单没法压、还有权重没开所以没法独立复现。
好了,今天挨条对。
门确实开了
得先承认,Moonshot 这次给得很足,比我预期的足。
放出来的不只是权重。2.8T 总参数、104B 激活的 MoE,896 个专家、每次选 16 个,93 层里 69 层是 KDA 线性注意力、24 层 MLA 交错着排。原生视觉理解,1M token 上下文。技术报告一起挂上了 arXiv。
更实在的是配套。高性能注意力内核开了,MoE 通信库开了,还有个叫 AgentENV 的分布式智能体环境也开了,支持快照、恢复、分支。SGLang 负责推理、Miles 负责强化学习训练,都是发布当天就跟上。
这个规格比很多所谓开源要诚实得多。丢个权重就宣布自己开源的做法见得太多了,这次是把跑起来需要的那一整套都递到你手上。
所以我列的条件里,有一条明确兑现了:权重和技术报告确实到位。
剩下那几条呢?开源才一天。社区在真实业务项目上的实测还没出来,外部独立复现也一样。这怪不着谁,时间不够而已。我那几条本来就该给它更长的窗口。
至于我最关心的那条路,能不能塞进 Claude Code 当备用底座,我查到的说法是它提供 OpenAI 兼容的接口。而我要走的那条路需要的是另一套兼容。这条我还没验,所以老实说:不知道。
可那箱子有 594G
真正让我停住的,是一个我十天前压根没想到要问的数。
权重文件大约 594GB。
我盯着这个数看了一会儿。十天前我写「等开权重跑一轮真活对照」的时候,脑子里那个画面是:权重开了,我下载下来,在自己机器上跑跑看。这个画面从头到尾就没成立过。
我手上是一台 M1 的 Mac。之前跑本地模型,我用 Ollama 挂 gemma4:e4b,上下文开到 32768,一次能吃满就算不错,速度在 20 到 40 token 每秒之间晃。那是个几 GB 的模型。
594GB 是什么概念,你把它跟我那台机器摆一块儿就知道了。这不是慢一点快一点的问题,是它根本装不进来。
再看 SGLang 那份性能数据。单卡 batch-1 解码大约 113 token 每秒,配上投机解码能到 423。听着挺快。可我翻到测试配置那一行,用的是英伟达的 GB300,而且是好几张的规模。
所以「开源了」这三个字,落到我这种人身上,得先拆开看一层。权重公开,跟我能用上,中间隔着一整个机房。
这就是我十天前那句话里的漏洞。我把「开权重」当成了一个我能执行的动作,其实它更像一扇门开了,但门后面那口箱子有 594GB 重,我一个人搬不动。
当然,搬不动也还有别的路。我可以走 API,可以走各家托管。可那样一来,开源这件事对我的意义就变了。它从「我能自己掌握」,退成了「多了几家可以选的供应商」。这两件事差得远。
顺带提一句许可证。这次各家报道对不上,有说是改过的 MIT、允许商用,也有说是 Moonshot 自己那套专有协议。两边都提到年营收超过两千万美元、拿它做付费 API 的要另外谈。我没能力替你下定论,只能给一句实在的建议:真要用在正经项目上,自己去仓库里把 LICENSE 原文读一遍,别信任何人的转述,包括我这篇。
官方又替我说了一次
技术报告里有一句话,我读到的时候笑了一下。
官方自己写的:K3 在长程编码、智能体、知识、推理和视觉任务上达到前沿水平,整体性能优于其他开源及闭源模型,但落后于 Claude Fable 5 和 GPT-5.6 Sol。
十天前那篇我引过 Moonshot 的另一句原话,说相对 Fable 5 和 GPT-5.6 Sol,K3 在用户体验上仍存在明显差距。
同一件事,官方连着说了两次。
我不想把这句当成什么胜利宣言,那太得意了。我想说的是另一层意思:当媒体标题喊得比厂商自己还响的时候,去看厂商自己怎么写,往往最省事。这次我判断对了一半,另一半是人家自己替我把话说了。
厂商自报的成绩我一贯先存疑,看是谁测的、对标哪一版。这条规矩这次同样适用于对 K3 有利的那些数字。还有个宣传口径说新架构在每单位计算上有 2.5 倍的智能提升,我想找它到底是相对哪一代、哪个基准算出来的,没找到参照系。找不到我就不跟着喊。
有一条我当时算错了
复查这件事,只挑对自己有利的看就没意义了。所以得说一条对我不利的。
十天前我判 K3 账单没法压,理由是它只有一档思考力度,让它改个变量名它也照最大力度想。这条现在得打个折。
OpenRouter 那边的数据显示,K3 流量的缓存命中率到了 92%。缓存命中的输入价是每百万 token 三毛美元,是原价的一折。这么一摊,加权下来的平均输入价大约落在五毛二,而不是标价的三块。
对我这种流水线场景,这个差别不小。我每篇稿子都要把那套五十多万字节的规则库重新喂一遍,输入端占的比重很大,缓存正是吃这块的。
思考力度那一档到底还是不是只有满档,我看到的说法也对不上,有的说接口给了三档可选,有的说它永远拉满。这条我没验,先记着存疑。
所以这一条我修正一半:账单没我当时说的那么不可压,只是能压的地方在输入那头,思考那头照旧。
我没搬但改了一处
到期复查完了,结论其实挺无趣的:我没搬。
四条不搬家的理由,只有「权重没开」这一条随着今天失效了。订阅补贴那本账没变,十几个 skill 的迁移成本没变,官方自己承认的能力差距也没变。而且多出来一条我十天前没算到的:594GB 加上一整机柜的卡,把自托管这条路直接从我的选项里划掉了。
但我确实改了一处。以前我看开源模型,默认它意味着「我能拿回控制权」。K3 让我把这句话拆细了:权重开放、能自己部署、我这种规模的人部署得起,其实是三件事,得分开数。前两样 K3 都做到了,剩下那样跟我没关系。
前一阵 HuggingFace 被入侵后做取证,商业模型的护栏把工程师挡在门外,最后是靠一个开源权重模型自己搭在机房里跑完的。那件事我一直记着,它证明开源在关键时刻真能兜底。但也得看清楚,那个「自己机房」是 HuggingFace 的机房,不是我书房里那台 M1。
如果你也在纠结要不要动,我的建议跟十天前一样,只是更具体了:别整条流水线搬。挑一类你天天在跑、心里有标准答案的活,让新旧各跑一遍,只比两件事,产出你敢不敢直接用,月底账单变没变。至于自托管,先去看一眼权重多大、参考配置几张卡,这一眼能替你省掉整个周末。
昨天我刚写过一次同样的复查,那次撞上的是闭源顶配降价。今天撞上的是开源顶配放权重。两天两个新变量,我那张表一格没动。倒也谈不上它有多结实,只是这两下都没打在真正卡我的地方。
最后想问问你:有没有哪个工具,你嘴上说了好几次要换,结果一直没换?是被什么绊住的,是迁移太麻烦,还是每次真去看,都发现它没自己想的那么值?评论区聊聊。