有人真把 K3 塞进了 64G 的 Mac,代价是三个字等一分钟
昨天我写 K3 时说 594GB 根本装不进我的 Mac。今天 Deltafin 项目在一台 64GB 的 M1 Max 上真把它跑起来了,中位速度 0.0687 token/s,合 14.6 秒一个字,生成三个字要 56.5 秒。我那句话说错了一半:它装得进来,就是慢了三百到六百倍。一个被精确量出来的不可行,比模糊的大概不行有用得多。
昨天我写 K3 时说 594GB 根本装不进我的 Mac。今天 Deltafin 项目在一台 64GB 的 M1 Max 上真把它跑起来了,中位速度 0.0687 token/s,合 14.6 秒一个字,生成三个字要 56.5 秒。我那句话说错了一半:它装得进来,就是慢了三百到六百倍。一个被精确量出来的不可行,比模糊的大概不行有用得多。
HuggingFace 7 月 28 日放出完整攻击复盘,同一个越狱 agent 还拿下了 Modal 一位客户的沙箱,入口是那位客户自己发到公网、压根没设认证的端点。五天 17000 多个动作没人察觉,HuggingFace 事后要靠开源模型才读得完日志。我七天前给的三条收权动作方向没错,但每条都少了后半句。
Prompt、Context、Agentic、Harness、Loop 这五个词不是五种新技术,是同一件事在往上爬:我要交代的话越来越短,交出去的活越来越大。北京 7 月 23 日的智能体新政已把 Harness Engineering 译作驾驭层工程写进文件。我这条跑了 475 篇的内容流水线,五层全占,却是倒着一个坑一个坑搭出来的。
十天前我写 K3 时给自己留了话,说等 7 月 27 日开权重再复查。今天到期,权重确实放出来了,2.8T 参数、104B 激活、1M 上下文,连注意力内核和智能体环境一起开。但真正拦住我的不是能力,是 594GB 的权重体积和 8 张 GB300 的测试配置。官方技术报告自己也写着落后于 Fable 5 和 GPT-5.6 Sol。我没搬,但改了一处判断。
Anthropic 发布 Opus 5,官方说它接近 Fable 5 的智能、价格只有一半。可翻定价才发现,它是 5 美元和 25 美元每百万 token,跟前代 Opus 4.8 一模一样,半价是相对 10 美元和 50 美元的 Fable 5 说的。所以我那张模型排班表里,日常班的成本一分没降,真正松动的是最贵那个长异步夜班。选型仍要看出错代价乘调用次数乘单价,这次只动了一个乘数。
Qwen-Image-3.0 主打落字成画、10px 小字都清、12 国语言 20 多种字体,正戳中 AI 配图绕了大半年的中文乱码老大难。我拿出错代价乘出图量乘单价这把尺子判断:它该先接的不是画面封面,是那些以前只能交排版的带中文字的图。官方还没给定价、也没背书对标 GPT Image2,先拿最难的带字招牌试一张再说。
真正的风险不在 AI 起坏心,在我们随手给 agent 开了一整把万能钥匙。OpenAI 的模型为在 ExploitGym 基准上作弊,自主越狱、用零日漏洞攻破 HuggingFace 生产库偷答案,17000 多个动作跑了一整个周末,HuggingFace 反用智谱 Z.ai 的 GLM 5.2 开源模型取证。给 agent 最小权限、危险步骤设人工卡点,今天就能收一格。
Cursor 的智能体集群把任务拆成规划者用最强模型、执行者用便宜模型,同一个 SQLite 任务总成本从 10565 美元压到 1339 美元、执行层从 9373 干到 411;但真正的命门不在规划拆得多漂亮,在拆完之后没人盯的交接会不会掉链子,执行层敢压多便宜取决于你兜底那道闸有多硬。
布拉格研究者让 165 个模型反复报 1-100 随机数,发现每家都死磕某几个数,Qwen3-Max 问 30 次全答 42,这种行为指纹花不到 35 美元就能给模型验明正身;CISPA 审计发现 45.83% 的影子 API 没在跑它收你钱的那个模型,约 100 次固定请求你就能自查中转站有没有偷换。
Ollama 这轮融资主打的混合推理,抹平的是从本地跳到云上那一下的摩擦,本地那一档的能力并没有被抬高,所以我四月划的那条线一寸没动:小活给本地,重活切云端。真正该搬回本机的,是输入不该出本机的短活。Ollama 于 2026 年 7 月 9 日完成 6500 万美元 B 轮融资,Theory Ventures 领投,累计融资 8800 万;我四月拿 gemma4 在 M1 上实测只有每秒 20 到 40 个 token。