那个 82.7 我写过一次,但不是这把尺子量的
DeepSeek-V4-Flash 正式版 API 今天公测,Terminal Bench 2.1 拿了 82.7。这个数我三个月前写过一次,是 GPT-5.5 在 2.0 上拿的,换了尺子不能直接比。同版本对照下 Codex CLI 配 GPT-5.5 是 83.4,差 0.7 分,但那是组合分不是自报分。真正值钱的是官方那句:架构和尺寸一个字没改,只重新做了一遍后训练。
DeepSeek-V4-Flash 正式版 API 今天公测,Terminal Bench 2.1 拿了 82.7。这个数我三个月前写过一次,是 GPT-5.5 在 2.0 上拿的,换了尺子不能直接比。同版本对照下 Codex CLI 配 GPT-5.5 是 83.4,差 0.7 分,但那是组合分不是自报分。真正值钱的是官方那句:架构和尺寸一个字没改,只重新做了一遍后训练。
一项受控研究把语料规模拉成 28 级阶梯跨越约 450 倍,发现约一千万语料 token 是个交叉点,过了这条线 BM25 一路领先近 20 分。我量了自己的库,三千两百万 token,已经过线三倍多。但论文真正的结论不是老办法赢了,而是把 BM25 装给 agent 之后它拿 69.4 分,比裸 BM25 的 54.8 和它自己翻文件的 36.9 都高。
吴恩达团队开源了桌面 agent OpenWorker,十天拿到 10831 star,交的是成品不是聊天记录,11 家模型随便换还能全下本地。昨天我刚写完自己被单点依赖套住,这东西看着像现成答案。可它把换模型做到了零成本,我欠的那笔债却不在模型那一层。更有意思的是这个判断不用我下,吴恩达自己在 README 里指了那一层。
一项影子评估让前沿 agent 接手两篇未发表 NeurIPS 论文的核心研究问题,给它六天和数千美元算力。工程活全干完且不需要人帮忙,研究问题零进展,两篇都被原作者明确拒稿。论文归纳出五个失败模式,其中四个我在自己那条流水线上都被咬过,而五条里至少三条的共同根因是同一个:那个问题没有一条机器能判死的线。
有人自述 Claude 账号被封,网上把原因指向一个绕过 SEPA 支付的油猴脚本,但这条因果我核不到。能核到的是 Anthropic 自己公布的数:2026 上半年封禁 1140 万个账号,收到申诉 39.8 万份,推翻 4.2 万份,被封的号里约两百七十个才有一个申诉回来。迁移成本这笔账我算过好几遍,一直当成选择题在算,忽略了它的到期日从来不在我手上。
把 AI 工作画成流程图这套讲法我写过四篇了。这次有个新概念叫虚假连线,指没有真实数据依赖却被画上去的箭头。我拿它量自己那条八阶段流水线,发现沉淀和配图之间那条线是假的,而实际执行时我早就并行跑了,图和现实对不上。另有一条单写者规则我刚违反过。
中文标题写着 1100 多人联名喊减速。我点开 pacingthefrontier 官网,签署人是 1224 名,全文用的词是 deliberately pace,没有 decelerate 也没有 slow。Altman 本人原话用的也是 pace,decelerate 是媒体标题加的。他们真正要的是先把能调节节奏的工具造出来,而在我这一层,那套工具早就发到手里了。
Gemini 的 Managed Agents 新增环境钩子,能在工具调用前后跑脚本,返回 deny 就把那次调用直接拦掉、拒绝理由还自动进模型上下文。我两周前刚写文章推荐给 Claude Code 配三个 hook,今天打开自己的配置一看,那三个一个都没有,permissions.deny 是零条。上周我说卡点没人守等于没有,我这儿更省事,压根没装。
昨天我写 K3 时说 594GB 根本装不进我的 Mac。今天 Deltafin 项目在一台 64GB 的 M1 Max 上真把它跑起来了,中位速度 0.0687 token/s,合 14.6 秒一个字,生成三个字要 56.5 秒。我那句话说错了一半:它装得进来,就是慢了三百到六百倍。一个被精确量出来的不可行,比模糊的大概不行有用得多。
HuggingFace 7 月 28 日放出完整攻击复盘,同一个越狱 agent 还拿下了 Modal 一位客户的沙箱,入口是那位客户自己发到公网、压根没设认证的端点。五天 17000 多个动作没人察觉,HuggingFace 事后要靠开源模型才读得完日志。我七天前给的三条收权动作方向没错,但每条都少了后半句。