那个 82.7 我写过一次,但不是这把尺子量的

哈喽,我是飞飞。
今天 DeepSeek 把 V4-Flash 正式版 API 放出来公测了。
我先说一件有点尴尬的事。这三天我连着写了两篇,讲我怎么被 Claude Code 焊死、迁移债怎么到期。然后我去查了一下自己那个 AI 大脑的配置文件。
1 | LLM_BASE_URL=https://api.deepseek.com |
我知识库那一层的对话模型,早就是今天更新的这个东西了。
我写了三天「我被一家锁死了」,结果自己其实一直在两边下注,只是从没当回事。
官方到底给了什么
先把官方那页摆出来,别转述。
更新日志里给了九个基准分数:Terminal Bench 2.1 是 82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon verified 70.3,Agent Last Exam 25.2,Automation Bench 25.1,DSBench-FullStack 68.7,DSBench-Hard 59.6。
清一色是 agent 类的活:跑终端、调工具、做完整工作流。
还有两条我更在意的:原生支持 Responses API 格式,并且专门针对 Codex 做了适配。V4-Pro 正式版官方说「尽快」。
针对 Codex 适配这句别当套话看。它的意思是这个模型不只想被你当聊天接口用,是想被塞进一个真的会跑命令、会改文件的壳里。一家模型厂主动去适配另一家的 agent 客户端,这个动作本身就说明它想抢的是哪块地。
得说清一个口径。网上都在传「远超 V4-Pro-Preview」,但官方更新日志里只有绝对分数,一张对比表都没有。那句话出自官推,不在文档里。定价这次也没给。
那个 82.7 我写过一次
看到 82.7 我愣了一下,因为这个数我写过。
三个月前 GPT-5.5 发布,我那篇文章的一个小标题原话是「Terminal-Bench 2.0 拿了 82.7%,把 Opus 4.7 甩出 13 个点」。同篇给的三家分数是 GPT-5.5 的 82.7、Claude Opus 4.7 的 69.4、Gemini 3.1 Pro 的 68.5。
同一个数字,一模一样。
但那是 2.0,这次是 2.1。
换了尺子的分数不能直接放一起比,这是我给自己定过的规矩。真要说「DeepSeek 追平 GPT-5.5」,等于拿去年的卷子分和今年的卷子分比高低。
而且我翻了翻自己存的 2.0 那一批数字,能看出这条分数带整体是什么水位:GPT-5.5 的 82.7 是当时的顶,往下 Qwen3.7-Max 69.7、Opus 4.7 的 69.4、Gemini 3.1 Pro 的 68.5、DeepSeek-V4-Pro 的 67.9、Kimi K2.6 的 66.7。
也就是说在 2.0 那把尺子上,82.7 是一骑绝尘,后面一堆挤在 66 到 70 之间。换到 2.1 之后各家分数普遍往上走了一截,这时候你还拿 2.0 的 82.7 当参照,就会把一个平常的分数读成惊天成绩。
同版本能比,但还隔着一层
那 2.1 上有没有可比的?有。
我五月写编程工具横评那篇记过:tbench.ai 的 Terminal-Bench 2.1 榜上,**Codex CLI 配 GPT-5.5 跑到 83.4%**,在非 Anthropic 模型里咬得最靠前,Claude Code 配 Opus 4.8 紧跟在后。
同一把尺子,83.4 对 82.7,差 0.7 分。
这个对照比上面那个靠谱,但还隔着一层,得说清楚。
tbench 那个 83.4 是「工具外壳加模型」的组合分,跑的是 Codex CLI 这套壳。DeepSeek 给的 82.7 是模型自报,没说用的什么壳。
昨天那篇我刚讲过,同一个模型换个壳,分数能差出一大截。所以这两个数摆在一起看方向可以,当成同类去掐 0.7 分的高低,不成立。
我自己也没复现过任何一个,这些都是照搬口径。
还有一条边界得先摆在这儿:我没拿它干过 agent 的活。 我用它做知识库问答用了几个月,但让它跑终端、连着调工具、自己走完一条多步流程,我一次都没试过。所以这篇里所有关于它 agent 能力的话,来源都是官方那张成绩单,不是我的体感。
最值钱的是那句没人转的话
真正让我停下来的是更新日志里的一句说明。它很短,短到大部分转述都没带上,跟那几个分数完全不在一个量级。
原话是:DeepSeek-V4-Flash-0731 保持了和 Preview 版完全相同的模型架构和尺寸,只是重新做了一遍后训练。
架构没动,参数量没动,一个字都没改。
变的只有后训练那一层。
后训练说人话就是这样:一个模型先用海量文本喂出基础能力,这一步叫预训练,烧钱最多、动一次伤筋动骨。之后还有一道工序,专门教它怎么听懂指令、怎么按格式回话。还有什么时候该去调工具,调完拿到结果怎么接着往下走。这道工序就是后训练。
所以这次更新等于同一批坯子,配方半点没改,只是回炉重烧了一遍,出来的成色不一样了。而这一遍回炉,换来的是九个 agent 基准全线上分。
这句话比 82.7 有信息量得多。 它说的是:这次能力提升不来自把模型做大,来自把它教好。
我早就把它当快档在用
说回我自己。
四月我写过一篇讲怎么把国产模型接进 Claude Desktop 的文章,里面列了一张兼容端点速查表,DeepSeek 那行是 https://api.deepseek.com/anthropic,V4、V4-Pro、V4-Flash 都走这个。
那篇里我还专门写了一句:思考模式默认开着,只是聊天用会觉得慢,可以切 V4-Flash。
我当时给 V4-Flash 的定位是「嫌慢就切的快档」。
三个月后,这个快档在九个 agent 基准上交出了一张不难看的成绩单。
我那个 AI 大脑每天在用它。库里现在九千多篇文档,关键词层索引了九千零六十六篇,向量层一千两百多篇。我今天写这篇之前的查重,就是它跑的。说实话我从没觉得它慢过,也从没想过它能干 agent 的活。
便宜档对我不是个小事。我调 Opus 之前会在心里过一遍秤,杂活手动切便宜模型。多智能体那套跑法烧的 token 是普通对话的十五倍,这个账我算过好几遍。所以「有没有一个便宜的东西能接住一部分活」,对我是实打实的钱。
我打算这周把它接进流水线里的一个环节试试。不是主力,先挑判得死的活给它:查重、格式检查、硬扫描矩阵那几条规则的初筛。这些活有明确的对错,跑砸了我一眼能看出来。跑上一两周再说。
这周撞上三回同一件事
写到这儿我发现一个巧合。
这周我写了三篇,回头看讲的是同一件事。
一篇讲有人给前沿 agent 六天时间和数千美元算力,工程活全干完,研究问题零进展。结论是卡住它的是那条判不死的线。
一篇讲一项受控研究测了 28 级语料规模,结论是 agent 自己翻文件那套输了。可给它配上排好序的检索,它反而拿最高分。
今天这篇讲的是同一个模型、同样的参数,只是重新教了一遍怎么用工具,agent 分数就全线上去了。
这周我撞上三回同一件事:真正卡住 agent 的,不在模型本体有多强,在它周围那一层怎么搭。
我得声明一句,这不是「果然被我说中了」。前两次是别人做实验,这次是厂商用一次发布顺带验证了同一个方向。我只是恰好三次都在场。
你手上那个便宜档
所以这篇给你的东西挺具体。
如果你也在用某家的「快档」或者「便宜档」跑杂活,今天可以做一件事。去看一眼它最近有没有更新过,重点看更新日志里有没有「后训练」「工具调用」「agent」这几个词。
模型的名字不变、参数不变、你付的钱不变,可它会的活可能已经变了。你上次给它定的位置,也许是半年前那个版本的水平。
我那个「嫌慢就切的快档」,就在我没看的时候,悄悄换了张成绩单。
最后想问问你:你手上有没有一个模型,是很久以前试过一次觉得不行、后来就再没回头看过的?说说是哪个,我挺好奇大家的印象都停在哪一版。