Opus 5 的半价砍的不是我的日常班,是我那个最贵的夜班

cover

哈喽,我是飞飞。

七月二十四号,Anthropic 发布了 Claude Opus 5。官方那句话说得很勾人:接近 Claude Fable 5 的前沿智能,价格只要一半。

看到「一半」两个字,我下意识就想去翻自己那张模型排班表。天天用 Claude Code 的人,脑子里都挂着这么一张表。谁顶白班、谁扛夜班、哪个活敢派给谁,心里门儿清。顶配模型降价,那不等于我全线的用人成本都松了?

然后我去翻了定价,愣了一下。

Opus 5 是每百万 token 输入 5 美元、输出 25 美元。这个数字,跟前代 Opus 4.8 一模一样。它一分钱没降。

那「一半」是从哪来的?是相对 Fable 5 来的。Fable 5 是 10 美元和 50 美元,Opus 5 正好是它的一半。

这两件事听着差不多,落到我的排班表上,差得远了。

先说清我那张表

先撇清一下,这篇不接我上周那篇 Fable 5。那篇讲的是「强不等于该当主力,得先看它该站哪个坑」。这篇是同一张表遇上「半价」这个新变量之后,我回头做的一次复查。

我的活是这么分的。改格式、顺语法、批量替换这类杂活,压给 Haiku,它能扛我六七成的日常。真正写代码、改 bug、加功能,主力是 Sonnet,一个人干掉九成。只有整模块重构、一次动十几个文件那种硬骨头,才切 Opus。上周新排进来的 Fable 5,我只让它顶一个班:没人盯着、要跑很久的长异步任务。

为什么卡得这么死?因为贵。让 agent 干正经活之前,我都会在心里过一遍秤:这活值不值得动用那颗最贵的脑子。前阵子我批量改二十个 frontmatter 字段,手一滑差点点成 Opus,反应过来赶紧切回去。这种下手前先过秤的绷着感,就是「贵」最真实的样子。

这套分法我一开始压根没想周全,全是账单和翻车一点点逼出来的。我光写文章这条流水线就挂着一串 skill,拉资讯的、查重的、润色的、配图的、发公众号的,每一个背后调哪档模型我都得盯着。有一回没盯住,一个 Haiku 就能干的活悄悄爬到了贵档上,那个月的额度漏得莫名其妙。还有一次贪快,让同一个会话连撑了六个钟头,它到后面开始重复生成我早写过的函数,还顺手把旧逻辑改错了。从那以后我学乖:活按大小分,脑子按贵贱派。

所以新来一个模型,我头一个动作从来不是掂量它多强,是看它该站哪个坑。

半价没降在我头上

回到 Opus 5。它把「接近顶配的智力」和「一半的价钱」摆在一起,听着像天降福利。可我把它按进排班表,发现降的地方,跟我原本以为的不是一个位置。

我那几个班次里,扛走绝大多数活的是 Haiku 和 Sonnet。这两档的价钱,这次一分没变。Opus 那一档呢?也没变,还是 5 美元和 25 美元。

所以对我这条天天跑的流水线来说,日常成本这次纹丝不动。

真正松动的只有一个地方:最贵的那个长异步夜班。以前那个班只有 Fable 5 能顶,一小时 10 美元和 50 美元的价签挂在那儿,我每次派活前都要多犹豫一下。现在它头一回有了个替班的人,价签只有一半。

这就是我这篇最想说清楚的一件事。这次真正变的,不在我那几个日常班次的价钱,在最贵那个夜班头一回有了替班。

官方数字怎么读

先把官方说了什么摆清楚,我不加工。

Anthropic 说 Opus 5 在 CursorBench 3.2 上,最高努力档的表现落在 Fable 5 峰值成绩的 0.5% 以内;在 OSWorld 2.0 上,用大约三分之一的成本超过了 Fable 5 的最好成绩。它还说 Opus 5 在 Frontier-Bench v0.1 上超过所有其他模型,性能比 Opus 4.8 高出两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。即日起,它是 Claude Max 的默认模型,也是 Claude Pro 里最强的那个。另外它有个快速模式,价格翻倍,速度大约是默认的 2.5 倍。

我得说句实话:这些我一条都没验过。模型今天刚发布,我手上还没跑过一次真活。所以这篇给你的是判断,算不上实测报告。

但有一条经验我一直守着:厂商自报的跑分先存疑,看清楚是谁测的、对标哪一版。这次 Anthropic 拿来当参照的是自家的 Fable 5 和 Opus 4.8,口径是自己出题自己判分。同一天他们还发了篇讲上下文工程的博客,说新一代模型把 Claude Code 的系统提示词砍掉了八成、编码评测没明显掉分。这条我先记着,跟今天这张排班表关系不大,改天单独聊。

我这次动哪一班

所以真要重排,我怎么排?

我的尺子一直没换过:这活错一点的代价,乘以一天要跑多少次,再乘以单价。三个数相乘,才是这一班真实的用人成本。

这次半价,只动了三个乘数里的一个,而且只动在最贵那一档上。出错代价没变,调用次数更没变。所以结论其实挺朴素的:我不打算全线换人。

我只动一个班次,就是那个长异步夜班。以前那个班的成本压着我,我只敢挑最值得的活派过去。现在同一个班次有了半价的选择,我会先拿一件我熟得不能再熟的活,让新人和老人各跑一遍,盯着产出质量和月底真实扣费,再决定这班交给谁。

日常那两班我不动。Haiku 和 Sonnet 扛着我绝大部分调用,这次它们的价钱没变,产出也够用。为一个没在我这儿验过的新面孔,去动一条天天在跑的流水线的主力,风险和收益压根不成比例。

还有一层容易被忽略的账:换班本身是有成本的。每换一档模型,我都得重新调提示词、重新观察它在我那些 skill 里的脾气、重新踩一遍它特有的坑。我那套写作规则库已经攒到五十多万字节、一百五十多条规则,每篇稿子都要重新喂一遍,换个模型就意味着这一整套得重新验一轮。这笔账不出现在任何一张价目表上,但它真金白银地花我时间。

我还吃过一种更闷的亏。有阵子部署用的令牌悄悄过期了,构建全绿,就最后一步推不上去,网站整整红了一天我都没发现。那件事跟模型无关,但它教会我同一个道理:流水线上真正咬人的,往往不是你正盯着的那个数字。价目表上的单价是你看得见的,换人之后那些静悄悄的返工和踩坑,才是你看不见的。

你先别急着全换

所以这篇我不劝你立刻把主力换成 Opus 5,也不劝你无视它。

真要动,最省的一步是这样:挑出你现在最贵的那一个班次,只挑这一个,找一件你做过很多遍、心里有标准答案的活,让新旧模型各跑一遍。比对的时候别看谁显得更聪明,就看同样这件活,谁的产出你更敢直接用,以及月底账单上那个数字到底变没变。

顺手提醒一句,Claude Max 的默认模型已经换成 Opus 5 了。你要是从来不手动切档,那这个班其实已经悄悄换过人了,只是你没接到通知。

最后想问问你:你那条流水线里,最舍不得换的是哪一班?有没有被单价坑过,比如某个便宜档反复返工,最后总花费反而比一次上贵档还高?评论区聊聊,我挺想看看别人的表是怎么排的。