Fable 5.1 更强了,我却更不敢放大权

cover

Hello,我是飞飞。

Fable 5 那阵我说过一句话:它是最强的那台,也是主流里最贵的那台。6 月 10 号那篇,我盯着它的价格,把手缩了回来。它输入 10 美元、输出 50 美元每百万 token,我拿 Opus 当主力时用得先过一遍秤,面对它我得过两遍。

今天 Fable 5.1 出来了,我多看了两眼,因为这次反转的还不只是”强不强”,是”便宜还是贵”。我把官网那条词一句句读完,又去翻了 Artificial Analysis 的评测,越看越觉得有意思。同一个模型,两种算账法,得出两个相反的结论。

Anthropic 自己主打,说缓存读价格砍了 75%,那种跑很久、要它自己做主的长活,能省高达 45%。可参与它预发布评测的 Artificial Analysis,在推理拉到最满的那一档(max 档)跑出来的数是:每任务约 3.76 美元,比上一代 Fable 5 贵了 20%,还是 Opus 5 的 1.6 倍。

同一个模型,官方说省,独立评测说贵。谁在撒谎?都不是。破绽在”按哪类活算”。

流程图

官网说降,评测说贵

Fable 5.1 的价格其实没动,还是输入 10、输出 50、缓存写 12.5,跟 Fable 5 一模一样。Anthropic 只动了缓存读这一项,从 1 美元砍到 0.25 美元。它说典型工作负载降约 25%,高度 agentic 的能降 45%。

那这 45% 是从哪来的?你喂给模型的上下文,要是大部分能命中缓存,读的那段就便宜到四分之一。长代理反复读同一堆文档、同一份代码库,正好是这种活。这账算得没错。

可 Artificial Analysis 发现了另一半。它把 Fable 5.1 放到 max 档跑,模型为了多想一步,输出 token 用了差不多上一代的 1.7 倍。这里得说清楚,这家评测机构是帮着 Anthropic 做预发布评测的,不算纯第三方,可它测出来的数,反而跟官方那句”省”对着干,这一点更值得琢磨。输出是最贵的那段,一条 50 美元。砍掉的那点缓存钱,全被这多出来的输出吃回去,还倒贴 20%。

所以两个都是真的,只是它们各算了一类活。缓存密集的活,你确实省了;max 档新颖推理的活,你确实贵了。这也提醒我,看一条 AI 定价的新闻,先得问一句:它拿哪类活算的?

怎么判断你的活是哪类?我给你个笨办法。先看它是不是反复读同样那堆东西。是,就多半吃缓存,该按”省”那半算。再看它是不是要它自己想、自己规划、跑很久。是,就多半掉在 max 档附近,该按”贵”那半算。这套笨办法,是我 Fable 5 那次过两遍秤学来的,因为一旦掉进”贵”那半,我的额度真的会疼。

真正烧钱的是 token 量

这条把我那本”过秤”账推翻了半本。

我以前算账很简单:这活错一点的代价,乘一天跑几次,再乘单价。三个数相乘,就是我该拿哪档模型。说白了,我一直在单价和次数上使劲。

可 Fable 5.1 告诉我,第三个变量我压根没当回事:token 量。它五个推理档位,输出 token 从低档 13.1M 一路拉到 max 的 143.7M,差了 11 倍。模型越强,越爱多想,越想多输出,而且它自己还在那五个档之间挑。我上 max 档,大半是图省事,把”强大本身要多烧多少 token”这件事,压根没往账里放。

这跟我去年踩过的坑是同一件事。我那套写稿流水线,6 个 skill 全用 Sonnet 跑一篇稿,一个月吃掉了 19% 的月额度,一百美金的 Max,就是十九美元烧在这一件事上。我把它按任务拆开,写稿、润色留 Sonnet,搜料、配图、分发切给 Haiku,才压到 8% 到 9%。可就算这样,还是有漏。有一回我一个 Haiku 就能干的活,手滑点成了最贵的档,那个月额度莫名其妙少了,我查了半天才发现,它为了”做得更好”,输出拉长了一大截。还有一次贪快,同一个会话连撑六个钟头,它到后面开始重复生成我写过的函数,还顺手把旧逻辑改错了。前面那笔靠”换便宜的档”省不出来,后面那两笔靠”选对档”也拦不住,因为它们一个是档位问题,一个是量在偷偷涨。

我一直以为省钱是”选对档”,现在看还得加一条”看好量”。档位决定单价,量决定这张单价到底被乘了多少次,后者往往才是大头。

怎么盯量?我现在干三件事。第一,看每次会话的 token 消耗,别只看月底那张账单。第二,给那种没人盯、要跑很久的长活单独记一笔,看它到底烧了多少输入、多少输出。第三,遇到一个明显超出预期的数字,先问它是档位问题还是量问题。上次那个额度漏,就是这么一步步往回追出来的。

那一档到底够用

除了”量”,还有个我一直没花心思的旋钮:推理档位。

Fable 5.1 五个档,输出 token 从 13.1M 到 143.7M,差 11 倍,可智能分只从 58 拉到 66。换句话说,你从低档往高档爬,多花的那部分钱,只买到几十个得分点,离能力翻倍差得远。对我这种每天都有一堆”改个标点、转个格式”的杂活,低档就够,硬上高档等于拿跑车去买菜。

真正该上高档的,只有那种没人盯、要它自己想很久、跑错了要返工好几天的活。这几类活错一点代价大,值得为它多烧点。剩下那六成日常,用低中档反而更划算,因为它算得又快又不贵。

我以前的问题是,一碰到”重要”的活,就不自觉往高档拨,好像拨上去才算认真。现在想想,那纯粹是把”贵”当成了”负责”。

边界松了吗

比钱更让我坐住的,是另一条:更强的模型,允许做的事也放宽了。

Anthropic 说,Fable 5.1 现在允许拿来找软件漏洞了。这对我这种天天给 agent 放权的人不是小事,因为以前这一类是它碰都不碰的。可它也没全放开:渗透测试、漏洞利用、二进制漏洞扫描这几类,还是转给 Opus 处理;生物学那类误杀大减,等于放宽了一个口子。Mythos 5.1 更收着,只给网络安全和生命科学那两类特殊访问。

还有一条容易被忽略:默认 30 天数据保留,用来做安全监控。命中安全护栏的请求,会自动转给更弱的 Opus,而且不按 Fable 价计费。换句话说,我买的是 Fable,端上来的可能是 Opus。

Artificial Analysis 还有个反直觉的数:它在一类考”会不会答还要硬答”的题上,尝试率 93.4%,准确率也最高,可答错的时候它还是硬应了 72.6%,比 Fable 5 更能撑场面、也更会编。能力强了,它更爱答,答错的也更多。

这些连起来,就是我 7 月那篇收钥匙的续篇。能力越强,AI 能自己做的事越多,我放出去的那部分权限,也跟着松了。它更能藏了,也更难盯了。我天天写文章靠着它,可它现在允许干的活里,有一类是”找漏洞”,还有一类是”端上来的不是我点的那个模型”。

这层担心不是空想。有一回我 GitHub token 权限给得太宽,Claude 顺手就把一个我压根没打算动的仓库设置改了。它没使坏,它只是觉得顺手,一起弄了更高效。那次之后我立了条规矩:每把钥匙只给最小权限,每 90 天换一次。现在看到 Fable 5.1 能碰”找漏洞”了,我第一反应不在它多强,在我开出去的那把钥匙,是不是又得多锁一道。

我打算怎么验这台

所以我没急着换,也没急着骂。

我打算挑流水线上那件最熟、最没人盯的长活,让 Fable 5.1 和 Fable 5 各跑一遍。不看官方那条”省 45%”,也不看独立那条”贵 20%”,就看月底真实扣费和我返工的次数。跑完我心里那本账,才会告诉我是换还是留。

说白了,Fable 5.1 让我重新想了一遍”更强”这两个字。它确实是更强的模型,可”更强”底下跟着三样东西:更贵的价、更多的 token、更松的边界。我想要的从来不是”最强的模型”,是”那件活最划算的模型”。这两件事,以前我总觉得是同一件,现在得分开算了。

你呢。你手里那台 AI,报的是”更强”,可你算过它为了更强,多烧了多少 token、多放着多少它自己会做的活吗?评论区聊聊,我想看看是不是只有我,以前从没把”token 量”和”放权边界”算进过秤里。