说真的,Astra 开中挡就够了

cover

Hello,我是飞飞。

上周四写稿的时候,我还老老实实交代了一句:我没有 Astra 的访问权限,它实际什么样全是官方口径,你当说明书看。结果话音没落几天,9 月 8 号 OpenAI 官宣了:Astra 全面推送给 Plus、Pro、Business 和 Enterprise 用户。我这张 Plus,在名单里。

这样的续篇是我最乐意写的,上次留的话这次能接着说。

但打开账号的头一分钟,我就差点走错门。

先说它藏在哪儿

按我原来的习惯,看到模型推送,直接去 ChatGPT 的模型选择器里找。翻了半天,没有。

对了一遍官方帮助文档才明白:Chat 里那个挂着 GPT-6 Pro 牌子的版本,只发给 Pro、Business 和 Enterprise。Plus 用户拿 Astra 的门在另外两个地方:ChatGPT Work 和 Codex。

Work 是浏览器里那个干杂活的工作台,派活、看进度都在网页上;Codex 是终端里写代码的那个。两个门各发一把钥匙,Chat 那扇门对 Plus 是关着的。Codex 还有个硬门槛,CLI 得升到 0.153.0 以上才认它。

如果你也是 Plus,先记住这条,能省十分钟瞎找。总结成一句:模型选择器里压根搜不到 Astra 这个名字,认牌子,别认名。

五个挡不是三个挡

Astra 的推理等级,官方叫 reasoning effort,说人话就是「让它开工前想多久」。别的模型上这东西多半三档两档,Astra 一口气给了五个:low、medium、high、xhigh、max。

两件事值得单说。

一是没有关掉思考的选项。上一代 Sol 还有 none 档,能把推理预算压到零,Astra 直接不认。temperature、top_p 这些老旋钮也一并拆了。

翻译过来就是,这个模型出厂设定里没有「不思考」这个状态,你只能决定它想多久,决定不了它想不想。过去有人拿 none 档当省钱开关,简单问题让它别想直接答,Astra 把这条路焊死了,省钱的活儿全压给了挡位选择。

二是挡位可以边跑边换。官方模型指南里写了,对话中途改挡位,缓存前缀不会推倒重来。开手动挡的人熟悉这个动作:路况变了,踩离合降个挡,不用熄火重起步。这个细节看着小,实际是省钱的命门:缓存重算一次,前面烧的 token 就白烧一遍。

顺带纠个偏。中文圈把最高挡传成了「Ultra」,我把英文信源核了一圈,官方文档里排最末的那挡就是 max,Ultra 这个说法我没核到,你按 max 记。

一张挡位价签表

五个挡各自值多少钱,评测机构 Artificial Analysis 给了目前唯一一份逐档账。口径先说清:他们的 v4.2 指数任务,API 牌价,每个任务平均。

挡位 得分 每任务成本 输出 token
low 49 0.63 美元 5.4M
medium 52 1.16 美元 12M
high 53 1.41 美元 19M
xhigh 54 1.85 美元 30M
max 55 2.57 美元 49M

表里最有意思的是两头的坡度。low 到 medium,花 0.53 美元买 3 分;xhigh 到 max,花 0.72 美元只买 1 分。输出 token 更夸张,从 low 到 max 涨了九倍,得分只涨 6。

这表还得跟上一代对着看才算完。Astra 的牌价是输入 10 美元、输出 50 美元每百万 token,Sol 是 4 美元和 20 美元,直接贵了 2.5 倍。顺带提醒一句,推理过程产生的 token 也是按输出价收的,50 美元一百万,表里每一挡多出来的输出量,大头都是它想的时候落下来的草稿钱。

贵出来的靠什么找回来?Artificial Analysis 算过两笔账:编码任务上,Astra 用的 token 只有 Sol 的三分之一,干一样的活反而划算;可换成通用任务,每任务成本从 Sol 的 0.95 美元涨到 1.67 美元,token 省下的抵不过单价涨的。

换挡这件事,越往后越贵,跟车一个道理,市区通勤用不着六千转。而这台车本身,跑哪种路划算,得看你每天装的是什么货。

官方劝我降挡

OpenAI 自己的使用建议(多封信源转述的口径,我没核到一手文档)是:编码和研究的日常默认 medium,复杂的调试上 high。xhigh 只在评测显示明确收益时才开。官方账号还补过一句更直白的:Astra 开 low 比 Sol 开 high 还强,你过去要是习惯拉满,现在可以降一到两挡。

这句我看着眼熟。5 月写 Opus 4.8 的 effort 时,我的打法是二分法:改变量名、补注释、写小脚本这类琐事压到低档,重构模块这种硬活拉满,泡杯茶回来收方案。那时候就两个挡,心里过一遍秤,二选一。

Astra 把这道题从判断题改成了分配题。我现在给自己立的规矩是三段:能重来的小事 low,改个报错、补个正则、格式化一坨数据都算;日常正经活 medium,写个功能、起一篇稿子的框架;动了才知道深浅的硬骨头,跨模块重构、那种改了三回还在报的 bug,high 起步,不够再往上加。秤还是那杆秤,刻度变密了。

为什么不干脆全开 max?表摆在那儿,max 的钱是 medium 的 2.2 倍,多买 3 分。省下来的那份,够我把 medium 的活多跑两轮。两轮 medium 给我两版方案对着挑,一轮 max 只给一版更贵的设计;两轮等于我能把头一轮的输出当输入再审一遍,错误是显性的,一轮 max 的深想发生在黑盒里,对不对只能赌。对大多数活,挑本身比深想更值。中挡,就够了。

这个过秤的习惯其实早于 effort 这个功能。还在按量烧 API 的那阵子,我每次调 Opus 前都会在心里过一遍:正经活用贵的,杂活切便宜的,真做之前先掂量值不值得。AI 帮忙写完的代码,提交前还得自问一句,这段逻辑我能解释清楚吗,答不上来说明代码在我眼前过,逻辑却没在我脑子里过。这套习惯搬过来,挡位不过是把「用不用」细化成了「用多深」。

这钱买了看不见的东西

还有一笔账,价签表上没有。

我 9 月 4 号写过 Astra 一件反常的事:它的中间推理打包带走,外面看不见。ARC-AGI-3 那个刷屏的 99.9% 抽象推理成绩,就是带着一个看不见的包跑出来的。这次翻官方的 system card,相当于模型的出厂说明书,又补了一层:max 挡下某些成功的攻击样本,全程一个思维链 token 都没写。思维链就是它边想边落下的草稿,草稿不写,你也无从对稿。

OpenAI 的应对是改盯动作,上了一个全程看它行为到底的监控器。

把这两条摆在一起看:挡位越高,你能看见的东西反而可能越少。多花的钱里,有一部分买的是它想得更深,也有一部分买的是你的监控盲区变大了。

我自己审 agent 的那套,git diff 逐行过、测试跑没跑、输出对不对,全是看结果,从来审不到它中间想什么。所以这条对我不是理论风险,是我那套审查法天生的窟窿。挡位开得越高,窟窿越大。

说这个,不是劝你别开 max,硬活该开还开。我的老规矩没变:能撤回的活交出去,撤不回的攥自己手里。只是「开最高挡更稳妥」这个直觉,在这台机器上是反的,值得记一笔。

官方没写的额度账

交个底,有一笔账我算不出来。

Astra 的用量计入现有订阅额度,Plus 属于 limited 用量,不够了可以买 credits 加量。但 effort 挡位怎么折算进额度,官方一个字没提。已经有 Pro 用户在吐槽,Medium 挡连续干 12 个小时,一周的 Codex 额度见底。这是个例口径,你当方向看,别当结论用。

上个月配 Codex 的多代理协作时我写过一句:判得死的活不需要深推理,推理档设高了,等于把省下来的又烧回去。这话放在 Astra 身上只会更对,它每个挡之间拉开的成本,比上一代大得多。

所以我的下一步说清楚:不写实测报告,先在 Codex 里拿 medium 挡跑一周真活,额度烧掉多少、活干成了什么,各记一笔。我打算每天记四样:额度掉的百分比、干的什么活、开的哪挡、返工了几回。一周下来,档位和额度之间那条官方没写的换算,我自己先描个大概。挡位怎么选这件事,纸上算得再清,最后都得过一遍自己的用量。

轮到你了:你平时开推理挡,是习惯随手拉满,还是真按活儿分挡?Codex 里的 model_reasoning_effort,你现在设的是哪一挡?评论区报个数,我猜大多数人和我一样,装完就没动过。