说真的,Astra 开中挡就够了

Hello,我是飞飞。
上周四写稿的时候,我还老老实实交代了一句:我没有 Astra 的访问权限,它实际什么样全是官方口径,你当说明书看。结果话音没落几天,9 月 8 号 OpenAI 官宣了:Astra 全面推送给 Plus、Pro、Business 和 Enterprise 用户。我这张 Plus,在名单里。
这样的续篇是我最乐意写的,上次留的话这次能接着说。
但打开账号的头一分钟,我就差点走错门。
先说它藏在哪儿
按我原来的习惯,看到模型推送,直接去 ChatGPT 的模型选择器里找。翻了半天,没有。
对了一遍官方帮助文档才明白:Chat 里那个挂着 GPT-6 Pro 牌子的版本,只发给 Pro、Business 和 Enterprise。Plus 用户拿 Astra 的门在另外两个地方:ChatGPT Work 和 Codex。
Work 是浏览器里那个干杂活的工作台,派活、看进度都在网页上;Codex 是终端里写代码的那个。两个门各发一把钥匙,Chat 那扇门对 Plus 是关着的。Codex 还有个硬门槛,CLI 得升到 0.153.0 以上才认它。
如果你也是 Plus,先记住这条,能省十分钟瞎找。总结成一句:模型选择器里压根搜不到 Astra 这个名字,认牌子,别认名。
五个挡不是三个挡
Astra 的推理等级,官方叫 reasoning effort,说人话就是「让它开工前想多久」。别的模型上这东西多半三档两档,Astra 一口气给了五个:low、medium、high、xhigh、max。
两件事值得单说。
一是没有关掉思考的选项。上一代 Sol 还有 none 档,能把推理预算压到零,Astra 直接不认。temperature、top_p 这些老旋钮也一并拆了。
翻译过来就是,这个模型出厂设定里没有「不思考」这个状态,你只能决定它想多久,决定不了它想不想。过去有人拿 none 档当省钱开关,简单问题让它别想直接答,Astra 把这条路焊死了,省钱的活儿全压给了挡位选择。
二是挡位可以边跑边换。官方模型指南里写了,对话中途改挡位,缓存前缀不会推倒重来。开手动挡的人熟悉这个动作:路况变了,踩离合降个挡,不用熄火重起步。这个细节看着小,实际是省钱的命门:缓存重算一次,前面烧的 token 就白烧一遍。
顺带纠个偏。中文圈把最高挡传成了「Ultra」,我把英文信源核了一圈,官方文档里排最末的那挡就是 max,Ultra 这个说法我没核到,你按 max 记。
一张挡位价签表
五个挡各自值多少钱,评测机构 Artificial Analysis 给了目前唯一一份逐档账。口径先说清:他们的 v4.2 指数任务,API 牌价,每个任务平均。
| 挡位 | 得分 | 每任务成本 | 输出 token |
|---|---|---|---|
| low | 49 | 0.63 美元 | 5.4M |
| medium | 52 | 1.16 美元 | 12M |
| high | 53 | 1.41 美元 | 19M |
| xhigh | 54 | 1.85 美元 | 30M |
| max | 55 | 2.57 美元 | 49M |
表里最有意思的是两头的坡度。low 到 medium,花 0.53 美元买 3 分;xhigh 到 max,花 0.72 美元只买 1 分。输出 token 更夸张,从 low 到 max 涨了九倍,得分只涨 6。
这表还得跟上一代对着看才算完。Astra 的牌价是输入 10 美元、输出 50 美元每百万 token,Sol 是 4 美元和 20 美元,直接贵了 2.5 倍。顺带提醒一句,推理过程产生的 token 也是按输出价收的,50 美元一百万,表里每一挡多出来的输出量,大头都是它想的时候落下来的草稿钱。
贵出来的靠什么找回来?Artificial Analysis 算过两笔账:编码任务上,Astra 用的 token 只有 Sol 的三分之一,干一样的活反而划算;可换成通用任务,每任务成本从 Sol 的 0.95 美元涨到 1.67 美元,token 省下的抵不过单价涨的。
换挡这件事,越往后越贵,跟车一个道理,市区通勤用不着六千转。而这台车本身,跑哪种路划算,得看你每天装的是什么货。
官方劝我降挡
OpenAI 自己的使用建议(多封信源转述的口径,我没核到一手文档)是:编码和研究的日常默认 medium,复杂的调试上 high。xhigh 只在评测显示明确收益时才开。官方账号还补过一句更直白的:Astra 开 low 比 Sol 开 high 还强,你过去要是习惯拉满,现在可以降一到两挡。
这句我看着眼熟。5 月写 Opus 4.8 的 effort 时,我的打法是二分法:改变量名、补注释、写小脚本这类琐事压到低档,重构模块这种硬活拉满,泡杯茶回来收方案。那时候就两个挡,心里过一遍秤,二选一。
Astra 把这道题从判断题改成了分配题。我现在给自己立的规矩是三段:能重来的小事 low,改个报错、补个正则、格式化一坨数据都算;日常正经活 medium,写个功能、起一篇稿子的框架;动了才知道深浅的硬骨头,跨模块重构、那种改了三回还在报的 bug,high 起步,不够再往上加。秤还是那杆秤,刻度变密了。
为什么不干脆全开 max?表摆在那儿,max 的钱是 medium 的 2.2 倍,多买 3 分。省下来的那份,够我把 medium 的活多跑两轮。两轮 medium 给我两版方案对着挑,一轮 max 只给一版更贵的设计;两轮等于我能把头一轮的输出当输入再审一遍,错误是显性的,一轮 max 的深想发生在黑盒里,对不对只能赌。对大多数活,挑本身比深想更值。中挡,就够了。
这个过秤的习惯其实早于 effort 这个功能。还在按量烧 API 的那阵子,我每次调 Opus 前都会在心里过一遍:正经活用贵的,杂活切便宜的,真做之前先掂量值不值得。AI 帮忙写完的代码,提交前还得自问一句,这段逻辑我能解释清楚吗,答不上来说明代码在我眼前过,逻辑却没在我脑子里过。这套习惯搬过来,挡位不过是把「用不用」细化成了「用多深」。
这钱买了看不见的东西
还有一笔账,价签表上没有。
我 9 月 4 号写过 Astra 一件反常的事:它的中间推理打包带走,外面看不见。ARC-AGI-3 那个刷屏的 99.9% 抽象推理成绩,就是带着一个看不见的包跑出来的。这次翻官方的 system card,相当于模型的出厂说明书,又补了一层:max 挡下某些成功的攻击样本,全程一个思维链 token 都没写。思维链就是它边想边落下的草稿,草稿不写,你也无从对稿。
OpenAI 的应对是改盯动作,上了一个全程看它行为到底的监控器。
把这两条摆在一起看:挡位越高,你能看见的东西反而可能越少。多花的钱里,有一部分买的是它想得更深,也有一部分买的是你的监控盲区变大了。
我自己审 agent 的那套,git diff 逐行过、测试跑没跑、输出对不对,全是看结果,从来审不到它中间想什么。所以这条对我不是理论风险,是我那套审查法天生的窟窿。挡位开得越高,窟窿越大。
说这个,不是劝你别开 max,硬活该开还开。我的老规矩没变:能撤回的活交出去,撤不回的攥自己手里。只是「开最高挡更稳妥」这个直觉,在这台机器上是反的,值得记一笔。
官方没写的额度账
交个底,有一笔账我算不出来。
Astra 的用量计入现有订阅额度,Plus 属于 limited 用量,不够了可以买 credits 加量。但 effort 挡位怎么折算进额度,官方一个字没提。已经有 Pro 用户在吐槽,Medium 挡连续干 12 个小时,一周的 Codex 额度见底。这是个例口径,你当方向看,别当结论用。
上个月配 Codex 的多代理协作时我写过一句:判得死的活不需要深推理,推理档设高了,等于把省下来的又烧回去。这话放在 Astra 身上只会更对,它每个挡之间拉开的成本,比上一代大得多。
所以我的下一步说清楚:不写实测报告,先在 Codex 里拿 medium 挡跑一周真活,额度烧掉多少、活干成了什么,各记一笔。我打算每天记四样:额度掉的百分比、干的什么活、开的哪挡、返工了几回。一周下来,档位和额度之间那条官方没写的换算,我自己先描个大概。挡位怎么选这件事,纸上算得再清,最后都得过一遍自己的用量。
轮到你了:你平时开推理挡,是习惯随手拉满,还是真按活儿分挡?Codex 里的 model_reasoning_effort,你现在设的是哪一挡?评论区报个数,我猜大多数人和我一样,装完就没动过。