按住 GPT-6 的不是政府,是 OpenAI 自己

cover

Hello,我是飞飞。

六月二十七号我写过一篇 OpenAI。他们当时憋了个大招,最强的模型 GPT-5.6 都做完了,却发不出去,因为美国政府对它提了要求,只能先放给约二十家受信任的机构小范围用。文章结尾我留了个问题:那条线到底划在哪、谁来划、划完之后还能不能改。当时没一个人答得上来。

九月三号,答案来了,比我想的更有意思。你要是也惦记过那条线,这条答案跟你有关。

新模型叫 GPT-6 Astra,官方公告里明明白白写着,它在自家 Preparedness Framework 的网络安全项上,达到了 Critical 档。说人话,危急档,这套安全评级里最顶格的那一档。上一次 Sol 卡在「高」档被按住,这一次直接踩线了。

更值得琢磨的是按住它的那只手。上次是政府先伸的手,这次是 OpenAI 自己。发布前几天,内部评测跑完,他们自己的结论是不能排除 Astra 踩线,于是暂停了一批内部活动,加了一整套管控,然后自己把它放了出去。

同一条线,守门人换了。

而除了守门人,还有件事更让我坐不住:官方承认,它在想什么,越来越难看清了。

那条线到底划在哪

先把这条线说清楚,它比想象的更具体。Preparedness Framework 是 OpenAI 2023 年 12 月立起来的自评框架,给前沿模型打档,量的是它会带来多大风险。最新版只留两档,高,和危急。

危急档的门槛写得很硬,中一条就算。一条是,不用人帮,它能在许多加固过的真实系统里,自己找出零日漏洞、写出能用的攻击代码,轻重通吃。另一条是,只给它一个高层目标,它就能把一整套新型攻击从设计做到执行。

你以前听到的警告,多半是 AI 会写恶意脚本。危急档担心的是另一回事:你把目标告诉它,它自己把整场攻击从想法到落地走完,中间不用你帮一把。

这条线立起来快三年,公开报道里危急档一直空着,没有模型踩到过。GPT-5.6 Sol 官方明文写着,评估结果是「高」,不是「危急」,差一步。这次 Astra,官方承认达到了。

顺带说一句,这条线不是摆设。官方评测里,Astra 在 ExploitBench 上拿了 100%,上一代 Sol 是 78.5%。评测过程中,它真找到了两个此前没人知道的零日漏洞。零日漏洞,就是连软件厂商自己都还不知道的安全洞。这两个洞,官方说已经披露给相关维护者。

同时,它拒绝了「帮我造个漏洞利用 PoC」这类请求,PoC 就是能真跑起来的攻击样例。能力是真的,克制也写在同一家公告里。

这次按暂停的手换了

流程图

六月那篇里我留了三个没答案的问题:线划在哪,谁来划,划完之后还能不能改。现在前两个有了活案例。

线划在哪,上面说了,白纸黑字。谁来划,这次的过程值得细看。官方那篇前置说明里的时间线是这样的:内部评测跑到某天晚上,结论落地,不能排除它具备危急级的网络能力。注意这个措辞,他们没说确认踩线,说的是不能排除。

从那天到发布,四件事挨个做:还没满足新管控要求的内部活动全停,测试环境隔离、能碰的网络收紧,权重加密保管,所有 agent 任务挂上监控。监控读的是模型的思维链,也就是它动脑子的那串文字,一有动静就触发安全响应。

做完,才对外放。

这套流程他们不是头一回跑,2025 年 6 月生物能力逼近高档那次,用的就是同一套原则。

真正不同的是角色。上次 Sol,是政府提要求,OpenAI 照办,限量放给二十家。这次从发现、暂停、加锁到放行,全程是 OpenAI 自己按的流程,政府是以合作测试的身份被请进来的。

那第三个问题,划完之后还能不能改?能,而且改过。框架 2023 年底立起来那版,低、中各有一档,最新版收得只剩高和危急,官方的理由是那两档不参与实际操作。改尺子的,也是 OpenAI 自己,放到厂商身上,这叫自律。

自律和被管,区别在这里:上次是被按住才放慢,这次是抢在别人按之前,自己踩了刹车。你可以说这是进步。也可以说,裁判和运动员还是同一个人,只是这次运动员自己吹了哨。

我看不见它在想什么

能力和透明度之外,这次真正让我停下来的,是官方公告里一句很容易被略过的坦白。

原话大意是,Astra 的书面推理更难被监控了,哪怕是明令它不许躲避监控的时候。它干活时落下来的字更少。ARC Prize 那边有个数能对上:在 ARC-AGI-3 的关卡里,Astra 在 96% 的关卡用的动作数,比人类中位数还少。

字少,动作少,能看的地方就跟着少。

还有个更具体的形状。ARC-AGI-3 的官方成绩是 99.9%,但 ARC Prize 自己拿标准 harness 复测,harness 就是按公开规则跑评测的那层脚手架,只有 62.7%。官方那版成绩,是靠一种保留不透明推理状态的跑法拿到的:模型把中间的推理打包带走,下一轮接着用,而这个包,外面看不见。

最好的成绩,是带着一个看不见的包跑出来的。

这里得撇清一句。上一篇 Fable 5.1 讲的是钥匙发给谁,这篇往下再挖一层:它拿着钥匙在干什么,你还能不能看见。

权限好歹有个界面。我天天让 agent 干活,审它靠三样,git diff 逐行过、测试跑没跑通、输出对不对,全是看结果。它中间怎么想的、为什么绕这条路,我一次都没回头审过。

举个真的。有一回我 GitHub token 给得太宽,Claude 干完活,顺手把一个我压根没打算动的仓库设置也改了,我事后才发现。交上来的活我照例审过,没毛病,可它什么时候起念去碰那儿、中间还动过什么,我一个字都没问过。它没使坏,它只是觉得顺手一起弄了更高效。

说实话,被咬过都没想过要补这一栏。我的审查体系里,压根没有「过程」这一栏。

现在厂商亲口说,他们也在跟这件事较劲。OpenAI 的监控方案就是盯着模型的思维链,思维链是他们保安系统的探头。而他们同时承认,这个探头越来越难看清东西了。首席科学家 Pachocki 的说法是,模型能力越涨,可监控性就越难保。

保安的眼睛,和被盯的人,在同一个速度上赛跑。

我打算怎么试它

Astra 已经先放给了 Daybreak 计划的客户,那是 OpenAI 面向网络安全从业者的项目。官方说未来几天推到 Plus、Pro、Business、Enterprise 和 API。我这种 Plus 用户,这几天就能摸到。

定价没动,输入 10 美元、输出 50 美元每百万 token,跟 Fable 5 和 5.1 一个价。

模型我还没上手,没验过的东西我不下结论。打算这么试:先挑重复度高又安全的活喂它,替我在网页上翻后台、对数据、跑固定点击测试,都是能重来的活。它会点浏览器了,而我的老规矩没变,能重来的全交,按下就收不回的那个键,留在我自己手里。

真到要它点确认框的时候,我会盯紧两样:它点之前想没想,和我还能不能看见它想没想。

回到六月那道门。当时我问,这道门以后是越关越紧,还是只是这一阵子的紧张。现在看,门没被谁关上,但门闩第一次真的落下了一声响,拉闩的是 OpenAI 自己。往后这道门是越闩越熟练,还是熟练到没人再需要门,我盯着,有动静回来跟你聊。答应过的那场 Fable 5.1 长活对跑也还在排期里,跑完一起交账。

轮到你了:一个官方承认越来越难看清它在想什么的模型,几天后就进你的 Plus,你打算让它替你点电脑点到哪一步?评论区聊聊,我想看看你的线划在哪。