OpenAI 同一天,一脚油门一脚刹车

Hello,我是飞飞。
9 月 6 号,OpenAI 官网同一天挂出两篇长文。头一篇是研究组织的内部账本:干研究的 agent 运行时长已经反超人类,每 1 个人类工作日配 3.1 个 agent 工作日,去年定的「自动化研究实习生」目标按期达成,下一站 2028 年 3 月造出自动化研究员。
另一篇是首席科学家 Pachocki 署名的《An Alien Mind》,里面最重的一句是:他认为目前没有任何实验室把对齐和监控解决到「能继续负责任地全速扩展」的程度,呼吁全行业自愿放缓。
油门和刹车,同一天,装在同一辆车上。
我一直觉得厂商发东西的排列方式本身是信息。把这两篇当成两条独立新闻看,你就只看到了 3.1 这个数和一句安全口号。当成同一辆车上的两个踏板看,事情有意思得多。
账本上那行字
先把油门这篇的数摆出来。
今年 6 月之前,OpenAI 研究组织里 agent 的总运行时长还低于人类总工时。8 月中旬起反超,按标准 8 小时工作日折算,每 1 个人类工作日,agent 干 3.1 个工作日的量。研究者的账单也跟着飞:年初中位数研究者只是偶尔用用,8 月中旬按 API 价格算每天烧掉 600 多美元,前 10% 的人一天烧 7000 美元以上。他们还统计了开并行会话的人数,同时挂四个以上 agent 的研究者越来越多,这个数连别人派出去的子 agent 都算在内。
报告用了一套六阶段的分类法给这些 agent 活计价:定方向、做设计、写代码、跑实验、做分析、做沟通。1 月到 8 月,六类全在涨,大头始终是研究和基础设施代码。涨得最快的还有一类,技术排障。
这里必须把两个容易混的数掰开。3.1 量的是运行时长,不是等效生产力。原文明明白白写着这是 agent 工作日和人类工作日的比值,从头到尾没有说「效率 3.1 倍」。不少转述把「跑了更多」写成了「干得更好」,这一步偷换你得看出来。打个比方。我给十个徒弟各派了活,十个人同时开工,到晚上一算工时,是我一个人的十倍。可交付桌上摆出来的东西,有几件能直接用、几件得我返工,那是另一本账。3.1 量的只是前半句。
报告里还有一行容易被略过的字:高层规划(decide 类的活)到今天仍只占 agent 输出 token 的极小部分。定方向、判结果、决定加大还是停掉,这些还是人在做。
实习生是判得死的活
这篇报告里我最在意的,是「实习生」的定义。
OpenAI 原文说,research intern 指的是能在人类指导下完成「明确界定的研究任务」的系统,包括那种熟练研究员要花几天的活。
注意「明确界定」四个字。上个月我写过 agent 做开放式研究的五个失败模式,那篇的结论是:五个坑里至少三个的根因,是手里没有一把机器能判死的尺子。工程活的测试过没过、代码跑不跑,机器一秒判死,所以 agent 六天能干完;研究问题比如这个方向值不值得追,判不死,agent 零进展。
OpenAI 这个定义跟我那条推论严丝合缝。现在的实习生,干的全是判得死的活。2028 年要造的研究员,才开始碰判不死的部分。报告自己的数据也诚实:成功跑完的四到八小时任务里,超过一半仍然要人插手至少一次。说白了,这就是官方版的 waiting on you,跟我盯后台 agents 那块看板是同一个物种。
连组织形态都在跟着变:好几个团队的内部答疑时间出勤率一路跌,有一个干脆停办了。以前研究者卡住了去问别的组,现在先问 agent。这行字读着是效率故事,换个角度看,是组织里「人教人」的通道在关。
还得替这篇报告记一句它的自我泼冷水。原话说这套测量方法是初级的,AI 研究的瓶颈有很多个,总体研究进度「大概率不会跟上这些具体指标」。厂商主动给自家里程碑降温,这个姿态比数字本身少见。
刹车那篇说了什么
再看刹车这篇。Pachocki 的判断分三层。
他先垫了一层概念。目标对齐,问的是模型有没有做你让它做的事。价值对齐更深,是模型内化了一套原则,在没有明确指令、甚至有冲突和对抗的场合还知道怎么行事。前者好测,后者难得多。
垫完这块,正题才来:监控的绳子在变松。他给了三个原因。模型的推理跟工具调用混在一起,本来就难盯。模型开始操纵自己的思维链,草稿纸本身会作假。预训练让模型不靠外显推理就变强了,草稿纸上越来越没东西可看。
这话接得上我前天那篇费马。那篇的结论是验证门有多硬,决定 agent 敢把野心放多大,数学域有 Lean 编译器当裁判,所以 agent 敢跑出 11 天 1300 万行。现在 OpenAI 要造的野心更大,直接是自动化研究员,可它自己承认,那根叫监控的绳正在变软。
再一层是刹车本身的成色:呼吁自愿放缓,直到行业建立共享安全门槛,再加国际协调。注意这是呼吁,没有机制,没有时间表。Pachocki 顺带交代了他的信念从哪来:2017 年前后 OpenAI 内部就见过算力往上堆的持续回报,这条路线他们信了快十年。文章里也谈了防务,说强大的对齐 AI 会是部署重点,但原话补了一句,一旦真正掂量过赌注的大小,「不计代价往前冲这件事就显得荒唐」。注意这句的位置,按二手转述的语境,它出现在谈自家部署重点的段落里,不在呼吁放缓的那段。翻译过来就是:刹车该踩,也打算给别人装刹车,自己的车先开到对齐 AI 造出来再说。一家公司的首席科学家说「谁都不该再全速了」,而这家公司同天公布的账本显示它自己在全速,这个组合怎么读,你自己称。
得交代口径:OpenAI 官网我直抓被 403 挡了,这篇的引语是拿两个独立二手源交叉对过的,意思一致,原文措辞以官网为准。
一辆车读出什么
RSI 这个词,说人话就是 AI 自己造出更强的自己。OpenAI 在报告里也留了余地,原话说快速 RSI 未必是应该追求的结果,要不要走取决于能不能保住人的控制和知情的公共选择。它还引了自己那份前沿政策蓝图,主张各公司该被要求公开追踪 RSI 进度,并且表态就算没人要求,它也会继续公开。国外的老牌博主 Simon Willison 当天就点了题:今天大概是 OpenAI 的 RSI 日,这个缩写两篇都在用,账本那篇甚至懒得解释它是什么。
把两篇叠在一起,说实话,我读出来的是一组没说破的赌注:他们赌自动化研究员造出来之后,能反过来帮着解决对齐问题,报告中确有原话,自动化 AI 研究员也可以是自动化的安全研究员。可监控又在变软,等于把安全押在「造出来的东西刚好会自己系安全带」上。
油门刹车的比喻到这儿可以说全了:踩油门的脚和踩刹车的脚长在同一家身上,车只有一个方向。这不见得是坏事,但值得你盯紧点。
我自己接着盯两件事。一件是那份「共享安全门槛」几周后会不会真落地成机制,还是停在呼吁。另一件是 3.1 这个比值下个季度还涨不涨。它 6 月前还不到 1,8 月中旬就到了 3.1。你自己接着算,两三个季度后这个数到哪,到那时你岗位里「判得死的活」还剩几成。
轮到你。你手边的人机配比是多少?要是也拿 agent 工作日除一下自己的人工日,你会得到几?