OpenAI CFO 说每块钱该越用越值,我那五十万字节的规则库偏偏反着来

哈喽,我是飞飞。
你花在 AI 上的钱,到底换回来了多少能用的东西?
这个问题我一直以为自己答得上来。我写过怎么把单价打下来,也写过怎么让稿子更稳。直到有人递给我一张记分卡,我拿它量了一遍自己那条线,前三项都过了,最后一项我答不上来。
递尺子的人,是 OpenAI 的 CFO。
她那四问挺实在
七月十七号,OpenAI 的 CFO Sarah Friar 发了篇东西,叫《AI 时代的记分卡》。
她的起手式我挺认同。她说过去衡量软件都看采纳率,卖出去多少席位、多少人还活跃、到期续没续约。AI 不能这么量,得看它到底干成了多少活。
她给了个指标,叫 useful intelligence per dollar,说人话就是每花出去一块钱,换回来多少能用的智能。
这个指标底下拆成四个问题。
你让 AI 干的活,重不重要。
每一次真正干成的活,花了多少钱。
它交出来的东西,你敢不敢直接拿去用。
用量涨上去以后,每块钱是不是变得更值了。
她还给了具体算法,就三步:把干完这摊活的全部开销加起来,数一数其中有多少次达到了你要的质量标准,拿总开销除以成功的次数。
我看到这儿愣了一下。
因为她把「全部开销」定义得挺狠,里头明确包含了人工复核的时间、重试,还有返工。我原本以为这种大厂文章会在这儿留个空子,结果人家写得比我预想的实在。
她还有一句我特别服:单价最低的那个,未必是每个结果最便宜的那个。一个贵模型如果一遍就做对,省下来的重试、等待和复核,可能远远超过它多花的那点单价。
这句话我是拿真金白银验证过的,所以我信这份记分卡不是拍脑袋憋出来的。
那就拿它量一量我自己那条线。
前三问我都答得上
我有一条内容流水线,十几个 skill 串起来跑:拉资讯、选题、调研、写稿、润色、评阅、沉淀经验、配图、分发,最后才是发布。
先说活重不重要这条。
对我来说重要,因为它天天在出活。到今天为止,从这条线里出来的稿子是一百二十七篇。这个数我不用自己记,规则库文件头上挂着一个计数,每写完一篇,沉淀那一环把教训写回去,顺手就把它加一。
再说每次干成的活花多少钱。
这个我答得上来,因为我本来就是逐篇过秤的人。派活之前我会在心里过一遍:这活错了代价多大、一天要跑多少次、单价多少。三样相乘,决定它配用哪一档模型。
剩下一条,敢不敢直接拿去用。
敢。但这里有个前提,我得说清楚。
我敢直接用,信的不是模型。
信的是那一百四十六条规则。
破折号一个都不许留,对仗句全文最多一处,三连否定的排比不许排,小标题超过十二个字揪出来重写,中文字数拿正则数一遍卡在两千到两千五。这些规矩是一条条踩出来的,命中一条打回一条。
Friar 那篇里讲可靠性讲得很准,她说能力让人愿意上手试一回,可靠才让 AI 真的长进你干活的流程里。
我完全同意。我只想补一句她没说的:在我这种小作坊,可靠这东西模型不白送,得我一条条买。
买来的东西,就有价钱。
卡住我的是最后一问
前三问顺顺当当,再往下就走不动了。
最后一问是:用量涨上去以后,每块钱是不是变得更值了。
Friar 给的判据挺清楚:同一套流程跑一段时间,如果干成的活涨得比总开销快,质量还没掉,那每块钱就是更值了。
我拿这个判据往自己身上套,套不进去。
问题出在那份规则库上。
我刚去量了一下那个文件。50 万字节出头,843 行,146 条经验。
这个体积已经越过一条线了。我那套工具读不动整份,敲下去就甩回来一句超出上限,读都不给读。挺荒唐的:这些规矩是我一条条写进去的,现在我想从头到尾看一遍都办不到,只能按关键词一条条往外捞。
而这份文件,是每写一篇稿子都得过一遍的。
那把它删薄一点不就完了?我也这么想过。别扭就别扭在这儿。
我提高可靠性的唯一办法,是往规则库里加规则。规则越多,稿子越稳,敢不敢直接用那条的分就越高。
可规则每多一条,每篇稿子要背的那个包袱就重一分,每次成功花多少钱那条的分就往下掉一点。
同一个动作,一边把成功率往上推,一边把每篇的底价往上抬。
Friar 那个判据要求干成的活涨得比总开销快。可在我这儿,让活干得更成的那个动作,本身就在推高开销。
复利也有本金那面
说到这儿我得认个错,认给我自己看的。
六月底我写过一篇,讲我这套系统怎么越用越聪明。里头有一段我当时写得挺得意:每写完一篇,沉淀那一环把复盘提炼成新规则回写进规则库,规则库就厚一层,下一篇就少踩一次同样的坑。那时候这个计数停在一百次。
我把它叫复利。
现在回头看,复利这个说法没错,但它只说了利息,没说本金也在涨。
规则库厚一层,确实少踩一个坑,这是利息。同时它也让往后每一篇的起步开销高一点,这是本金。
我以前只盯着利息看,因为利息看得见,稿子明显变稳了。本金藏在每次调用的上下文里,不会跳出来提醒你。
这个坑我其实在别的地方撞过。
我把给 AI 看的那份项目说明从十二 KB 砍到四 KB,就因为那里面每一行每一轮都要当前缀重发一次。我还把装着的 skill 从五十多个卸到二十八个,因为光那些 skill 的说明文字,占用就从一千 token 涨到了四千二。
这两个数是在别的东西上量的,不算规则库本身的账。但那个形状,一模一样。
同一个道理,换个对象我就没认出来。
摊薄这事分规模
想明白之后,我觉得 Friar 那个判据底下藏着一个前提,她没写出来,因为对她的读者来说那是默认的。
她的读者是企业。企业规模化,是同一套东西服务更多次调用。那份提示词写一次,一万次请求分着摊,像一口大锅炖出来分给一万个人,每人碗里那点柴火钱薄到看不见。规模越大,越划算。
我这种个人流水线,规模化的样子不一样。
我这儿是一人一灶。篇数越多,规则库越厚,每做一顿都得重新生一次火,摊不薄。
同一条公式,在两种规模底下,指向的结论正好相反。
所以我现在不敢直接套用她那个判据。她那把尺子是给摊得薄的场景量的,拿来量我这种摊不薄的场景,会给出偏乐观的读数。
这也是我得老实交代的地方:这笔账我只算到了方向,没算到数。
我没有逐环节的精确账本,不知道调研那一环具体吃掉多少、评阅那一环具体吃掉多少,也没跑过对照实验去测规则库到底让每篇贵了多少。
我能确定的只是方向:它在涨,没人替我盯着。
今天先删哪条规则
方向想清楚了,能做的事很具体。
我现在的做法是分三层:主文件只放流程,二十二 KB,每次必读;细节全部挪到外挂文件里;跑的时候只按需要捞那几条,绝不整份加载。
这个做法把成本暂时按住了,但它治的是症状。病根是规则只进不出。
所以我打算给规则库加一道体检,问每一条同一个问题:过去这些篇里,你真的拦住过东西吗。
拦住过的留着。从来没命中过的,说明它当初是为一个特例写的,而那个特例再没出现过,那就合并掉或者删掉。
这件事我还没做,是写这篇的时候才想到的。
绕了一圈我才明白,AI 这笔账最难算的,是你为了让它可靠而额外垫进去的那一层。
如果你手里也有一套跑着的 AI 工作流,今天可以做件小事:把你为了让它别出错而加进去的东西摊开看看。提示词、规则、检查项、人工复核的步骤,一样一样列出来,然后问一句,这里头哪几条是每次都要重付一遍的。
那部分就是你的本金。它不出现在任何一张账单上,但它在涨。
你那套工具里,有没有哪一条规则其实早就没拦住过东西了,只是你一直没敢删?评论区聊聊,我挺想知道别人是怎么给自己的规则库瘦身的。