从抠提示词到开一间后厨,AI 这五年其实只在做一件事

哈喽,我是飞飞。
前几天北京发了个文件,叫《关于加快智能体引领发展的若干措施》,是国内头一份省级的智能体专项政策。我扫到其中一条措施的时候愣了一下。
里面出现了一个词:驾驭层工程。英文原词是 Harness Engineering。
我愣住是因为,这个词我一个月前还只在技术群和几篇英文博客里见过,属于圈内黑话。现在它被翻译成中文,写进了红头文件。
也是那一下让我意识到,这几年满天飞的那一串 Engineering,可能不只是概念在轮番上新。
提示词工程、上下文工程、Agent 工程、驾驭层工程,最近又多了个循环工程。我一开始也觉得是一波接一波的新名词,学不动了。直到有天我把它们按时间顺序摆成一列,才看明白。
它们压根不是五种技术。是同一件事,在一层一层往上爬。
先说清楚,这篇跟我之前写的怎么把单个 skill 写稳不是一回事。那篇讲的是手艺,是把一个零件打磨好。这篇是张地图,看的是整条线现在爬到了哪儿。
五个词其实是一条线
我先把结论摆出来,后面再一层层展开。
这一串词的演变,说白了就一句话:我需要交代的话越来越短,能交出去的活越来越大。
打个你肯定懂的比方。这五步,就像从站在灶台边手把手教一个厨师怎么颠勺,一路走到你开了一间自己会转的后厨。
所以这五个词真正在变的,不在 AI 那头变强了多少,在我这头要交代的话变短了多少。
下面挨层说。
教它每一句话怎么说
最早那阵,也就是 GPT-3.5 那个时候,模型是真的笨。
你想让它好好干活,得一句一句教。我那会儿写的提示词现在翻出来看都好笑,开头一长串:你是一个 Java 专家,请输出 Markdown,不要解释,一步一步思考,最后给我 JSON。
少写一句,出来的东西就飘。多写一句,质量立刻上一个台阶。
所以那两年大家都在研究怎么把话说得更准,什么思维链、给几个例子、让它自己检查一遍,全是围着这一件事转。
这就是提示词工程,本质是优化输入。
放回后厨里,这一层相当于你站在灶边盯着一个新来的学徒,告诉他先放油还是先放盐,火开多大,什么时候翻面。他不缺力气,缺的是手艺。
它不笨只是不知道
后来 GPT-4、Claude 3 这批模型出来,情况变了。
模型自己会推理了。这时候你再花心思抠措辞,收益就很小了。真正卡住它的变成另一件事:它手上有没有足够的资料。
举个最直观的例子。你让 AI 改一个 bug,只丢一句「把这个 bug 修了」,基本没用。这跟它聪明与否没关系。它手上压根就没有你这个项目的底细:怎么搭的、接口长什么样、数据库里存了什么、这段代码当初为什么写成这样。
于是重点从「怎么问」变成了「把对的资料递到它手上」。
这一层催生了一大堆东西。让 AI 先去翻资料再回答的检索方案、给它配长期记忆、建知识库、把整个代码库做成索引、还有动辄上百万字的超长上下文。
说人话就是,提示词也就几十行,喂给它的背景资料能有几十万个计费单位那么多。
现在很多人讲提示词工程已死,说的就是这个意思。这一层叫上下文工程,本质是优化知识。
后厨里,这一层相当于你不再手把手教了,而是把冰箱、菜谱、今天的订单、客人的忌口,一股脑全摆到他面前。
我自己这一层是最先补上的。我有个 Obsidian 库,原始素材、提炼过的知识、写完的稿子分开存,其中光个人经历这一块就分了 13 个主题文件。我那 475 篇已经发出去的文章,也被专门的工具提炼过一遍,回填进这个库。写新文章的时候,AI 翻的就是这些。
让它自己动手干活
资料给够了,新问题又冒出来:它能不能别光说,自己动手把活干了?
以前你说修个 bug,它回你一句「这里改一下就行」,剩下的还得你自己来。现在的 Claude Code 是这样的:读代码、分析、改文件、跑起来、跑测试、发现没过接着改、最后提交。
从回答问题,变成了执行任务。这就是 Agent,中文一般叫智能体,说人话就是能自己动手的那种 AI。
这一层要设计的东西也变了,变成给它配什么工具、怎么记事、怎么拆任务、怎么把一套固定流程封装成它随手能调的技能。本质是优化执行。
后厨里,这一层相当于你说一句「做个红烧肉」,他自己去买菜、洗切、下锅、装盘,全程你不用管。
我现在手上有 13 个这样的 skill,拉资讯的、选题的、查资料的、写稿的、润色的、评分的、配图的、分发的、发公众号的,各干各的。
一个人变成一后厨
有了一个能干活的,接着就想要一群。这就到了驾驭层工程。
先说这个词。Harness 的原意是马具。注意它指的并非马本身,而是套在马身上那套皮带和缰绳。作用是把好几匹马挂在同一辆车上,让它们朝一个方向使劲。北京那份文件把它译成驾驭层工程,我觉得译得挺准。
到了这一层,让每个 AI 都聪明反倒成了容易的部分。难的是这些:谁先谁后?前一个的产出怎么交给后一个?中间有一个失败了怎么办,重试还是回滚?哪几步能同时跑省时间?
本质是优化协作。
后厨里,这一层就是你不再只有一个厨师了。你有配菜的、掌勺的、打荷的、传菜的,你得排出顺序,还得管好一个环节卡住时其他人怎么办。
我这条内容流水线就是这么一个东西。有个总调度,把研究、写稿、润色、评阅、沉淀、配图、分发、发布这八步串起来。中间还带规则:发公众号那步默认不执行,只有我明确说了才走,就怕误推没审过的稿子。
出锅前得有人尝一口
最后一层最近才火起来,叫循环工程,说白了就是闭环。
它的想法特别朴素:AI 一次干不好,那就让它接着干。
以前是生成完就结束。现在是生成、检查、发现不行、重写、再检查、还是不行、再改、直到过关。写代码是这样,写文章也是这样。
本质是优化迭代。核心已经从「生成」那一下,挪到了「反复改」那一段。
后厨里,这就是菜出锅前有人先尝一口,咸了淡了退回去重做,绝不直接端给客人。
我这条线上有两道这样的口子。一道查 AI 味,典型的一篇能从二十七个点压到十七个点。另一道按六个维度给稿子打分,不到八十分就打回给专门的环节重改一轮,再复核一次。
还有一层我觉得比上面这些都值钱。我写了个工具,专门把每篇稿子踩过的坑自动提炼成规则,回写进一个规则库。那个库现在有 52 万字节、156 条规则、133 篇训练记录。
尝一口是让这一道菜别出错。而它干的事,是让下一道菜一开始就不容易错。
我这条线是倒着搭的
写到这儿得说句老实话,免得你以为我多有远见。
这五层我一层都不是照着理论搭的。我是被坑一个一个推着走的。
配图那会儿 AI 自作主张往正文里塞图床链接还漏图,我才去把规则抠死。稿子写出来一股 AI 味,我才加了检测那一环。同一个坑连着踩三次,我才想起来该把教训自动记下来。全都是先疼,后补。
直到把这五个词摆成一列,我才发现每一层原来都有名字,而且有人已经研究得很深了。
所以我不劝你从头学这五个词。真正有用的是拿它当把尺子,量一下自己现在卡在哪儿。
我的观察是,多数人还停在最前面那层,一直在抠提示词的措辞,指望一句话说得更漂亮就能出好结果。可现在模型这个水平,那一层的收益已经很薄了。真正还有大空间的是中间那层和最后那层:你给它的资料够不够,以及它交活之前有没有人尝一口。
今天就能动的最小一步,是给你最常干的那件事加一道出锅检查。哪怕只是让 AI 干完之后,再拿三条你自己的标准回头对一遍,都比你花一下午改提示词强。
最后想问问你:你现在跟 AI 干活,卡在这五层的哪一层?是资料给不全,还是活交出去之后没人验收?评论区聊聊,我挺想知道大家是不是都卡在同一处。