一万刀干到一千三:Cursor 贵规划便宜执行,可它没讲交接会掉链子

哈喽,我是飞飞。
先甩一个让我愣了一下的数字。Cursor 让一个智能体集群去干同一件活,把总账从 10565 美元压到了 1339 美元。光是干体力活的那层,从 9373 美元干到了 411 美元。活还是那些活,质量他们说”差不多”。
我盯着这个数字出了会儿神。因为它省钱的路子,跟我天天手动在跑的那套,是同一个理。
前阵子我写过《三个模型接力 16 小时》,那篇讲的是长任务串着交接怎么掉链子。今天这篇不太一样,讲的是一摊活在内部怎么分层:谁来拆,谁来干,凭什么这么分能省这么多。顺带说一句我觉得 Cursor 那篇博客最漂亮、也最避重就轻的地方。
一秒 1000 次提交
先看它干了件什么活。
Cursor 让集群用 Rust 从零重写 SQLite 那本 835 页的手册,拿 sqllogictest 当卷子打分。用 Grok 4.5 跑,新集群 4 小时过了 80% 的测试。旧版集群呢?没撑到第 2 个小时就崩了,被迫暂停。
给它一本 835 页的手册,它还你一个数据库。
更夸张的是提交速度。它家早先那个建浏览器的集群,一小时提交约 1000 次,走的是 Git。这回的新系统,一秒提交约 1000 次,为此他们从零自己写了一套版本控制。同一个词,一小时和一秒,差了 3600 倍。
贵的只值在拆解
那这活到底是怎么分的?
Cursor 给这一节起的小标题叫”树和叶子”。任务天然长成一棵树:规划者用最强的模型,把一个大目标劈成一块块小活;执行者用更快更便宜的模型,把这些小活一件件干掉。规划者永远不动手,执行者永远不操心全局。
省钱就省在这儿。原文那句话我觉得说透了:一旦前沿模型把模糊的目标压成一条明确到不能再明确的指令,便宜模型照着做就行了。
摊开成本你会更服气。执行层扛了七成以上、大多数时候九成以上的 token,却只花掉一小块钱;规划者吐的 token 是零头,却吃掉了大约三分之二的成本。真正配得上前沿智能的动作,一只手数得过来:拆解、拍设计、做几个关键取舍。剩下的都是照章办事,凭什么用贵的?
这套路子并非 Cursor 独创。Anthropic 自己的研究系统同样拿 Opus 当牵头规划、Sonnet 当干活的执行者,业界给它起了个名,叫编排者和工人,早成了多智能体的默认骨架。
这就是我的活法
看到这儿我特别有共鸣,因为这就是我天天在手动干的事。
我那条博客流水线,content-director 就是个纯编排者:它先规划,再把研究、写作、润色、配图、分发这些环节,一个个扇给对应的 skill 去干。我自己派活前还有个土规矩,叫”过秤”:值得动脑的活,润色稿子、改流水线脚本、关键判断,舍得上 Opus 旗舰;纯体力的杂活,批量改文件名、格式转换,手动切便宜模型。
这套分法的账我算过。六个 skill 全用 Sonnet 跑完一篇,一个月吃掉我 19% 的额度。后来按任务分,写作润色留 Sonnet,搜料、配图、分发全压到 Haiku,直接降到 8% 到 9%。省下的一半多,跟 Cursor 那套是同一个道理:别让贵模型干便宜活。
说来有点丢人,我一开始是逮着最强的模型往死里用,什么活都塞给 Opus,图个省事。直到有个月账单肉疼,才逼自己坐下来,把每个 skill 到底该配哪档模型,一个个重新过了一遍秤。
可我这套过秤说白了是人肉路由,手感好的时候准,忙起来手一抖,也会把有难度的活压给便宜模型,结果它答岔了还得回炉重来。所以我特别懂 Cursor 那股劲:想把这道分活的判断,从人的肌肉记忆,挪成系统能自动调度的东西。
诚实说一句,我没跑过 Cursor 那套工业级的装置,也没复测过它的分。我能印证的,只是”强弱分工确实省钱”这个方向。
交接才是命门
但 Cursor 那篇博客,我觉得有个地方讲得太漂亮了,漂亮到有点避重就轻。它把省钱讲得头头是道,却没细讲拆完之后,交接会怎么掉链子。
我吃过这个亏。有次我用 agent 把一个 7000 多行的 SpringBoot 老项目迁成 Kotlin。它规划得很利索,一块块干得也快。可它会自信地把一个空指针判断顺手”优化”掉,把某个分支逻辑悄悄改岔,有个叫 isLiability 的字段在某个分支里凭空消失。编译过了,跑也跑了,满屏 diff 你根本看不出哪儿错了。到头来是靠流水线里专门设的一道对抗校验,在报错时才把它捞回来。
所以我越来越信一句话:长任务里最值钱的,不在规划有多周全,在错了之后那道兜底的闸。
Cursor 自己其实也承认了这件事,只是换了个说法。它一秒 1000 次提交、还专门自建版本控制,本质上就是在给交接铺基础设施,让每一步都能回滚、能追溯。它还提到一个更逗的坑:两个规划者互相不知道对方存在,各自造了一个一模一样的轮子。
我没本事一秒提交一千次,但同一个道理,我在流水线里给每个 skill 都焊死了一张岗位接口卡:进来什么、吐出去什么、格式长什么样,写得死死的。就靠这一步,上一个 skill 交给下一个的东西,才不至于在半路走样。规划漂亮是锦上添花,接口对齐才是塌不了的地基。
还有一种更阴险的掉链子,是静默失败。我的博客镜像站有回部署,构建全绿,只有临了那步 git push 认证悄悄红了,整条链静默挂了一整天没人发现。所以我的结论是两条:人得卡在不可逆、要对外的那一步;全自动链路必须给”失败”本身单配一个能推到你手机上的告警。
你该怎么分
要真把这套用起来,我的判断是三条。
先问自己:这摊活里,到底哪一下才配得上贵模型?通常就是拆解、定方案、拍那几个关键取舍。剩下的照章执行,全交给便宜模型。
再一个,你敢把执行层压到多便宜,取决于你兜底那道闸有多硬。有对抗校验、有逐行 review、有测试网兜着,你就敢往下压;什么都没有,便宜模型干岔了没人知道,省的那点钱全得吐回去。
还有,交接一定要走明面。进度文件、git 历史、给每个环节一张写清输入输出的接口卡,别让上下文在 agent 之间靠”它应该懂”来传。
Cursor 用一秒 1000 次提交把这套跑成了工业级,我用十几个 skill 手动跑我的小作坊。规模差着十万八千里,可撞上的是同一堵墙:活可以扇出去,那道该不该收的判断,收不回来。
你手上的活,有没有哪一摊是你也想拆成”贵的规划、便宜的执行”的?你最怕它在哪一步掉链子?评论区聊聊。