Ploy 迁 GPT-5.6 快 2.2 倍便宜 27%,我盯着那笔没入账的迁移工程债

Hello,我是飞飞。
耗时从 8 分钟砍到 3 分 42 秒、单次成本从 3.06 美元压到 2.22。GPT-5.6 Sol 上线那天,Ploy 就把生产 agent 从 Claude Opus 4.8 切过去,隔天发的这篇迁移复盘,账面漂亮得没话说。可真正让我盯了一下午的,是账面之外那几笔没入账的债。
你要是也在盯这份账本,八成先看的也是这几个数字。可真金子在中间那段。为了把数字做出来,他们踩了四个大坑,几乎逐条对得上我这套写作流水线的家底。
快 2.2 倍是真的
Ploy 那份账本我信。Opus 撑了他们家默认档位整整四个月,先 4.7 后 4.8,中间试遍每个前沿新模型都没打过,直到 GPT-5.6 Sol 出场。
同一份改版评测跑十来个案例出来的数字,不靠一次对照测试的运气。是他们眼睁睁看着 GPT-5.6 把页面写得更精简:同一份样式表,Opus 甩出去近一万八千字符、一百七十多个变量,大半根本没用上;GPT-5.6 只写两千五、四十来个变量,效果一样甚至更好。臃肿的那份你一眼扫过去,就知道谁在凑数。
这些收益不算幻觉,是真的。所以「要不要换」这个问题,账面上答案很清楚:换。但账面之外那些没入账的活,才是这篇复盘真正扎人的地方。
编造的默认值最坑
Ploy 有个叫 code 的工具,25 个参数,1 个必填,24 个可选。Claude Opus 一直是要用哪个填哪个,剩下的省掉。GPT-5.6 上来直接 25 个每次全填,不用的它就编一个看着合理的默认值:从哪个位置读起它填 0,超时它随手填两分钟,站点编号它编一串全是零的。
看着都像真的。工具那头也不知道这是它自己编的,欢欢喜喜从它填的 0 那个位置读起,读回来一片空。工具照样回一句「成功」,模型一点感觉都没有。三天的调用记录拉出来:GPT-5.6 每次读文件都把 25 个参数塞满,一次不落;Opus 几千次里才犯四回,Sonnet 一次没有。GPT-5.6 的文件读取里,有 52% 到 64% 是读进来一片空的。
Ploy 一开始想在提示词里治它。工具描述加一句「不用的参数请省略」,还是全填。每个字段都标上「可选」,还是全填。连 OpenAI 官方的严格模式都搬出来,一模一样。后来有人一句话讲透原理:这是它训练时就烧进权重里的脾气,提示词里出现哪个参数名,它就非得给它填个值。提示词治不了骨子里的偏好。
Ploy 最后绕开提示词,在工具入口动手:把每个可选参数都改成「可以填空」,给模型一个正大光明说「这个我不用」的地方,进工具前再把这些空值悄悄擦掉。修完,空读从 52% 降到 0%,工具调用总量也少了 30%。最扎心的是,这道空读悄悄发生了三天,没一个人发现。
越往深越阴的暗账
头一笔卡在服务端替你管状态,先撞上的是缓存,说穿了纯是配置的锅。Ploy 最初看到的账本是 GPT-5.6「贵 50%」,翻回头查,跟模型价格没一点关系,全卡在两家缓存的玩法两样。Anthropic 那套几乎啥都不用管,随手标个断点,命中率自己稳在 92% 到 96%。GPT-5.6 这套得你亲手给每份缓存起名字,名字对上它才认你;换个名字,它就当从没见过,命中直接归零。名字太散,每份都没人光顾;一个名字底下挤太多人,后面来的全被挤去从头重算。于是「开个缓存」到了 GPT-5.6 这边,从勾一个开关升级成了一道设计题。Ploy 最后按客户分别起名字,首次命中从几乎为零涨到 83.7%,成本这才压到 Opus 底下。
同一套服务端替你记东西的脾气,还埋了条支线:会话跑到中途会丢东西。GPT-5.6 默认让服务端替你记着上一轮的思考过程,下一轮只回传一个编号,跑着跑着偶尔就报错,一段引用凭空没了。要修,得让每次请求把整份思考自己加密带走,别把命脉押在服务端的记性上。这条我特意记下来了:你发出去的东西只增不改,这个老规矩在服务端替你存状态面前,不成立了。发出去的还是那份提示词,上游可能早悄悄换过,你还蒙在鼓里。
更阴的一笔藏在评估口径本身。Ploy 复盘头一句就是「先修评测框架」。他们跨模型头一回跑,1/3 的失败压根跟模型无关,是评测框架自己的假设先错了:工具预算按 Opus 的串行脾气设的,GPT-5.6 一次并发一大批直接爆;有条及格线默认继承成满分,GPT-5.6 拿 0.98 的视觉分照样判失败。你那套框架,早把老模型的习惯当成了默认标尺。
你要是也攒过一套围着某个模型调出来的死规矩,读到这儿大概也会心里一沉。我那份防 AI 味的 grep 规则就是这么攒的:不许中文长破折号、先甩否定再翻转的对仗全篇最多留一处、三联否定要拆成散句、单句超 20 字要拆,全是照 Claude Code 一稿一稿抠出来的。改到第 76 版之前,那条查对仗的规则老误伤。我写一句「你是不是也这样」,它扫到里头「不是」两个字,啪地就把整句标红,判我一个 AI 味。满屏这种冤枉的红盯久了我才回过神:这套规矩背下来的全是 Claude 写字的口癖,换一篇正常中文它就乱开枪。它画的是「Claude 写字容易犯什么错」的语义地图,跟「AI 中文写字通用地图」还差一层。真换个模型底座,这份 grep 会当场失效多少,我心里没数。这是我这套家底最不敢体检的一层。
换的其实是那间屋
我这套流水线,就是照左撇子的习惯装修好的一间屋。开关往哪边扳、门把多高、灶台摆在哪,全按左手顺过来。右撇子搬进去,家什一样不缺,可开个门都得先愣半秒,没一样顺手。你以为你换的是模型,其实你搬的是这间屋。这个「形状」的说法是借 Ploy 的,我抄下来贴在经验库最上头那句就是他写的,说的是同一件事。
具体到我这边,全是照着 Opus 的脾气抠出来的死规矩:它先读哪个技能、认哪种格式的开头、什么时候自动接一段话、每段功能的说明写成什么样才不误触,还有那条写完自动回写经验的回路。哪一条都是我一稿一稿贴着 Opus 焊上去的。Lindy 那个例子我一直记得:他们把全部流量从 Anthropic 切到 DeepSeek V4,账面上是几百万美元一年的节省,可创始人自己说,迁移「比预想多干了 100 倍的活」。省下的那几百万,够不够覆盖那 100 倍的活,只有他自己那本账知道。
我这套写作流水线跑了 115 篇。十几个技能、一份从 12KB 砍到 4KB 的配置、一摞按每天真用什么裁出来的记忆文件,全长在 Claude Code 那套加载机制上。换个底座,光是把每个技能的说明重新写到不误触、把那份查 AI 味的规则重新对准新模型的写字口癖,我粗算一两周都下不来。这笔账,在「省下多少单价」那本上一分钱都不记。
你最先该盘的两笔账
我没说不该换。只想说换之前你得先看清:你想换的那个模型名字,早被这半年围着它长出来的一屋子形状焊死了。
真要迁,你手里最先该盘的是这两笔账。
头一笔,先把你的评估口径捋清楚。你判断手里的工具好不好用,到底是在看它把活干成什么样,还是在看它有没有踩中你照旧模型脾气埋下的那些暗桩。这本尺子不重画清楚,跨模型跑出来的头一波数字,跟 Ploy 那 1/3 的假失败一样,全是幻觉。
另一笔,挑一条你流量最大的活先试,我这边大概是 content-writer。让新旧模型各跑一批真活,盯质量、盯风格、盯月底的实扣账单,看那个「便宜 27%」在你那套死规矩底下还剩多少。
该不该迁,我到现在没答案。账面上那 27% 一年下来是笔真金白银的钱,可它压根盖不住底下这本账。
真卡住你的,是你这半年围着它焊死的那一屋子形状,那本没人给你入账的迁移工程债。你自己,盘过吗?