OpenAI 新语音模型:嘴五美分一分钟,脑子另算

cover

Hello,我是飞飞。

这两天开发圈的注意力都在 GPT-6 Astra 上。如果你也刷到另一条公告,9 月 10 号 OpenAI 把 GPT-Live-1 开放进 API,语音层每分钟 0.05 美元,你八成会跟我一样愣一下:嘴五美分一分钟,脑子另算?

我愣完的第一反应是:我那条语音记账管线,是不是该推倒重写了。

看完公告我想明白的是另一件事。这次真正的新东西,不是模型多强,是嘴和脑第一次拆开来卖;至于你该不该用,分界线只有一条:你的语音要不要对话。

老管线的活是排队的

我的 App 里有个语音记账功能,你对它说一句「午饭花了三十五」,它得变成一条记账记录。

实现走的是标准的级联管线,说人话就是接力赛:端上先跑一套规则解析,把这句话拆成金额和分类;规则拆不全的,异步丢给后端一个大模型兜底,设了 2 秒超时,超时就降级用规则的结果。

为什么不用大模型一把梭?图的是账算得清。记账是高频小动作,大部分单子「午饭三十五」这种格式,规则零成本就能吃下;真剩下那些说不清的,才值得花一次大模型的钱。整条链路里每一步出问题会发生什么,我都事先知道:解析失败走兜底,兜底超时走降级,没有一步是黑盒。

这套结构是行业里语音方案的通用形状:录音,转写成文字,文字喂给大模型,回答再交给语音合成念出来。四段排队,一段干完下一段才开工。

排队有个隐藏代价,平时没人提。转写那一步会把声音里的时机信息全丢掉:你犹豫的那半秒、说到一半改口的那句话、「嗯」「啊」的附和,进了文字全没了。所以传统语音助手听不懂「等一下,我说错了」,它只能等你说完才开始想。

我那条记账管线没这个问题,因为记账压根不需要对话。

全双工是边聊边干

级联管线与全双工架构对比

先补个背景。GPT-Live-1 不是今天才存在的模型,7 月 8 号它就随 ChatGPT 语音模式上线了,当时只在自己家产品里跑,开发者够不着。两个月后开放 API,外头的人才算第一次拿到手。

它干的事,是把排队改成同时。它听和说同时进行,进出两路音频都开着,模型自己在持续决定:继续听、继续说、停一下、接住打断,还是把手头的活递出去。

官方给的对比数字是,在一个专测现场说话行为的 Full Duplex Bench 上,它比上一代 Realtime 模型高了 30 个百分点。这个基准测的东西挺特别:打断、轮次接替、背景里有人说话、听的人嗯嗯啊啊。传统跑分根本不测这些,没有哪张推理榜单管「语音助手会不会抢话」。

有一个第三方实测我觉得比跑分有意思。语言学习平台 Speak 换上它之后,学员思考停顿时被打断的次数少了将近八成。你练过口语就懂这个场景:你卡壳想词,机器抢着开口,那一下多败兴致。

它还能委托。对话进行到一半,它可以把需要动脑的活递给后端模型,比如 GPT-6 Astra,递出去之后嘴不停,接着跟你聊。简单请求路由给便宜模型,复杂请求才请出贵的。通话开着,不等于一直在烧最贵的推理。

配套的细节还有一批:12 个声音跨口音和方言,电话场景直接支持,模型顺手把你说的话和它的回答都吐成文字,方便你留存。它走的是一条叫 live sessions 的独立通道,说人话就是专门跑实时语音的专线,老的 Chat Completions 文本接口接不了它。

嘴和脑分开计价

计价方式比模型本身更值得盯。每分钟 0.05 美元只是语音层的价格,按秒计费不进位。后端模型的推理、工具调用,按它们自己的正常价另算。

我把口径摊开,你自己算:

项目 口径 价格
语音层 按通话时长,按秒计 每分钟 $0.05
后端推理 按模型 token,正常 API 价 另算
工具调用 按所用工具的价 另算

上次 GPT-5.6 是按聪明程度分档卖,这次是按器官分工卖:嘴一个价,脑一个价。

拆着卖还有一层意思:嘴的价格锁死了,脑的部分你随便换。今天配 GPT-6 Astra,明天换成便宜的跑简单请求,嘴都不用动。计价切在嘴和脑之间,等于把选哪个脑子的权力,还给了开发者。

账别只看嘴价。我做过一套有声书。合成之前我拿正文字数估了个成本,自以为很稳。结算那天账单出来,是预估的 1.7 倍。我翻着明细对了半天才发现:标点在算钱,空格在算钱,连每句话之间那半秒的停顿,都在算钱。语音这东西的账单,从来比标价胖。OpenAI 自己也提醒:该按每次接通解决任务的完整成本算,不是按分钟价。

有个早期客户把级联语音栈换成 GPT-Live-1,转写、状态机、打断判断那一摞胶水代码全不要了,删了约两万三千行,相当于把接力赛四棒之间所有的交接棒代码整个撕掉。官方引用这个案例时老实标注了是个案,别拿它推自己的项目。

跑分那边还有一组数:配套后端模型跑 Tau3,一个专测语音 agent 完成任务的评测,它配 GPT-6 Astra 排第一,任务成功率 86.2%,上一代 Realtime 是 45.7%。不过这些都是厂商发布口径,我自己那句老话还得放上:榜是别人的考场,我项目里好不好用才是我的考场。

你的语音要对话吗

回到开头。我为什么想岔了?因为记账场景里,级联管线反而是对的。

我的语音记账不需要对话。用户说完一句话,要的是一条结构化记录,来回聊反而是打扰。级联加兜底便宜、可控、好调试:规则能吃下八成的单子,大模型只兜剩下的两成,兜不住还有 2 秒超时给我垫底。全双工的「同时」,在这个场景里是白付的能力。

顺带交代我自己的语音入口。我天天口喷豆包,语音转成文字喂给 Claude Code 干活。看着是语音工作流,其实还是排队:豆包转完,Claude 接住才开干,中间没有「同时」。真给它配上全双工的耳朵和嘴,我的工作流会变成什么样,我自己也还没想清楚。

做记账功能那阵子我还撞见过一个同路人。有个学生拿小米遥控器给 Mac 当控制器,语音那一步同样不自己做识别,把声音搬给现成的输入法。我当时看完只想到自己那套规则解析,原来绕了半天,聪明人的答案都一样:识别这种又重又成熟的活,别自己造,把搬运和兜底做好就行。这条工程直觉没变,只是全双工出现后,它的适用域被划得更清楚了。

分界线在这儿。

要对话、要打断、要边聊边办事的,客服、订座、语音 agent,全双工是正经新选项。一次输入、一个结果、不需要来回的,转写加大模型那条老路还是更省。

老实交代,GPT-Live-1 我还没接,这篇讲的是公告和多方核实的事实,不是我的实测。厂商基准是发布时的口径,独立的生产实测还没跟上,延迟到底什么体感,得等我真接一段再说。全双工听着美好,打断接得顺不顺、背景噪音扛不扛得住、长时间通话稳不稳,这些只有真跑起来才知道。

我打算拿它做个小实验:给记账加一个对话版,让它边聊边记,看看嘴价加脑价,算下来比我那条 2 秒超时的土管线贵多少。跑通了单独写一篇跟你对账。

你手头有没有那种说出来比打字快的场景?你现在是语音转文字再喂给模型,还是已经在琢磨全双工的事了?评论区聊聊,我想看看有多少人的管线跟我一样,还在排队。