两行配置,把腾讯 770B 开源旗舰接进你的 Claude Code

Hello,我是飞飞。
这两天刷资讯,你多半也看到那条消息了:硅基流动上线 Hy4 preview,770B 参数、1M 上下文,模型卡里还专门写了句「深度适配 Claude Code」。
我头一眼也把它读成了「腾讯发新模型了」。查完发现是个乌龙。Hy4 preview 是腾讯混元 8 月 28 号就发布开源的模型,9 月 14 号这条新闻,本体只是硅基流动新添了一个托管渠道。货架换了,货还是那件货。
把口径掰正再开聊,是因为这篇要算的所有账,都建立在这颗模型是谁、什么时候出的之上。先把结论放在前面:接入是官方铺好路的,改三处配置就能试;价格表里有一格真便宜的;跑分要带尺子看。至于我反复讲的那句老判断,便宜模型顶得了「活」,顶不了「底座」,这篇会给你最新的验算过程。
先纠一个口径
Hy4 preview 是混元 Hy 系列的新一代。前任 Hy3 是 295B 总参数、256K 上下文,这次一口气翻到 770B 总参、1M 上下文。Apache 2.0 协议,权重挂在 Hugging Face 上,连 FP8 量化版都给了,就是那个把权重压掉一半精度的瘦身版。
770B 听着吓人,其实不是一次请求就激活 770B。它是 MoE 架构,说人话就是一大屋子专家,每个 token 来了只叫醒其中几个。Hy4 屋里坐着 256 个路由专家加 1 个共享专家,每个 token 选中 8 个路由专家带上共享专家,算下来激活 49B。身板是旗舰级的,干活的量是中档模型的,价格才压得下来。
那 9 月 14 号的新闻值不值得单写一篇?值得,但值的点在渠道,不在模型。硅基流动这次上架,把「怎么用上它」的门槛打到了最低,模型卡里明写深度适配 Claude Code、OpenClaw、OpenCode 和 Kilo Code 这类工具。对一个模型来说,能不能舒服地长在你现有的工作流里,比跑分表上多两分要紧得多。
接进现有工作流难不难
腾讯云的 API 文档写得很清楚,Hy4 preview 同时兼容三种协议:OpenAI Chat Completions、OpenAI Responses,还有 Anthropic Messages。
真正关键的是最后一种。Claude Code 认的就是 Anthropic 这套协议,也就是说理论上改个 base_url、填个 key、换个模型名,就能让它顶到 Opus 的位置干活。严格说算三处改动,但全是配置,一行代码不用动。
这套换后端的路子我是真跑通过的。之前 Anthropic 封号潮那阵,我把 ANTHROPIC_BASE_URL 指到别家,改完配置重启,终端还是那个终端,快捷键、我的 skill 列表一个没变,变的只是背后干活的模型,而它照样把活接住了。当时最直观的感受就一句:换底座这件事,没想象中那么玄。顺手交代一句,我日常其实早就在用国产模型顶活了:我那套知识库大脑,对话层走的就是 DeepSeek,每天在跑。但那是替它顶活,家我没搬,不离手的主力还是 Opus。
换后端那条我也写过实话:两行配置只是门票,麻烦全在后面。我那条写文章的流水线挂着十几个 skill,每个都照着 Claude 的脾气磨过,换个模型,工具调用的格式十有八九会飘,得挨个重校。
更早用 Ollama 接 gemma4 那次,坑我记得更清楚:上下文长度得手写进配置,不然转不动;模型生成到一半停住,原地打转,我盯着屏幕等了四十秒才反应过来它卡住了。所以「接得进」和「用得顺」中间隔着一整个实测区。这一段 Hy4 我还没跑过,不装懂,后面细说我的打算。
成绩单要看用什么尺子
先声明一句,我最近几篇老在掐厂商自报的数字,这篇不想再当跑分怀疑论,所以下面把口径标清楚就放下,重点不在揪分数。
Hy4 的成绩,三张尺子三个读法。Agent Arena 上它排开源第 2。LMArena 的 Code Arena WebDev 榜,人类盲评投出来大约全球第 5、开源里第 3,不过官方自己标了这是早期的自动评测位置,会随票数重排。腾讯自家还做了个盲测,163 名内部专家、203 个工程任务,Hy4 拿 2.99 分,GLM-5.3 是 2.92,Kimi K3 是 2.94。自家专家自家任务,半分之差,这个数当「同一梯队」读合适。要读成「更强」,就过了。
自动化评测那边,官方口径不差:Terminal-Bench 2.1 拿 85.4,DeepSWE 64.3。但这两个数眼下没有独立第三方复核过,先当宣传页读,等别人跑完再记进成绩单。
独立聚合是另一副面孔。benchlm 这类站点上,它的智能体工具使用类排到 153 个模型里的第 30。两副面孔都真,只是一把尺子量人类偏好,一把量工具调用能力。
最扎人的对照在价格那头。同一张 Agent Arena 榜,开源第 3 名是 DeepSeek-V4.1-Flash,每个任务中位成本 0.07 美元,比 Hy4 低 68%,成绩只差 0.09 个百分点。开源第 2 和第 3 之间,隔着的几乎全是钱。
缓存才是账单大头
硅基流动的价目:输入每百万 token 6 块,输出 18 块。同站的 GLM-5.3,输出是 28 块。海外 OpenRouter 口径是 0.834 美元进、2.501 美元出。
价目表上最值得盯的,其实是最不显眼那一格:缓存,每百万 token 0.042 美元,折人民币三毛左右。
跑 agent 的都懂这个理。Claude Code 每一轮都要把系统提示、CLAUDE.md、十几个 skill 的描述原样重发一遍,上下文越长,重发的部分越贵,缓存命中率直接决定你烧多少钱。这事我有切身数字:之前发现 CLAUDE.md 的每一行每一轮都会当 prefix 重发,就把它从 12KB 砍到 4KB,缓存命中率从三成拉到七成三,一个月的账单从 106 美元压到 33 美元。同样的活,缓存单价便宜这么多,对天天跑长任务的人是真金白银。
短板也得摆上桌,有几条还是官方自己认的:复杂任务会想得太久、过度验证,这是 preview 阶段的通病;纯文本,没有视觉,读不了图;FP8 加八卡并行才跑得动,自部署门槛不低。InfoQ 在 WorkBuddy 里实测后的判词我觉得挺准:开始具备把一件事做完的能力,但人还是最后一道防线。
托管渠道这边也有一段前科得记着。7 月 Hy3 接进 WorkBuddy 后撞上过算力挤兑,排队率一度超过五成,腾讯紧急扩容才压下去。热门开源模型上新,头几周的渠道体验往往配不上模型本身,这也是我打算先小流量试、不急着迁活的原因之一。
哪类活值得交出去
我的秤还是那三个数:这活错一点的代价,一天要跑多少次,乘上单价。
按这个秤,Hy4 适合接的是高频、量大、但对质量不那么苛刻的活。把一个陌生的大仓库整个喂进去理模块关系,1M 上下文正好吃得下;大段日志、长文档先过一遍捞重点;写作流水线里判得死的初筛活,比如查重和格式检查,错了当场能看出来。缓存又便宜,重上下文反复跑,账越算越划算。
把它放进这两年的曲线里看,位置就更清楚。从 DeepSeek R1 到 Kimi K2,到 MiniMax M3,到冲进 Code Arena 全球前几名的 Qwen3.7-Max,再到 LongCat 和 Ring,国产开源一直卡着「开源加低推理成本」这个位置往前拱,闭源旗舰因为商业模式够不到这里。Hy4 是这条曲线上最新的一格,而它真正值得注意的打法变化是,腾讯没去卷单轮聊天,把训练重心压在了 agent 和生产力场景上,这恰好是你我这类天天派活给 agent 的人最吃的那一口。
写稿、润色、关键重构这些错一步就得返工的,我暂时一个都不交。不是我保守,是疼过。前阵子拿便宜模型把一个七千行的 SpringBoot 老项目翻成 Kotlin,切文件喂上下文,切着切着它把我前面改过的字段忘了,回头又改坏一处,我顺着它的改动往回倒,耗掉大半个下午。这种活,账不能只看单价。
所以绕回那句老话,它顶得了「活」,顶不了「底座」。真把底座搬过去,光重写十几个 skill 的描述、重调那套防 AI 味的规则,一周两周下不来,这笔成本价目表上从来不印。Hy4 便宜了,能打了,这个格局没变。
口径交代清楚:这篇我没真跑过 Hy4,上面的数字全部核过出处,但「用得顺不顺」这件事,纸面算不出来。我的计划是拿判得死的初筛活先喂它一周,跑完回来交账,顺还是飘,到时候摆数字给你看。
轮到你了:要是你也在 Claude Code 里接过国产模型,踩的头一个坑是工具调用飘了,还是上下文后段乱了?评论区聊聊,我想看看这两类坑哪个更常见。