说真的,27B 本地跑出 Opus 4.6 的编程分,我没想到是今年

Hello,我是飞飞。
上周四下午,Qwen 团队在 X 发了一条推:「我们承诺过的开源权重来了。」
我点开图,盯着那张跑分表看了好几秒。SWE-bench Pro,Qwen3.8-27B 得了 61.7 分,Claude Opus 4.6 Max 是 53.4 分。27B 参数的开源模型,在衡量真实软件工程能力的榜上赢了旗舰 API。
我愣了一下,心里冒出的第一个念头是:这事是真的吗?
跑分背后那张表
Qwen 官方 model card 列了一张对照表,三列:Qwen3.8-27B、Qwen3.6-27B(上代)、Claude Opus 4.6 Max。全是 Qwen 官方自测数据,用的是 Claude Code harness:
| 任务 | Qwen3.8-27B | Qwen3.6-27B | Opus 4.6 Max |
|---|---|---|---|
| SWE-bench Pro(软件工程) | 61.7 | 53.5 | 53.4 |
| DeepSWE 1.1(智能体编码) | 42.2 | 13.3 | — |
| LiveCodeBench v6(代码竞赛) | 90.3 | 83.9 | 88.8 |
| CoWorkBench(长时协同) | 70.7 | 61.0 | 68.2 |
| IFBench(指令遵从) | 79.5 | 69.1 | 62.5 |
| Terminal Bench 2.1(终端操作) | 73.0 | 63.4 | 78.2 |
| GPQA Diamond(科学推理) | 89.2 | 87.8 | 91.3 |
| HLE(人文最后考试) | 30.8 | 24.0 | 40.0 |
Qwen 赢了编程智能体那块:SWE-bench Pro、DeepSWE、CoWorkBench、LiveCodeBench、IFBench。Opus 赢了 Terminal Bench、GPQA Diamond、HLE,也就是终端实操、科学推理、人文综合。
两边各有擅长的地方,编程智能体那块是 Qwen 赢,科学推理和人文那块是 Opus 赢。碾压没有,分科了。
说真的,比 SWE-bench 更让我关注的是 DeepSWE 1.1 那个数:Qwen3.6-27B 得了 13.3,Qwen3.8-27B 得了 42.2。一个版本,跳了三倍多。
你知道 DeepSWE 在测什么吗?它测的是模型能不能独立打开真实 GitHub 仓库、读懂 issue、自己写代码、自己验证通过。真刀真枪解决工程问题,不是多选题。
上一代 27B 得 13 分,这代 42 分,对手是 Anthropic 的旗舰 API。这个幅度不像是线性进步,更像是某个技术节点被打穿了。
把三个数字放在一起想:一代 27B 本地模型,智能体编码分跳了三倍,它要超越的那条线是旗舰 API,它要运行的硬件是你的 Mac 或者消费级 GPU。「今年有什么东西悄悄变了」这种感觉,大概就是从这里来的。
这几个数的信任度有多高
我用 Qwen 的数,但不会假装它们是独立验证的。
全部是 Qwen 官方自测。kingy.ai 在发布当天(8 月 14 日)做过检索,没有找到任何独立的 benchmark 复现结果。Artificial Analysis 这类第三方机构目前也没跑过。
还有一个脚注要说:SWE-bench Pro 那列,Qwen 用 Claude Code harness 跑了自家模型,但 Opus 4.6 Max 的 53.4 分是直接引用 Anthropic 官方数字,不是同等条件重跑的。两组数的产出方式不完全一致,对比的时候要心里有数。
多模态那张表有些数差距更大,OSWorld(电脑操控)84.3 vs Opus 的 72.7、AndroidWorld(手机操控)81.9 vs 62.0。但背后有多少是「Qwen 在自家测试集上练过」,目前没有足够外部信息判断。
说白了:这些数字当方向看是成立的,Qwen3.8-27B 在编程智能体任务上确实有一次明显跃升。当精确结论用,还需要等第三方跑完。
本地跑起来要什么
这个模型能在消费级硬件上跑,这一点比跑分更实际。
API 账单涨得快的团队,或者数据不想出本机的私活,「模型能不能装进我的机器」这个问题比榜单排名重要得多。
原始 BF16 权重约 55.6 GB,大多数人不会直接跑这个。量化版本把体积压下来了:4-bit GGUF 约 16 GB,8-bit 约 30 GB。双 RTX 4090 共 48 GB 显存,跑 4-bit 有余量,社区测试大约 80 token/s。
Mac 用户:32 GB 统一内存的 Mac Studio 或 MacBook Pro 可以跑 MLX 4-bit 版本(约 16.1 GB)。8-bit 需要 48 GB 以上。LM Studio 已经支持,最低量化版本需要约 17 GB RAM。AMD 那边,Ryzen AI Max+ 和 Radeon AI PRO R9700(32 GB 显存)官方确认可用。
这里要提醒一件事:官方跑分基于 BF16 原始权重。你在 Mac 上跑 4-bit 版本,实际表现会比表里的数字低一截,通常差几到十几个点。量化有损耗,这是正常的工程取舍,但别拿跑分数字直接当预期。
真正的问题在哪
如果量化损耗不太严重,一张 24 GB 显存的消费级 GPU 现在可以本地运行一个在编程任务上能跟旗舰 API 掰手腕的模型。
这打开了几道账。
API 成本那道账:OpenRouter 上 Qwen3.8-27B 是 $0.45 输入 / $3.20 输出(每百万 token),比大多数旗舰 API 便宜一个数量级。本地部署买断硬件之后边际成本趋近于零。我每个月给 Anthropic 不少钱,这件事从来不是问题,但它让我每次用 Opus 前都会在心里掂量一下值不值得。你懂那种感觉吗,打开一个新对话,脑子里先过一遍「这个活用 Haiku 够不够,非要上 Opus 吗」。如果这道心算消失了,日常工作流会有什么变化,我还没想清楚,但感觉值得认真想一想。
隐私那道账:对一部分场景来说,不走 API 数据不出本机,根本就是前提条件,加分项都谈不上。有些客户的代码或者内部文档,上任何云服务都得过一道审批;本地模型绕开了这道门槛,哪怕它的能力比云端旗舰差一点,也值得用。一些做医疗、法律、金融的团队,这道门槛根本就是合规红线,绕不开的那种。
OpenRouter 首日数据能看出一点信号:Kilo Code 和 Zed Editor 这两个编程工具率先接入,首日合计调用量超过 700 万 tokens。开发者工具先动,说明编程场景是这个模型第一批能落地的地方,这和跑分数据对得上。
还有一道账没人帮你算:量化损耗加上本地推理速度,真实任务里能不能替代旗舰 API?取决于你用它干什么活,以及你能接受什么样的速度。我自己还没在流水线里正经跑过,目前只是在看数字。等我拿真活试过了,会回来补一篇。
这件事真正的门槛其实已经从「能不能买到一张好 GPU」变成了「愿不愿意花时间适配工具链」。硬件条件够用的人越来越多,但把量化模型接进本地 coding agent 流水线、调好推理参数、稳定跑起来,这套工程工作仍然需要时间投入。对大多数人来说,这才是真正的成本所在。
架构改了什么
说人话讲一下架构,因为这直接影响本地跑的体验。
Qwen3.8-27B 用了 Gated DeltaNet 线性注意力和标准注意力的混合结构,64 层里 48 层是 Gated DeltaNet,16 层是全量注意力,交替排布。
线性注意力的好处是:每个 token 的计算量不随上下文变长而爆炸。这让 Qwen3.8-27B 能把原生上下文推到 262K tokens,而绝大多数同体量本地模型的上下文窗口在 32K 到 64K 之间。
一个稍微复杂的项目,代码文件加历史对话塞进去,很容易超 64K。超了就得截断,截断就丢上下文,然后模型开始犯低级错误。262K 把这个临界点推远了很多。
要提前说清楚:100 万 tokens 需要 YaRN 扩展,有性能损耗。32GB Mac 上跑 4-bit 版本,实际能稳定跑的上下文远没有 262K 那么长,KV cache 内存随上下文线性增长,硬件还是那道墙。
模型还支持多 token 预测,说人话就是每步推理同时算好几个下一步。这让双 RTX 4090 上的吞吐量能到 80 token/s,跑长链任务不算慢。
我现在的处理方式
我最近连续写了几篇对厂商自报跑分存疑的文章。写着写着,「质疑跑分」本身快变成一种新范式了。这我意识到了,所以这篇想换一个姿态。
不纠结「Qwen 是不是又在刷榜」,只看这张表里哪些数值得认真对待,哪些还需要等。
DeepSWE 跳三倍那个,值得认真对待。幅度太大,说明有什么东西变了,不像噪声。SWE-bench Pro 那个,我会等第三方复现,因为两组数的产出条件本来就不完全一致。多模态那几个,信息不足,先挂着。
有一件事我一直想说:厂商跑分被批评「自吹自擂」,这很合理。但如果你只要求别人不刷榜,却从不仔细读那张表里的数字,最后掌握信息的只有发榜的人自己。我读 Qwen 这张表,不是出于完全相信它,而是因为不读就什么都不知道。
两件事可以同时为真:数字需要独立验证,以及这个方向确实值得关注。用其中一句否定另一句,就是把事情想简单了。
你现在本地用着开源模型做编程任务吗?用的哪个,体感上和用 API 差距大不大?