说真的,27B 本地跑出 Opus 4.6 的编程分,我没想到是今年

cover

Hello,我是飞飞。

上周四下午,Qwen 团队在 X 发了一条推:「我们承诺过的开源权重来了。」

我点开图,盯着那张跑分表看了好几秒。SWE-bench Pro,Qwen3.8-27B 得了 61.7 分,Claude Opus 4.6 Max 是 53.4 分。27B 参数的开源模型,在衡量真实软件工程能力的榜上赢了旗舰 API。

我愣了一下,心里冒出的第一个念头是:这事是真的吗?

跑分背后那张表

Qwen 官方 model card 列了一张对照表,三列:Qwen3.8-27B、Qwen3.6-27B(上代)、Claude Opus 4.6 Max。全是 Qwen 官方自测数据,用的是 Claude Code harness:

任务 Qwen3.8-27B Qwen3.6-27B Opus 4.6 Max
SWE-bench Pro(软件工程) 61.7 53.5 53.4
DeepSWE 1.1(智能体编码) 42.2 13.3
LiveCodeBench v6(代码竞赛) 90.3 83.9 88.8
CoWorkBench(长时协同) 70.7 61.0 68.2
IFBench(指令遵从) 79.5 69.1 62.5
Terminal Bench 2.1(终端操作) 73.0 63.4 78.2
GPQA Diamond(科学推理) 89.2 87.8 91.3
HLE(人文最后考试) 30.8 24.0 40.0

Qwen 赢了编程智能体那块:SWE-bench Pro、DeepSWE、CoWorkBench、LiveCodeBench、IFBench。Opus 赢了 Terminal Bench、GPQA Diamond、HLE,也就是终端实操、科学推理、人文综合。

两边各有擅长的地方,编程智能体那块是 Qwen 赢,科学推理和人文那块是 Opus 赢。碾压没有,分科了。

说真的,比 SWE-bench 更让我关注的是 DeepSWE 1.1 那个数:Qwen3.6-27B 得了 13.3,Qwen3.8-27B 得了 42.2。一个版本,跳了三倍多。

你知道 DeepSWE 在测什么吗?它测的是模型能不能独立打开真实 GitHub 仓库、读懂 issue、自己写代码、自己验证通过。真刀真枪解决工程问题,不是多选题。

上一代 27B 得 13 分,这代 42 分,对手是 Anthropic 的旗舰 API。这个幅度不像是线性进步,更像是某个技术节点被打穿了。

把三个数字放在一起想:一代 27B 本地模型,智能体编码分跳了三倍,它要超越的那条线是旗舰 API,它要运行的硬件是你的 Mac 或者消费级 GPU。「今年有什么东西悄悄变了」这种感觉,大概就是从这里来的。

这几个数的信任度有多高

我用 Qwen 的数,但不会假装它们是独立验证的。

全部是 Qwen 官方自测。kingy.ai 在发布当天(8 月 14 日)做过检索,没有找到任何独立的 benchmark 复现结果。Artificial Analysis 这类第三方机构目前也没跑过。

还有一个脚注要说:SWE-bench Pro 那列,Qwen 用 Claude Code harness 跑了自家模型,但 Opus 4.6 Max 的 53.4 分是直接引用 Anthropic 官方数字,不是同等条件重跑的。两组数的产出方式不完全一致,对比的时候要心里有数。

多模态那张表有些数差距更大,OSWorld(电脑操控)84.3 vs Opus 的 72.7、AndroidWorld(手机操控)81.9 vs 62.0。但背后有多少是「Qwen 在自家测试集上练过」,目前没有足够外部信息判断。

说白了:这些数字当方向看是成立的,Qwen3.8-27B 在编程智能体任务上确实有一次明显跃升。当精确结论用,还需要等第三方跑完。

本地跑起来要什么

这个模型能在消费级硬件上跑,这一点比跑分更实际。

API 账单涨得快的团队,或者数据不想出本机的私活,「模型能不能装进我的机器」这个问题比榜单排名重要得多。

原始 BF16 权重约 55.6 GB,大多数人不会直接跑这个。量化版本把体积压下来了:4-bit GGUF 约 16 GB,8-bit 约 30 GB。双 RTX 4090 共 48 GB 显存,跑 4-bit 有余量,社区测试大约 80 token/s。

Mac 用户:32 GB 统一内存的 Mac Studio 或 MacBook Pro 可以跑 MLX 4-bit 版本(约 16.1 GB)。8-bit 需要 48 GB 以上。LM Studio 已经支持,最低量化版本需要约 17 GB RAM。AMD 那边,Ryzen AI Max+ 和 Radeon AI PRO R9700(32 GB 显存)官方确认可用。

这里要提醒一件事:官方跑分基于 BF16 原始权重。你在 Mac 上跑 4-bit 版本,实际表现会比表里的数字低一截,通常差几到十几个点。量化有损耗,这是正常的工程取舍,但别拿跑分数字直接当预期。

真正的问题在哪

如果量化损耗不太严重,一张 24 GB 显存的消费级 GPU 现在可以本地运行一个在编程任务上能跟旗舰 API 掰手腕的模型。

这打开了几道账。

API 成本那道账:OpenRouter 上 Qwen3.8-27B 是 $0.45 输入 / $3.20 输出(每百万 token),比大多数旗舰 API 便宜一个数量级。本地部署买断硬件之后边际成本趋近于零。我每个月给 Anthropic 不少钱,这件事从来不是问题,但它让我每次用 Opus 前都会在心里掂量一下值不值得。你懂那种感觉吗,打开一个新对话,脑子里先过一遍「这个活用 Haiku 够不够,非要上 Opus 吗」。如果这道心算消失了,日常工作流会有什么变化,我还没想清楚,但感觉值得认真想一想。

隐私那道账:对一部分场景来说,不走 API 数据不出本机,根本就是前提条件,加分项都谈不上。有些客户的代码或者内部文档,上任何云服务都得过一道审批;本地模型绕开了这道门槛,哪怕它的能力比云端旗舰差一点,也值得用。一些做医疗、法律、金融的团队,这道门槛根本就是合规红线,绕不开的那种。

OpenRouter 首日数据能看出一点信号:Kilo Code 和 Zed Editor 这两个编程工具率先接入,首日合计调用量超过 700 万 tokens。开发者工具先动,说明编程场景是这个模型第一批能落地的地方,这和跑分数据对得上。

还有一道账没人帮你算:量化损耗加上本地推理速度,真实任务里能不能替代旗舰 API?取决于你用它干什么活,以及你能接受什么样的速度。我自己还没在流水线里正经跑过,目前只是在看数字。等我拿真活试过了,会回来补一篇。

这件事真正的门槛其实已经从「能不能买到一张好 GPU」变成了「愿不愿意花时间适配工具链」。硬件条件够用的人越来越多,但把量化模型接进本地 coding agent 流水线、调好推理参数、稳定跑起来,这套工程工作仍然需要时间投入。对大多数人来说,这才是真正的成本所在。

架构改了什么

说人话讲一下架构,因为这直接影响本地跑的体验。

Qwen3.8-27B 用了 Gated DeltaNet 线性注意力和标准注意力的混合结构,64 层里 48 层是 Gated DeltaNet,16 层是全量注意力,交替排布。

线性注意力的好处是:每个 token 的计算量不随上下文变长而爆炸。这让 Qwen3.8-27B 能把原生上下文推到 262K tokens,而绝大多数同体量本地模型的上下文窗口在 32K 到 64K 之间。

一个稍微复杂的项目,代码文件加历史对话塞进去,很容易超 64K。超了就得截断,截断就丢上下文,然后模型开始犯低级错误。262K 把这个临界点推远了很多。

要提前说清楚:100 万 tokens 需要 YaRN 扩展,有性能损耗。32GB Mac 上跑 4-bit 版本,实际能稳定跑的上下文远没有 262K 那么长,KV cache 内存随上下文线性增长,硬件还是那道墙。

模型还支持多 token 预测,说人话就是每步推理同时算好几个下一步。这让双 RTX 4090 上的吞吐量能到 80 token/s,跑长链任务不算慢。

我现在的处理方式

我最近连续写了几篇对厂商自报跑分存疑的文章。写着写着,「质疑跑分」本身快变成一种新范式了。这我意识到了,所以这篇想换一个姿态。

不纠结「Qwen 是不是又在刷榜」,只看这张表里哪些数值得认真对待,哪些还需要等。

DeepSWE 跳三倍那个,值得认真对待。幅度太大,说明有什么东西变了,不像噪声。SWE-bench Pro 那个,我会等第三方复现,因为两组数的产出条件本来就不完全一致。多模态那几个,信息不足,先挂着。

有一件事我一直想说:厂商跑分被批评「自吹自擂」,这很合理。但如果你只要求别人不刷榜,却从不仔细读那张表里的数字,最后掌握信息的只有发榜的人自己。我读 Qwen 这张表,不是出于完全相信它,而是因为不读就什么都不知道。

两件事可以同时为真:数字需要独立验证,以及这个方向确实值得关注。用其中一句否定另一句,就是把事情想简单了。

你现在本地用着开源模型做编程任务吗?用的哪个,体感上和用 API 差距大不大?