蒸馏吵了一年,这回美国政府下场点名了六家

Hello,我是飞飞。
六月底我写过一篇,Anthropic 指控阿里想蒸馏 Claude 的能力,我天天靠 Claude 吃饭,但选择先不站队。当时我的判断是,蒸馏这摊水谁的手都不太干净,没有证据掰扯不清,先等等看。
三个月后,事态换了个量级。9 月 8 号,美国国家安全局、联邦调查局和 CISA 三家机构发了一份联合公告,点名六家中国 AI 公司。厂商之间的口水战,政府下场接手了。
我把公告原文核了一遍,先把我看到的摊开,再回头对一遍我六月留下的判断,哪些站住了,哪些得改。
这回点名的名单
公告编号 AA26-251A,标题里就带着定性的词:工业规模蒸馏行动。蒸馏说人话就是,拿强模型的输出当老师,去教自己家弱一点的模型,省去从头训练的钱和时间。
被点名的六家:DeepSeek、月之暗面 Moonshot AI、阿里、MiniMax、StepFun、Z.AI。
公告称,这些公司的行动「构成其 AI 发展战略的核心,而非补充」,从 2024 年底以来,从 Claude、GPT、Gemini、Grok 各系模型里提取了数十亿 token、横跨数百万次交互。注意公告里政府知情的措辞是「Likely with Chinese government awareness」,很可能,不是断言。
逐家的指控细节里,有一条扎得最深。公告称 DeepSeek 公开报的 560 万美元训练成本有误导性,因为没把蒸馏得来的数据的真实成本算进去。这话打的是 R1 那句「600 万美元做出 GPT-4 级别」的全球叙事。这条是真指控还是账目口径之争,公告没给原始证据,你当指控听,别当结论用。
其余几家的版本我逐家过一遍,全是公告口径。Moonshot 被指自 2025 年年中起,拿 Claude Fable 5 的数据练 Kimi-K3、GPT-4o 的数据练 Kimi-K2。阿里被指用工业规模蒸馏改进 Qwen 系列。注意,六月那篇的主角,这回在六家名单里。MiniMax 被指在 Claude 新模型发布 24 小时内就把请求切了过去。Z.AI 被指到今年年中蒸馏了数十亿 token 的 GPT-5.5 和 Opus 4.8 数据,专攻思维链能力。
手法层面公告也没空着:越狱式 prompt,逼模型把隐藏的思维链吐出来;跨司法辖区开壳公司,分布式操作避开单点检测。指控的颗粒度比厂商时代细得多,细到像是有人蹲在日志前看了几个月。
公告也留了口径缝:分析者说的 high confidence,来自多源遥测和查询关联的推断,原始证据数据没有公开。
这事吵了一年的旧账
这份公告背后有条升级线,每一步都有出处。
2 月,Anthropic 发布报告,称 DeepSeek、Moonshot、MiniMax 用约两万四千个欺诈账户跟 Claude 完成了一千六百万次交互。后来 OpenAI 向国会递信,指控 DeepSeek。7 月,白宫科技政策办公室官员点名 Moonshot 蒸馏 Anthropic 的 Fable 模型。
8 月初,商务部把 DeepSeek 放进实体清单,美国境内访问不了它的服务器。9 月 8 号,三机构公告把六家的指控合并成一份评估。Bloomberg 报道说,五眼伙伴预计这几天也会各自发公告。
还有个时间背景:公告卡在 Trump 与习近平会晤前夕发布。地缘的事我不展开,我只提醒一句,选在这个点发,它就不只是技术公告,更像牌桌上先亮出来的一张牌。
我六月那篇里有个细节现在看更有意思:当时厂商指控的规模是两万四千个账户,这次公告说六家共用的手法是跨司法辖区开壳公司、分布式操作避单点检测。从小作坊到工业流水线,指控的调门也跟着升级了。
六月的三条判断对账
六月我留了三条判断,现在逐条对账。
头一条,灰色地带谁的手都不太干净。这条站住了,而且两边都在继续印证。公告指控中方蒸馏,可就在七月,Anthropic 往 Claude Code 里塞的防蒸馏遥测代码,被中方平台点名成「后门」,Anthropic 自己的解释是防滥用实验。一个在明处偷着学,一个在暗处防着盯,灰色地带还灰色。
另一条,没有证据掰扯不清。这条也站住了。公告把「怎么薅」的每一步都编了号,还对照了一本叫 MITRE ATLAS 的攻击手法手册,逐家列了路数,但原始遥测数据一份没公开。技术上你怎么信,公告说凭遥测关联;证据上你能查什么,什么都没给。
还有一条,先不站队。这条得改半条。厂商指控可以当利益相关方的话打折听,政府情报机构的结论权重不一样,再拿「厂商互撕」的老框架去套,就不老实了。但公告自己用了 Likely,证据没摊开,我六月那套「把已知和未知分清楚」的方法照旧成立,只是这么做的成本变高了。
Moonshot 的回应目前只有一条:坚持称模型是独立研发。其余五家截至发稿我没核到公开回应,有的话以各家官方渠道为准。
最戏剧的一条建议
公告里我反复读的是给美国厂商的建议那段。官方原话是,对疑似恶意蒸馏的请求,「subtly alter responses」,悄悄地改变回复内容,压低蒸馏的收益。
说白了,政府建议厂商:怀疑谁在薅你的模型,就暗中给他的回答掺水,降智但不告知。
这段我看着眼熟。七月那起遥测代码风波里,质疑的核心正是这段代码理论上能对识别出来的用户降智、限速,Anthropic 否认做过。当时「厂商会不会暗中给可疑用户降级」还是个阴谋论式的问题。
两个月后,同一件事写进了政府公告的官方建议里。从阴谋论到操作手册,就隔了一份 PDF。
对普通用户这意味着什么,公告没说,我也没证据说它已经发生。但「你拿到的回答可能因为你被怀疑而变差」这件事从假设变成了被官方认可的手段,这条缝值得记下来。
跟我有关系的部分
我的处境有点拧巴,两重身份说给你听。
一重是 Claude 的付费用户。公告里的指控不管真假,都不改变我今天用到的模型能力,该好用还是好用,这点六月我想明白了,现在没变。
另一重是国产模型实测者。六月写 MiMo 的时候我提过一句:它的官方文档白纸黑字写着「兼容 Anthropic Dynamic Workflow 的核心语义」,明说是照着抄的。MiMo 那种借鉴成熟设计,和公告指控的工业规模蒸馏,中间隔着一条又粗又模糊的线。
这条线的麻烦在于,设计层面的对齐是公开的、可查的,输出层面的蒸馏是暗的、难证的。公告这次把线往严了画,可画线的证据没公开,线两边的从业者,日子都会更难。
还有一笔我能自己算的账。我跑多智能体协作,烧的 token 是普通对话的十几倍,月底账单都看得见。把这份体感乘到公告的规模上:数十亿 token、数百万次交互,按旗舰模型输出 50 美元一百万 token 的牌价,十亿 token 就是五万美元起步,几十亿就是几十万到几百万美元的调用费。
蒸馏省的是训练费,烧的是调用费,这笔账公告没替任何人摊开。
轮到你了:六月我问过你,先信指控还是先等等看。现在指控的一方从厂商换成了政府,你的答案变了吗?还有,如果你发现自己用的 AI 回答突然变差,你会想到这份公告里的那条建议吗?评论区聊聊。
公告里还有一条线我没展开:五眼伙伴的公告这几天就要陆续发,措辞框架据说会和华盛顿版不一样。等它们出来,回来对一遍。