我让 Claude 写稿,有人让它写导弹制导软件

cover

Hello,我是飞飞。

我开工有个固定动作:把活拆给一队 Claude 实例。一个搜资料,一个写初稿,一个挑毛病。这套分工我跑了半年多,顺得已经不假思索。

上周 Anthropic 发了份威胁报告,我在里面看到了一模一样的分工。写代码的、做研究的、审代码的,各占一个实例,排班排得明明白白。区别只有一件事:他们用这套分工开发导弹制导软件。

这份报告最值得带走的,是一条边界:检测抓得住还在用你服务的阶段,抓不住已经打包离场的成果。这条边界,跟我这种把全部生产力押在 Claude 身上的人,关系不小。

先说清楚是谁干的

报告 9 月 10 日发布,官方名字挺长,说人话就是《我们怎么发现并拦住 Claude 被滥用》。覆盖去年 12 月到今年 8 月,横跨网络攻击、监控、影响力行动等七类滥用。常规武器这一节一共六个案例,中国三个,俄罗斯两个,也门一个。

也门这个就是刷屏的那个。先校准一个口径:官方原文只写了「也门北部的威胁行为者小组」,从头到尾没出现「胡塞」两个字。也门北部是胡塞控制区,外媒据此推断关联,中文报道再往前推一步直接点名。原文没坐实的,正文里我也只按原文写。

这个小组同时在推进三个武器项目。一个是制导火箭,用的是手机级别的飞行计算机,末段寻的;一个是多级弹道导弹,宣称射程目标超过两千公里;还有个代号 R2000 的导弹族,里面有个型号带高超声速滑翔载具。制导火箭是真试射了的,试射失败,几个小时后他们回到 Claude 查失败原因。

口径钉在这儿。往下这部分,是我读得最不舒服的。

跟我的流水线一个模子

官方报告里有句原话:行为者用 Claude Code 替代人类软件工程师,开发 GNC 软件。GNC 就是制导导航与控制,管着飞行器怎么稳稳飞向目标的那些代码。具体干的事包括把开源自动驾驶仪集成到手机级飞行计算机上,写控制与位置估计软件,调参数,跑固件构建,做飞行仿真。

派活的方式更值得多看一眼。几个 Claude 实例同时开着,各干各的:一个写代码,一个做研究,还有一个专门审写代码那个实例的产出。报告原文把这比作小工程团队的 lead 在分活。

我读到这里把报告放下,回头看了一眼自己的流水线。选题阶段一个实例扫资讯打分,写作阶段三个实例接力:一个搜资料,一个写稿,一个按同理心、结构、观点、画面、比方、用词六个维度审稿打分,不到八十分打回重改。派活之前我心里会过一遍秤:这活错一点的代价,一天要跑多少次,再乘上单价。你现在读的这篇稿子,就是这条流水线出的货。

两张分工表几乎能逐行对上。工具没变,招式没变,变的是任务清单最上面那一行写的是什么。这是我头一回从滥用报告里照见自己。说实话,那一段我来回读了两遍。

还有比这更接近红线的案例。俄罗斯有个自由职业团队给 FPV 自杀式无人机装机载模型,那东西能自己认目标、自己下达起爆指令,全程无人在环。也门案例好歹每一步都有人拧阀门,俄罗斯那个是真把阀门拆了。

护栏到底拦住了什么

同一套工作流的两种用途与检测边界

Anthropic 自报的战绩写得很诚实:拦下了很多请求,但没全拦住。行为者的手法是隐藏目的、拆分会话,让任何单独一次对话看起来都无害。你从会话级信号里找异常,对手就把意图摊到几十个会话里,每个都干净得像日常开发。

发现之后的处置是标准动作:封禁关联账号,跟公私伙伴共享威胁情报,再上一批专门检测高爆弹药和武器开发流量的新分类器。

更扎人的是另一句。报告承认,这个小组已经建成一套不依赖 Claude 的离线仿真工具箱,还编译成了独立可执行文件。官方原话直译过来是:一份脱离 Claude 也能跑、也能留下来的交付物。

这就是那条边界的机制层。AI 在这件事里的角色是加速器,把过去要一个导弹工程小组才干得动的活,压缩成一个小小组的工期。加速出来的成果一旦编译落盘,封号就只剩迟滞的意义。检测天然是事后追认,而对手的每一步都在往前赶。

七月我写过 Claude Code 客户端里藏着 147 个域名的检测埋点。当时我把安装包解开,在一堆混淆过的字符串里把那 147 个域名一条条抠出来,自己跑了遍统计,终端里跳出来的数字和爆料对上了。原来半年前我就摸过这套系统的进料口,只是当时不知道它在喂谁。现在看,那套信号系统正是这份报告成绩单的进料口,它确实抓到了东西。只是等检测赶到的时候,货已经装车了,那份货叫独立可执行文件,封号封不到它头上。检测赢了那一局,整场还没赢。

锤子没法只递给好人

把机制想透一层,会碰到一个不太舒服的结论。Claude Code 的卖点是什么?替掉一支工程师团队。这个卖点对也门小组和对我,吸引力是同源的。能力本身没有善恶,也不带用户筛选器,你造不出一个只卖给写增删改查的人的版本。报告里好几个案例还都是靠 VPN 绕过地区封锁的,平台能查的始终是你干了什么,拦不住你是谁。手机级飞行计算机加开源自动驾驶仪,这两样本来就是公开货架上的商品,Claude 把它们缝起来的那双手,恰好也是我付钱买的那双手。

我的处境也跟着清楚了。每月付钱,十几个 skill 长在上面,我的每一次使用记录都是那套检测系统的数据源。系统从海量正常使用里捞异常,我待在「正常」那一堆里。这谈不上坏事,但它说明用得越深,跟检测的绑定就越深,工具的信任从来都跟这件事拴在一起。

还有一句公道话得说在前头。这份报告既是安全披露,也是 Anthropic 证明自己在认真管的材料,作者同时坐在裁判席和运动员席上。拦了多少、放了多少,只有它自己的日志知道。报告里那句「没全拦住」是它自己认的,这个诚实值得记一分,但外部验证依然缺席。

明天我还是会把活拆给一队实例,这个习惯不会变,半年多跑下来的顺滑是真的。变的是我重新记起一件事:这套分工的说明书是公开的,谁都能照着开。Anthropic 能做的,是在每天几百亿 token 的流量里把异常的那几条捞出来。这次捞到了,它也承认了漏掉的那些。

轮到你了。哪怕你从没把活交给过 AI,你手机里每样服务背后,都有一套这样的检测在替你筛陌生人,你觉得该拦多严?评论区聊聊。