Qwen-Image-3.0 号称字字如印,我那条配图流水线该分它哪类活

哈喽,我是飞飞。
先撇清一件事。七月一号我写过一篇,讲 Google 的 Nano Banana 2 Lite 又快又便宜,该给我那条自动配图流水线分哪类活。那篇量的是速度和单价。今天这篇不一样,主角换成国产的 Qwen-Image-3.0,量的是另一件事:它能不能把中文字,稳稳写进图里。
这事对不做内容的人可能无感。可对我这种天天让 AI 出图的人,中文字能不能写清,是一道绕了大半年都没绕过去的坎。
七月二十一号,阿里通义千问发布了新的图像生成基础模型 Qwen-Image-3.0。官方给的口号是四个字,落字成画。说白了,就是冲着把字写清楚来的。我看到这四个字,心里咯噔一下。它画得好不好,我当下没那么在意,我在意的是我那块删了大半年的招牌,好像终于能贴回去了。
它值不值得进我的流水线,不在它画得多惊艳,在它能不能把我删掉大半年的那行字,稳稳写回图里。
我那条配图流水线长啥样
先说我手里这套东西,你才知道我在纠结什么。
我公众号每篇封面,基本都是 AI 出的,我一笔不画。链路是我自己写的一个 skill,在 Claude Code 里我说一句给这篇配张封面,它就自己读文章主题、想画面、调图像模型生图、再把图传到我的图床。我这头只管说一句话,回头图就在那儿了。
这套跑了大半年,攒下几十张统一浅色科技风的横版封面。省心是真省心。
但它有个我一直没敢碰的短板。我想给每篇文章的每个小节都单独配张图,让读者刷起来更有节奏。算了笔账就放弃了:一篇五六个小节,一天出好几篇,按张烧钱,成本和速度都拦着,最后只敢配一张封面。
所以我判断一个新图像模型值不值得用,从来不看它单张画得多惊艳,看的是它能接我流水线里哪一档活。
绕了大半年的坎是文字
这道坎具体长什么样,我给你描一下。
老版模型有个特别稳定的毛病:图里文字少,基本没问题。我那张卡通头像,T 恤上印着 Feifei、电脑上写着 AI Lab、书脊上是 Prompt,几个词都拼得清清楚楚。可只要往图里放一段稍长的文字,比如封面的标题加副标题,它立刻就抽风。笔画黏成一团,缺胳膊少腿,远看像字,近看全是鬼画符。
封面那行标题,对公众号几乎是点击率的命根子。它就像街边小店的招牌,字一糊,整张脸就废了,人从门口过都不带看一眼的。
我的应对办法特别土。要么反复重试碰运气,刷五六遍看哪张不糊;要么干脆认怂,把字从图里彻底删掉,改成纯色块的氛围图,标题老老实实挪回正文。
后来我索性给配图 skill 定死一条规矩:生封面的提示词里,强制不许出现任何文字、字母、数字。字这东西,图像模型碰不得,事后我自己贴。
我对这道坎有多在意,可以给你个参照。之前 Nano Banana 升到二代,我拿一张排满密集中文小字的样张去试它,字多、字密、还要规整,三样最难的全占齐,它居然稳稳接住了,放大凑近看边缘都是利落的。从那一刻起,文字渲染就成了我判断一档模型能不能出封面的硬指标。这道坎,我绕了大半年。
这回它冲着写字来
Qwen-Image-3.0 这次亮出来的能力,几乎是照着我这道坎设计的。
官方说它支持最高约 4.5k token 的超长指令,能原生渲染 12 国语言、20 多款字体,最小到 10px 的小字都清晰可读,论文、公式推导、手写批注都能看清。它还能一次生成带公式符号和逻辑步骤的复杂图解,能做画中画的界面嵌套,也能多图融合。一句话,它把图里的字当成了正经产品来做,从顺带变成了主打。
我得在这儿踩一脚刹车,说几句实话。
这些是官方口径和外部评测里的话,我自己还没把它挨个跑一遍。网上有篇实测拿它跟 GPT Image2 比了十九个场景,说文字不崩、质量能打。但对标 GPT Image2 这话官方没说,是评测者的说法。官方到现在也没公布定价,只讲在阿里云百炼开了 API 邀测,Qwen Studio 和千问 APP 随后上线。所以便宜、国内随便用这类话,我先不跟着喊。等我真拿它出几张图、按张算过账,再回来告诉你。
但方向我是认的。一个把字渲染准当命根子的图像模型出现,对我这种被文字乱码坑了大半年的人,光这一条,就够我认真掂量它一回了。
该先分给它哪类活
好,回到我最关心的问题:真要用,它该先接哪一档活。
我给图像模型分活,就一把尺子:出错的代价,乘以一天出多少张,再乘以单价。这跟我选文本模型用的是同一把尺子。封面这种门面活,出错代价高、量不大,就该留给最能写清字的高档款;正文里那些量大又不苛刻的缩略图、草稿图,交给便宜的快模型就行。
还有一条更老的判据:看一张图的主角,是画面还是文字。主角是画面的,比如一张讲氛围的概念封面,交给图像模型,它强在质感;主角是文字的,比如金句卡、数据卡、步骤卡,以前我只能交给排版工具,用网页模板套出来截图,图上每个字都是真实文字,一个都不会糊。
排版这条路稳,代价是所有卡片长一个样,撞脸撞得厉害。
Qwen-Image-3.0 如果真能把 10px 小字写清,等于给主角是文字、我又想要点画面感的这类图,又劈出了一条新路。所以我的判断很明确:最惊艳的那张画面封面,先别急着交给它。反倒是那些以前被我判给排版、又总嫌太死板的带字的图,最该让它先上手。招牌先别急着换,先让它去写店里那些价签,写准了,再谈招牌。
多图融合那个能力我也惦记着。要是它真能一次出一组风格一致的图,我那个给每小节都配张图的念想,被拦住的两道坎里,一致性这道说不定能松一松。剩下单价那道,还得等定价出来再算。
今天先拿它试一张
所以这篇我不劝你立刻搬家,也不劝你无脑信任何一家的口径。
要试,今天就能试最省的一步:把你手里最头疼的那类图挑出来,专挑它去试。对我就是那种带一行中文标题的封面,或者带中文标注的示意图,这是我以前必崩、只能删字的重灾区。拿这一张去试它,比看十篇评测都实在。写清了,这道绕了大半年的坎才算真过了一格;写不清,那至少我省下了一次搬家的折腾。
我自己这两天就会拿几张老封面的标题图去喂它,专看那行中文糊不糊,回头把结果补给你。
最后想问问你:你给内容配图,最怕模型在哪一步崩?是中文字写着写着就成了鬼画符,还是好几张图凑不出一个统一的风格?评论区聊聊,我想看看大家的坑是不是都长一个样。