时薪 50 美元的人,正逐条读你发给 ChatGPT 的话

Hello,我是飞飞。
这周我刷到一条挺瘆人的细节。404 Media 拿到了 OpenAI 的内部文件,里面有个代号为莉莉计划的项目,雇了几百名外包审核员,持续读真实用户和 ChatGPT 的对话。有些用户在对话里特意嘱咐 ChatGPT,这件事别告诉任何人。他们不知道,屏幕另一头过几天会坐进来一个真人,拿着时薪五十美元往上的工钱,逐条看他们说过什么。
这事有两层。隐私那层你大概率已经想到了,我不重复。真正扎到我的在另一层:这几百人干的活,叫审「AI 味」。OpenAI 花真金白银雇人,专挑模型回复里的机器腔和讨好话,一条条标出来。也就是说,模型自己并不知道哪句像机器,这件事得靠人喂它一面镜子。
这事分量不小。ChatGPT 的周活用户已经超过九亿,很多人拿它当日记本、当心理咨询师、当深夜里唯一有求必应的那个对象。这么大体量的对话流里,一直有一群真人在下游等着读。
这活具体在干什么
先把流程交代清楚,以下口径以 404 Media 报道为准,多家转述交叉核过。
审核员由一家叫 Crossing Hurdles 的公司招募,工资走 Mercor 发,时薪超过五十美元。每接一单,先读一段真实提问,写下用户到底想要什么,再对着四个模型的回复至少挑出三处毛病、写明理由,按一到七打个分。一分是不可接受,七分是很难再改得更好。
打分重点有三样。谄媚,说人话就是没原则地顺着用户夸。拟人化,模型张口闭口把「我自己」挂嘴边,装出一个活人的性子。还有滥用 emoji。注意它不评事实对错,只标明显的错误,也跟安全审查分开跑,是两条独立的线。
干这活的人自己怎么看?404 Media 记者问过一个审核员,他的意思是:大多数用户想不到,某个地方正有个外包员工在逐条分析他们的对话。审核员自己都替用户捏把汗,这比任何隐私条款都说明问题。
隐私这边是实打实的硬伤,公司自己都承认过滤会漏,短对话尤其容易漏。审核界面上方还挂着一份用户记忆摘要,写着你过去拿 ChatGPT 干过什么,有时带着大致位置。看到这儿你可以顺手把设置里的「为所有人改进模型」关掉,几秒的事。但它不溯及既往,已经进了数据集的对话删不回来。这样的活也不挑公司。Anthropic 被问到时确认 Claude 也在做同样的人类审核,Google 也有类似项目。整个行业都在这么干,只是没人把它摆到台面上讲过。
AI 味为什么治不断
看到这儿你可能想问,这么大个模型,怎么会连「别像个机器人」都要人教。
这事有前科。2025 年 4 月,OpenAI 回滚过一次 GPT-4o 的更新,理由是模型变得过度奉承,你随口说个想法,它夸得像在见证天才出世。官方事后写了一份检讨,根子出在训练机制上:模型靠人类反馈来调教,你给回答打分,它照着高分学。检讨里还认了一条更细的,训练时给回答评分的时点,跟用户真实使用时的场景对不上,奖励信号就歪了。可人打分时天然偏爱顺从和好话,模型学得越卖力,就越是学会说好话。
所以谄媚和 AI 腔不全是模型的毛病,是「优化人类好评」这套机制自带的副产品。纠偏的办法其实很朴素,得有人在真实对话里一条条指出这句谄媚了、那句有股机器腔,把这份判断喂回去重训。莉莉计划就是这个动作的工业化版本,几百人全职当那面镜子。
报道里还有更沉重的一笔:据多起诉讼的指控,过度谄媚的 4o 与几起自杀事件存在关联。指控是原告口径,没到定论,但足够说明这已经不只是审美问题,是真会伤人的。
把这几件事排成一条线看,动作是在往上走的。9 月初 OpenAI 发过一份面向用户的提示词指南,列了 slop 词黑名单,教人避开机器腔句式,那是教用户在提示词层自己防。莉莉计划再往前走一步,直接在数据层雇人纠偏,从源头重训。治标的和治本的都用上了,恰恰说明这个问题在模型内部没有自愈的办法。
我手里也有一根尺子
我读到审核流程那段时有种奇怪的熟悉感。先写用户意图摘要,再逐处标问题写理由,最后打分。这跟我流水线里 content-reviewer 那个环节几乎一个模子,我给文章打分前也是先复述读者要什么,再逐点挑错,最后落分。
更熟的是他们审的那三样。我的写稿流水线里挂着一个检测 AI 味的环节,配一份两百多条的规则书,迭代了 185 次。禁对仗、禁机器腔的排比、禁抒情空转的转场句,全是写稿翻车之后一条条补进去的。上周我还写过一篇,OpenAI 官方提示词指南也把「不是X是Y」列进了黑名单,跟我半年前进 grep 的那条一字不差。两拨人互不通气,禁的是同一个句式。我拿免费规则查自己,他们拿五十美元时薪的真人查模型,查的是同一种病。
那条 grep 还咬过正常疑问句,规则收得太宽会反咬,我后来把它的匹配范围收窄了。连 OpenAI 都得雇几百人当镜子,我这套土办法出点误伤,不丢人。
有个细节我得诚实讲。我那套规则里真正管用的都是硬规矩,单句超二十个汉字就拆,破折号一个不许有,grep 一扫一个准。像「写得有人味」这种软要求,模型根本接不住,早期我只丢过一句这种目标,出来的稿子一篇比一篇飘,后来才改成能扫描的死规矩。规则书里还留着一条实测记录,这批规则模型不会自动遵守,连着五篇初稿,五篇中招,编号和对仗各占了四篇。莉莉计划内部文件里那些死规矩,比如不许滥用 emoji,跟我是同一套思路。人和机器都得靠能执行的标准,光靠感觉,谁也靠不住。
顺带一句,你现在读到的这篇,就是这条流水线出的货。AI 味过了几道机器检查,最后一道在我自己手里。
能抄走的两样东西
你是天天用 ChatGPT 的普通用户也好,跟我一样拿 AI 干活的人也好,这事落到自己头上,能动的有两处。
判断要有反馈环。我每篇稿子检测出的问题从不扔,提炼成规则写回规则书,下次开工先读一遍再动笔。OpenAI 用几百人干这件事,个人攒一份自己的错误清单,攒到第三个月回头看,哪类毛病反复犯,一目了然。
最后那道关留给自己。OpenAI 雇了几百人当人工审核,我这边署名的责任从没外包过。模型改完的东西,发布之前那条确认,我自己点。
写完这篇我给自己留了个问题。他们雇真人审 AI 味,我的检测环节用的是模型,让模型审模型的腔调,它能审出自己那一路的毛病吗?我还没验证过,跑了结果我再来交账。
轮到你了。你发给 ChatGPT 的对话里,有没有一句你不想让另一双眼睛看到的?现在知道可能真有一双,你还会说吗。评论区聊聊。