做内容治理的朋友大概都有同一种感觉:这几年的互联网内容池,突然被一种“看着字挺多、读起来没信息”的东西包围了。社区里开始统一叫它AI Slop——AI 批量生成的低质量内容垃圾。我做过内容社区、也带过质量治理团队,过去一年半几乎每天都在跟AI Slop 治理实战打交道,踩了不少坑,也沉淀出一套相对能打的方法。这篇就把它拆开讲。
这篇文章不是给“要消灭 AI”的理想主义者看的,也不是给“要全面拥抱 AIGC”的激进派看的。它更偏向给内容平台运营、社区管理员、独立站长,以及那些不想让自己产品被机器内容淹没的技术负责人。目标是回答三个问题:AI Slop 到底脏在哪、为什么治不住、以及按什么顺序治理才不把正常内容一起误杀。
1. AI Slop 到底是什么垃圾:先给问题画个像
1.1 最常见的四张脸
很多人一听 AI Slop 就以为是“一眼假”的机翻文章,实际接触多了会发现,这玩意儿是个光谱,从一眼假到高仿真的都有。
第一类是纯 SEO 聚合垃圾。典型场景是站群程序每天自动抓取搜索词,再让大模型拼出一篇“2025年XX排行榜”“XX多少钱”之类的页面。没有作者、没有真实体验、没有可靠信源,唯一的目的是把人骗进来点广告。
第二类是伪原创洗稿文。把别人的干货文章丢给模型“改一遍措辞”,然后重新发布。这类内容单篇看甚至通顺,但信息熵极低——原稿说三句话讲完的观点,被扩写成三段车轱辘话,把老内容稀释得没有任何增量。
第三类是评论区与问答区的水军式 AI 回复。比如一句“感谢分享,学习了”,在社区里批量出现;或者问答平台上一长段“作为AI语言模型……”式的空话。单个看无害,量大了以后,真正想讨论问题的人会觉得自己在一间回音室里。
第四类比较隐蔽,是低成本批量制作的“有图没真相”内容。AI 直接生成配图再加一段故弄玄虚的文字,配图里的手指数量、字体边缘、透视关系全是破绽,但架不住出货量巨大。
1.2 它和传统垃圾内容不是一回事
以前内容平台也在跟垃圾内容打仗,不过主要打的是重复、抄袭、伪原创、低俗引流。AI Slop 最大的不同在于:它的语义是完整的,语法是通顺的,如果只看单句质量,人类写手未必写得比它好。
这就带来了一个核心矛盾:传统质量检测看“句子通不通”,而 AI Slop 检测要看“整篇有没有信息增量”。后者比前者难得多。它要求系统具备一定程度的语义理解能力,而不只是抓敏感词、查重复率。
还有一点,传统垃圾内容的制造者是有真实成本压力的:写手要付工资、洗稿要花时间。但 AI 生成文本的边际成本几乎是零,一个脚本一天能产几千篇。所以 AI Slop 治理的第一性原理不是“怎么检测单篇内容”,而是怎么对冲掉规模效应——你的检测系统如果只能拦掉 95%,剩下的 5% 乘以海量基数,绝对量依然能淹没正常内容生态。这一点后面会反复提到。
2. 为什么 2023 年之后内容突然“烂”得这么快
2.1 产量经济把内容竞争从质量拉回了数量
AI 生成内容滥用的底层逻辑是经济模型变了。以前做内容农场,收益等于“单篇内容收益 × 产量 - 人工生产成本”。人工成本压不下去,所以生产方还讲基本法,至少不会一天产几千篇。
现在不一样了,用大模型 API 批量生成,或者本地部署开源模型跑批处理,三千篇内容和三篇内容的边际成本差距非常小。只要平台无法立刻识别,生产方就愿意铺量。哪怕十篇里只有一篇能通过审核带来搜索流量,ROI 也比人工写十篇高得多。
这就导致一个奇怪的现象:真正认真做内容的作者发现,自己辛苦一周写出来的东西,很快被几十篇同主题的 AI 改写版包围,用户根本分不清谁是原作。劣币驱逐良币的过程,其实不是某一个 AI 工具的问题,而是整个生态的供给端产能无限放大后,需求端注意力没有成比例放大。
2.2 搜索与推荐系统的参照系被污染了
很多系统在判断内容质量时,会参考历史点击、阅读时长、外链数据。这套机制有几个前提:内容来源足够多样、用户点进去之后真的消费内容、传播链路是“人推荐给人”。
AI Slop 直接把这三个前提打碎了。机器可以通过批量注册、互点、做搜索留痕来操纵初始信号,内容页还能靠“正文足够长、段落足够多”拖住用户停留时间。推荐和搜索系统一旦把这些垃圾页当成高价值结果,就会进一步给它们加权,形成恶性循环。
我见过一个挺典型的数据:某资讯类小程序调整排序算法后,AI 改写类文章的平均阅读完成率其实只有正常文章的 60%,但因为量大且停留时长做假很容易,它们依然能挤进头部位置。系统层面尝到了甜头,人力审核层面看到的又只是零散个案,两边都以为对方在把关。这也是为什么治理不能只加一个检测模型,而是要动整个分发链路。
2.3 “AI 味”本身在快速衰减
不少人觉得可以用“这句子像不像 AI 写的”来判断,但这个方法正在失效。早期模型生成的内容有几个特征:总爱说“总而言之”、排比句特别多、形容词堆成山。后来的模型在指令调优后,把这些特征压得很干净,普通人单看文本已经分不出作者是人还是模型。
更麻烦的是,人类自己也在变得“越来越像 AI”。当大家都在短视频、AI 问答和摘要式阅读里浸泡,很多人写东西也开始用总分总结构、空泛形容词、小标题加要点。这时候你按“AI 味”去清理,很容易误伤真人写的模板化文章。所以治理必须从“鉴别作者是人还是机器”转向“判断内容有没有真正价值”,前者是个伪命题,后者才具备可操作性。
3. 治理框架:为什么要“分级处理”,不能一刀切删除
3.1 按风险分四个动作:屏蔽、限流、降权、删除
刚开始做治理时,不少团队的第一反应是“识别出来就干掉”。但很快发现,一刀切删除会带来大量客诉和误伤,而且 AI Slop 很难做到百分百识别。
我在实践中更倾向于把治理动作做成阶梯式:
| 动作 | 适用对象 | 用户感知 | 系统成本 |
|---|---|---|---|
| 屏蔽 | 明确的机器灌水、恶意刷屏 | 无感知(仅发布者有提示) | 低 |
| 限流 | 疑似 AI 生成、但暂无明显恶意的低质内容 | 阅读量明显下降 | 中 |
| 降权 | 确认非原创、信息增量低的内容 | 搜索排名、推荐排序下降 | 中 |
| 删除 | 垃圾广告、欺诈、违规内容 | 内容下架 | 高 |
屏蔽和删除的区别,是很多刚做治理的人最容易忽略的。屏蔽只对特定场景生效,比如把某条评论折叠、把某篇文章在搜索结果里隐藏;删除是直接从库里去物理消失。对于 AI Slop,绝大多数情况不应该物理删除,因为它是“低价值”而不是“违法内容”,后者往往才是删除的合法理由。
3.2 关键认知:治理的目标是控制占比,不是归零
任何一个真实平台都做不到把 AI Slop 完全归零,也不需要归零。真正重要的指标是AI Slop 在信息流里的占比,以及正常创作者的流量有没有被挤压。
我见过一个失败的案例:某团队上了非常激进的 AI 文本检测模块,线上误杀率一度超过 8%,真人作者写的短文被大量限流,社区作者流失率明显上升。后来把策略目标从“把 AI 识别率做到 95%”改成“把 AI Slop 的信息流占比从 20% 压到 5% 以下”,误杀率调到 1% 以内,生态反而好很多。
所以开始做治理之前,先定义清楚你想要的不是一个“干净的池子”,而是一个“大多数内容仍然来自真实人类且有信息增量的池子”。这个概念不搞对,后面所有的阈值和策略都会跑偏。
3.3 治理体系要覆盖三道防线
在具体落地时,我会把整个体系分成三层:
- 入场拦截:在内容发布、入库阶段做启发式规则和轻量模型初筛。这一层拦的是最笨的那批机器内容。
- 流内调节:在推荐、搜索分发时做质量分判断。这一层针对的是“能发出来但价值不高”的内容,用限流和降权来减少曝光。
- 事后追溯:针对用户举报、运营抽检、搜索低满意度反馈做二次复核。这一层用来发现那些成功绕过了前两层的漏网之鱼。
这三道防线缺一不可。只做入场拦截,第二天就会被更聪明的生成脚本绕过;只做流内调节,首次曝光阶段用户已经看到垃圾;只依靠事后举报,反馈链路太长,普通用户根本不会花时间举报一篇“只是没营养”的文章。
4. 可复用的检测链路:从规则到大模型裁判
4.1 第一层:启发式规则,性价比最高的拦截网
真正高效的系统,通常靠规则先干掉 70%~80% 的明显问题,而不是一上来就上大模型。规则的核心思路是找 AI Slop 的生产痕迹,而不是辨别语义好坏。比如:
- 发布频率:同一账号、同一 IP 或同一设备短时间内发布超过 N 篇内容,直接进待审池。
- 文本自相似度:单篇文章内高相似句式占比过高,或者连续多段都是“首先……其次……最后……”的模板。
- 实体密度:文章里真正的人名、机构名、数字、专有名词特别少,而套话虚词特别多。
- 多文档局部相似:用 SimHash 或 MinHash 做相似簇检测,大量文本与历史库里的文章片段高度重叠。
这些规则不需要训练模型,第二天就能上线。我司早期用这个方案,就把 AI SEO 聚合文的拦截率做到了 75% 左右。关键是规则要跑在发布流程里,不能等文章已经在线上跑了几天再补刀。
4.2 第二层:用“困惑度 + 爆发度”做机器文本信号
对规则漏掉的内容,可以用统计语言模型做特征提取。有两个指标值得先试:困惑度(perplexity,PPL)和爆发度(burstiness)。
困惑度衡量的是文本对模型的“意外程度”。人类写文章时,用词跳跃大、句式变化多,困惑度相对高;AI 生成时则倾向于把高概率词串起来,整体困惑度偏低。爆发度衡量的则是句子长度和句式的波动。人类写东西状态起伏很大,有时候短句,有时候长句;而模型如果温度设得低,输出文本的长度和结构会异常均匀。
两个指标一起做饭,效果比单独看任何一个都稳。因为真人写出来的“极简风格”文章困惑度也可能偏低,但它的句式波动通常不会像机器那样均匀到无聊。把这个逻辑封装成一个评分函数,就能在召回阶段识别出一批疑似内容。
有个识别伪原创 AI 文本的经验可以分享:不要只看全篇 PPL,最好分段看。很多模型在开头部分会模仿得很好,但到中后段就开始露馅——信息重复、逻辑跳跃、长句拖沓,PPL 会在后半段出现明显的大起大落。把 PPL 分布的不稳定性也作为一个特征,能显著提升对“经过人工简单修改”的 AI 文本的识别率。
4.3 第三层:大模型当裁判,做“最后一道复核”
规则和统计特征跑完后,剩下的内容量已经小了很多。这时候用大模型做零样本或少样本判别比较划算,不会烧太多成本。
我在做复核策略时,会让大模型关注三件事,而不是问“这文章是不是 AI 写的”:
- 这篇文章提供了几个具体事实或数据?
- 这些事实/观点是否在多个来源中可核对?
- 文章是否给出了独特的角度、案例或操作细节?
把问题改成“信息量拆解”,而不是“作者身份鉴别”,有两个好处:第一,AI 写的实验报告如果确实包含真实数据和结论,也能正常通过,避免误伤;第二,真人写的空话套话文会被打回,这让治理逻辑落在内容价值上,更站得住脚。
然后对输出做一个结构化 JSON,例如:
{ "fact_count": 3, "has_unique_perspective": false, "repeated_paragraph": true, "suggestion": "疑似洗稿或扩写,建议降权" }这个结果不直接决定删不删,而是进入后面的质量分体系。
4.4 别忘了对抗性样本:检测是一条不断追逐的曲线
AI Slop 的制造者也在升级。我们上线 PPL 检测后,很快发现有些人会用“改写作指令”来规避:要求模型“加入一些口语化词、长短句交替、故意写错几个标点”。这堪称 AI 内容界的军备竞赛。
应对方法有两个。第一是不要公开检测规则细节,规则文档只在内部脱敏后流通。第二是定期做绕过测试,每两周让算法同学用最新模型尝试生成一批“目标是通过检测”的内容,拿回来当新的负样本训练。你不主动打自己,别人就会替你做压力测试,到那时候代价往往更大。
5. 治理落地时最该盯住什么:三个指标与一个雷达
5.1 三个数字决定体系健康度
- 低质内容残留率:用人工抽检或者大模型复核的方式,统计线上新发布内容里被判定为 AI Slop 的比例。理想值控制在 3% 以下,这个指标告诉你拦截网有没有被大面积绕过。
- 误杀率:统计被系统限流、降权的内容里,人工复核后认为值得正常分发的比例。误杀率持续高于 2%~3%,就要警惕策略是不是把正常作者也影响了。
- 人工复审覆盖比:很多人会忽略这个运营指标。它指的是被系统标记出来的内容里,有多少真正流入了人工抽检池。如果系统标记了 10 万条,人工只看 2000 条,规则再准也有可能漏掉隐性问题。这个覆盖比做到 5%~10% 是一个不算过分的要求。
这三个数字要放到同一个看板里观察。如果残留率低但误杀率很高,说明策略偏保守,模型宁可错杀也不放过;反过来如果误杀率极低但残留率还在涨,说明很多 AI Slop 已经换上了“真人皮”,进入了策略盲区。
5.2 用作者分层来降低误杀
误杀率的核心受害者往往是三类人:新作者、低粉作者、写“模板化教程”的行业作者。他们在数据表现上和 AI Slop 很像——发布频率高、内容结构稳定、引用多而原创观点少。
针对这个问题,比较好的做法是给作者建立信誉分层。比如:
- 老作者,历史内容人工抽检无违规,质量得分积累高,被规则命中后给予“申诉优先复核”的待遇。
- 新作者,采用“先降权观察、不直接屏蔽”的策略,避免一言不合就把真人新手赶跑。
- 已被多次确认的低质账号,直接从严处理。
把内容质量判断和作者历史信誉绑定,本质上是给真人作者一个“被信任的余地”。这比单纯相信单篇文本判断靠谱得多。
5.3 搞一个内容质量雷达,而不是一元分
早期我犯过一个错:把所有文章都打一个 0 到 100 的分,低于 60 就降权。后来发现这个一元分在运营侧非常难用,因为运营根本不知道低分原因是“疑似 AI”“洗稿”还是“内容肤浅”。
后来改成质量雷达,用几个维度打分:
- 原创度(与库内内容的相似程度)
- 信息密度(有效实体、结论、关键数据量)
- 结构规范度(标题与正文是否匹配,段落是否断裂)
- 作者可信度(历史内容表现与账号行为)
别让一个总分决定生死,而是让“哪个维度触发了阈值”决定采用哪个治理动作。比如原创度低走降权;信息密度低走限流;结构混乱且疑似拼接再转人工。越细分,误杀处理时的解释成本就越低。
6. 最容易翻车的三个治理现场
6.1 现场一:“高质量 AI 辅助写作”与“AI Slop”的边界之争
上线治理后收到的第一波投诉,一定不是来自垃圾账号,而是来自那些用 AI 润色、整理提纲的真实创作者。他们会说自己“用 AI 辅助怎么了”,而系统却把他的文章识别成了低质内容。
这个边界确实模糊。我的处理原则是:不惩罚辅助,只惩罚无增量。如果一篇内容有作者本人的真实项目经验、真实测评数据,即便某些段落明显经过 AI 润色,它依然是有价值的。所以在特征选择上,要重点跟踪“是否有作者独特经历、是否有具体数据、是否有实操细节”,而不是纠结句子是不是机器生成的。
实际执行中可以加一个作者自查动作:发布页面上提示用户填写“文章经历了哪些实践”“有哪些截图或测试数据可佐证”。别小看这一点,它能把恶意批量生成者挡掉一大半,因为他们根本懒得做这些额外动作。
6.2 现场二:回归测试做不好,一个策略误伤整个垂类
内容治理有个天然陷阱:样本库以热门的、易识别的 AI Slop 为主,模型很容易对特定题材过拟合。比如发现“旅游攻略类 AI 文”有特征,就把所有攻略类内容都从严了,结果误伤了真人写攻略的作者。
推荐给每次规则调整加两层回归:
- 历史高质量内容回归集:拿过去 30 天里人工确认过的高质量内容跑一遍新策略,确保新策略不会把它们的质量分压下去超过 5%。
- 垂类分层回归:把科技、生活、情感、时政等不同垂类分开看误杀率,不要只盯大盘。一个策略改动往往对某个垂类是救火,对另一个垂类却是屠杀。
6.3 现场三:只防文本,不管图片和多模态
我想特别提醒一下:AI Slop 不只是文字。现在的批量工具早就可以做文生图、图配文、甚至 AI 生成的短视频脚本。不少平台只做了文本检测,结果 AI Slop 生产者马上转向做“AI 配图 + 简短文字”的图文贴,一条贴子几分钟能产几百个。
对多模态内容,早期不必上很重的模型,可以先做轻量级的生成痕迹检测:比如图片元数据是否包含常见生成模型标签、图片与实际文字是否语义匹配、多张配图之间是否存在同源噪点特征。等量上来了再考虑专用模型。核心还是那句话:AI Slop 的软肋是规模化和同质化,攻击其“重复性”要比攻击其“生成痕迹”更长效。
7. 治理的后半程:人工审核的价值要重新定义
很多人以为上了 AI 检测,人工审核就不重要了。我的观点恰恰相反:AI 负责把量从 10000 缩到 1000,人工负责在 1000 里做确定性判断。没有人工反馈,模型只是在闭着眼打分,永远不知道真实生态里那些“说不清哪里怪但就是很垃圾”的案例长什么样。
所以我会在每周运营例会上固定加一项议程:找 5 条被系统放过但人工看不过去的内容,分析系统为什么没拦住。这是一个低成本的“滴滴答答渗水检测”,长期坚持下来,比一次性搞一个大模型检测器的边际收益高得多。因为这些内容单条都能骗过模型,说明它们多半是依托新工具生成的,属于模型没见过的新模式。早发现一天,就能早一天加进负样本,后面少被捅一刀。
人工审核团队的工作方式也要跟着变。以前审核是“看内容有没有违规”,现在需要把“有没有信息增量”也纳入判断维度。这要求审核标准非常具体。我会给审核同学准备一份负面特征清单,看到任意 3 条就直接判低质:
- 文章通篇没有出现任何真实项目名、人名或具体数字;
- 示例部分使用大量“比如一个用户说”“打个比方”的虚拟场景;
- 核心观点在其他热门文章中已原样出现且无任何延伸;
- 段落之间缺少转折,读起来像把五篇相关文章各截一段拼在一起。
把这些特征固化成 checklist,既避免了审核主观性,又能让新同学快速上手。
最后说点实际的体会
AI Slop 治理这事干久了,我最大的感受是:这本质上不是一个纯模型问题,而是一个内容价值观工程。模型能解决的只是“怎么发现它们”,真正难的是团队愿不愿意为了生态健康牺牲一部分短期流量。那些靠 AI Slop 撑起来的 PV 往往看着漂亮,一旦用户发现点进来十篇有五篇都是机器拼出来的,流失是不可逆的。
如果你是个人站长或者中小产品,还没有条件上复杂模型,我建议从三个动作开始:发布频率限制、相似内容聚类、人工抽检周报。一周内就能看到显性效果。如果团队条件更好,再按上面的链路逐步加规则、统计特征和模型裁判。
最后给你一个可量化的目标参考:把一个平台里 AI Slop 的线上占比从 20% 压到 5% 以下,远没有你想的那么难;但要是想把 5% 压到 0%,投入产出比会急剧恶化。与其追求完美,不如把省下来的时间拿去设计一套“让真人作者感觉被保护”的反馈与申诉机制。在我经手的项目里,后者对内容生态的长期贡献,往往比任何一条检测规则都大。