1. 一次“笨拙”的文本挖掘:我为什么要分析一万页营销文案
去年年底,我接手了一个有点特殊的咨询项目。客户是一家做B2B SaaS的公司,市场部堆了将近三年的内容资产——博客、落地页、邮件序列、白皮书、案例研究,加起来超过一万页。他们的痛点很具体:内容团队从三个人扩张到十二个人之后,产出效率上去了,但转化率反而在往下掉。老板怀疑是“AI味太重”,但没人说得清“AI味”到底长什么样。
这个项目让我意识到一个被忽略的事实:市面上关于AI写作的讨论,绝大多数停留在“能不能用”“该不该用”的层面,很少有人真正拿放大镜去看——当AI参与写作之后,文本本身到底发生了什么变化。于是我决定做一件笨拙的事:把这一万多页真实营销文案全部拆开,逐页分析写作模式,看看能不能找到一些可量化、可复现的规律。
这篇文章就是这次分析的完整记录。我会把分析框架、核心发现、实操方法全部摊开来讲。如果你也在管理内容团队,或者自己用AI辅助写作,这些从一万多页真实文本里挖出来的东西,应该能帮你少走不少弯路。
2. 分析框架:怎么把“写作风格”变成可量化的数据
2.1 为什么不能靠“感觉”判断AI味
刚开始做这个项目的时候,我犯了一个典型错误:试图靠人工阅读来标注哪些页面“像AI写的”。结果做了两百页就崩溃了——不同人的判断标准差异太大,同一个人在不同时间段的判断也不一致。更麻烦的是,很多被标注为“AI味重”的页面,其实是人类写的,只是作者当时状态不好或者赶时间。
这件事让我明白一个道理:判断写作模式不能依赖主观感受,必须建立可量化的指标体系。就像品酒师不能只说“这酒好喝”,得说出单宁、酸度、余味的具体表现。写作风格也一样,得拆解成具体的、可测量的维度。
2.2 我最终采用的六个核心指标
经过反复试错,我最终锁定了一套包含六个维度的分析框架。这套框架不追求完美,但足够实用,而且每个指标都能通过脚本自动计算。
句长分布:统计每句话的字符数,计算平均值、标准差和分布形态。人类写作的句长分布通常更“散”,长短句交错;AI生成的文本句长往往更集中,波动较小。
段落结构:记录每个段落的句子数量、开头词类型、结尾方式。AI倾向于使用高度一致的段落模板,比如“观点句+解释句+总结句”的三段式。
连接词密度:统计“因此”“然而”“此外”“值得注意的是”这类逻辑连接词的出现频率。AI在这方面的使用频率明显偏高,因为它需要通过连接词来维持表面的逻辑连贯。
词汇丰富度:用类型-形符比(TTR)来衡量,同时追踪高频词和低频词的比例。AI倾向于反复使用同一批“安全词汇”,导致词汇丰富度偏低。
信息密度:计算每个句子承载的独立信息点数量。AI生成的文本经常出现“信息稀释”现象——用很多字说一件小事。
情感曲线:追踪文本中情感倾向的变化轨迹。人类写作的情感曲线通常更自然,有起伏;AI的情感表达往往过于平稳,或者出现不自然的突变。
提示:这六个指标不需要全部同时使用。如果你只是想快速筛查,句长分布和连接词密度这两个指标就足够发现大部分问题。
2.3 数据清洗:那些不得不做的“脏活”
一万多页文本不可能直接扔进分析脚本。我花了将近一周时间做数据清洗,主要包括:
- 去除HTML标签和导航元素,只保留正文内容
- 统一标点符号格式,特别是中英文标点混用的情况
- 剔除少于100字的短页面,避免噪声干扰
- 标记出已知由AI生成的页面作为对照组
这里有个坑值得单独说:很多页面的正文和营销话术是混在一起的。比如一个落地页,既有产品描述,又有行动号召按钮的文案,还有页脚的法律声明。如果不做区分,分析结果会被严重污染。我的做法是用CSS选择器定位主要内容区域,再人工抽查确认。
3. 一万页文本告诉我的七个真相
3.1 句长趋同:AI的“中等句长陷阱”
先看一组数据。在人类撰写的页面中,句长标准差平均为18.7个字符;而在AI生成的页面中,这个数字只有11.2。更直观的对比是:人类文本中,超过60个字符的长句占比约12%,低于15个字符的短句占比约9%;AI文本中,这两个比例分别是4%和3%。
这意味着什么?AI写作存在明显的“中等句长陷阱”——它倾向于把所有句子都控制在20到40个字符这个区间内。读起来不累,但也没有节奏感。就像一首所有音符都在中音区的曲子,听久了必然乏味。
我翻了很多AI生成的营销文案,发现一个典型模式:开头一个中等长度的陈述句,中间跟两到三个解释句,最后用一个中等长度的总结句收尾。整段话的句长曲线几乎是平的。人类作者则会有意识地用短句制造冲击力,用长句展开论述,形成“呼吸感”。
3.2 连接词依赖:逻辑不够,连接词来凑
连接词密度这个指标,差异大到让我意外。AI文本中,每千字平均出现23.4个逻辑连接词;人类文本中这个数字是14.1。其中差异最大的是“此外”和“值得注意的是”——AI的使用频率分别是人类的3.2倍和4.7倍。
为什么AI这么依赖连接词?我的理解是:连接词是AI维持“表面逻辑”的拐杖。当它无法真正理解两个观点之间的深层关系时,就会用“此外”“因此”“然而”这类词来强行建立联系。读起来好像很连贯,但仔细一想,很多连接词去掉之后,句子之间的关系反而更清晰。
举个例子。我见过一段AI生成的文案:“我们的产品能提升团队效率。此外,它还能降低沟通成本。值得注意的是,很多客户反馈说使用后会议时间减少了。”三个句子之间其实没有真正的逻辑递进关系,只是并列罗列。但加上连接词之后,读起来好像有了某种论证结构。
3.3 词汇安全区:那些被过度使用的“万能词”
词汇丰富度方面,AI文本的TTR值平均比人类文本低15%左右。但更有意思的是具体哪些词被过度使用。我统计了AI文本中频率异常高的词汇,排在前面的包括:
| 词汇 | AI文本频率 | 人类文本频率 | 倍数 |
|---|---|---|---|
| 赋能 | 0.8‰ | 0.1‰ | 8.0 |
| 抓手 | 0.6‰ | 0.08‰ | 7.5 |
| 闭环 | 0.5‰ | 0.07‰ | 7.1 |
| 底层逻辑 | 0.4‰ | 0.05‰ | 8.0 |
| 颗粒度 | 0.3‰ | 0.04‰ | 7.5 |
这些词有个共同特点:它们都是“看起来专业但实际信息量为零”的词汇。用“赋能”代替“帮助”,用“抓手”代替“方法”,用“闭环”代替“完整流程”——本质上是用更长的词表达更少的意思。
我并不是说这些词不能用。在特定语境下,它们确实有精确的含义。问题在于AI会把它们当成万能替换词,不分场合地使用。结果就是文本读起来很“专业”,但仔细一琢磨,什么都没说。
3.4 段落模板化:三段式结构的泛滥
段落结构方面,AI文本表现出极强的模板化倾向。我统计了所有页面的段落开头方式,发现AI文本中排名前三的开头模式是:
- 观点陈述句(占比42%)
- 背景铺垫句(占比28%)
- 问题引出句(占比19%)
这三种加起来占了89%。而人类文本中,这三种开头方式只占61%,剩下的39%包括故事开头、数据开头、引用开头、场景描写开头等等。
更明显的是段落内部结构。AI最常用的段落模板是“总-分-总”:第一句抛出观点,中间两句解释,最后一句总结。这个模板本身没问题,但当成千上万个段落都用同一个模板时,读者会产生强烈的疲劳感。
我做过一个测试:把十个AI生成的段落打乱顺序,让同事猜哪些是同一个页面的。结果准确率只有30%左右——因为所有段落的“质感”太像了,根本分不清。
3.5 信息稀释:用一百个字说十个字的事
信息密度这个指标是我最看重的。计算方法很简单:统计每个句子中独立信息点的数量,然后除以句子长度。人类文本的平均信息密度是0.42,AI文本只有0.28。
差距在哪里?我举一个真实例子。某页面需要表达“我们的软件支持团队协作”这个信息。人类作者写的是:“三个人可以同时编辑同一份文档。”AI写的是:“我们的软件提供了强大的团队协作功能,让团队成员能够实时共享信息、协同工作,从而提升整体效率。”
后者用了47个字,但独立信息点只有“支持团队协作”这一个。前者用了15个字,信息点同样是“支持团队协作”,但还额外传递了“同时编辑”“同一文档”“三人规模”这些具体细节。
信息稀释是AI写作最隐蔽的问题。它不会让文本变得“错误”,但会让文本变得“空洞”。读者读完感觉好像说了什么,又好像什么都没说。
3.6 情感平坦:缺乏真正的“情绪起伏”
情感曲线分析是最复杂的部分。我用了一个简化的情感词典方法,追踪每句话的情感倾向(正面、中性、负面),然后画出整篇文本的情感变化曲线。
人类文本的情感曲线通常有明显的起伏:开头可能比较平淡,中间出现一个情感高点(比如强调痛点或展示成果),结尾再回到平稳。AI文本的情感曲线则往往是一条接近水平的直线,偶尔出现不自然的尖峰——通常是在刻意使用感叹号或强烈形容词的时候。
这种情感平坦在营销文案中特别致命。营销的本质是情绪驱动,你需要让读者感受到痛点、产生共鸣、然后被解决方案吸引。如果整篇文案的情感曲线是平的,读者就不会有任何情绪波动,自然也不会采取行动。
3.7 开头结尾的“安全区效应”
最后一个发现关于开头和结尾。AI文本的开头方式高度集中:超过70%的AI页面以“在当今...的时代”或“随着...的发展”开头。结尾同样集中:超过65%以“总之”“综上所述”或“让我们一起...”收尾。
人类文本的开头则分散得多:有直接抛问题的,有讲故事的,有引用数据的,有描述场景的。结尾也更多样:有的戛然而止,有的用一个小细节收束,有的把问题抛回给读者。
开头和结尾是写作中最需要创造力的部分,也是AI最保守的部分。因为AI的训练目标让它倾向于选择“最安全”的表达方式,而安全往往意味着平庸。
4. 实操指南:怎么用这套方法分析你自己的内容
4.1 最小可行分析流程
你不需要一万页文本才能做这个分析。我后来把这套方法简化成了一个最小可行流程,用几百页文本就能跑出有意义的结果。
第一步:收集样本。从你的内容库中随机抽取100到200个页面。注意要覆盖不同类型的内容(博客、落地页、邮件等),避免偏差。
第二步:数据清洗。把HTML转成纯文本,去除导航、页脚、法律声明等非正文内容。这一步可以写个简单的Python脚本自动化。
第三步:计算核心指标。至少计算句长标准差、连接词密度、词汇丰富度这三个指标。我用的是Python的textstat和nltk库,代码不复杂。
第四步:对比分析。如果你有已知的人类撰写样本和AI辅助样本,直接对比。如果没有,可以把样本按时间分组——AI工具普及前后的对比往往能说明问题。
第五步:人工复核。挑出指标异常的页面,人工阅读确认。数据告诉你“哪里有问题”,人工阅读告诉你“为什么有问题”。
4.2 一个可以直接用的Python脚本框架
下面是我当时用的分析脚本的核心框架。代码不完整,但关键部分都在,你可以根据自己的需求调整。
import re import statistics from collections import Counter def split_sentences(text): # 简单分句,按句号、问号、感叹号切分 sentences = re.split(r'[。!?.!?]+', text) return [s.strip() for s in sentences if len(s.strip()) > 5] def sentence_length_stats(text): sentences = split_sentences(text) lengths = [len(s) for s in sentences] return { 'mean': statistics.mean(lengths), 'std': statistics.stdev(lengths) if len(lengths) > 1 else 0, 'max': max(lengths), 'min': min(lengths) } def connector_density(text): connectors = ['因此', '然而', '此外', '值得注意的是', '综上所述', '总而言之', '换句话说', '与此同时', '不仅如此'] total_chars = len(text) count = sum(text.count(c) for c in connectors) return count / total_chars * 1000 # 每千字密度 def vocabulary_richness(text): # 简单按字符切分,中文需要更复杂的分词 chars = [c for c in text if '\u4e00' <= c <= '\u9fff'] if len(chars) < 100: return 0 return len(set(chars)) / len(chars)注意:中文分词比英文复杂得多。上面的词汇丰富度计算只是粗略估计,如果需要精确分析,建议用jieba分词后再计算TTR。
4.3 怎么解读分析结果
拿到数据之后,怎么判断问题严重程度?我总结了一个简单的参考标准:
| 指标 | 健康范围 | 警告区间 | 危险区间 |
|---|---|---|---|
| 句长标准差 | >16 | 12-16 | <12 |
| 连接词密度 | <16‰ | 16-22‰ | >22‰ |
| 词汇丰富度 | >0.45 | 0.35-0.45 | <0.35 |
| 段落开头多样性 | >5种 | 3-5种 | <3种 |
这些阈值是基于我分析的一万多页文本得出的,不一定适用于所有领域。技术文档的句长标准差天然会低一些,创意文案则会高一些。建议你先用自己的历史数据建立基线,再对比分析。
5. 从分析到行动:怎么让AI辅助写作不那么“AI”
5.1 提示词层面的调整
分析做完之后,客户问我的第一个问题是:“那我们该怎么改?”我的回答是:不要试图让AI一次生成完美文本,而是把AI当成一个需要严格指导的实习生。
具体到提示词层面,我总结了几个有效的调整方向:
明确要求句长变化。在提示词中加入“请确保句长有显著变化,包含至少两个短句(少于15字)和至少一个长句(超过50字)”。这个简单的指令能显著改善句长分布。
限制连接词使用。直接告诉AI“每千字最多使用8个逻辑连接词”,并列出禁止过度使用的词表。实测下来,这个限制能让连接词密度下降40%左右。
要求具体细节。在提示词中明确“每个观点必须附带一个具体数字、案例或场景描述”。这能有效提升信息密度,减少空洞的概括。
指定开头和结尾方式。不要让AI自己选择开头方式,直接告诉它“用一个小故事开头”或“用一个反问句结尾”。这能打破AI的“安全区效应”。
5.2 人工编辑的介入点
即使提示词调得再好,AI生成的文本仍然需要人工编辑。关键是找到正确的介入点。我的经验是:不要在句子层面修修补补,要在段落层面重新组织。
具体来说,拿到AI生成的初稿后,我会做三件事:
第一,打乱段落顺序。AI生成的段落往往有一个固定的逻辑顺序,但这个顺序不一定是最优的。把段落拆开,按照“痛点-方案-证据-行动”的框架重新排列。
第二,替换高频词。把“赋能”“抓手”“闭环”这类词全部找出来,换成更具体、更朴素的表达。这个过程很枯燥,但对文本质量的提升非常明显。
第三,插入“不完美”的元素。人类写作是有“毛边”的——偶尔的口语化表达、不完整的句子、突然的转折。这些“不完美”恰恰是让文本显得真实的关键。我会刻意在AI文本中插入一些这样的元素。
5.3 建立自己的“反AI味”检查清单
经过这个项目,我整理了一份检查清单,每次发布AI辅助的内容之前都会过一遍。清单不长,但很实用:
- 句长标准差是否大于15?
- 每千字连接词是否少于18个?
- 是否有至少三个具体的数字或案例?
- 段落开头方式是否超过四种?
- 开头第一句是否避免了“在当今...的时代”?
- 结尾最后一句是否避免了“总之”“综上所述”?
- 是否有至少一处口语化表达?
- 通读一遍,是否有任何一段让你觉得“好像在哪见过”?
这份清单不能保证文本完美,但能过滤掉大部分明显的AI痕迹。
6. 几个我踩过的坑和对应的解法
6.1 不要过度依赖自动化指标
项目初期,我过于相信自动化指标,结果闹了个笑话。有一个页面被脚本判定为“高度疑似AI生成”,句长标准差只有9.8,连接词密度高达28‰。但我人工阅读之后发现,那是一篇关于法律合规的技术文档,本身就要求高度结构化的表达。人类作者写这种内容时,也会呈现出类似的模式。
这件事教会我:指标是线索,不是判决。任何分析结果都必须经过人工复核,结合具体语境来判断。技术文档、法律文本、学术论文这些领域,本身就有较强的模板化倾向,不能简单套用营销文案的标准。
6.2 样本偏差比想象中更严重
另一个坑是样本偏差。我最初的分析样本主要来自客户的博客内容,结论是“AI文本的句长标准差比人类低40%”。但后来加入了落地页和邮件序列之后,这个差距缩小到了25%左右。原因是落地页和邮件本身就有较强的模板化倾向,人类写的落地页句长标准差也不高。
不同内容类型的“基线”差异很大。做对比分析时,一定要确保样本类型一致。拿AI写的博客和人类写的落地页对比,结论必然失真。
6.3 情感分析比想象中难做
情感曲线分析是我花时间最多、但效果最不理想的部分。主要问题是中文情感词典的覆盖率不够,很多营销文案中的微妙情感表达无法被准确捕捉。比如“省心”这个词,在不同语境下可能是正面(省去麻烦)也可能是负面(缺乏掌控感),词典方法很难区分。
后来我改用了一个折中方案:不追求精确的情感值,只追踪情感倾向的“变化点”。也就是找出文本中情感发生明显转折的位置,然后对比人类文本和AI文本在这些位置上的分布差异。这个方法粗糙但有效,至少能看出AI文本的情感变化点明显更少。
6.4 不要试图“消灭”AI痕迹
最后一个坑是心态上的。项目做到一半的时候,我一度陷入“追求100%人类化”的执念,试图把AI文本改得完全看不出AI痕迹。后来发现这既不现实,也没必要。
AI辅助写作的价值在于效率,不在于完美。如果你的目标是让文本完全像人类写的,那不如直接让人来写。AI辅助写作的正确姿势是:用AI完成初稿和框架,人工负责注入细节、调整节奏、增加“人味”。接受文本中有一些AI痕迹,只要整体质量达标、信息传递有效,就是成功的。
7. 这套方法还能怎么用
分析做完之后,我发现这套方法的应用场景远不止“检测AI痕迹”。客户后来把它用在了几个意想不到的地方。
内容质量审计。每季度跑一次分析,看看内容团队的整体写作质量是在提升还是下降。句长标准差、词汇丰富度这些指标的变化趋势,比单纯的阅读量数据更能反映内容质量。
新员工培训。把分析报告作为培训材料,让新来的内容编辑直观地看到“什么样的写作模式是好的,什么样的是需要避免的”。比单纯讲“要写得生动”有效得多。
编辑流程优化。根据分析结果,客户调整了编辑流程:AI负责初稿,人类编辑负责“反AI味”处理,最后有一个专门的质检环节跑一遍指标检查。整个流程的效率比纯人工提升了三倍左右,质量也稳定在可接受范围内。
竞品内容分析。把竞品的内容也跑一遍分析,看看他们的写作模式有什么特点。这个信息在制定内容策略时很有参考价值——如果竞品都在用同一种模板,你反而应该避开。
我个人在实际操作中的体会是:分析写作模式这件事,最大的价值不是找到“标准答案”,而是建立一套共同的语言。当团队里所有人都能用“句长标准差”“信息密度”这些具体指标来讨论写作质量时,沟通效率会大幅提升。以前说“这篇写得不好”,现在说“这篇的句长标准差只有8,信息密度0.25,需要调整”。后者虽然听起来有点机械,但至少每个人都知道该往哪个方向改。
最后分享一个小技巧:如果你不想写代码,可以用现成的文本分析工具做初步筛查。很多在线工具都能计算句长分布和词汇丰富度,虽然精度不如自己写脚本,但胜在快速方便。先用工具筛出可疑页面,再人工精读,这个组合拳打下来,效率最高。