摘要:欧盟 AI 法生效后,Anthropic 给 Claude 输出加了文本水印与文件凭据,还上线了免费检测页。能查的是图片音视频,代码和纯文本恰恰不在清单里。本文拆这套机制,也说说代码溯源为什么最难。
9 月初,Anthropic 上线了一个免费检测页:把文件拖进去,它会告诉你这个文件是不是被 Claude 处理过。文件不出本机,凭据在浏览器里本地读取。
程序员的第一反应,多半是把手头的代码拖进去试试。
页面弹回一句:不支持。清单里是 JPG、PNG、SVG、MP4、WAV 这类图片音视频,纯文本不在其中,代码文件更不用说。
这个落差就是本文想聊的:内容溯源从口号变成了工具,但"证明代码是 AI 写的"——这个很多人最想验证的场景——恰恰是最难落地的一环。
为什么忽然全行业开始"盖章"
先交代背景:这不是厂商自发的善举,是法律的 deadline。
欧盟《人工智能法案》第 50 条在 2026 年 8 月 2 日生效,要求生成式 AI 的提供者确保输出内容能以机器可读的方式被识别。7 月,Anthropic 和另外约 190 家机构签署了欧盟的《AI 生成内容透明度实践准则》。
Anthropic 选择全球部署,而不是只给欧盟用户加。官方说明里给的理由很实在:暂时没有可靠的办法按地区区分,干脆一刀切。
这跟当年 GDPR 的路径一样——一条欧盟法律,最后变成一套全球默认。
同行也在动:OpenAI 5 月加入了 C2PA 联盟,并与 Google 合作,用 SynthID 给自己的图像输出打标(官方说明见参考资料 1)。
两个信号,机制完全不同
Anthropic 实际交付的是两套独立机制,经常被混为一谈。
第一套是文本统计水印。Claude 生成文本时,会依据一把检测密钥,在语义等价的候选词之间做细微偏向,形成人类看不出、但算法能复原的统计模式。它不是往文本里塞隐形字符,是改变词的选择概率。
这套水印覆盖面最广:8 月 2 日之后发布的新模型(Fable 5.1、Mythos 5.1),在网页、API、Claude Code、Cowork 里生成的所有文本都带。
经 AWS、Google Cloud、微软 Foundry 访问也一样。
文本被复制粘贴后水印跟着走,轻度编辑一般去不掉。
代价在另一端:完全改写、逐词替换能抹掉它。Anthropic 在 FAQ 里补了一句实话——被改写到这个程度,还能不能算"AI 生成",本身就值得商榷。太短的文本也低于检测下限:只有三五个词的回复,统计上没有空间藏信号。
第二套是文件凭据。Claude 生成的受支持文件(目前是 PNG、JPG、SVG),会在元数据里附一段加密签名的记录,声明"此文件由 Claude 制作或处理"。
它走的是 C2PA 开放标准——相机厂商和修图软件记录照片来源用的同一套,联盟成员超过 6000 家组织。
凭据和文本水印有个本质区别:它不修改内容本体,是挂在文件容器上的签名。
好处是篡改可以被发现:任何一个字节变了,签名就断,C2PA 读取工具会直接告诉你。坏处是它比水印脆弱得多:截图、转码、换个软件另存,容器重写一遍,凭据就没了,内容看起来毫无变化。
检测器:能查的,和查不了的
配套的免费工具叫 Content Checker(claude.com/check-content)。无登录,拖文件即查,支持 17 种图片、视频、音频格式,上限 100MB,全程本地处理——页面明确写文件不会上传(工具说明见参考资料 2)。
它只读凭据,不读内容。这句话值得细品。
有评论直接点破了这款产品的诚实之处:它明确告诉你"只识别内容凭据,不能判断 Claude 是否参与了创作"。阳性结果说你被处理过,阴性结果什么都不说明。
这与过去三年的"AI 检测器"是两条路线。Pangram 这类工具没有厂商的密钥,只能靠文本特征猜——最近它把 10 位英联邦文学奖得主中的 4 位误标成 AI。凭据路线不做猜测:验的是签名,是密码学校验,不是推断。
阳性 ≠ AI 写的。Claude 帮你润色一段话、校对一篇文章,也算"处理过",凭据分不清"生成"和"编辑"。
阴性 ≠ 人写的。反制工具开源的一抓一大把,仅剥离 SynthID 和 C2PA 标记的工具就在 GitHub 上攒了 4900 多颗星;截图、转码、重存这些日常操作也会随手丢掉凭据。
无信号,等于没有信息。
代码为什么恰恰最难
回到开头的落差。为什么"证明代码是 AI 写的"落在清单之外?这里有三个层次。
第一层最直接:C2PA 凭据目前只挂在图片类文件上,Content Checker 支持清单里没有纯文本格式。你把 .java、.py、.md 拖进去,它根本没东西可读。机制上就够不着代码。
第二层是检测权不公开。Claude Code 的文本输出理论上带统计水印——产品线全覆盖的口径里包含它。
但检测这段水印需要 Detection API,目前是私有预览,只向监管机构、执法部门、媒体、事实核查组织这类欧盟法律点名的机构开放。个人开发者想自查,没有门路。
第三层是代码本身不适合统计水印,这是我的判断,官方没这么说。文本水印能工作,前提是自然语言里"同一个意思"有海量的改写空间,模型有足够自由度去做偏向。
代码不一样:语义等价的表达空间窄得多,标识符能换,结构变不了。更麻烦的是代码出厂前要过 formatter、lint、编译、重构——每一道都是对统计模式的破坏,还是无心破坏。
所以现状很清楚:能可靠验证的,是 AI 生成的富媒体资产——图片、音频、视频。至于"这段代码是不是 AI 写的",技术上仍停留在几个月前聊治理时说过的笨办法:靠 commit 里的手动标记和流程约定。
我的判断
把期望摆正,这套工具的价值才看得清。
它是合作场景的工具,不是对抗场景的武器。新闻室核验投稿图片、平台确认上传者主动附带的来源声明、企业自查合规——这些"对方愿意配合溯源"的场景,凭据是可靠的。
抓 AI 写的作业、查下属有没有用 AI 写代码——对方想藏的话,截图、转码、剥离工具,随手都是漏洞。官方把"阴性结果不代表清白"写在页面上,本身就是承认了这条边界。
对写代码的人来说,今天它带来的直接价值很小。但有一个现在就能用的例外:让 Claude 画架构图、生成设计稿这类资产,导出的是 PNG、SVG——这些在支持清单里,拖进检测页能验。
代码本身查不了,代码周边生成的图倒是能查,这个反差本身就是现状的最好注脚。
真正值得跟踪的是方向。欧盟把"内容可溯源"变成了模型出厂默认,OpenAI、Google 在同一条路上跟进,跨厂商的凭据互认正在成形。
等代码工具哪天把"这行代码怎么来的"做成生成时默认附带的记录,而不是事后靠人标记——"证明代码是 AI 写的"这个问题才算真正有解。
在那之前,再看到"检测 AI 内容"的按钮,先看一眼它的支持清单。
参考资料
- Anthropic:How Claude’s text watermarking works(官方 FAQ),更新于 2026-09-01,https://www.anthropic.com/news/claude-text-watermark
- Ground Truth:Anthropic shipped a content checker that cannot tell you if Claude wrote it,2026-09,https://groundtruth.day/news/anthropics-content-checker-cannot-tell-you-if-claude-wrote-it.html
- Apidog:How Claude Marks AI-Generated Content?,2026-09,https://apidog.com/blog/how-claude-marks-ai-generated-content
- LangProtect:Anthropic’s AI Watermarks: What Enterprises Need to Know,2026-09,https://www.langprotect.com/blog/anthropic-ai-watermarks-enterprise-guide
作者:唐悦玮 | 从后端出发,用 AI 拓展到全栈的工程师。