Anthropic干了一件让全体用户暴躁的事。
8月中旬,他们宣布要给所有的生成产物都打上水印,包括文本和图片。这种水印对人类来说隐形,却能被检测器读出来。
图片水印早已有之,给文本打水印之前没大规模推广。以后,用Claude写工作总结?打上。做中英翻译?打上。检查语病语法?打上。写代码?打上!
一群人怒了:凭什么啊?虽然我是用了AI,但它的贡献可能只是一小部分,跟我自己的脑力劳动相比微不足道。那把产出物全打上水印,算不算抢我成果?检测器能测明白吗,误杀率有多少?如果领导、客户把我交出去的东西一过检测器,发现里面全是AI水印,用各种理由不给我发钱了,谁承担损失?几天之内,多款“水印去除器”在GitHub发布。最受欢迎的是法国开发者Guillaume Meyer做的Watermarks remover,它被星标了1.9万次,在X上也有2万收藏。
好好的,Anthropic为什么在两周前挑逗大众情绪呢?
欧盟动手在前,Anthropic不得不跟欧盟的《人工智能法案》已经在8月2日生效。它的第50条要求,生成式AI的输出必须带机器可读的标记,目的是让人们能够识别自己何时正与AI互动,以及所接触的内容是否由AI生成或修改,从而减少欺骗、操纵和虚假信息。法案特地要求“足够可靠、有效、稳健、可互操作”。
记住这4个词。后面你会发现,这个要求常常被打脸。
《人工智能法案》的名字非常简洁:EU AI Act丨欧盟
具体来说,8月2日后发布的新模型必须给所有生成物打上水印;8月2日前就上线的旧模型,包括Sonnet 5、Fable 5,都有过渡期,到今年12月2日前能上线水印即可。
违反法案会有一系列处理措施,最高可能罚款1500万欧元,或全球年营业额的3%,哪个高就按哪个罚。目前有100多家机构签署签署了配套的《AI生成内容透明度行为准则》,包括谷歌、Meta、微软、Mistral、OpenAI、联想等。xAI和DeepSeek、字节等中国代表性AI企业暂时没签。绕过水印的第一件事,是知道它长什么样这种水印对人类隐形,远不如“不是……而是……”这种AI拉屎句式那么明显。
Claude给图像附加的来源元数据,遵循内容来源与真实性联盟(C2PA)开放标准,因此在非专业用途上暴力破解就够,图片格式转换、手机截图、哪怕发微信再另存都行。
C2PA检测器可以读出很多信息,比如图片是哪个AI生成的丨C2PA Viewer
而给文本打水印的技术SynthID-Text,虽然早就由谷歌在2024年发布,但目前应用得还不算太广。原理简单来说是:
模型每写一个词,都会先按正常概率抽出一组候选词,越合适的词分数越高。SynthID再根据密钥和上文,给候选词打上看不见的随机分,让它们像参加淘汰赛一样两两较量,最后的胜者被写进下文。单看一个词没有任何异常,但在一定长度的文本里,某种规律就会累积起来,形成记号。检测,则使用同一把密钥反向进行。
既然水印的关键在于AI选词有"规律",那么破解的核心也就两个字:换词。
去水印,也没那么麻烦最直接的方法是把文字改写一遍。注意,是换词复述,而不是照着原文自己重新打一遍,当然也不能让Claude自己去改写自己。
省力版·重写,就是上古手搓论文时期的防查重方法:把一段文字丢进翻译器,中文转英语转德语再翻译成中文,几轮倒腾下来,查重系统就检测不到了。
如果你不想自己搞,那当然你可以用AI去改写和翻译,也可以让工具帮你使唤AI。
Watermarks Remover就是自动使用不带水印的模型生成多个重写版本,替换同义词,并对内容进行微调。用几个带水印的模型,相互改写,也能通过魔法对冲消水印。争议Claude的所有文本类型输出都会带上标记,自然也包括代码。
Anthropic一再表示,从技术上来说代码里能塞进水印的余地很小,因为给定上文之后代码下文经常只有唯一一个词可选、不存在选A还是选B。但还是有很多开发者不买账,愤而退订。
媒体Business Insider采访了几位退订用户。一位捷克开发者Vladislav平时用AI做代码审查和翻译,他担心如果正式交付给客户的代码,都带着水印,客户会质疑代码作者是谁,进而引发版权归属争议,甚至触发合同里的违约条款。
另一个问题是,Claude很可能会把它吐出来的东西一股脑打上标记,不管你是让它写作,还是仅仅检查文章的语法是否错误、让它给成稿润色语气;而如果让它把一张原创的图片改个格式,它也会加上标注,不区分AI在其中的贡献度。如果下一个人拿着这些产物塞进检测器,检测结果是“用了AI”,他又会怎么看待呢?
哦,对了,也有一种可能,检测器根本揪不出AI。在今年7月发布的研究里,结果相当不乐观:
在约50个词元的短文本实验中,研究定制版SynthID检测器面对30段带水印文本,只明确检出6段,其余24段落入“不确定”区间;对184次纯人类手搓的文本,它又把其中10次误判为带水印,误报率为5.4%。当然,这些结果只适用于论文测试的开源配置,不能直接代表Gemini或Claude的实际情况。执行,草台班子监管落地得这么急,可现在根本执行不了。
谷歌算是走得最快的,它已经让Gemini给多种输出形式打水印,也开源了SynthID-Text的生成与检测框架,但尚未有针对性检测工具。OpenAI目前给图像和音频加了水印,没来得及管文本。Anthropic的水印和检测器都在路上。Meta、微软等公司的进度更加落后。

OpenAI溯源信号(水印)现状丨OpenAI官方
连检测器都没有,那欧盟要求将来“用一个检测器,就能检测出各家水印”,还稍微有点难办。
更尴尬的是,欧盟27个成员国里,不是各个都已经指定好了负责监管的机构。
所以现在就是这么个情况:官方需求已经下了,才发现执行能力、标准、工具甚至人员都还没对齐。“让人们能够识别自己何时正与AI互动,以及所接触的内容是否由AI生成或修改,从而减少欺骗、操纵和虚假信息”,这场声势不小的水印运动出发点是好的,但能否达到目标,是否会有其他地区跟进,尚不得而知。
参考文献
[1] Regulation (EU) 2024/1689 (Artificial Intelligence Act), Article 50, Article 113. EUR-Lex.
[2] Anthropic. How Claude marks AI-generated content. Claude Help Center.
[3] The Machine Herald. EU AI Act Transparency Rules Take Effect, Requiring Deepfake and AI-Content Labeling Across the Bloc.
[4] El País. Ya no será tan fácil copiar y pegar con IA: Claude pondrá una marca de agua en todos los textos que genere.
[5] Google AI. SynthID: Tools for watermarking and detecting LLM-generated Text.
[6] StreamingMeme. EU AI Act transparency rules take effect, mandating synthetic content watermarks.
[7] guillaumemeyer/watermarks-remover. GitHub.
[8] Wu, Z., Gong, G., Zhu, Q., Chen, Y., Zhao, R. Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs. ICML 2026
[9] Business Insider. Claude users are canceling their subscriptions, citing Anthropic's new AI watermark.
[10] Tamim, S. R., Khan, A. L. AI Watermark Evidence Fails Forensic Readiness: An Empirical Evaluation.
[11] Outsource Accelerator. EU AI act enforcement begins for AI model makers.
作者:Luna
编辑:李小葵
封面图来源:即梦
点个“小爱心”吧
