Anthropic 已开始在其最新的 Claude 模型生成的所有文本中嵌入不可察觉的水印。该变化于 2026 年 8 月 2 日在欧盟推出的模型中生效,Anthropic 表示这将在全球范围内适用。
Anthropic 在一篇 支持文章中阐述了该计划,此前它签署了欧盟人工智能法案的透明度行为准则。换句话说,这并不是自愿的。该标记覆盖了每个 Claude 接口,从聊天机器人和 API 到 Claude Code 以及 AWS、Google Cloud 和 Microsoft Foundry 等云合作伙伴。
Myriad: OpenAI 何时发布 GPT-6? 点击进行预测。
“当一个支持的 Claude 模型生成文本时,它会直接将不可察觉的水印编织到文本本身中。你不会看到它,并且它不会改变 Claude 响应的意义、质量或可读性,”Anthropic 说。“因为水印是文本的一部分,当文本被复制并粘贴到其他地方时,它会随之移动,并可能在某些编辑中持续存在。”
所以这比用户通常认为的方式要复杂一些。当一个支持的 Claude 模型写文本时,它会将不可察觉的水印直接编织到单词中,没有可见的标签。由于这个标记是文本的一部分,它会在复制粘贴中保留,同时,Anthropic 承认,“可能在某些编辑中持续存在。”文件有第二层:在 C2PA 开放标准下的签名元数据(想象一下记录谁制作了文件以及是否有人随后对其进行了更改的数字运输清单)。
方法保持机密
Anthropic 并没有说明水印是如何生成的。支持文章称它是模型级别(模型通过该水印进行训练)和文本本地(这不是像元数据生成器这样的外部工具),但检测文档和确切技术尚未公布。
研究人员推测这是一种统计特征:模型将其单词选择向一种微弱的、可检测的偏差调整,使用的方法与谷歌在 SynthID Text 中使用的方法同属一个家族。直到 Anthropic 发布检测工具之前,这仍然只是一个猜测。
但是,这并没有阻止隐私爱好者,一些专家已经在研究破解 Anthropic 的秘密水印的方法。 mikiane/claude-watermark-cleaner(在 GitHub 上获得 106 顶星)清除隐形的 Unicode,然后用非 Claude 模型重写文本,以干扰令牌模式。
一个更大的项目,guillaumemeyer/watermarks-remover(在 GitHub 上获得 4.6k 顶星),剥离 Claude 文本标记以及跨 PNG、JPEG、SVG、PDF 和 DOCX 的 C2PA 和 SynthID 类信号。作者认为统计文本标记“不是证明来源的可靠方式”,并主要促使用户花费第二个模型回合清理自己的写作。在 Anthropic 发布其检测器和阈值之前,无法保证任何去除。
Anthropic 的历史使隐私反应更加尖锐。该公司在三月移除了一个隐藏的 Claude Code 跟踪器,在此之前研究人员发现它通过未公开的 Unicode 标记标记了一些用户的位置信息和代理使用情况——这种安静的标记技术现在正是在水印计划的核心。
该标记证明 Claude 曾参与文本的生成,并不意味着它写了整个内容,因此它将视为具有小编辑的原创文本与完全由 AI 生成的文本相同。要求 Claude 校对或翻译你的段落,输出仍然可以携带信号。Anthropic 坦诚地表示,重编辑可能会去除它,并且缺少标记并不能证明某个人写了某些内容。
美国一项法案 COPIED Act 推动同样的理念:一种标准化的方式来水印 AI 内容,以便平台可以追溯其来源。正如Claude 的勒索问题所示,该公司的模型已经因其处理文本的方式而受到密切审查。
Anthropic 尚未说明何时会发布能够让任何人验证标记的检测工具。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。