AI-NEWS · 2026年 8月 11日

Claude 水印:能溯源但难定罪

Anthropic 宣布将在新款 Claude 模型中嵌入不可感知水印。这项技术试图解决 AI 生成内容的溯源问题,通过微调概率分布,在文本中留下人类无法察觉但检测器能识别的标记。

8 月 2 日发布的版本起,所有云端访问的 Claude 生成内容都带有这种信号。公司计划把检测工具开源给第三方,甚至考虑把能力回推到旧版模型。

这直接回应了出版和教育行业的焦虑。过去几年,不少出版物因为疑似混入 AI 文本被下架,大学论文也面临大规模审查。水印让机构有了抓手,能区分哪些段落是机器写的,哪些是人类写的,哪怕作者忘了声明。

但技术本身有硬伤。Anthropic 自己承认,一旦文本被大规模重写、翻译,或者跟人类写作深度混合,水印就碎了。检测器只能证明这段文字经过过 Claude,没法断定 Claude 是不是唯一作者。

这就引出一个具体的责任认定难题。假设一篇论文里,人类写了结论,Claude 只负责生成了中间的数据表格,检测器报出“检测到 AI 参与”。这时候,读者是觉得人类作者作弊,还是觉得 AI 只是个辅助工具?目前的逻辑链条在这一环是断的。

这种模糊性让版权方很难直接用检测器做“零容忍”的审查。检测到的水印只能作为证据之一,不能作为定罪的唯一依据。

行业层面,Google DeepMind 在 2024 年已经跟进,Gemini 的文本和视频都会打水印,图像领域更早用了 SynthID。OpenAI 这边,GPT 和 Sora 也在各自的赛道上布局类似的追踪机制。

从图像到文本再到多模态,巨头们都在往这个方向走。这确实提高了 AI 内容的透明度,让“这是机器写的”这件事变得可被验证。

不过,工具给出来了,法律和责任界定还得慢慢磨。

火龙果频道