8 月 11 日,Anthropic 發布官方說明:從現在開始,Claude 生成的文本會被嵌入一個人眼看不見的水印。你把文字複製貼上到任何地方,水印跟著走。圖片等檔案則附加符合 C2PA 標準的數位簽名。

但真正值得看的不是「Anthropic 加了水印」這件事本身。是他們在同一份說明裡,花了大量篇幅解釋這個水印「不能證明什麼」。


30 秒定位

項目 內容
宣布日期 2026-08-11
法規觸發 歐盟 AI 法案第 50 條《AI 生成內容透明度行為準則》,2026-08-02 生效
準則簽署規模 約 190 家公司/組織(含 Anthropic、OpenAI、Google、Meta、Microsoft、Mistral 等)
適用範圍 全球,不限歐盟
文本標記 隱形水印,嵌入文本本身(非元數據),複製貼上後仍存在
檔案標記 C2PA 簽名溯源元數據(支援 .svg、.png、.jpg)
覆蓋產品 Claude Platform (API)、Claude、Claude Code、Claude Cowork、Claude Tag
雲合作伙伴 AWS、Google Cloud、Microsoft Foundry
適用模型 Sonnet 4.6、Haiku 4.5 及 2026-08-02 後發布的新模型;舊模型逐步補上

為什麼是現在:歐盟的 compliance deadline

直接觸發因素很明確:歐盟 AI 法案第 50 條第 2 款。

這條法規要求,生成合成內容(文本、圖片、音訊、影片)的 AI 系統,必須以機器可讀的方式標記其輸出。配套的《AI 生成內容透明度行為準則》在 2026 年 8 月 2 日正式生效。在這之後於歐盟推出的新模型,從發布之日起就必須支持內容標記。

Anthropic 是簽署者之一。但它做了一個選擇:不只在歐盟合規,而是全球適用。

同一批簽署者還包括 OpenAI、Google、Meta、Microsoft、Mistral、Black Forest Labs、Synthesia 等,總計約 190 家公司和組織。TechCrunch 的報導提到,音樂生成公司 Suno 也在 8 月 6 日宣布了音樂水印。整個產業正在同時動起來,這不是 Anthropic 的單獨行動。


水印怎麼運作:三種可能的技術路線

很多人第一反應是:「純文本怎麼加水印?」

Anthropic 的官方說明只講了效果——「imperceptible watermark directly into the text itself」,沒有公布具體技術實現。但「把不可見信號藏進純文本」這件事,業界已知的技術路線主要有三條。以下都是概念示範,不代表 Claude 實際採用哪一種。

路線一:零寬度 Unicode 字元

最直觀的方法。在文字之間插入人眼看不見的特殊 Unicode 字元,用不同字元編碼位元。

正常顯示:「今天天氣很好。」

加入零寬空白 U+200B 後,實際字元結構變成:

1
今 天 U+200B 天 氣 很 好 。

畫面上仍然是「今天天氣很好。」——肉眼完全一樣。

更進一步,可以用不同零寬字元編碼二進位資訊:

1
2
0 = U+200B(ZERO WIDTH SPACE)
1 = U+200C(ZERO WIDTH NON-JOINER)

要隱藏 101 這串訊號:

1
今天 U+200C 天氣 U+200B 很好 U+200C 。

複製貼上通常會帶走這些字元。但文字正規化、某些編輯器或平台可能將其刪除——這是這條路線的弱點。

路線二:特殊空白與同形字

特殊空白。 肉眼看到的是「Claude generated this text.」,但實際上每個空格用了不同的 Unicode 編碼:

1
Claude U+00A0 generated U+2009 this U+0020 text.

其中 U+0020 是普通空白、U+00A0 是不換行空白、U+2009 是窄空白。三者寬度相近,但程式可以辨識差異。

同形字(Homoglyph)。 「同形字」是外觀看起來幾乎一樣,但實際 Unicode 碼位不同的字元。拉丁字母、西里爾字母、希臘字母之間有大量同形對:

拉丁 vs 西里爾:

外觀 拉丁字母 西里爾字母
a/а a U+0061 а U+0430
e/е e U+0065 е U+0435
o/о o U+006F о U+043E
p/р p U+0070 р U+0440
c/с c U+0063 с U+0441
x/х x U+0078 х U+0445

拉丁 vs 希臘(大寫更多):

外觀 拉丁字母 希臘字母
A/Α A U+0041 Α U+0391
B/Β B U+0042 Β U+0392
E/Ε E U+0045 Ε U+0395
O/Ο O U+004F Ο U+039F
P/Ρ P U+0050 Ρ U+03A1
T/Τ T U+0054 Τ U+03A4

以下兩行看起來幾乎相同:

1
2
Claude can create content.
Clаude саn сreаte соntent.

第二行混入了西里爾字母。Clаude 裡的 аU+0430саn 的前兩個字元分別是 U+0441U+0430。兩個字串因此不相等:"Claude" === "Clаude" 結果是 false

再看大寫的例子:

1
2
OPENAI
ΟΡΕΝΑΙ

第二行前四個字母其實是希臘字母(Ο = U+039F、Ρ = U+03A1、Ε = U+0395、Ν = U+039D)。

這種技巧可以用來藏簡單信號,但也常被用於網址仿冒——paypal.com(全拉丁)和 pаypal.com(第二個字是西里爾 а)看起來一樣,實際上是不同網域。正因如此,同形字方法在正式系統中有安全疑慮,不適合任意使用。

路線三:句型或統計模式(不加隱藏字元)

這是最不直觀但最「耐洗」的方法。不插入任何隱藏字元,而是利用語言本身的冗餘性——同一個意思有多種合理的表達方式——來編碼信號。

標點編碼。 設定逗號「,」= 0、分號「;」= 1。要隱藏 101

系統完成更新;使用者重新登入,服務恢復正常;資料沒有遺失。

標點序列是 ;,;= 1, 0, 1。

句型編碼。 設定「因此」開頭 = 0、「所以」開頭 = 1。要隱藏 101

所以系統已完成更新。因此使用者需要重新登入。所以資料不會遺失。

更隱蔽的版本可以使用多組等價表達(但是/不過、因此/所以、例如/舉例來說),只看一兩句完全看不出異常。檢測器需要分析較長文章,看選詞或標點是否持續符合祕密規則。

Token 概率微調。 這是學術界研究最多的一種。LLM 生成文本時,每一步預測下一個 token 的概率分布。水印系統在這個概率分布上做微調:用 hash 函數把詞彙表分成兩組,輕微提高其中一組被選中的概率。單看任何一個詞看不出異常,但整篇文章的選詞分布會形成可檢測的統計指紋。Google DeepMind 的 SynthID 用的就是這個原理,稱之為 tournament sampling。

三條路線的取捨

  零寬 Unicode 特殊空白/同形字 句型/統計模式
實作難度
複製貼上後存活 通常存活 通常存活 存活
被文字清理工具清除 容易 容易 困難
耐改寫/翻譯 不耐 不耐 部分耐受
對文本品質影響 極低 極低

Anthropic 說水印「may persist through some editing」——「部分編輯後可能還在」。這個描述跟三條路線都相容:零寬字元複製貼上後帶著走但正規化後消失,統計模式在輕度編輯後仍在但重度改寫後消失。沒有公布技術細節之前,我們無法確認 Claude 用的是哪一種,或者是多種的組合。

不過有一件事可以確定:不管用哪種方法,「讓 Claude 自己找到並去除水印」都行不通。如果是字元類方法,模型在生成階段不知道推論管線在後面插了什麼;如果是統計模式,模型不知道自己的 logit 被偏向了哪些詞。水印是在模型的「視野之外」施加的。

人類指紋是一個很好的類比。你不需要知道指紋的某一條紋路在手指的哪個位置,才能判斷這是不是某個人的指紋——你看的是整體的紋路模式。文本水印也一樣,不管底層用的是隱藏字元還是統計分布,檢測器看的都是全文的整體特徵,不是定位「水印藏在第幾個字」。


兩種互補機制

Anthropic 實際上部署了兩套東西:

第一套:嵌入式文本水印。 上面討論的三種可能路線之一(或組合)。適用於所有 Claude 文本輸出,無論從哪個產品介面生成。水印是文本的一部分,不是附加的元數據,所以複製貼上後跟著走。Anthropic 的原話:水印「may persist through some editing」——部分編輯後可能還在。

第二套:C2PA 簽名溯源元數據。 當 Claude 生成圖片或其他受支援的檔案類型(.svg、.png、.jpg),會附加符合 C2PA 開放標準的數位簽名。C2PA(Coalition for Content Provenance and Authenticity)是業界廣泛採用的內容溯源標準——Adobe、Microsoft、BBC 等都參與了。如果簽名存在,表示該檔案經 Claude 處理過,並且可以檢測檔案是否被篡改。

兩者的差別:文本水印是「織進布料裡」的,去除它需要重織整塊布;C2PA 簽名是「貼在包裝上」的,格式轉換、截圖、重新儲存都可能把標籤撕掉。


Anthropic 自己講的局限:信號,不是鐵證

這是整篇官方說明裡最值得細讀的部分。Anthropic 花了相當篇幅解釋水印「不能做什麼」。

檢測到水印,不代表 Claude 是原作者。 用戶經常用 Claude 做校對、翻譯、摘要、格式轉換。輸出帶著 Claude 的水印,但底層的想法、文字、數據可能完全來自其他來源。而且,內容在經 Claude 處理後可能已被修改、節選、或與其他材料合併。

沒檢測到水印,也不代表內容不是 AI 生成的。 以下情況都會導致水印消失:

  • 內容由水印功能上線前的舊模型生成
  • 文本經過大幅編輯、改寫、翻譯、或混合
  • 文本段落太短,不足以承載可靠的統計信號
  • 檔案元數據在格式轉換、重新儲存、截圖時被剝離
  • 使用尚不支援標記的平台、功能、或檔案格式

白話講:既不能完全證實,也不能完全證偽。 水印是一個「信號」,不是一個「判決」。

這個定位很老實。它把水印放在一個合理的位置上:能提高可追蹤性,但不能當作唯一依據。


對開發者的影響:合規責任不因水印自動轉移

Anthropic 在說明裡特別提了一段:在自有產品中整合 Claude 的開發者,應「獨立評估 AI 法案第 50 條對其產品和服務的具體要求」。

翻譯一下:Anthropic 加了水印,不代表你的產品就自動合規了。

如果你用 Claude API 建了一個面向歐盟用戶的產品,你生成的內容確實會帶著 Claude 的水印。但歐盟 AI 法案對「deployer」(部署者)有獨立的義務——你可能還需要在 UI 上標示「此內容由 AI 生成」、建立內容日誌、或提供用戶查詢機制。這些事 Anthropic 幫不了你,因為它不知道你的產品怎麼包裝、怎麼呈現 Claude 的輸出。

具體而言,一個整合 Claude 的企業 CTO 現在需要回答的問題從「要不要加水印」(Anthropic 已經幫你加了)變成「在我的產品裡,我還需要做哪些事才算合規」。這是一個法律問題,不是技術問題。


反方:水印這麼容易被打破,加了有什麼用?

最強的反駁來了。

統計水印的根本弱點:只要大幅改寫,指紋就散了。把 Claude 的輸出丟給另一個模型重寫一遍、翻譯成另一種語言再翻回來、或者手動逐句改寫——水印就消失了。Anthropic 自己也承認短文本「不足以承載可靠信號」。

所以一個合理的質疑是:如果有心規避的人這麼容易就能繞過,這個水印到底保護了誰?

回應:水印不是為了抓「有心規避的人」設計的。它的目標受眾是大規模、低動機的 AI 生成內容流——那些直接把 Claude 輸出原封不動貼到社群媒體、新聞稿、學術作業裡的情境。在這些場景裡,絕大多數人不會花力氣去改寫,水印就能起作用。

這跟密碼鎖的邏輯一樣。密碼鎖擋不住拿角磨機的小偷,但它擋得住絕大多數順手牽羊的人。水印的價值不在於它不可破解,在於它把「直接複製貼上」的成本從零提高到「至少要花力氣改寫」。

但這個回應有一個前提:水印必須真的被大規模部署和檢測,才有嚇阻效果。 如果沒有人在用檢測工具,水印就跟不存在一樣。Anthropic 說會在技術文檔就緒後發布檢測方案的詳細指引——目前還沒有。這是一個待觀察的缺口。


其實早就在做了:Claude Code 裡的隱藏水印

8 月 11 日的官方宣布不是故事的起點。早在一個多月前,就有人在 Claude Code 的二進位檔裡挖出了一套已經上線的水印機制——而且它用的正是上面講的「路線二:同形字替換」。

2026 年 7 月,有開發者逆向工程 Claude Code v2.1.197 的 claude.exe,在偏移量 0xd2e2879 附近找到一段打包後的 JavaScript。這段程式碼做了幾件事:

  1. 讀取環境變數 ANTHROPIC_BASE_URL,解析出 hostname
  2. 判斷本機時區是不是 Asia/ShanghaiAsia/Urumqi(注意:不是 UTC+8,香港、台灣、新加坡不會命中)
  3. 用 XOR 91 解密一份 Base64 編碼的域名名單(147 項)和 AI 關鍵詞名單(11 項)
  4. 根據判斷結果,把系統提示詞裡 Today's date is 2026-07-01. 這行的撇號換成不同的 Unicode 字元

四種撇號對應四種判斷組合:

Unicode 字元 含義
U+0027 ' 普通撇號 域名未命中、關鍵詞未命中
U+2019 ' 右單引號 域名命中、關鍵詞未命中
U+02BC ʼ 修飾字母撇號 域名未命中、關鍵詞命中
U+02B9 ʹ 修飾字母 prime 域名命中、關鍵詞命中

同時,如果時區命中中國大陸,日期分隔符從 - 換成 /

一個撇號 + 一個日期分隔符,就編碼了三個布林值:是否用了名單內的域名、是否包含 AI 關鍵詞、是否來自中國大陸時區。

這 11 個 AI 關鍵詞解密後是:deepseekmoonshotminimaxxaminimzhipubigmodelbaichuanstepfun01aidashscopevolces——基本對應中國頭部 AI 模型廠商或平台。147 項域名名單的第一項就是 cn,加上匹配邏輯 e===r || e.endsWith("."+r),所有 .cn 結尾的 hostname 都會命中。名單裡還有 baidu.comalibaba-inc.combytedance.netbilibili.co 等大公司域名,以及大量 API 中轉站域名。

這套機制的目的很明確:辨識哪些 Claude Code 的請求來自中國的 API 中轉站。 它不額外上傳資料,而是把判斷結果藏進本來就會發送給模型的 system prompt 裡。Anthropic 後台看到某個請求的日期行長什麼樣,就能推斷這個請求的來源。

從技術上看,這正是上面「路線二」的實戰版——用肉眼看不出差異的同形字元編碼資訊。而且它選的字元特別精巧:四種撇號在任何字型、任何平台上看起來幾乎一模一樣。

這也意味著,8 月 11 日宣布的「文本隱形水印」不是從零開始的新計畫。Anthropic 至少在一個月前就已經在 Claude Code 裡部署了基於 Unicode 字元替換的水印機制,只是當時的目標不是通用內容標記,而是追蹤未授權的 API 中轉。


產業對照:OpenAI 不敢上,中國走另一條路

Anthropic 不是唯一被歐盟盯上的公司。但目前的產業現實是:Anthropic 是唯一公開宣布並實際部署「文本層統計水印」的前沿 lab。

OpenAI:技術早就有,但刻意不上

這是最耐人尋味的案例。OpenAI 的研究員 Scott Aaronson 早在 2022 年就公開描述過文本水印的技術方案。據 Wall Street Journal 報導,OpenAI 內部已經有一套「高準確率」的水印檢測工具,準備好超過一年。

但他們選擇不部署。原因很商業:2023 年 4 月的內部調查顯示,30% 的用戶表示如果 ChatGPT 加水印就會停用。OpenAI 還提出水印可能「不成比例地標籤化非英語母語使用者」——這些人用 ChatGPT 當合法寫作工具,被標記出來不公平。

截至 2026 年 8 月,ChatGPT 的純文本輸出仍然沒有水印。OpenAI 做了圖片的 C2PA 元數據(2024 年起)和音訊標記(2026 年 7 月底趕在歐盟 deadline 前上線),但文本這一塊空著。他們簽了同一份歐盟透明度準則,但歐盟的措辭是「wherever technically feasible」——OpenAI 可能會用 robustness 不足作為暫時不做的技術理由。

這裡有一個結構性矛盾:如果 Anthropic 加了水印而 OpenAI 沒加,部分在意被追蹤的用戶會從 Claude 流向 ChatGPT。30% 的流失率數字,正是 OpenAI 不敢動的原因。Anthropic 選擇在商業壓力下先動,某種程度上是在替整個產業測試「用戶到底會不會跑」。

中國:可見標籤 + 元數據,不是隱形統計水印

中國走的是完全不同的技術路線。

2025 年 3 月,網信辦聯合工信部、公安部、廣電總局發布 AI 生成內容標識規定,2025 年 9 月 1 日生效。要求兩層:

  1. 顯式標籤:用戶可見的文字或圖示(例如「此內容由 AI 生成」),放在內容的適當位置
  2. 隱式標識:在檔案元數據裡嵌入「AIGC」欄位,附帶生產者的統一社會信用代碼和唯一內容識別碼

平台端已在落實——微信要求創作者自行申報 AI 生成內容,抖音也有對應機制。

但這跟 Anthropic 的做法是不同層次的東西。中國的隱式標識是元數據層面的,類似 C2PA 的邏輯:貼在檔案外面,格式轉換或截圖就可能丟失。Anthropic 做的是把統計指紋織進文本本身——複製貼上後指紋仍在。目前沒有公開資料顯示 DeepSeek、百度文心、通義千問或豆包有部署類似的統計文本水印。

三種路線的差異一目了然:

  Anthropic OpenAI 中國模型
文本隱形水印 已部署(技術細節未公布) 技術就緒但未部署 無公開資料
圖片/檔案元數據(C2PA 等) 已部署 已部署(2024 起) 隱式標識(元數據)
可見標籤 強制要求
驅動力 歐盟 AI 法案 + 主動選擇全球適用 歐盟 AI 法案(選擇性合規) 國內監管(網信辦)

連回 Harness Engineering:水印是又一層外部控制

這篇 blog 花了半年在寫 Harness Engineering——AI agent 的外部控制機制。核心框架是:對齊是道德教育,harness 是法律制度,兩者缺一不可。

水印就是 harness 的一個新層次。

之前講的 harness 主要在行為面:沙箱隔離、權限管控、人類審批閘門。水印加入的是溯源面——不是阻止 AI 做某件事,而是讓 AI 做過的事留下可追蹤的痕跡。

這兩個方向互補。行為控制是事前防禦(「不讓你做」),溯源控制是事後追蹤(「做了能查到」)。完整的 harness 架構需要兩者都有。

不過,跟所有 harness 層一樣,水印也有它的適用邊界。行為控制的弱點是「以為有隔離,其實沒有」(Anthropic 三起沙箱逃逸的根因);溯源控制的弱點是「以為能追蹤,其實被改寫了」。每一層 harness 都有它失效的情境,所以才需要多層疊加。


坦白說

這篇文章有幾個需要交代的限制。

第一,Anthropic 沒有公布文本水印的具體技術實現。上面列出的三條技術路線是業界已知的方法,不是 Anthropic 的官方技術文檔。Anthropic 說「將在技術文檔就緒後發布詳細指引」,但目前還沒有。Claude 可能用了其中一種,也可能是多種的組合,或者是完全不同的方法。

第二,「約 190 家公司簽署」這個數字來自歐盟委員會的官方頁面,但簽署準則跟實際落地是兩回事。簽了不代表做了,做了不代表做得好。這個產業的 compliance 歷史告訴我們,從簽署到全面執行之間通常有很長的落差。

第三,水印的實際效果——檢測準確率、誤報率、對文本品質的影響——目前沒有第三方獨立測試數據。Anthropic 說「不會影響品質」,但這是廠商自己的宣稱,不是經過獨立驗證的結論。

第四,歐盟 AI 法案對「deployer」的具體義務,目前的指引文件仍在逐步細化中。上面關於開發者合規責任的描述是基於法條原文和幾家律所的分析,但具體執行細節可能隨後續指引而調整。

第五,「OpenAI 30% 用戶會停用」這個數字來自 Wall Street Journal 引述的 OpenAI 2023 年 4 月內部調查。三年前的數字套用到今天的市場格局需要打折——用戶組成、競爭態勢、監管壓力都已經不同。中國模型「沒有部署統計文本水印」的判斷是基於目前的公開資料,不排除有內部實驗或未公開的部署。

第六,Claude Code 裡的撇號水印機制來自一位中國開發者對 claude.exe 二進位檔的逆向工程分析(v2.1.197,有附 SHA256 和具體程式碼片段)。程式碼邏輯和解密結果看起來可信,但 Anthropic 目前沒有對這個發現做出官方回應或確認。


關鍵洞察

  • 水印是信號,不是判決。 Anthropic 自己講得很清楚:檢測到不代表 Claude 是原作者,檢測不到也不代表非 AI 生成。在引用水印檢測結果時(無論是學術誠信審查還是內容真實性驗證),把它當成「一個參考信號」而不是「定論」,是唯一負責任的用法。

  • 整合 Claude API 的開發者:Anthropic 加了水印不等於你合規了。 歐盟 AI 法案對部署者有獨立義務。現在要做的事不是等 Anthropic,是讓法務團隊評估你的產品在第 50 條下還缺什麼。這是法律問題,Anthropic 的技術實現解決不了。

  • 水印不是為了抓有心人,是為了提高無心複製的成本。 它的威力在於大規模部署後的嚇阻效果,不在於不可破解。但嚇阻效果的前提是檢測工具被廣泛使用——目前這一塊還是空白。檢測方案什麼時候落地、誰來運營、準確率多少,是接下來要看的。

  • 水印不是 8 月 11 日才開始的。 Claude Code 裡早就藏著一套基於同形字元的水印機制,用四種撇號編碼「是否來自中國 API 中轉站」。官方宣布的「文本隱形水印」是把這類技術從特定用途(追蹤未授權中轉)擴展到通用內容標記。技術路線已經在跑了,歐盟法規只是給了它一個公開的名義。

  • Anthropic 先動,是在替整個產業測試用戶反應。 OpenAI 有技術但怕掉 30% 用戶不敢上,中國走可見標籤路線而非隱形統計水印。三條路線反映三種取捨:Anthropic 選擇合規 + 主動透明,OpenAI 選擇商業安全,中國選擇平台責任制。誰的路線最後被證明正確,要看歐盟的執法力度和用戶的實際反應。

  • 在 Harness Engineering 的框架裡,水印填補的是溯源層。 之前這個 blog 討論的 harness 主要在行為控制面(沙箱、權限、審批閘門)。水印加入了事後追蹤的能力。完整的 AI 治理需要事前防禦 + 事後溯源,兩者都不能單獨運作。


常見問題 Q&A

Q: 我用 Claude 寫的東西,別人能看出來嗎?

目前 Anthropic 還沒公布公開的檢測工具。水印是機器可讀的,人眼完全看不出來。等檢測方案發布後,持有金鑰的人可以驗證一段文本是否可能經 Claude 處理。但即便被檢測到,也只代表「可能經 Claude 處理」,不代表「Claude 是原作者」。

Q: 我把 Claude 輸出改寫一遍,水印還在嗎?

取決於改寫幅度。小幅修改(改幾個詞、調整標點)水印可能還在。大幅改寫、翻譯、或用另一個模型重新生成,水印大概率消失。太短的文本片段也不足以承載可靠信號。

Q: 用 Claude API 開發產品的企業需要做什麼?

Anthropic 會在模型層面自動加水印,你不需要做額外的技術實現。但如果你的產品面向歐盟用戶,你需要獨立評估 AI 法案第 50 條對「deployer」的要求——這可能包括 UI 層面的標示、內容日誌等,Anthropic 的水印不能替代這些。

Q: ChatGPT 有加水印嗎?

截至 2026 年 8 月,ChatGPT 的純文本輸出沒有水印。OpenAI 內部有現成的文本水印技術(2022 年就公開描述過),但因為擔心用戶流失(內部調查顯示 30% 用戶會因此停用)而選擇不部署。圖片和音訊有 C2PA 元數據,但文本是空白的。Google DeepMind 的 SynthID 是目前公開資料最多的文本水印系統,用的是 token 概率微調路線。Anthropic 沒有公布自己的具體技術,所以無法直接比較。

Q: 中國的 AI 模型有類似的水印嗎?

中國走的是不同路線。2025 年 9 月生效的規定要求可見標籤(「此內容由 AI 生成」)加元數據層的隱式標識,但這跟 Anthropic 把統計指紋織進文本本身是不同層次的技術。目前沒有公開資料顯示 DeepSeek、百度、阿里或字節的模型有部署類似的統計文本水印。