AI 文字浮水印是怎麼運作的








Anthropic 在 2026 年 8 月 2 日(含)之後推出的新模型,產出的文字裡帶有浮水印。我把官方說明讀了一遍,順著查了浮水印本身的原理,整理成四個問題:浮水印是什麼、為什麼要加、為什麼文字也能加、以及什麼情況下會失效。
浮水印是什麼?為什麼要加?
這裡講的浮水印,不是圖片右下角那種半透明 logo。它是在內容裡留一個機器讀得到、人看不出來的來源標記。
官方給的理由是:AI 生成的內容愈來愈普遍,讓大家知道一份內容從哪裡來,能提供有用的脈絡。法規面對應的是歐盟 AI Act 第 50(2) 條的透明度行為準則,Anthropic 在履行那份承諾。
標記分兩條路走。
文字是把浮水印織進文字本身——官方用的動詞是 weave。你看不到,它也不影響句子的意思、品質或可讀性。因為記號長在文字裡,複製貼上會跟著走。
圖檔是另外附上一段有數位簽章的來源資訊(metadata),遵循 C2PA(Coalition for Content Provenance and Authenticity,業界共通的內容來源標準)。這段資訊除了標示「這個檔案經過 Claude」,也能看出檔案後來有沒有被動過手腳。
適用範圍:不管你是在網站上用 Claude、用 Claude Code,還是用 Claude Cowork、Claude Tag,或是用程式接 Claude Platform(API),都算;跑在 AWS、Google Cloud、Microsoft Foundry 這些雲端平台上的一樣算。官方的寫法是 wherever Claude is offered, worldwide。
為什麼文字也能加浮水印?
這是我最想弄懂的一段。圖片可以動幾個像素,人眼看不出來;文字改一個字就是改一個字,記號要藏在哪裡?
答案在生成的過程裡。模型每寫下一個字,都是從一批候選字裡挑一個——「今天天氣很」後面可以接「好」、「熱」、「悶」,模型算出每個候選字的機率,再從中取樣。浮水印動的不是寫出來的字義,而是「怎麼挑」這件事。
學術上最常被引用的做法是綠名單:用前面已經寫出來的字當種子,把整個詞彙表偽隨機切成兩半,一半算綠名單,取樣前給綠名單的字加一點權重。單獨看每個字都很自然,句子也讀得順,但整段文字裡綠名單字的比例會統計性地偏高。偵測端用同一組種子重算一次名單,數綠字比例、算統計分數,就能判斷這段文字有沒有被標記過。
Google 的 SynthID-Text 走得更細:它不直接調整機率,而是改動取樣時的隨機來源,用一種叫 tournament sampling 的方式決定挑哪個字。這篇論文發在 2024 年的 Nature,他們拿近 2,000 萬則 Gemini 回覆做過線上實驗,結論是文字品質沒有受影響。
要說明的是,Anthropic 沒有公布自己用的是哪一種。官方說明只寫了 weave,技術細節留給之後的文件。上面講的是這類技術的共通原理,不是 Claude 的實作。
這個原理也直接解釋了官方列的一條限制:浮水印是統計訊號,不是藏在某個字裡的一段編碼。字數太少,比例的偏差就撐不出可靠的訊號。
怎麼讓浮水印失效?
官方說明裡有一段在解釋「為什麼你可能測不到記號」,列了五個條件:
- 大幅編輯、改寫(paraphrase)、翻譯,或把它混進你自己的文章裡
- 段落太短,文字量不足以撐出可靠的訊號
- 轉檔、重新儲存、截圖,都可能把圖檔的來源資訊清掉
- 用的是在開始標記之前就釋出的舊模型
- 平台、功能或檔案格式本身不支援某一種標記
前兩條就是上一段那個機制的反面。訊號長在「選了哪些字」上,改寫換掉的正是那些被選出來的字;換得夠多,統計上的偏差就淡掉了。翻譯是整段重新選字,效果更徹底。
第三條是圖檔那條路的弱點。文字的記號長在內容裡,圖檔的來源資訊是附加在檔案上的——附加的東西就有辦法弄掉,截一張圖,那段資訊當場就沒了。
官方沒有回答的是門檻:改寫到什麼程度才會失效?換幾個詞?整段重寫?文件只寫了 heavily edited。這種東西大概也只能自己試出來。
測到不等於判決
官方原文的說法是:偵測到 Claude 的記號,代表這段內容「可能經過 Claude 處理」。
兩個方向都不成立:
測到,不代表是 AI 寫的。 官方自己舉的例子就是校稿、翻譯、摘要、轉檔。你辛苦寫完的文章請 Claude 順一遍句子,它一樣會被標記。
沒測到,不代表不是 AI 寫的。 官方那句寫得很直白:Lack of a detected mark doesn't mean the content wasn't AI-generated or processed。
整件事官方的定調是 not fully conclusive——是訊號,不是結論。
現在還沒有工具可以驗
現在沒有公開的偵測工具。Anthropic 的說法是,他們正在做讓使用者與第三方也能偵測 Claude 浮水印與來源資訊的工具,技術細節會在之後的文件公布。
也就是說,浮水印從 8 月初就開始寫進支援的模型的每一次輸出(8 月 2 日之前推出的舊模型還在過渡期補上),但外面的人拿到一段文字,目前沒有任何官方管道可以驗。標記先上線,驗證後補。
我原本想做的實驗也因此做不了:拿一段 Claude 產出的文字,(a) 自己換句話說 (b) 丟給另一個 AI 改寫,再看記號還在不在。等偵測工具開放再回來補這段。
其他家的做法
Google 走自家的 SynthID,文字也涵蓋。OpenAI 目前只在影像端做來源標示——2026 年 5 月加入 C2PA,並在影像輸出嵌入 Google 的 SynthID,文字浮水印還在研究階段。
它解決的是溯源問題
這東西想解決的是溯源:這份內容從哪裡來、中間有沒有被改過。用這個角度看,設計得很合理——記號跟著內容走,圖檔還能看出有沒有被竄改。
但它不是作弊偵測器。改寫一遍就能繞過、文字太短測不出來、就算測到也只證明「碰過 Claude」,這樣的訊號不足以當成處分或評分的依據。官方自己也把話講在前面了:測到不是結論,沒測到也不代表什麼。
浮水印標的是來源,不是誠信。
最近開始做免費的一對一諮詢,幫你把 AI 接進自己的工作流——有需要的話可以約:https://www.dawsonwang.com/
來源:
- Anthropic 官方說明:https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
- 上線時間與 EU AI Act 背景:https://gizmodo.com/anthropics-claude-will-start-adding-invisible-watermarks-to-ai-generated-text-2000797759
- 綠名單做法(Kirchenbauer et al., 2023, A Watermark for Large Language Models):https://arxiv.org/abs/2301.10226
- SynthID-Text(Google DeepMind, Nature 2024, Scalable watermarking for identifying large language model outputs):https://www.nature.com/articles/s41586-024-08025-4