ChatGPT 文字開始有「隱形指紋」:OpenAI 將在歐盟導入 textGrain 浮水印,AI 文章追蹤進入新階段

晶片觀測站2026/10/069 min read
分享

30秒摘要

OpenAI 宣布將在未來數週內,為歐盟地區符合條件的 ChatGPT 與 Codex 文字輸出加入不可見的 textGrain 浮水印;全球 API 客戶則可自行選擇是否啟用。這套技術不是在文章裡偷偷塞入特殊字元,而是微調模型生成文字時的機率分布,在詞彙選擇中留下統計訊號。不過 OpenAI 同時承認,短文字、數學內容、翻譯與改寫都可能削弱訊號,因此文字偵測器目前只提供給核准的研究機構與專家組織,而不直接向一般大眾開放。

重點摘要

  1. 01OpenAI 將在未來數週內為歐盟符合條件的 ChatGPT 與 Codex 文字輸出逐步加入 textGrain watermark。
  2. 02全球 API 客戶可以自行 opt-in,API 預設不開啟文字浮水印。
  3. 03textGrain 不使用零寬字元或隱藏符號,而是在模型的 token 選擇中建立統計訊號。
  4. 04OpenAI 測試顯示,文字長度增加通常有利於偵測,但數學等受限內容較難辨識。
  5. 05400-token 測試中,替換 25% 詞彙曾使偵測率從約 92% 降至 17%。
  6. 06文字 detector 第一階段僅開放核准研究人員與專家組織,而不是公開 AI Checker。

AI 文字開始留下看不見的「指紋」

AI 生成圖片已經逐漸進入 C2PA、Content Credentials 與不可見浮水印的時代,現在,同樣的概念開始真正進入文字。

OpenAI 在 2026 年 10 月 5 日公布新的文字來源追蹤策略,核心技術稱為 textGrain。未來數週內,歐盟地區符合條件的 ChatGPT 與 Codex 使用者,在所有方案上產生的部分文字內容,將逐步加入不可見的文字浮水印。

但這次不是全球同步強制導入。

OpenAI 採用的是區域性部署策略:歐盟 ChatGPT / Codex 逐步導入,全球 API 客戶自行選擇是否開啟。

背後最直接的原因,是歐盟 AI Act 對生成式 AI 內容來源透明度提出要求。OpenAI 表示,生成式 AI 提供者需要讓生成內容能以機器可讀方式被辨識,因此公司開始把文字 provenance,也就是內容來源追蹤,正式納入產品架構。

這也代表 AI 內容辨識正在從過去的「看文章像不像 AI 寫的」,逐漸轉向另一條技術路線:在生成過程本身留下訊號。


textGrain 並不是偷偷塞入看不見的字元

很多人看到「文字浮水印」,第一個想到的可能是零寬空格、Unicode 特殊字元、不可見符號,甚至是在複製貼上時偷偷攜帶某些 metadata。

但 textGrain 不是這樣運作。

大型語言模型生成文字時,本質上是在每一步預測下一個 token 的機率。例如一句話後面可能有數個合理選項,每個選項都有不同的 probability。

簡化來看,可以想成:

模型原本認為下一個 token 的可能性為:

A:35% B:30% C:20% D:15%

textGrain 不需要加入額外符號,而是在不明顯破壞語意與品質的前提下,按照秘密金鑰對這些候選 token 的機率分布進行細微調整。

單獨看任何一個詞,都沒有特殊之處。

但當文章累積數百個 token 後,這些選擇會形成統計上的模式。

知道相同秘密設定的 detector,就可以分析一段文字的 token sequence,判斷其中是否存在高於隨機機率所能解釋的 textGrain 訊號。

因此浮水印真正存在的地方不是文字檔案的 metadata,而是:

模型選擇字詞的統計分布。

這是一個很重要的差異。

即使把 ChatGPT 回答複製到記事本、Word、論壇或網頁,只要文字本身沒有被大量改寫,訊號理論上仍可能存在。


但它不是「AI 測謊機」

OpenAI 對這項技術最大的警告之一,就是不要把 watermark detector 當成絕對的 AI 文章判定器。

官方公布的實驗很好地展示了問題。

在目標 false positive rate 設為 1% 的條件下,對部分心理學類內容而言,大約 200-token 的文字,浮水印偵測率約為 80%;當文章增加到約 400 tokens,偵測率可以提高到約 95%。

這代表文字越長,統計訊號通常越容易累積。

但不同類型內容的效果並不相同。

數學、程式碼、精確事實回答等內容,可選擇的合理 token 本來就比較少。模型沒有太多自由度調整措辭,浮水印能藏進去的統計空間自然也比較有限。

換句話說,一篇長篇心理學解說可能有很多種寫法;但「2 + 2 = 4」沒有多少創作空間。

文字浮水印需要語言的自由度才能存在。


改寫 10% 的文字,偵測率就可能明顯下降

真正麻煩的地方是 editing。

OpenAI 公布的 400-token 英文文字測試顯示,在其中一項實驗裡,原始浮水印內容的偵測率約為 92%。

如果只把其中 10% 的詞彙換成同義詞,偵測率就下降到約 66%。

如果替換 25% 的詞彙,偵測率更下降到約 17%。

這揭露文字 provenance 最根本的工程問題。

圖片中的不可見訊號需要面對裁切、壓縮、縮放與重新編碼;文字浮水印面對的敵人則是語言本身。

改寫、翻譯、摘要、人工潤稿、另一個 LLM paraphrase,都可能重新排列 token sequence。

一篇原本由 AI 生成的文章,如果經過大量人工修改,最後可能無法再可靠偵測 watermark。

反過來也一樣重要:

沒有偵測到浮水印,不代表文章一定是人類寫的。

它可能來自不支援 watermark 的模型、可能在功能部署前生成、可能太短,也可能已經被改寫或翻譯。


為什麼 OpenAI 不直接公開 detector?

這次另一個非常值得注意的決策,是 OpenAI 沒有把文字 detector 做成人人都能使用的公開 AI Checker。

至少在第一階段不會。

OpenAI 開放研究人員與專家組織申請 detector access,但會逐案審查。

理由正是 false positive 與 false negative。

如果一個公開網站直接顯示:

「這篇文章有 95% 機率是 ChatGPT 寫的。」

人們很容易把它當成作者身份判定工具。

但 watermark 實際能回答的問題比較窄:

這段文字是否包含與 OpenAI watermark 相符的統計訊號?

它不能回答:

誰生成了文章、使用哪個帳號、輸入了什麼 prompt、人類修改了多少、文章版權屬於誰、內容是否合法,以及文章內容是否正確。

OpenAI 特別表示,detector 不會揭露使用者身份,也不會顯示使用者的 prompts 或 conversations。

這使 watermark 比較接近「來源訊號」,而不是「作者鑑識」。


API 使用者反而擁有選擇權

另一個有趣的地方,是 OpenAI 沒有直接把 watermark 全球強制套進 API。

從 2026 年 10 月 5 日開始,全球 API 客戶可以針對支援的模型選擇啟用文字浮水印,而且預設仍然是關閉狀態。

企業可以依照自己的 transparency requirement、產品設計與法規需求決定是否啟用。

OpenAI 也表示正在與 cloud partners 合作,希望未來數週內讓透過合作夥伴服務存取 OpenAI 模型的輸出,同樣能使用 watermarking。

因此 OpenAI 現階段形成了一個很有意思的雙軌制度:

EU consumer products:逐步導入。

Global API:opt-in。

這也讓歐盟在某種程度上成為大型語言模型文字 provenance 的現實世界實驗場。


浮水印會不會讓模型變笨?

這也是最值得工程端注意的問題。

因為 textGrain 本質上會干預 token sampling probability,如果限制太強,理論上確實可能讓模型無法選擇原本最佳的 token。

OpenAI 因此對 Astra 進行了一系列有無 watermark 的 benchmark 比較。

例如 GPQA Diamond 中,未加浮水印為 94.44%,加入 watermark 後為 93.94%;BrowseComp 從 87.92% 變成 87.35%;DeepSWE v1.1 則從 72.80% 變成 71.68%。另一方面,部分 benchmark 加入 watermark 後反而略高。

OpenAI 的結論是,目前觀察到的差異落在一般 evaluation run 的波動範圍內,沒有看到具有實質意義的整體能力下降。

換句話說,textGrain 的設計目標並不是強迫模型使用某組固定詞彙,而是在保留原本 probability distribution 特性的情況下,加入足以被統計辨識的偏移。

這是一個典型的工程 trade-off:

訊號太弱,抓不到;訊號太強,模型語言品質可能受影響。

textGrain 真正困難的地方,就是找到兩者之間的甜蜜點。


這跟傳統「AI Detector」其實是兩回事

目前網路上的 AI text detector,大多屬於 classifier。

它們通常觀察 perplexity、句型、詞彙分布、重複模式與其他統計特徵,再猜測文章是否像 AI 生成。

問題是,人類也可能寫得很像 AI,而 AI 經過人工修改後也可能寫得很像人類。

Watermarking 的哲學不同。

Classifier 問的是:

「這篇文章看起來像不像 AI?」

Watermark detector 問的是:

「這篇文章裡有沒有我在生成時刻意留下的訊號?」

前者比較接近鑑識推論,後者比較接近 provenance verification。

這也是為什麼歐盟 AI Act 對 machine-readable identification 的要求,正在推動模型供應商從單純的事後 AI detection,走向 generation-time provenance。


AI 內容正在形成自己的「來源基礎設施」

把這件事情拉遠一點看,它其實比單純的 ChatGPT 新功能更重要。

OpenAI 現在已經對不同媒體採用不同 provenance 技術。

圖片可以使用 C2PA Content Credentials 與 SynthID;音訊可以使用不可聽見的 SynthID;文字則開始導入 textGrain。

這代表生成式 AI 正在逐漸形成一套類似數位內容供應鏈的來源基礎設施。

未來看到一張圖片、一段錄音或一篇文章,問題可能不再只是:

「這是不是 AI 做的?」

而是:

「這個檔案保留了哪些 provenance signals?」

這兩句話看起來很接近,但技術哲學完全不同。

前者試圖猜測作者。

後者試圖保存來源證據。


真正的難題其實才剛開始

textGrain 並沒有解決 AI 文字來源問題。

它只是讓這個問題從幾乎完全依賴猜測,開始多出一層可驗證訊號。

文字比圖片與音訊更加麻煩,因為語言天然可以被重寫。

一篇 ChatGPT 文章可以被人工修改,可以送給另一個模型重新改寫,可以翻譯成日文再翻回英文,也可以只保留其中幾個段落。

最後究竟還剩多少 watermark,是一個連續問題,而不是簡單的 YES / NO。

這也是 OpenAI 沒有直接把 detector 公開給所有人的原因之一。

真正值得觀察的,可能不是「AI 文章終於抓得到了」,而是另一件事情:

網際網路正在嘗試為生成式內容建立 provenance layer。

二十年前,我們主要擔心檔案從哪裡來;今天,我們開始需要知道一句話究竟經過了哪些人類與模型。

而 textGrain,就是這套新基礎設施中很早期的一塊磚。


Tech English|本文技術名詞

Text Watermarking|文字浮水印:在 AI 生成文字時嵌入可由特定偵測方法識別的訊號。textGrain 使用的是字詞選擇中的統計模式,而不是額外加入不可見字元。

Content Provenance|內容來源追蹤:描述數位內容從何而來、經過哪些生成或處理流程,以及是否帶有可驗證來源訊號的技術與標準體系。

Token Probability Distribution|Token 機率分布:語言模型生成下一個 token 時,對所有可能候選項分配的機率。textGrain 會在這個階段加入受控制的統計偏移。

False Positive|偽陽性:實際沒有 OpenAI watermark 的文字,卻被 detector 判斷為存在 watermark。

False Negative|偽陰性:文字原本具有 watermark,但因文字太短、改寫、翻譯或其他因素,導致 detector 沒有成功辨識。

Machine-readable Provenance|機器可讀來源資訊:能由軟體自動解析與驗證的內容來源訊號,是 AI 內容透明化的重要技術方向。

Core takeaway

OpenAI 的 textGrain 不是傳統的「AI 文風偵測器」,而是在模型生成文字時直接留下統計來源訊號,但改寫、短文字與受限內容仍會大幅降低可靠度。

Why it matters

這代表 AI 文字來源辨識正在從事後猜測文風,逐步轉向生成階段就建立 provenance signal。對新聞、教育、出版、企業內容與 AI 法規而言,未來真正重要的問題可能不再只是「像不像 AI」,而是內容是否保留可驗證的生成來源。

Data story

03

約 80%

部分心理學類 200-token 文字的 watermark 偵測率

OpenAIOpenAI 測試,target false-positive rate 為 1%;不同內容領域的結果會不同。

約 95%

部分心理學類 400-token 文字的 watermark 偵測率

OpenAI較長文字通常能累積更多統計訊號,但不代表所有領域都能達到相同結果。

17%

替換 25% 詞彙後的實驗偵測率

OpenAI400-token 英文測試中的特定實驗結果,顯示改寫可能大幅削弱 watermark。

Data figure

文字改寫會快速削弱 watermark 訊號

400-token 英文文字,同義詞替換比例增加後的偵測率

Unit · %
0255075100原始watermarkedtext替換 10% 詞彙替換 25% 詞彙
OpenAIOpenAI 公布的特定評估結果;不可直接推廣至所有語言、模型與內容類型。

Tech index

06
01textGrain
02Text Watermarking
03Content Provenance
04Token Probability Distribution
05C2PA
06SynthID

限制與注意

07
  1. 01文字浮水印偵測並非 100% 準確,存在 false positive 與 false negative。
  2. 02OpenAI 公布的偵測率來自特定測試條件,不能直接視為所有語言、模型與文章類型的固定準確率。
  3. 03短文字、程式碼、數學與高度受限的事實性回答通常比較難加入或偵測穩定的 watermark。
  4. 04改寫、同義詞替換、翻譯與其他 LLM paraphrasing 都可能削弱 textGrain 訊號。
  5. 05偵測到 watermark 不代表能確認作者、帳號、prompt、版權歸屬或內容真實性。
  6. 06未偵測到 watermark 也不能證明內容由人類撰寫。
  7. 07OpenAI 目前沒有在 launch 階段向一般大眾公開文字 watermark detector。

資料來源

02
01

OpenAI — Our approach to EU text provenance rules

official

02

OpenAI Help Center — Provenance signals in OpenAI-generated content

official

相關公司

相關文章

探索更多 →