ChatGPT 文字開始有「隱形指紋」:OpenAI 將在歐盟導入 textGrain 浮水印,AI 文章追蹤進入新階段
30秒摘要
OpenAI 宣布將在未來數週內,為歐盟地區符合條件的 ChatGPT 與 Codex 文字輸出加入不可見的 textGrain 浮水印;全球 API 客戶則可自行選擇是否啟用。這套技術不是在文章裡偷偷塞入特殊字元,而是微調模型生成文字時的機率分布,在詞彙選擇中留下統計訊號。不過 OpenAI 同時承認,短文字、數學內容、翻譯與改寫都可能削弱訊號,因此文字偵測器目前只提供給核准的研究機構與專家組織,而不直接向一般大眾開放。
重點摘要
- 01OpenAI 將在未來數週內為歐盟符合條件的 ChatGPT 與 Codex 文字輸出逐步加入 textGrain watermark。
- 02全球 API 客戶可以自行 opt-in,API 預設不開啟文字浮水印。
- 03textGrain 不使用零寬字元或隱藏符號,而是在模型的 token 選擇中建立統計訊號。
- 04OpenAI 測試顯示,文字長度增加通常有利於偵測,但數學等受限內容較難辨識。
- 05400-token 測試中,替換 25% 詞彙曾使偵測率從約 92% 降至 17%。
- 06文字 detector 第一階段僅開放核准研究人員與專家組織,而不是公開 AI Checker。
AI 文字開始留下看不見的「指紋」
AI 生成圖片已經逐漸進入 C2PA、Content Credentials 與不可見浮水印的時代,現在,同樣的概念開始真正進入文字。
OpenAI 在 2026 年 10 月 5 日公布新的文字來源追蹤策略,核心技術稱為 textGrain。未來數週內,歐盟地區符合條件的 ChatGPT 與 Codex 使用者,在所有方案上產生的部分文字內容,將逐步加入不可見的文字浮水印。
但這次不是全球同步強制導入。
OpenAI 採用的是區域性部署策略:歐盟 ChatGPT / Codex 逐步導入,全球 API 客戶自行選擇是否開啟。
背後最直接的原因,是歐盟 AI Act 對生成式 AI 內容來源透明度提出要求。OpenAI 表示,生成式 AI 提供者需要讓生成內容能以機器可讀方式被辨識,因此公司開始把文字 provenance,也就是內容來源追蹤,正式納入產品架構。
這也代表 AI 內容辨識正在從過去的「看文章像不像 AI 寫的」,逐漸轉向另一條技術路線:在生成過程本身留下訊號。
textGrain 並不是偷偷塞入看不見的字元
很多人看到「文字浮水印」,第一個想到的可能是零寬空格、Unicode 特殊字元、不可見符號,甚至是在複製貼上時偷偷攜帶某些 metadata。
但 textGrain 不是這樣運作。
大型語言模型生成文字時,本質上是在每一步預測下一個 token 的機率。例如一句話後面可能有數個合理選項,每個選項都有不同的 probability。
簡化來看,可以想成:
模型原本認為下一個 token 的可能性為:
A:35% B:30% C:20% D:15%
textGrain 不需要加入額外符號,而是在不明顯破壞語意與品質的前提下,按照秘密金鑰對這些候選 token 的機率分布進行細微調整。
單獨看任何一個詞,都沒有特殊之處。
但當文章累積數百個 token 後,這些選擇會形成統計上的模式。
知道相同秘密設定的 detector,就可以分析一段文字的 token sequence,判斷其中是否存在高於隨機機率所能解釋的 textGrain 訊號。
因此浮水印真正存在的地方不是文字檔案的 metadata,而是:
模型選擇字詞的統計分布。
這是一個很重要的差異。
即使把 ChatGPT 回答複製到記事本、Word、論壇或網頁,只要文字本身沒有被大量改寫,訊號理論上仍可能存在。
但它不是「AI 測謊機」
OpenAI 對這項技術最大的警告之一,就是不要把 watermark detector 當成絕對的 AI 文章判定器。
官方公布的實驗很好地展示了問題。
在目標 false positive rate 設為 1% 的條件下,對部分心理學類內容而言,大約 200-token 的文字,浮水印偵測率約為 80%;當文章增加到約 400 tokens,偵測率可以提高到約 95%。
這代表文字越長,統計訊號通常越容易累積。
但不同類型內容的效果並不相同。
數學、程式碼、精確事實回答等內容,可選擇的合理 token 本來就比較少。模型沒有太多自由度調整措辭,浮水印能藏進去的統計空間自然也比較有限。
換句話說,一篇長篇心理學解說可能有很多種寫法;但「2 + 2 = 4」沒有多少創作空間。
文字浮水印需要語言的自由度才能存在。
改寫 10% 的文字,偵測率就可能明顯下降
真正麻煩的地方是 editing。
OpenAI 公布的 400-token 英文文字測試顯示,在其中一項實驗裡,原始浮水印內容的偵測率約為 92%。
如果只把其中 10% 的詞彙換成同義詞,偵測率就下降到約 66%。
如果替換 25% 的詞彙,偵測率更下降到約 17%。
這揭露文字 provenance 最根本的工程問題。
圖片中的不可見訊號需要面對裁切、壓縮、縮放與重新編碼;文字浮水印面對的敵人則是語言本身。
改寫、翻譯、摘要、人工潤稿、另一個 LLM paraphrase,都可能重新排列 token sequence。
一篇原本由 AI 生成的文章,如果經過大量人工修改,最後可能無法再可靠偵測 watermark。
反過來也一樣重要:
沒有偵測到浮水印,不代表文章一定是人類寫的。
它可能來自不支援 watermark 的模型、可能在功能部署前生成、可能太短,也可能已經被改寫或翻譯。
為什麼 OpenAI 不直接公開 detector?
這次另一個非常值得注意的決策,是 OpenAI 沒有把文字 detector 做成人人都能使用的公開 AI Checker。
至少在第一階段不會。
OpenAI 開放研究人員與專家組織申請 detector access,但會逐案審查。
理由正是 false positive 與 false negative。
如果一個公開網站直接顯示:
「這篇文章有 95% 機率是 ChatGPT 寫的。」
人們很容易把它當成作者身份判定工具。
但 watermark 實際能回答的問題比較窄:
這段文字是否包含與 OpenAI watermark 相符的統計訊號?
它不能回答:
誰生成了文章、使用哪個帳號、輸入了什麼 prompt、人類修改了多少、文章版權屬於誰、內容是否合法,以及文章內容是否正確。
OpenAI 特別表示,detector 不會揭露使用者身份,也不會顯示使用者的 prompts 或 conversations。
這使 watermark 比較接近「來源訊號」,而不是「作者鑑識」。
API 使用者反而擁有選擇權
另一個有趣的地方,是 OpenAI 沒有直接把 watermark 全球強制套進 API。
從 2026 年 10 月 5 日開始,全球 API 客戶可以針對支援的模型選擇啟用文字浮水印,而且預設仍然是關閉狀態。
企業可以依照自己的 transparency requirement、產品設計與法規需求決定是否啟用。
OpenAI 也表示正在與 cloud partners 合作,希望未來數週內讓透過合作夥伴服務存取 OpenAI 模型的輸出,同樣能使用 watermarking。
因此 OpenAI 現階段形成了一個很有意思的雙軌制度:
EU consumer products:逐步導入。
Global API:opt-in。
這也讓歐盟在某種程度上成為大型語言模型文字 provenance 的現實世界實驗場。
浮水印會不會讓模型變笨?
這也是最值得工程端注意的問題。
因為 textGrain 本質上會干預 token sampling probability,如果限制太強,理論上確實可能讓模型無法選擇原本最佳的 token。
OpenAI 因此對 Astra 進行了一系列有無 watermark 的 benchmark 比較。
例如 GPQA Diamond 中,未加浮水印為 94.44%,加入 watermark 後為 93.94%;BrowseComp 從 87.92% 變成 87.35%;DeepSWE v1.1 則從 72.80% 變成 71.68%。另一方面,部分 benchmark 加入 watermark 後反而略高。
OpenAI 的結論是,目前觀察到的差異落在一般 evaluation run 的波動範圍內,沒有看到具有實質意義的整體能力下降。
換句話說,textGrain 的設計目標並不是強迫模型使用某組固定詞彙,而是在保留原本 probability distribution 特性的情況下,加入足以被統計辨識的偏移。
這是一個典型的工程 trade-off:
訊號太弱,抓不到;訊號太強,模型語言品質可能受影響。
textGrain 真正困難的地方,就是找到兩者之間的甜蜜點。
這跟傳統「AI Detector」其實是兩回事
目前網路上的 AI text detector,大多屬於 classifier。
它們通常觀察 perplexity、句型、詞彙分布、重複模式與其他統計特徵,再猜測文章是否像 AI 生成。
問題是,人類也可能寫得很像 AI,而 AI 經過人工修改後也可能寫得很像人類。
Watermarking 的哲學不同。
Classifier 問的是:
「這篇文章看起來像不像 AI?」
Watermark detector 問的是:
「這篇文章裡有沒有我在生成時刻意留下的訊號?」
前者比較接近鑑識推論,後者比較接近 provenance verification。
這也是為什麼歐盟 AI Act 對 machine-readable identification 的要求,正在推動模型供應商從單純的事後 AI detection,走向 generation-time provenance。
AI 內容正在形成自己的「來源基礎設施」
把這件事情拉遠一點看,它其實比單純的 ChatGPT 新功能更重要。
OpenAI 現在已經對不同媒體採用不同 provenance 技術。
圖片可以使用 C2PA Content Credentials 與 SynthID;音訊可以使用不可聽見的 SynthID;文字則開始導入 textGrain。
這代表生成式 AI 正在逐漸形成一套類似數位內容供應鏈的來源基礎設施。
未來看到一張圖片、一段錄音或一篇文章,問題可能不再只是:
「這是不是 AI 做的?」
而是:
「這個檔案保留了哪些 provenance signals?」
這兩句話看起來很接近,但技術哲學完全不同。
前者試圖猜測作者。
後者試圖保存來源證據。
真正的難題其實才剛開始
textGrain 並沒有解決 AI 文字來源問題。
它只是讓這個問題從幾乎完全依賴猜測,開始多出一層可驗證訊號。
文字比圖片與音訊更加麻煩,因為語言天然可以被重寫。
一篇 ChatGPT 文章可以被人工修改,可以送給另一個模型重新改寫,可以翻譯成日文再翻回英文,也可以只保留其中幾個段落。
最後究竟還剩多少 watermark,是一個連續問題,而不是簡單的 YES / NO。
這也是 OpenAI 沒有直接把 detector 公開給所有人的原因之一。
真正值得觀察的,可能不是「AI 文章終於抓得到了」,而是另一件事情:
網際網路正在嘗試為生成式內容建立 provenance layer。
二十年前,我們主要擔心檔案從哪裡來;今天,我們開始需要知道一句話究竟經過了哪些人類與模型。
而 textGrain,就是這套新基礎設施中很早期的一塊磚。
Tech English|本文技術名詞
Text Watermarking|文字浮水印:在 AI 生成文字時嵌入可由特定偵測方法識別的訊號。textGrain 使用的是字詞選擇中的統計模式,而不是額外加入不可見字元。
Content Provenance|內容來源追蹤:描述數位內容從何而來、經過哪些生成或處理流程,以及是否帶有可驗證來源訊號的技術與標準體系。
Token Probability Distribution|Token 機率分布:語言模型生成下一個 token 時,對所有可能候選項分配的機率。textGrain 會在這個階段加入受控制的統計偏移。
False Positive|偽陽性:實際沒有 OpenAI watermark 的文字,卻被 detector 判斷為存在 watermark。
False Negative|偽陰性:文字原本具有 watermark,但因文字太短、改寫、翻譯或其他因素,導致 detector 沒有成功辨識。
Machine-readable Provenance|機器可讀來源資訊:能由軟體自動解析與驗證的內容來源訊號,是 AI 內容透明化的重要技術方向。
Core takeaway
OpenAI 的 textGrain 不是傳統的「AI 文風偵測器」,而是在模型生成文字時直接留下統計來源訊號,但改寫、短文字與受限內容仍會大幅降低可靠度。
Why it matters
這代表 AI 文字來源辨識正在從事後猜測文風,逐步轉向生成階段就建立 provenance signal。對新聞、教育、出版、企業內容與 AI 法規而言,未來真正重要的問題可能不再只是「像不像 AI」,而是內容是否保留可驗證的生成來源。
Data story
03約 80%
部分心理學類 200-token 文字的 watermark 偵測率
約 95%
部分心理學類 400-token 文字的 watermark 偵測率
17%
替換 25% 詞彙後的實驗偵測率
Data figure
文字改寫會快速削弱 watermark 訊號
400-token 英文文字,同義詞替換比例增加後的偵測率
Tech index
06限制與注意
07- 01文字浮水印偵測並非 100% 準確,存在 false positive 與 false negative。
- 02OpenAI 公布的偵測率來自特定測試條件,不能直接視為所有語言、模型與文章類型的固定準確率。
- 03短文字、程式碼、數學與高度受限的事實性回答通常比較難加入或偵測穩定的 watermark。
- 04改寫、同義詞替換、翻譯與其他 LLM paraphrasing 都可能削弱 textGrain 訊號。
- 05偵測到 watermark 不代表能確認作者、帳號、prompt、版權歸屬或內容真實性。
- 06未偵測到 watermark 也不能證明內容由人類撰寫。
- 07OpenAI 目前沒有在 launch 階段向一般大眾公開文字 watermark detector。
資料來源
02OpenAI — Our approach to EU text provenance rules
official
OpenAI Help Center — Provenance signals in OpenAI-generated content
official


