OpenAI 推出 Private Safety Processing:跨對話偵測濫用,主打「不保留客戶資料」與 Anthropic 打隱私戰

晶片觀測站2026/08/208 min read
分享

30秒摘要

OpenAI 正向部分客戶預覽新的 Private Safety Processing 安全機制,希望在偵測跨多次對話的惡意使用行為時,仍維持零資料保留。這套架構試圖解決企業 AI 長期存在的矛盾:模型供應商需要辨識分散在多個工作階段中的攻擊行為,企業卻不希望敏感對話被平台保存甚至交由人工審查。此舉也與 Anthropic 對部分高能力模型採取最長 30 天資料保留的政策形成鮮明對比,使資料治理與企業隱私逐漸成為 OpenAI 與 Anthropic 競爭的新戰場。

重點摘要

  1. 01OpenAI 正向部分客戶預覽 Private Safety Processing,主打在不保留原始客戶資料的情況下進行跨對話安全分析。
  2. 02新系統把傳統 Zero Data Retention 從單次 session 監控,延伸至多次對話的 long-horizon safety monitoring。
  3. 03偵測到可疑活動時,系統可向 OpenAI 傳送範圍受限的安全訊號,而非直接交出完整對話內容供人工閱讀。
  4. 04Anthropic 對部分 covered models 採取最長 30 天資料保留政策,並允許在受控流程下由少數授權人員進行人工審查。
  5. 05兩家公司正在形成不同的企業 AI 安全路線:Anthropic 強調有限資料保留與嚴格稽核,OpenAI 則試圖以自動化安全處理降低原始資料暴露。
  6. 06企業 AI 的競爭焦點正在從模型性能,擴展到資料治理、隱私、安全架構與合規能力。

生成式 AI 能力持續提升之後,模型供應商面臨一個愈來愈棘手的工程與商業問題:如何同時做到「看得見長期濫用行為」與「看不見企業的敏感資料」?

OpenAI 最新公布的 Private Safety Processing,正試圖從系統架構上解決這個矛盾。

OpenAI 表示,正在向部分客戶預覽 Private Safety Processing。這是一套以自動化方式運行的安全監控系統,能夠分析可能橫跨多次對話與不同工作階段的濫用模式,同時不保留客戶的原始資料。

這項設計的重要性,在於它把傳統 Zero Data Retention(ZDR,零資料保留)的安全能力,從「單次工作階段」延伸至更長時間尺度。

過去企業導入大型語言模型時,一直存在兩個彼此衝突的需求。一方面,AI 供應商必須防止模型被用於惡意軟體開發、網路攻擊、詐騙或其他濫用活動;另一方面,企業可能把原始碼、內部文件、財務資料、客戶資訊與未公開產品計畫送入模型,因此對資料是否被保存、誰能存取,以及供應商是否會進行人工審查極為敏感。

Private Safety Processing 的核心,就是試圖將「安全訊號」與「原始內容」分離。

OpenAI 原本便為部分 API 使用情境提供 Zero Data Retention。按照這種模式,系統可以在單一 session 中自動檢查潛在濫用,但客戶內容不需要長期留存在 OpenAI 的系統裡。

問題是,許多真正複雜的惡意行為並不會集中在一次對話完成。

例如,一名攻擊者若想利用 AI 協助建立惡意軟體,可能刻意把工作拆成數十個看似無害的任務:第一輪詢問網路協定、第二輪產生資料處理程式、第三輪討論權限維持方式,接著再逐步組合成完整攻擊鏈。如果安全系統只看到每一段獨立對話,很可能無法辨識其整體意圖。

OpenAI 將 Private Safety Processing 描述為一種 long-horizon safety monitoring,也就是「長時間尺度安全監控」。系統可以評估多個對話中的輸入與輸出,再判斷這些行為串聯後是否呈現可疑模式。

關鍵在於,這個分析流程仍由自動化安全系統完成,而不是直接把完整客戶對話交給 OpenAI 人員逐一閱讀。

根據 OpenAI 的說法,如果系統偵測到符合特定濫用模式的行為,它可以向 OpenAI 傳送一個「narrowly defined signal」,也就是範圍受到嚴格限制的安全訊號,用來告知平台某種類型的可疑活動可能正在發生。

換句話說,OpenAI 希望得到的是「發生了什麼類型的風險」,而不是直接取得「使用者完整說了什麼」。

OpenAI 隨後可以依照該安全訊號判斷是否需要進一步執法或採取帳戶措施。如果需要更多背景資訊,公司可以主動聯絡企業客戶;而客戶是否進一步向 OpenAI 分享相關資料,則可由客戶自行決定。

這套方法背後真正想解決的是企業 AI 的「跨 session 可見性」問題。

傳統安全系統如果完全不保留資料,最大的弱點就是缺乏記憶。攻擊者只要把一個完整任務拆成許多階段,就可能讓每一個請求單獨看起來都沒有問題。Private Safety Processing 則希望在不建立完整對話資料庫的前提下,仍保存足以判斷模式的安全狀態。

這讓它成為一種介於兩個極端之間的架構:既不是完全沒有跨對話狀態,也不是把客戶所有內容保存數十天後再進行分析。

而這正好碰上 OpenAI 與 Anthropic 目前最敏感的競爭領域之一。

Anthropic 今年 7 月公布新的資料保留政策,針對所謂的「covered models」採取最長 30 天的資料保留。報導指出,這類模型包括 Mythos 等級模型,以及未來具有類似能力的模型。

Anthropic 的理由同樣是安全。

更高能力模型能夠完成更複雜的程式設計、推理與代理任務,也意味著潛在濫用風險增加。如果企業刻意利用高能力模型進行長期攻擊活動,僅依賴單次請求的即時安全檢查可能不足,因此保存一段時間的互動資料,有助於後續分析可疑活動。

但這個做法隨即引起部分企業客戶反彈。

對一般消費者而言,30 天資料保留可能只是隱私政策中的一個數字;對大型企業而言,問題卻完全不同。AI API 可能直接接觸公司的原始碼、資料庫欄位、研發文件、法律文件,甚至受到合約、產業規範或資料主權要求保護的資訊。

因此企業真正關心的不只是「資料會不會被拿去訓練模型」,還包括「資料到底會存在多久」、「是否可能被人工看到」以及「發生安全調查時誰有權限取得內容」。

Anthropic 表示,若確實需要人工審查客戶資料,存取必須透過受控制的流程完成,只允許少數經核准的審查人員操作,而且所有審查活動都會被記錄在無法由審查者自行修改或刪除的防竄改紀錄中。

從資安治理角度看,這是一種典型的 controlled access 設計:接受某些特殊情況下仍需要人工介入,但利用權限隔離與稽核紀錄降低濫用風險。

OpenAI 此次採取的方向則更接近「從一開始就盡量不要讓原始資料進入人工安全流程」。

兩家公司因此正在形成兩種不同的企業 AI 安全哲學。

Anthropic 的方案偏向保留有限時間資料,再利用嚴格權限與稽核流程控制存取;OpenAI 則希望透過 Private Safety Processing,把長期安全判斷盡可能交給自動化系統,再只向平台傳送最小化的安全訊號。

如果這套技術能夠實際達到預期效果,對金融、醫療、法律、國防、軟體開發等高度重視機密資料的產業而言,可能具有相當大的吸引力。

這場競爭也說明,企業級 AI 市場的勝負已經不只是模型排行榜。

過去 OpenAI、Anthropic、Google 等業者競爭焦點主要集中在推理能力、程式設計、context window、模型速度與價格;但隨著大型企業開始把 AI 深度整合到內部工作流程,資料治理、合規、安全架構與資料保留政策正逐漸成為採購決策的一部分。

尤其 AI Agent 開始執行長時間、多步驟任務之後,問題會更加明顯。

Agent 可能連續工作數小時甚至數天,呼叫資料庫、程式碼倉庫與企業內部工具。如果安全系統完全失去跨 session 記憶,可能難以辨識逐步形成的攻擊;但如果為了安全而完整保存所有 agent 操作內容,又可能創造一個新的高度敏感資料庫。

Private Safety Processing 因此可以被視為 OpenAI 對「stateful safety without data retention」的一次嘗試,也就是讓安全系統具有某種跨時間狀態,同時避免建立傳統意義上的完整客戶資料紀錄。

目前這項服務仍處於預覽階段,而且僅提供給部分客戶,因此真正值得觀察的問題還包括:這套系統如何定義與保存跨 session 的安全狀態、錯誤警報率能否控制、企業是否能取得足夠透明的稽核資訊,以及未來是否會擴大到更多 frontier models。

此外,OpenAI 與 Anthropic 此時對企業隱私政策的競爭,也發生在兩家公司商業競爭快速升溫之際。

近期報導指出,OpenAI 第二季成長速度低於 Anthropic;另一方面,Anthropic 的年化營收 run rate 據報已達 650 億美元。資本市場同樣密切關注兩家公司未來上市計畫,Anthropic 投資人甚至曾提出最高約 2 兆美元 IPO 估值的可能性,而 OpenAI 也被報導正在規劃自己的上市進程。

因此,Private Safety Processing 不只是一項資安功能。

對 OpenAI 而言,它同時是一個明確的企業市場訊號:當競爭對手選擇透過保留更多資料來提升安全監控能力時,OpenAI 希望證明另一條路也可能成立,也就是讓 AI 安全系統變得更聰明,而不是單純保存更多內容。

如果這條技術路線成熟,未來企業選擇 AI 供應商時比較的可能不只是「哪個模型更強」,而會進一步變成:「哪家公司能在知道最少資料的情況下,仍然提供足夠可靠的安全保障。」

這或許才是企業 AI 下一階段最重要的護城河之一。

【Tech English 專有名詞】

  1. Private Safety Processing|私密安全處理 OpenAI 新公布的安全架構,目標是在不保留企業原始對話資料的情況下,分析橫跨多次互動的潛在濫用模式。

  2. Zero Data Retention(ZDR)|零資料保留 指 AI 供應商在提供模型服務後,不長期保存客戶輸入與模型輸出內容的資料政策,常見於高度重視隱私與合規的企業 API 環境。

  3. Long-Horizon Safety Monitoring|長時間尺度安全監控 不只檢查單一請求,而是觀察較長時間、跨多個 session 的行為模式,用來辨識刻意拆分的攻擊或濫用活動。

  4. Narrowly Defined Signal|限定範圍安全訊號 安全系統偵測到問題後,只向平台傳遞特定風險類型或警示,而不是直接傳送完整使用者對話內容,以降低敏感資料曝光。

  5. Controlled Access Path|受控存取流程 只有經過授權的人員才能在特定條件下查看敏感資料,通常會搭配權限管理、操作紀錄與稽核機制。

  6. Tamper-Proof Log|防竄改稽核紀錄 一種無法由一般操作者任意修改或刪除的操作紀錄,常用於資安與合規系統,以追蹤誰在什麼時間存取了哪些敏感資料。

相關公司

相關文章

探索更多 →