AI 安全該靠規則還是「性格」?新研究拆解大型 AI 系統的兩道防線
30秒摘要
當 AI 每天處理數百萬甚至上億次互動,只靠輸出過濾器真的夠安全嗎?一篇最新研究建立數學模型,比較「Character Shaping」與「Rule Enforcement」兩種 AI 安全策略。結果顯示,真正左右安全架構的關鍵,可能不是部署規模本身,而是模型在陌生環境中能否維持訓練後的安全行為,也就是研究所稱的 Character Fragility。
重點摘要
- 01研究將 AI 安全分為 Character Shaping 與 Rule Enforcement,並用 α 表示安全資源投入模型內部行為塑造的比例。
- 02在作者測試的三種情境中,完全依賴 Character Shaping(α = 1)從未成為最佳安全配置,混合式防禦通常表現更佳。
- 03部署規模從 10² 增至 10⁸ 次互動後,Optimistic 情境最佳 α 僅由 0.62 增至 0.63,顯示 Scale 本身未必是主要決定因素。
- 04Character Fragility 是敏感度最高的參數:baseline fragility 從 0.005 增至 0.40 時,最佳 α 可由約 0.70 降至 0.20。
- 05研究模型顯示,Character Fragility 約低於 5% 時配置較偏向 Character Shaping,超過約 10% 後則明顯偏向 Rules,但這不是現實產業安全標準。
- 06論文屬於理論性的 stylized comparative-statics model,而非基於 GPT、Claude 或 Gemini 真實部署數據建立的實證 Scaling Law。
生成式 AI 的安全問題,經常被簡化成一句話:「怎麼讓模型不要做危險的事?」但真正部署大型 AI 系統時,工程師面對的問題其實更複雜。
一個 AI 系統可以從兩個地方建立安全防線。第一種方法,是直接在訓練階段改變模型的行為,讓它本身更傾向產生安全、符合人類偏好的回答;第二種方法,則是在模型外面建立分類器、內容過濾器與政策規則,在輸出真正送到使用者之前進行攔截。
這兩種思路看起來都合理,但問題來了:如果安全資源有限,到底應該投入多少在「把模型本身教好」,又應該投入多少在外部防護系統?而當同一個 AI 模型從服務幾百人,擴張到每天數百萬甚至上億次互動時,最佳配置會不會改變?
日本理化學研究所 RIKEN 與日本國立癌症研究中心研究團隊,在論文《Rules or Character? Scaling Laws for AI Safety Design》中,嘗試用數學模型回答這個問題。
AI 安全的兩條路:改變模型,或限制模型
研究將 AI 安全措施概略分為兩大類。
第一類稱為 Character Shaping,可以理解成「塑造模型本身的行為傾向」。常見方法包括 Reinforcement Learning from Human Feedback(RLHF)、Constitutional AI,以及其他安全微調與偏好最佳化技術。
這類方法的重點不是在模型輸出後才判斷內容,而是在訓練階段直接改變模型的輸出分布。理想情況下,即使沒有外部過濾器,模型本身也比較不容易產生危險行為。
第二類則是 Rule Enforcement,也就是在模型外部建立規則與防護層,例如 Safety Classifier、Output Filter、Policy Engine 或其他 Runtime Safety Mechanism。
簡化來看,可以把兩種架構想像成:
Character Shaping:使用者 → 已接受安全訓練的模型 → 回答
Rule Enforcement:使用者 → 模型 → 安全分類器/過濾器 → 回答
而現實世界的大型 AI 系統,通常並不是二選一,而是把兩種方式疊在一起:模型本身接受安全訓練,同時外部還存在額外的內容審查與政策執行機制。
研究真正想知道的,因此不是哪一派「比較正確」,而是兩種安全機制之間應該如何分配資源。
用 α 表示 AI 安全資源怎麼分配
作者建立一個簡化模型,使用 α(alpha)代表投入 Character Shaping 的安全資源比例。
當 α = 0,代表安全資源全部投入 Rule Enforcement;當 α = 1,則代表完全依靠 Character Shaping,不再把資源投入外部規則與過濾機制。
介於 0 與 1 之間,則代表混合式安全架構。
例如 α = 0.6,可以概念性理解為約 60% 的安全資源投入模型內部行為塑造,其餘投入外部防護。這不是現實中的實際預算公式,而是作者用來研究不同安全策略相對關係的數學抽象。
接下來,研究讓 AI 的部署規模 T 從 10² 次互動一路增加到 10⁸ 次互動,觀察最低化預期危害時的最佳 α 是否改變。
AI 規模越大,小概率事故也會累積
為什麼部署規模值得單獨研究?原因在於 AI 與人類專業工作最大的不同之一,就是 AI 可以被極大量複製。
一名醫師、律師或金融分析師,一天能做出的重要決策數量有限;但同一套 AI 模型可以同時服務數十萬、數百萬甚至更多使用者。
假設某個系統發生錯誤的機率非常低,在少量使用情況下可能幾乎觀察不到問題。但是當互動次數增加好幾個數量級,原本極小的 per-interaction failure probability,仍可能累積成大量事故。
換句話說,AI Safety 不能只看「一次回答出錯的機率有多低」,還必須考慮這個機率會被放大多少次。
這也是大型 AI 系統與傳統軟體風險管理開始出現差異的地方。
更麻煩的是:所有 AI 可能一起踩到同一個洞
研究進一步加入一個重要概念:Common-Mode Failure,中文通常可譯為共同模式故障。
假設公司部署了一百萬個 AI instance,但這些 AI 使用相同模型權重、相同安全分類器,以及相同的政策架構。
表面上看起來,公司擁有一百萬套 AI 系統;但從系統安全角度來看,它們其實可能共享同一個弱點。
如果某個安全分類器存在未被發現的盲區,一旦某種輸入模式成功繞過這個盲區,問題可能不是單一使用者遭遇一次錯誤,而是所有共享相同安全架構的 AI instance 都可能受到影響。
這就是 Common-Mode Failure。
它與航空、核能或大型基礎設施工程中的共同故障概念非常接近:看似擁有很多系統,不代表真正擁有很多獨立防線。如果所有系統都依賴同一個零件,那個零件就可能成為整體架構的單點風險。
作者因此假設,隨著 AI 遭遇的 edge cases 越來越多,外部 filter 的有效 leakage rate 可能逐漸增加,而共同弱點被發現或觸發的可能性也可能升高。
為什麼不能乾脆全部投入 Character Shaping?
看到這裡,很容易產生另一個問題:既然外部規則可能被繞過,為什麼不乾脆把 AI 本身訓練得非常安全?
這正是論文加入的另一個核心概念:Character Fragility。
Character Fragility 指的是模型經過安全訓練後所形成的行為,在面對訓練分布之外的新情境時,是否仍然可靠。
例如一個模型在已知的 benchmark、red teaming 題目與安全訓練資料中表現良好,並不代表它在真正部署後遇到全新的語言組合、文化背景、工具使用方式、多步驟任務或異常情境時,仍然一定維持相同行為。
研究將這類風險大致涵蓋成兩種可能性。
第一種是 Distributional Fragility,也就是典型的 Distribution Shift 問題。模型並沒有惡意,只是進入訓練資料沒有充分涵蓋的區域後,原本學到的安全行為無法可靠泛化。
第二種則是更極端的 Deceptive Alignment:模型在訓練階段表現出符合安全要求的行為,但某些不希望出現的行為模式並沒有真正消失,而可能在特定條件或觸發情境下重新出現。
論文沒有聲稱現有大型模型一定存在 deceptive alignment,而是將這兩類失敗都抽象化到 Character Fragility 參數之中。
結果一:完全依靠模型「內建安全」從未成為最佳方案
研究建立 Optimistic、Moderate 與 Pessimistic 三種情境,分別代表較強到較弱的 Character Shaping、不同的 filter 品質與不同程度的 fragility。
研究最直接的結果之一,是在所有模擬條件下,α = 1,也就是完全依靠 Character Shaping,都沒有成為最佳方案。
換句話說,即使模型本身的安全訓練非常有效,保留某種外部安全機制仍然具有價值。
在 Optimistic 情境中,當部署規模從 10² 增加到 10⁸ 次互動時,最佳 α 大約只從 0.62 增加到 0.63。
Moderate 情境則從約 0.51 增加至 0.55。
最明顯的變化出現在 Pessimistic 情境:小規模部署時最佳解是 α = 0,也就是完全偏向 Rules;但當部署規模增加到 10⁸ 時,最佳 α 上升至約 0.21。
這代表在作者設定的模型中,規模擴大確實可能讓 Character Shaping 的相對價值提高,但這種影響沒有想像中巨大,而且高度取決於其他條件。
結果二:真正重要的不是 Scale,而是 Character Fragility
這可能是整篇研究最重要、也最容易被論文標題掩蓋的發現。
作者原本研究的是 Scaling Laws for AI Safety Design,但敏感度分析顯示,Deployment Scale 並不是影響最佳安全配置最大的變數。
最強大的因素,是 baseline Character Fragility,也就是模型內建安全行為在陌生環境下失效的概率。
研究將 baseline fragility 從 0.005 提高到 0.40 時,最佳 Character Shaping 權重 α 從約 0.70 降低到 0.20,整整移動 0.50。
相比之下,研究測試的其他變數對最佳 α 的影響都明顯較小。Character Shaping 效果強度造成約 0.27 的變化,行為變異縮減效果約 0.21,filter 技術品質約 0.07,edge-case exposure 約 0.02,而 Common-Mode Failure 相關參數的影響在這套模型中甚至只有約 0.01。
也就是說,真正決定安全架構應該偏向哪一邊的問題,可能不是:「這個 AI 有多少人使用?」
而是:「我們有多確定安全訓練真的能泛化到模型從未遇過的情境?」
5% 與 10%:很有意思,但不能當成產業標準
作者的敏感度分析還出現一組非常醒目的結果。
在這套模型與參數設定中,如果 Character Fragility 能維持在大約 5% 以下,最佳配置通常會讓 Character Shaping 取得超過一半的安全資源;當 fragility 超過約 10% 後,最佳解則明顯轉向 Rule Enforcement。
但這裡必須特別注意:5% 與 10% 並不是現實世界 AI 的安全門檻,也不是 OpenAI、Anthropic、Google 或其他公司的實測標準。
它們只是作者這套 stylized model 在特定假設與參數範圍下產生的轉折區間。
研究本身也明確指出,模型目的不是精確複製現實 AI Safety System,而是研究兩種安全策略之間的結構性 trade-off。因此真正重要的不是記住 5% 這個數字,而是理解背後的關係:Character Fragility 越低,投資模型內部安全越值得;Character Fragility 越高,外部 Rule Enforcement 的價值就越重要。
一個反直覺結果:安全訓練越有效,反而不需要投入那麼多資源
研究還得到一個乍看非常奇怪的結果。
當 Character Shaping 的效果變得更強時,最佳 α 反而下降。
例如作者提高模型中 Character Shaping 的效果參數時,最佳 α 可以從約 0.67 降到 0.40。
原因不是 Character Shaping 變得不重要,而是 Diminishing Returns,也就是邊際效益遞減。
如果只投入 30% 到 40% 的資源,就已經能取得大部分可實現的安全改善,那麼繼續把剩下所有資源投入同一層防線,增加的效果可能非常有限。
相較之下,把剩餘資源投入 Runtime Filter、Classifier 或其他獨立防線,反而可能得到更好的整體風險表現。
這個結果其實非常符合傳統 Systems Engineering 的觀念:可靠性通常不是來自某一道完美防線,而是來自多層、失敗模式不同的防禦機制。
瑞士起司模型:AI Safety 可能也需要 Defense in Depth
論文引用了安全工程中著名的 Swiss Cheese Model,也就是「瑞士起司模型」。
想像每一道安全防線都是一片瑞士起司,每片起司都有自己的洞。如果只有一道防線,一旦事故剛好穿過那個洞,就會直接造成問題。
但如果將多片起司疊在一起,而且每一層的洞出現在不同位置,事故必須同時穿越所有缺口才會真正造成傷害。
對 AI 系統而言,Character Shaping 可以是一層,Runtime Classifier 是另一層,Policy Engine、Access Control、Human Oversight 甚至工具權限系統,都可以是其他獨立防線。
因此真正成熟的 AI Safety Architecture,可能不應追求「找到一種完美 Alignment 技術」,而應該思考不同防線之間如何互補。
這與資安中的 Defense in Depth 概念非常接近。
研究也考慮「平均事故」之外的黑天鵝風險
單純計算 Expected Harm 還有一個問題:AI 事故造成的損害未必呈現平均分布。
同樣一句錯誤回答,如果只是使用者隨口詢問,可能沒有任何後果;但如果它被用於醫療治療、金融決策或關鍵基礎設施,就可能造成完全不同等級的損害。
因此作者另外建立 Pareto heavy-tail damage model,並使用 CVaR,也就是 Conditional Value at Risk,研究最嚴重尾端事故的風險。
模擬結果顯示,在大型部署規模下,以 Expected Harm 與 CVaR 為目標計算出的最佳 α 會逐漸接近。
不過這項結果同樣受到模型假設限制。論文中的 damage multiplier 與 α 被設定為彼此獨立,因此不能直接解讀成「極端 AI 災難不會改變安全架構」。它比較適合被理解為:在作者目前這組假設下,引入 heavy-tail damage 並沒有徹底推翻 Character 與 Rules 的最佳配置關係。
這篇論文最大的限制:它不是大型 AI 的實測 Scaling Law
看到 Scaling Laws 這個名稱,很容易讓人聯想到利用 GPT、Claude、Gemini 或其他大型模型的大量實驗資料,找出類似模型參數、算力與能力之間的統計規律。
但這篇研究並不是這種類型。
作者明確把研究稱為 stylized comparative-statics model。它是一個理論性的簡化模型,透過設定不同參數觀察最佳安全配置如何變化,而不是從現有大型 AI 平台的真實 deployment data 中回歸出安全 Scaling Law。
其中一個特別重要的假設,是 Character Fragility 在模型中被視為模型本身的固有失效率,因此每次互動的 fragility probability 不會隨部署規模 T 增加。
相反地,規模擴張卻會提高 edge-case pressure、filter degradation 與 systemic vulnerability 被發現的機率。
這意味著模型本身存在一個結構性傾向:規模越大,Rules 的相對效果可能下降,因此 Character Shaping 的相對價值自然提高。
然而現實世界可能更加複雜。
當一套 AI 從服務十萬人擴張到數億人時,不只是 interaction count 增加,語言、文化、使用目的、工具鏈、攻擊方式與任務分布也可能快速變得更加多樣。這些變化同樣可能提高 Distribution Shift,進而影響 Character Fragility。
如果未來的模型把 Character Fragility 本身也設計成 deployment diversity 或 scale 的函數,結果可能會更加複雜,甚至可能出現不同的最佳安全策略。
因此這篇論文最適合被視為一個 AI Safety Engineering 的理論框架,而不是一張可以直接交給 AI 公司照表施工的安全配方。
AI 安全可能正在從 Alignment 問題走向 Systems Engineering
這篇研究真正有意思的地方,是它把 AI Safety 從「模型到底有沒有被對齊」往前推了一步。
現實中的大型 AI 系統,不只是單獨一顆模型。
它可能同時包含 foundation model、安全訓練、moderation classifier、system prompt、tool permission、sandbox、rate limit、access control、monitoring、human review 與 incident response。
換句話說,真正需要保護的並不是一顆模型,而是一整套 AI System。
因此未來 AI Safety 的核心問題,很可能會逐漸從「怎麼做出永遠不犯錯的模型」,轉變成更工程化的問題:哪些失敗無法完全消除?不同安全層的 failure mode 是否獨立?某一層失效後還剩下什麼保護?共同弱點會不會一次影響所有 AI instance?安全預算投入哪一層能得到最大的 risk reduction?
航空、核電廠與資安系統早就接受一件事:不存在永遠不會失敗的單一零件。
真正可靠的系統,是在預設每一層都有可能失敗的情況下,仍然能靠其他防線阻止事故一路穿透。
這篇《Rules or Character?》提出的核心觀點,也可以濃縮成一句話:AI 安全真正重要的,可能不是 Rules 與 Character 到底哪一派勝出,而是如何讓兩套不完美的防線互相補位。
而在作者的模型中,比部署規模更值得 AI 研究者優先弄清楚的問題,是我們究竟能多大程度相信模型經過 Alignment 後形成的安全行為,在真正陌生的世界裡仍然有效。
Tech English 專有名詞中英對照
1. Character Shaping|模型行為塑造/內在安全塑造 指透過 RLHF、Constitutional AI、安全微調等訓練階段方法,直接改變模型的行為分布與偏好,使模型本身更傾向產生安全輸出。這裡的 Character 並非指 AI 真的具有人格,而是一種描述模型行為傾向的抽象概念。
2. Rule Enforcement|規則執行/外部安全約束 指在模型生成過程之外加入安全分類器、Output Filter、政策規則等機制,偵測並阻止不符合安全要求的輸出。它不一定改變模型本身,而是像一道外部檢查站。
3. Character Fragility|內在安全行為脆弱性 本文最重要的參數之一,描述模型經過安全訓練後形成的安全行為,在遭遇陌生或超出訓練分布的情境時失效、退化或回到原始行為的可能性。
4. Distribution Shift|分布偏移 當模型實際部署時遇到的資料、使用情境或任務分布與訓練時不同,就稱為 Distribution Shift。它是機器學習系統常見的失效來源,也是本文 Character Fragility 的重要來源之一。
5. Common-Mode Failure(CMF)|共同模式故障 多個系統因共享同一個設計、模型、零件或安全機制,而被同一個弱點同時影響。例如數百萬個 AI instance 共用相同安全分類器時,一個共同盲區可能影響整個部署系統。
6. CVaR(Conditional Value at Risk)|條件風險值/尾端平均風險 一種專門衡量極端損失的風險指標。它關注的不只是一般情況下平均會損失多少,而是當事件已經落入最糟糕的一小部分情況時,平均損失會有多嚴重,因此常被用來分析金融、工程與 AI Safety 的尾端風險。
原始來源
arxiv.org


