Chip Insight 資料庫

#RLHF

找到 1 篇文章

AI 安全該靠規則還是「性格」?新研究拆解大型 AI 系統的兩道防線

當 AI 每天處理數百萬甚至上億次互動,只靠輸出過濾器真的夠安全嗎?一篇最新研究建立數學模型,比較「Character Shaping」與「Rule Enforcement」兩種 AI 安全策略。結果顯示,真正左右安全架構的關鍵,可能不是部署規模本身,而是模型在陌生環境中能否維持訓練後的安全行為,也就是研究所稱的 Character Fragility。

晶片觀測站·1 個月前
9 min