Chip Insight 資料庫
找到 1 篇文章
當 AI 每天處理數百萬甚至上億次互動,只靠輸出過濾器真的夠安全嗎?一篇最新研究建立數學模型,比較「Character Shaping」與「Rule Enforcement」兩種 AI 安全策略。結果顯示,真正左右安全架構的關鍵,可能不是部署規模本身,而是模型在陌生環境中能否維持訓練後的安全行為,也就是研究所稱的 Character Fragility。