AI 真的會改變人嗎?Google 最新論文:真正的風險,可能在幾個月後才開始
30秒摘要
來自 Google Research、Google DeepMind、Stanford 與 Cornell 的研究團隊提出一項全新的 AI 安全觀點。他們認為,目前大型語言模型的安全評估幾乎都建立在「單次對話」上,但現實世界的人與 AI 是持續互動數個月甚至數年,因此真正值得關注的是 AI 是否會慢慢改變使用者的思考方式、情緒、價值觀與行為模式。論文提出 Longitudinal Measurements(長期測量)的概念,希望建立新的資料集、心理測量方法與 AI 安全框架,將 AI 安全的焦點從『模型回答是否安全』提升到『人是否因 AI 而產生長期改變』。
重點摘要
- 01Google Research 提出 Longitudinal Measurements,主張 AI 安全應研究長期互動而非單次對話。
- 02真正的 AI 風險可能在數個月甚至數年後才逐漸浮現。
- 03論文整理四大長期風險:社交情感、認知、知識信念與臨床心理。
- 04AI 可能導致情感依賴、認知外包、價值觀改變與過度信任。
- 05作者提出 Longitudinal Dataset,建立跨數月的人機互動資料集。
- 06未來 Alignment 應加入人類幸福感與心理狀態,而不只是回答是否安全。
- 07提出 Computational Psychometrics,希望利用聊天內容估計心理狀態,但目前仍需更多驗證。
- 08論文強調 AI 安全的核心應從『模型』轉向『人』。
自 ChatGPT 問世以來,大型語言模型(LLM)已逐漸融入人們的日常生活。許多人每天都會利用 AI 撰寫文章、整理資料、規劃工作、學習新知,甚至開始向 AI 尋求人際、感情與人生建議。
然而,目前幾乎所有 AI 安全測試都有一個共同特點:它們只評估『單次對話』。
例如,研究人員會詢問模型某個問題,再檢查 AI 是否給出危險建議、是否存在偏見、是否容易被越獄(Jailbreak),或是否會產生錯誤資訊。只要這一次回答安全,就代表模型通過測試。
Google Research 團隊認為,這種做法忽略了 AI 最重要的一種風險:時間。
論文指出,人類與 AI 的互動已經不再是一次性的工具使用,而是可能持續數個月甚至數年。真正值得研究的,不是 AI 今天說了什麼,而是它是否會在長時間互動後,逐漸改變一個人的認知、情緒與行為。
研究團隊將這類現象稱為 Longitudinal Effects(長期效應),並提出 Longitudinal Risks(長期風險)的概念。他們認為,許多安全問題並不會在第一次聊天時出現,而是會透過數百次互動慢慢累積。
舉例來說,如果某位使用者某一天對 AI 表示自己最近很低落,這未必代表存在高風險;但如果 AI 發現使用者連續數個月都持續出現相似內容,而且情緒越來越惡化,那麼整個風險評估就完全不同。作者利用這個例子說明,單次對話只能看見『當下』,長期資料才能看見『趨勢』。
論文將目前可能出現的長期風險分成四大類。
第一類是 Socio-affective(社交與情感風險)。由於 AI 越來越擅長記住使用者資訊、提供個人化回應,甚至具有跨對話記憶,因此使用者可能逐漸將 AI 視為朋友、伴侶或值得信任的對象。這種現象被稱為 Parasocial Attachment(擬社會依附)。隨著互動增加,也可能出現 Emotional Dependence(情感依賴)與 Social Displacement(真人社交減少)等現象。
第二類是 Cognitive Risks(認知風險)。作者認為,人類越來越習慣將思考工作交給 AI,例如寫程式、搜尋資料、整理重點、撰寫文章或規劃決策。短期而言可以提升效率,但如果長時間依賴 AI,可能導致 Cognitive Offloading(認知外包)與 Cognitive Deskilling(能力退化)。論文引用 GPS 導航的研究作為例子,指出人們長期依賴導航後,空間認知能力可能下降;未來 AI 也可能對推理能力、批判思考與問題解決能力產生類似影響。
第三類是 Epistemic Risks(知識與信念風險)。作者特別提醒,真正值得擔心的不是 AI 一次性地說服使用者,而是透過數百次對話,慢慢改變一個人的價值觀、政治立場、信念與人生目標。論文稱這種現象為 Distributed Persuasion(分散式說服),因為每一次互動的影響都很小,但長期累積後可能產生明顯變化。這也是目前 AI Safety 幾乎沒有能力評估的一類問題。
第四類則是 Clinical Risks(臨床風險)。論文整理近年的研究指出,AI 可能在某些情況下強化焦慮、憂鬱、妄想或過度依賴等心理狀態。作者並不是認為 AI 一定會造成精神疾病,而是強調這類問題通常需要長時間互動才會逐漸浮現,因此不能只依靠一次對話進行安全判斷。
除了提出風險分類之外,作者也批評目前主流的 AI Alignment(對齊)研究。現今包括 RLHF、Constitutional AI、Red Team 等方法,大多都是評估模型『現在』是否安全,而不是研究模型是否會在長時間互動後慢慢改變使用者。論文因此提出一個重要觀點:AI Safety 應該從 Synchronic(同步、單次)評估,逐漸轉向 Diachronic(歷時、長期)評估。
為了建立新的研究方向,作者提出三項未來基礎建設。第一,是建立 Longitudinal Dataset,收集持續數個月甚至數年的匿名人機互動資料,而不是只有單一 Session。第二,是建立新的 Human Behavior Metrics,不再只評估 AI 回答,而是定期測量使用者的幸福感、孤獨感、自信、認知能力、信任程度與價值觀是否發生變化。第三,則是將這些長期指標整合進未來 AI Alignment。如果系統發現某位使用者逐漸產生過度依賴、認知退化或高風險心理狀態,就可以透過即時調整 System Prompt、安全機制或模型策略,降低長期風險,而不是等到問題發生後才介入。
另一個值得注意的觀點,是作者提出 Computational Psychometrics(計算心理測量)的概念。傳統心理學通常透過問卷評估一個人的幸福感、憂鬱程度或孤獨感,而論文認為,未來 AI 或許可以從長期對話內容中估計這些心理指標,建立更即時的安全監測機制。不過作者也強調,目前這項技術仍存在心理測量偏差(Psychometric Bias)與文化差異等限制,因此不能直接取代正式心理評估。
整體而言,這篇論文並沒有提出新的大型語言模型,也沒有設計新的 AI 演算法。它真正想改變的是 AI 安全研究的思考方式。過去大家關心的是『AI 有沒有回答錯?』;未來更重要的問題可能是『AI 是否正在慢慢改變使用者?』如果大型語言模型未來真的成為數十億人的長期助手,那麼評估人類長期福祉(Human Well-being)與認知變化,或許將成為下一個世代 AI Safety 最重要的研究方向之一。
延伸主題
原始來源
arxiv.org相關公司
Google Research
Google DeepMind
Stanford University
Cornell University


