AI 真的會改變人嗎?Google 最新論文:真正的風險,可能在幾個月後才開始

晶片觀測站2026/08/048 min read
分享

30秒摘要

來自 Google Research、Google DeepMind、Stanford 與 Cornell 的研究團隊提出一項全新的 AI 安全觀點。他們認為,目前大型語言模型的安全評估幾乎都建立在「單次對話」上,但現實世界的人與 AI 是持續互動數個月甚至數年,因此真正值得關注的是 AI 是否會慢慢改變使用者的思考方式、情緒、價值觀與行為模式。論文提出 Longitudinal Measurements(長期測量)的概念,希望建立新的資料集、心理測量方法與 AI 安全框架,將 AI 安全的焦點從『模型回答是否安全』提升到『人是否因 AI 而產生長期改變』。

重點摘要

  1. 01Google Research 提出 Longitudinal Measurements,主張 AI 安全應研究長期互動而非單次對話。
  2. 02真正的 AI 風險可能在數個月甚至數年後才逐漸浮現。
  3. 03論文整理四大長期風險:社交情感、認知、知識信念與臨床心理。
  4. 04AI 可能導致情感依賴、認知外包、價值觀改變與過度信任。
  5. 05作者提出 Longitudinal Dataset,建立跨數月的人機互動資料集。
  6. 06未來 Alignment 應加入人類幸福感與心理狀態,而不只是回答是否安全。
  7. 07提出 Computational Psychometrics,希望利用聊天內容估計心理狀態,但目前仍需更多驗證。
  8. 08論文強調 AI 安全的核心應從『模型』轉向『人』。

自 ChatGPT 問世以來,大型語言模型(LLM)已逐漸融入人們的日常生活。許多人每天都會利用 AI 撰寫文章、整理資料、規劃工作、學習新知,甚至開始向 AI 尋求人際、感情與人生建議。

然而,目前幾乎所有 AI 安全測試都有一個共同特點:它們只評估『單次對話』。

例如,研究人員會詢問模型某個問題,再檢查 AI 是否給出危險建議、是否存在偏見、是否容易被越獄(Jailbreak),或是否會產生錯誤資訊。只要這一次回答安全,就代表模型通過測試。

Google Research 團隊認為,這種做法忽略了 AI 最重要的一種風險:時間。

論文指出,人類與 AI 的互動已經不再是一次性的工具使用,而是可能持續數個月甚至數年。真正值得研究的,不是 AI 今天說了什麼,而是它是否會在長時間互動後,逐漸改變一個人的認知、情緒與行為。

研究團隊將這類現象稱為 Longitudinal Effects(長期效應),並提出 Longitudinal Risks(長期風險)的概念。他們認為,許多安全問題並不會在第一次聊天時出現,而是會透過數百次互動慢慢累積。

舉例來說,如果某位使用者某一天對 AI 表示自己最近很低落,這未必代表存在高風險;但如果 AI 發現使用者連續數個月都持續出現相似內容,而且情緒越來越惡化,那麼整個風險評估就完全不同。作者利用這個例子說明,單次對話只能看見『當下』,長期資料才能看見『趨勢』。

論文將目前可能出現的長期風險分成四大類。

第一類是 Socio-affective(社交與情感風險)。由於 AI 越來越擅長記住使用者資訊、提供個人化回應,甚至具有跨對話記憶,因此使用者可能逐漸將 AI 視為朋友、伴侶或值得信任的對象。這種現象被稱為 Parasocial Attachment(擬社會依附)。隨著互動增加,也可能出現 Emotional Dependence(情感依賴)與 Social Displacement(真人社交減少)等現象。

第二類是 Cognitive Risks(認知風險)。作者認為,人類越來越習慣將思考工作交給 AI,例如寫程式、搜尋資料、整理重點、撰寫文章或規劃決策。短期而言可以提升效率,但如果長時間依賴 AI,可能導致 Cognitive Offloading(認知外包)與 Cognitive Deskilling(能力退化)。論文引用 GPS 導航的研究作為例子,指出人們長期依賴導航後,空間認知能力可能下降;未來 AI 也可能對推理能力、批判思考與問題解決能力產生類似影響。

第三類是 Epistemic Risks(知識與信念風險)。作者特別提醒,真正值得擔心的不是 AI 一次性地說服使用者,而是透過數百次對話,慢慢改變一個人的價值觀、政治立場、信念與人生目標。論文稱這種現象為 Distributed Persuasion(分散式說服),因為每一次互動的影響都很小,但長期累積後可能產生明顯變化。這也是目前 AI Safety 幾乎沒有能力評估的一類問題。

第四類則是 Clinical Risks(臨床風險)。論文整理近年的研究指出,AI 可能在某些情況下強化焦慮、憂鬱、妄想或過度依賴等心理狀態。作者並不是認為 AI 一定會造成精神疾病,而是強調這類問題通常需要長時間互動才會逐漸浮現,因此不能只依靠一次對話進行安全判斷。

除了提出風險分類之外,作者也批評目前主流的 AI Alignment(對齊)研究。現今包括 RLHF、Constitutional AI、Red Team 等方法,大多都是評估模型『現在』是否安全,而不是研究模型是否會在長時間互動後慢慢改變使用者。論文因此提出一個重要觀點:AI Safety 應該從 Synchronic(同步、單次)評估,逐漸轉向 Diachronic(歷時、長期)評估。

為了建立新的研究方向,作者提出三項未來基礎建設。第一,是建立 Longitudinal Dataset,收集持續數個月甚至數年的匿名人機互動資料,而不是只有單一 Session。第二,是建立新的 Human Behavior Metrics,不再只評估 AI 回答,而是定期測量使用者的幸福感、孤獨感、自信、認知能力、信任程度與價值觀是否發生變化。第三,則是將這些長期指標整合進未來 AI Alignment。如果系統發現某位使用者逐漸產生過度依賴、認知退化或高風險心理狀態,就可以透過即時調整 System Prompt、安全機制或模型策略,降低長期風險,而不是等到問題發生後才介入。

另一個值得注意的觀點,是作者提出 Computational Psychometrics(計算心理測量)的概念。傳統心理學通常透過問卷評估一個人的幸福感、憂鬱程度或孤獨感,而論文認為,未來 AI 或許可以從長期對話內容中估計這些心理指標,建立更即時的安全監測機制。不過作者也強調,目前這項技術仍存在心理測量偏差(Psychometric Bias)與文化差異等限制,因此不能直接取代正式心理評估。

整體而言,這篇論文並沒有提出新的大型語言模型,也沒有設計新的 AI 演算法。它真正想改變的是 AI 安全研究的思考方式。過去大家關心的是『AI 有沒有回答錯?』;未來更重要的問題可能是『AI 是否正在慢慢改變使用者?』如果大型語言模型未來真的成為數十億人的長期助手,那麼評估人類長期福祉(Human Well-being)與認知變化,或許將成為下一個世代 AI Safety 最重要的研究方向之一。

延伸主題

原始來源

arxiv.org

相關公司

Google Research

Google Research

Google DeepMind

Google DeepMind

Stanford University

Stanford University

Cornell University

Cornell University

相關文章

探索更多 →