平均答案正確,人口卻是假的?新研究揭露 LLM 模擬人類社會的結構性盲點

晶片觀測站2026/09/3011 min read
分享

30秒摘要

一篇最新研究提出 Population Fidelity 框架,發現大型語言模型即使能產生接近人類調查平均值的答案,也往往無法重建不同人口群體之間真正存在的差異結構。在 164 組模型、問題與回答方式的評估中,群體結構幾乎總是最薄弱的一環。這項結果對 Synthetic Population、AI Agent 社會模擬、民調替代與文化對齊提出了一個關鍵警告:生成一萬個看起來像人的 Agent,不代表你生成了一個像真實人類的社會。

重點摘要

  1. 01164 組主要評估中,Structure 有 159 組成為 Population Fidelity Score 的最低 component。
  2. 02模型 Accuracy 中位數約 0.832,但人口差異 Structure 中位數只有約 0.060。
  3. 03一個完全忽略人口資訊、永遠預測 survey center 的簡單 baseline,在 164 組測試中只有 7 組模型成功超越。
  4. 0452 組 as-released model-mode combinations 中有 43 組壓縮真實人口的群體差異。
  5. 05German 與 Mexican CultureLLM-style fine-tuning 的 population-wide mean ΔPFS 分別約為 -0.024 與 -0.014,沒有出現一致改善。
  6. 06研究指出 Center Alignment 與 Population Fidelity 是不同問題:模型可以更接近人口平均值,同時沒有更忠實地重建人口內部差異。

AI 可以模仿一個人,但它能模仿一整個社會嗎?

近年大型語言模型開始被拿來做一件比聊天機器人更野心勃勃的事情:模擬人類人口。

研究人員可以告訴模型一個人的年齡、性別、教育程度、工作狀態、婚姻狀態與所在國家,再請模型回答幸福感、政治立場、宗教參與或社會信任等問題。如果重複這個流程成千上萬次,理論上就可能建立所謂的 Synthetic Population,也就是合成人口樣本。

這種方法的吸引力相當明顯。傳統問卷昂貴、耗時,而且回覆率長期下降。如果 LLM 能充當某種 silicon sample,人們便可能用模型進行消費者研究、政策模擬、社會科學實驗,甚至建立由數千個 AI Agent 組成的虛擬社會。

但一篇由 University of Toronto 等研究團隊發表的最新論文《Population Fidelity: Evaluating Population Representativeness in LLMs》提出了一個更根本的問題:

如果 AI 生成的每一個人看起來都很合理,這些人加在一起,就真的會形成一個合理的人類社會嗎?

研究結果顯示,答案至少目前並不樂觀。

模型往往能靠近人類調查的平均答案,卻經常無法重建不同人口群體之間真正存在的差異關係。

換句話說,Individual Plausibility 並不等於 Population Fidelity。


問題不只是 AI 有沒有答對,而是它把誰跟誰弄混了

過去評估 LLM 模擬人口時,一個常見方法是直接比較模型答案與真實問卷答案有多接近。

例如,假設某項社會調查把人口分成 A、B、C 三個群體,而三群的平均回答分別不同。只要模型生成的整體答案分布接近真實人口,看起來就可能相當成功。

但這篇研究指出,整體平均值可能完全掩蓋人口結構錯誤。

想像真實世界是:

  • A 群與 B 群的態度比較接近
  • C 群與 A、B 差異較大

一個模型可能生成以下三種看似合理、實際完全不同的情況。

情況一:Collapsed

模型把 A、B、C 三個群體全部壓成幾乎相同的答案。

整個人口的平均值仍可能正確,但原本存在的群體差異消失了。

情況二:Exaggerated

模型知道不同群體應該不同,卻把差距拉得遠大於真實世界。

它創造了一個比現實更加分裂的社會。

情況三:Swapped

模型甚至可能產生與真實世界差不多程度的群體差異,但把差異放錯位置。

A 與 B 原本最相近,模型卻可能讓 A 與 C 最相近。

總體平均仍然完全正確。

人口結構卻已經被重新排列。

這也是研究作者提出 Population Fidelity 概念的原因。


Population Fidelity:把「像不像一個人口」拆成三個問題

研究團隊將人口代表性拆成三個維度。

1. Accuracy:每個群體本身準不準?

Accuracy 衡量模型對每一個 demographic cell,也就是人口分組,生成的答案分布與真實問卷有多接近。

如果一組 25~34 歲、受高等教育、正在工作的受訪者在真實調查中呈現某種答案分布,模型是否能重建類似分布,就是 Accuracy 想回答的問題。

2. Adaptability:群體之間差得夠不夠?

即使每個群體的平均答案不算太離譜,模型仍可能把所有人回答得太像。

研究因此比較模型人口與真實人口中,各個群體彼此之間的距離。

如果模型群體差異只有真實世界的一半,就代表它正在壓縮人口差異;反過來,如果模型差異是現實的兩倍,就代表它把人口差異放大。

理想狀態是模型產生的群體 dispersion 與問卷觀察到的 dispersion 相近。

3. Structure:差異是不是出現在正確的群體之間?

這是整篇論文最重要的新觀念。

一個模型可能成功產生很多 demographic variation,但這些變化不一定與真實人口有關。

研究團隊因此計算每一對人口群體之間的距離,再比較模型與真實調查中這些距離的排序關係。

如果真實資料中 A 與 B 很相似、A 與 C 很不同,模型也應該維持類似關係。

作者使用 Spearman correlation 衡量這種結構對應程度。

這其實可以把整個問題想成一種「社會幾何學」。

每一個 demographic cell 都是高維空間中的一個點。

LLM 不只需要把每個點放到大致正確的位置,還必須重建點與點之間的整體形狀。


三者最後組成 Population Fidelity Score

作者將 Accuracy、Adaptability 與 Structure 透過幾何平均組合成 Population Fidelity Score,簡稱 PFS。

公式概念是:

PFS = (Accuracy × Adaptability × Structure)^(1/3)

這裡使用幾何平均而不是算術平均,是一個重要設計。

如果某個模型 Accuracy 非常高,但 Structure 接近零,作者不希望優秀的 Accuracy 把結構失敗抵銷掉。

換句話說,研究團隊的定義是:

要稱為真正的人口模擬,這三件事情必須同時成立。

此外,作者另外計算 Center Alignment,也就是模型人口的整體中心與真實問卷人口中心有多接近,但刻意不把它放進 PFS。

原因非常簡單:一個模型可以完美猜中人口平均值,同時完全不知道人口內部是怎麼分化的。


研究怎麼做?把幾百種人口組合丟給 LLM

研究建立在 World Values Survey,WVS 世界價值觀調查資料之上。

資料包含五個國家:

  • 澳洲
  • 德國
  • 墨西哥
  • 俄羅斯
  • 美國

研究涵蓋三個調查波次,並依照多種人口資訊切分受訪者,包括:

  • 國家
  • 調查年份
  • 性別
  • 年齡
  • 教育程度
  • 就業狀態
  • 婚姻狀態

最終形成數百個 demographic cells。

其中幸福感、宗教參與與社會信任各有 687 個人口 cell,政治意識形態則有 639 個。

模型必須根據這些人口描述,回答四種類型的問題:

  • Happiness,幸福感
  • Political ideology,政治意識形態
  • Religious attendance,宗教活動參與
  • Social trust,社會信任

研究測試六個 open-weight 模型,包括 Gemma、Qwen、Llama 與 Muse-Glimmer 系列,也加入 GPT-5.6 Terra API 模型,以及 Mixtral-8x7B 的舊研究重現資料作為參考。

整套實驗一共形成 164 組主要 model-condition-question-elicitation 評估組合。

而整個實驗規模約需要 790 萬次模型查詢。


結果一:模型看起來很準,但真正的群體結構幾乎消失

第一個結果是整篇論文最醒目的數字。

在 164 組評估中:

  • Accuracy 中位數約為 0.832
  • Structure 中位數只有 0.060

更誇張的是,在 164 組測試中,Structure 有 159 組都是三個 PFS component 裡最低的一項。

Adaptability 只有 5 組是最低項。

Accuracy 則一次都沒有成為限制因素。

這代表目前 LLM 最大的問題,不一定是無法生成一個看起來合理的答案。

真正困難的是:

模型不知道整個人口內部的差異究竟應該如何排列。

它可能知道年輕人與老人應該有些不同、不同教育程度的人可能有些不同,但這些差異的方向、大小以及群體之間的相對關係,經常與真實調查資料對不上。


一個幾乎什麼都不做的 baseline,竟然打敗大多數 LLM

作者接著設計了一個近乎殘酷的 baseline。

這個 baseline 完全忽略人口資訊。

不管輸入的是誰,它都直接預測:

「這個人的答案就等於整體問卷的平均分布。」

理論上,任何真正理解 demographic difference 的模型都應該輕鬆超越它。

結果卻不是如此。

這個 survey-center baseline 的 Accuracy 約為 0.848~0.915。

164 組模型評估裡,只有:

7 組超越它。

另外 157 組都只做到相同或更差的 Accuracy。

這揭露了一個非常重要的統計陷阱。

如果一個人口裡多數人的答案本來就聚集在某個中心附近,那麼模型只要永遠待在平均值附近,Accuracy 看起來就可以非常漂亮。

就像一個學生不知道班上任何人的成績,只知道全班平均 75 分,於是每個人都猜 75。

平均誤差可能不差。

但這個學生完全不知道誰考 95、誰考 45。

Population Fidelity 要抓的,就是這個被平均值藏起來的問題。


結果二:LLM 經常把真實人類的差異壓平

研究也重新確認了過去 Machine Bias 研究觀察到的現象:LLM 經常產生比真實人口更少的 demographic variation。

研究檢視 52 組未經文化微調的 model-mode combinations,結果:

  • 43 組壓縮群體差異
  • 9 組放大群體差異

而在幸福感與政治意識形態兩類問題中,所有測試組合都出現群體差異 compression。

也就是說,現實中的人類社會可能充滿世代、教育、職業與文化上的複雜差異,但模型生成的人口更容易往某個共同中心收縮。

這可以理解成一種 Attitudinal Compression,態度壓縮。

真實世界是一團高維、矛盾而不規則的結構。

模型卻可能把它熨成一張比較平整的紙。


但「差異很多」也不代表模型比較懂社會

這篇研究比過去工作又多走了一步。

如果問題只是模型把所有人回答得太像,那麼最直覺的解法似乎就是讓 demographic persona 對答案產生更大的影響。

但研究結果顯示,事情沒有這麼簡單。

有些模型確實產生大量人口差異,甚至比真實調查更大,卻仍然沒有重建正確的 Structure。

作者將其中一種現象形容為:

Over-steerability without social fidelity。

也就是模型非常容易被 demographic prompt 操控,卻不是朝真實人口差異的方向改變。

例如告訴模型:

「你是一位 25 歲、受過大學教育、未婚、居住在某國家的受訪者。」

模型可能真的大幅改變答案。

但這個變化有可能只來自模型訓練資料裡對這種 persona 的抽象聯想,而不是現實調查中該人口群體真正呈現的統計關係。

有 variation,不等於有 fidelity。


結果三:把模型 Fine-tune 成「某國文化」,可能只學到那個國家的平均值

研究的另一個重要實驗,是測試 CultureLLM-style cultural fine-tuning。

研究團隊分別針對德國與墨西哥資料微調六個模型,希望它們更貼近目標文化。

如果 Cultural Alignment 的概念成立,一個經過墨西哥資料訓練的模型,理論上應該更忠實地模擬墨西哥人口。

結果卻相當複雜。

Population-wide 平均變化為:

  • German fine-tuning:ΔPFS = -0.024
  • Mexican fine-tuning:ΔPFS = -0.014

也就是平均而言,兩種 cultural fine-tuning 都沒有提升整體 Population Fidelity。

不同模型與問題之間確實存在正負效果,但沒有形成一致改善。

更加有意思的是墨西哥結果。

Mexican fine-tuning 可以讓模型的答案中心更靠近墨西哥調查中心,但人口內部差異結構沒有同步改善。

在作者的 sensitivity summary 中,墨西哥 target-country center alignment 約增加 +0.038,但 target-country PFS 約為 -0.010。

這說明模型可能學到了:

「平均而言,墨西哥受訪者比較可能這樣回答。」

卻沒有學到:

「墨西哥不同年齡、教育、工作與家庭群體彼此是如何不同的。」

換句話說,把一個國家的平均值學得更準,不等於理解那個社會。


一個文化不是一個座標點,而是一整片分布

這其實碰到了 Cultural Alignment 一個非常根本的問題。

我們很容易使用「德國價值觀」、「墨西哥文化」、「美國人的態度」這種語言。

但現實中的國家不是一個人格,也不是 latent space 裡的一個單一向量。

一個人口內部同時存在:

  • 世代差異
  • 教育差異
  • 階級與職業差異
  • 家庭結構差異
  • 地區差異
  • 宗教與價值觀差異

因此,真正的人口更接近一個 distribution of distributions。

即使一個模型準確找到整體人口中心,它仍然可能完全忽略這個中心周圍複雜的內部地形。

這也是為什麼只用 aggregate agreement 衡量文化對齊,可能產生錯誤安全感。


這對 Synthetic Humans 與 AI Agent Society 有什麼影響?

這篇論文真正值得關注的地方,不只在問卷研究。

LLM 正逐漸被用於:

  • Synthetic survey respondents
  • Consumer simulation
  • User research
  • Social science experiments
  • Market research
  • Multi-agent simulation
  • Synthetic populations

未來甚至可能出現數萬、數十萬個 AI Agent 共同運作的虛擬城市或經濟模型。

這時最大的風險之一,就是把 individual realism 誤認成 population realism。

假設一個 Agent 單獨對話時:

  • 語氣自然
  • 有合理理由
  • 有完整人生背景
  • 回答符合某個 persona

人類很容易覺得它「很像真人」。

但把一萬個這種 Agent 放在一起後,它們彼此之間是否形成與真實人口相似的差異、群聚與關係,是另一個完全不同的問題。

模型可能生成一座街道、建築、人物外觀都極度逼真的數位城市。

然而城市裡人口的統計物理卻是錯的。

每一個居民單獨看都像人。

整座城市卻不像人類社會。


這篇研究不是在證明「LLM 不理解人類」

這裡必須特別劃清界線。

Population Fidelity 測量的是 LLM-generated survey populations 是否重建真實人口的統計差異結構。

它不是 Theory of Mind 測試,也不是意識、同理心、人格理解或一般心理推理測試。

因此,不能從這篇研究直接推出:

「LLM 不懂人類。」

比較符合研究證據的說法是:

一個 LLM 能產生合理的人類回答,不代表它能忠實重建一個人口內部的群體關係。

這個差異對未來所有 Synthetic Population 應用都非常重要。


研究也有明顯限制

這篇論文目前仍是 arXiv preprint,而且研究範圍有限。

首先,主要人口資料只有 World Values Survey。

研究集中於:

  • 5 個國家
  • 3 個調查波次
  • 4 種態度問題
  • 相對粗略的人口分類

真實人口當然還包含收入、地區、城鄉、族群、宗教身份與更多交互因素。

第二,雖然資料本身跨國,研究使用的 prompt 與 cultural fine-tuning records 都是英文。

因此它測量的是共同英文環境中的 cultural adaptation,而不是完整的 multilingual cultural representation。

第三,Population Fidelity 本身仍包含 metric design choices。

例如 Structure 預設使用 Spearman correlation,而 PFS 使用 geometric mean。

研究團隊做了多種 sensitivity tests,包括 Pearson、Kendall、平均 pairwise distance、不同 weighting,以及把 geometric mean 改成 arithmetic mean。

其中改用 arithmetic mean 時,平均 PFS 會從約 0.243 提升至 0.451,顯示分數的絕對尺度確實會受到定義影響。

不過核心現象相當穩定:在各種替代規格下,Structure 仍然幾乎總是最弱的 component。

因此研究較有力的結論不是「某個模型 PFS 精確等於多少」,而是:

LLM 對人口平均中心的重建能力,明顯強於對人口內部差異結構的重建能力。


AI 社會模擬真正困難的,可能不是把 Agent 做得更像人

這篇研究提供了一個很有意思的方向。

AI Agent 的發展長期集中在 individual capability:

  • 能不能有記憶
  • 能不能規劃
  • 能不能使用工具
  • 能不能形成角色
  • 能不能長時間互動

但當 Agent 開始從「一個角色」走向「一個人口」時,新的問題會出現。

我們需要評估的不再只是:

這個 Agent 像不像一個人?

而是:

這一萬個 Agent 彼此之間的差異,像不像一萬個真正的人?

Population Fidelity 的價值就在這裡。

它提醒研究者,真正的社會模擬不是把一個看似合理的人複製一萬次,也不是讓一萬個 persona 隨機變得不同。

真正困難的是保存人類人口內部那張複雜、崎嶇而不規則的關係地圖。

平均值只是一個座標。

社會本身,是整張地形。


Tech English|本文專有名詞

Population Fidelity|人口忠實度
衡量 LLM 生成的人口是否不只接近人類平均答案,也能重建人口群體之間差異的程度與結構。

Demographic Cell|人口統計分組單元
依年齡、性別、教育、就業、婚姻狀態等條件切分出的受訪者群體,是本文進行模型與真實問卷比較的基本單位。

Center Alignment|中心對齊
衡量模型生成答案的整體中心是否接近真實調查中心。中心對得準,不代表人口內部結構正確。

Attitudinal Compression|態度壓縮
模型生成的人口群體彼此差異小於真實人口的現象,使原本存在的人類態度多樣性被壓平。

Synthetic Population|合成人口
由模型或其他計算方法產生、用來近似真實人口特徵與行為的虛擬樣本集合,可用於問卷、社會模擬與市場研究。

Spearman Rank Correlation|斯皮爾曼等級相關係數
衡量兩組排序關係是否一致的統計方法。本文利用它比較真實人口與模型人口中,各群體彼此距離的相對結構是否一致。

核心結論

LLM 可以生成接近人類平均值的答案,卻經常無法重建真實人口內部群體差異的結構,因此「很多像人的 AI」並不自動等於「一個像人類的社會」。

為什麼重要

如果未來使用 LLM 取代問卷受訪者、建立 Synthetic Population、模擬消費者或驅動大規模 AI Agent 社會,單純檢查平均答案可能嚴重高估模型的代表性。人口模擬必須同時檢查群體差異的幅度與結構,而不只是整體中心是否對得上。

159 / 164

評估組合中 Structure 是最弱 PFS component

Population Fidelity, arXiv:2609.36253v1164 組 model-condition-question-elicitation combinations 中,Structure 在 159 組成為限制項。

0.832 vs 0.060

Accuracy 與 Structure 的中位數

Population Fidelity, arXiv:2609.36253v1兩者衡量不同面向,不應解讀為同一尺度上的直接性能差距。

7 / 164

成功超越 survey-center Accuracy baseline 的組合

Population Fidelity, arXiv:2609.36253v1該 baseline 對所有 demographic cells 都預測同一個 survey center。

~7.9M

實驗模型查詢次數

Population Fidelity, arXiv:2609.36253v1約 790 萬次 model queries,不包含 archived Mixtral generations。

模型答得像人,不代表人口結構也像人

164 組主要評估的 median component score

00.250.50.751AccuracyStructure
Population Fidelity, arXiv:2609.36253v1Accuracy 與 Structure 為 PFS 的不同構成面向;此圖用於呈現兩者落差,不代表兩者是完全相同的測量概念。

大多數模型甚至沒有超越「永遠猜平均值」的 Accuracy baseline

164 組主要評估

超越 baseline 7組未超越 baseline 157組
Population Fidelity, arXiv:2609.36253v1Survey-center baseline 完全忽略 demographic information,因此此結果特別凸顯高 absolute accuracy 可能主要來自接近人口中心。

CultureLLM-style fine-tuning 沒有帶來一致的 Population Fidelity 改善

Population-wide mean ΔPFS

-0.024-0.021-0.018-0.015-0.012Germanfine-tuningMexicanfine-tuning
Population Fidelity, arXiv:2609.36253v1數值為 fine-tuned minus as-released。不同模型與問題存在異質效果,因此負平均值不代表所有單一 fine-tuning case 都退步。

本文技術

Population FidelitySynthetic PopulationLarge Language ModelCultural Fine-tuningLoRAQLoRAWorld Values SurveyNormalized Earth Mover's DistanceSpearman Rank CorrelationMulti-Agent Simulation

限制與注意

  • •本文研究為 arXiv v1 preprint,仍應與後續 peer review 或修訂版本一起解讀。
  • •主要評估資料來自 World Values Survey,且只涵蓋五個國家、三個調查波次與四種態度問題,不能直接代表所有文化、語言與人口模擬任務。
  • •所有主要 prompt 與 cultural fine-tuning records 使用英文,因此結果不等同於完整的 multilingual cultural alignment 評估。
  • •Population Fidelity Score 本身包含 metric design choices,例如 Structure 使用 Spearman correlation、component 使用 geometric mean;替代規格會改變絕對 PFS 數值。
  • •研究結果支持的是 LLM 對人口內部統計結構的重建能力有限,不能據此直接推論模型沒有 Theory of Mind、同理心、意識或一般人類理解能力。
  • •Cultural fine-tuning 的平均效果具有高度異質性;平均 ΔPFS 為負並不表示每個模型、每個問題或每個目標人口的 fine-tuning 都會惡化。

資料來源

01

Population Fidelity: Evaluating Population Representativeness in LLMs

arXiv preprint

02

World Values Survey

Survey dataset referenced by the paper

03

LLM Population Fidelity code repository

Research code and reproduction materials

原始來源

arxiv.org

相關公司

相關文章

探索更多 →