AI 看錯了,還是想錯了?一篇論文揭開多模態 AI 訓練最大的盲點
30秒摘要
當 ChatGPT、Qwen3-VL、Gemini 等多模態 AI 回答圖片問題時,如果答案錯誤,到底是因為模型沒有看懂圖片,還是後續推理出了問題?NeurIPS 2026 最新研究提出 Perception-Correction Distillation(PCD),首次將「感知」與「推理」拆開訓練,利用教師模型與學生模型的差異,加上多次推理成功率,判斷真正需要修正的地方。研究顯示,這種方式比傳統蒸餾方法最高可提升超過 4 個百分點,讓小模型學得更有效率。
重點摘要
- 01提出 Perception-Correction Distillation(PCD),將圖片理解與推理分開訓練。
- 02利用 Perception Success Rate(PSR)衡量固定感知下的推理成功率。
- 03加入 Teacher 與 Student 的 KL Divergence 判斷是否真的看錯圖片。
- 04**核心公式:d = (1 − PSR) × KL**,只有同時推理失敗且感知不同時才強化蒸餾。
- 05Qwen3-VL 8B→2B 平均提升 2.78 個百分點;32B→8B 提升 4.28 個百分點。
- 06研究指出未來多模態 AI 應將 Vision 與 Reasoning 分別最佳化,而非一律共同更新。
AI 真的會「看圖」嗎?
近年來,多模態大型語言模型(Multimodal Large Language Model,MLLM)快速發展,像是 GPT-4o、Gemini、Qwen3-VL、Claude Vision 都已經可以閱讀圖片、分析圖表、理解數學幾何題,甚至解讀醫療影像。
當 AI 回答錯誤時,我們知道答案錯了,卻不知道它到底是哪一步出了問題。
假設 AI 看著一張圖片。
圖片裡明明有 5 顆蘋果。
AI 最後回答:
圖片裡有 4 顆蘋果。
這代表它一開始就看錯了。
但另一種情況是:
AI 正確辨識出圖片有 5 顆蘋果,最後卻回答:
一共有 7 顆。
這次不是看錯,而是推理過程出錯。
這兩種錯誤雖然最後答案都是錯的,但原因完全不同。
如果每次答案錯都把整個模型一起更新,就像老師不知道學生是哪一題算錯,只好把整本課本重新教一次,不但效率低,也可能讓原本學對的部分反而退步。
傳統 AI 訓練最大的問題:不知道錯在哪
目前主流的蒸餾(Knowledge Distillation)方法,大多使用一個非常簡單的概念。
學生模型回答。
老師模型給答案。
學生盡量模仿老師。
這就是 On-Policy Distillation(OPD)。
但是 OPD 有一個很大的缺陷。
它只知道:
最後答案是錯的。
卻不知道:
- 是 Vision 看錯?
- 還是 LLM 推理錯?
論文把這個問題稱為:
Credit Assignment Ambiguity(責任歸屬模糊)。
也就是說,一個最終失敗的結果,可能同時來自不同原因,而模型無法分辨真正需要修改的是哪一部分。
作者想到一個很有趣的方法
作者把整個 AI 思考流程切成兩段。
圖片
↓
Perception(感知)
↓
Reasoning(推理)
↓
答案
其中:
Perception(感知)
就是模型閱讀圖片、辨識文字、理解物體位置與關係。
例如:
- 圖片裡有哪些物件?
- 三角形哪個角是 50°?
- 折線圖最高點是多少?
而 Reasoning(推理) 則是在這些資訊基礎上進行邏輯運算。
作者認為,真正應該先確認的是:
AI 有沒有先把圖片看對?
如果固定「看見的內容」,會發生什麼事?
這篇論文最大的創新,就是提出 Separated Perception–Reasoning Rollout。
意思是:
先固定一次圖片理解。
再讓模型對同一份理解,連續推理很多次。
例如:
圖片
↓
辨識:
A、B、C
接著不是推理一次,而是:
推理① ❌
推理② ✅
推理③ ❌
推理④ ✅
如果同樣的圖片理解,有時成功、有時失敗,就代表:
Vision 很可能沒有問題。
真正出問題的是後面的推理。
反過來說,如果:
推理① ❌
推理② ❌
推理③ ❌
推理④ ❌
全部失敗。
那就很有可能一開始就看錯圖片了。
這樣一來,就第一次能夠把「看錯」與「想錯」區分開來。
PSR:AI 看懂圖片的成功率
作者定義了一個新的指標:
Perception Success Rate(PSR)。
它的概念非常簡單。
固定同一份圖片理解。
讓 AI 推理很多次。
最後統計成功率。
數學上可以表示為:
PSR = 成功次數 ÷ 推理總次數
例如:
推理 8 次。
成功 6 次。
那麼:
PSR = 6 / 8 = 0.75
PSR 越高,代表目前這份圖片理解,大多可以成功推導答案。
但作者發現,PSR 仍然有一個問題。
有些題目本來就非常困難。
即使圖片完全看懂,推理也可能一直失敗。
因此:
PSR 低,不一定代表 Vision 有問題。
第二個關鍵:老師與學生是否看到同樣的東西
於是作者加入第二個訊號。
也就是教師模型(Teacher)與學生模型(Student)之間的差異。
論文利用 KL Divergence(Kullback-Leibler Divergence) 來衡量。
可以把它理解成:
老師與學生,看圖片是否一致。
如果:
- 老師認為圖片資訊是 A
- 學生卻理解成 B
代表學生真的有可能看錯了。
如果老師與學生幾乎一致,代表圖片理解本身可能沒有問題,即使最後答案錯,也比較可能是推理失敗。
PCD:真正需要修正 Vision 的時候才加強學習
最後作者提出整篇論文最重要的公式:
d = (1 − PSR) × KL
其中:
- 1 − PSR:代表推理失敗程度
- KL:代表老師與學生的圖片理解差距
只有兩者同時成立,PCD 才會提高 Vision 的蒸餾權重。
例如:
情況一
PSR 很低。
KL 很高。
代表:
看錯圖片,而且老師知道正確答案。
➡ 應該大力修正 Vision。
情況二
PSR 很低。
KL 很低。
代表:
老師和學生都看到一樣。
可能只是推理太難。
➡ 不需要修改 Vision。
情況三
PSR 很高。
KL 很高。
雖然老師看法不同。
但學生大部分仍能成功完成任務。
➡ 沒必要重新訓練 Vision。
因此,PCD 比起傳統方法,多了一層「是否真的需要修正感知能力」的判斷。
研究成果如何?
作者在 Qwen3-VL 上測試兩組模型。
8B Teacher → 2B Student
- OPD:44.50%
- PCD:47.28%
提升 2.78 個百分點。
32B Teacher → 8B Student
- OPD:56.94%
- PCD:61.22%
提升 4.28 個百分點。
研究也進一步進行消融實驗(Ablation Study),當拿掉 PCD 的權重分配後,平均表現下降約 2.22 個百分點,代表這套「判斷是否真的看錯」的策略,確實對模型學習有實際幫助。
這篇研究的重要性
過去,多模態 AI 大多把整個回答流程視為一個黑盒子。
只要最後答案錯,就一起修正。
但這篇論文提出一個新的觀念。
AI 不只是需要學會思考,更需要知道自己是哪一步出了問題。
未來的多模態模型,很可能會逐漸將 Vision(感知) 與 Reasoning(推理) 分開訓練、分開優化。
這不只是提升模型準確率,更代表 AI 正朝向更像人類的學習方式發展。
當學生考卷錯誤時,老師不再只是告訴他答案,而是先判斷:
你是題目看錯?還是算錯?
這正是 PCD 想解決的核心問題,也是未來多模態 AI 訓練的重要方向。
原始來源
arxiv.org相關公司
Qwen
DeepSeek



