AI 幫你做得更快,卻不一定讓你學得更好:研究發現關鍵在「還有沒有自己思考」

晶片觀測站2026/08/259 min read
分享

30秒摘要

UC Irvine 研究團隊透過一項 124 人參與的邏輯解題實驗,探討 AI 輔助是否會影響人類技能形成。研究發現,AI 使用次數本身並不能有效預測後續技能成長;真正與較佳學習成果相關的,是使用者在 AI 可用時仍保留多少自主推理時間。結果顯示,AI 可能提高眼前的任務表現,但如果它直接取代原本應由人類完成的認知工作,使用者在失去 AI 後的獨立解題能力可能較弱。

重點摘要

  1. 01研究最終分析 124 名受試者,透過「無 AI → 可使用 AI → 再次無 AI」三階段設計,觀察 AI 對後續獨立解題能力的影響。
  2. 02低成本 AI 組平均要求協助 6.67 次,高成本組為 3.33 次,顯示 AI 的使用摩擦與成本會改變求助行為。
  3. 03曾在第二階段要求 AI 協助者,第三階段移除 AI 後平均 Reward Rate 為 3.42,未要求 AI 者為 3.86。
  4. 04Solo Share 與潛在技能成長呈正向關聯,後驗機率顯示其係數大於零的機率為 97.7%。
  5. 05模型推估,在 20 分鐘 AI 階段中多保留 1 分鐘自主推理,與第三階段預測正確率提高約 1.5%、反應時間下降約 2.5% 相對應。
  6. 06單純的 AI 呼叫次數並不能有效解釋技能成長,研究因此認為真正值得注意的是 AI 是否取代人類原本需要完成的自主推理。

生成式 AI 正快速進入寫作、程式設計、研究、教育與辦公工作。過去幾年的討論大多集中在一個問題:AI 能讓人做得多快、多好?但隨著 ChatGPT、Claude 等工具逐漸成為日常工作的一部分,另一個更難回答的問題開始浮現:如果 AI 幫我們完成愈來愈多思考,人類自己的能力還會不會繼續成長?

UC Irvine 的研究團隊在論文《How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles》中,試圖把這個問題拆開來研究。

研究的核心結論並不是「使用 AI 會讓人變笨」。相反地,研究結果指向一個更細緻的差異:真正與技能成長較弱有關的,可能不是使用 AI 本身,而是 AI 是否取代了原本應由使用者進行的自主推理。

換句話說,問題可能不是「你用了多少 AI」,而是「AI 出現之後,你自己還思考了多少」。

為什麼只看 AI 幫助下的成績可能會誤判?

假設有兩個人正在學習解一道複雜問題。

第一個人自己分析條件、嘗試不同策略、犯錯、修正,再尋求 AI 提示;第二個人則在看到問題後,很快就要求 AI 提供答案。

如果只看最後完成任務的速度,第二個人可能表現得更好。但這個成績其實混合了兩種能力:人類自己的能力,以及 AI 提供的額外能力。

因此,AI 輔助下的高績效並不一定等於使用者本身已經學會這項技能。

研究團隊將這個問題稱為 AI 輔助與技能發展之間的張力:AI 可以改善短期表現,但如果它減少使用者進行推理、測試策略、修正錯誤與理解問題結構的機會,這些原本用來建立技能的練習也可能一起消失。

研究怎麼測?先讓所有人自己做,再加入 AI,最後把 AI 拿走

為了測量 AI 對人類技能形成的影響,研究團隊設計了一套三階段邏輯解題實驗。

研究最初透過 Prolific 招募 150 名居住在美國、使用英文且至少具有大學學歷的成年人。在排除注意力不足、紀錄異常、極端作答時間與低投入等資料後,最終有效樣本為 124 人,平均年齡 40 歲。

受試者被隨機分成三組:42 人屬於完全沒有 AI 的控制組、43 人屬於低成本 AI 組、39 人屬於高成本 AI 組。

每道題目包含 6 個物件以及 5 條邏輯限制條件,這些條件共同決定一個唯一正確的排列。受試者必須根據條件,把六個物件排列到正確的位置。

每一題最多可以提交兩次。第一次提交後,系統只會告訴受試者有幾個物件放在正確位置,卻不會透露究竟是哪幾個,因此使用者仍需要進一步推理與修正。

每題結束後,系統才會顯示完整答案,讓參與者有機會從前一題的結果中學習。

整個實驗被切成三個階段。

第一階段是沒有 AI 的初始測驗,持續 8 分鐘,或直到受試者至少完成 4 道題目。這一階段用來估計每個人的原始能力。

第二階段持續 20 分鐘,是實驗真正的核心。控制組仍然沒有 AI,而另外兩組可以自行決定何時要求 AI 幫助。

第三階段再次完全移除 AI,設計與第一階段相近。研究人員藉此觀察:經歷 AI 輔助之後,當 AI 被拿走,受試者自己的能力究竟變成什麼樣子。

這種設計非常重要,因為它避免只測量「AI + 人」的共同績效,而是重新把 AI 拿掉,觀察真正留在人類身上的能力。

研究中的 AI 不是 ChatGPT,而是一個刻意設計成 100% 正確的工具

這項實驗中的 AI 並不是一般大型語言模型。

當使用者按下「Get AI help」時,系統會隨機挑選一個物件,直接告訴使用者這個物件的正確位置。

更重要的是,研究團隊刻意把這個模擬 AI 設定成 100% 正確。

這麼做的原因,是排除 AI 回答品質這個干擾因素。如果有些人遇到正確答案、有些人遇到錯誤答案,就難以判斷最後的差異究竟來自 AI 使用方式,還是單純因為 AI 品質不同。

因此這項研究真正測量的並不是「ChatGPT 準不準」,而是在假設 AI 提供可靠協助的情況下,人類會如何改變自己的認知投入。

受試者本身並不知道 AI 的正確率是 100%。

AI 加上一點「價格」,人真的就比較少依賴它

研究人員還加入了一個相當有意思的設計:使用 AI 需要付出代價。

實驗中的每一道完整正確答案可以獲得點數,而要求 AI 幫助則會扣掉一部分點數。

低成本 AI 組每要求一次協助扣 0.1 點,高成本 AI 組則每次扣 0.18 點。

結果顯示,低成本組在第二階段平均要求 AI 幫助 6.67 次,高成本組則只有 3.33 次,大約相差一倍。

這項結果透露了一個重要的人機互動現象:AI 使用行為不只是由 AI 本身能力決定,介面所設計的使用成本、摩擦與獎勵機制,也能明顯改變人們依賴 AI 的程度。

當取得答案幾乎沒有成本時,人更容易把問題交給 AI;當求助需要付出一些代價,人則更可能先自己嘗試。

不過這部分統計結果使用單尾 Welch 檢定得到 p < 0.10,因此證據強度應保守解讀,不能把它描述成極強的統計效果。

完全不用 AI 的人,短期內進步非常明顯

研究首先觀察第二階段完全沒有要求過 AI 幫助的參與者。

這群人共有 75 人,他們從第一階段到第三階段的平均 Reward Rate,也就是綜合正確率與解題速度後計算出的表現指標,從每分鐘 2.03 個正確物件提升至 3.86 個。

增幅達到約 90.2%。

這代表這套邏輯題本身確實具有可以透過練習快速學會的結構。受試者會逐漸理解規則、建立策略,甚至學會利用題目中重複出現的隱藏視覺線索。

也正因如此,研究才能進一步問:如果在這段本來會產生學習的過程中插入 AI,會發生什麼?

AI 用得越便宜,能力提升幅度看起來越小

從第一階段到第三階段,完全沒有 AI 的控制組 Reward Rate 平均增加 1.95;高成本 AI 組增加 1.66;低成本 AI 組增加 1.32。

換句話說,在 AI 最容易被呼叫的低成本組中,表現提升幅度最小。

不過這裡同樣需要小心解讀。低成本 AI 組與無 AI 組之間的差異在研究採用的單尾檢定中為 p < 0.10,因此它比較適合被視為方向性的證據,而不是已經確定的強因果結論。

到了第三階段,各組的平均正確率本身並沒有顯著差異,但低成本 AI 組解題時間明顯更長:平均約 111.81 秒,高成本 AI 組約 86.78 秒,沒有 AI 組約 92.21 秒。

這暗示部分影響可能不是最後能不能答對,而是失去 AI 後,需要花多少認知成本才能自行完成問題。

用過 AI 的人,AI 消失後平均表現較差

研究再把參與者按照第二階段是否真的要求過 AI 協助重新分類。

曾要求 AI 幫助的人,在第三階段 AI 已被完全移除後,平均 Reward Rate 為每分鐘 3.42 個正確物件;完全沒有要求 AI 的參與者則為 3.86。

但研究團隊沒有直接因此宣稱「AI 導致能力下降」。

原因很簡單:能力本來比較弱的人,也可能更容易向 AI 求助。

如果沒有排除這種可能性,就無法知道究竟是 AI 造成後續能力較弱,還是本來能力較弱的人比較常使用 AI。

因此作者進一步建立 Bayesian Latent Ability Model,也就是貝葉斯潛在能力模型,試圖從正確率、反應時間以及初始能力中推估每位參與者真正的技能變化。

AI 輔助下的高績效,可能讓我們高估一個人的真實能力

研究還得到一個對企業與教育領域都很值得注意的結果。

研究人員嘗試用第二階段的表現預測第三階段,也就是 AI 被移除後的表現。

對完全沒有使用 AI 的人來說,模型平均低估第三階段 Reward Rate 約 0.15;但對 AI 使用者來說,卻平均高估了約 0.22。

換句話說,如果只觀察一個人在 AI 存在時完成工作的速度與品質,可能會錯把 AI 提供的能力當成人類自己的能力。

這在未來的教育測驗、員工績效評估與技能認證中特別重要。

一個人在 Copilot、ChatGPT 或其他 AI 工具幫助下能完成某項任務,不代表當工具不存在時,他仍具備相同程度的理解與執行能力。

因此 AI 時代可能需要重新區分兩種指標:AI-assisted performance,也就是 AI 輔助後的整體產出,以及 unassisted capability,也就是人類本身在沒有工具協助時的能力。

真正關鍵的變數不是「用了幾次 AI」,而是 Solo Share

這也是整篇研究最值得注意的地方。

研究團隊並沒有只統計每個人呼叫 AI 幾次,而是另外設計了一項名為 Solo Share 的指標。

Solo Share 衡量的是,在一道人類可以求助 AI 的問題中,受試者有多少比例的解題時間是在沒有 AI 幫助的情況下自行思考。

假設兩個人都只呼叫一次 AI。

第一個人在 100 秒的解題時間中,自己思考 80 秒後才求助;第二個人只思考 5 秒就按下 AI。

兩人的「AI 使用次數」完全一樣,但實際經歷的認知活動卻截然不同。

第一個人仍然經歷了假設、推理、排除與修正等過程;第二個人則可能把這些過程直接交給外部工具。

Solo Share 因此比單純的 AI 呼叫次數,更接近研究真正想測量的東西:人類到底保留了多少自主認知工作。

自己多思考一點,與較大的能力成長相關

在貝葉斯潛在能力模型中,Solo Share 與技能變化呈現正向關係。

Solo Share 的後驗平均係數為 0.125,95% credible interval 為 0.002 至 0.246,而係數大於零的後驗機率達到 97.7%。

也就是說,在這套模型與這項實驗資料中,保留較多自主解題時間的人,更可能展現較大的潛在技能成長。

研究團隊進一步將模型結果換算成較容易理解的尺度。

假設兩名條件大致相同的受試者,在長達 20 分鐘的 AI 使用階段中,其中一個人比另一個人多保留 1 分鐘的自主思考時間,模型預測前者在第三階段的正確率約高 1.5%,反應時間約縮短 2.5%。

需要注意的是,這是模型推導出的預測差異,不代表實驗已經直接證明「多思考一分鐘必然造成 1.5% 成績提升」。

反而單純計算 AI 使用次數,幾乎沒有解釋能力

研究人員另外建立了一個模型,把 Solo Share 拿掉,只使用第二階段的 AI 呼叫總次數來預測技能變化。

結果 AI usage 的後驗平均係數只有 0.0004,95% credible interval 從 -0.122 到 0.124,而係數大於零的後驗機率是 50.1%。

這幾乎沒有提供明確方向。

換句話說,在控制初始能力之後,單純知道一個人按了多少次「AI Help」,並不能很好地解釋他的技能究竟進步了多少。

五折交叉驗證也得到類似結果。使用 Solo Share 的主要模型,在預測第三階段正確率與反應時間時,整體表現優於只看 AI 使用次數的模型,也優於假設所有人能力變化相同的基準模型。

因此研究真正支持的故事不是簡單的「AI 使用越多,能力越差」。

比較合理的解釋是:如果 AI 的使用方式大量取代原本需要由使用者完成的思考過程,技能形成可能因此變弱;如果使用者仍維持大量自主推理,AI 本身未必會阻礙學習。

Cognitive Offloading:大腦把工作交給外部工具

這個現象在認知科學中稱為 Cognitive Offloading,也就是認知卸載。

人類其實一直都在這麼做。

我們用紙筆記住電話號碼、用計算機做算術、用 GPS 導航。這些工具可以降低大腦負擔,通常也是文明效率提升的重要來源。

AI 只是把可外包的認知工作推到另一個層級。過去工具多半替我們儲存資訊或執行固定計算,生成式 AI 則開始可以代替閱讀、推論、寫作、程式設計甚至決策的一部分。

問題因此不在於認知卸載本身是否邪惡,而在於被卸載的是哪一種工作。

如果外包的是繁瑣、重複且已經熟練的工作,AI 可以釋放大量時間;但如果外包的恰好就是使用者正在努力學會的技能,那麼被省掉的認知成本,同時也可能是原本用來學習的練習量。

健身的比喻很接近這個問題:AI 可以幫你把槓鈴抬起來,但如果訓練目的本來就是讓肌肉承受重量,那麼把所有重量交出去,完成次數再漂亮,也未必代表肌肉變強。

這篇論文沒有證明「ChatGPT 讓人變笨」

這點非常重要。

首先,研究只有 124 名有效受試者,而且參與者都是居住在美國、使用英文、至少具有大學學歷的成年人,因此不能直接代表所有族群。

其次,整個主要實驗的中間 AI 階段只有 20 分鐘,研究測量的是短期、特定任務的技能形成,而不是數月或數年使用生成式 AI 對智力造成的長期影響。

第三,研究任務是一套受控制的六物件邏輯排列題,而不是現實世界中的軟體工程、寫作、醫療、設計或研究工作。

第四,實驗使用的是功能非常簡單而且固定 100% 正確的模擬 AI,不是 ChatGPT、Claude 或其他真正的大型語言模型。

現實世界的生成式 AI 可以解釋原因、提出反問、提供分層提示、指出錯誤,也可能回答錯誤。這些不同互動模式都有可能改變學習效果。

最重要的是,作者自己明確指出,Solo Share 是受試者實際產生的行為,不是研究人員隨機指定的實驗條件。因此 Solo Share 與技能成長之間的正向關係應該被理解為 association,也就是統計上的關聯,而不是已經證實的因果關係。

研究證據因此支持的是:「保留更多自主推理與較大的短期技能進步相關」,而不是「只要禁止 AI,人就一定學得比較好」。

AI 產品可能需要一種看似反直覺的設計:不要太快給答案

這項研究對 AI 教育與工作工具還帶來一個有趣的 UX 問題。

傳統軟體設計通常努力消除摩擦。點擊越少、答案越快、操作越簡單,往往被視為更好的使用者體驗。

但如果 AI 的目標包含學習與技能培養,完全消除 Cognitive Friction,反而未必是最佳設計。

研究作者提出幾種可能的方法,例如要求使用者先嘗試一次再開放 AI、延後完整協助、只提供部分提示,或要求使用者在得到答案之後反思自己的推理過程。

這些設計故意保留一點「阻力」,目的不是刁難使用者,而是避免 AI 直接把最需要練習的認知步驟整段切掉。

未來教育型 AI 因此可能不能只追求 Answer Quality,而必須同時追蹤 Learning Quality。

最有效率的 AI 不一定是最快把答案吐出來的 AI,有時真正好的 AI Tutor 反而會知道什麼時候不應該立刻回答。

AI 時代真正需要重新思考的是「人還要保留哪些能力」

這篇論文最值得留下來的問題,或許比實驗本身更大。

AI 幾乎必然會繼續接管更多認知工作。要求人類完全不用 AI,就像要求現代人停止使用搜尋引擎、計算機或導航系統一樣,並不現實。

真正需要回答的是:哪些能力可以放心外包,哪些能力即使 AI 已經能完成,人類仍值得持續練習?

如果一項技能只是為了產出結果,那麼 AI 自動化可能非常合理;但如果這項技能同時是理解更複雜問題的基礎,過度自動化就可能讓人失去建立高階能力所需要的底層練習。

因此這篇研究提供的不是「不要用 AI」的答案,而是一個更實際的原則:讓 AI 成為 reasoning amplifier,而不是 reasoning replacement。

也就是讓 AI 放大人的思考,而不是讓人的思考從流程中消失。

在 AI 能力愈來愈強的未來,最重要的衡量方式可能不再只是『AI 幫我完成了多少工作』,而是『工作完成之後,有多少能力真正留在我身上』。

Tech English 專有名詞

Cognitive Offloading|認知卸載:把原本需要由大腦完成的記憶、推理或計算工作交給外部工具。AI 可以降低認知負擔,但如果外包的是正在學習的核心技能,也可能減少必要的練習。

Solo Share|自主解題時間比例:本研究提出的行為指標,用來衡量受試者在 AI 可用的情況下,有多少比例的解題時間仍由自己獨立思考。研究發現它比單純的 AI 呼叫次數更能預測後續技能表現。

Latent Ability|潛在能力:無法直接觀察的人類真實技能水平。研究利用正確率與反應時間等可觀察資料,透過統計模型推估受試者背後的能力變化。

Bayesian Latent Ability Model|貝葉斯潛在能力模型:利用貝葉斯統計推估不可直接觀察能力的模型。這篇研究用它區分受試者的初始能力、後續能力以及個別技能變化。

Human-AI Complementarity|人機互補:讓 AI 與人類各自發揮擅長能力,而不是單純由 AI 取代人類。本研究顯示,AI 是否保留人類的自主推理過程,可能比 AI 使用頻率本身更加重要。

Cognitive Friction|認知摩擦:刻意保留一些需要使用者思考、確認或嘗試的步驟。在教育型 AI 中,適度延遲答案、提供提示而非完整解答,可能有助於避免使用者過早把整個推理流程外包給 AI。

延伸主題

相關文章

探索更多 →