Google AMIE 走進真實診間:90% 鑑別診斷命中率,AI 醫師距離現實還有多遠?
30秒摘要
Google 與 Beth Israel Deaconess Medical Center 合作的 AMIE 真實臨床研究登上《The Lancet》。100 名成人完成診前 AI 對話,98 名接受後續門診;AMIE 的前七項鑑別診斷在 90% 案例中包含最終診斷,但首選診斷正確率為 56%。研究揭示醫療 AI 的潛力,也說明其尚無法獨立取代醫師。
重點摘要
- 01100 名成人完成診前 AMIE 文字問診,其中 98 人接受後續門診。
- 02Top-7 診斷命中率 90%、Top-3 為 75%、Top-1 為 56%。
- 03真人醫師全程監督,沒有觸發預設安全中止的案例。
- 04臨床醫師在處置實用性與成本效益上優於 AMIE。
- 052026 年的視訊版 AMIE 已結合 Gemini 與 Project Astra,但相關能力仍主要由模擬諮詢驗證。
從醫療聊天機器人到真實診間
2026 年 10 月 8 日,Google 宣布與 Beth Israel Deaconess Medical Center(BIDMC)合作的 AMIE 研究正式刊登於《The Lancet》。AMIE 全名為 Articulate Medical Intelligence Explorer,是 Google Research 與 Google DeepMind 推動的對話式醫療人工智慧研究系統。
這項研究的重要性並不是 AI 第一次回答醫療問題,而是研究人員開始在真實醫療流程中,觀察 AI 如何與真正的患者互動,以及它能否協助醫師準備門診。
過去許多醫療 AI 評測使用標準化考題、病歷摘要或模擬患者。這些測試可以比較模型的推理能力,卻無法完整重現真實患者的表達方式、臨床工作流程、隱私問題與安全風險。AMIE 這次跨出了模擬環境,但仍然處於受到嚴格監督的研究階段。
一、研究究竟如何進行?
研究採前瞻性、單中心、單組可行性設計,經研究倫理審查並事先登錄。參與者是預約非緊急門診、因新出現的症狀尋求醫療協助的成人。
共有 100 名成人在看診前最多五天完成 AMIE 文字對話,其中 98 名如期接受門診。AI 透過安全網頁連結詢問症狀、病史及相關問題,再產生逐字稿、病情摘要與可能的鑑別診斷,供實際看診的醫師參考。
研究中的每場患者與 AI 對話都有真人醫師即時監督。監督醫師可在出現自傷或傷人風險、顯著情緒困擾、潛在臨床傷害,或患者要求結束時介入。這不是無人監管的 AI 門診,也不是讓 AI 獨立開立處方。
研究人員另外安排獨立臨床評估者,以盲法比較 AMIE 與基層醫師提出的鑑別診斷及處置計畫。最終診斷則根據就診八週後的病歷回顧建立。
二、90% 診斷命中率到底代表什麼?
研究最受關注的數字是 90%。但這裡必須分清楚三個概念。
第一,Top-7 命中率為 90%。 研究發現,AMIE 提出的前七項可能診斷,在 90% 的評估案例中包含最終診斷。這代表它有相當強的鑑別診斷涵蓋能力,並不代表每十位患者就有九位被 AI 第一時間正確確診。
第二,Top-3 命中率為 75%。 當只考慮前三個候選診斷時,仍有四分之三的案例包含最終診斷。
第三,Top-1 正確率為 56%。 若要求 AI 的第一個、最可能診斷必須與最終診斷相同,比例便降至 56%。
例如一位患者因胸部不適求診,AI 可能提出肌肉骨骼疼痛、胃食道逆流、心血管疾病等候選原因。若最終診斷排在第三位,這對鑑別診斷與提醒醫師排查風險有價值,卻不能稱為 AI 已經準確完成首選診斷。
因此,90%、75% 與 56% 並不矛盾。它們測量的是不同嚴格程度的診斷任務。
三、AI 與真人醫師相比,誰表現更好?
在獨立臨床評估者的盲法評分中,AMIE 與基層醫師的整體鑑別診斷品質,以及處置計畫的適當性和安全性,沒有觀察到統計顯著差異。
但沒有顯著差異並不等於已證明兩者完全等效。這項研究的樣本量、研究目的與統計設計,不能直接支持 AI 與醫師具有相同臨床能力的結論。
更值得注意的是,真人醫師在處置計畫的實用性與成本效益上表現更好,兩項差異的 p 值分別為 0.003 與 0.004。
原因可能與資訊環境有關。這次 AMIE 沒有患者完整電子病歷,不能親自進行理學檢查,也不能直接觀察患者的外觀及非語言訊號。實際看診的醫師則能利用這些資料,並考慮醫院資源、檢查取得難度、患者負擔與臨床經驗。
醫療決策不只是列出理論上可能的疾病,還必須決定先做哪一項檢查、何時觀察、什麼情況需要轉診,以及哪些處置真正對患者有幫助。
四、100 名患者,零次安全中止,是否代表 AI 已經安全?
研究中沒有任何一場 AMIE 對話觸發預先定義的安全中止條件。這是重要的初步成果,說明在這個特定的監督環境下,研究人員沒有觀察到需要立即停止對話的情況。
但零次安全中止不能推論為零風險。首先,樣本只有 100 名成人,無法排除罕見但嚴重的錯誤。其次,參與者主要來自單一醫療中心,並不代表兒童、急診重症患者、不同語言族群或所有高齡患者。
研究中的參與者也較整體門診人口年輕,因此對高齡、低數位素養或複雜慢性病患者的適用性仍有待研究。
此外,安全中止指標衡量的是預先定義的互動風險,並非完整追蹤所有可能的誤診、延遲治療或長期健康結果。真正的臨床安全性,需要更大規模、不同醫療場域、長期追蹤與適當的對照組。
五、醫師為什麼可能反而需要這種 AI?
研究中,醫師認為 AMIE 產生的診前摘要有助於門診準備。Google 於 10 月 8 日的研究公告指出,醫師回報這些摘要在 75% 的案例中有助於準備就診,並在超過半數案例中影響照護方式。
這提供了一種不同於 AI 取代醫師的部署方向:讓 AI 在患者進入診間之前,先整理症狀、病史與值得確認的問題。
傳統看診的前幾分鐘經常花在蒐集基本資訊。若患者已經完成結構化訪談,醫師就有機會將時間轉向確認資料、判斷風險、進行理學檢查與討論治療選擇。
不過,AI 摘要也可能帶來自動化偏誤。若系統過早提出錯誤診斷,醫師可能受到候選清單影響。因此,摘要必須清楚區分患者原話、AI 推論、未確認資訊及警示訊號,並保留醫師獨立判斷的空間。
六、AMIE 的技術演進:從文字對話到 Gemini 與 Project Astra
AMIE 並不是單一版本、單一功能的醫療聊天機器人。Google 近年的研究逐步將它從文字問診推進到多模態理解與疾病管理。
早期 AMIE 使用醫療資料、臨床對話與模擬患者互動訓練,並利用 Self-Play 自我對話及回饋機制改善問診和臨床推理。
2026 年 6 月發表於《Nature》的疾病管理研究,進一步使用 Gemini 的長上下文能力,結合臨床指引、藥物處方資料與結構化推理,研究 AI 如何協助多次就診與長期疾病管理。但該研究主要使用模擬病例,不能直接等同真實患者的長期治療成效。
2026 年 8 月,Google 又展示建立在 Gemini 與 Project Astra 技術上的 AMIE Video。系統可以進行即時視訊對話,整合語音與影像線索,並引導模擬患者完成部分遠距理學檢查。
這項視訊研究使用 100 個臨床情境與 300 場標準化模擬諮詢,顯示多模態醫療 AI 的研究潛力。然而,視訊版評測與本次 BIDMC 真實臨床可行性研究是不同實驗,不能把兩者的表現合併視為同一項臨床驗證。
七、真正困難的不是語言模型,而是臨床系統工程
要讓醫療 AI 從研究工具變成可信賴的醫療服務,至少需要解決幾個工程問題。
資訊整合: AI 必須在適當授權下取得正確的電子病歷、用藥、過敏史與檢驗結果,同時處理資料缺漏與版本衝突。
不確定性管理: 系統需要知道何時資訊不足、何時應該要求補充檢查、何時必須轉交真人醫師,而不是在每個問題上都給出看似確定的答案。
臨床工作流程: 醫師需要能快速查核 AI 摘要的來源與推論,避免錯誤資訊直接進入正式病歷或處置流程。
資安與隱私: 醫療資料具有高度敏感性。患者同意、存取控制、資料保留、稽核紀錄與供應商責任,都必須在部署前建立清楚規範。
監管與責任: 一旦 AI 建議造成延誤、漏診或不必要檢查,必須能釐清系統、醫療機構與臨床人員各自承擔的責任。
這些問題往往不會在一般 AI Benchmark 中充分顯現,卻決定技術能否真正進入醫院。
八、AI 醫師離現實還有多遠?
答案取決於我們所說的 AI 醫師究竟是什麼。
如果是協助患者整理症狀、準備看診、提供醫師可審查的鑑別診斷,AMIE 已經提供真實臨床環境中的初步可行性證據。
如果是完全獨立診斷、決定檢查、開立處方、處理急症並承擔醫療責任,目前這項研究遠遠不足以證明系統已具備相關能力。
更可能先出現的發展,是醫師與 AI 共同工作的模式:AI 負責前期資訊蒐集、資料整理、指引檢索及提出候選診斷;醫師負責整合臨床情境、進行檢查、判斷風險並與患者共同決策。
Google 也已宣布與 Included Health 合作展開全美範圍的研究,進一步評估對話式 AI 在真實遠距醫療工作流程中的表現。後續能否證明患者結果改善、醫療資源節省或臨床錯誤減少,仍需要等待具對照組的研究結果。
結語:醫療 AI 的真正考試才剛開始
AMIE 的進展說明,大型語言模型正在從回答醫療知識題目,走向參與真實醫療流程。但一份高品質的鑑別診斷清單,與一次完整、安全、經濟且對患者有益的醫療照護,仍然存在巨大差距。
真正值得追問的問題,不只是 AI 能否猜中疾病,而是它能否讓醫師更早發現風險、讓患者更清楚理解病情、減少不必要的檢查,並且在錯誤發生時有可靠的安全機制。
當 AI 開始進入診間,衡量技術成熟度的標準也必須改變:不再只是模型答對多少題,而是它能否在真實世界中持續改善醫療品質。
Tech English|本文技術名詞
Differential Diagnosis(鑑別診斷): 根據患者症狀與檢查資料,列出並逐步排除可能疾病的臨床推理過程。
Top-k Accuracy(前 k 名命中率): 正確答案是否出現在模型排名前 k 個候選結果中的比例。Top-7 命中不等於首選診斷正確。
Prospective Feasibility Study(前瞻性可行性研究): 依事先規劃的研究流程蒐集未來資料,評估一項介入措施能否實際執行,而不一定能證明療效。
Human-in-the-Loop(人類參與監督): 在 AI 工作流程中保留真人審查、介入與決策機制,特別適用於高風險領域。
Multimodal Reasoning(多模態推理): 整合文字、影像、聲音等不同形式資訊進行分析,讓模型能處理比純文字更複雜的情境。
Automation Bias(自動化偏誤): 人類過度信任自動化系統的建議,可能忽略與其結論矛盾的證據。
Core takeaway
AMIE 已在真實診前問診流程展現可行性,但 90% 是前七項鑑別診斷命中率,首選診斷正確率為 56%,目前仍不能視為可獨立執業的 AI 醫師。
Why it matters
這項研究將醫療 AI 的評估從模擬情境推向真實患者與醫師協作,可能改變診前資訊蒐集、門診準備及臨床決策支援方式。但安全性、成本效益與長期患者結果仍需要更大規模研究驗證。
Data story
04Data figure
AMIE 鑑別診斷:候選清單越長,命中率越高
真實臨床研究,不同 Top-k 指標比較
Tech index
07限制與注意
06- 01單中心、單組、前瞻性可行性研究,沒有隨機分配的對照組,不能推論 AI 改善患者健康結果的因果效果。
- 0290% 是 Top-7 鑑別診斷命中率,Top-1 正確率為 56%,兩者不可混用。
- 03所有患者與 AI 的對話均有真人醫師即時監督,零次安全中止不代表系統已可無監督使用。
- 04樣本只有 100 人,參與者年齡分布偏年輕,外部效度與罕見風險尚待確認。
- 05研究中的 AMIE 沒有完整電子病歷存取與理學檢查能力;視訊版 AMIE 的模擬研究不能直接視為本次真實臨床驗證。
- 06醫師在處置計畫實用性及成本效益方面表現更好;未觀察到顯著差異不等於已證明臨床等效。
原始來源
research.google相關公司
Alphabet
Google DeepMind
Beth Israel Deaconess Medical Center
Included Health


