Google AMIE 走進真實診間:90% 鑑別診斷命中率,AI 醫師距離現實還有多遠?

晶片觀測站2026/10/0912 min read
分享

30秒摘要

Google 與 Beth Israel Deaconess Medical Center 合作的 AMIE 真實臨床研究登上《The Lancet》。100 名成人完成診前 AI 對話,98 名接受後續門診;AMIE 的前七項鑑別診斷在 90% 案例中包含最終診斷,但首選診斷正確率為 56%。研究揭示醫療 AI 的潛力,也說明其尚無法獨立取代醫師。

重點摘要

  1. 01100 名成人完成診前 AMIE 文字問診,其中 98 人接受後續門診。
  2. 02Top-7 診斷命中率 90%、Top-3 為 75%、Top-1 為 56%。
  3. 03真人醫師全程監督,沒有觸發預設安全中止的案例。
  4. 04臨床醫師在處置實用性與成本效益上優於 AMIE。
  5. 052026 年的視訊版 AMIE 已結合 Gemini 與 Project Astra,但相關能力仍主要由模擬諮詢驗證。

從醫療聊天機器人到真實診間

2026 年 10 月 8 日,Google 宣布與 Beth Israel Deaconess Medical Center(BIDMC)合作的 AMIE 研究正式刊登於《The Lancet》。AMIE 全名為 Articulate Medical Intelligence Explorer,是 Google Research 與 Google DeepMind 推動的對話式醫療人工智慧研究系統。

這項研究的重要性並不是 AI 第一次回答醫療問題,而是研究人員開始在真實醫療流程中,觀察 AI 如何與真正的患者互動,以及它能否協助醫師準備門診。

過去許多醫療 AI 評測使用標準化考題、病歷摘要或模擬患者。這些測試可以比較模型的推理能力,卻無法完整重現真實患者的表達方式、臨床工作流程、隱私問題與安全風險。AMIE 這次跨出了模擬環境,但仍然處於受到嚴格監督的研究階段。

一、研究究竟如何進行?

研究採前瞻性、單中心、單組可行性設計,經研究倫理審查並事先登錄。參與者是預約非緊急門診、因新出現的症狀尋求醫療協助的成人。

共有 100 名成人在看診前最多五天完成 AMIE 文字對話,其中 98 名如期接受門診。AI 透過安全網頁連結詢問症狀、病史及相關問題,再產生逐字稿、病情摘要與可能的鑑別診斷,供實際看診的醫師參考。

研究中的每場患者與 AI 對話都有真人醫師即時監督。監督醫師可在出現自傷或傷人風險、顯著情緒困擾、潛在臨床傷害,或患者要求結束時介入。這不是無人監管的 AI 門診,也不是讓 AI 獨立開立處方。

研究人員另外安排獨立臨床評估者,以盲法比較 AMIE 與基層醫師提出的鑑別診斷及處置計畫。最終診斷則根據就診八週後的病歷回顧建立。

二、90% 診斷命中率到底代表什麼?

研究最受關注的數字是 90%。但這裡必須分清楚三個概念。

第一,Top-7 命中率為 90%。 研究發現,AMIE 提出的前七項可能診斷,在 90% 的評估案例中包含最終診斷。這代表它有相當強的鑑別診斷涵蓋能力,並不代表每十位患者就有九位被 AI 第一時間正確確診。

第二,Top-3 命中率為 75%。 當只考慮前三個候選診斷時,仍有四分之三的案例包含最終診斷。

第三,Top-1 正確率為 56%。 若要求 AI 的第一個、最可能診斷必須與最終診斷相同,比例便降至 56%。

例如一位患者因胸部不適求診,AI 可能提出肌肉骨骼疼痛、胃食道逆流、心血管疾病等候選原因。若最終診斷排在第三位,這對鑑別診斷與提醒醫師排查風險有價值,卻不能稱為 AI 已經準確完成首選診斷。

因此,90%、75% 與 56% 並不矛盾。它們測量的是不同嚴格程度的診斷任務。

三、AI 與真人醫師相比,誰表現更好?

在獨立臨床評估者的盲法評分中,AMIE 與基層醫師的整體鑑別診斷品質,以及處置計畫的適當性和安全性,沒有觀察到統計顯著差異。

但沒有顯著差異並不等於已證明兩者完全等效。這項研究的樣本量、研究目的與統計設計,不能直接支持 AI 與醫師具有相同臨床能力的結論。

更值得注意的是,真人醫師在處置計畫的實用性與成本效益上表現更好,兩項差異的 p 值分別為 0.003 與 0.004。

原因可能與資訊環境有關。這次 AMIE 沒有患者完整電子病歷,不能親自進行理學檢查,也不能直接觀察患者的外觀及非語言訊號。實際看診的醫師則能利用這些資料,並考慮醫院資源、檢查取得難度、患者負擔與臨床經驗。

醫療決策不只是列出理論上可能的疾病,還必須決定先做哪一項檢查、何時觀察、什麼情況需要轉診,以及哪些處置真正對患者有幫助。

四、100 名患者,零次安全中止,是否代表 AI 已經安全?

研究中沒有任何一場 AMIE 對話觸發預先定義的安全中止條件。這是重要的初步成果,說明在這個特定的監督環境下,研究人員沒有觀察到需要立即停止對話的情況。

但零次安全中止不能推論為零風險。首先,樣本只有 100 名成人,無法排除罕見但嚴重的錯誤。其次,參與者主要來自單一醫療中心,並不代表兒童、急診重症患者、不同語言族群或所有高齡患者。

研究中的參與者也較整體門診人口年輕,因此對高齡、低數位素養或複雜慢性病患者的適用性仍有待研究。

此外,安全中止指標衡量的是預先定義的互動風險,並非完整追蹤所有可能的誤診、延遲治療或長期健康結果。真正的臨床安全性,需要更大規模、不同醫療場域、長期追蹤與適當的對照組。

五、醫師為什麼可能反而需要這種 AI?

研究中,醫師認為 AMIE 產生的診前摘要有助於門診準備。Google 於 10 月 8 日的研究公告指出,醫師回報這些摘要在 75% 的案例中有助於準備就診,並在超過半數案例中影響照護方式。

這提供了一種不同於 AI 取代醫師的部署方向:讓 AI 在患者進入診間之前,先整理症狀、病史與值得確認的問題。

傳統看診的前幾分鐘經常花在蒐集基本資訊。若患者已經完成結構化訪談,醫師就有機會將時間轉向確認資料、判斷風險、進行理學檢查與討論治療選擇。

不過,AI 摘要也可能帶來自動化偏誤。若系統過早提出錯誤診斷,醫師可能受到候選清單影響。因此,摘要必須清楚區分患者原話、AI 推論、未確認資訊及警示訊號,並保留醫師獨立判斷的空間。

六、AMIE 的技術演進:從文字對話到 Gemini 與 Project Astra

AMIE 並不是單一版本、單一功能的醫療聊天機器人。Google 近年的研究逐步將它從文字問診推進到多模態理解與疾病管理。

早期 AMIE 使用醫療資料、臨床對話與模擬患者互動訓練,並利用 Self-Play 自我對話及回饋機制改善問診和臨床推理。

2026 年 6 月發表於《Nature》的疾病管理研究,進一步使用 Gemini 的長上下文能力,結合臨床指引、藥物處方資料與結構化推理,研究 AI 如何協助多次就診與長期疾病管理。但該研究主要使用模擬病例,不能直接等同真實患者的長期治療成效。

2026 年 8 月,Google 又展示建立在 Gemini 與 Project Astra 技術上的 AMIE Video。系統可以進行即時視訊對話,整合語音與影像線索,並引導模擬患者完成部分遠距理學檢查。

這項視訊研究使用 100 個臨床情境與 300 場標準化模擬諮詢,顯示多模態醫療 AI 的研究潛力。然而,視訊版評測與本次 BIDMC 真實臨床可行性研究是不同實驗,不能把兩者的表現合併視為同一項臨床驗證。

七、真正困難的不是語言模型,而是臨床系統工程

要讓醫療 AI 從研究工具變成可信賴的醫療服務,至少需要解決幾個工程問題。

資訊整合: AI 必須在適當授權下取得正確的電子病歷、用藥、過敏史與檢驗結果,同時處理資料缺漏與版本衝突。

不確定性管理: 系統需要知道何時資訊不足、何時應該要求補充檢查、何時必須轉交真人醫師,而不是在每個問題上都給出看似確定的答案。

臨床工作流程: 醫師需要能快速查核 AI 摘要的來源與推論,避免錯誤資訊直接進入正式病歷或處置流程。

資安與隱私: 醫療資料具有高度敏感性。患者同意、存取控制、資料保留、稽核紀錄與供應商責任,都必須在部署前建立清楚規範。

監管與責任: 一旦 AI 建議造成延誤、漏診或不必要檢查,必須能釐清系統、醫療機構與臨床人員各自承擔的責任。

這些問題往往不會在一般 AI Benchmark 中充分顯現,卻決定技術能否真正進入醫院。

八、AI 醫師離現實還有多遠?

答案取決於我們所說的 AI 醫師究竟是什麼。

如果是協助患者整理症狀、準備看診、提供醫師可審查的鑑別診斷,AMIE 已經提供真實臨床環境中的初步可行性證據。

如果是完全獨立診斷、決定檢查、開立處方、處理急症並承擔醫療責任,目前這項研究遠遠不足以證明系統已具備相關能力。

更可能先出現的發展,是醫師與 AI 共同工作的模式:AI 負責前期資訊蒐集、資料整理、指引檢索及提出候選診斷;醫師負責整合臨床情境、進行檢查、判斷風險並與患者共同決策。

Google 也已宣布與 Included Health 合作展開全美範圍的研究,進一步評估對話式 AI 在真實遠距醫療工作流程中的表現。後續能否證明患者結果改善、醫療資源節省或臨床錯誤減少,仍需要等待具對照組的研究結果。

結語:醫療 AI 的真正考試才剛開始

AMIE 的進展說明,大型語言模型正在從回答醫療知識題目,走向參與真實醫療流程。但一份高品質的鑑別診斷清單,與一次完整、安全、經濟且對患者有益的醫療照護,仍然存在巨大差距。

真正值得追問的問題,不只是 AI 能否猜中疾病,而是它能否讓醫師更早發現風險、讓患者更清楚理解病情、減少不必要的檢查,並且在錯誤發生時有可靠的安全機制。

當 AI 開始進入診間,衡量技術成熟度的標準也必須改變:不再只是模型答對多少題,而是它能否在真實世界中持續改善醫療品質。

Tech English|本文技術名詞

Differential Diagnosis(鑑別診斷): 根據患者症狀與檢查資料,列出並逐步排除可能疾病的臨床推理過程。

Top-k Accuracy(前 k 名命中率): 正確答案是否出現在模型排名前 k 個候選結果中的比例。Top-7 命中不等於首選診斷正確。

Prospective Feasibility Study(前瞻性可行性研究): 依事先規劃的研究流程蒐集未來資料,評估一項介入措施能否實際執行,而不一定能證明療效。

Human-in-the-Loop(人類參與監督): 在 AI 工作流程中保留真人審查、介入與決策機制,特別適用於高風險領域。

Multimodal Reasoning(多模態推理): 整合文字、影像、聲音等不同形式資訊進行分析,讓模型能處理比純文字更複雜的情境。

Automation Bias(自動化偏誤): 人類過度信任自動化系統的建議,可能忽略與其結論矛盾的證據。

Core takeaway

AMIE 已在真實診前問診流程展現可行性,但 90% 是前七項鑑別診斷命中率,首選診斷正確率為 56%,目前仍不能視為可獨立執業的 AI 醫師。

Why it matters

這項研究將醫療 AI 的評估從模擬情境推向真實患者與醫師協作,可能改變診前資訊蒐集、門診準備及臨床決策支援方式。但安全性、成本效益與長期患者結果仍需要更大規模研究驗證。

Data story

04

90%

前七項鑑別診斷命中率

Google Research / The Lancet clinical feasibility study最終診斷出現在前七項候選清單中,不代表首選診斷正確。

56%

首選診斷正確率

Google Research依就診八週後病歷回顧建立的最終診斷比較。

100

完成 AI 診前對話的成人

Google Research / The Lancet clinical feasibility study其中 98 人如期接受後續門診。

0

觸發預設安全中止的對話

Google Research所有對話均有真人醫師監督;不代表已證明零臨床風險。

Data figure

AMIE 鑑別診斷:候選清單越長,命中率越高

真實臨床研究,不同 Top-k 指標比較

Unit · %
0255075100Top-1 首選診斷Top-3 前三項Top-7 前七項
Google Research / The Lancet clinical feasibility studyTop-k 為最終診斷出現在前 k 個候選中的比例,不是獨立診斷成功率。

Tech index

07
01Articulate Medical Intelligence Explorer
02Clinical Decision Support
03Differential Diagnosis
04Gemini
05Project Astra
06Multimodal Reasoning
07Human-in-the-Loop

限制與注意

06
  1. 01單中心、單組、前瞻性可行性研究,沒有隨機分配的對照組,不能推論 AI 改善患者健康結果的因果效果。
  2. 0290% 是 Top-7 鑑別診斷命中率,Top-1 正確率為 56%,兩者不可混用。
  3. 03所有患者與 AI 的對話均有真人醫師即時監督,零次安全中止不代表系統已可無監督使用。
  4. 04樣本只有 100 人,參與者年齡分布偏年輕,外部效度與罕見風險尚待確認。
  5. 05研究中的 AMIE 沒有完整電子病歷存取與理學檢查能力;視訊版 AMIE 的模擬研究不能直接視為本次真實臨床驗證。
  6. 06醫師在處置計畫實用性及成本效益方面表現更好;未觀察到顯著差異不等於已證明臨床等效。

資料來源

05
01

Google Research:AMIE 真實臨床可行性研究

official

02

Google Research:臨床研究論文摘要

research

03

Google 官方:The Lancet 發表公告(2026-10-08)

official

04

Google Research:AMIE 即時視訊諮詢研究

research

05

Nature:Towards conversational artificial intelligence for disease management

research

原始來源

research.google

相關公司

Alphabet

GOOGLNASDAQ· 雲端科技

Google DeepMind

Google DeepMind

Beth Israel Deaconess Medical Center

Beth Israel Deaconess Medical Center

Included Health

Included Health

相關文章

探索更多 →