GPT-5、Gemini 能考贏人類律師?一場真正的法律圖靈測試揭露 AI 的極限(上)
30秒摘要
最新研究以義大利律師、法官與公證人國家考試為基礎,透過雙盲圖靈測試比較 GPT-5、Gemini 2.5 Pro、Claude 4 Opus 與 DeepSeek R1 的表現。結果顯示,Gemini 2.5 Pro 已能在律師與法官考試中超越頂尖人類考生,但所有模型仍無法通過最需要法律規劃能力的公證人考試。
重點摘要
- 01Gemini 2.5 Pro 在律師與法官考試皆超越真人最高分
- 02研究採用真正國家考試與雙盲圖靈測試
- 03所有模型皆未使用 Fine-tuning 或 RAG
- 04法律知識與法律推理能力已達相當高水準
- 05真正考驗仍是公證人考試
AI 真的能成為律師嗎?
近兩年,大型語言模型(LLM)在程式設計、數學、醫學與科學推理等領域持續刷新紀錄,因此不少人開始提出另一個問題:
AI 是否已經能勝任法律工作?
然而,多數過去的研究都有一個共同限制。
它們大多採用選擇題、法律知識測驗或 Benchmark,例如 LegalBench、LEXam 等資料集,測試模型是否知道法條、是否能回答法律問題。
但真正的法律工作遠遠不只是「知道答案」。
律師需要說服法官。
法官需要分析不同法律見解。
公證人甚至需要替當事人設計一份幾十年後仍然有效的法律文件。
因此,來自義大利多所大學的研究團隊設計了一場更貼近真實世界的測試。
一場真正的法律圖靈測試
研究沒有採用一般 Benchmark,而是直接使用義大利最新一次國家法律考試。
研究團隊選用了三種最高等級的法律專業考試:
- 律師(Bar Exam)
- 法官(Judicial Exam)
- 公證人(Notary Exam)
每一份 AI 作答都與真正國考最高分考生的考卷一起重新排版,所有文件都變成完全相同格式。
接著邀請曾擔任國家考試委員的法律專家,在不知道作者身分的情況下進行評分。
換句話說,評審不知道眼前看到的是:
- 真人
- GPT-5
- Gemini 2.5 Pro
- Claude 4 Opus
- DeepSeek R1
而是完全依照正式國考標準打分數。
這種方法也就是研究標題所稱的 Blind Turing Test(雙盲圖靈測試)。
測試條件十分嚴格
研究使用四個當時最先進的大型語言模型:
- Claude 4 Opus
- GPT-5
- Gemini 2.5 Pro
- DeepSeek R1
所有模型皆採用 Out-of-the-box 設定:
- 沒有法律微調(Fine-tuning)
- 沒有使用 RAG
- 不調整生成參數
- 使用最簡單 Prompt
- 開啟 Thinking Mode
- 允許搜尋網路
因此測試的是模型本身真正具備的法律能力,而非客製化系統。
第一關:律師考試
律師考試的核心能力並不是背法條,而是建立一套能夠說服法官的法律論證。
評分內容包含:
- 法律知識
- 法律推理
- 法律論證
- 文件格式
- 法律術語
- 語言品質
最終結果令人相當意外:
Gemini 2.5 Pro 取得 79 分,超越真人第一名的 62 分。
GPT-5 則取得 65 分,同樣高於人類最高分。
Claude 4 Opus 與 DeepSeek R1 則落後不少。
研究者指出,Gemini 在法律攻防論證、法條引用、論述完整性以及預先反駁對方可能主張等方面,都已經達到甚至超越優秀人類考生水準。
第二關:法官考試
法官考試與律師完全不同。
它要求考生分析法律理論、不同學說、司法見解以及各種法律制度之間的關係,而不是單純選擇答案。
這種能力反而非常符合 LLM 的優勢。
Gemini 2.5 Pro 再次取得最高分(21 / 24),超越真人最高分(18 / 24)。
研究者指出,Gemini 展現出:
- 優秀的法律知識整合能力
- 清楚的法理架構
- 完整介紹不同法律見解
- 合理引用法律來源
- 高度一致的論述結構
相較之下,GPT-5 雖然語言流暢,但在內容完整性與法律推理深度仍明顯落後。
Claude 與 DeepSeek 則與 Gemini 存在更大的差距。
一個重要發現
從前兩場考試可以發現,目前最先進的 LLM 已經不只是會查資料。
它們開始展現出一種類似法律助理甚至研究員的能力:
- 快速整理大量法律資料
- 比較不同法律見解
- 建立完整論證架構
- 產生高品質法律文件
然而,真正的挑戰並不是從這裡開始,而是下一關。


