GPT-5、Gemini 能考贏人類律師?一場真正的法律圖靈測試揭露 AI 的極限(上)

晶片觀測站2026/08/076 min read
分享

30秒摘要

最新研究以義大利律師、法官與公證人國家考試為基礎,透過雙盲圖靈測試比較 GPT-5、Gemini 2.5 Pro、Claude 4 Opus 與 DeepSeek R1 的表現。結果顯示,Gemini 2.5 Pro 已能在律師與法官考試中超越頂尖人類考生,但所有模型仍無法通過最需要法律規劃能力的公證人考試。

重點摘要

  1. 01Gemini 2.5 Pro 在律師與法官考試皆超越真人最高分
  2. 02研究採用真正國家考試與雙盲圖靈測試
  3. 03所有模型皆未使用 Fine-tuning 或 RAG
  4. 04法律知識與法律推理能力已達相當高水準
  5. 05真正考驗仍是公證人考試

AI 真的能成為律師嗎?

近兩年,大型語言模型(LLM)在程式設計、數學、醫學與科學推理等領域持續刷新紀錄,因此不少人開始提出另一個問題:

AI 是否已經能勝任法律工作?

然而,多數過去的研究都有一個共同限制。

它們大多採用選擇題、法律知識測驗或 Benchmark,例如 LegalBench、LEXam 等資料集,測試模型是否知道法條、是否能回答法律問題。

但真正的法律工作遠遠不只是「知道答案」。

律師需要說服法官。

法官需要分析不同法律見解。

公證人甚至需要替當事人設計一份幾十年後仍然有效的法律文件。

因此,來自義大利多所大學的研究團隊設計了一場更貼近真實世界的測試。

一場真正的法律圖靈測試

研究沒有採用一般 Benchmark,而是直接使用義大利最新一次國家法律考試。

研究團隊選用了三種最高等級的法律專業考試:

  • 律師(Bar Exam)
  • 法官(Judicial Exam)
  • 公證人(Notary Exam)

每一份 AI 作答都與真正國考最高分考生的考卷一起重新排版,所有文件都變成完全相同格式。

接著邀請曾擔任國家考試委員的法律專家,在不知道作者身分的情況下進行評分。

換句話說,評審不知道眼前看到的是:

  • 真人
  • GPT-5
  • Gemini 2.5 Pro
  • Claude 4 Opus
  • DeepSeek R1

而是完全依照正式國考標準打分數。

這種方法也就是研究標題所稱的 Blind Turing Test(雙盲圖靈測試)。

測試條件十分嚴格

研究使用四個當時最先進的大型語言模型:

  • Claude 4 Opus
  • GPT-5
  • Gemini 2.5 Pro
  • DeepSeek R1

所有模型皆採用 Out-of-the-box 設定:

  • 沒有法律微調(Fine-tuning)
  • 沒有使用 RAG
  • 不調整生成參數
  • 使用最簡單 Prompt
  • 開啟 Thinking Mode
  • 允許搜尋網路

因此測試的是模型本身真正具備的法律能力,而非客製化系統。

第一關:律師考試

律師考試的核心能力並不是背法條,而是建立一套能夠說服法官的法律論證。

評分內容包含:

  • 法律知識
  • 法律推理
  • 法律論證
  • 文件格式
  • 法律術語
  • 語言品質

最終結果令人相當意外:

Gemini 2.5 Pro 取得 79 分,超越真人第一名的 62 分。

GPT-5 則取得 65 分,同樣高於人類最高分。

Claude 4 Opus 與 DeepSeek R1 則落後不少。

研究者指出,Gemini 在法律攻防論證、法條引用、論述完整性以及預先反駁對方可能主張等方面,都已經達到甚至超越優秀人類考生水準。

第二關:法官考試

法官考試與律師完全不同。

它要求考生分析法律理論、不同學說、司法見解以及各種法律制度之間的關係,而不是單純選擇答案。

這種能力反而非常符合 LLM 的優勢。

Gemini 2.5 Pro 再次取得最高分(21 / 24),超越真人最高分(18 / 24)。

研究者指出,Gemini 展現出:

  • 優秀的法律知識整合能力
  • 清楚的法理架構
  • 完整介紹不同法律見解
  • 合理引用法律來源
  • 高度一致的論述結構

相較之下,GPT-5 雖然語言流暢,但在內容完整性與法律推理深度仍明顯落後。

Claude 與 DeepSeek 則與 Gemini 存在更大的差距。

一個重要發現

從前兩場考試可以發現,目前最先進的 LLM 已經不只是會查資料。

它們開始展現出一種類似法律助理甚至研究員的能力:

  • 快速整理大量法律資料
  • 比較不同法律見解
  • 建立完整論證架構
  • 產生高品質法律文件

然而,真正的挑戰並不是從這裡開始,而是下一關。

相關公司

相關文章

探索更多 →