為什麼 GPT-5、Gemini 都輸給公證人?真正卡住 AI 的不是法律,而是「規劃能力」(下)
30秒摘要
雖然 Gemini 2.5 Pro 與 GPT-5 已能在律師與法官考試中超越人類,但四個大型語言模型在義大利公證人考試中全數落敗。研究指出,問題並非法律知識不足,而是目前 LLM 仍缺乏長期規劃、風險預測與法律設計能力,這也可能是下一代 AI Agent 必須突破的關鍵。
重點摘要
- 01四個 LLM 全數未通過公證人考試
- 02研究提出 Goal-directed Planning 是目前 AI 最大瓶頸
- 03整理出五種法律推理失敗模式
- 04所有模型都在特殊案例中忽略關鍵法律程序
- 05研究認為未來 AI 將從知識模型走向規劃模型
AI 為什麼突然失靈了?
如果只看前兩場考試,很容易得到一個結論:AI 已經快要取代法律工作。
Gemini 2.5 Pro 在律師與法官考試都超越了真人最高分,GPT-5 也有相當優秀的表現。
然而到了第三場考試,情況卻完全翻轉。
四個模型,包括 GPT-5、Gemini 2.5 Pro、Claude 4 Opus 與 DeepSeek R1,全數未能通過公證人考試。
研究團隊認為,真正的原因並不是 AI 不懂法律,而是目前的大型語言模型仍然缺乏一項十分重要的能力:目標導向規劃(Goal-directed Planning)。
公證人考試到底在考什麼?
很多人以為公證人只是負責簽名、蓋章。
事實上,在義大利的公證人考試中,考生必須根據一段複雜的真實案例,親自設計一份合法且能長期運作的法律文件。
例如:
- 如何設計房屋買賣契約?
- 如何安排遺囑?
- 如何避免未來繼承糾紛?
- 如何保護所有當事人的權益?
- 如何符合所有法律程序?
這不只是回答問題,而是替所有人設計一套完整的法律方案。
法律分析 ≠ 法律設計
研究作者提出一個很重要的觀點。
目前 LLM 很擅長的是:
- 查找法律
- 解釋法律
- 比較不同法律見解
- 建立完整論證
但公證人的工作需要另一種能力。
模型必須同時考慮:
- 多位當事人的利益
- 契約未來可能產生的法律效果
- 所有正式程序
- 潛在法律風險
- 數十年後仍能成立的法律安排
也就是說,AI 必須先理解最終目標,再反向規劃所有法律步驟。
研究指出,目前所有模型都還做不到。
AI 最常犯的五種錯誤
研究團隊整理出五種最常見的失敗模式。
1. Legal Source Failure(法律來源錯誤)
模型引用了錯誤、不適用甚至不存在的法律規定。
雖然這種情況不像早期模型那麼常見,但仍然會發生。
2. Reasoning Failure(推理錯誤)
模型前後論述互相矛盾。
例如前面主張某項法律制度可以適用,後面卻又推翻自己的結論。
研究認為,這類問題主要出現在需要多步驟推理的案例。
3. Pertinence Failure(偏離題目)
模型沒有真正回答考題最重要的法律問題。
有時候內容看起來很多,但卻忽略了考題真正想考的核心。
4. Lexical Failure(法律術語使用不精確)
雖然語法正確,但部分專業法律用語仍使用不夠精準。
5. Formal Failure(正式文件格式錯誤)
法律文件具有大量固定格式。
即使法律分析正確,只要正式文件缺少必要內容,在真實法律程序中仍可能無效。
研究發現,這也是所有模型最常出現的問題之一。
一道陷阱題,四個模型全部中招
論文分享了一個非常有趣的案例。
考題中,一名購屋者同時具有「聾」與「啞」的身分,而且能閱讀與書寫。
依照義大利公證法,這種情況下辦理公證時必須有手語翻譯員在場,否則整份法律文件可能因程序問題而失效。
令人意外的是,所有模型都知道相關法律規定,卻沒有在實際起草的法律文件中加入翻譯員。
換句話說,模型知道規則,但沒有真正把規則落實到最後的方案設計。
研究團隊認為,這代表目前 LLM 很容易受到題目中的特殊條件影響,在多步驟規劃過程中遺漏關鍵細節。
為什麼 AI Agent 也值得注意?
這篇研究不只是法律研究。
它其實也提醒所有正在開發 AI Agent 的團隊。
目前的大型語言模型,在以下任務通常都有很好的表現:
- 文件整理
- 知識搜尋
- 報告生成
- 程式撰寫
- 法律分析
但如果任務變成:
- 規劃企業流程
- 安排多部門工作
- 控制風險
- 設計金融商品
- 長期專案管理
模型往往需要同時追蹤大量限制條件,並持續驗證自己的每一步決策。
這正是目前 LLM 最容易出錯的地方。
作者的另一個觀察
研究團隊認為,律師與法官考試之所以表現較好,其中一個原因可能是相關法律資料非常豐富。
大量教材、法院判決與法律評論都公開存在,因此模型在訓練或搜尋時較容易取得知識。
反觀公證契約,多數屬於私人文件,公開資料遠少於法院判決,因此模型能參考的案例也相對有限。
這可能也是公證人成為目前最困難法律任務的重要原因之一。
AI 已經可以取代法律工作了嗎?
研究作者最後提醒,答案是否定的。
即使模型能寫出非常漂亮的考卷,也不代表它真的具備完整的法律執業能力。
例如法官每天仍需要:
- 評估證據
- 理解當事人互動
- 判斷案件背景
- 平衡不同法律價值
- 與律師進行法庭攻防
這些能力目前仍遠超過一次考試所能測試的範圍。
晶片觀測站觀點
這篇研究最大的價值,不是在比較 GPT-5、Gemini 或 Claude 誰比較強。
真正值得注意的是,它清楚劃出大型語言模型目前能力的邊界。
今天的 LLM 已經非常擅長「知識整理」與「推理分析」,甚至在部分法律考試超越人類。
但當問題變成設計一套能長期運作、符合所有限制條件且兼顧各方利益的完整方案時,模型仍然會暴露出規劃能力不足的問題。
這也意味著,未來 AI 發展的重點,很可能不再只是更大的模型,而是如何結合規則引擎、驗證機制、工作流程與多 Agent 協作,讓 AI 能真正完成複雜任務,而不只是回答問題。


