Astra 花兩天破解 85 年前 Enigma 密文:真正驚人的不是答案,而是 AI 自己造了解題工具
30秒摘要
一則 1941 年 7 月 10 日的德軍 Enigma 電文 MVUEH,自 2005 年被公開列為未破解訊息後一直沒有成功解出。2026 年 9 月,Carter Leffen 使用 GPT-6 Astra 與平行 AI agents 對它展開分析,模型不只尋找歷史線索,還自行建立 Enigma 模擬器、撰寫 cryptanalysis 程式並執行 key search,最終找到可正確解密訊息的設定。Crypto Cellar 的 Frode Weierud 已驗證結果,之後亦有獨立 verifier 重新從原始 ciphertext 驗證公布 key。真正值得注意的並不是 AI『背出』了 Enigma 答案,而是大型模型開始扮演 Researcher、Tool Builder 與 Tool User 的組合角色。
重點摘要
- 011941 年德軍 Enigma 訊息 MVUEH 自 2005 年公開列為未破解訊息後,一直到 2026 年才成功得到可驗證 plaintext。
- 02Crypto Cellar 的 Frode Weierud 已確認 Carter Leffen 與 GPT-6 Astra 找到的 key 與 plaintext 正確。
- 03Astra 的工作不只是推測 plaintext,而是自行建立 Enigma simulator 與 Bombe-like cryptanalysis 程式,再執行搜尋與候選 key 驗證。
- 04後續獨立 verifier 不使用原 solver code,直接從 Crypto Cellar 的 ciphertext 與公布 key 重新解密,也得到相符結果。
- 05關鍵線索之一來自同一天已被人類破解的 SIPVX 訊息,以及 ROSENOW ROSENOW crib,因此 Astra 的成功建立在人類既有 cryptanalysis 知識之上。
- 06這個案例最重要的能力訊號可能不是 cryptography,而是 AI 能把 Research、Code Generation、Tool Building、Computation 與 Verification 串成完整工作流。
1940 年代,人類為了破解 Enigma,打造了可以自動搜尋密碼空間的機器。
八十五年後,由現代計算機發展最終孕育出的人工智慧,反過來自己寫了一套虛擬 Enigma 與類 Bombe 搜尋工具,破解了一則當年留下的訊息。
這不是科幻小說。
2026 年 9 月,一則 1941 年 7 月 10 日的德國陸軍 Enigma 電文 MVUEH,在公開沉睡超過二十年後被成功破解。
訊息本身只有 82 個加密字母。
它被保存在 Enigma 研究者 Frode Weierud 維護的 Crypto Cellar Research 資料庫中,自 2005 年以來一直列在未破解訊息清單裡。
9 月 15 日,Carter Leffen 將一組由 GPT-6 Astra 協助找到的 Enigma key 與 plaintext 交給 Weierud 驗證。
Weierud 後來表示,結果很快就顯示出這組 key 與 plaintext 是正確的。
更重要的是,這不是只有一句『AI 說它破解了』的不可驗證故事。
Enigma 是 deterministic cipher。
只要拿到原始 ciphertext 與正確 key,任何人都可以重新跑模擬器驗證結果。
後續已有人使用自己重新撰寫的獨立 verifier,直接從 Crypto Cellar 的 ciphertext 出發,不使用原破解者的 solver code,仍然成功還原相同訊息。
這使 MVUEH 成為一個非常罕見的 AI 能力案例:
成功與否不是由 benchmark judge、LLM evaluator 或主觀評審決定,而是可以直接重新計算。
解出來的內容,其實非常普通
如果期待這是一封藏著德軍秘密武器、最高軍令或驚天情報的電文,答案可能會有點令人失望。
解密後的內容大意只是:
請告知行軍路線。
我目前位於 Rosenow。
請立即用無線電回覆。
換句話說,這封讓後世 cryptanalyst 卡了二十多年的訊息,本質上只是 1941 年某個德軍單位在問:
『我現在在這裡,接下來要往哪裡走?趕快回我。』
但這反而非常符合真實戰爭通訊。
大量軍事無線電並不是戲劇化的最高機密命令,而是後勤、位置、交通、行軍與日常協調。
真正重要的不是 plaintext 有多精彩。
而是它到底是怎麼被找出來的。
Astra 並不是把 Enigma 密文丟進 Transformer 然後神奇地得到答案
這是整件事最需要澄清的一點。
GPT-6 Astra 並不是像語言翻譯一樣:
Ciphertext → Neural Network → Plaintext。
Enigma 的 key space 與機械結構並不適合單靠語言模型直接『猜』。
真正發生的流程更接近:
LLM reasoning → Historical Research → Hypothesis → Crib Selection → Simulator → Search Tool → Computation → Candidate Key → Verification
Astra 在這個流程中的角色更接近研究員與工程師,而不是傳統 cryptographic accelerator。
根據 Carter Leffen 對過程的說明,Astra 首先分析 Crypto Cellar 上仍未破解的訊息,並把 MVUEH 判斷為相對具有突破可能性的目標。
接著它注意到同一天還有另一則已在 2017 年成功破解的訊息 SIPVX。
兩則訊息之間可能存在上下文關聯。
這成為後續破解的關鍵線索。
第一個重要動作:找 Crib
破解歷史 Enigma 時,一個非常重要的技巧叫做 Crib。
Crib 可以理解成:
『我懷疑 plaintext 的某個位置應該會出現這段文字。』
例如軍事電文通常具有固定格式、地名、天氣用語、單位名稱、問候語或程序文字。
二戰時期的 Allied cryptanalysts 也大量利用這種 predictable plaintext。
MVUEH 的破解則把注意力放到了:
ROSENOW ROSENOW
這是一個重複出現的地名,來自相關已破解訊息所提供的上下文線索。
如果 plaintext 中真的包含 ROSENOW ROSENOW,就可以把它和 ciphertext 的特定區段對齊。
這並不會直接給出 Enigma key。
但會大幅增加搜尋時可利用的 constraint。
這就是傳統 Bombe 類型 cryptanalysis 的基本思想之一。
不是把所有可能 key 從宇宙開始暴力掃完。
而是利用已知 plaintext 與 Enigma 的機械限制,不斷排除不可能的設定。
然後 Astra 做了一件非常重要的事:自己寫工具
這才是整個案例最值得關注的部分。
Astra 並沒有停在:
『我覺得 ROSENOW 可能是 crib。』
它接著需要真正測試這個想法。
所以它建立了 Python 與 C++ 的 Enigma simulator,以及用於 cryptanalysis 的 Bombe-like 搜尋程式。
這件事情乍看只是『AI 會寫程式』。
但語意上其實和一般 coding assistant 非常不一樣。
一般使用情境通常是:
Human:幫我寫一個 Enigma simulator。
AI:好的。
這次則更接近:
AI:要解這個問題,我需要一個 Enigma simulator。那我先寫一個。
這中間出現了一個非常重要的能力轉折。
程式不再只是 output。
程式變成 AI 為了完成其他目標而自行建立的 instrument。
就像科學家為了做實驗先設計儀器。
從 Code Generation 走向 Tool Generation
過去幾年大型語言模型的 coding 能力主要被描述成:
寫 function。
修 bug。
建立網站。
寫 SQL。
生成 application。
但 agentic system 開始出現另一種使用模式。
模型先碰到一個原本無法直接回答的問題。
然後判斷:
我需要某種工具。
接著自己把工具做出來。
最後再使用自己做出的工具取得答案。
整個結構變成:
Problem → Need Tool → Build Tool → Run Tool → Observe Result → Modify Hypothesis → Run Again
這已經非常接近傳統研究工作中的 iterative loop。
所以 Astra 破解 MVUEH 最重要的地方,不是『GPT 很會密碼學』。
而是它展現出:
LLM 可以把 deterministic computation 當成自己的外部認知器官。
語言模型負責策略。
C++ 負責跑 billions of operations。
Python 負責快速實驗。
Archive 負責提供歷史證據。
Simulator 負責驗證機械行為。
Agent 則協調這些資源。
這是一種完全不同於單一 neural network inference 的 AI architecture。
AI 並沒有取代傳統演算法
這裡反而出現一個有趣的結論。
大型語言模型越強,並不代表傳統 computer science 變得沒有用。
恰恰相反。
Astra 要破解 Enigma,最後還是需要 deterministic simulator。
還是需要 search algorithm。
還是需要 constraints。
還是需要大量 CPU computation。
還是需要 cryptographic verification。
也就是說:
LLM 並沒有取代演算法,而是開始自己選擇、建立與操作演算法。
這是一個非常重要的差別。
以前 AI 常被想像成一個更大的模型,把所有問題都塞進 neural network 裡。
但 agentic AI 的另一條路線可能反而是:
模型本身負責 orchestration。
真正精確的計算交給傳統工具。
就像人類科學家不會用大腦心算十億次矩陣運算。
我們會寫程式。
AI 也開始這樣做。
Enigma 為什麼這麼難?
要理解這次突破,還是需要先理解 Enigma 本身。
Enigma 是一套 electromechanical rotor cipher machine。
每按下一個字母,電流會通過 plugboard、rotors 與 reflector,再經過 rotors 回來,最後點亮另一個字母。
更麻煩的是 rotors 每輸入一個字母都會轉動。
所以:
A → G
並不代表下一個 A 還會變成 G。
整個 substitution mapping 每打一個字母都在改變。
其安全性來自多個設定組合。
包括:
Rotor order。
Rotor starting position。
Ring setting。
Plugboard connection。
Reflector。
這些設定組合在一起,就形成非常大的 key space。
對 1940 年代的人類而言,直接逐一嘗試是不現實的。
因此 Bombe 等設備的作用並不是簡單地『算得更快』。
而是利用 Enigma 本身的一些數學與機械性質排除大量不可能設定。
例如 Enigma 有一個著名特性:
一個字母永遠不會被加密成自己。
這種限制對 cryptanalysis 極其有用。
當 crib 對齊 ciphertext 時,只要某個位置出現 plaintext letter 和 ciphertext letter 相同,就可以直接排除那個 alignment。
大量 constraint 疊加後,原本天文數字般的搜尋空間就會逐漸縮小。
Bombe 不是現代意義的暴力破解機
談到 Enigma 時,常會看到一個簡化版本:
『盟軍製造 Bombe,然後暴力破解 Enigma。』
但 Bombe 更接近一套 constraint-testing machine。
它利用已知或猜測的 plaintext,也就是 crib,建立字母關係。
再快速測試 rotor settings 是否可能滿足這些關係。
絕大部分設定會非常快被排除。
剩下少量候選,再交給 cryptanalyst 進一步確認。
Astra 這次所做的事情在概念上也非常接近這種思路。
只是 1940 年代需要由大量 cryptanalysts 與 electromechanical machines 協作完成的流程,現在可以由 agent 自己搜尋資料、建立 simulator、產生程式並啟動計算。
這就是最有意思的歷史對稱。
1940 年代,人類造機器解密碼
2026 年,機器自己造機器解密碼
這裡的『造機器』當然已經不再是焊接繼電器與轉子。
而是 Software Tool。
但抽象結構其實高度相似。
Alan Turing、Gordon Welchman 與 Bletchley Park 的 cryptanalysts 面對問題後,會思考:
我們需要什麼機器才能測試這個假設?
接著工程團隊製造 Bombe。
2026 年的 Astra 面對另一則 Enigma message,也做了一個概念相似的動作:
這個問題需要 simulator 與 search tooling。
於是寫出 simulator 與 Bombe-like software。
這並不代表 Astra 等於 Turing。
但它顯示 AI agent 開始具有一個很重要的研究行為:
當現有工具不足時,可以自行建立新的工具。
但它不是從零開始
這也是整篇最重要的 caveat。
如果只看部分媒體標題,很容易得到一個錯誤印象:
『Astra 看了一眼 1941 年 Enigma 密文,完全沒有人類知識,然後突然破解。』
實際過程並不是這樣。
Astra 能取得大量人類已整理完成的歷史資訊。
Crypto Cellar 已經保存並分類 Enigma messages。
SIPVX 已由 Alex Shovkoplyas 在 2017 年破解。
Enigma 的機械原理早已公開。
Bombe cryptanalysis 已經有八十多年研究歷史。
ROSENOW 的 contextual clue 也不是從虛無產生。
所以更精確的描述是:
AI 讀取人類累積的知識,重新組合其中的線索,再用自己建立的工具把一個尚未完成的問題推到終點。
這其實比『AI 從零破解密碼』更接近真正的科學研究。
因為人類研究者也從來不是從零開始。
牛頓讀過前人的數學。
現代物理學家使用數十年前建立的理論。
生物學家依靠既有 genome database。
研究本身就是建立在人類累積知識之上的增量工作。
真正值得觀察的,是 AI 現在是否開始能參與這個 incremental research loop。
『完全自主』這四個字仍需要謹慎
Carter Leffen 對這次實驗的描述非常強烈。
他表示 Astra 能自主搜尋歷史 archives、比較不確定字元、尋找 contextual clues、建立 Enigma simulator、撰寫 cryptanalysis code、執行平行實驗、測試 competing keys、recover plaintext 並 cross-check results。
Crypto Cellar 對破解過程的描述也認為 Astra 承擔了非常大量的實際 cryptanalysis 工作。
但這不代表我們現在可以毫無保留地說:
『一個 AI 完全沒有人類參與,獨自研究並破解 Enigma。』
原因很簡單。
實驗本身仍然由 Carter Leffen 啟動與配置。
模型運行於特定 agentic environment。
人類選擇了研究方向。
而完整 interaction logs、agent orchestration 與 researcher intervention 的邊界,仍需要進一步整理才能精確判斷。
因此更合理的說法是:
這是一個高度 agentic、AI 主導核心破解工作的 AI-assisted cryptanalysis 案例。
至於 autonomous 到什麼程度,需要和『結果是否正確』分開討論。
前者是 workflow attribution 問題。
後者則已經能夠 cryptographically verify。
這個案例真正漂亮的地方,是結果可以被重新驗算
現在的大型 AI benchmark 有一個越來越嚴重的問題。
很多任務的答案不是絕對的。
寫文章好不好?
程式架構漂不漂亮?
研究報告有沒有洞見?
往往需要另一個人,甚至另一個 LLM 來評分。
這就會產生 evaluator bias、benchmark contamination 與 grader reliability 等問題。
MVUEH 不一樣。
Ciphertext 是固定的。
Key 是固定的。
Enigma transformation 是 deterministic 的。
所以驗證流程可以非常簡單:
Ciphertext + Claimed Key → Independent Enigma Simulator → Plaintext
如果得到亂碼,錯了。
如果得到 coherent German plaintext,而且符合歷史格式與相關資料,就是強烈證據。
目前已有獨立 GitHub verifier 使用另一套程式重新執行這個流程,得到和公布結果一致的 plaintext。
這讓 MVUEH 成為少數非常適合檢驗 agentic AI 真實能力的案例。
AI 開始變成 Researcher,而不是 Answer Machine
如果把大型語言模型過去幾年的演進非常粗略地畫成幾個階段,可以得到:
2022:Answer Generator
輸入問題,輸出文字。
2024:Tool User
能搜尋 Web、執行 Python、使用 API。
2025:Agent
能持續執行多步驟任務。
2026:Tool Builder
遇到不存在的工具時,自己寫一個,再使用它解題。
MVUEH 就非常接近第四種。
這個能力如果能穩定泛化,影響可能遠比『破解一封老 Enigma』大得多。
因為很多研究問題的真正障礙,從來不是缺乏語言能力。
而是需要:
找到資料。
理解資料格式。
建立 parser。
寫 simulation。
做 search。
跑 experiment。
分析 failure。
修改 hypothesis。
再跑一次。
這整套流程才是研究工作本身。
下一步真正值得看的,是 AI 能不能自己發明新的實驗
MVUEH 仍然是一個相對封閉的問題。
Enigma 的規則已知。
Ciphertext 固定。
答案可以 deterministic verification。
真正困難的研究環境則更混亂。
例如材料科學。
生物學。
藥物開發。
物理。
晶片設計。
這些領域裡,模型可能不知道:
資料是不是有問題。
假設是不是錯的。
實驗是不是設計錯誤。
measurement 是否存在 bias。
甚至可能根本不存在唯一答案。
所以 Astra 破解 Enigma 並不能直接證明:
『AGI 已經會科學研究。』
但它提供了一個非常清楚的中間訊號。
AI 已經可以把:
閱讀 → 推理 → 寫程式 → 執行計算 → 驗證
串成同一個比較完整的 loop。
這是從 chatbot 走向 research agent 很重要的一步。
而歷史還出現了一個漂亮得有點荒謬的閉環
Enigma cryptanalysis 本身,就是現代計算史的重要支流之一。
為了破解高速、大量的機器密碼,人類被迫把邏輯推理轉成可以由機器大量執行的程序。
Bombe、Colossus,以及 Bletchley Park 周圍形成的技術與思想,後來都成為現代 computing history 中極具代表性的篇章。
八十五年後,計算機進化出了大型語言模型。
而這個模型現在又回頭研究那台曾經刺激計算機技術快速演進的密碼機。
甚至自己重新寫了一台軟體版本的破解工具。
歷史在這裡幾乎形成了一個圓。
人類為了破解機器密碼而造出更好的計算機。
計算機一路演化出人工智慧。
人工智慧再回頭破解當年留下來的機器密碼。
而那封等了八十五年的訊息最後只是:
『請告訴我接下來往哪裡走。』
某種程度上,這句話甚至意外適合拿來形容現在的 AI。
我們已經證明它能往前走。
真正的大問題變成:
接下來,它會往哪裡走?
Tech English|本文技術名詞
Cryptanalysis(密碼分析):研究如何在不知道完整密鑰的情況下,利用密碼系統結構、統計特徵、已知明文或其他線索還原 plaintext 或 key 的技術。
Crib(已知明文線索):cryptanalyst 推測密文中特定位置可能對應的 plaintext。Enigma 破解中常利用固定軍事格式、地名或常見詞建立 crib。
Bombe(炸彈機):二戰期間用來協助破解 Enigma 的 electromechanical cryptanalytic machine。它主要利用 crib 與 Enigma 的結構快速排除不可能的 rotor settings,而不是單純逐一嘗試所有 key。
Deterministic Verification(確定性驗證):相同輸入與設定必定得到相同輸出的驗證方式。Enigma 破解結果可以用公布的 ciphertext 與 key 在獨立 simulator 上重現,因此特別容易驗證。
Agentic AI(代理型人工智慧):能把一個目標拆成多個步驟,自主選擇工具、執行操作、觀察結果並持續調整策略的 AI 系統。
Tool Generation(工具生成):AI 不只是使用已存在的工具,而是在解題過程中自行撰寫新的程式、simulation 或 utility,再利用這些工具完成原始任務。
核心結論
MVUEH 案例的重要性不只是 GPT-6 Astra 解出一則 1941 年 Enigma 訊息,而是模型能自己尋找歷史線索、建立 simulator 與 cryptanalysis 工具,再用 deterministic computation 驗證假設,展現從回答問題走向 Tool Builder 與 Research Agent 的能力。
為什麼重要
大型模型未必需要自己完成所有精確計算。更重要的能力可能是知道何時需要傳統演算法、simulation 或 search,再自行建立並使用這些工具。若這種 workflow 能穩定泛化到工程與科學領域,AI 的角色可能從 Coding Assistant 進一步變成能參與完整研究循環的 Agent。
~10 小時
Carter Leffen 公布的 Astra 核心破解時間
本文技術
限制與注意
- •MVUEH 破解結果本身已有 Crypto Cellar 的 Frode Weierud 驗證,並可使用公布 key 重新從原始 ciphertext 獨立解密;但『完全自主』屬於另一個問題,必須和破解結果是否正確分開判斷。
- •Carter Leffen 啟動並配置了此次研究工作流,Astra 亦運行於具備平行 agents 與工具執行能力的環境,因此不應把案例描述成模型在完全沒有任何人類設定與介入的狀態下自行發現並破解 MVUEH。
- •關鍵 crib ROSENOW ROSENOW 與對同日訊息的分析建立在既有人類 Enigma 研究與已破解 SIPVX 訊息之上,因此這不是 AI 從零重新發明 Enigma cryptanalysis。
- •媒體常使用『兩天破解』描述整起事件,但 Carter Leffen 本人表示核心破解約花 10 小時;兩種說法對應的時間範圍並不完全相同。
- •破解一則已知演算法、固定 ciphertext 且可以 deterministic verification 的歷史密碼,不代表 AI 已具備一般化的自主科學研究能力。
- •Enigma、Bombe 與二戰密碼分析的歷史高度複雜,本文對 Bombe 與 crib 的說明以科普理解為目的,並非完整 cryptographic history。
原始來源
cryptocellar.org

