AI 為什麼會越來越聰明?最新研究建立生成式 AI 自我學習的數學理論
30秒摘要
生成式 AI 已廣泛應用於藥物探索、材料設計與蛋白質工程,但一直缺乏完整的理論來解釋 AI 是否真的能透過不斷學習自己的成果而持續進步。最新研究提出 Closed-loop Generative Selection 理論,首次證明生成、評估、保留最佳結果並重新學習的閉環流程,在特定條件下能逐步收斂到最佳解,並分析記憶長度、Oracle 評估成本以及評估誤差對搜尋效率的影響。
重點摘要
- 01首次建立 Closed-loop Generative Selection 的完整數學理論。
- 02證明生成式 AI 能透過生成、評估、再學習持續朝最佳解收斂。
- 03分析 AI 記憶深度對搜尋效率的影響。
- 04指出 Oracle 評估才是藥物設計最主要的成本來源。
- 05研究成果可延伸至材料科學、蛋白質工程及其他生成式 AI 最佳化問題。
AI 不只是生成,更重要的是學會如何學習。
近年來,生成式 AI 已從聊天機器人發展到更複雜的科學領域,例如新藥開發、材料探索與蛋白質設計。這些工作都有一個共同挑戰:需要在幾乎無限大的可能性中找到最好的答案。
然而,AI 並不是一次就找到正確答案,而是透過不斷嘗試與修正,逐步縮小搜尋範圍。最新研究首次建立完整的數學理論,解釋這種自我改善的過程為何有效。
什麼是 Closed-loop Generative Selection?
研究提出的核心概念稱為 Closed-loop Generative Selection(閉環生成式搜尋)。

整個流程可以分成四個步驟:
AI 生成大量候選方案,例如新的藥物分子。 Oracle(評估系統)替每個候選進行評分。 保留目前表現最好的候選結果。 利用這些成功案例重新訓練 AI,再開始下一輪搜尋。
每完成一次循環,AI 都會利用新的資訊調整搜尋方向,希望下一輪提出更好的候選。
研究首次證明 AI 可以持續收斂
雖然許多 AI 藥物平台早已使用類似流程,但一直缺乏完整理論證明其有效性。研究團隊建立新的數學模型,將生成模型本身也納入分析,證明只要保留最佳候選並維持一定探索能力,搜尋流程就能持續朝最佳解收斂,而不是一直停留在局部最佳解。
AI 的記憶不是越多越好
研究另一項重要發現,是分析 AI 應該保留多少歷史資料。
如果過去資料仍具有代表性,較長的記憶能提升模型品質;但如果早期資料品質不佳,保留過多歷史反而可能降低學習效率。因此,最佳記憶長度未必是全部歷史,而可能是最近幾輪的重要資訊。
真正昂貴的是 Oracle
許多人認為 AI 最大成本來自模型訓練,但在藥物設計中,真正昂貴的是 Oracle,也就是評估候選結果的系統,例如分子模擬、Docking 或實驗室測試。
因此,研究除了分析搜尋效率之外,也探討如何利用最少的 Oracle 評估次數找到最佳候選,降低整體研究成本。
現實世界一定存在誤差
真實世界沒有完美的評分系統。同一個候選分子,多次測試可能得到略有不同的結果。研究因此分析不同型態的評估雜訊,探討需要重複測試多少次,才能有足夠信心判斷新的候選確實比舊方案更優秀。
影響不只藥物設計
雖然論文以藥物探索作為主要案例,但作者建立的是一套更通用的生成式最佳化理論。只要符合「生成候選 → 評估 → 保留最佳 → 再學習」的閉環流程,都可能應用這套方法,包括材料科學、蛋白質工程、多目標最佳化,以及未來更多 AI 自動設計系統。
晶片觀測站觀點
近年來 AI 發展多半聚焦於更大的模型、更強的 GPU 與更多訓練資料,但這篇研究關注的是另一個更根本的問題:AI 如何從自己的成功與失敗中持續學習。未來生成式 AI 的競爭,可能不只是模型規模,而是誰能建立更有效率、更可靠的閉環學習機制。這項研究雖然偏向理論,但有望成為下一代 AI 科學研究的重要基礎。
原始來源
arxiv.org

