AI 為什麼會「學新忘舊」?研究團隊用量子混合態挑戰災難性遺忘
30秒摘要
當人工智慧持續學習新的類別時,往往會逐漸忘記過去學過的知識,這個現象被稱為「災難性遺忘」。一篇最新研究嘗試把這項經典 AI 難題帶進量子機器學習,提出以 Mixed-State Prototype(混合態原型)表示不同類別的方法。研究利用 8-qubit 量子骨幹與 4-qubit 密度矩陣,在 CIFAR-100 與 TinyImageNet 上測試增量學習能力。結果顯示,量子方法已能與部分傳統增量學習方法競爭,但仍未超越 FeCAM 等較強的 classical baseline,而且目前所有量子電路仍是在傳統 GPU 上模擬,距離真正的量子硬體優勢還有相當距離。
重點摘要
- 01研究提出 Quantum Incremental Learning with Mixed-State Prototypes,利用量子混合態建立類別原型。
- 02目標是處理 AI 增量學習中的 Catastrophic Forgetting,也就是學習新知識時逐漸遺忘舊知識的問題。
- 03架構採用 ResNet-18、256 維 MLP、8-qubit quantum backbone 與 4-qubit density matrix,是量子與傳統運算混合的模型。
- 04Mixed state 能描述類別內部的統計變異,而非只用單一 pure quantum state 代表整個類別。
- 05模型透過 Hilbert-Schmidt distance 比較輸入資料與不同 mixed-state prototypes 的距離進行分類。
- 06CIFAR-100 Split A 實驗取得 57.28% Last Accuracy、71.78% Average Accuracy,但仍低於 FeCAM 的 68.69% 與 78.26%。
- 07TinyImageNet 上量子方法取得 38.38% Last Accuracy、53.71% Average Accuracy,同樣未超越最強 classical baseline。
- 08研究主張 mixed-state prototype 在參數複雜度方面具有潛在優勢,但不代表目前已具有實際運算速度優勢。
- 09所有量子電路目前都透過 NVIDIA RTX 3090 與 PennyLane 模擬,並未在真正量子處理器上完成實驗。
- 10研究目前不能證明 quantum advantage,更適合視為量子機器學習探索持續學習問題的一種新架構。
人工智慧如果已經學會辨認貓、狗與汽車,接著再教它辨認飛機、船隻與卡車,理論上它應該只是增加新的知識。但對神經網路而言,事情沒有這麼簡單。
當模型使用新資料持續更新參數時,原本為舊任務建立的特徵與決策邊界可能被改寫,使模型在學會新類別的同時,逐漸失去辨認舊類別的能力。這個現象被稱為 Catastrophic Forgetting,也就是「災難性遺忘」,是持續學習(Continual Learning)與增量學習(Incremental Learning)長期面對的重要問題。
2026 年 8 月發表於 arXiv 的研究《Quantum Incremental Learning with Mixed State Prototypes》,則提出一個相當不同的方向:如果不完全依賴傳統神經網路的分類方式,而是利用量子態來建立每個類別的「原型」,能不能讓模型在加入新類別時,不需要不斷擴張主要分類器?
這項研究提出 Quantum Incremental Learning with Mixed-State Prototypes 架構,核心概念是讓每一個類別擁有自己的量子混合態原型(Mixed-State Prototype),再透過量子態之間的距離進行分類。
為什麼 AI 會忘記以前學過的東西?
傳統深度學習通常假設訓練資料可以一次取得,而且資料分布相對固定。例如訓練一個 100 類影像分類器時,可以把所有類別一起交給模型學習。
但真實世界往往不是如此。新的商品、新疾病影像、新物種、新工業缺陷或新的使用情境會持續出現,模型因此需要不斷加入新的類別。
問題在於,神經網路的知識並不是一個個獨立存放的檔案,而是共同分散在大量權重之中。當模型為了適應新資料而調整權重時,舊知識使用的參數也可能一起受到影響。
因此,Continual Learning 的核心問題之一,就是如何取得「可塑性」與「穩定性」之間的平衡:模型必須具有足夠的 plasticity 學習新知識,同時又需要 stability 保留舊知識。
把類別變成量子世界中的「原型」
這篇研究採取 Prototype-based Learning 的概念。
如果把傳統分類器想像成替不同類別畫出決策邊界,那麼 prototype 方法更接近替每個類別建立一個代表性的「中心」。新資料進來之後,模型判斷它最接近哪一個 prototype,再決定它屬於哪個類別。
研究團隊進一步把這個概念搬進量子機器學習。
經過量子電路轉換後,一個類別不再只是普通向量,而可以利用 density matrix,也就是密度矩陣描述。每個類別因此能建立自己的量子 prototype。
例如模型已經知道「貓」、「狗」與「汽車」,系統便可以分別建立三個 mixed-state prototypes。未來加入「飛機」類別時,理論上只需要建立新的飛機 prototype,而不是重新設計一個容量更大的量子分類器。
這對量子機器學習特別重要,因為傳統量子分類架構的輸出能力可能受到 qubit 數量、測量方式與 Hilbert space 結構限制。如果每增加類別都必須擴大量子電路,不僅硬體需求提高,也可能增加訓練困難。
為什麼不是 Pure State,而是 Mixed State?
這也是整篇研究最值得注意的地方之一。
如果只使用單一 pure quantum state 表示一個類別,就有點像用一個點代表整群資料。然而同一類別的影像通常存在大量變化,例如不同角度、背景、亮度與物體外觀。
Mixed state 則能描述由多個量子態組成的統計分布,因此更適合表示一個類別內部的變異。
研究利用 density matrix 建立這些 prototype,並控制其 rank K。直覺上可以把 K 想成模型保留多少主要資訊方向:K 太低可能丟失重要特徵,K 太高則可能把雜訊一起保存。
作者因此將這個過程類比為某種與 PCA 相似的降維與去噪機制,透過保留較重要的成分建立更穩定的類別 representation。
新資料進來後,模型怎麼判斷?
分類階段則利用量子態之間的距離。
研究採用 Hilbert-Schmidt distance 比較輸入資料形成的量子 representation 與各類別 mixed-state prototype 之間的差異。
概念可以簡化成:
輸入影像 → 特徵抽取 → 量子 representation → 與所有 prototype 比較距離 → 選擇最接近的類別。
因此模型不必依靠一個固定大小的輸出分類層。當新的類別出現時,可以增加新的 prototype,讓分類系統逐步擴充。
這其實是一套「混合式」量子 AI
不過需要特別注意,這篇研究並不是完全由量子電腦完成影像辨識。
整個架構首先利用 ResNet-18 處理影像,再經過 256 維 MLP,接著進入 8-qubit quantum backbone。模型進一步利用其中的 4-qubit subsystem 建立 density matrix 與 mixed-state prototypes。
初始 representation learning 階段還包含 classical MLP classification head,完成 representation 訓練後才將這個分類 head 移除。
因此,更準確的描述應該是 Hybrid Quantum-Classical Machine Learning,也就是量子與傳統運算混合的機器學習架構,而不是量子電腦完全取代 GPU 或神經網路。
實驗結果如何?
研究團隊在 CIFAR-100 與 TinyImageNet 等影像資料集上測試 incremental learning。
在 CIFAR-100 Split A 實驗中,提出的量子 mixed-state 方法取得約 57.28% Last Accuracy 與 71.78% Average Accuracy。
相比之下,傳統增量學習方法 FeCAM 達到約 68.69% Last Accuracy 與 78.26% Average Accuracy;FeTrIL 約為 64.53% 與 74.17%;PASS 則約為 63.47% 與 72.36%。
換句話說,量子方法已能與部分 incremental-learning baseline 競爭,但仍沒有超越實驗中最強的 classical methods。
TinyImageNet 的差距更加明顯。量子方法取得約 38.38% Last Accuracy 與 53.71% Average Accuracy,而 FeCAM 分別達到約 59.19% 與 66.53%。
因此,這篇論文並不能證明「量子 AI 已經比傳統 AI 更強」。它真正展示的是另一件事情:mixed-state quantum prototypes 確實可以形成一套可運作的 incremental-learning 架構,而且在類別持續增加時,不需要以相同方式持續擴張主要分類器。
另一項潛在優勢:Prototype 儲存成本
作者也特別討論 prototype 的參數複雜度。
傳統 prototype-based incremental learning 通常需要為每個類別保存高維特徵向量或統計資訊,而 mixed-state quantum representation 可以利用有限 qubit subsystem 與低 rank density matrix 表示類別資訊。
因此研究主張,這種設計具有降低 prototype parameter complexity 的潛力。
不過「參數比較少」並不等於「現在跑得比較快」。量子電路模擬本身在傳統電腦上可能非常昂貴,而真正量子硬體又存在噪聲、qubit 數量、量子閘精度與資料編碼等問題。
所以這項優勢目前主要仍是模型表示方式與理論架構上的特性,而不是已經證明的實際運算成本優勢。
最大限制:目前根本沒有真正的量子電腦參與
這是閱讀這篇論文時最重要的限制。
研究實驗使用 NVIDIA RTX 3090 GPU、PyTorch 與 PennyLane 執行,量子電路是在 classical hardware 上進行 simulation。
換句話說,論文證明的是「這套量子機器學習架構在模擬環境中可以運作」,並沒有證明真正量子處理器執行時會比 GPU 更快、更省電或更準確。
目前也無法從這些結果得出 quantum advantage。
而且由於 classical baseline 在 CIFAR-100 與 TinyImageNet 上仍然取得更高準確率,現階段更合理的解讀,是研究人員找到了一種值得繼續探索的 quantum continual-learning representation,而不是量子機器學習已經擊敗傳統深度學習。
為什麼這項研究仍然值得關注?
量子機器學習目前最大的問題之一,就是找到真正適合量子資訊表示方式的應用,而不是單純把傳統神經網路搬進量子電路。
Mixed-State Prototype 的有趣之處,就在於它利用 density matrix、Hilbert space 與 quantum-state distance 等量子資訊本身的數學結構,重新思考 incremental learning。
它提出的問題並不是「量子電腦能不能把 ResNet 跑得更快」,而是:量子態是不是能提供一種不同的知識表示與類別擴張方式?
這可能才是這篇論文真正值得關注的地方。
AI 的災難性遺忘問題距離解決仍然很遠,量子電腦也尚未證明能在這項任務上超越傳統硬體。但這篇研究展示了一條有意思的路線:未來的量子 AI,價值或許不只是『算得更快』,而是用完全不同的方法表示與保存知識。
原始來源
arxiv.org


