AI 挑戰《黑暗靈魂》Boss 結果被打爆:研究揭露強化學習距離真正「會玩遊戲」還有多遠
30秒摘要
研究團隊打造 Dark Souls Learning Environment(DSLE),將《Dark Souls: Remastered》全部 22 場 Boss 戰轉化為可供 AI Agent 訓練與評估的標準化環境。然而實驗結果相當殘酷:PPO、DQN、神經演化方法與規則式系統在五個代表性 Boss 中,除了教學 Boss Asylum Demon 外,其餘全部無法取得勝利。研究顯示,即使現代 AI 已能在許多遊戲與模擬環境中展現驚人能力,面對真正商業遊戲中的即時控制、視覺理解、稀疏獎勵、多目標戰鬥與長期規劃時,仍存在巨大的能力落差。
重點摘要
- 01研究團隊推出 Dark Souls Learning Environment(DSLE),將《Dark Souls: Remastered》全部 22 場 Boss 戰轉化為 Gymnasium-style AI Benchmark。
- 02DSLE 並非簡化模擬器,而是透過 Docker、Wine、DXVK、X11 與程序記憶體讀取,直接控制真正運行中的商業遊戲。
- 03PPO 與 DQN 主要從遊戲畫面進行決策,訓練時的視覺輸入被縮放至 84×84 灰階影像,並從 14 種玩家操作中選擇動作。
- 04DSLE-5 涵蓋 Asylum Demon、Capra Demon、Quelaag、Ornstein and Smough 與 Gwyn,分別測試基礎近戰、狹窄空間、環境危險、多目標與高速戰鬥。
- 05除了教學 Boss Asylum Demon 外,Random、Expert System、PPO、DQN 與 SCOPE 在其餘四個 DSLE-5 Boss 上全部取得 0 勝。
- 06簡單規則式 Expert System 對 Asylum Demon 達到 63% 勝率,反而大幅高於 PPO 與 DQN 不到 0.4% 的表現。
- 07PPO 與 DQN 在 100,000 steps 預算內沒有呈現可測量的學習趨勢,凸顯真實遊戲中的稀疏獎勵與 sample efficiency 問題。
- 08Capra Demon 與 Gwyn 的 Agent 中位存活時間僅約 7 至 19 秒;Quelaag 則可存活 52 至 68 秒,卻仍幾乎無法造成傷害,證明活得久不等於真正取得進展。
- 09即使改用所有屬性 Level 50 的優勢角色,SCOPE 仍只能突破少數早期 Boss,大多數 22 場 Boss 依然無法取勝。
- 10每個 DSLE action 都是真正在遊戲中執行,單次 PPO 訓練約需 9 至 21 小時,DQN 約需 12 至 41 小時,使樣本效率成為核心挑戰。
當 AI 已經能下贏圍棋冠軍、在《StarCraft II》達到頂尖玩家水準,甚至學習複雜的多人競技遊戲後,一個看似單純的問題開始變得有趣:如果把 AI 直接丟進《黑暗靈魂》,它真的知道該怎麼戰鬥嗎?
答案至少目前看來是:還差得非常遠。
來自 Connecticut College Autonomous Agent Learning Lab 的研究團隊提出 Dark Souls Learning Environment(DSLE),試圖將 FromSoftware 的《Dark Souls: Remastered》變成一套正式的 AI Agent 測試環境。研究最大的特色並不是另外製作一個簡化版模擬器,而是讓 AI 直接操作真正運行中的商業遊戲,並把遊戲內全部 22 場 Boss 戰轉化為可以重複訓練、比較與評估的 AI Benchmark。
把《黑暗靈魂》變成 AI 實驗室
遊戲長期以來一直是人工智慧研究的重要測試場。從早期西洋棋、跳棋,到後來的 Atari、圍棋、《StarCraft II》、《Minecraft》與 NetHack,不同遊戲分別測試 AI 的策略規劃、視覺辨識、探索能力與長期決策。
但許多 AI 遊戲環境都有一個共同特點:它們通常提供專門設計的程式介面,讓研究人員可以快速取得遊戲狀態、重置環境,甚至用遠高於真人遊玩的速度大量產生訓練資料。
《Dark Souls: Remastered》並不是為 AI 研究設計的遊戲。
DSLE 因此必須在真正的遊戲外面建立一整套控制與自動化架構。研究團隊讓 Windows 版《Dark Souls: Remastered》透過 Wine 運行於 Ubuntu Docker container,使用虛擬 X11 顯示環境與 DXVK 進行 GPU 加速,並透過鍵盤與滑鼠事件注入控制角色。
換句話說,從遊戲本身的角度來看,AI 做的事情和真人玩家非常接近:按下移動、攻擊、翻滾與治療等操作,再根據下一個遊戲畫面決定下一步。
為了讓實驗可以自動進行,DSLE 還建立了 Boss 專用存檔、自動讀檔、選單操作、進入 Boss 場地與死亡後重置機制。研究人員不需要每次看到 AI 顯示「YOU DIED」後,再手動幫它重新進入 Boss 房。
AI 主要真的靠「看畫面」戰鬥
DSLE 採用類似 Gymnasium 的標準化介面。每一次環境步驟,AI 接收新的 observation、reward、終止狀態與診斷資訊,再選擇下一個 action。
預設視覺輸入是一張 600×800 的灰階遊戲畫面,其中包含玩家角色、Boss、場景、動畫狀態、攝影機視角與遊戲 HUD。PPO 與 DQN 實驗則會進一步將畫面縮小至 84×84,再送進卷積神經網路。
值得注意的是,研究團隊雖然透過直接讀取遊戲程序記憶體取得玩家 HP、Boss HP、死亡次數、Boss 是否死亡與鎖定狀態等資訊,但這些資料主要用於計算 reward、判定 episode 是否結束以及實驗紀錄。PPO 與 DQN 的 policy 並不直接取得這些結構化遊戲數據,而是從視覺畫面進行決策。
AI 可以選擇的動作共有 14 種,包括前後左右移動、輕攻擊、重攻擊、治療、後跳、四方向翻滾,以及兩種滑鼠操作。每個選定動作預設維持 250 毫秒,因此 Agent 大約每秒做出 4 次決策。
這使 DSLE 成為真正的 real-time control 問題,而不是可以暫停遊戲、慢慢計算下一步的回合制任務。
為什麼偏偏是《黑暗靈魂》?
《黑暗靈魂》Boss 戰真正適合 AI Benchmark 的原因,不只是遊戲很難,而是不同 Boss 的「難」完全不同。
研究團隊將 22 場 Boss 戰依照需要的能力分類,包括近距離戰鬥、空間定位、多目標管理、階段轉換、遠距離攻擊、環境危險、感知、特殊目標以及技能轉移等。
例如 Asylum Demon 是遊戲最早期的教學 Boss,攻擊速度較慢、動作提示明顯,主要考驗基本移動與近戰反應。
Capra Demon 則完全不同。玩家必須在極度狹窄的場地,同時面對 Boss 與兩隻快速逼近的狗,因此 Agent 不只需要攻擊,還必須處理位置、敵人選擇與多目標壓力。
Chaos Witch Quelaag 會在地面留下持續存在的岩漿,使安全活動區域逐漸受到限制;Ornstein and Smough 則是經典雙 Boss 戰,擊敗其中一名 Boss 後,另一名還會恢復並強化,要求 Agent 理解目標優先順序與戰鬥階段。
更極端的是 Bed of Chaos。這場戰鬥甚至不能單純依靠輸出傷害取勝,玩家必須破壞場景中的特殊目標,同時面對逐漸崩塌、可以立即致死的地板。Seath the Scaleless 則存在特殊的無敵機制,玩家必須先找到並破壞另一個目標,才能正常對 Boss 造成傷害。
因此從 AI 研究角度來看,《黑暗靈魂》的 Boss 並不是單純從「血比較少」一路排列到「血比較多」,而是一套天然存在的多任務控制測試集。
DSLE-5:先派 AI 挑戰五隻代表性 Boss
由於完整測試 22 場 Boss 的運算成本相當高,研究團隊首先建立名為 DSLE-5 的代表性測試集。
五場戰鬥分別為 Asylum Demon、Capra Demon、Chaos Witch Quelaag、Ornstein and Smough,以及最終 Boss Gwyn, Lord of Cinder。
這五場戰鬥分別代表教學級近戰、狹窄空間、多重環境危險、多人目標戰鬥以及高速高壓近戰。
研究團隊則派出五類 Agent:完全隨機選擇動作的 Random Policy、人工撰寫規則的 Expert System、兩種經典強化學習演算法 PPO 與 DQN,以及使用 CMA-ES 進行最佳化的神經演化方法 SCOPE。
其中所謂 Expert System 其實並不是什麼《黑暗靈魂》高手 AI。它只是一個非常簡單的反應式策略:玩家生命低於一定比例時進行治療,其他時間主要向前移動並攻擊。
它存在的目的,是測試最基本的人工戰鬥先驗知識,究竟能夠把 Agent 帶到什麼程度。
結果:除了新手 Boss,AI 幾乎全軍覆沒
實驗結果非常直接。
Random Policy 在五隻 Boss 都沒有取得任何勝利。
Expert System 在 Asylum Demon 的 100 場測試中取得 63 勝,勝率達 63%;但是遇到剩下四隻 Boss 後,勝場全部歸零。
PPO 在 Asylum Demon 的 1,971 個 episode 中只取得 5 勝;DQN 在 2,469 個 episode 中取得 8 勝。換算下來,兩者勝率甚至不到 0.4%。
SCOPE 的表現明顯較好,在五次訓練試驗累計 5,000 個 episode 中擊敗 Asylum Demon 1,065 次,整體約 21%,最佳 generation 的勝率則可以達到 43%。
然而當戰場換成 Capra Demon、Quelaag、Ornstein and Smough 或 Gwyn 時,結果再次全部歸零。
數千次 Boss 戰之後,五種方法沒有任何一個能在這四場較困難的 DSLE-5 戰鬥取得一次勝利。
最有趣的反差之一,是那個只會在低血量時治療、其他時間往前移動與攻擊的簡單 Expert System,在 Asylum Demon 上反而大幅超越 PPO 與 DQN。
這並不代表強化學習本身沒有價值,而是凸顯現有方法面對真實遊戲環境時嚴重的 sample efficiency 與 exploration 問題。
PPO 與 DQN 甚至沒有明顯「越打越好」
研究結果更值得注意的地方,在於 PPO 與 DQN 並不是單純『最後沒打贏』。
在研究提供的 learning curve 中,兩種方法的平均 episode reward 在完整 100,000 environment steps 訓練期間,大致停留在接近死亡懲罰的區域,沒有呈現明確向上改善趨勢。作者因此將結果描述為在給定預算內沒有 measurable learning。
這與《黑暗靈魂》的 reward 結構有直接關係。
研究者給予 Agent 的 reward 包含 Boss 受到的傷害、玩家受到的傷害、每一步的小幅懲罰,以及勝利 +100、死亡 -10 的終局訊號。
問題在於,一個完全不懂《黑暗靈魂》的 Agent,最初很難有效接近 Boss、判斷攻擊距離、抓到攻擊空檔,再正確閃避反擊。因此大量 episode 最終得到的資訊都非常相似:造成少量甚至零傷害,接著死亡。
當大量嘗試得到近似的失敗結果時,演算法很難判斷究竟哪些行為真正讓自己更接近成功。這就是稀疏獎勵與困難探索問題在真實遊戲中的具體展現。
Capra Demon:AI 甚至沒有時間學習
不同 Boss 還產生了完全不同的失敗模式。
研究團隊分析 Agent 的存活時間後發現,在 Capra Demon 與 Gwyn 戰鬥中,各方法的中位存活時間大約只有 7 至 19 秒。
尤其 Capra Demon 的戰場極度狹窄,又有兩隻快速敵人立即向玩家逼近。簡單 Expert System 面對 Capra Demon 時,平均甚至只能削掉約 7 點 Boss HP,而 Boss 總生命值為 771。
也就是不到 1%。
對強化學習而言,這種環境尤其棘手:Agent 還來不及進行多少探索就死亡,每次死亡之後還必須重新讀取存檔、操作選單並再次進入 Boss 戰。
活得久,也不代表 AI 學會玩了
Quelaag 則呈現完全相反的失敗模式。
Agent 在這場戰鬥的中位存活時間約為 52 至 68 秒,是 DSLE-5 中存活時間最長的一組,但仍然幾乎沒有造成有效傷害。
原因是 Boss 接近速度較慢,Agent 可以在場地中活動相當長時間,最後才被岩漿或遠距離攻擊擊殺。
這也揭露 AI Benchmark 中一個容易被忽略的問題:Survival Time 並不等於 Progress。
一個 Agent 即使可以逃跑一分鐘,如果始終沒有理解如何攻擊 Boss,就不能被視為真正學會戰鬥。因此研究團隊除了 Win Rate,也同時分析存活時間與造成的 Boss 傷害,以區分『活得比較久』和『真的更接近勝利』。
如果直接給 AI 一個超強角色呢?
研究團隊之後進行了一項更寬鬆的探索性測試。
原本 DSLE-5 使用的是低等級起始角色,而在完整 22 Boss 實驗中,研究人員改用所有屬性皆為 Level 50 的優勢存檔,讓 Agent 擁有更高生命、耐力與武器傷害,再讓 SCOPE 挑戰全部 Boss。
這一次終於有部分戰鬥被突破。
SCOPE 在這個較有利的設定下,對 Capra Demon 的勝率達 96%,Taurus Demon 達 88%,Pinwheel 為 16%,Bell Gargoyles 為 8%。
但即使角色數值被大幅強化,22 場 Boss 中仍有大多數沒有被擊敗。
這個結果很重要,因為它顯示問題並不只是『AI 操作的角色太弱』。
提高 HP 與傷害可以解決部分早期 Boss,但遇到要求特殊目標、多階段規劃、環境理解或不同戰鬥機制的 Boss,單純增加角色數值仍不足以解決問題。
真正昂貴的地方:每一次訓練都是真正在玩遊戲
DSLE 最大特色同時也是最大的限制。
在許多專為 AI 建立的模擬器中,研究人員可以用遠高於即時速度大量執行 environment steps。但 DSLE 的每個 action 都真的要送進正在運行的《Dark Souls: Remastered》。
預設每個動作持續 250 毫秒,因此 100,000 environment steps 光是理論上的遊戲執行時間就接近 7 小時,而且這還沒有計算死亡後重新載入存檔、操作選單與再次進入 Boss 房的時間。
研究中單次 PPO run 實際需要約 9 至 21 小時,DQN 則約 12 至 41 小時。Capra Demon 因為 Agent 經常快速死亡、導致系統不斷重置遊戲,反而成為特別昂貴的場景之一。
DSLE 因此採取平行化而不是單一 instance 加速。研究團隊的實驗通常每台機器同時運行五個遊戲 instance,並表示曾在配備 NVIDIA RTX 5090 32GB VRAM 與 128GB RAM 的系統上,同時運行最多 30 個 instance。此時全部 instance 合計約使用 10GB VRAM 與約 80GB 系統記憶體,顯示大規模運行時真正容易形成瓶頸的反而是 RAM。
這也是 DSLE 與高速模擬器最大的取捨:它犧牲訓練 throughput,換取在真正商業遊戲環境中進行實驗的真實性。
下一代 AI 可能不能只靠『死幾萬次』
這項研究並沒有證明 PPO 或 DQN 永遠不可能學會《黑暗靈魂》。作者明確指出,100,000 steps 是基於實際運算成本所設定的固定實驗預算,結果只能說明這些方法在目前測試條件與預算內的能力,而不能代表它們在無限訓練下的最終極限。
但研究結果確實指向一個更大的問題:如果每一次 interaction 都如此昂貴,依靠數百萬甚至數億次嘗試暴力累積經驗,可能不是實際可行的道路。
因此作者提出多個未來研究方向,包括更完整的 reward shaping、具有時間記憶能力的 recurrent 或 transformer policy、model-based learning、world model、從真人或 scripted demonstration 進行 imitation learning,以及 curriculum learning。
《黑暗靈魂》本身尤其適合 curriculum 與 transfer learning。例如 Asylum Demon 與後續部分 Demon 類 Boss 共享某些戰鬥特徵,研究人員可以先讓 Agent 學習較簡單的 Boss,再測試它是否能把已經學到的閃避、距離控制與攻擊時機轉移到更困難的敵人。
這將提出一個比『AI 能不能殺死某隻 Boss』更有意思的問題:AI 究竟是在記住一場戰鬥,還是真的學會了可以泛化的戰鬥技能?
從打贏人類,到理解遊戲世界
過去十多年,遊戲 AI 最吸睛的故事往往是『AI 又在哪款遊戲擊敗人類』。但 DSLE 提供了一個完全相反、也可能更值得研究的視角。
現代 AI 在高度結構化或能大量產生訓練資料的環境中已經可以展現驚人的能力,但當問題變成真正商業遊戲中的即時視覺感知、低延遲控制、空間理解、多目標管理、環境危險與長期任務規劃時,能力落差迅速浮現。
《Dark Souls: Remastered》的 Boss 戰因此不只是娛樂性的『AI 受苦測試』。
DSLE 真正有價值的地方,是把 22 場原本為人類玩家設計的 Boss 戰,轉化成一套具備不同難度與能力需求的標準化 Agent Benchmark。
而目前第一輪答案相當明確:對今天這些基準方法而言,Asylum Demon 或許已經可以突破,但離真正理解《黑暗靈魂》的戰鬥世界,還有很長一段路要走。
原始來源
arxiv.org相關公司
FromSoftware


