《魔物獵人 荒野》的角色怎麼改說英文?SGX 把 AAA 遊戲最麻煩的嘴型在地化變成自動化流程

晶片觀測站2026/10/0710 min read
分享

30秒摘要

《魔物獵人 荒野》以日文作為主要開發語言,但全球版本的大量過場動畫不能只是換掉配音檔案。不同語言的音節、發音時間與嘴型完全不同,意味著角色的臉也必須重新表演。Capcom 因此導入 Speech Graphics 的 SGX,以音訊驅動程序式臉部動畫,自動產生英文版 lip sync,並把原本日文版的眼神與表情演技盡可能保留下來。這個案例揭示 AAA 遊戲在地化正在發生的另一場自動化革命:AI 與程序式動畫不是取代 animator,而是開始吞掉那些規模巨大、重複性高、卻又不能隨便做錯的 production workload。

重點摘要

  1. 01《魔物獵人 荒野》主要以日文進行開發,英文版需要重新建立與英文語音相符的嘴型動畫。
  2. 02SGX 透過音訊驅動程序式 facial animation,大量自動化 localization lip-sync 工作。
  3. 03Capcom 保留原本日文版的視線與眼部演技,再替換與語言高度相關的嘴部動畫。
  4. 04艾路與莫利巴等非人角色同樣能套用 SGX 結果,背後關鍵是統一 controller 與 rig abstraction。
  5. 05Capcom 的「變化に強いリグ」設計讓 Rig 可以持續加入新功能,而不破壞既有 animation。
  6. 06案例顯示 AI 與 procedural technology 對 AAA 遊戲近期最實際的影響,很可能是 production scalability,而不是一鍵生成整款遊戲。

翻譯一句台詞很容易,但讓角色真的「改說英文」完全是另一回事

遊戲在地化最容易被低估的一個問題,是玩家聽到的語音可以直接替換,但角色的臉不能。

假設一段日文台詞已經完成 facial animation,角色嘴巴、下巴、臉頰、視線與表情全部配合日文聲優演出。現在把音軌換成英文,原本的動畫並不會自動成立。

原因很簡單:不同語言並不是把同一句話換成另一組聲音而已,它們的發音結構、音節數量、母音與子音排列,以及每個發音出現的時間全部不同。

CGWORLD 公開的《魔物獵人 荒野》案例就展示了一個非常直觀的例子。

角色 Fabius 在日文版說出「不明」時,嘴型會按照日文發音運動;英文版改成「Unknown」後,相同時間點需要呈現的嘴部形狀已經完全不同。

但有趣的是,角色的視線與眼睛周圍的表情動畫並沒有因此全部重做。

Capcom 採取的策略更接近把臉拆成不同資訊層:

  • 原本日文版建立好的視線與情緒演技盡可能保留
  • 與語言高度相關的嘴部動畫重新產生
  • 再把新的英文 lip sync 整合回既有 facial animation

這正是 SGX 被導入《魔物獵人 荒野》的核心原因。

SGX 到底是什麼?它其實不只是「AI 對嘴」

SGX 是 Speech Graphics 開發的 audio-driven procedural facial animation system,也就是由音訊驅動的程序式臉部動畫系統。

因此,把 SGX 簡化成「生成式 AI 幫角色做嘴型」其實並不準確。

Speech Graphics 對 SGX 的描述,是一套建立在多年語音技術、語言學、AI 與程序式 facial dynamics 研究上的 production system。

基本流程可以理解成:

Voice Audio → Speech Analysis → Procedural Facial Behaviour → Character Rig → Facial Animation

系統分析角色正在說什麼、聲音如何變化,再把結果映射到已經設定完成的角色 facial rig。

SGX 不只處理嘴唇開合。

其系統還可以產生完整臉部情緒、頭部運動、眨眼、眼球快速移動以及呼吸等非語言行為。

換句話說,它處理的問題並不是單純的:

「這個音出現時嘴巴張多大?」

而更接近:

「一個角色說出這段聲音時,臉部應該產生什麼連續的動態行為?」

這也是為什麼 Speech Graphics 將 SGX 稱為 procedural facial animation,而不是單純的 lip-sync generator。

《魔物獵人 荒野》真正遇到的是規模問題

如果遊戲只有十段對話,animator 手工調整英文嘴型並不是什麼世界末日。

但 AAA 遊戲完全不是這個數量級。

《魔物獵人 荒野》包含大量角色、大量劇情演出與大量語音。一旦每段 cutscene 都需要另一套英文 facial animation,工作量會隨語言版本迅速膨脹。

傳統流程可能需要 animator 逐段查看語音或錄音影像,再手動調整角色嘴型。

這種方法品質可以非常高,但有一個致命問題:人力成本幾乎會跟台詞數量一起成長。

100 段台詞可以人工處理。

1,000 段開始昂貴。

當內容進入大型 AAA production 的規模後,問題就不再只是動畫技術,而是 production scalability。

SGX 的價值正在這裡出現。

它不是讓 animator 消失,而是把大量可以系統化處理的第一輪工作交給機器,讓 animator 把時間留給真正需要演技判斷與藝術調整的鏡頭。

連艾路與莫利巴都能使用同一套系統

這次案例另一個很有意思的地方,是 SGX 並不只處理標準人類角色。

Capcom 表示,包括艾路與莫利巴等具有台詞的獸人角色,英文 lip sync 同樣套用了 SGX 的分析結果。

這件事背後其實牽涉非常重要的 rig architecture。

艾路的 facial rig 基本上以人類 rig 為基礎,因此仍能表現類似人類語音所需要的發音動作;結構差異更大的莫利巴,也透過人類 rig 作為中介,將 SGX 的結果轉換到角色身上。

Capcom 同時統一了 controller configuration,因此不同角色不需要為 SGX 重新建立完全不同的工作方式。

這揭露了一個比 AI 模型本身更重要的 production 原則:

自動化工具真正能不能大規模使用,往往取決於資料、rig 與 controller 是否標準化。

工具再聰明,如果每個角色都是完全不同的 facial rig、自訂 controller、不同命名與不同 deformation logic,自動化流程最後仍然會被大量人工 mapping 吃掉。

所以這次真正值得注意的,不只是 SGX 本身,而是 Capcom 為了讓它工作所建立的 rig consistency。

「變化に強いリグ」:真正漂亮的是 Rig 設計

Capcom 在《魔物獵人 荒野》中採用了很有意思的概念:能夠承受變更的 Rig。

大型遊戲開發最大的麻煩之一,是 production 不會乖乖按照教科書順序進行。

角色動畫正在製作時,rig 可能還在修改;新的 facial behaviour 可能加入;工具需求可能改變;後期甚至還會加入新的 localization pipeline。

如果每修改一次 rig,舊動畫全部壞掉,那 production 很快就會變成災難現場。

因此 Capcom 在加入 SGX 所需的新 facial behaviour 時,必須確保先前已完成的 animation 不會因此遭到破壞。

這種設計思想本質上非常接近軟體工程中的 backward compatibility。

舊 animation 是既有資料。

新的 facial controller 是新功能。

新的 rig 必須能讀懂舊資料,同時支援新的 animation behaviour。

這也是為什麼 SGX 的導入並不是下載軟體、按一顆 Generate 就結束。

Capcom 先把基準 facial rig 提供給 Speech Graphics,由對方確認 SGX 所需要但目前缺少的 facial behaviour,再由 Capcom 補上相關 rig 功能,之後重新交給 Speech Graphics 完成設定。

Speech Graphics 表示,其角色端 setup 通常約需要兩週;《魔物獵人 荒野》整體初期 setup 則花費約一個半月至兩個月。

真正昂貴的是前期建立接口。

一旦接口穩定,大量內容才能開始高速通過。

為什麼不是直接重新做整張臉?

因為嘴型與演技並不是同一件事。

假設角色原本在日文版本中皺眉、看向另一名角色、稍微低頭,這些動作代表的是劇情意圖,而不是日文本身。

如果只是因為換成英文,就把整套 facial animation 全部重新生成,很可能反而破壞導演原本確認過的演出。

因此比較合理的 production philosophy 是:

Language-dependent animation → 重算

Performance-dependent animation → 儘量保留

嘴唇、下巴與部分口腔附近的運動高度依賴語音,因此需要跟著英文重新產生。

眼神、情緒、視線方向與部分表情則屬於角色演出,可以沿用原本已經被導演與 animator 調整完成的結果。

這種 layer-based workflow 其實比「AI 幫我重新生成整張臉」成熟很多。

因為它沒有把自動化當成替代藝術決策的工具,而是把 production 中最適合機械化的部分切出去。

這才可能是 AI 進入 CG production 最現實的方式

生成式 AI 討論經常集中在一個極端問題:

AI 會不會取代 artist?

但《魔物獵人 荒野》的 SGX 案例展示了另一條更務實的路。

大型 CG production 裡其實存在大量工作,它們需要專業知識,但同時具有高度重複性。

Localization lip sync 就是典型例子。

角色演技可能早已完成,導演也已經確認鏡頭,現在只是因為英文、中文或其他語言的發音不同,需要重新建立大量嘴部動畫。

這些工作當然可以全部由人完成。

問題只是:真的有必要讓大量 animator 把時間花在數千次相似的 phoneme timing 調整上嗎?

如果程序式系統能先產生品質穩定的第一版,人類 animator 就可以把時間集中到 hero shots、特寫鏡頭、特殊角色以及自動化結果失敗的 edge cases。

這比較像 CG production 過去數十年一直在做的事情。

我們早就不會手工逐根模擬頭髮、不會逐粒移動煙霧,也不會人工擺放森林裡的每一片葉子。

Facial animation 現在也開始出現類似的 proceduralization。

真正改變 AAA 遊戲的,可能不是「AI 生成遊戲」

市場很喜歡想像未來 AI 輸入一句 prompt 就能生成整款遊戲。

但至少在現階段,更具體的改變可能沒有那麼戲劇化。

它發生在 production pipeline 裡。

一段原本需要 animator 重複處理的工作變成 batch processing。

一套只能服務人類角色的工具,因為 rig abstraction 開始支援獸人角色。

一個英文 localization team 不再需要從零重建每一段 facial animation,而是建立在原本日文演出的成果上繼續工作。

這些改變單獨看都不像革命。

但當 AAA 遊戲包含數萬甚至更多 production assets 時,每一個小幅自動化都可能在整個專案中被放大。

真正重要的問題因此可能不是:

AI 能不能做動畫?

而是:

CG pipeline 裡還有多少工作,本質上其實可以被轉化成 procedural system?

《魔物獵人 荒野》使用 SGX 的案例,正好提供了一個非常實際的答案。

AI 與程序式動畫沒有突然坐上導演椅。

它們先走進了 production pipeline,接手那些數量龐大、重複、昂貴,但又必須保持品質一致的工作。

而這可能才是未來幾年遊戲開發真正變化最快的地方。

Tech English|本文技術名詞

Lip Sync|嘴型同步
讓角色嘴唇、下巴與口腔附近的動畫與實際語音發音時間一致。不同語言具有不同音節與發音結構,因此同一角色切換語言後通常需要重新處理。

Facial Rig|臉部綁定系統
控制 3D 角色臉部表情與變形的 rig。可以包含骨骼、Blend Shape、控制器與其他 deformation system,是 facial animation 與自動化工具之間的重要接口。

Procedural Animation|程序式動畫
不是由 animator 手工設定每一個動作,而是根據規則、輸入資料或模擬結果自動產生動畫。SGX 的 audio-driven facial animation 就屬於這類方法。

Phoneme|音素
語音系統中的基本聲音單位。Lip-sync 系統需要理解語音中的發音變化,再將其轉換成適合角色嘴部的動作。

Viseme|視覺音素/口型單位
不同 phoneme 在視覺上可能呈現相似嘴型,因此 facial animation 系統通常會把聲音映射成一組可見的嘴部形狀,而不是單純一個聲音對應一個 Blend Shape。

Rig-Agnostic|不依賴特定 Rig 架構
工具不是只能支援某一套固定角色骨架,而是透過角色設定與映射層適配不同 rig。這種設計對大型遊戲中大量角色的 production scalability 特別重要。

Core takeaway

《魔物獵人 荒野》使用 SGX 的真正價值不是「AI 自動做動畫」,而是把多語言版本中大量重複的 lip-sync 工作程序化,同時保留 animator 已完成的角色演技。

Why it matters

AAA 遊戲全球同步發售後,Localization 已經從翻譯問題變成動畫、錄音、Rig 與資料管線的規模化問題。SGX 案例顯示,未來 AI 與程序式工具最可能先大量改變的不是創意決策,而是 production pipeline 中那些重複、昂貴又需要品質一致性的工作。

Data story

03

1.5~2 個月

《魔物獵人 荒野》SGX 初期整合時間

CGWORLDCapcom 訪談中提到的初始 setup 所需時間。

約 2 週

Speech Graphics 角色 Setup 參考時間

CGWORLD / Speech Graphics為 Speech Graphics 端角色設定的一般參考值,不代表所有角色或專案皆固定需要兩週。

1,180 萬套

CGWORLD 報導所列《魔物獵人 荒野》全球銷量

CGWORLD為 CGWORLD 2026 年 9 月 30 日文章刊載時引用的全球銷售數字。

Tech index

09
01SGX
02Speech Graphics
03Procedural Facial Animation
04Audio-Driven Animation
05Lip Sync
06Facial Rig
07Phoneme
08Viseme
09Batch Processing

限制與注意

05
  1. 01SGX 應描述為 audio-driven procedural facial animation system,不宜直接等同於一般文字或影像生成式 AI。
  2. 02Speech Graphics 為 SGX 供應商,因此產品能力與案例描述中包含廠商自身說法。
  3. 03CGWORLD 公開訪談沒有提供《魔物獵人 荒野》總台詞數、總 cutscene 數量或節省的精確人時,因此本文不自行推算具體節省百分比。
  4. 04自動產生 lip sync 並不代表所有 facial animation 都完全不需要 animator 修正,特殊鏡頭、角色與演技需求仍可能需要人工調整。
  5. 05CGWORLD 訪談主要詳細說明英文版製作流程;Speech Graphics 的案例頁則描述 SGX 在多語言版本中的使用,兩者討論範圍並不完全相同。

資料來源

03
01

CGWORLD:《魔物獵人 荒野》全球展開與 SGX 自動語音動畫系統案例

primary interview / industry media

02

Speech Graphics:SGX Documentation

official documentation

03

Speech Graphics:Monster Hunter Wilds Client Project

vendor case study

相關公司

Capcom

Capcom

Speech Graphics

Speech Graphics

相關文章

探索更多 →