AI 晶片

Google 傳攜手 AMD 開發第 10 代 TPU:AI 晶片可能走向「CPU+加速器」封裝整合

晶片觀測站2026/08/167 min read
分享

30秒摘要

市場消息指出,Google 可能與 AMD 合作開發第 10 代 TPU 家族中的新型 AI ASIC。相較於傳統以張量運算為核心的 TPU,新設計可能進一步把通用 CPU 核心整合至同一封裝,以因應強化學習、推理模型與 AI Agent 工作負載日益增加的 CPU 運算需求。若消息屬實,這不僅可能成為 AMD 首次大規模參與客製化 AI ASIC 專案,也反映 AI 基礎設施的設計重心正從單純追求加速器算力,逐步轉向 CPU、AI 加速器、HBM 與先進封裝的系統級整合。

重點摘要

  1. 01SemiAnalysis 市場消息指出,Google 可能與 AMD 合作開發第 10 代 TPU 家族中的新型晶片,但目前尚未獲官方證實。
  2. 02AMD 的價值可能不在傳統 TPU 設計,而是 CPU IP、Chiplet、互連與先進封裝技術。
  3. 03Reasoning、強化學習與 AI Agent 工作負載增加,使 AI 系統對通用 CPU 運算能力的需求逐步提高。
  4. 04Google TPU 8i 系統已提高 CPU 與 TPU 的配置比例,顯示 AI 基礎設施可能朝更 CPU-heavy 的方向發展。
  5. 05AMD Instinct MI300A 已具備將 x86 CPU、加速器與 HBM 整合於同一封裝的實際經驗。
  6. 06若混合式 TPU 成真,AI 晶片競爭可能從單純比較加速器算力,進一步轉向 CPU、加速器、記憶體與封裝的系統級整合。

根據 SemiAnalysis 客戶報告引述的市場消息,Google 據傳正與 AMD 合作開發第 10 代 TPU(Tensor Processing Unit)家族中的其中一款晶片。雖然目前合作內容、產品規格與分工方式都尚未獲得 Google 或 AMD 正式確認,但這項消息之所以受到關注,在於 Google 本身已經累積多代 TPU 設計經驗,因此若仍選擇引入 AMD,合作重點可能並不是單純協助設計另一顆傳統 AI 加速器,而是取得 AMD 在 CPU IP、Chiplet、先進封裝與異質整合方面的能力。

Google 至今已經發展多代自研 TPU,並長期與 Broadcom 合作進行客製化晶片設計與實作。因此,若第 10 代 TPU 只是延續既有架構,Google 並沒有明顯理由需要 AMD 介入。SemiAnalysis 因此推測,AMD 最具吸引力的資產可能來自 CPU 核心、先進封裝技術、互連架構,甚至其他可程式化運算 IP,而其中「把 CPU 核心直接帶進 TPU 封裝」被認為是最值得注意的可能方向。

這背後反映的是 AI 工作負載正在發生變化。過去大型語言模型訓練的核心瓶頸大多集中在矩陣乘法、張量運算與高頻寬記憶體,因此 GPU、TPU 等加速器扮演絕對主角;CPU 的主要工作則偏向資料準備、排程、系統管理與控制邏輯。然而,隨著推理模型、強化學習以及 Agentic AI 快速發展,AI 系統執行過程中需要處理的非張量工作愈來愈多,例如環境模擬、工具呼叫、分支判斷、資料驗證、狀態管理、獎勵計算與大量控制流程,這些工作未必適合全部交給 TPU 或 GPU 執行。

尤其在 Reinforcement Learning(強化學習)工作負載中,加速器可能負責神經網路的前向與反向運算,但整個訓練流程往往還必須依賴 CPU 執行環境模擬、資料整理、策略更新、任務協調與各種控制邏輯。當 AI Agent 同時開始呼叫搜尋、程式執行、資料庫或其他外部工具後,整個運算鏈條也會變得更加異質化。這代表未來 AI 伺服器的瓶頸不一定只是『加速器數量不夠』,CPU 與系統級資料交換效率同樣可能成為限制因素。

事實上,Google 最新 TPU 系統的配置已經透露出類似趨勢。文章指出,針對推論、Reasoning 與 RL 工作負載設計的 TPU 8i 系統,CPU 配置已提升至每兩顆 TPU 搭配一顆 Google Axion CPU;相比之下,第 7 代 TPU 伺服器曾採用一顆 Intel Xeon Emerald Rapids 處理器搭配四顆 TPU。這代表 CPU 與 AI 加速器之間的比例正在提高,而在部分工作負載中,甚至可能需要接近一顆 CPU 對一顆加速器的配置。

如果這個方向延續下去,下一步便可能是直接把通用 CPU 運算資源整合進 TPU 封裝。這種架構可以縮短 CPU、AI 加速器與 HBM 之間的資料傳輸距離,減少傳統主機板、PCIe 或其他外部連結帶來的延遲與功耗,同時提高不同運算單元之間共享資料的效率。AI 晶片也因此可能從過去相對單一的『大型矩陣運算引擎』,逐漸演變成包含通用運算、張量運算、高頻寬記憶體與高速互連的完整異質運算平台。

AMD 在這方面具有一項相當特殊的經驗,就是 Instinct MI300A。MI300A 並不是傳統意義上將 CPU 與 GPU 分別安裝在系統上的產品,而是在單一先進封裝中整合 x86 CPU Chiplet、GPU 加速器與 HBM 記憶體。這類架構讓 AMD 累積了高階 CPU、加速器、Chiplet、記憶體與封裝共同設計的經驗,也因此成為 Google 如果真的希望開發混合式 TPU 時,相當合理的合作對象。

SemiAnalysis 也特別提到 AMD 在 Advanced Packaging 與 SoIC 等領域的能力可能具有吸引力。對下一代 AI 加速器而言,效能競爭已經不再只取決於單一晶粒的製程與核心數量,而是逐步進入『封裝就是系統』的階段。CPU Chiplet、TPU Compute Die、HBM、I/O Die 與高速互連如何放進同一個封裝,資料要如何在不同運算單元之間移動,往往直接決定整個系統的功耗、延遲與有效算力。

因此,一種可能的假想架構,是由 Google 繼續負責 TPU 計算架構與核心 AI IP,再搭配 AMD 提供部分 CPU、互連或封裝技術,最後把 TPU Compute Chiplet、CPU Chiplet 與 HBM 整合成高度緊密的 AI 運算封裝。不過目前並沒有證據證明實際產品一定採用這種配置,也無法確認 AMD 是否會直接參與實體晶片設計、提供 IP,或僅參與封裝與系統整合。

這項合作若成真,對 AMD 的意義同樣不小。AMD 雖然已經透過 EPYC、Instinct 與 MI300 系列深入資料中心與 AI 市場,也具備完整客製化晶片團隊,但大型客製化 AI ASIC 並不是其目前最主要的業務。如果能進入 Google TPU 生態系,代表 AMD 的角色可能從銷售標準化 CPU 與 GPU,進一步延伸至為大型雲端服務商提供 CPU IP、Chiplet、互連與封裝技術。

這也可能改變市場觀察 AMD 與 Broadcom 等 ASIC 廠商的方式。Broadcom 長期在大型 Hyperscaler 客製化 AI 加速器領域占有重要位置,而 AMD 若能透過 CPU 與異質封裝能力切入,競爭方式未必是直接取代既有 ASIC 設計商,而可能是成為下一代 AI 晶片中的另一層技術供應者。

更值得注意的是,這項傳聞折射出 AI 基礎設施下一階段的競爭方向。第一波生成式 AI 基礎設施主要競爭誰擁有更多 GPU、更多 HBM 與更高的矩陣運算能力;下一階段,隨著 Reasoning、RL 與 AI Agent 擴大,運算負載可能變得更加碎片化與異質化。真正高效率的平台,可能不再是一顆極度強大的 AI 加速器,而是一個能讓 CPU、AI Accelerator、HBM 與高速互連彼此緊密協作的運算系統。

因此,這項傳聞真正值得觀察的地方,並不是『AMD 是否幫 Google 做了一顆 TPU』這麼簡單,而是 Google 是否正在重新定義 TPU 本身。如果第 10 代 TPU 家族真的出現 CPU-heavy、針對強化學習與 Agentic AI 設計的異質運算版本,那將意味著下一代 AI 晶片架構可能逐漸從 accelerator-centric 轉向 system-centric,CPU 也可能重新成為 AI 資料中心中比市場原先預期更重要的一塊拼圖。

不過,目前相關資訊仍屬市場傳聞與分析推測,Google、AMD 的實際合作內容、第 10 代 TPU 架構以及是否真的整合 AMD CPU 核心,都尚未獲得正式確認。在更多產品資訊或官方資料公布之前,仍應避免把假設性的混合式 TPU 架構視為已確定產品規格。

【Tech English|科技英文專有名詞】

  1. Custom AI ASIC|客製化 AI 專用積體電路:ASIC 是 Application-Specific Integrated Circuit 的縮寫,指為特定用途打造的晶片。Google TPU 就屬於 AI ASIC,相較通用 GPU,可以針對特定 AI 工作負載最佳化功耗與效能。

  2. On-package CPU Cores|封裝內 CPU 核心:指 CPU 與 AI 加速器不再只是放在同一台伺服器中,而是直接整合進相同封裝,使兩者可以透過更短、更高速的連線交換資料,降低延遲與功耗。

  3. Reinforcement Learning, RL|強化學習:AI 透過與環境互動、取得獎勵或懲罰來學習策略的方法。相較單純的大模型預訓練,RL 經常需要更多環境模擬、控制流程與 CPU 運算資源。

  4. Chiplet|小晶粒/晶粒模組:把原本單一大型晶片拆成多個功能不同的小型晶粒,再透過先進封裝整合。例如 CPU、AI 加速器與 I/O 都可以使用不同 Chiplet 組合,提高設計彈性與良率。

  5. Advanced Packaging|先進封裝:利用 2.5D、3D 堆疊、晶粒互連等技術,把 CPU、GPU、AI 加速器與 HBM 高密度整合。現代 AI 晶片的效能愈來愈取決於封裝與記憶體架構,而不只是晶片製程本身。

  6. Heterogeneous Computing|異質運算:讓不同類型的處理器共同處理最適合自己的工作,例如 CPU 執行控制邏輯、TPU 執行張量運算、HBM 提供高頻寬資料存取。下一代 AI 系統正快速朝這種架構發展。

相關公司