中國 DFSX 挑戰 NVIDIA AI 架構!14nm DF2000 靠 960TB/s 記憶體頻寬叫板 GB200 NVL72

晶片觀測站2026/08/035 min read
分享

30秒摘要

中國 AI 晶片新創 Dongfang Suanxin(DFSX)提出不同於 NVIDIA 的發展路線,主張 AI 效能瓶頸並非先進製程,而是記憶體頻寬(Memory Bandwidth)。即將於 2026 年第四季推出的 DF2000 採用成熟的 14nm 製程,透過全新的 3D 近記憶體運算架構與 3.5D Infinity Chiplet 設計,在 TY64 SuperNode 配置下可提供高達 960TB/s 的總記憶體頻寬,超越 NVIDIA GB200 NVL72 的 576TB/s,希望藉此降低 AI 運算中的 Memory Wall 問題。

重點摘要

  1. 01DF2000 採用成熟 14nm 製程,預計 2026 年第四季推出。
  2. 02DF2000 導入 3.5D Infinity Chiplet 與 3D Near-Memory Compute 架構。
  3. 03TY64 SuperNode 可提供高達 960TB/s 記憶體頻寬,高於 GB200 NVL72 的 576TB/s。
  4. 04DF2000 TY64 SuperNode BF16 算力為 64 PFLOPS,GB200 NVL72 為 360 PFLOPS。
  5. 05DFSX 認為 AI 真正瓶頸是 Memory Wall,而非製程微縮。
  6. 06下一代 DF3000 預計可達 1,280TB/s 系統記憶體頻寬。

中國 AI 晶片公司 Dongfang Suanxin(DFSX)近日公布其最新 AI 運算架構規劃,提出與 NVIDIA 完全不同的技術路線。DFSX 認為,限制大型 AI 模型效能的關鍵並非持續追求更先進的製程,而是如何突破記憶體頻寬瓶頸(Memory Wall),讓 GPU 或 AI 加速器能持續取得資料,而不是長時間等待記憶體傳輸。

DFSX 現有的 DF1000 晶片採用成熟的 14nm 製程製造,但導入獨特的 3D Near-Memory Compute(近記憶體運算)架構。不同於傳統 GPU 將運算核心與記憶體分離配置,DF1000 將 DRAM 直接堆疊於運算層上方,並利用 3D Wafer-Level Hybrid Bonding 技術直接連接上下兩層銅導線,完全省去傳統封裝中的 Microbumps 與導線。這種設計可建立大量垂直資料通道,大幅縮短資料移動距離,提高資料傳輸效率。

即將於 2026 年第四季推出的 DF2000,則在 DF1000 架構基礎上進一步升級。DFSX 不再只是堆疊單一記憶體層,而是採用名為 3.5D Infinity Chiplet Layout 的新架構,將多組運算與記憶體塔(Compute-Memory Towers)排列於同一基底上,同時搭配客製化的 3D DRAM 結構,使更多暫存資料能直接儲存在晶片內部,降低資料搬移成本。

DFSX 認為,目前大型語言模型與生成式 AI 的主要瓶頸並不是 GPU 算力不足,而是 GPU 經常因等待資料從記憶體傳輸而處於閒置狀態。因此,相較於持續追求更高 FLOPS,提升記憶體吞吐量才是未來 AI 基礎設施更重要的方向。

根據 DFSX 公布的規格,每顆 DF2000 可提供 15TB/s 的記憶體頻寬,若組成 TY64 SuperNode,整體頻寬可達 960TB/s,高於 NVIDIA GB200 NVL72 的 576TB/s,約提升 67%。

然而,在純運算能力方面,兩者仍存在明顯差距。DF2000 所組成的 TY64 SuperNode 可提供約 64 PFLOPS 的 BF16 算力,而 NVIDIA 採用 4nm 製程打造的 GB200 NVL72 則可達 360 PFLOPS,約為 DFSX 的 5.6 倍。DFSX 認為,高記憶體頻寬將有機會彌補部分算力落差,使整體 AI 工作負載維持較高效率。

DFSX 也透露下一代 DF3000 已在規劃中,每顆晶片預計可提供 20TB/s 的記憶體頻寬,若同樣組成 TY64 SuperNode,整體頻寬將提升至 1,280TB/s。作為對照,NVIDIA 下一代 Vera Rubin NVL72 系統預計可提供約 1,580TB/s 的總記憶體頻寬,僅比 DF3000 TY64 SuperNode 高約 23%。

整體而言,DFSX 正試圖建立一套不同於 NVIDIA 的 AI 晶片設計哲學,不以最先進製程為核心競爭力,而是透過近記憶體運算、3D Hybrid Bonding、3.5D Chiplet 與超高記憶體頻寬,改善 AI 系統在大型模型訓練與推論時的資料傳輸效率。未來這條技術路線是否能在實際 AI 工作負載中證明其優勢,仍有待 DF2000 正式上市後進一步驗證。

相關公司

Dongfang Suanxin

Dongfang Suanxin

NVIDIA

NVDANASDAQ· 半導體

相關文章

探索更多 →