d-Matrix 發表 Raptor AI 推論晶片:宣稱頻寬密度達 NVIDIA Rubin 20 倍,挑戰 HBM 架構瓶頸

晶片觀測站2026/08/258 min read
分享

30秒摘要

AI 晶片新創 d-Matrix 公布新一代 Raptor 推論加速器,透過將最多四層 DRAM 直接堆疊於 TSMC N4 邏輯晶片下方,試圖繞過傳統 HBM 的水平資料傳輸與 PHY 功耗限制。公司宣稱,新架構可帶來約 20 倍的單位面積頻寬密度,以及每傳輸 1GB 資料約 13.5 倍的能源效率改善,並鎖定大型語言模型最受記憶體頻寬限制的 Decode 階段。不過目前公開資訊主要仍來自 d-Matrix 的技術簡報與效能宣稱,尚缺乏完整規格、現場展示與第三方獨立測試。

重點摘要

  1. 01d-Matrix 公布 Raptor AI 推論加速器,利用最多四層 DRAM 與 TSMC N4 邏輯晶片進行垂直堆疊。
  2. 02公司宣稱 Raptor 的單位面積記憶體頻寬密度可達 NVIDIA Rubin 等傳統 HBM 架構約 20 倍。
  3. 03透過約 36 微米 Face-to-Face Bonding 縮短資料傳輸距離,d-Matrix 宣稱 I/O 能耗約為 0.37 pJ/bit。
  4. 04Raptor 每卡配置約 32GB 記憶體,主要鎖定大型語言模型推論 Decode,而非 Frontier Model Training。
  5. 05d-Matrix 規劃利用 72 卡等 Rack-Scale 架構擴展容量與總頻寬,官方並宣稱可處理 3T-Class 模型與 1M Context。
  6. 06目前 Raptor 多數效能數據仍屬 d-Matrix 官方宣稱,缺乏完整產品規格、現場展示與獨立第三方 Benchmark 驗證。

AI 推論晶片市場正在出現一條與傳統 GPU 不太相同的技術路線:與其持續增加運算核心,不如直接解決大型語言模型推論期間最難突破的記憶體頻寬瓶頸。

矽谷 AI 晶片新創 d-Matrix 在最新公開的技術資訊中展示了名為 Raptor 的新一代 AI 推論加速器。Raptor 的核心設計,是把 DRAM 直接垂直堆疊在邏輯晶片下方,利用極短距離的垂直互連傳輸資料。d-Matrix 宣稱,這套架構相較 NVIDIA Rubin 等採用 HBM 的傳統高階 AI 加速器,可提供約 20 倍的單位面積記憶體頻寬密度,同時降低資料搬移所需要的能源。

AI 推論真正的瓶頸,往往不是算力

大型語言模型的推論流程通常可以大致分成兩個階段:Prefill 與 Decode。

Prefill 是模型第一次讀入使用者 Prompt、文件或其他上下文內容,並建立相關中間狀態的階段。這部分涉及大量矩陣運算,因此通常能充分利用 GPU、Tensor Core 或其他矩陣運算單元的算力。

Decode 則是在模型開始逐一產生 Token 之後進行。每生成一個新的 Token,處理器都必須重新讀取大量模型權重以及相關的 KV Cache 資料。由於每一步生成的計算量相對有限,但需要頻繁搬動大量資料,因此 Decode 往往變成典型的 Memory Bandwidth Bound 工作負載。

這代表即使晶片本身擁有極高的 FLOPS,如果模型權重無法快速送到運算單元,增加更多算力也不一定能讓 Token 生成速度等比例提高。

這也是近年 AI 推論晶片公司開始集中火力解決記憶體架構的原因。Groq、d-Matrix 等公司都曾嘗試利用大量片上 SRAM 或不同的資料流架構,提高推論階段的資料供應速度。

Raptor 則進一步從晶片封裝本身下手。

把 DRAM 直接放到運算晶片下方

Raptor 的設計概念,可以理解成把傳統位於 GPU 周圍的高速記憶體,改為直接堆疊在邏輯晶片的垂直方向。

類似的垂直堆疊概念已經存在於部分消費級處理器。例如 AMD 第二代 3D V-Cache 技術將 SRAM Cache Die 放置在 CPU Compute Die 下方,藉此改善散熱與堆疊布局。

Raptor 使用的則不是 SRAM,而是最多四層 DRAM。

SRAM 擁有極低延遲與極高頻寬,但單位面積容量昂貴,因此很難塞入數十 GB 甚至更大的模型資料。DRAM 的密度則高得多,因此 d-Matrix 希望利用 3D 堆疊,在容量、頻寬與成本之間取得新的平衡。

根據公開資訊,Raptor 使用約 36 微米的 Face-to-Face Bonding 技術,將基於 TSMC N4 製程的邏輯晶片與 DRAM 直接結合。

傳統 HBM 通常配置在 GPU 或 AI 加速器晶粒旁邊,並透過 Silicon Interposer 連接。資料必須從 HBM 水平方向經過封裝介面送往邏輯晶片,因此需要大量高速 I/O 線路以及專用 PHY 電路。

Raptor 則讓資料直接沿垂直方向穿越只有數十微米距離的互連結構。

從物理角度來看,這個差異非常重要。電路中的資料搬移距離越長,通常就需要越大的驅動能力,也意味著更高的能源消耗。

d-Matrix:資料傳輸能源可降至約 0.37 pJ/bit

d-Matrix 宣稱,透過這種垂直記憶體架構,Raptor 可以將 I/O Energy 降低到約 0.37 pJ/bit。

公司同時提出兩項關鍵比較數據:

第一,Raptor 的 Bandwidth Density,也就是單位晶片面積能提供的記憶體頻寬,最高可達傳統 HBM 架構約 20 倍。

第二,以每傳輸 1GB 資料所消耗的能源計算,d-Matrix 宣稱 Raptor 可以帶來約 13.5 倍改善。

這兩個指標直接對應目前大型 AI 加速器面臨的兩項核心問題:封裝面積以及功耗。

HBM 本身可以提供非常高的頻寬,但 HBM Stack 必須排列在 Compute Die 周圍。隨著每一代 GPU 需要配置更多 HBM,CoWoS 等先進封裝的尺寸、成本與製造難度也跟著提高。

更重要的是,高速記憶體介面的 PHY 並非免費。為了維持極高資料傳輸速率,記憶體介面本身就可能消耗相當可觀的電力。在數百瓦甚至突破千瓦級封裝功耗逐漸成為 AI 加速器設計現實的情況下,資料搬移所需要的每一瓦能源都開始變得重要。

Raptor 的策略因此不是單純讓 DRAM 更快,而是盡可能縮短 DRAM 與運算核心之間的物理距離。

32GB 容量,鎖定推論而不是大型模型訓練

這種設計同時存在明顯取捨。

Raptor 每張卡提供約 32GB 記憶體,遠低於部分新一代 HBM AI GPU 可以提供的數百 GB 記憶體容量。因此它並不是為了取代 NVIDIA、AMD 或其他大型 GPU 進行 Frontier Model Training。

訓練大型模型需要在單一節點內保存龐大的模型參數、Optimizer State、Activation 等資料,因此記憶體容量本身非常重要。

推論的需求則不同。

對 Decode 而言,如何快速把模型參數與 KV Cache 持續送入計算單元,往往比單一卡片擁有最大容量更加重要。因此 d-Matrix 將 Raptor 放在 SRAM 與 HBM 之間的位置:容量高於純 SRAM 架構,同時試圖取得接近 SRAM 等級的資料頻寬。

透過 72 卡系統支援超大型模型

單一卡片只有 32GB 並不代表系統只能執行小型模型。

d-Matrix 的方案是 Scale-Out。

公司提出由多張 Raptor 卡組成的 Rack-Scale Cluster,例如 72 卡系統,透過高速互連 Fabric 把模型參數分散至不同節點。

如果每一顆晶片都能提供極高的本地記憶體頻寬,理論上整個系統的 Aggregate Memory Bandwidth 可以隨節點數量增加,最終進入 PB/s,也就是每秒數 Petabyte 的資料傳輸規模。

這種架構的目標,是讓模型參數分散在大量節點之後,Decode 階段仍然能保持高速資料供應。

對於 Context Window 持續擴大的大型語言模型而言,這尤其重要。當 Context 從數萬 Token 擴張到數十萬甚至數百萬 Token,KV Cache 本身就可能成為龐大的記憶體負擔。

因此 d-Matrix 對 Raptor 的定位,很明顯不是單純追求最高 AI TOPS,而是試圖建立一套以 Memory Bandwidth 為中心的大型推論系統。

宣稱 3T 模型、100 萬 Token Context 可達每使用者約 1,000 tokens/s

目前 Raptor 最吸引注意的仍是 d-Matrix 公布的效能數據。

根據公司簡報,Raptor 被描述為可以在執行約 3T-Class,也就是約兆級參數模型,並搭配 1M、100 萬 Token Context 的情境下,提供每位使用者約 1,000 Tokens per Second 的推論速度。

另外,在 d-Matrix 公開的測試數據中,Raptor 在 32 位並行使用者的情況下執行 GLM 5.2,宣稱可以達到約 2,121 tokens/s/user;執行 Kimi K3 時,則宣稱達到約 785 tokens/s/user。

如果這些數據最終能在實際產品與第三方測試中重現,代表 Raptor 的主要優勢可能不只是總吞吐量,而是高並行環境下仍能維持非常高的單一使用者 Token Generation Rate。

對即時 AI Agent、Coding Agent、Reasoning Model、語音 AI 與其他需要低延遲回應的應用來說,這可能比單純提高整體 Batch Throughput 更具有商業價值。

最大問題:目前仍缺乏第三方驗證

不過,目前對 Raptor 的效能仍需要保持謹慎。

現階段公開資訊主要來自 d-Matrix 自身提供的簡報與技術資料,完整的晶片規格、功耗、實際系統配置、測試條件與成本資訊仍相當有限。

特別是官方所展示的 tokens/s/user 數據,最終效能會受到模型精度、量化方法、Batch Size、Context Length、Speculative Decoding、網路互連以及軟體最佳化程度等大量因素影響。

目前也沒有足夠資訊證明這些結果已經透過獨立第三方 Benchmark 重現,而相關報導亦指出尚未看到完整的 Raptor 現場產品展示。

因此,20 倍 Bandwidth Density、13.5 倍資料傳輸能源效率,以及超過每使用者 1,000 tokens/s 等數字,目前都應視為 d-Matrix 的官方技術宣稱,而不是已經獲得業界普遍驗證的實際產品表現。

不過 d-Matrix 與只存在於簡報中的早期晶片新創仍有所不同。公司過去已經推出並交付 AI 推論相關產品,因此 Raptor 並非完全沒有產品化基礎的概念設計。

AI 晶片競爭正在從 FLOPS 走向資料搬移效率

Raptor 真正值得關注的地方,也許不是它究竟能否真的做到 NVIDIA Rubin 20 倍的某項指標,而是它反映了整個 AI 晶片產業正在發生的架構轉變。

過去十多年,高效能運算競爭往往集中在 FLOPS、Tensor Core 數量、製程節點與晶片面積。

但大型語言模型逐漸讓另一個問題浮上檯面:資料到底能不能及時送到這些運算核心。

當模型規模進入數千億甚至兆級參數、Context Window 邁向百萬 Token,而推論成本成為 AI 服務商最大的營運支出之一時,Memory Bandwidth、Interconnect、Data Movement Energy 與先進封裝的重要性正在快速提升。

HBM 仍然是目前高階 AI GPU 的核心技術,但 d-Matrix Raptor 所代表的是另一種可能性:與其把更多、更快的 HBM 放在晶片旁邊,不如重新思考記憶體與邏輯晶片在三維空間中的位置。

接下來真正決定 Raptor 是否具有競爭力的,將不是簡報上的 20 倍數字,而是實際晶片量產後的功耗、良率、成本、軟體生態、Scale-Out 效率,以及第三方大型模型推論 Benchmark。

如果 d-Matrix 最終能把目前公布的技術指標轉化為可量產、可部署的產品,AI 推論加速器市場的競爭焦點,可能會進一步從「誰擁有最多算力」轉變為「誰能用最低能源把最多資料送到算力旁邊」。

相關公司

相關文章

探索更多 →