AMD 收購 AI 推論晶片新創 Taalas,將 AI 模型直接「燒錄進矽晶片」,瞄準新一代高效推論市場
30秒摘要
AMD 宣布已簽署最終協議收購 AI 晶片新創 Taalas。這項收購發生在 AMD 與 Cerebras 合作推出 Helios AI 系統僅數週後,顯示 AMD 正積極布局 AI 推論(Inference)市場。Taalas 的核心技術並非提升 GPU 算力,而是將 AI 模型直接固化於晶片電路中,藉此大幅降低記憶體存取延遲,突破長期困擾 AI 推論的 Memory Wall(記憶體瓶頸)。
重點摘要
- 01AMD 正式宣布收購 AI 推論晶片新創 Taalas。
- 02Taalas 將 AI 模型直接固化於晶片電路,而非儲存在外部記憶體。
- 03核心目標是突破 AI 推論最大的 Memory Wall(記憶體瓶頸)。
- 04HC1 晶片採用預先計算架構,官方展示可達每位使用者約 16,000 至 17,000 Tokens/s。
- 05每顆晶片僅支援設計時對應的 AI 模型,無法自由切換模型。
- 06技術概念與 Groq 類似,但實作方式不同。
- 07此次收購將與 Cerebras Wafer-Scale Engine、Helios AI 系統形成互補,強化 AMD AI 推論布局。
AMD 正持續加速 AI 推論市場布局。繼日前宣布與 Cerebras 合作,將 Wafer-Scale Engine(WSE)整合至下一代 Helios 機櫃級 AI 系統後,如今再宣布收購 AI 晶片新創 Taalas,希望透過全新的推論架構,進一步提升 AI 推論效率。
根據 AMD 公布的消息,公司已正式簽署協議收購 Taalas。雖然交易金額並未公開,但此次收購被視為 AMD 在 AI Inference 市場的重要一步。
將 AI 模型直接變成晶片的一部分
與目前主流 GPU 不同,Taalas 並非依靠更大的 GPU 或更快的 HBM 記憶體,而是採用完全不同的設計理念。
傳統 AI 推論流程中,GPU 必須持續從外部記憶體讀取模型權重(Weights),再進行矩陣運算,因此大量時間耗費在資料搬移,而非真正計算,這也是所謂的「Memory Wall(記憶體瓶頸)」。
Taalas 則選擇直接將 AI 模型權重固化(Hardwire)到晶片電路之中,使模型本身成為晶片的一部分。
換句話說,模型權重不再儲存在外部 SRAM、HBM 或 DRAM,而是在晶片製造時,就透過金屬遮罩(Mask ROM)將每個權重永久寫入電晶體連接路徑。
因此,晶片運作時不需要再等待載入模型,也不需要頻繁讀取外部記憶體,資料幾乎可直接在硬體中完成流動。
一顆電晶體同時完成儲存與運算路徑
Taalas 表示,其專有數位架構能讓單一電晶體同時儲存 4-bit 資料並參與數學運算流程。
HC1 晶片內部會預先計算量化模型所有可能的 16 種乘積結果(Pre-compute)。
真正運作時,每個電晶體並非重新執行乘法,而只是像一個高速交換器(Router),直接選擇正確的預計算結果,再送往加法器完成後續推論。
由於數學結果早已存在晶片內,因此幾乎消除了模型讀取造成的等待時間。
官方展示每位使用者可達 16,000~17,000 Tokens/s
根據 Taalas 公開介紹,HC1 在此架構下,可達到每位使用者約 16,000 至 17,000 Tokens/s 的推論速度。
不過,這種設計也有明顯限制。
由於 AI 模型已經直接寫入晶片,因此每顆晶片只能執行當初設計時所對應的模型,若模型更新或更換,就需要重新製造新的晶片,而不像 GPU 可以自由切換不同模型。
類似 Groq,但實作方式不同
報導指出,Taalas 的概念與 Groq LPU 有些相似。
Groq 同樣希望降低記憶體存取延遲,不過其做法是將模型權重固定存放於 SRAM 中,而 Taalas 更進一步,直接把模型權重變成晶片實體電路的一部分,使記憶體與運算幾乎融為一體。
與 Cerebras Helios 形成互補
此次收購也與 AMD 近期 AI 戰略高度一致。
AMD 幾週前才宣布將 Cerebras Wafer-Scale Engine 納入 Helios AI 系統。WSE 將數十萬個運算核心與大量 SRAM 整合於單一超大型晶片中,大幅降低跨晶片與跨網路傳輸延遲。
如今再加入 Taalas 的固定模型推論技術,代表 AMD 正同步布局大型 AI 訓練平台與極致高效率 AI 推論架構,希望在 NVIDIA 主導的 AI 市場中建立更多差異化競爭優勢。
原始來源
wccftech.com

