技術

AMD收購Taalas:將AI模型權重刻入晶片,推理速度比英偉達快48倍

Susan Hill

AMD正在收購Taalas,這是一家多倫多新創公司,其打造的晶片將AI模型權重永久嵌入矽晶,而非在推論期間從記憶體載入。該公司的HC1晶片在Meta的Llama 3.1 8B上每秒產生16,960個token——AMD宣稱此數字比Nvidia的GPU快48倍,也比推論晶片專家Cerebras快8.5倍。

Taalas背後的技術,利用了當前AI推論運作中的結構性無效率。標準GPU具備彈性:能執行任何模型,隨時切換任務,並在模型更新時重新編程。但這份彈性也正是瓶頸。每次推論請求,都得將數十億個模型權重從高頻寬記憶體載入運算單元,所產生的延遲,並非擴充更多GPU就能消除。

Taalas在製造時便將那些權重直接嵌入晶片的矽晶之中。模型活在硬體裡,而非存在每次請求都得提取的記憶體。AMD對外宣傳的吞吐量數字,正反映了這項架構選擇——但代價也毫不避諱:一旦晶片在製造時燒錄特定模型,若要更新,就得重新進行矽晶流片(tape-out)。Taalas表示,模型更新僅需更動兩層金屬層,這縮短了循環週期,但這些晶片無法即時調整至更新的模型版本。

在AMD的整合規劃中,Taalas晶片將負責token生成——推論中最耗時的階段——而AMD的Instinct GPU則負責每個請求起始時的prefill與注意力計算。整套系統運行於AMD的Helios機架級平台。對執行固定模型工作負載的雲端營運商——客服機器人、文件處理管線、即時翻譯——其承諾是每機架瓦特的吞吐量,這是同等成本下,彈性GPU叢集無法比擬的。

這套盤算是否經得起業界模型更新速度的考驗,是核心問題。各大實驗室如今約每六個月就會更新其生產模型。今天鎖定Llama 3.1 8B的晶片,可能在後繼版本成為標準部署目標時就得退役。Taalas宣稱的兩層金屬層更新有幫助,但一次矽晶流片仍須耗時數個月——當模型換代比硬體循環更快,這便是可觀的落差。

這項收購,距離Nvidia以據報200億美元收購Groq相隔七個月——Groq對同一推論速度問題,採取的是不同途徑。Groq的tensor streaming處理器同樣以吞吐量為最佳化目標,但保留載入不同模型的能力。AMD則為一家做出相反賭注的新創公司,付出未揭露、但想必較少的金額。

對買家而言,Taalas收購案屬於藍圖而非目錄。目標為高達200億參數模型的HC2晶片仍在開發中。48倍基準僅適用於特定條件下的HC1——真實世界的部署若混合流量、批次大小不一,將產生不同結果。這筆交易預期在2026年第四季完成,尚待監管審查。HC1已於2月以6奈米製程出貨;HC2的出貨日期與目標製程節點則未獲證實。

標籤: , , , ,

討論

共有 0 則留言。