技術

OpenAI Jalapeño晶片的推理效率比Nvidia Blackwell高1.9倍(每瓦特)

Adrian Kessler

OpenAI 打造了自家的晶片。該公司在 8 月 25 日的 Hot Chips 會議上發表了 Jalapeño,這款與博通(Broadcom)合作開發的矽晶設計,能以每千瓦每秒 85,448 個 token 的速度處理推論請求。目前市場標竿 Nvidia 的 Blackwell 架構,在同一指標下僅達到 44,960。兩者比值為 1.9 倍。

這項指標之所以重要,是因為推論正是 AI 系統在實際運作時的模式。訓練只做一次;但推論則發生在每次有人向 ChatGPT 發送查詢、使用 API,或是與任何執行語言模型的應用程式互動時。大規模推論的成本,是 AI 服務經濟效益的主要驅動力。一款能將推論能耗大致減半的晶片,若廣泛部署,將改變執行模型的每次查詢成本。

在回應延遲為限制因素的互動式工作負載上,Jalapeño 的優勢更為突出。SemiAnalysis 針對 Hot Chips 發表內容的報告指出,在這些基準測試中,Jalapeño 比 Blackwell 表現好 2.1 至 4.1 倍。此範圍反映了不同任務類型的差異;較低的數值是較為保守的比較基準。

這款晶片僅處理推論。它不執行訓練工作負載,也就是那些產出 Jalapeño 設計用來運作之模型的過程。那些任務仍需要 Nvidia 硬體。博通是依據與 OpenAI 的客製設計協議製造這款晶片,而非將其作為商業產品銷售。這樣的安排讓 OpenAI 擁有專屬的推論層,而無需在通用晶片市場上競爭。

OpenAI 的部署時間表有限。計劃在 2026 年底前進行小規模推出;更廣泛的部署則目標在 2027 年。該晶片仍處於工程樣品階段,這意味著量產版本尚未大規模出貨。在 Hot Chips 上公布的基準數據代表的是設計目標,而非已驗證的量產成果。從會議宣布到客製矽晶實際部署營運的差距,通常需要數年時間。

這項宣布符合大型 AI 公司朝向客製化矽晶發展的廣泛趨勢。Google 旗下的張量處理單元(Tensor Processing Unit)已在生產環境中運作超過十年。Amazon 在 AWS 中運行 Trainium 與 Inferentia。Meta 也在內部運作自家的推論晶片。OpenAI 的加入證實,在擁有數億活躍用戶的規模下,完全依賴外部 GPU 供應商的經濟效益已變得困難,足以讓客製化晶片設計計畫的成本顯得合理。

標籤: , , , , ,

討論

共有 0 則留言。