重點摘要: 彭博情報預測,AI 推論市場將於 2032 年達到 1.3 兆美元,為訓練市場的兩倍,並將重塑晶片競爭格局。
重點摘要: 彭博情報預測,AI 推論市場將於 2032 年達到 1.3 兆美元,為訓練市場的兩倍,並將重塑晶片競爭格局。

AI 推論是 AI 基礎設施市場中成長最快速的領域,據彭博情報預測,該市場將於 2032 年達到 1.3 兆美元——為訓練市場的兩倍——輝達、Cerebras 與 AMD 正競相爭取市占率。
根據該研究機構的預測,彭博情報預計推論市場規模將於 2032 年達到訓練市場的兩倍,上看 1.3 兆美元。這項預測已促使晶片製造商重新圍繞記憶體存取與延遲問題進行工程設計,而非僅專注於原始運算能力。
輝達(NVDA)作為訓練市場龍頭,市值達 5.3 兆美元,收購了 Groq 及其語言處理單元(LPU),這些單元將靜態隨機存取記憶體(SRAM)直接嵌入晶片。其系統將 GPU 用於預填充階段——即讀取提示詞——搭配 LPU 負責解碼階段,也就是模型回答查詢的過程。Cerebras(CBRS)估值達 660 億美元,其晶圓級晶片的運算速度比 LPU 快五至六倍,不過需要特殊的散熱系統,且僅以 CS-3 系統整套銷售。AMD(AMD)市值達 7,740 億美元,採用小晶片(chiplet)設計,將 GPU 與更多高頻寬記憶體(HBM)整合,以降低延遲。
此一市場之所以關鍵,在於推論是 AI 模型生成回應的環節——也是部署過程中最耗費運算資源與成本的部分。輝達目前本益比為 34.3 倍(以過去獲利計算),具備規模優勢;Cerebras 則以速度見長;AMD 則透過其 Helios 機架級系統,以及近期收購的記憶體優化公司 MEXT 與晶片新創 Taalas,提供成本效率優勢。
輝達的 LPU 押注瞄準解碼瓶頸
輝達將 Groq 的 LPU 納入產品線,目的在於解決推論的解碼階段——即大型語言模型(LLM)逐字元組裝答案的過程。由於 SRAM 位於晶片之上,LPU 可避開傳統 GPU 受制於外部記憶體存取的較慢路徑。其結果是一套完整的系統:輝達的 GPU 負責讀取提示詞,LPU 負責生成回應,在最能被用戶感知的環節降低了延遲。
此策略使輝達在市場從訓練轉向推論之際,持續穩居 AI 基礎設施的核心地位。其資料中心部門在會計年度第一季創造了 752 億美元營收,較去年同期成長 92%,公司並預期會計年度第二季總營收約達 910 億美元,年增幅達 95%。輝達同時正籌備其 Vera Rubin 系統,該公司表示,相較於 Blackwell 平台,此系統可將推論的 token 成本降低 90%。
AMD 與 Cerebras 聯手削減推論成本
Cerebras 已與 OpenAI 及亞馬遜 AWS 簽署合作協議,但其晶圓級引擎定價高昂,且需要特殊的散熱與電源管理。與 AMD 的新合作關係中,AMD 的 Helios 機架級解決方案負責以更低的成本處理預填充階段,Cerebras 的晶圓級引擎(Wafer-Scale Engine)則負責更快的解碼階段,此組合直指輝達的整合系統。
AMD 也從其他角度切入推論市場。其收購 MEXT 的目標在於解決記憶體瓶頸,方法是將罕見存取的資料從 DRAM 卸載至未使用的快閃記憶體,再利用預測性 AI 在應用程式提出請求前將其取回——從而減少對昂貴 DRAM 的需求。收購 Taalas 則帶來了將 AI 模型直接硬體化於矽晶片上的技術,對特定模型而言更快且更便宜,但靈活性較低。AMD 計劃以 GPU 負責預填充,搭配 Taalas 晶片處理解碼。
對投資人而言,這三種策略承擔不同的風險特性。輝達目前的交易本益比為過去獲利的 34.3 倍,低於其十年平均的 61.6 倍,若推論需求加速成長,估值仍有上升空間。Cerebras 市值 660 億美元,是純度最高的速度型標的,但隨著規模擴大超越利基應用,也承擔執行風險。AMD 市值達 7,740 億美元,產品組合最為廣泛,但必須證明其推論技術堆疊足以縮小與輝達整合系統之間的差距。
本文僅供資訊參考,不構成投資建議。