Cerebras Systems 週二發表 CS-4 機架級 AI 加速器,宣稱推理速度最高比 GPU 系統快 30 倍,效能為前代產品兩倍。
Cerebras Systems 週二發表 CS-4 機架級 AI 加速器,宣稱推理速度最高比 GPU 系統快 30 倍,效能為前代產品兩倍。

Cerebras Systems 週二正式發表 CS-4 AI 加速器,宣稱推理速度比 GPU 解決方案快 30 倍,運算能力達 750 PFLOPs,直接挑戰 Nvidia 在 AI 推理市場的龍頭地位。
Cerebras 技術長暨共同創辦人 Sean Lie 表示:「快 30 倍不只是讓回應感覺更流暢。它讓智慧體(agentic)系統在相同的實際時間內,擁有超過一個數量級的空間進行推理、驗證或工具調用。」
機架級 CS-4 將三顆 WSE-3 Turbo 晶圓——每顆內含四兆個電晶體、900,000 個 AI 優化核心,覆蓋 46,225 平方毫米矽晶面積——與每秒 129.6 PB 的記憶體頻寬及每秒 7.2 Tb 的 I/O 頻寬相結合。在 GPT-OSS-120B 模型上,該系統每個使用者每秒可產生超過 4,400 個 token,比 GPU 解決方案快 30 倍,並可支援超過 50 兆個參數的模型。
此次發表恰逢 Cerebras 公布第二季核心營收為 2.099 億美元(年增 103%)、剩餘履約義務達 254 億美元的一週之後。CBRS 股價過去一個月在 169 至 265 美元之間波動,財報後賣壓使其收在接近 219 美元,UBS、Morgan Stanley 及 Needham 均維持看多評等。
WSE-3 Turbo 每晶圓運算能力倍增
與 WSE-3 相比,WSE-3 Turbo 將每顆晶圓的 AI 運算能力提升至 250 PFLOPs(倍增),記憶體頻寬提升至每秒 43.2 PB。晶片內織構(on-chip fabric)頻寬升至每秒 53.5 PB,而 I/O 延遲從五微秒降至最低兩微秒。CS-4 的每瓦吞吐量也比 CS-3 高出 10 倍,此指標直接影響資料中心的營運成本。
全新的 Nexus 平台架構將運算、電源與 I/O 拆分為模組化元件。電源轉換距離從傳統 GPU 電路板上距離處理器約 50 毫米,縮短至約 0.5 毫米,降低電路板層級功耗損失並實現更高的工作頻率。可插拔的「背包式」設計將電源轉換、液冷與控制電子元件整合為一體化單元,部署時間從數天縮短至數小時。
與 AMD Helios 搭配目標 5 倍效率提升
CS-4 的可程式化 I/O 子系統支援基於 Ethernet 的標準 RoCE v2 RDMA,可與異質系統整合。這實現了去聚合推理架構:專用 prefill 引擎處理提示後,再交由 Cerebras 進行超低延遲的解碼。Cerebras 已與 AMD 就此架構展開合作,將 AMD 的 Helios Rackscale 解決方案與 WSE 搭配,每瓦每秒可產生的 token 數量比純 Cerebras 配置高出 5 倍。AWS Trainium 也被列為合作夥伴。
SemiAnalysis 創辦人暨執行長 Dylan Patel 表示,CS-4 在可部署性與網路能力上的提升,使其能擴展至更大規模的模型,打造「大規模 token 工廠」。
投資人影響
Cerebras 的競爭地位取決於其宣稱的效能能否在獨立基準測試中得到驗證。該公司未揭露 30 倍比較所採用的具體 GPU 配置,僅表示「實際吞吐量會因模型架構、上下文長度、精度及服務配置而異」。若此效能優勢獲得證實,可能改變目前部署 Nvidia H100 與 B200 加速器的超大規模資料中心營運商的採購決策。
公司 254 億美元的剩餘履約義務,以 OpenAI 逾 100 億美元、750 兆瓦推理容量的合約為核心,提供至 2028 年的合約收入能見度。首批 CS-4 將於本季出貨,公司預估 2026 全年核心營收為 8.8 億至 8.9 億美元,並預期 2027 年核心營收成長三倍。
CBRS 目前的本益比約為過去銷售額的 50 倍,若 2027 年財測達成,將壓縮至約 16 倍。11 月 9 日執行長 Feldman 與技術長 Lie 持股的鎖定期屆滿,構成投資人須密切關注的供應面壓力。
本文僅供資訊參考,不構成投資建議。