重點摘要: NVIDIA 首次公布的 Vera Rubin NVL72 晶片內基準測試顯示,在真實代理編碼工作負載上,其每百萬瓦吞吐量較 GB300 NVL72 提升 30 倍。
重點摘要: NVIDIA 首次公布的 Vera Rubin NVL72 晶片內基準測試顯示,在真實代理編碼工作負載上,其每百萬瓦吞吐量較 GB300 NVL72 提升 30 倍。

NVIDIA 的 Vera Rubin NVL72 在真實代理編碼工作負載上,每百萬瓦吞吐量較 GB300 NVL72 高出最多 30 倍,此為在 Hot Chips 2026 大會上公布的首次晶片內基準測試結果。
「推論是 AI 的增長引擎,」NVIDIA 創辦人暨執行長黃仁勳表示。「Vera Rubin 透過針對代理式 AI 時代設計的工作負載優化 AI 工廠配置,擴展了這一願景。」
這些基準測試在 SemiAnalysis 的 AgentX 工作負載上執行,採用 DeepSeek-V4-Pro(1.6 兆參數),重現了生產型編碼代理的會話過程,其中包括累積上下文、調用工具和生成子代理——根據 OpenRouter 的數據,這種模式消耗的 token 數量比一般聊天高出最多 15 倍。GB300 NVL72 本身在相同工作負載下,每百萬瓦吞吐量較 H200 NVL8 高出最多 15 倍,而在更大的混合專家模型(如 Kimi K3 2.8T)上則可高出最多 80 倍。這些增益來自系統層面的優化:MoE 服務運行時(SGLang、TensorRT-LLM、vLLM)、基於 DeepGEMM 的內核、混合精度格式(MXFP4、MXFP8),以及 NVIDIA Dynamo 具備 KV 快取感知路由的會話感知服務堆疊。
這些結果重新定義了 AI 基礎設施的經濟學。在電力與資料中心容量成為 AI 擴張關鍵限制因素的背景下,每百萬瓦吞吐量——而非原始峰值算力——正成為決定 AI 工廠獲利能力的關鍵指標。NVIDIA 同時宣布 Groq 3 LPX 推論加速器全面量產,該晶片在 Gemma 4 31B 模型、10 萬 token 上下文的條件下,每秒可達 3,400 個 token 的輸出速度;並揭露 SpaceXAI 正部署 Vera CPU 用於吉瓦級規模的運算,包括軌道 AI 的規劃。
Groq 3 LPX 採用 NVIDIA 於 2025 年 12 月以約 200 億美元收購自 Groq 的技術打造,是一款專用的互動式推論加速器,旨在與 Vera Rubin NVL72 互補。每個 2U 液冷托盤搭載十六顆 Groq 3 LPU,配備 500MB 的晶片上 SRAM、一顆主機 CPU,以及 BlueField-4 DPU 或 ConnectX-9 NIC。機架級部署最多可整合 256 顆 LP30 加速器。
在 Artificial Analysis 針對 Gemma 4 31B 模型、配備 10 萬 token 上下文視窗所進行的基準測試中,Groq 3 LPX 達到每秒 3,400 個輸出 token——這是該模型有史以來錄得的最快成績,比最接近的其他平台快約 4 倍。對於對延遲敏感的代理編碼而言,生成 5,000 個 token 的耗時從約 50 秒大幅縮短至 1.5 秒。NVIDIA 的架構進行了分工:Rubin GPU 負責大規模上下文處理與預填充,而 LPX 則加速對延遲敏感的解碼階段。
這項比較值得深入審視。Cerebras 的 CS-3 加速器在相同的 Gemma 4 31B 測試中,僅使用一至兩顆晶片即可達到每秒 882 個 token,而 NVIDIA 需要至少 64 顆 Groq 3 LPU。Cerebras 上週也發布了基於 WSE-3T 晶圓級引擎的 CS-4 加速器,其運算與記憶體頻寬均為前代的兩倍。
Nebius 是首家部署 Groq 3 LPX 的 AI 雲端合作夥伴,將其整合至 Nebius Token Factory 生產級推論服務中。「生成是推論中決定 AI 系統實際回應速度的階段,」Nebius 技術長 Danila Shtan 表示。推論服務供應商 Groq 預計將成為最早期的採用者之一。
NVIDIA 同時揭露其 Vera CPU——配備 LPDDR5X 記憶體、提供 1.2TB/s 頻寬的 88 顆客製化 Olympus 核心——已進入全面量產。該晶片專為代理在 GPU 推論呼叫之間產生的大量 CPU 密集工作而設計:工具執行、Python 程式碼、上下文檢索與資料處理。NVIDIA 聲稱 Vera 在代理式 AI、強化學習與資料處理任務上的執行速度比 x86 CPU 快最多 1.8 倍。
SpaceXAI 已開始擴大 Vera CPU 的部署規模,並正在 Vera Rubin 平台上建置一座吉瓦級規模的運算工廠。該公司計劃在其第一代 Starmind AI 衛星中部署優化版的 Vera Rubin NVL72,大規模部署目標定於 2028 年。
NVIDIA 的這些公告顯示,AI 基礎設施的競爭戰場正從訓練效能轉向 token 生成效率、能源消耗與每單位有效輸出的成本。AMD 與 Cerebras 正積極布局低延遲推論市場,而 NVIDIA 與 Cerebras 之間的基準測試比較也因晶片數量差異而受到關注。NVIDIA 將於本週三公布財報,屆時 AI 推論需求與 Groq 商業化進展,預計將與 Blackwell 及 Vera Rubin 的訂單動能一同成為市場關注的焦點。
本文僅供參考,不構成投資建議。