重點摘要:
- DeepSeek 旗艦模型 V4 Pro 於 8 月 12 日告別預覽版本,其智能體基準測試成績將與 Anthropic 的 Claude Fable 5 之間的差距縮小至個位數百分比——而成本僅約為後者的 46 分之 1。
重點摘要:

DeepSeek 旗艦模型 V4 Pro 於 8 月 12 日告別預覽版本,其智能體基準測試成績將與 Anthropic 的 Claude Fable 5 之間的差距縮小至個位數百分比——而成本僅約為後者的 46 分之 1。
DeepSeek 旗艦模型 V4 Pro 於 8 月 12 日告別預覽階段,其智能體基準測試平均得分落後 Anthropic 的 Claude Fable 5 約 5.3%,但在混合輸入輸出計價下,成本卻低約 46 倍。
「這填補了推論成本上的差距,」Hugging Face 執行長 Clement Delangue 表示,並引用每任務成本數據——Claude Fable 5 每任務約需 31 美元,而 DeepSeek 僅需 0.04 美元。
0813 版建置透過 deepseek-v4-pro 端點提供服務,無需變更程式碼,維持預覽版定價:每百萬輸入 token 0.435 美元、每百萬輸出 token 0.87 美元,支援一百萬 token 的上下文視窗,輸出上限為 384,000 token。在 DeepSeek 自家的智能體測試套件中,正式版在 DeepSWE 的得分從預覽版的 12.8 躍升至 62.7,在 DSBench-Hard 上則從 31.1 攀升至 67.2。
此次發布對定價高昂的競爭對手構成壓力——Claude Fable 5 每百萬輸入 token 定價 10 美元、每百萬輸出 token 定價 50 美元——同時也改變了企業在頂尖效能與每任務成本之間權衡取捨的採購邏輯。
DeepSeek 公布的數據顯示,正式版在 Terminal Bench 2.1 上拿下 87.9 分,領先 Claude Opus 4.8 的 85.0 分,僅以些微差距落後 Moonshot 的 Kimi K3(88.3 分)。在網路安全攻防測試套件 CyberGym 上,V4 Pro 獲得 83.3 分,略勝 Fable 5 的 83.1 分。在 Humanity's Last Exam 啟用工具的情況下,V4 Pro 達到 60.0 分,而 Fable 5 為 63.0 分。
成績的提升主要集中在長時程智能體任務上。DeepSeek 內部軟體工程基準測試 DeepSWE 從預覽版的 12.8 飆升近五倍至 62.7。DSBench-FullStack 從 41.8 攀升至 71.1,AutomationBench 則從 12.8 升至 31.8。
上述數據均由供應商自行報告。DeepSeek 未揭露這些測試所使用的基礎設施,十項基準中有兩項——DSBench-FullStack 與 DSBench-Hard——為內部測試集,並無外部排行榜可供對照。Hugging Face 模型卡仍將 V4 系列標示為預覽版本,0813 版權重亦尚未公開。獨立驗證仍有待完成。第三方評分則較為保守:OpenRouter 引用 Artificial Analysis 的 Composite Intelligence Index,將 V4 Pro 評為 45.3 分,認為其「優於 70% 的模型」。
價格差異是本篇報導的核心焦點。Claude Fable 5 每百萬輸入 token 收費 10 美元、每百萬輸出 token 收費 50 美元,混合費率接近 30 美元。DeepSeek 的混合費率約為 0.65 美元——低約 46 倍。以每項基準任務計價,Artificial Analysis 估算 V4-Flash 每任務約 3 美分,而 Claude Fable 5 則為 3.15 美元。
OpenRouter 數據顯示快取命中率達 86%,將使用者實際支付的加權輸入價格推低至每百萬 token 0.064 美元。這款 1.6 兆參數的混合專家(MoE)模型每次啟用 490 億個參數,DeepSeek 的壓縮稀疏注意力(Compressed Sparse Attention)與重度壓縮注意力(Heavily Compressed Attention)技術,在百萬 token 設定下,將單一 token 的推論運算量降至 V3.2 世代的 27%,KV 快取則降至 10%。
低價策略可能無法持續。DeepSeek 在其定價頁面發布公告,計畫「大幅調漲」整體 API 價格,V4 Pro 於北京時間 9:00-12:00 及 14:00-18:00 的尖峰時段,每百萬未快取輸入價格將倍增至 6 元人民幣、每百萬輸出價格為 12 元人民幣。該公司同時承諾,在 Ascend 950 超級節點於下半年大規模部署後,將調降價格。
騰訊已率先行動:CodeBuddy 與 WorkBuddy——包括 IDE、外掛程式與 CLI——已升級至正式版 V4 Pro 建置,顯示中國企業採用意願正在升溫。Anthropic 則面臨更嚴峻的壓力,其內部 Claude Opus 5 據報在多項基準測試上以約半價的成績超越 Fable 5,使其高階定位更趨複雜。
對開發者而言,評估重點正從單純的基準測試表現,轉向每項完成任務的成本。DeepSeek 的 MIT 授權權重自 4 月起開放下載,過去一個月在 Hugging Face 上累計超過 140 萬次下載,為團隊提供了閉源競爭對手無法比擬的自架推論路徑。尚待解答的開放問題是:0813 版的效能能否經得起獨立測試的檢驗——以及價格調漲是否會在這項驗證到來之前先落地。
本文僅供參考,不構成投資建議。