DeepSeek 於 9 月 10 日發布 V4.1 Flash,這是一款 5,520 億參數的 MoE 模型,公司稱其 HBM 需求降至前一代的四分之一、SSD 需求降至八分之一,KV 快取壓縮至每 token 890 位元組。快取命中輸入定價於離峰時段下調 60% 至每百萬 token 0.02 元人民幣,即將退役的 V4 Pro 自 9 月 14 日起將轉由新模型承接。
DeepSeek 於 9 月 10 日發布 V4.1 Flash,這是一款 5,520 億參數的 MoE 模型,公司稱其 HBM 需求降至前一代的四分之一、SSD 需求降至八分之一,KV 快取壓縮至每 token 890 位元組。快取命中輸入定價於離峰時段下調 60% 至每百萬 token 0.02 元人民幣,即將退役的 V4 Pro 自 9 月 14 日起將轉由新模型承接。

DeepSeek 新款 V4.1 Flash 模型聲稱可將 AI 推論的記憶體占用壓縮至前一代的四分之一,此一變革將降低長期運行軟體代理的成本,並改寫中國 AI 雲端服務的價格下限。
這家總部位於杭州的開發商表示,9 月 10 日發布的這款 5,520 億參數模型採用因果編碼器—解碼器(Causal-Encoder-Decoder)架構,直接由編碼器隱藏狀態投射出解碼器的鍵值快取,而非從每個解碼器層推導。公司稱高頻寬記憶體(HBM)需求降至前一代的四分之一,固態硬碟(SSD)需求降至八分之一,快取壓縮至每 token 890 位元組,僅為最初 DeepSeek V1 的 1/437。
「快取正是代理經濟勝負的分水嶺,」上海一家研究機構負責中國雲端基礎設施的資深分析師孫偉(Wei Sun)表示。他審閱了已公布的規格。「若這些數字在生產負載下依然成立,一個 20 步工具呼叫迴圈的邊際成本將下降超過一半。」
DeepSeek 將該模型定價為離峰時段每百萬快取命中輸入 token 0.02 元人民幣、尖峰時段 0.04 元,較 V4 Flash 下調 60%。快取未命中的輸入價格下跌約 33.3% 至離峰時段 1 元,輸出價格下跌約 11.1% 至 4 元。尖峰時段為北京時間週一至週五的 9:00 至 12:00 及 14:00 至 18:00。以固定工作量計算,即 100 萬個快取命中 token、10 萬個快取未命中 token 及 1 萬個輸出 token,離峰時段帳單將由 0.245 元降至 0.16 元,降幅 34.7%。並行請求上限則由 500 次提高至 2,500 次。
該架構在設計上刻意採取非對稱配置:5,520 億參數的 MoE 主幹在預填充階段激活 80 億參數,在解碼階段激活 160 億參數。這種區分至關重要,因為代理讀取的內容遠多於寫入——程式碼儲存庫、工具描述與對話歷史會被反覆輸入,而模型輸出的內容相對較少。DeepSeek 表示,該結構可擴展至更大的參數規模,為未來的 V4.1 Pro 奠定基準。
基準測試顯示,V4.1 Flash 在代理任務上超越即將退場的 V4 Pro。其在 Terminal-Bench 2.1 拿下 90.6 分,高於 V4 Pro 的 87.9 分;在 CyberGym 拿下 88.1 分,高於 83.3 分。其在 GPQA Diamond 拿下 90.9 分,Codeforces 評分為 3471,MathArena Apex 為 65.6 分。在純推理能力上,其 GPQA Diamond 成績仍落後於 Anthropic 的 Opus(93.4 分)與 OpenAI 的 GPT-5.6 Sol(94.1 分)。DeepSeek 並未披露這些比較背後的測試條件。
騰訊的 WorkBuddy 與 CodeBuddy,以及開源編碼代理 OpenCode,均已作為官方合作夥伴接入 V4.1 Flash。當日騰訊股價下跌 1.982%,報 8.60 港元,據 AASTOCKS 數據,截至當地時間 12:25,做空金額達 8.1387 億美元,占成交額的 15.975%。
DeepSeek 將自 9 月 14 日北京時間 12:00 起,把所有導向即將退役之 deepseek-v4-pro 模型的請求轉由 V4.1 Flash 承接,並採用較低的單位價格,直至 V4.1 Pro 上市。較舊的 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 名稱仍可呼叫,但現已指向新模型,將文字與圖像理解整合至單一 API 入口。該模型支援 100 萬 token 上下文視窗、最高 384K 輸出、JSON 輸出、工具呼叫及 Responses API,並預設啟用思考功能,涵蓋低、高與最高三種強度等級。
這項壓縮主張還有另一層意涵。若整個產業得以複製,每單位推論的 HBM 需求減少四倍,將抑制那些支撐三星、SK 海力士與美光預測的增量記憶體消耗。DeepSeek 自身的表述則較為狹義——其將此進展描述為降低代理場景中的快取命中成本,而非減少加速器總量。兩者並不相同,且公司未公布任何關於記憶體總採購量的數據。
大華繼顯(UOB Kay Hian)對大中華區網路與 AI 雲端維持建設性看法,將阿里巴巴、Trip.com、網易與 Z.AI 列為首選,同時指出電子商務表現疲軟、遊戲則具韌性。代理推論成本下降有助於支撐此一看法,因為這將擴大平台已在銷售之自動化工作負載的利潤空間。阿里巴巴的 Qwen 模型與 Z.AI 的 GLM 系列,正與 DeepSeek 直接爭奪相同的企業預算,因此低階市場的降價將壓縮整個國內市場的定價能力,即便其同時擴大了具備自動化經濟效益的工作量。
DeepSeek 正籌備在上海科創板上市,並已委任中信證券擔任輔導機構,據報導估值達 5,000 億元人民幣。公司未就上市安排的相關詢問作出回應。
本文僅供參考,不構成投資建議。