Moonshot AI 的 Kimi K3 以美國前沿模型零頭的成本,提供 2.8 兆參數,重塑了 AI 的經濟效益。
Moonshot AI 的 Kimi K3 以美國前沿模型零頭的成本,提供 2.8 兆參數,重塑了 AI 的經濟效益。

Moonshot AI 的 Kimi K3 以美國前沿模型零頭的成本,提供 2.8 兆參數,重塑了 AI 的經濟效益。
Kimi K3 在 BrowseComp 基準測試中獲得 91.2 分,高於 Claude Fable 5 的 88.0 分和 GPT-5.6 Sol 的 90.4 分,而每次部署成本僅為 4.65 美元,遠低於 Anthropic 模型的 13.41 美元,這對美國前沿實驗室的定價能力構成威脅。
輝達(Nvidia)執行長黃仁勳接受 Axios 採訪時表示:「開放權重模型正在縮小能力差距,同時拉開成本差距。美國公司絕對應該被允許使用中國的模型。」
該模型在混合專家(MoE)架構中使用了 896 個路由專家,每次解碼啟動 16 個專家以保持計算效率。其 Kimi Delta Attention(KDA)機制用線性注意力取代了四分之三的傳統注意力層,在百萬 token 的上下文環境中實現了 6.3 倍的解碼速度提升。在 Kimi Code Bench 上,K3 的得分比 Claude Fable 5 低 4 分,但成本僅為其 38%——相當於每美元可解決的任務量是其 2.8 倍。在完整的 452 次部署測試中,K3 的總成本為 2,103 美元,而 Fable 5 則為 6,010 美元。
此次發布給本已享有高估值倍數的美國 AI 公司帶來壓力。Anthropic 隨後推出了更便宜的 Claude Opus 5,作為 Fable 5 的低價替代方案。輝達則成立了一個安全聯盟,以促進安全的開放權重部署。根據平台數據,中國模型現在約占美國公司在 OpenRouter API 市場上 token 使用量的 60%。
這個 93 層的網路以 3 比 1 的模式,結合了 69 個 KDA 線性注意力層與 24 個 MLA 層。KDA 維護一個固定大小的狀態緩衝區,該緩衝區會隨每個新 token 更新,並使用通道級遺忘門,讓不同的記憶維度以不同的速率衰減——實體關係得以持久保留,而局部措辭則逐漸淡出。Delta 規則透過比較現有記憶與新值,僅修正誤差部分來寫入新資訊。該系統強制執行每步約 0.67% 的最低保留率,以防止並行計算期間出現數值不穩定。
注意力殘差(Attention Residuals)機制讓每一層能夠跨九個壓縮區塊從任何較早的層中檢索輸出,解決了標準殘差連接在大規模擴展時產生的特徵稀釋問題。根據已發表的研究,在傳統的 93 層網路中,約有 44% 的層可能產生的有效轉換微乎其微。AttnRes 將層與層之間的資訊傳遞從固定的加性通道轉變為可學習的路由系統。
Stable LatentMoE 將 token 表徵從 7,168 維壓縮至 3,584 維,然後再路由到專家,從而在活躍專家數量從八個翻倍至十六個的情況下,仍保持通訊頻寬穩定。兩個共享專家仍以全寬度運行,處理每個 token。
DoorDash 將 Kimi 用於低階任務,同時保留 Anthropic 的 Fable 用於高階功能。Coinbase 已確認內部使用。被 SpaceX 收購的程式設計新創公司 Cursor 將其產品建構在 Kimi 模型之上。川普政府則做出了負面反應——科學顧問 Michael Kratsios 指責 Moonshot AI 非法蒸餾 Anthropic 的 Fable,但專家對此說法提出異議;財政部長 Scott Bessent 則威脅要將該公司列入實體清單。
據報導,Moonshot AI 完成了 35 億美元的融資,顯示投資者對開放權重路線的信心。該公司的技術報告提供了在 3 兆參數規模下進行訓練的完整配方,包括保證專家平衡分配且不中斷訓練的 MoonEP 通訊庫,以及一個統一的啟動管理器,可動態決定在反向傳播期間,是將中間結果保留在 GPU 上、移至 CPU 記憶體、壓縮至 FP8,還是重新計算。
對投資者而言,這個算術很簡單。如果 K3 在程式設計任務上保持 2.8 倍的成本優勢,同時在知識基準測試上匹配或超越封閉模型,那麼專有推理 API 的市場規模將會縮小。輝達的硬體為兩大陣營提供支援,因此仍能免受影響。但對於那些預期營收倍數超過 30 倍的美國 AI 公司來說,它們面臨著一個任何出口管制都無法消除的結構性定價逆風。
本文僅供資訊參考,不構成投資建議。