重點提要:
- 字節跳動正討論打造五兆參數模型,超越Qwen 3.8-Max與Kimi K3
- 張一鳴拒絕蒸餾路線,稱其只是複製Claude而非超越
- 火山引擎未達Token目標,Seedance與Seedream貢獻超過半數使用量
重點提要:

據知情人士透露,字節跳動正討論訓練一個參數規模超過五兆的大型語言模型,這一規模將超越阿里巴巴旗下參數達2.4兆的Qwen 3.8-Max,以及月之暗面參數達2.8兆的Kimi K3。此舉標誌著一個激進的賭注:靠原始規模而非模仿,來縮小在程式碼與推理能力上的差距——字節跳動的Seed 2.0在二月發布後市場反應平淡。
據與會人士透露,在兩週前舉行的全員大會上,字節跳動創辦人張一鳴對Seed研究團隊表示:「蒸餾可以在短期內提升模型性能,但本質上只是複製Claude已經具備的能力——沿著這條路只能接近領先者,永遠無法真正超越。」他表示,公司可以接受暫時落後於競爭對手,也不願依賴這項被白宮指控中國實驗室大規模使用的技術。
新模型將由Seed Foundation團隊負責人項亮主導,與負責大語言模型預訓練數據的沈科合作,這將是中國已知規模最大的在研模型。字節跳動正在重組Seed團隊,整合資源並消除內部相互競爭的項目,這與其長期以來「大力出奇蹟」的多線並行押注策略形成鮮明對比。該計畫仍處於早期階段,最終可能不會推出成品。
此次押注既是商業之爭,也是技術之爭。字節跳動旗下雲端部門火山引擎是中國最大的模型API銷售商,市占率約為一半,2025年營收約150億元人民幣,而2026年內部目標為超過400億元人民幣。然而,豆包的Token消耗量在六月達到180兆,低於250兆至300兆的目標,其中影片和圖像模型Seedance與Seedream貢獻了超過一半的使用量——這種集中度使其成長暴露於短劇需求放緩的風險之中。
為何追求規模,以及為何現在行動
字節跳動的賭注呼應了使Seedance 2.0成為首個全面採用混合專家架構的影片模型(參數規模達2000億)的路徑。該模型於二月發布,被廣泛評為全球最強影片生成器。一位Seed內部人士表示,該模型毛利率達70%至90%,已成為火山引擎模型即服務業務的營收基礎,並證明用戶會流向最具能力的產品。
語言模型的差距才是問題所在。智譜的開源模型GLM-5被廣泛認為是首個可與Anthropic Opus系列相媲美的中國模型,而月之暗面的Kimi K3在第三方基準測試中已接近海外閉源旗艦模型。受程式碼能力驅動,智譜與月之暗面的年度經常性收入分別突破10億美元和3億美元。字節跳動已招募DeepSeek核心研究員郭達雅主導程式碼專項訓練,並將相關資源整合至其麾下。
張一鳴反對蒸餾的立場正值華盛頓加強審查之際。白宮科技政策辦公室主任麥可·克拉齊奧斯指控月之暗面祕密蒸餾Anthropic的Fable模型以打造Kimi K3,Anthropic追蹤到340萬次Claude對話來自虛假帳戶。財政部長斯科特·貝森特曾提出,若中國企業大規模採用蒸餾技術將實施制裁。與此同時,史丹佛大學以人為本人工智慧研究院發現,儘管美國在AI上的支出是中國的23倍,頂尖美國與中國模型的能力大致相當。
企業端回報
字節跳動更廣泛的重組將模型賭注與其辦公軟體連結起來。飛書產品團隊併入趙琦領導的豆包團隊,飛書的謝欣向其匯報,市場推廣部門則併入火山引擎。飛書2025年營收超過30億元人民幣,2026年第二季同比成長超過100%。豆包成為任務入口,飛書則提供身分、權限和工作流程上下文。
對投資者而言,問題在於字節跳動能否在競爭對手之前,將一次五兆參數的訓練轉化為營收。火山引擎的Token成長已未達內部目標,而該模型能否成功,取決於能否解決中國尚無任何實驗室嘗試過的、此一規模預訓練所需的系統工程挑戰。字節跳動的私募估值及其資本支出——為所有中國AI參與者中最高——意味著這項賭注不受公開市場檢驗,但一旦取得突破,將對正在競相將程式碼與推理需求變現的阿里巴巴Qwen、月之暗面和智譜構成壓力。
本文僅供資訊參考,不構成投資建議。