重點摘要:
- 騰訊將Hy4預覽版模型權重從約1.5TB壓縮至214GB,減少幅度達86%
- 混合精度量化技術在長上下文任務上保持接近原始性能
- 此舉降低企業自行託管成本,加劇與阿里巴巴、百度和字節跳動的競爭
重點摘要:

騰訊混元團隊利用兩種核心量化技術,將Hy4預覽版模型的權重從約1.5TB壓縮至214GB——減少幅度達86%——同時在長上下文理解與多輪檢索任務上保持接近原始性能,此消息來自該公司9月1日的公告。
「這就是一台需要數據中心的模型與一台可運行於單一高端工作站的模型之間的區別。」騰訊混元發言人在公告中表示,稱此壓縮技術是讓前沿級AI適合企業自行託管的重要一步。
壓縮後的STQ1_0版本採用混合精度方法,根據校準數據為每一層分配不同的位寬——部分層級降至1.31位元的STQ1_0,其他層級則保持在2.06位元的IQ2_XXS——而非對整個模型施加統一的量化標準。結果顯示:長文檔理解能力幾乎與原始BF16檢查點持平,多輪檢索維持在相近水準,數學性能僅有輕微下降。Q4_K_M版本運行需要435 GiB的VRAM;STQ1_0版本則僅需214 GiB。
此壓縮方案的經濟效益至關重要,因為Hy4預覽版是一個擁有7700億參數的混合專家(MoE)模型,具備490億活躍參數和100萬token的上下文窗口——這是騰訊迄今發布的最大型開放權重模型。在全精度下,運行該模型需要約1.5TB的VRAM,實際上將其部署限制在配備高頻寬互連的八卡GPU集群。輕量版將此需求降低逾六倍,使採用單節點當前世代加速器的組織也能運行該模型。
騰訊此舉落腳於中國AI市場,當前阿里巴巴的Qwen3.8 Max、智譜的GLM-5.3、DeepSeek的V4 Pro以及月之暗面的Kimi K3均在爭奪企業級工作負載。根據騰訊自行報告的基準測試,Hy4預覽版在SWE-bench Pro(65.7分)和Terminal Bench 2.1(85.4分,與Claude Opus 5並列)上已達到或超越GPT-5.6 Sol的成績。如今壓縮技術更進一步解決成本端的問題——API定價為每百萬輸入token 0.834美元、每百萬輸出token 2.501美元,快取命中則為0.042美元,約為領先閉源前沿模型輸出價格的十分之一。
該技術方案建立在騰訊的AngelSlim量化工具包之上,這是騰訊為使大型模型能在受限硬體上部署而持續開發的工具。Hy4預覽版輕量版將這項工作擴展至7700億參數規模,其逐層位寬選擇方法尤其值得關注,因為它將壓縮視為一個最佳化問題——將更多位元分配給對準確性至關重要的層級,分配較少位元給冗餘層級——而非一刀切的轉換方式。
騰訊尚未公布壓縮模型的獨立基準測試結果,性能聲明均基於公司自身的評測體系。原始的Hy4預覽版本身僅公開四天,公開排行榜上尚無第三方驗證。壓縮後的GGUF檔案已在Hugging Face上以Apache 2.0授權發布,允許商業使用和修改。
對於正在評估自行託管AI的企業而言,實際意義十分直接:一個214GB的模型能處理100萬token的上下文窗口並具備接近前沿的編碼性能,這將改變本地部署的單位經濟效益。騰訊的整體戰略——開放權重發布、寬鬆授權,以及跨模型路由的雲端平台(TokenHub)——使其有能力獲取那些受數據主權限制而無法由OpenAI和Anthropic等西方競爭對手服務的企業工作負載。騰訊雲在24個區域運營68個可用區,擁有支援區域部署的實體基礎設施。
騰訊股份在香港交易所交易,該公司報告2026年第二季度資本支出為528億元人民幣(74億美元),持續擴展AI基礎設施。壓縮技術的突破不會直接改變這一支出軌跡,但降低了客戶採用混元模型的門檻,可望加速騰訊雲AI服務的營收成長。競爭風險在於阿里巴巴、百度和字節跳動可能對各自旗艦模型——分別是Qwen、文心Ernie和豆包Doubao——推出類似的壓縮方案,進而壓縮騰訊的差異化窗口期。
本文僅供參考,不構成投資建議。