重點摘要: 字節跳動正準備以一個規模遠超當前前沿水準的模型,超越中國所有AI實驗室。
重點摘要: 字節跳動正準備以一個規模遠超當前前沿水準的模型,超越中國所有AI實驗室。

字節跳動正在討論訓練一個參數超過5兆的大型語言模型,其規模將超越阿里巴巴的Qwen 3.8-Max和月之暗面的K3,以參數數量計將成為中國已知最大的模型。
據中國媒體引述知情人士透露,這項計畫將由字節跳動Seed基礎模型團隊負責人項亮主導,並與負責大語言模型預訓練數據的沈科合作。報導指出,該模型最終可能不會對外發布。
一個5兆參數的模型,規模將約為月之暗面Kimi K3的兩倍——K3每個token啟動1,040億個參數;同時也將是阿里巴巴Qwen 3.8-Max的兩倍以上——後者擁有2.4兆參數,其中950億個參數被啟動。兩款模型均於近幾週以開放權重形式發布,其中Qwen3.8-Max已成為Arena.AI文本排行榜上排名最高的中國模型。
此計畫顯示字節跳動希望在中國AI競賽中重奪前沿地位。該公司透過豆包助手和Seed基礎模型研究部門,一直是中國AI領域的重要力量。中國開放權重模型已佔Hugging Face下載量的約41%,而史丹佛大學2026年AI指數顯示,美中效能差距已縮小至僅2.7%,遠低於2023年的31.6個百分點。
從2.4兆到5兆:中國的參數競賽升級
參數規模的攀升遵循中國各實驗室快速擴張的模式。阿里巴巴本週發布Qwen3.8-Max,配備100萬token的上下文視窗,單次請求可分析超過200頁文字或約100小時的影片內容。月之暗面兩週前發布的Kimi K3,公司稱其可與Anthropic的Claude Fable 5及OpenAI的GPT-5.6 Sol相匹敵。
據先前報導,字節跳動還將世界模型列為最高技術優先事項,其Seed基礎模型團隊也是中國最活躍的研究團隊之一。一個5兆參數的模型將需要龐大的運算基礎設施,不過字節跳動尚未公布其訓練叢集容量或估計訓練成本。
該擬議模型的規模引發了訓練經濟學的疑問。Qwen3.8-Max的2.4兆參數已是阿里巴巴今年2月發布的Qwen3.5的七倍。一個5兆參數的模型將把訓練運算需求推升至遠超中國現有基礎設施的水準,可能需要數萬個加速器並進行長達數月的連續訓練。
字節跳動大規模擴張,誰能受益
對投資人而言,這場規模競賽對AI供應鏈具有直接影響。中國實驗室對華為昇騰系列國產加速器的需求將持續成長,而在出口管制收緊下,Nvidia在中國的市佔率已從約95%降至2025年的約55%。根據美國外交關係委員會的分析,華為昇騰960預計要到2027年才能達到Blackwell等級的效能。
模型競賽同樣對雲端服務商構成壓力。根據Omdia數據,阿里雲在中國國內雲端市場的市佔率約為36%至37%,華為雲為16%,騰訊雲為9%。字節跳動的前沿模型可能促使企業工作負載轉向字節跳動的雲端服務,不過該公司尚未公布雲端市佔率數據。
競爭格局的變化超越了中國市場。在OpenRouter(多數西方開發者使用的API聚合平台)上,中國開放模型的用量從2024年底的近乎為零,成長至近期約佔總流量的30%。一個5兆參數的字節跳動模型將成為史上最大的開放權重模型,可能加速全球對中國AI基礎設施的採用。
DeepMind執行長Demis Hassabis於今年1月表示,中國實驗室已將差距縮小至約六到十二個月,低於此前的兩年。如果字節跳動成功推出5兆參數模型,這一時間表可能進一步壓縮,重塑中美AI企業的競爭格局。字節跳動的消費級應用程式豆包在中國已覆蓋數億用戶,這為公司提供了阿里巴巴和月之暗面等純模型實驗室必須透過開放權重發布和雲端合作才能匹敵的分發優勢。
本文僅供參考,不構成投資建議。