重點摘要:
- Kimi K3的效率引發傑文斯悖論,帶動晶片與記憶體總需求上升
- 花旗認為伺服器DDR5與企業級SSD將受惠;美銀稱美國實驗室將增加運算支出
- Token使用量仍在加速增長,中文模型在OpenRouter上的用量已超越非中文模型
重點摘要:

Moonshot AI的Kimi K3證明,更便宜、更高效的模型反而會推升AI晶片與記憶體的總需求,而非減少。
Moonshot AI推出的Kimi K3——一個擁有2.8兆參數的混合專家模型,具備100萬Token的上下文視窗——正在重燃一場辯論。這場辯論最初源於DeepSeek的R1在2025年1月單日內從輝達市值抹去5890億美元。當時的問題是:更高效的模型是否意味著對硬體的需求減少?根據花旗與美銀的觀點,答案正好相反:效率提升會引發傑文斯悖論,即每項任務成本下降,總使用量擴大,最終導致整體資源消耗增加。
「即使Kimi K3被廣泛採用,對伺服器DDR5與企業級SSD的需求仍將上升,」花旗半導體分析師Peter Lee在7月17日的報告中表示。其邏輯核心在於長上下文推理與自主代理工作負載,這類應用每次會話產生的Token數量遠多於簡單的問答。每增加一個Token都需要記憶體頻寬與儲存空間,從而將更低的單位成本轉化為更高的總體消耗。
根據Moonshot的技術文件,K3每處理一個Token僅啟動其896個專家中的16個,達到了前一代Kimi K2的2.5倍擴展效率。該模型在Artificial Analysis Intelligence Index上得分57——落後於Claude Fable 5的60分與GPT-5.6 Sol的59分,但領先Claude Opus 4.8的56分——而每項任務成本約為0.94美元,僅約Opus 4.8(1.80美元)的一半。在LMArena的Frontend Code Arena中,K3躍升17個名次,奪得榜首。完整模型權重預計於7月27日在Hugging Face上發布。
此投資影響橫跨半導體供應鏈。花旗認為伺服器DDR5與企業級SSD是直接受惠者,因為長上下文推理與代理驅動的工作流程會增加KV快取需求,進而需要更多高頻記憶體存取與儲存空間。美銀分析師Vivek Arya在7月17日另一份報告中指出,隨著中國開源模型縮小能力差距,美國前沿實驗室——OpenAI、Anthropic、Google——將需要增加運算支出,而非減少。「如果開源模型持續縮小差距,領頭羊就需要更大規模的訓練、更多的強化學習與合成數據循環、更重的測試階段運算,以及更快的產品迭代週期,才能維持差異化,」Arya寫道。
MoE基礎設施瓶頸
K3的混合專家架構將總參數量與每個Token的運算量脫鉤,雖減輕了部分運算負擔,但瓶頸轉移至記憶體頻寬、專家路由與互連速度。根據輝達公布的規格,該公司估計其GB300 NVL72平台在領先的開源MoE模型上,每瓦效能可達Hopper世代的25倍。CoreWeave圍繞Kimi K2.6的測試顯示,即使是稀疏MoE模型,仍需要優化的輝達GB200或GB300 NVL72基礎設施才能維持速度與成本優勢。
此動態讓更廣泛的AI基礎設施生態系統受惠。GPU製造商輝達與AMD、高頻寬記憶體供應商如SK海力士與三星、DDR5生產商,以及網路設備供應商,都將因模型驅動的工作負載擴張超過每Token效率提升而受益。關鍵變數並非單一模型是否運作得更便宜,而是更低的成本是否足以帶動足夠的增量使用量,以抵銷單位成本下降的影響。
Token需求仍在加速增長
OpenRouter數據顯示,該第三方API平台的Token消耗持續快速增長,中國AI實驗室的模型目前的Token用量已超過非中文模型。企業採用範圍也在擴大:截至2026年6月的Ramp數據顯示,55%的美國公司已為AI模型、平台或工具購買付費訂閱,而美國人口普查局BTOS調查的估計值僅為21%。Anthropic的企業採用率達42.4%,OpenAI則為39.5%。
然而,支出仍然高度集中。前1%的企業用戶平均每月在AI上花費約每位員工4,833美元,而所有公司的中位數僅為11美元。科技與媒體公司的訂閱率最高,達79.8%;大型企業以65.5%領先中型企業的61.3%與小型企業的48.7%。此分布顯示AI使用仍處於擴散階段,低成本模型可能解鎖來自小型企業與新代理型應用的下一波採用浪潮。
輝達股價目前約為預期本益比的30倍,尚未完全反映傑文斯悖論動態的全部影響。如果K3的敘事將投資人焦點從「模型效率降低晶片需求」轉向「模型效率擴大總體工作負載」,重新估值可能使記憶體製造商、GPU供應商與AI數據中心基礎設施相關股票全面受惠。風險在於模型壓縮與推理最佳化的速度超過工作負載增長,暫時冷卻基礎設施擴張——但就目前而言,花旗與美銀均認為K3是需求催化劑,而非阻力。
本文僅供資訊參考,不構成投資建議。