Key Takeaways:
- 阿里巴巴千問團隊推出 Qwen-Audio-3.0-TTS 語音合成模型,提供兩種版本
- Flash 版本首包延遲僅 300 毫秒,適用於即時互動場景
- 此次發布緊接 Qwen3.8-Max-Preview 之後,以及與 Apple Intelligence 在中國的合作
Key Takeaways:

阿里巴巴千問推出的 Qwen-Audio-3.0-TTS 將即時語音合成帶入 AI 競賽,對 OpenAI 與 Anthropic 在語音互動市場發起挑戰。
阿里巴巴千問團隊發布了 Qwen-Audio-3.0-TTS 語音合成模型,其中 Flash 版本首包延遲僅 300 毫秒,可實現即時互動,加劇了 AI 語音市場的競爭。
千問團隊在聲明中表示,該模型支援「自由風格自然語言指令控制」,允許使用者透過對話式指令而非固定參數來引導語音輸出。
該模型提供兩種版本:Flash 版本首包延遲為 300 毫秒,適用於語音助理和客服等即時應用;Plus 版本則針對內容製作進行了高品質生成最佳化。此次發布緊接阿里巴巴推出 Qwen3.8-Max-Preview 之後,這是一款擁有 2.4 兆參數的模型,該公司聲稱在前沿系統中僅次於 Anthropic 的 Claude Fable 5。
此次語音合成布局使阿里巴巴與 OpenAI 的先進語音模式及 Anthropic 的文字轉語音能力直接競爭,瞄準一個預計到 2028 年將達到 135 億美元的市場。在 Qwen3.8 預覽版發布後,阿里巴巴週一在香港交易時段股價一度上漲 5.4%,反映出投資人對該公司 AI 發展方向的信心。
阿里巴巴的雙重模型策略——在數天內同時發布大型語言模型與專業語音合成系統——顯示其積極搶佔中國 AI 基礎設施層的主導地位。該公司已將千問定位為雲端業務的核心,提供開放權重模型,讓開發者可透過阿里雲進行客製化與部署。該公司表示,這種策略已幫助千問建立起中國模型家族中規模最大的開發者社群之一。
此次發布的時機具有戰略意義。中國 AI 新創公司月之暗面(Moonshot AI)數日前以 Kimi K3 震撼市場,這款 2.8 兆參數的模型在程式碼基準測試中將 Anthropic 的 Fable 5 擠到第二位。據彭博報導,月之暗面目前正準備以接近 300 億美元的估值在香港進行 IPO(首次公開募股)。阿里巴巴密集的產品發布顯示,其目標是防止任何單一中國競爭對手奪取前沿 AI 的桂冠。
蘋果協議打開消費市場通路
阿里巴巴的語音模型透過與蘋果的合作獲得了內建分銷管道。據科技媒體 TechNode 報導,中國國家網信辦本月已批准 Apple Intelligence 在中國本地發布,阿里巴巴與百度共同作為技術合作夥伴。千問模型將為蘋果在中國的裝置端 AI 功能提供支援,涵蓋文字、影像理解與內容生成,如今更可能加入語音能力。
與蘋果的合作使 Qwen-Audio 得以接觸中國數百萬 iPhone 用戶,讓阿里巴巴獲得月之暗面等競爭對手所缺乏的消費市場分銷優勢。據業界估算,中國 AI 系統每月處理的 token 數量已超過美國同業,而語音互動正代表著消費級 AI 應用的下一個前沿領域。這項批准歷經了蘋果與中國監管機構之間長達數月的談判,內容涉及資料隱私與內容審查要求。
對投資者的影響
阿里巴巴目前的預期本益比為 17 倍,低於美國 AI 同業,反映出地緣政治風險以及核心電商業務成長放緩。千問模型家族強化了阿里巴巴雲端業務的看漲論點,該業務上一季營收達 56 億美元。若 Qwen-Audio 能在企業客服與消費裝置領域獲得市場動能,可望帶動雲端業務的增量營收,並縮小與美國科技同業之間的估值差距。
語音合成市場目前仍較為分散,參與者包括 ElevenLabs、OpenAI 基於 Whisper 的語音模式,以及百度的語音辨識系統。阿里巴巴號稱的 300 毫秒延遲,若經證實,將使其躋身目前最快的即時語音合成模型之列。未來仍需獨立基準測試來驗證其在既有競爭對手面前的實際表現。
本文僅供資訊參考,不構成投資建議。