重點摘要:
- OpenAI 的 GPT-5.6 Sol 超高速模式每秒產生 750 個輸出 token,速度提升 14 倍。
- 該模式運行於 Cerebras 的晶圓級引擎上,將 44GB 的 SRAM 保持於晶片內。
- 有限預覽版鎖定即時金融、事件應對及客戶服務工作流程。
重點摘要:

OpenAI 為 GPT-5.6 Sol 推出的全新超高速模式每秒產生 750 個輸出 token,效能提升 14 倍,消除了過去阻礙頂尖模型進入即時企業工作流程的延遲障礙。
OpenAI 的 GPT-5.6 Sol 超高速模式每秒產生 750 個輸出 token,實現 14 倍速度提升,讓企業得以在即時應用中運行其最先進的模型——過去這樣的延遲問題迫使企業轉向較小型的專業化系統。該功能於 8 月 13 日發布,目前僅向特定 API 客戶提供有限預覽,同時也是 OpenAI 首次將其旗艦模型與大規模非 GPU 推論架構搭配使用。
「在 AI 開發中,速度與智慧不再互斥,」Cerebras Systems 執行長 Andrew Feldman 表示。
該模式由 Cerebras 的晶圓級引擎驅動,可將全部 44GB 的 SRAM 維持於晶片內,繞過了 GPU 系統上因記憶體頻寬瓶頸而拖慢大型模型推論的問題。OpenAI 運算策略暨 GPT 基礎設施副總裁 Sachin Katti 表示,早期的客戶測試將揭示這項速度在何處創造最大價值。OpenAI 工程師們在預覽影片中描述了其效果:技術人員 Jeff Liu 形容這種速度感覺像是「作弊」,而 Sayan Sisodiya 則表示程式碼庫重構「幾乎不需成本,且幾乎瞬間完成」。
速度與智慧的結合可將頂尖 AI 的可觸及市場擴展至對時間敏感的產業,例如金融市場分析、自動化事件應對及高流量客戶服務——在這些領域中,每一秒的延遲都帶來可衡量的成本。OpenAI 引用的基準測試結果顯示,GPT-5.6 Sol 完成「人類最後考試」(Humanity's Last Exam)的速度比 Anthropic 的 Claude Fable 5 快近七倍,且在衡量經濟價值任務的 GDP-Val 基準上實現 5.6 倍的速度提升。
Cerebras 的架構優勢是結構性的,而非漸進式的。傳統 GPU 系統需在晶片內記憶體與晶片外儲存之間穿梭模型權重,這一限制封頂了大型模型的推論速度。晶圓級引擎透過將整個模型存放於晶片內 SRAM 來消除這種資料傳輸,這正是 14 倍效能提升卻不犧牲模型品質的原因。其代價在於營運層面:OpenAI 能否擴展超高速模式取決於能否穩定取得 Cerebras 的專業硬體,該公司表示將隨著基礎設施產能增加而逐步擴展可用性。
這項合作標誌著 AI 硬體格局可能出現的轉變——專業化推論架構正挑戰 Nvidia 長期主導的 GPU 核心模式。Anthropic 已為 Claude 提供快速模式,Google 本週也推出 Gemini 3.7 Flash 以支援程式開發與自主工作流程,這凸顯低延遲推論已成為整個產業的競爭戰場。
OpenAI 目前仍為私人公司,但已向美國監管機構提交機密 IPO 文件,這一進展正受到全球投資人密切關注。根據 StartupHub.ai 數據,該公司於 2026 年籌集了 1000 億美元資金,投資後估值達 8500 億美元,並在其平台排名中獲得 100 分制中 84 分的領導力評分。就上市公司而言,漣漪效應貫穿半導體與雲端產業:Cerebras 以 CBRS 代碼在那斯達克交易,而 Nvidia 的資料中心業務正面臨推論速度的新標竿,這可能壓縮其在低延遲領域的定價能力。下一個值得關注的指標是超高速模式更廣泛公開部署的時間表,以及 OpenAI 邁向上市之路的任何進展。
本文僅供資訊參考,不構成投資建議。