Cerebras的晶圓級晶片現以每秒高達750個輸出token運行OpenAI最先進的模型,比標準推論速度快14倍。
Cerebras的晶圓級晶片現以每秒高達750個輸出token運行OpenAI最先進的模型,比標準推論速度快14倍。

Cerebras正在驅動OpenAI API中全新的Ultrafast層級,該層級以每秒高達750個輸出token的速度運行GPT-5.6 Sol,比標準處理快14倍,且智慧表現毫不打折,為前沿模型的工作負載開闢了速度與智慧邊界的新領域。
「GPT-5.6 Sol在Ultrafast上的表現證明了速度與智慧不再互斥,」Cerebras執行長兼聯合創辦人Andrew Feldman表示。
根據Artificial Analysis發布的輸出速度報告,Ultrafast比Claude Opus 4.8的Fast模式快5倍,比Claude Fable 5快11倍。在Humanity's Last Exam這個涵蓋研究生級化學、經濟學與文學、包含2,500道題目的基準測試中,GPT-5.6 Sol Ultrafast僅用了11個多小時就完成全部題目,而Claude Fable 5則需要超過三天的連續運算,前者以將近7倍的速度達到相當的準確度。在GDP-Val這個衡量法律文件、財務模型和工程報告等具經濟價值知識工作的基準測試中,Ultrafast實現了5.6倍的端到端加速,且品質完全沒有下降。
這種速度來自Cerebras的晶圓級引擎架構,該架構在每顆晶圓大小的晶片上保留44 GB的靜態隨機存取記憶體(SRAM),將模型權重保存在晶片上,而非像GPU推論那樣在晶片內記憶體與晶片外儲存之間來回搬移。這消除了傳統硬體上限制前沿模型推論速度的記憶體頻寬瓶頸。
更快的token生成直接轉化為具經濟價值工作的生產力提升,從程式設計到起草法律文件皆然。OpenAI產品負責人Rohan Varma表示,Ultrafast是使用前沿AI快速回應即時資訊的組織的一項持續性優勢,從排查生產環境故障的根本原因到偵測網路攻擊皆適用。OpenAI研究人員Jeffrey Wang表示,Ultrafast提供即時洞察,讓使用者無需在多個平行工作階段之間頻繁切換情境。
Cerebras反其道而行的做法是在每顆晶圓大小的晶片上整合44 GB的SRAM,使權重留在晶片上,token則透過跨晶圓管線化的模型層持續流動。該架構可隨模型規模擴展,為未來前沿模型持續保持速度優勢鋪平了道路。OpenAI運算策略與GPT基礎設施副總裁Sachin Katti表示,公司正從一小群客戶開始,在擴大服務範圍之前先了解速度在哪些環節創造出實質價值。
Cerebras在納斯達克以股票代碼CBRS掛牌交易,OpenAI是其少數重要客戶之一,其他客戶還包括Group 42 Holding、穆罕默德·本·扎耶德人工智慧大學(MBZUAI)以及AWS。這項Ultrafast合作加深了Cerebras對OpenAI的依賴,同時為這家晶片製造商提供了對抗Nvidia GPU資料中心業務的旗艦級晶圓級推論技術佐證。OpenAI正從一批精選客戶開始,隨著產能增長逐步擴大開放範圍。
這筆交易也顯示出前沿模型供應商正在重新思考推論經濟學。OpenAI決定將其最先進的模型導向Cerebras硬體而非Nvidia GPU,這表明傳統加速器上的記憶體頻寬瓶頸正隨著模型規模擴大而成為競爭劣勢。對Cerebras而言,贏得OpenAI這個客戶提供了指標性的參考部署,有望吸引更多正在評估晶圓級推論的雲端和企業客戶。該公司並未揭露Ultrafast合作安排的商業條款,也未說明OpenAI將對該層級收取的定價。
本文僅供參考,不構成投資建議。