代理式AI消耗CPU的速度已超過超大規模雲端業者擴建的腳步,迫使亞馬遜在內部進行運算資源配給。
代理式AI消耗CPU的速度已超過超大規模雲端業者擴建的腳步,迫使亞馬遜在內部進行運算資源配給。

亞馬遜雲端運算服務(AWS)已告知工程師削減CPU使用量,因代理式AI將產業的CPU對GPU比例從1:4推向1:1,使EC2容量吃緊,內部等待時間從數小時延長至數日。
「基本上,現在建置、生產和執行大量工作所需的CPU比過去更多,」AI顧問公司Elendil Labs共同創辦人暨董事總經理謝敬表示。他指出,客戶的人均IT支出因採用代理式AI而直接倍增。
英特爾執行長陳立武在4月報告指出,AI推論工作負載每使用四顆GPU搭配一顆CPU。到了7月,英特爾財務長大衛·辛斯納表示該比例已接近一比一。超微和安謀高層也觀察到類似趨勢。此一轉變反映代理式工作負載日益複雜——除了餵養GPU之外,還需要CPU處理工具呼叫、編排與資料準備。
運算能力緊縮帶來實質的財務影響。亞馬遜一名程式碼代理程式上個月消耗了180萬美元的token成本,超出開發預算860%。對企業而言,點實例(AWS提供折扣的超額容量)供給日益緊俏,顯示隨著產業彈性運算緩衝縮水,雲端成本將持續上揚。
傳統資料中心架構假設固定比例:每顆CPU搭配四顆GPU,CPU主要負責持續餵養加速器。代理式AI打破此一模式。這類工作負載串接多次推論呼叫、在通用核心上執行工具呼叫,並編排複雜的多步驟推理——全都需要持續的CPU吞吐量。
據《The Information》報導,過去能在數小時內啟動EC2實例的AWS工程師,如今回報需等待數日才能取得資源。一名在亞馬遜任職多年的工程師表示從未經歷過如此嚴重的延誤。公司已為各團隊設定降低運算使用量的期限,並將閒置實例收回供外部客戶使用。
短缺在AWS的點實例市場最為嚴峻,該市場以大幅折扣出售超額容量,但可在兩分鐘前通知後收回。一名協助企業使用AWS的顧問表示,合約容量尚未出現營運短缺,但大量取得點實例已日益困難——這顯示AWS整體供需缺口正在收窄。
亞馬遜並非唯一面對此一緊張局勢的業者。谷歌去年成立高層級委員會,負責在Google Cloud、DeepMind與消費產品之間分配運算資源。摩擦仍然存在:明星AI研究員諾姆·沙澤爾今年夏天離職,部分原因正是運算資源取得的挫折感。
微軟已將效率轉化為營收。財務長艾咪·胡德將Azure部分成長歸因於管理CPU與GPU機隊的「效率改善」,並在公司財報電話會議上表示「當我們達成效率增益時,這些效益會迅速變現」。
晶片製造商正趁勢掌握此一需求轉變。超微推出Zen 6「Venice」資料中心CPU,這是數十年來該公司首次在客戶端市場之前發表新架構於資料中心。輝達已將其訊息重心從加速器轉向新款Vera CPU,尋求在蓬勃發展的代理式基礎設施市場中立足。亞馬遜自家採用安謀架構的Graviton5,是該公司迄今最強大的CPU。
AWS對容量危機的說法提出反駁。一名發言人表示,公司持續滿足內外部客戶「絕大多數的運算需求」,並將效率推動歸因於亞馬遜長久以來的「節儉」領導原則,而非新的限制因素。
對投資人而言,CPU吃緊重塑了AI基礎設施的投資主題。英特爾和超微可望受惠於每個AI工作負載的CPU需求上升,而雲端利潤則面臨容量限制的壓力。隨著AI需求激增,超大規模業者正投入近六千億美元的年資本支出,雲端營收現已每季超過1430億美元。依賴點實例處理大規模工作負載的企業,應預期在產業運算緩衝收緊之下面臨更高成本。一度難以想像的1:1 CPU-GPU配比,正成為代理式AI基礎設施規劃的新基準。
本文僅供資訊參考之用,不構成投資建議。