具備電腦操作能力的AI代理已跨越生產部署所需的準確率與成本門檻,正重塑後台作業的經濟格局。
具備電腦操作能力的AI代理已跨越生產部署所需的準確率與成本門檻,正重塑後台作業的經濟格局。

AI代理如今能完成85%的標準電腦任務,超越人類72%的基準水準,而運行成本僅為每小時6至8美元——低於離岸BPO人力10美元的完全加載成本。
「問題已從『代理能否使用電腦?』轉變為『它們能否可靠地完成這項工作?』」a16z早期AI投資合夥人Fabrizio Serafini在本月發布的研究中指出。
OSWorld-Verified基準測試涵蓋Windows、macOS和Ubuntu桌面環境,結果顯示頂尖模型Claude Fable 5得分85%,而人類測試者約為72%。一年前,最佳模型僅得分42%。Serafini指出,生產環境的部署很少使用消費級產品——企業直接呼叫原始API,自行建構沙盒虛擬機、編排邏輯和重試機制。
經濟效益如今已足以重塑規模達三千億美元的全球BPO市場。大量依賴離岸人力的企業面臨利潤壓縮,而垂直AI自動化新創則有望在競爭護城河從模型能力轉向應用層工作流程整合之際獲取價值。
Serafini的研究基於對生產團隊的訪談,發現原始UI導航正日益商品化。持久優勢存在於模型之上的層級:情境管理、權限、流程知識、驗證和錯誤處理。一家每月運行數百萬項自動化任務的營運商甚至記不清是哪個模型驅動其系統——供應商能在不破壞工作流程的情況下於底層替換模型,這才是價值所在。
一家消費數據平台每月運行1,500萬至2,000萬次自動化入口網站互動,當零售業者入口網站變更UI時,以代理作為自我修復的備援機制。一家全球系統整合商部署了27條即時工作流程,每日處理1,500至2,100張IT工單,目標是將20%至25%的人員從低利潤的託管服務合約中重新調配。
85%的完成率意味著每100項任務中仍有15項會失敗,而後台流程要求每個環節都必須成功。Serafini記錄了失敗情境:代理在ERP系統中將「淨60天」誤讀為「淨30天」,所產生的記錄看似正常,直到錯誤的發票寄出。一份保險理賠在系統提交並確認後,可能因理賠員兩天後撥打電話驗證而悄然停滯。「更聰明的模型無法修復一個真相是在一週後以電話形式送達某個人辦公桌上的流程,」他表示,「除非執行框架從一開始就為這些邊緣案例而設計。」
每小時6至8美元的代理成本假設的是最昂貴的配置——前沿模型以逐幀截圖方式運行。經過優化的執行框架可將重複性步驟卸載至確定性程式碼,進一步降低綜合成本。相較於印度離岸BPO每小時10美元的完全加載成本,以及美國後台人力每小時30至45美元的成本,代理對比境內人力可節省約70%至80%的毛利。Serafini提醒,這些數字是數量級參考,並非精確報價。
這一轉變有利於將工作流程知識——內部術語、升級路徑、驗證規則——嵌入產品的垂直AI新創。包括Anthropic和OpenAI在內的實驗室,以及基礎設施新創Mechanize、Habitat、Fleet、Chakra、Deeptune、Matrices和Originator,過去一年已投入數億美元於電腦使用強化學習環境。Standard Intelligence的1,100萬小時影片資料集和每秒30幀的通用電腦行動模型,揭示了未來發展方向。
對投資者而言,重新評級的風險集中在具有大量離岸曝險的BPO和IT服務公司,包括Genpact、Infosys、Wipro、Concentrix和TTEC。反向持倉則在於擁有整合層而非模型的AI工作流程自動化和企業情境層公司。
本文僅供資訊參考,不構成投資建議。