OpenAI 的 Astra 模型將採用「遞迴深度」推理技術,使其思維鏈更難以監控,這引發了 AI 安全研究人員對整個產業陷入不透明推理競賽的擔憂。
OpenAI 的 Astra 模型將採用「遞迴深度」推理技術,使其思維鏈更難以監控,這引發了 AI 安全研究人員對整個產業陷入不透明推理競賽的擔憂。

OpenAI 的 Astra 模型將透過一種名為「遞迴深度」(recurrent depth)的技術進行推理,此技術繞過了大多數推理系統所採用的循序思維鏈(chain-of-thought),使其內部邏輯更難追溯——這一轉變已讓 AI 安全研究人員警告,整個產業正陷入一場不透明推理的競賽。
「我對 Astra 採用不透明遞迴(opaque recurrence)的報導感到極度擔憂,」非營利 AI 安全組織 Redwood Research 執行長 Buck Shlegeris 在新聞發布後發文表示。「如果 OpenAI 進一步推動此技術,他們將有能力大幅增加遞迴程度,徹底摧毀思維鏈的可監控性。」
這項技術也被稱為「不透明遞迴」,由《The Information》於週二率先報導。該模型並非產出一連串可辨讀的推理步驟,而是在迴圈中多次處理相同的查詢,留給外部觀察者檢查的痕跡更少。據報導,Astra 對該方法的使用程度有限——其思維鏈預期仍可辨讀——而 OpenAI 也已反駁任何關於其將轉向「神經語」(neuralese,即研究人員擔憂的難以理解之內部表徵)的說法。
此事的影響層面遠不止單一模型。Redwood Research 首席科學家 Ryan Greenblatt 表示,不透明推理可能比傳統思維鏈擴展得更快,甚至可能將推理徹底移出可視管道。「我最大的擔憂是,從這裡自然發展下去,會將不透明推理擴展到模型完全或幾乎完全在潛在空間中推理的程度,」Greenblatt 寫道。「我希望現在還不算太晚,能夠避免最令人擔憂的架構,也希望 OpenAI 能在這裡止步。」
此警訊反映出更廣泛的張力。思維鏈日誌雖然只是模型推理的不完美表徵,卻已成為核心安全工具——它們幫助研究人員理清 OpenAI 的失控代理在近期事件中的行為原因。而不透明遞迴恰恰在模型能力日益增強的同時,侵蝕了這份可視性。
OpenAI 試圖平息此項擔憂。首席科學家 Jakub Pachocki 重申了實驗室對可辨讀思維鏈的承諾。「從我們最早期的推理模型開始,OpenAI 就一直致力於保存並利用思維鏈監控,」Pachocki 寫道。「這是我們當前研究計畫的核心目標之一。」該公司也宣布,作為其前瞻性安全計畫的一部分,將展開廣泛的思維鏈監控措施。
競爭的賭注正在加劇。在週三的後續報導中,《The Information》指出 Anthropic 和 Google DeepMind 都已在討論這項技術——這表明不透明遞迴可能成為下一代推理模型的標準配置,而非 OpenAI 的獨特做法。Astra 預計將以 ChatGPT 6 之名在 9 月 3 日至 10 日的發布窗口推出,據報導其擁有約 10 兆個參數,直接對標 Anthropic 的 Claude 及 Google 的 Gemini 系列。
安全倡議人士認為,此動態可能迫使產業陷入競相向下沉淪的局面。長期關注 AI 安全的作家 Zvi Mowshowitz 表示,可能需要法律來阻止實驗室在不透明性上相互競爭。「這項技術是在玩火,正冒著破壞 OpenAI 和 Anthropic 辛苦建立的禁忌風險——雙方一直努力維持思維鏈的忠實性與可監控性,能撐多久算多久,」Mowshowitz 寫道。
所有 AI 模型都會進行一定程度的模糊推理,也很少有研究人員將思維鏈日誌視為模型思考的直接紀錄。但令人擔憂的是,Astra 的架構使這種不透明性成為一種設計選擇,而非副產品——而且隨著這項技術擴散至競爭對手,其影響可能層層疊加。
對投資人而言,問題在於不透明性是否會成為一種負債。OpenAI 的估值及其在 AI 領導者中的地位,部分取決於市場對其安全立場的信任,而監管機構和企業買家對此日益看重。如果模糊遞迴引起政策制定者的關注——或者如果一起高調的失誤在弱化的監控之下悄然發生——其聲譽成本可能超過任何能力增益。相比之下,Anthropic 和 Google DeepMind 若能守住透明度底線,則可將可辨讀推理作為差異化賣點進行行銷。
本文僅供參考,不構成投資建議。