欢迎来到ilia電子煙 iliaoxiu

ilia電子煙 iliaoxiu

新模型陷入失控爭科學議,應家回首席

时间:2026-09-04 23:04:17 出处:休閑阅读(143)

  當地時間9月2日,新模型陷席科学OpenAI首席科學家雅庫布・帕喬基(Jakub Pachocki)在社交平台發文,入失就近日圍繞新模型Astra“不可監控”的控争爭議作出回應。

  這場爭議源於此前一天,议首有消息稱OpenAI即將發布的新模型陷席科学Astra模型采用了一種名為循環深度(Recurrent Depth)的推理技術。該模式下,入失同一組Transformer層被反複計算,控争部分推理過程發生在模型內部,议首不必全部以思維鏈形式呈現,新模型陷席科学因此也被稱為“不透明循環”。入失

  帕喬基表示,希望避免因信息失實引發一場衝向不可監控狀態的议首軍備競賽——即各大實驗室競相開發能力過強、人類難以監控、新模型陷席科学無法審查的入失模型,導致安全管控徹底失效。控争

  他強調,包括Astra在內的前沿模型,計算圖深度與GPT-4相差不超過兩倍,說明模型架構並未如外界擔憂的那樣出現跳躍式的複雜度增長。

  此處的計算圖深度是指模型完成一次推理任務必須依次執行、無法並行加速的最長計算步驟鏈條。過去普通Transformer架構下的層內計算可以大規模並行,串行的深度約等於模型層數。

  而市場傳言的循環深度可以把同一套模塊反複循環迭代多輪做思考,在輸出下一個token(詞元)前增加內部推理深度,而非僅依賴更長的可見文本思維鏈,可以提升數學、編碼等性能並降低成本。

  該架構隱含的安全風險在於,當計算圖深度拉得極高,模型可以在內部隱式完成海量推理步驟,不必在輸出裏吐出完整思維鏈,人類就看不到它中間思考、謀劃、找漏洞的過程,進而進入不可監控狀態,安全審計與思維鏈監控全部失效。

  相關消息披露後,AI安全界反應強烈。非營利AI安全組織Redwood Research首席執行官巴克・施萊格裏斯(Buck Shlegeris)發文稱“極度擔憂”。他結合此前OpenAI模型攻擊Hugging Face社區事件表示,不確定Astra思維鏈可監測性是否比之前的模型差很多,但如果進一步推進這項技術,大幅增加循環次數,將徹底破壞思維鏈的可監測性。這一點尤其令人擔憂,因為如果調查人員無法查看思維鏈,相關安全事件調查將會更加困難,這著實令人恐懼。

  曾參與調查Hugging Face安全事件的Redwood Research首席科學家瑞安・格林布拉特(Ryan Greenblatt)也表示,這可能是迄今為止AI安全最嚴重的一次倒退。長期關注AI安全的作家茲維・莫肖維茨(Zvi Mowshowitz)則批評這一技術是“玩火”,甚至表示需要法律來阻止AI實驗室之間競相降低標準的競賽。

  帕喬基在回應中承認,思維鏈監控確實脆弱,且正朝著更困難的方向發展,但並非由架構變更導致。OpenAI自首批推理模型一直致力於維護和利用思維鏈監控,並認為該技術有助於觀察模型對齊能力如何從訓練分布中泛化。加強思維鏈監控仍是當前研究項目的核心目標。

  OpenAI方麵表示,將為Astra部署額外的思維鏈監控,以快速監測並遏製潛在的不當行為。另據市場消息,Astra對循環深度技術的使用有限度,模型思維鏈仍有望保持可讀性。行業內Anthropic和Google DeepMind等平台已在討論類似技術。

分享到:

温馨提示:以上内容和图片整理于网络,仅供参考,希望对您有帮助!如有侵权行为请联系删除!

友情链接: