技術

OpenAI發布Astra:稱其為最安全的AI,卻隱藏推理過程

Adrian Kessler

Astra 在程式碼、安全分析、電腦操作以及多步驟專業任務中,以超越 OpenAI 先前模型 Sol 與 Anthropic 的 Fable 的速度與準確度運作,在標準軟體工程基準測試中表現更佳。OpenAI 形容這是該公司首個跨越網路安全能力「關鍵」等級的模型:它能以前所未有的規模與速度,找出並開發先前未發現的安全漏洞之利用方法,沒有任何人類團隊能匹敵。

背後機制是一項名為「不透明遞迴」的技術。標準語言模型會以可讀文字產生其推理過程——也就是研究人員用來審查決策、抓出錯誤、並驗證模型是否如預期運作的思維鏈。Astra 則在運作時不產生那些文字。它能解決艱難問題,卻不留下任何可讀的過程痕跡。OpenAI 首席科學家 Jakub Pachocki(雅各布·帕霍茨基)承認了這項轉變:他表示,能力更強的模型可以「用更少的語言符號執行更困難的任務」,而監控難度也隨之增加。

這就造成了一個結構性問題,而 OpenAI 自己的說法讓這個問題更加明顯。OpenAI 形容 Astra 是迄今「最符合人類意圖的模型」。符合人類意圖(alignment)——這門工程學科旨在讓 AI 系統按照設計者的意圖運作——過去一直依賴於逐步閱讀模型正在做的事。一個以隱形方式推理的模型,使得其自身是否符合意圖變得無法透過那種方法驗證。OpenAI 並未公開說明在部署前,它使用哪種替代方法來驗證 Astra 的行為。

OpenAI 總裁 Greg Brockman(格雷格·布羅克曼)形容 Astra 是「世代級飛躍」,並被直接問到這是否代表通用人工智慧(AGI)。他的回答是:原本管轄 OpenAI 與微軟合作關係的合約 AGI 定義已不再適用。他說,AGI 如今是一個「精神概念」。這個框架很重要。OpenAI 與微軟的協議中包含與 AGI 相關的條款——即當某些條件成立時,雙方關係的條款會發生變化。將 AGI 描述為未定義,就能讓這些條款保持休眠狀態,無論 Astra 實際能力如何。

存取權限首先開放給 Daybreak——OpenAI 經審查的網路安全計畫——這是一個被 OpenAI 框架為「防禦優先部署」的結構。其邏輯是:在自家系統中尋找漏洞的組織,比那些在他人系統中尋找漏洞的組織更早獲得這項能力。這個邏輯只有在存取控制仍然有效時才成立。Astra 的零日漏洞識別能力,正是一個資源充足的攻擊者會想要的東西。一個沒有可讀思維鏈的推理模型,在出錯後也更難被約束或審查。

更廣泛的存取權限將於未來一週內陸續開放給付費層級——Pro、Plus、Enterprise、Business——以及透過 API 提供。

標籤: , , , , ,

討論

共有 0 則留言。