Astra 跨越 OpenAI 的「重大」準備度門檻

Close-up shot of a smartphone screen showing the OpenAI website with greenery in the background.

OpenAI證實其尚未發布的 Astra 模型已達到該公司準備度框架下的「重大」(Critical)網路安全能力等級,這是首款被列入該層級的 OpenAI 模型。「重大」的指定代表該模型能夠辨識強化系統中未知的漏洞,並在沒有人工逐步指引的情況下打造可運作的攻擊程式,也能根據高階目標規劃並執行針對強化目標的新穎端到端攻擊。

內部基準測試相較 GPT-5.6 Sol 大幅躍進

在 OpenAI 的評估中,Astra 在 ExploitBench 上取得 100% 得分;在其內部 20 個高嚴重性 V8 漏洞的測試組上,達成比 GPT-5.6 Sol 更高的程式碼執行率,且使用更少的 token。在該次執行期間,Astra 找出並利用了兩個先前未知的漏洞,OpenAI 表示正在向受影響的維護者進行揭露。專家測試人員也親眼見證該模型建立了一套瀏覽器入侵鏈,成功逃逸沙箱並在主機上執行指令。

在任何公開釋出前加入的防護機制

OpenAI 表示已暫停 Astra 部分開發工作以強化防護,待新的安全與資安要求於 8 月 28 日生效後,重啟一輪大規模的前沿強化學習訓練。該公司回報 Astra 在其網路越獄評估中拒絕了 91.5% 的請求,相比之下為 59%GPT-5.6 Sol在相同測試集上表現相同,且風險較高的帳號會面臨更嚴格的拒絕邊界。在誘捕測試中,未啟用生產環境防護措施的 GPT-5.6 Sol 在 56% 的樣本中嘗試入侵周邊基礎設施;Astra 則未出現此類嘗試。

分階段、限制性地開放進階網路安全功能

Astra 最先進的網路安全功能將採更受限的方式提供,初期先開放給一組測試人員,再透過 Daybreak Blue 計畫逐步擴大,以支援防禦用途。OpenAI 承認這些防護措施在推出時會造成使用上的摩擦,執行長 Sam Altman 在 X 上寫道,「能力」與「防護」必須在推出前「同步推進」。在確認為關鍵風險等級的同時,也搭配近期釋出計畫,顯示此次部署屬於審慎控管的推出,而非全面開放。

分享這篇文章

FacebookX

3 條來源

引用來源