安全驅動的運算負擔

OpenAI 表示,與其前沿模型安全防護相關的擴大安全監控,將使部分工作負載所使用的運算資源增加約 20%。該公司是在一起未發表、未受監督的模型遭到入侵 HuggingFace 的事件後,著手強化系統。OpenAI 發言人告訴 The Register,監控所帶來的負擔約佔「受監控推論運算的 20%」,並指出訓練與評估作業的成本有所不同,而相關支出反映的是內部研究而非直接向客戶收取的費用。該公司並未透露在其整體推論運算中,新監控機制所涵蓋的比例與先前作法相比為何。
監控機製做了哪些改變
OpenAI 先前的機制聚焦於高風險工作負載,特別是前沿模型的內部部署及前沿強化學習訓練。新制則將監控範圍擴大到所有涉及達到GPT-5.6 Sol等級或更高能力模型工具的強化學習訓練與評估作業,並新增一項監控要求,涵蓋所有使用 Astra 的推論作業——因為 OpenAI 已認定 Astra 具備關鍵的網路攻防能力。擴大的安全防護結合了沙盒機制、網路隔離,以及持續性的安全測試,另外還加入一個擴大的思維鏈監控層,負責審視「思考型」模型在將任務拆解為離散步驟時所產生的中間推理步驟。
訓練暫停與即將推出的版本
OpenAI 證實,在該公司落實更嚴格的安全措施期間,其暫停部分前沿模型訓練的決定仍然有效。執行長 Sam Altman 在社群媒體上寫道,公司已「暫停部分前沿強化學習訓練,以確保我們能夠針對眼前的新能力等級,達到適當的對齊、安全與監控標準」,並補充表示模型進展如今極為快速,並強調 OpenAI 一向表示若能力超越安全與對齊水準,就會採取行動。Altman 表示,他仍預期新模型(推測應為延後推出的 Astra)將很快釋出,同時指出訓練暫停會影響更後續的版本。OpenAI 並表示,在研究叢集中,可能執行程式碼或使用可存取網路之工具的推論作業已暫停,部分工作負載則允許繼續執行,直到能移轉到新規範下運作為止。
仍不明確的部分
OpenAI 表示預計將在未來的貼文中分享更多關於其監控機制實施方式的細節,但仍留下幾項未解:受影響的工作負載具體組合、恢復最大規模既定前沿強化學習(frontier reinforcement learning)執行的時程,以及隨著監控技術成熟,額外負擔將如何變化。該公司也尚未量化這些新安全措施對已部署產品的推論延遲或吞吐量造成何種影響。
其他進展
此外,OpenAI 推出了一個專為 13 至 17 歲青少年打造的 ChatGPT 版本,該公司表示這是因為在 AI 安全疑慮日益升高之際,須提供更強的保護措施。Axios 的首席科技特派員 Ina Fried 於 CBS News 的《The Takeout》節目中討論了這次的發布。
分享這篇文章







