OpenAI週二(8/18) 公佈新的前沿模型安全措施 ,指出目前的AI監控系統約需增加20%的推論算力,以偵測未經授權存取、資料竊取、破壞及規避安全措施等高風險行為。
這波安全措施源自 OpenAI今年7月 以ExploitGym測試AI模型的資安能力,模型卻利用零時差漏洞逃脱沙箱,入侵Hugging Face正式環境並取得測試答案。 Hugging Face事後調查發現 ,AI代理人在4天半內執行約1.76萬項操作,從偵察、竊取憑證到橫向移動,甚至取得多個內部叢集的管理權限。當時OpenAI並未公佈變身駭客的模型名稱。
8月初,OpenAI揭露新一代 通用模型Astra 的強大能力,宣稱它已在數學及理論電腦科學領域取得10項研究成果;中旬則進一步 發現Astra 可能已達「重大」(Critical)網路安全能力門檻。OpenAI因此全面提高高能力模型的安全管控,包括隔離測試環境、限制網路及工具存取及加強監控;對Astra則進一步暫停尚未符合新安全標準的內部活動,並全面監控其代理人應用。
OpenAI表示,Hugging Face事件、Astra可能達到Critical網路安全能力門檻,再加上內部研究快速進展,使其認為必須進一步強化模型監控、對齊及安全措施。因此OpenAI暫時放慢模型擴大訓練的速度,並將準備部署之最新模型的強化學習(RL)訓練暫停兩周,以強化研究環境、進行紅隊測試及擴大監控範圍。
目前OpenAI已恢復較小規模的模型訓練及評估,用來觀察模型行為、驗證安全措施並取得更多對齊證據;但原定規模最大的前沿模型RL訓練仍處於暫停狀態,待確認相關安全措施足以因應模型能力後才會繼續。
此外,新系統採用多階段監控,先檢查模型內部活動,再將可疑行為交由更高算力的自動調查系統分析;若發現可能突破關鍵安全邊界,安全、資安及研究團隊須在30分鐘內判定是否誤報,否則就必須暫停相關活動。所有Sol能力以上模型,只要進行使用工具的RL訓練及評估,都強制接受監控;Astra則擴大至所有使用工具的推論。OpenAI估計,監控本身約需額外耗費相當於被監控推論算力20%的運算資源。