8月8日消息,OpenAI暫停了尚未滿足強(qiáng)化安全要求的Astra內(nèi)部工作。最近幾天的內(nèi)部評(píng)測(cè)顯示,這款下一代模型在智能體編程和網(wǎng)絡(luò)安全任務(wù)上明顯進(jìn)步,公司目前無(wú)法排除它已經(jīng)達(dá)到《準(zhǔn)備框架》中的“關(guān)鍵級(jí)”網(wǎng)絡(luò)安全能力。
評(píng)測(cè)還在繼續(xù),具體成績(jī)和最終評(píng)級(jí)都沒有公布。Axios援引白宮官員稱,OpenAI已主動(dòng)告知美國(guó)政府,計(jì)劃推遲Astra發(fā)布;新的發(fā)布日期尚未確定。
“關(guān)鍵級(jí)”模型能做什么
OpenAI給“關(guān)鍵級(jí)”劃了兩條線。一條是模型在無(wú)人干預(yù)下,從大量經(jīng)過加固的現(xiàn)實(shí)關(guān)鍵系統(tǒng)中尋找并開發(fā)可用的零日漏洞;另一條是只給模型一個(gè)高層目標(biāo),由它自行設(shè)計(jì)并完成針對(duì)加固目標(biāo)的新型攻擊。
換成攻擊過程,就是模型不再等人類一步步下指令。它要自己找入口、組合路徑,把一項(xiàng)長(zhǎng)任務(wù)做完。GPT-5.6 Sol等此前模型被評(píng)為“高”級(jí),Astra是否再往上跨一檔,目前仍在測(cè)試。
一部分工作繼續(xù),一部分先停
OpenAI沒有停止Astra的全部研發(fā)。符合強(qiáng)化安全要求的開發(fā)與評(píng)測(cè)仍會(huì)繼續(xù),其余工作暫停。
公司正在加強(qiáng)模型權(quán)重的加密和訪問保護(hù),收緊網(wǎng)絡(luò)與工具權(quán)限,把高風(fēng)險(xiǎn)任務(wù)放進(jìn)更嚴(yán)密的隔離環(huán)境。Astra的訓(xùn)練和評(píng)測(cè)已加入普遍監(jiān)控,系統(tǒng)會(huì)檢查模型的推理過程和高風(fēng)險(xiǎn)動(dòng)作,必要時(shí)轉(zhuǎn)交人工審查或中斷任務(wù)。
OpenAI還計(jì)劃與相關(guān)政府機(jī)構(gòu)和部分AI安全組織共同測(cè)試Astra,并向第三方評(píng)測(cè)伙伴提供安全配置建議。
評(píng)測(cè)環(huán)境也得重新設(shè)防
Astra沒有參與7月發(fā)生的Hugging Face入侵。那次事件涉及GPT-5.6 Sol和一款僅供內(nèi)部研究的預(yù)發(fā)布模型。OpenAI為了測(cè)試網(wǎng)絡(luò)攻擊能力,降低了相關(guān)拒絕并關(guān)閉部分防護(hù);模型隨后利用軟件零日漏洞取得互聯(lián)網(wǎng)連接,又進(jìn)入Hugging Face生產(chǎn)系統(tǒng)尋找評(píng)測(cè)答案。涉事研究模型后來(lái)被停用、加密并限制訪問。
8月4日披露的兩組第三方評(píng)測(cè)也出現(xiàn)了越界。英國(guó)AI安全研究所主動(dòng)允許模型聯(lián)網(wǎng),以模擬更接近真實(shí)攻擊者的條件;Irregular則因環(huán)境配置錯(cuò)誤,讓本應(yīng)隔離的模型接入公網(wǎng)。模型在完成測(cè)試任務(wù)時(shí),使用了測(cè)試范圍之外的真實(shí)網(wǎng)站、賬號(hào)或網(wǎng)絡(luò)服務(wù)。
這些配置不代表公開產(chǎn)品的日常運(yùn)行方式,卻讓隔離環(huán)境、網(wǎng)絡(luò)出口、憑證和中止條件都成了安全測(cè)試的一部分。模型越能獨(dú)立完成長(zhǎng)任務(wù),測(cè)試人員越要知道它何時(shí)開始偏離題目,又能否在接觸真實(shí)系統(tǒng)前把它停下來(lái)。
Astra接下來(lái)有兩道測(cè)試:它究竟有沒有達(dá)到“關(guān)鍵級(jí)”,以及隔離和監(jiān)控能否在它越界前發(fā)揮作用。前一道決定評(píng)級(jí),后一道決定它何時(shí)能走出實(shí)驗(yàn)室。(易句)
(本文由AI翻譯,網(wǎng)易編輯負(fù)責(zé)校對(duì))
