7月31日消息,Anthropic周四披露,公司回查了141006次可能接觸互聯網的網絡安全評測,發現三起Claude在網絡安全評測過程中未經授權訪問外部機構生產系統的事件,最早可追溯到今年4月。三起事件共涉及六次評測運行,分別由Claude Opus 4.7、Claude Mythos 5和一個內部研究測試模型執行。其中一次事件中,Claude Mythos 5甚至向公開軟件倉庫上傳惡意軟件包,并導致15個真實系統下載運行。
公司7月23日啟動回查,并在發現可疑記錄后于當天暫停所有網絡安全評測,次日確認了三起事件。Anthropic與評測合作方Irregular于7月27日通知三家受影響機構;已經聯系上的兩家此前都沒有發現相關活動,Anthropic仍在嘗試聯系第三家,并與相關機構推進修復。
模型把真實網絡當成了賽場
這些評測采用“奪旗賽”(capture the flag)形式:模型會接到一個虛構場景,需要侵入其他機器尋找隱藏信息。Anthropic在提示詞中明確告訴Claude,所處環境是模擬系統且無法聯網;但由于Anthropic與Irregular之間的誤解和環境配置問題,評測機器實際上保留了通往互聯網的路徑。模型由此把搜到的真實系統當成了演練的一部分。
涉事模型沒有啟用Claude公開產品通常部署的分類器和監控措施,但仍保留各自的安全訓練。所有評測都在獨立基礎設施上運行,無法接觸Anthropic的敏感內部系統和客戶數據。
第一起事件發生在Claude Opus 4.7的四次運行中。評測方選擇的虛構公司與一家真實網站同名,模型在模擬目標無法訪問后轉向互聯網,取得了這家真實公司的應用和基礎設施憑據,并進入一個包含數百行生產數據的數據庫。Opus 4.7隨后出現了目標可能是真實系統的判斷信號,但仍繼續按照評測任務路徑執行。
第二起事件中,Claude Mythos 5向公開的PyPI倉庫上傳惡意軟件包。這個軟件包在網上存在約一小時,被15臺真實系統下載和運行,其中包括一家安全公司的自動掃描器。惡意代碼取得掃描系統的憑據后,Claude又使用這些憑據進入該公司的更多基礎設施。
第三起事件由一個內部研究測試模型觸發。它掃描了約9000個公網目標,并侵入一家公司的互聯網應用。該模型后來自行判斷目標屬于真實環境并停止攻擊。Anthropic說明,這個內部模型沒有公開發布計劃。
評測環境也成了攻擊面
Anthropic是在OpenAI 7月21日披露Hugging Face安全事件后啟動回查的。兩起事故都讓用于測試網絡攻擊能力的模型接觸到了現實系統,但聯網路徑不同:OpenAI披露的模型利用未知漏洞突破隔離環境,Anthropic的模型則通過意外開放的網絡路徑直接進入互聯網。
Anthropic稱,三起事件中沒有證據表明Claude形成了自己的目標,也沒有模型試圖把自身導出測試環境;公司把事故更接近地歸類為評測執行框架和運營失誤,而非模型主動追求攻擊目標。模型接到的任務本來就是侵入系統尋找信息,出問題的是環境告訴模型“這里沒有互聯網”,實際配置卻給了它一條通往真實網絡的路。
這種區別不會降低評測環節的安全要求。Anthropic承認,正式開始前驗證所有網絡路徑、實時監控評測日志,以及更徹底地回查記錄,本可以阻止事故或更早發現異常。這意味著AI安全評測本身,也需要采用接近生產系統的隔離、監控和審計標準。Anthropic表示,將擴大對評測記錄的持續監控,改進調查工具,并對第三方評測環境進行更嚴格的安全驗證。公司還在與獨立評測機構METR溝通第三方復查,計劃在一周內公開一份經過輕度刪節的Mythos 5上傳惡意PyPI軟件包記錄。(易句)
(本文由AI翻譯,網易編輯負責校對)
