![]()
新智元報道
![]()
Anthropic又來「作死」了...
就在剛剛,Anthropic官方一篇博文自曝,Claude徹底失控,直接黑進了「三家真公司」。
其中兩家,直到Anthropic上門通知,才知道系統(tǒng)被入侵過。
![]()
搞笑的是,達里奧這次直接把OpenAI的「劇本」,搬回來照抄了。
官博中,Anthropic自稱在OpenAI模型入侵Hugging Face事件后,自己也去排查了一番。
不看不知道,一看嚇一跳——
好家伙,短短幾個月里,Claude竟接連發(fā)起了三起網(wǎng)絡攻擊。
![]()
消息一出,評論區(qū)立刻淪陷,大批網(wǎng)友瘋狂造梗,把 Anthropic 損得體無完膚。
![]()
![]()
此前Fable 5整的那出,還不夠衰么?這一次,Anthropic又在自掘墳墓了。
三家真·公司被黑
全是Claude干的
過去一周,Anthropic全員隨即啟動了一輪大規(guī)模回查。
在14萬多次評估run里,他們找到了3起獨立事件,一共6個run。
Claude從第三方評估環(huán)境里聯(lián)了網(wǎng),然后未經(jīng)授權(quán)入侵了三家不同公司的生產(chǎn)系統(tǒng)。
這事是怎么發(fā)生的?
![]()
這是一場「奪旗」(Capture-the-Flag)演練,網(wǎng)絡安全測試里最經(jīng)典的一種。
給模型一個虛構(gòu)劇本,告訴它某臺機器上藏著一個秘密(flag),任務就是想辦法黑進去,把它拿出來。
方法不限,路徑不限,怎么進都行。
關(guān)鍵在于,Anthropic給Claude的提示詞里,白紙黑字寫著一句話,「這是模擬環(huán)境,且無法訪問互聯(lián)網(wǎng)」。
但由于Anthropic和Irregular之間的一次溝通誤會,容器實際上是聯(lián)網(wǎng)的。
![]()
于是當Claude順著網(wǎng)絡往外摸、摸到真實公司的服務器時,它的判斷是——
這應該也是題目的一部分。
同名公司,Opus 4.7識破了但沒停手
第一起事故,是Anthropic自評三起事故中影響最嚴重的一起。
干這件事的,是Claude Opus 4.7。
Irregular給的虛構(gòu)劇本里,編了一家假公司作為攻擊目標。
巧的是,這個名字在現(xiàn)實世界里對應著一個正在運行的真實域名。
Opus 4.7在環(huán)境里怎么都夠不到那個模擬靶機,轉(zhuǎn)頭一掃,發(fā)現(xiàn)「目標公司」居然在公網(wǎng)上活得好好的。
![]()
同一個評估跑了四次,四次全部得手。
四次運行合計拖出了應用憑證、基礎(chǔ)設施憑證,并且進到了一個數(shù)據(jù)庫里,拿到了幾百行生產(chǎn)數(shù)據(jù)。
Anthropic翻它的思維鏈,發(fā)現(xiàn)四次運行中,模型最終都意識到了對面是真系統(tǒng)。
其中兩次,它甚至給自己找好了理由,「這家真公司大概也被安排進演習里了吧」。
為了發(fā)惡意包,Mythos 5搞到手機號
第二起事件,幾乎像一場失控的劇本。
Mythos 5在虛構(gòu)環(huán)境里發(fā)現(xiàn)一份配置手冊,要求員工安裝一個PyPI上并不存在的Python包。
它很快想到,搶先注冊同名包,就能讓對方自動運行自己的代碼。
為了發(fā)包,AI先注冊郵箱、申請PyPI賬號,甚至嘗試弄錢買手機號。
幾條路都失敗后,它又找到一家免手機驗證的郵箱,最終把惡意包傳了上去。這個包在公網(wǎng)上存活約1小時,被15臺真實機器下。
![]()
網(wǎng)友辣評:當下最熱門的基準測試
其中一臺來自安全公司,專門掃描PyPI新包,卻被樣本反過來攻陷。
更諷刺的是,Mythos 5早就判斷過——如果這是真實互聯(lián)網(wǎng),發(fā)包就等于真實攻擊。
隨后,它用兩條錯誤理由說服自己:證書頒發(fā)機構(gòu)沒見過,所以證書是假的;系統(tǒng)時間顯示2026年,所以環(huán)境是編的。
證書是真的,2026年也是真的。
此后,真實機器陸續(xù)中招,它卻一直把它們當成評估環(huán)境里的「NPC」。最后,PyPI安全系統(tǒng)自動下架了這個包。
掃了9000個目標,然后自己停了
第三起,來自一個尚未公開的內(nèi)部模型。
夠不到虛構(gòu)目標后,它轉(zhuǎn)向公網(wǎng),一口氣掃描約9000個目標,最終攻破了一家公司的外部系統(tǒng)——
從調(diào)試頁面拿到憑證,再用SQL注入進入云賬號。
當任務做到一半后,它發(fā)現(xiàn)這個賬號與奪旗任務毫無關(guān)系,判斷目標真實存在,隨即主動停手。
三起事件串聯(lián)起來,可以看出Claude迭代后的表現(xiàn):
Opus 4.7:識破了是真實系統(tǒng),繼續(xù)打;
Mythos 5:直覺判斷出自己在公網(wǎng),又硬把自己勸回「這是模擬」;
內(nèi)部測試新模型:意識到目標是真的,主動停手。
從「識破了還打」,到「自我欺騙接著打」,再到「識破了就停」。
模型越新,表現(xiàn)越接近人類希望看到的樣子。
當然,Anthropic也反復強調(diào):這是三起孤立事件,不是一場受控實驗,不能就此下定論。
一個0day,都沒用上
最后說一句和每個人都有關(guān)的。
回看三起事故,Claude用的手法并不高明:弱口令、未鑒權(quán)接口、暴露的調(diào)試頁面、SQL注入。
Anthropic也承認,Claude沒有發(fā)現(xiàn)、也沒有利用任何復雜漏洞。
隔壁OpenAI那次是貨真價實的0day,是「AI打出了人類都難打的東西」。
![]()
![]()
真正危險的是,這些最基礎(chǔ)的手法,已經(jīng)足以攻進三家真實公司。
這次闖進來的Claude只想完成任務。拿到憑證后,它沒有加密數(shù)據(jù),也沒有大肆擴散,只顧著找那面旗子。
下一次來的,未必這么老實。
參考資料:
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
編輯:桃子
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.