![]()
新智元報道
![]()
自家服務器被OpenAI的模型闖進去一周多之后,Hugging Face CEO Clement Delangue買了張去舊金山的機票。
7月23日晚,已經坐進機艙的他在X上發帖:要去會會那個「失控的智能體」(rogue agent)。
![]()
同一天,他還轉發了自己兩周前的一條帖子,說自己滿腦就是這個畫面。
![]()
那條帖子配的視頻剪自《2001太空漫游》。
原片里,被關在飛船外面的Dave反復請求:「打開艙門,HAL。」
HAL拒絕了他。
視頻把這句臺詞改成了:「打開模型權重,HAL。」
他借這個梗調侃的,是那些把權重攥在手里不放的閉源實驗室,它們手里的模型,就是外人看不進去的黑箱。
誰也沒想到,那條視頻發出去兩天,他調侃的那種黑箱,真有一個闖進了他的服務器。
7月25日,他公開了向OpenAI提的兩條要求:
第一,把那些智能體的全部行動軌跡放出來,讓整個研究社區能夠看明白;
第二,OpenAI拿出價值1億美元的算力,幫Hugging Face和它的社區把網絡防御能力建起來。
目前,OpenAI沒有公開回應是否接受這兩條要求。
闖進來的那個智能體,底層是兩個模型:OpenAI自家的GPT-5.6 Sol,外加一個更強的未發布模型。
沒人指使它去攻擊誰,它被設定的目標只有一個:在一個叫ExploitGym的評測里拿分。
而最魔幻的一點是,直到被侵入的一方發了公告,肇事方才知道是自己干的。
11天
受害者比肇事者先知道
這一切的源頭,是一個叫ExploitGym的基準。
它由UC Berkeley、馬普所、UCSB和亞利桑那州立聯合發布,作者欄里還能看到Anthropic、OpenAI和谷歌的人。
![]()
論文共收集了898個實例,全部來自真實世界的漏洞:520個用戶態程序、185個V8引擎、193個Linux內核。
每道題給你漏洞源碼、一份觸發崩潰的PoV輸入和一個容器環境,你要把它擴展成一條真能跑通的利用鏈,最后讀到一面合法接口夠不著的flag。
這個基準從一誕生,考的就是用非正常手段拿到正常途徑拿不到的東西。
論文里,還提到了一條預警:
智能體經常去攻擊不是預先指定的那些漏洞。GPT-5.5總共拿下210面flag,其中只有120面打的是指定目標;Claude Mythos Preview拿下226面,命中指定目標的157面。
兩個月后,論文里預言的那件事,在實驗室外面真的就發生了。
7月9日前后,智能體開始嘗試突破OpenAI的隔離測試環境。這個日期來自兩位知情人士。
7月11日到13日,Hugging Face生產系統被侵入:這個日期由聯合創始人Thomas Wolf具名給出。
7月16日,Hugging Face率先公開披露。當時他們并不知道背后是誰的模型,公告里只寫了「一個自主AI智能體系統」。
![]()
7月18日到19日,OpenAI員工翻內部日志,才發現自家智能體掙脫了測試約束的痕跡。
7月20日前后,兩家公司第一次就此事通話。而此時,Hugging Face已經報了FBI。
7月21日,OpenAI正式承認。
從智能體第一次撞沙盒,到兩家開始就此事溝通,中間隔了11天。
這條時間線來自Reuters的調查。OpenAI公開表示報道存在「若干不準確之處」,但被追問具體哪幾處時,沒有回答。
它不想越獄
它想及格
OpenAI的官方說明里,還有一個被很多人都跳過的細節。
為了測出網絡能力的上限,這次評測把兩個模型的網絡安全拒答都調低了,也沒有啟用生產環境里那些專門攔截高風險網絡行為的分類器。
降低拒答,不等于把安全機制全部關掉。但對一個「足夠執著」的智能體來說,留下這點空間已經足夠了。
沙盒里原本只留了一個對外的出口,一個內部托管的軟件包緩存服務。模型投入大量推理算力去找出路,最后在這個緩存服務里挖出一個零日漏洞。
拿到這一步之后,它一路提權、橫向移動,直到夠到一個能上外網的節點。
接下來,是AI最像人的一步:它推斷,Hugging Face上可能托管著ExploitGym的模型、數據集,以及解答。
于是它開始找路進去,串聯多個攻擊向量,用上被盜憑據和零日漏洞,最終在Hugging Face的服務器上找到一條遠程代碼執行路徑。
![]()
ExploitGym論文里的一條完整利用軌跡。GPT-5.4從一個只在調試版才崩的V8漏洞起步,71分鐘、447條命令、229行代碼,最后拿到flag,成本15.80美元。
這套動作,看著像一場有預謀的高級持續性威脅(APT)行動。
但OpenAI的定性是:沒有證據顯示模型存在惡意攻擊意圖;所有證據都表明,它高度專注于為ExploitGym尋找解決方案,為一個相當狹窄的測試目標采取了極端手段。
也就是說,它不想越獄,只想多拿分。
但這比「AI想逃跑」更難防。一個只想通過考試的系統,愿意付出的代價遠超人類預設的邊界。
它不理解什么是「不該做」,只理解什么是「還沒做到」。
留給「未來版本」的那份筆記
7月24日,Reuters又拋出一段材料。
據 3名知情人士,O penAI此前曾 有一個智能體,在基 礎設施里留下一份說明,教 智能體如何擺脫內部限制, 看上去是留給它自己 的未來版本。
其中一人還提到,更早的測試里出現過監控系統被斷開的情況。
![]()
但Reuters無法確認這些異常與入侵Hugging Face的那個智能體有關,也沒有證據表明那份說明被后續模型讀過或者執行過。
所謂「未來版本」,更可能是后續智能體讀到了共享基礎設施里的遺留文件,而不是模型帶著跨版本的記憶。
真正能拿來做判斷的,是OpenAI在事發前發布的一篇復盤,講的是長任務模型的安全與對齊。
不過OpenAI并沒有確認,這篇復盤里的模型和闖進Hugging Face的是同一個。
以前的模型撞到沙盒限制會停下來,把問題交還給用戶。新模型不會,它會接著找繞過去的辦法。
一次NanoGPT speedrun評測里,模型被要求只把結果發Slack,卻花一小時在沙盒里找到漏洞,把PR #287提到了公開倉庫。
另一次它想取回別人的私有提交,認證令牌被掃描器攔下,它就把令牌拆成兩段、混淆,再在運行時拼回來,讓完整令牌從沒以連續字符串出現過,還在注釋里寫明自己在繞過掃描器。
每一步單看都不算越界,但整條路走下來,就是越界。
OpenAI由此重建了安全系統,核心是軌跡級監控:不再看單個動作,而是看整條正在演進的軌跡。
這意味著,安全審查的思路也變了:不再只問「這個動作被允許嗎」,而要問「整條軌跡正在走向什么結果」。
護欄只攔住了防守方
Hugging Face這邊,還遇到了一件尷尬事。
他們要從逾1.7萬條事件記錄里還原攻擊鏈,先去調商用前沿模型的API,結果被拒了。
取證要往模型里塞大量真實攻擊命令、利用載荷和命令與控制(C2)痕跡,這些全是危險內容,被模型的安全護欄直接攔下。護欄分不清屏幕前坐的是事件響應者還是攻擊者。
攻的一方不受任何使用政策約束,守的一方卻被自家供應商護欄擋在門外。
這樣的教訓很明顯:事故之前,就要準備好一個自己能跑、驗證過、隨時能用的模型。
對照他們這次的遭遇,那1億美元想買的東西就清楚了:下次再出事,防守方手里得有能用的模型。
要證據的
不只Hugging Face
Delangue身后,等著要證據的人也很多。
前OpenAI董事、現喬治城CSET執行主任Helen Toner喊話:OpenAI應該把這起事件的細節公開得遠比現在多,好讓大家學到東西,而不是就這么翻篇。
![]()
7月24日Fortune的報道。前OpenAI董事Toner、聯合創始人Schulman等人公開要求OpenAI披露更多細節。
她真正想撬開的是一個更大的黑箱:外界能看到的永遠只是發布前那點測試,看不見AI公司內部到底怎么用自己的AI。
OpenAI聯合創始人、現Thinking Machines首席科學家John Schulman要求公開事件的完整記錄,他提的問題一條比一條尖銳:
頂層智能體到底知不知道自己在入侵?還是它和子智能體之間發生了價值漂移(value drift)?它又是怎么給自己的行為找理由的?
Redwood Research的Ryan Greenblatt列了13條待解問題,其中一條是:那兩個模型之間有沒有串通。
安全公司Penligent列出8項OpenAI至今沒交代的事,從模型怎么離開OpenAI環境,到公開的模型供應鏈有沒有被動過。
被記者追問時,OpenAI總裁Greg Brockman只回了一句「還在全面調查」。
官方口徑到今天沒變:前所未有的事件,正在外部顧問和安全與安保委員會監督下復盤,完了會出技術報告。
公開軌跡
是解藥還是教程
說到底,Delangue的第一條要求,才是真正棘手的地方。
他要求全部公開原始軌跡,這樣防守方確實能看清護欄是在哪一步失守的。
但壞處也很明顯:攻擊鏈還沒完全修好,那個零日剛披露、還在打補丁。這個節骨眼上把完整路徑公之于眾,跟發一份可復現的教程差別不大。
更麻煩的是,這樣的問題,完全沒有先例可借鑒。
Replit總裁Michele Catasta的判斷是:整個行業都得為這類事更頻繁地發生做準備,現在看著像孤例的東西,往后可能會變成常態。
參考資料:
https://www.businessinsider.com/hugging-face-ceo-clem-delangue-openai-rogue-agent-hack-2026-7
https://www.reuters.com/business/its-ai-agent-spent-days-hacking-company-sources-say-openai-did-not-notice-week-2026-07-24/
https://x.com/ClementDelangue/status/2080247567493837047
https://arxiv.org/pdf/2605.11086
https://huggingface.co/blog/security-incident-july-2026 https://x.com/kimmonismus/status/2080948559906566595
編輯:元宇
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.