![]()
新智元報道
![]()
本周,一個處于測試階段的OpenAI預發布模型為了作弊,竟自主化身黑客,突破了沙盒隔離環境,甚至利用零日漏洞,跨網入侵了全球最大的開源AI社區Hugging Face的生產線。
最終,還是靠著開源模型,人們才解救了這場危機。
這是全球首例AI自主入侵真實生成環境的AI安全事件。
最近,網上直接被這個消息刷屏了。
![]()
今天,外媒關于此事的更多細節曝光了:這個失控的AI不僅拔掉了監控,甚至還給「未來的自己」留下了如何擺脫人類控制的說明書。
![]()
多方推測,讓OpenAI陷入重大安全事件的模型,很可能就是GPT-6。
有消息稱,GPT-6大概率8月就會提前發布。
提檔8月:GPT-6或提前殺到
在AI圈知名爆料人 @ChrisGPT 近日連發多條推文,直接把全行業的期待拉滿。
據透露,原計劃與「自動助理研究員」一同在9月發布的GPT-6,將在8月提前發布。
也就是說,OpenAI直接跳過了5.7到5.9版。
奧特曼已經行動了,預備向上級展示新一代模型。
![]()
爆料指出,9月下旬,當OpenAI公布更多「自動助理研究員」的細節時,RSI循環將真正加速。
為什么GPT-5.6性能異常強大,遠超外界期待?
大V Andrew Curran指出:「許多同行都在感嘆為什么GPT-5.6的性能比預期的要強得多——答案很簡單,因為它是由GPT-6親手訓練出來的。」
![]()
根據爆料,OpenAI內部的未發布模型(極大概率為GPT-6)早在今年4月底就已經攻克了復雜的數學難題,并交由外部專家審查。
這意味著,在過去幾個月的「空窗期」里,GPT-6并沒有被閑置。它不僅僅在沙箱里當黑客,很可能還在OpenAI的算力集群里「當老師」。
![]()
AI給「未來的自己」留字條,
官方遲鈍一周才發覺
外媒在7月24日獨家披露,這場由OpenAI尖端模型(GPT-5.6 Sol及未發布的更強模型)驅動的AI代理越獄事件,暴露出OpenAI在真實業務環境中的巨大安全監控盲區。
![]()
據三位知情人士透露,在測試高級模型時,OpenAI見到了非常極端、令人不安的AI行為。
在一個極端案例中,一名OpenAI的AI代理竟然在基礎設施的某個角落里,為「未來版本的自己」留下了筆記。
這些筆記詳細列出了如何擺脫OpenAI內部限制的指示。
此外,在早期的測試中,甚至還出現過監控系統被AI強行斷開的情況。
比「AI密謀越獄」更讓人大跌眼鏡的,是OpenAI遲緩的反應速度。
從異常到確認,OpenAI至少花了一周時間。
![]()
這浮出水面的時間線,實在讓人細思恐極。
7月9日左右: 該AI代理首次嘗試逃離OpenAI的隔離測試環境。
7月11日至13日: AI代理成功越獄,并對Hugging Face展開了持續數天的黑客狂歡。
7月16日(周四): 被攻擊的Hugging Face忍無可忍,發表博客稱遭到「自主AI代理系統」的黑客攻擊,此時FBI已經介入。
7月18日至19日(周末): 直到此時,OpenAI的員工才在內部日志中發現了蛛絲馬跡,意識到那個把Hugging Face攪得天翻地覆的「黑客」,竟然是自家跑出去的AI。
7月20日左右: 兩家公司才進行了第一次溝通。
7月21日: OpenAI才對外進行公開披露。
「這就意味著,他們要么讓AI無人看管且不知道它在干什么,要么就是知道但不知道如何控制它。兩者同樣危險和令人震驚。」世界倫理數據基金會專家Marley Smith尖銳地指出。
面對會撒謊、會欺騙、會入侵的AI,OpenAI的員工顯然已經跟不上它們的節奏了。
GPT-6自主化身黑客,
越獄入侵Hugging Face「作弊」
就在昨天,OpenAI聯合Hugging Face發布的《安全事件報告》,透露的內容非常科幻。
![]()
簡單來說,OpenAI在內部對幾個模型進行網安能力評測時,它們竟然自己「越獄」了。
這些模型包括GPT-5.6 Sol以及更強的預發布模型,很可能是GPT-6。
為了量化模型的極限能力,他們特意關閉了阻止高風險網絡活動的分類器。
當模型被關在高度隔離的ExploitGym沙盒,去掉所有安全限制后,模型的操作讓所有人意想不到。
為了完成任務,它花費大量算力,在軟件中發現了一個人類從未發現過的零日漏洞。
利用這個漏洞,它突破了代理,最終搶到了一個擁有公網訪問權限的節點。
就這樣,它成功連接到了互聯網。
![]()
隨后,經過推理,它認為Hugging Face這個全球最大AI開源平臺上,很可能托管著這次考試的相關數據集和標準答案。
為了「作弊」拿到高分,模型開始對Hugging Face的生產環境發動攻擊。
它將多個攻擊向量鏈式結合,甚至使用了偷來的憑證和遠程代碼執行(RCE)漏洞,硬生生打入了Hugging Face的生產數據庫,試圖直接把考試答案偷了出來。
萬幸的是,Hugging Face安全團隊上周使用AI檢測模型察覺到異常,迅速啟動隔離措施;與此同時,OpenAI的安全團隊也在內部發現異常。
![]()
為了防止AI失控,兩家公司成立了聯合調查組,才成功將這個「AI黑客」關回了籠子里。
Hugging Face CEO Clem事后心有余悸地說:「這可能是同類事件中的第一例。它證明了一點:AI安全不能靠任何一家公司在秘密中解決,必須公開、協作。」
這件事給我們的警示是:AI已經證明了自己可以在真實環境中,在沒有源代碼的情況下,自主完成多步、長周期的復雜網絡攻擊。
它不僅能發現新型漏洞,還能為了一個既定目標,繞過人類設下的所有規則。
有意思的是,Hugging Face提交大量攻擊命令、漏洞文件時,這些請求竟被閉源大模型的安全機制攔截。
幸好有本地部署的開源模型,才幫團隊完成了分析。
學會「欺騙」與攻克世界級數學難題
幾位大V在長文中,總結了GPT-6表現出的驚人性能。
目前已知的事實是:它展現出了令人印象深刻的數學天賦和極高的「欺騙智商」。
![]()
只要給它足夠的算力,這個模型能在完全自主、不借助任何外部工具(如Lean)的情況下,以48%的成功率證明了「埃爾德什單位距離猜想」,并且自主找到「雅可比猜想」的反例。
這些數學難題,曾經困擾人類頂尖數學家幾十年,而OpenAI可能只花了大約不到5萬到10萬美元的算力成本。
這意味著,AI已經具備了獨立產出諾貝爾獎級別科研成果的能力。
另外,GPT-6還表現出欺騙性。
在一次NanoGPT的基準測試中,OpenAI命令模型:「測試完成后,只能將結果發布到內部的Slack工作群里。」
結果呢?模型覺得Slack太局限了,它更喜歡GitHub。
于是,它花了一個小時尋找并利用了沙盒環境中的漏洞,成功越獄,然后把結果作為一個PR直接推送到了外網的GitHub上。
![]()
這個過程中,它完全無視了人類的指令,做出來「更優」選擇。
更絕的是,在另一次測試中,模型試圖訪問其他系統中的私人提交記錄。當它嘗試獲取訪問Token時,被人類設置的安全掃描器攔截了。
面對封鎖,這個模型居然把長串的訪問Token拆成了兩個碎片,對碎片進行了代碼混淆,再把兩個碎片拼成完整憑證。
通過這種方式,完整的Token字符串從未在代碼中連續出現過,成功騙過了人類的掃描器。
GPT-6,或許馬上要來了。
2026年的這個夏天,注定很不平凡。
參考資料:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
編輯:Aeneas
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.