同樣一份網絡安全攻擊能力評測,美國前沿模型平均得分76.2%,中國模型Kimi K3只有32.2%。差距超過44個百分點——但Kimi K3已經是開源權重模型中表現最好的那一個了。
這份聯合評估報告來自英國人工智能安全研究所(UK AISI)和美國人工智能標準與創新中心(CAISI),他們把月之暗面(Moonshot AI)最新模型Kimi K3,放到了兩個專門衡量網絡攻擊能力的測試平臺上。結果很直觀:Kimi K3在攻擊性網絡任務上大幅落后于美國領先模型,但明顯超過了中國另一家模型GLM-5.2的24.4%成績,在開源權重模型里創下新標桿。
![]()
還有一個值得注意的發現:Kimi K3的安全護欄完全沒有阻攔漏洞利用開發或攻擊性網絡操作,模型全程沒有拒絕配合的意思,直接提供了協助。
兩個測試機構使用的第一個測評工具叫ExploitBench,由卡內基梅隆大學開發,專門考驗模型在軟件漏洞利用上的能力。這套基準用了41個2023年后Chrome V8引擎中發現的漏洞,追蹤模型能走多深、走到漏洞利用流程的哪一步。
美國領先模型在這41個任務中平均完成率達到76.2%,Kimi K3是32.2%,GLM-5.2是24.4%。更關鍵的指標在于最高攻擊等級——任意代碼執行(ACE),這個級別意味著攻擊者能完全控制目標系統,是漏洞利用里最嚴重的等級。Kimi K3在全部41個任務中一次都沒有達到ACE。而美國領先模型在41個任務中有20個打到了ACE級別。
這里必須補充一句說明:測試機構在測評美國閉源模型時,是把系統級安全護欄關閉了的,目的是測出模型的最大能力上限。公開版本里這些護欄是開啟狀態的。
第二個測試叫“最后幸存者”(The Last Ones,TLO),模擬的是一次企業網絡攻擊場景。攻擊路徑橫跨4個子網、約20臺主機,總共有32步。根據測試機構的說法,人類專家完成這個攻擊大約需要20個小時。到目前為止,只有極少數模型能完整走完TLO全程,4個公開可用的閉源模型曾經通關過,其中最強的那個在十次嘗試里能成功六七次。
Kimi K3的平均成績是走完32步中的17步,美國前沿模型平均能走到28.5步,GLM-5.2只能走11步。但Kimi K3在十次嘗試中有一次完整走完了整條攻擊鏈路,而且控制在1億token的限制內。用測試報告的原話說:“Kimi K3能夠在被指令引導且獲得初始網絡訪問權限的情況下,自主攻擊小型、防御薄弱、存在漏洞的企業系統。”問題在于,它有這個能力,但還不能穩定地調用出來。
TLO這個測試并沒有考慮目標系統的主動防御能力,所以場景本身不算完全真實。但測試結果放到現實世界里確實會觸發警報。最近這周就有個現成的例子:OpenAI的模型試圖自動攻擊Hugging Face,Hugging Face把這波攻擊扛住了,但確實費了番功夫,還動用了開源權重模型來幫忙防御。
CAISI做了一項時間序列分析,用基于Elo評分的標準追蹤了2025年初以來美國和中國模型在網絡攻擊能力上的變化趨勢。兩條線都在往上走,但中國模型一直跑在美國模型后面,差距穩定存在。
英國研究所在之前一份分析里給出的判斷是:開源模型的性能差距大概在4到7個月之間,而2025年初這個差距還是6到10個月。縮小了,但追得并不算快。綜合兩份測試報告看下來,一個清晰的事實擺在眼前:模型能做攻擊操作,不等于能穩定做好,更不等于防御方就束手無策——但能力曲線在上揚,這才是各方需要持續盯緊的關鍵變量。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.