![]()
整理 | 鄭麗媛
出品 | CSDN(ID:CSDNnews)
AI 編程模型的競爭,又進入了一個新階段。
今日凌晨,馬斯克旗下SpaceXAI正式發(fā)布了旗下最新旗艦模型 Grok 4.5,并將其定位為目前公司“最智能的模型”,主打編程(Coding)、Agent(智能體)任務以及知識工作(Knowledge Work)三大場景,并表示在研發(fā)過程中還與 AI 編程工具 Cursor 進行了聯(lián)合訓練,進一步強化模型的軟件工程能力。
![]()
不過,相比“最強模型”這樣的宣傳噱頭,開發(fā)者們更關(guān)心的問題其實只有兩個:它到底能不能打?值不值得用?
從目前公布的各項 Benchmark、官方技術(shù)細節(jié)以及開發(fā)者的評測結(jié)果來看,Grok 4.5 的答案可以概括為一句話:絕對性能未必全面第一,但如果把速度和價格一起算進去,它可能是目前最具性價比的 AI 編程模型之一。
![]()
數(shù)萬塊 GB300 GPU 訓練,更強調(diào)“真實工程能力”
根據(jù) SpaceXAI 介紹,Grok 4.5 在訓練過程中使用了數(shù)萬塊 NVIDIA GB300 GPU,并針對超大規(guī)模訓練設(shè)計了一系列穩(wěn)定性優(yōu)化方案。
官方表示,相比單純擴大訓練 Token 數(shù)量,他們更關(guān)注數(shù)據(jù)質(zhì)量。為此,SpaceXAI團隊在數(shù)據(jù)預處理階段進行了大量工作,包括數(shù)據(jù)去重、質(zhì)量評分,以及面向編程、科學、工程、數(shù)學等領(lǐng)域的數(shù)據(jù)篩選——與其不斷增加訓練 Token,不如讓模型學到更多高價值的數(shù)據(jù)。
與此同時,Grok 4.5 的強化學習(RL)同樣進行了大幅升級。據(jù)了解,Grok 4.5 的 RL 階段覆蓋了數(shù)十萬個任務,其中絕大多數(shù)都來自真實的軟件工程場景,并采用自動化評測和模型評測相結(jié)合的方式持續(xù)優(yōu)化。
更有意思的是,SpaceXAI還專門搭建了一套高度異步(Highly Asynchronous)的訓練架構(gòu):即便某個 Agent 連續(xù)執(zhí)行數(shù)小時的復雜任務,訓練過程依然可以在后臺數(shù)萬塊 GPU 上持續(xù)進行,從而不斷提升模型在真實工程環(huán)境中的推理能力。
![]()
一個 Prompt,就能完成整個應用開發(fā)
在 Grok 4.5 的能力展示方面,SpaceXAI 給出的重點幾乎全部圍繞軟件開發(fā)展開:“Grok 4.5 不僅能處理復雜的 Rust、C/C++ 編程任務,還能根據(jù)一句 Prompt從零開始生成完整應用。”
從官網(wǎng)介紹來看,他們展示的多個 Demo 均由模型一次 Prompt(One-shot)完成——用戶只需要描述需求,模型便能直接生成設(shè)計完整、功能齊全、可運行的應用,而無需多輪調(diào)試。
例如:“創(chuàng)建一個精美的宇宙與太陽系模擬場景,需具備可調(diào)節(jié)的時間加速功能、逼真的運動軌跡、行星軌道和恒星效果,并使用 Three.js 實現(xiàn)。界面元素(HUD)應設(shè)計美觀,符合現(xiàn)代設(shè)計原則。”
除了編程之外,Grok 4.5目前也已經(jīng)成為 Grok Build 的默認模型。
在 Office 場景下,它能自動構(gòu)建復雜 Excel 表格,完成聯(lián)網(wǎng)資料檢索、跨工作表公式計算,并自動留下備注方便后續(xù)修改;同時還能利用 PowerPoint 原生圖形繪制流程圖、架構(gòu)圖,并在 Word 中生成結(jié)構(gòu)清晰的文檔。目前,Word、PowerPoint 和 Excel 插件也已經(jīng)同步上線。
![]()
Benchmark有驚喜,也有短板
那么,它到底有沒有達到 GPT-5.5、Claude 等第一梯隊模型的水平?從SpaceXAI官方公布的數(shù)據(jù)來看,答案是:部分任務已經(jīng)非常接近,但整體仍存在差距。
例如,在測試復雜命令行任務能力的 Terminal Bench 2.1 中,Grok 4.5 獲得 83.3%,幾乎追平 GPT-5.5(83.4%),距離 Anthropic 的 Fable 5(84.3%)也僅差1 個百分點。
![]()
不過,到了更加考驗真實軟件工程能力的 Benchmark,差距開始拉開。
在評估模型解決真實 GitHub Issue 能力的 DeepSWE 1.1 中,Grok 4.5 得分 53%,明顯低于 GPT-5.5 的 67% 和 Fable 5 的 70%。
![]()
而在更高難度的 SWE Bench Pro 測試中,Grok 4.5 獲得 64.7%,雖然已經(jīng)超過部分配置下的 Claude Opus 4.8,但距離 Fable 5 的 80.4% 仍有不小差距。
![]()
也就是說,如果只看 Benchmark,Claude 系列和 GPT-5.5 依然保持一定的領(lǐng)先優(yōu)勢。
![]()
四款頂級模型同場 PK:Grok 4.5究竟能打嗎?
當然,Benchmark 只能說明一部分問題。為了更接近真實開發(fā)體驗,外媒 TryAI趁熱組織了一場測評,規(guī)則很簡單:
讓 Grok 4.5、GPT-5.5、Claude Opus 4.8 以及 Claude Fable 5接收完全相同的 Prompt,一次生成完整應用,不允許修改 Prompt,也不允許人工修改代碼。
(1)第一關(guān):制作一個可打亂、可自動復原的 3D 魔方
Prompt 統(tǒng)一為:“創(chuàng)建一個彩色、具有 3D 效果的魔方,包含‘打亂’和‘復原’兩個按鈕,并且旋轉(zhuǎn)過程需要具有動畫效果。”
這是整場測試中最難的一項,最終只有 Claude Opus 4.8 和 Claude Fable 5 一次成功。而Grok 4.5 第一次生成時頁面上只有標題和按鈕,魔方完全沒有顯示,測試人員使用唯一一次允許的重試機會后,第二次才成功生成完整作品。GPT-5.5 則表現(xiàn)最差,只渲染出了一個深色方塊,沒有生成真正意義上的魔方。
(2)第二關(guān):粒子引力沙盒
Prompt 統(tǒng)一為:“生成一個基于 Canvas 的粒子引力模擬器,擁有數(shù)百個粒子及運動軌跡,點擊鼠標可以創(chuàng)建新的引力源,整體視覺效果盡可能具有觀賞性。”
這一次,四款模型都成功完成了任務,因此評判標準更多偏向于視覺表現(xiàn)。其中:
GPT-5.5 的效果最驚艷,采用了霓虹發(fā)光風格,粒子軌跡豐富,整體觀感極具沉浸感。
Grok 4.5 則偏向簡潔風格,粒子圍繞引力中心形成規(guī)則軌道,動畫流暢自然。
Claude Fable 5 使用了柔和發(fā)光粒子,看起來更加夢幻。
Claude Opus 4.8 的粒子數(shù)量最多,物理模擬也最復雜,不過視覺效果略遜一籌。
如果只論“顏值”,TryAI的測試人員認為 GPT-5.5的生成效果最好。
(3)第三關(guān):生成一款經(jīng)典的打磚塊游戲
Prompt 統(tǒng)一為:“一個可在畫布上運行的打磚塊游戲:球拍隨鼠標移動,小球擊碎彩色磚塊,包含得分和生命值。”
在這場測試中,四款模型也全部一次成功。無論是擋板控制、小球碰撞、磚塊消除、得分統(tǒng)計還是生命系統(tǒng),都已經(jīng)具備完整功能,可以直接游玩。其中 Grok 4.5 與 GPT-5.5 的霓虹街機風格更加突出,但整體來看,四款模型都達到了可以直接交付的水平。
在結(jié)束三輪測試后,TryAI 的測試團隊還額外增加了一項趣味測試:讓四款模型僅用 SVG 繪制“一匹馬騎在宇航員背上漫步月球”的畫面。其中,Claude Fable 5 甚至加入了對白和劇情,被評價為"不僅是在畫圖,更是在講笑話",成為這一輪最有創(chuàng)意的作品。
![]()
![]()
Grok4.5的最大“殺手锏”,其實是價格
真正讓Grok 4.5 引發(fā)討論的,其實不是 Benchmark,而是它的價格。
目前,幾個主流模型的API 定價如下:
![]()
僅從單價來看,Grok 4.5 的輸入價格只有 GPT-5.5 的40%、Fable 5 的20%,輸出價格也僅為 GPT-5.5 的20%。除了單價更低之外,SpaceXAI 還強調(diào),Grok 4.5 在 SWE Bench Pro 上完成相同任務時,所消耗的 Token 數(shù)量約為 Claude Opus 4.8 的 1/4.2,同時推理速度可達到 80 Tokens/s。
關(guān)于這一點,TryAI 在測評后也得出了類似結(jié)論:Grok 4.5 能在不到 0.5 秒內(nèi)輸出首個 Token,整體生成速度達到約 110 Token/s,幾乎是 GPT-5.5、Claude Opus 4.8 的兩倍,同時也是四款模型中調(diào)用成本最低的一款。
所以,如果綜合考慮 Token 單價、Token 消耗和生成速度,Grok 4.5 在性價比上的優(yōu)勢十分明顯——從某種程度上來說,其實Grok 4.5這種定價策略與智譜 AI、DeepSeek 等國產(chǎn)大模型廠商頗為相似:性能先追到第一梯隊附近,再依靠更低的價格搶占市場。
目前,Grok 4.5 已正式上線,可通過Grok Build、Cursor、SpaceXAI Console使用,開發(fā)者只需申請一個 API Key,即可通過幾行代碼快速接入 Grok 4.5:
![]()
那么,你對于馬斯克旗下 SpaceXAI 新發(fā)布的這款 Grok 4.5 又是否感興趣呢?
https://x.ai/news/grok-4-5
https://www.tryai.dev/blog/grok-4.5-vs-gpt-5.5-vs-claude-build-off
2026 奇點智能產(chǎn)品大會全日程正式發(fā)布!
7月17-18日,北京金隅喜來登大酒店,40+位來自字節(jié)、百度、阿里、騰訊、宇樹、360、京東、螞蟻、科大訊飛等一線產(chǎn)品技術(shù)領(lǐng)袖,圍繞 Agent 智能體、企業(yè)級 AI、AI Coding、具身智能、AI 原生組織等 12 大專題,全鏈路拆解AI原生落地閉環(huán)。
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.