![]()
來源:夕小瑤科技說
馬斯克這周打出了一套連招。
周一,xAI 改名 SpaceXAI,換上新 Logo,周三,也就是北京時間今天凌晨,SpaceXAI 正式發布 Grok 4.5。第一款以新身份亮相的旗艦模型這就來了!
![]()
從 6 月 28 日 Grok 4.5 進入 SpaceX 和特斯拉內部內測,到今天開放,僅用了短短 11 天。
SpaceXAI 這次也直接放福利——限時免費開放,用戶可在 Grok Build 和 Cursor 中直接白嫖 Grok 4.5。
Opus 級水準,成績單亮眼
早在發布前,馬斯克就預告了Grok 4.5 是 Opus-class 模型。
![]()
發布頁面上,SpaceXAI 公布了五項編程相關的成績,對手列得很全,Fable 5、Opus 4.8、GPT-5.5、GLM-5.2 這些一線模型都放在同一張圖表里對比。
先說 DeepSWE,考法很直接,把模型當成一個真的程序員,丟給它完整的開發任務,從理解需求到寫完代碼,全程自己干。1.0 這一版,Grok 4.5 拿了 62.0%,把 Opus 4.8 的 55.75% 甩開 6 個多點,離GPT 5.5 的 64.31% 只差一步。
![]()
DeepSWE 1.1 跟 1.0 題差不多,但換了規矩,所有模型統一用同一套最簡工具來跑,誰也別想靠自家順手的工具鏈占便宜。這一改,Grok 4.5 掉到了 53%,被 Opus 4.8 的 59% 反超。
![]()
SWE Marathon 這一項考的是超長任務。不是修一個 bug 就收工,而是跨幾十步、連續干很久的馬拉松式工程活,而且一次過才算數,不許重試。這一項 Grok 4.5 拿了 29.0%,直接排第一,壓過 Opus 4.8 的 26.0%,也超過Fable 5 的 24.0% 。
![]()
Terminal Bench 則是直接把模型扔進命令行終端,讓它自己敲命令、裝環境、跑腳本、修報錯,全程沒人搭手,考察獨立操作電腦的能力。這一項 Grok 4.5 拿了 83.3%,壓過 Opus 4.8 的 78.9%,幾乎追平 GPT 5.5 的 83.4% ,離第一名 Fable 5 的 84.3% 也就一個身位。
![]()
還有 SWE-Bench Pro,這是業內公認最接近程序員日常的測試,題目全是從真實開源項目里挖出來的真 bug 和真需求,模型得直接上手改代碼,改完還得跑通項目原本的測試才算數。這一項 Grok 4.5 是 64.7%,Opus 4.8 是 69.2%,差了四五個點,不過反手壓了 GPT 5.5 的 58.6% 一頭。
![]()
有意思的來了,Open AI 緊接著發布推特,稱SWE-Bench Pro 這項測試并不可靠,還要撤回之前關于研究界把它作為評估工具的建議。
![]()
無論如何,從目前官方發布的數據來看,五項測試Grok 4.5 對 Opus 4.8 三勝兩負,馬斯克之前說Grok 4.5是“Opus 級別”的模型,也不算吹牛。要是把定位更高的 Fable 5 拉進來,還有一些差距,但那是完全不同價位的產品。
官方成績單之外,獨立評測機構 Artificial Analysis 也放出了自己的跑分。
在 GDPval-AA v2 基準測試中,Grok 4.5 拿了 1543 分,全球第四。但真正的看點在成本,跑完一個 GDPval 任務,Grok 4.5 平均只花0.49美元,不僅比排在它前面的模型便宜近 90%,甚至還低于 GLM-5.2 和 Kimi K2.6 這些國產模型。
![]()
?更快、更便宜,性價比拉滿
跑分只是敲門磚,Grok 4.5 最打動人的是使用感,又快又省。
更高效的 Token。同一個 SWE-Bench Pro 任務,Opus 4.8 需要 6.7 萬 token,而Grok 4.5 平均只需約 1.6 萬 token——僅為對方的四分之一。這意味著實際使用時,成本大幅降低。
![]()
更快的輸出速度 。速度達到 80 token/s,這個以往屬于輕量模型的水平,如今出現在旗艦身上。上下文窗口更是拉到 50 萬 token,據馬斯克自己預告,到下周,這個數字還將升級到100萬。
![]()
更具性價比的價格。輸入2美元 / 百萬 token ,輸出6美元 / 百萬 token。外媒 The Decoder 直言,這個價格讓基準上那點差距幾乎可以忽略。再把更低的 token 用量算進去,實際賬單相當于打了雙重折扣,性價比拉滿。
官方總結稱“Grok 4.5 在單位時間和成本下提供了最高的智能水平”,放在這組數據面前,并不算夸張。
Grok 4.5 的進步并非偶然。
算力端,Grok 4.5 基于 1.5 萬億參數的 V9 基礎模型,在數萬張 NVIDIA GB300 GPU 上訓練。
數據側,Grok 4.5 與 Cursor 聯合訓練,注入了海量真實開發者的行為數據:如何一步步定位 bug、跨多文件修改代碼、人類如何修正 AI 錯誤等。直接治好了 Grok 過去“跑分強、實戰弱”的老毛病,尤其在前端和復雜工程場景的表現有了明顯提升。
?限時免費,現在就能上手白嫖
這次官方給了一個福利,限時免費開放 Grok 4.5,兩個入口,一個是 Grok Build,一個是 Cursor,而且 Cursor 是所有檔位的訂閱都能用,不挑會員等級。
![]()
Grok Build 可能有小伙伴還沒聽過,這是 SpaceXAI 自家的命令行 AI 編程工具,對標 Claude Code 那種,在終端里敲一行安裝命令就能裝上,裝完直接跟它對話干活。這次 Grok 4.5 也成了它的默認模型。
![]()
具體能用Grok 4.5做些什么?官方給了案例。
編程這邊是主戰場。官方放了一個演示,僅需一句話,就能打造出設計精良、功能完備的應用程序。
制作一個精美的宇宙和太陽系模擬程序。模擬速度應可調節,并包含逼真的運動、軌道和恒星。使用 Three.js 開發。界面設計應美觀,并符合現代設計原則。
辦公方面也很能打。
可以搭建復雜的 Excel 模型,一邊聯網查資料一邊寫跨表公式,甚至還會在單元格里留便簽備注,方便你以后回來看。Word 和 PowerPoint 也一樣,在 Word 中撰寫清晰易懂的文字、用 PPT 原生圖形設計復雜的架構圖都不在話下。
擬定一份包含5張幻燈片的季度業務回顧報告。
推特上也有網友放出了自己實測的 case,效果很不錯。游戲大神 Danny Limanseta 第一時間在 Cursor 里用上了 Grok 4.5,讓它給自己在做的游戲搓出了第一幕 Boss 戰,從構思、規劃到實現一條龍,動畫效果很出彩。
趁目前限時免費窗口還在,感興趣的朋友不妨現在就去試試 ,很可能帶來超出預期的體驗。
Grok 4.5 只是一個開始。
6月28日,馬斯克在推特上放出預告,今年剩下的時間里,SpaceX 每月都會發布一個完全從頭訓練的新模型。
![]()
按照行業常規,從頭訓練前沿模型的預訓練周期通常以月計,這份承諾如果兌現,將給整個 AI 行業帶來前所未有的沖擊。
作為圍觀群眾,這種月更節奏,想想就興奮。
閱讀最新前沿科技趨勢報告,請訪問21世紀關鍵技術研究院的“未來知識庫”
![]()
未來知識庫是 “21世紀關鍵技術研究院”建 立的在線知識庫平臺,收藏的資料范圍包括人工智能、腦科學、互聯網、超級智能,數智大腦、能源、軍事、經濟、人類風險等等領域的前沿進展與未來趨勢。目前擁有超過8000篇重要資料。每周更新不少于100篇世界范圍最新研究資料。 歡迎掃描二維碼或訪問https://wx.zsxq.com/group/454854145828進入。
![]()
截止到2月28日 ”未來知識庫”精選的百部前沿科技趨勢報告
(加入未來知識庫,全部資料免費閱讀和下載)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.