剛剛發(fā)布的Grok 4.5,顯示馬斯克迅速調(diào)整之后的更大野心,在中國(guó)開源模型對(duì)美國(guó)兩大閉源模型的挑戰(zhàn)中,塑造新的格局。
![]()
AI競(jìng)爭(zhēng)的焦點(diǎn),目前就是token效率:更快的token,更便宜的token,以及用更少的token處理更復(fù)雜的任務(wù)。對(duì)于Grok 4.5來說,就是從token的定價(jià)、單位token智能、到單任務(wù)token成本的優(yōu)勢(shì)。
Grok 4.5 是一個(gè)MOE(混合專家)模型,由 SpaceXAI與Cursor 聯(lián)合訓(xùn)練。馬斯克宣稱是Opus級(jí)別的,像Opus 4.7一樣聰明,但價(jià)格更低,速度更快。
Grok 4.5 每百萬(wàn)token的輸入價(jià)格是2美元,輸出價(jià)格是6美元,在美國(guó)前沿模型中是最低的,仍高于中國(guó)的開源模型。但Artificial Analysis評(píng)測(cè)結(jié)果,Grok 4.5的單任務(wù)成本,已經(jīng)低于GLM 5.2與Kimi K 2.6。
![]()
如何實(shí)現(xiàn)的?SpaceXAI稱通過強(qiáng)化學(xué)習(xí),提升了Grok 4.5單token智能,完成相同工作的token效率是其他前沿模型的兩倍,并展示完成一項(xiàng)軟件工程(SWE Bench Pro)任務(wù),平均使用token數(shù)量,僅為Opus 4.8的四分之一。
![]()
近來由于美國(guó)政府管制和前沿閉源模型token較貴,一些企業(yè)和開發(fā)者紛紛轉(zhuǎn)用中國(guó)開源模型。SpaceXAI聯(lián)手Cursor訓(xùn)練,追求單token智能和單任務(wù)成本優(yōu)勢(shì),接下來對(duì)于以低價(jià)策略為主的開源模型,是否會(huì)造成空間擠壓,值得關(guān)注。
Grok 4.5在發(fā)布之后,得到了業(yè)內(nèi)評(píng)價(jià)之高,超出了以往歷次Grok的發(fā)布,背后有數(shù)據(jù)、強(qiáng)化學(xué)習(xí)和算力的原因,也是相對(duì)于中國(guó)前沿開源模型的優(yōu)勢(shì):
數(shù)據(jù)。馬斯克4月份曾在法庭上承認(rèn)xAI蒸餾了GPT模型的數(shù)據(jù)用來訓(xùn)練Grok,以加快追趕前沿。這一次,馬斯克強(qiáng)調(diào)了在數(shù)據(jù)過濾和整理方面投入了大量資源,用來去重、質(zhì)量評(píng)分和基于領(lǐng)域的選擇,以確保數(shù)據(jù)達(dá)到覆蓋廣泛和高信號(hào)強(qiáng)度的搭配。其中Cursor提供數(shù)萬(wàn)億 Token 的真實(shí)日常開發(fā)數(shù)據(jù),以及極度成熟的沙盒、終端交互、自動(dòng)驗(yàn)證等 Rollout 生態(tài)基礎(chǔ)設(shè)施。
Cursor介紹說,這些訓(xùn)練數(shù)據(jù)捕捉了用戶與代碼庫(kù)及軟件工具的廣泛交互。這個(gè)數(shù)據(jù)集讓模型既能從現(xiàn)有軟件中學(xué)習(xí),也能從開發(fā)者與智能體之間的交互中學(xué)習(xí)開發(fā)者如何工作,以及智能體如何與其環(huán)境互動(dòng)。
Cursor有意讓訓(xùn)練數(shù)據(jù)的構(gòu)成更廣泛,強(qiáng)化學(xué)習(xí)訓(xùn)練涵蓋數(shù)十萬(wàn)個(gè)任務(wù),包括高質(zhì)量的 STEM 任務(wù)、研究論文以及其他知識(shí)工作內(nèi)容,從而讓模型在廣泛的領(lǐng)域中都具備了較強(qiáng)能力。
SpaceXAI工程師透露,Grok 4.5 只是“追加訓(xùn)練(Supplemental Training)”,而下一代模型將把 Cursor 數(shù)據(jù)直接融入最初的預(yù)訓(xùn)練。
強(qiáng)化學(xué)習(xí)。Cursor在覆蓋軟件工程和更廣泛知識(shí)工作的真實(shí)環(huán)境中,針對(duì)難題開展了強(qiáng)化學(xué)習(xí)。這些環(huán)境會(huì)訓(xùn)練模型探索問題、使用工具、從錯(cuò)誤中學(xué)習(xí),并確認(rèn)結(jié)果。
Cursor介紹說,這些問題中有很多都必須被設(shè)計(jì)得足夠困難,難到即便是前沿模型也會(huì)失手。隨著模型不斷提升,現(xiàn)有任務(wù)就無法再教會(huì)它們新的東西,而那些曾經(jīng)需要大量推理的問題也會(huì)逐漸變成常規(guī)任務(wù)。
他們用了上一代模型加速下一代模型的方法。SpaceXAI和Cursor開發(fā)了一套分布式智能體系統(tǒng),大規(guī)模構(gòu)建這些環(huán)境。工程師負(fù)責(zé)定義問題以及確認(rèn)解決方案,而大批智能體則負(fù)責(zé)構(gòu)建、測(cè)試并完善每個(gè)環(huán)境。其中一些環(huán)境,如果交給團(tuán)隊(duì)人工構(gòu)建,可能需要數(shù)百名工程師耗費(fèi)數(shù)月時(shí)間。
算力。訓(xùn)練Grok 4.5使用了數(shù)萬(wàn)張英偉達(dá)GB300。
Grok 4.5的交互速度達(dá)到了80 TPS。馬斯克表示,開發(fā)的 C/C++ 推理軟件能夠更精確地映射到 GB300 硬件上;如果完成這一步,Grok 4.5 的速度有望再提升一倍甚至更多。
隨著更多的工作流從人類閱讀token轉(zhuǎn)向機(jī)器消耗token,速度成為系統(tǒng)的核心要求,而不僅是用戶體驗(yàn)了。在智能體技術(shù)棧中,模型會(huì):
? 調(diào)用工具 ? 寫下中間思考過程 ? 查詢其他模型 ? 運(yùn)行模擬 ? 在多個(gè)步驟中不斷優(yōu)化計(jì)劃
……而 token 吞吐量 決定了能力的上限。快速推理并不只是讓 AI “感覺更快”——它會(huì)解鎖一整類新的行為能力:
? 更深入的多步驟推理 ? 更豐富的規(guī)劃循環(huán) ? 實(shí)時(shí)決策流水線 ? 遞歸式自我改進(jìn)循環(huán) ? 大規(guī)模模型間對(duì)話
下一個(gè)前沿,并不是更大的模型,而是更快、更高效的認(rèn)知循環(huán)。
大模型日益趨同,Grok 4.5試圖建立新的差異性,從編程到工程,包括制造業(yè)。這位Tesla AI的高級(jí)技術(shù)人員說,把Grok 4.5說成為編程智能體,那就低估了。它要解決的真實(shí)世界的問題,包括制造流程。
![]()
想想看,過去的幾個(gè)月間,馬斯克所經(jīng)歷的這些:
xAI創(chuàng)始團(tuán)隊(duì)全部離職;
承認(rèn)xAI的方向性錯(cuò)誤;
決定推倒重來,從Cursor挖人;
xAI并入SpaceX;
宣布收購(gòu)Cursor的條件和600億美元報(bào)價(jià);
向Anthropic和谷歌云出租算力;
SpaceX上市;
收購(gòu)Cursor;
推出Grok 4.5。
現(xiàn)在,馬斯克正在控制一個(gè)橫跨編程到工程的AI生態(tài),包括SpaceXAI的Grok、Composer,還有與Tesla的FSD,Robotaxi,Optimus的控制系統(tǒng)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.