在AI敘事中,GPU一度吞噬了一切,但那些曾被邊緣化的角色,逐步重新成為瓶頸。正如黃仁勛反復(fù)強(qiáng)調(diào)的那樣,CPU已經(jīng)成為限制英偉達(dá)“AI工廠”吞吐token速度的關(guān)鍵所在。換句話說,它是系統(tǒng)性能的阿姆達(dá)爾定律(Amdahl's law)極限所在。
現(xiàn)在,長(zhǎng)期堅(jiān)持身居幕后的Arm公司,終于也決定親自下場(chǎng)。Arm推出的首款面向外部銷售的數(shù)據(jù)中心CPU,命名為Arm AGI CPU,充分體現(xiàn)了其野心。AGI(通用人工智能)是整個(gè)AI行業(yè)的長(zhǎng)期敘事制高點(diǎn),智能體是“遞歸式”通往AGI的重要路徑。而Arm AGI CPU正是面向高性能智能體AI系統(tǒng)而設(shè)計(jì)的。
它性能強(qiáng)勁、易于擴(kuò)展,而且功耗低。在發(fā)布會(huì)上,公司高管直斥x86架構(gòu)CPU是AGI路線的技術(shù)債務(wù)。
![]()
根據(jù)官方資料,這款CPU擁有136個(gè)Neoverse V3核心,最高主頻可達(dá)3.7GHz,由兩個(gè)Chiplet組合而成,采用臺(tái)積電3納米工藝。每個(gè)核心配備2MB的L2緩存,并共享128MB的系統(tǒng)級(jí)緩存(SLC),內(nèi)存帶寬825 GB/s,設(shè)計(jì)熱功率(TDP)為300W。
它已經(jīng)超過了英偉達(dá)目前主打的Grace CPU。后者基于ARM Neoverse V2核心,無論是主頻、L2緩存、內(nèi)存帶寬都落后了不少。
Meta與OpenAI,這些原本圍繞AI推理芯片構(gòu)建體系的玩家,如今開始為CPU預(yù)留位置;叫板英偉達(dá)的芯片初創(chuàng)企業(yè)Cerebras,也是它的客戶之一。它們現(xiàn)在就可以訂購(gòu),年底實(shí)現(xiàn)量產(chǎn);明年,就迭代到第二代;AGI CPU 3也已在規(guī)劃中。
智能體式(Agentic)AI的興起,為CPU帶來了新的價(jià)值。ARM首席執(zhí)行官Rene Haas在發(fā)布會(huì)上稱,隨著AI從現(xiàn)有工作負(fù)載,演進(jìn)到智能體式工作模式,數(shù)據(jù)中心對(duì)CPU的需求可能增長(zhǎng)四倍,相當(dāng)于每GW算力的CPU核心數(shù),從當(dāng)前的3000萬個(gè)躍升至1.2億個(gè)。相比傳統(tǒng)x86架構(gòu)CPU,AGI CPU能省下高達(dá)100億美元/GW的電費(fèi)和資本支出。
然而,能省電費(fèi)也許不是CPU復(fù)興的主要原因,避免GPU價(jià)值被浪費(fèi)才是。隨著GPU算力日益強(qiáng)大,其空閑或未充分利用的也越來越不可接受。AI工廠吞吐token的交互速度,如果從每秒400個(gè)token向1000個(gè)token延伸,那么,每百萬token的價(jià)格可以從45美元提升至150美元,這不是線性的增長(zhǎng)。
在GTC 2026期間,黃仁勛接受專訪時(shí)稱,英偉達(dá)專注于加速計(jì)算,目標(biāo)從來不是取代CPU,而是最大化整個(gè)系統(tǒng)的性能。那些立錯(cuò)目標(biāo)的競(jìng)爭(zhēng)對(duì)手已經(jīng)消失在歷史里。在現(xiàn)代AI系統(tǒng)中,系統(tǒng)性能始終受阿姆達(dá)爾定律制約,GPU、網(wǎng)絡(luò)、內(nèi)存和CPU都會(huì)成為潛在瓶頸,英偉達(dá)正在一手抓。
過去10年,CPU的設(shè)計(jì)主要圍繞超大規(guī)模云計(jì)算展開(Cloud-Native CPU),更強(qiáng)調(diào)核心數(shù)量。在智能體興起前,AI主要用于生成內(nèi)容,CPU作為GPU控制節(jié)點(diǎn)(Head Node CPU),負(fù)責(zé)管理GPU并持續(xù)為其提供數(shù)據(jù),追求更高單核性能。不過,數(shù)據(jù)調(diào)度、任務(wù)編排、工具調(diào)用和系統(tǒng)交互,甚至操作沒有API接口的應(yīng)用程序,如瀏覽網(wǎng)頁、點(diǎn)擊界面元素等,在CPU與GPU的交互中,占比仍然不顯著。英偉達(dá)的Grace CPU,主要就是GPU控制節(jié)點(diǎn)。
但是,隨著智能體能力不斷提升,它可以完成越來越多復(fù)雜任務(wù),也將觸及更多無法并行的工作負(fù)荷。一旦CPU性能不足,這部分“不可加速”的工作,就會(huì)成為整個(gè)系統(tǒng)的瓶頸。要求CPU確保數(shù)據(jù)、任務(wù)和工具調(diào)用能夠高效流動(dòng),也就需要更強(qiáng)大的單核性能與IO能力。
既然AGI離不開CPU,那么,黃仁勛要打造最高效的“AI工廠”,自然也希望把CPU的命運(yùn),牢牢抓在自己手里。在上周的GTC 2026上,英偉達(dá)大力宣傳了下一代基于Arm架構(gòu)的自研CPU,賣點(diǎn)就在于專為智能體式AI打造。
它擺脫了ARM的Neoverse核心,采用深度自研的Olympus核心,號(hào)稱單核性能最強(qiáng)。該CPU的每核私有L2緩存也提升至2MB,內(nèi)存帶寬更是達(dá)到了1.2TB/s。Vera CPU的下一代,將是Rosa CPU,也已經(jīng)早早宣布。
盡管這次黃仁勛為ARM AGI CPU美言了幾句,但事情正在變得微妙。黃仁勛為了解決AI工廠的“阿姆達(dá)爾瓶頸”,已經(jīng)收購(gòu)了Mellanox與Groq。在2020年,英偉達(dá)也曾動(dòng)過400億美元收購(gòu)ARM的念頭,但最終在所有人的反對(duì)下,于2022年宣告終止推進(jìn)協(xié)議。
智能體正在改變AI敘事的競(jìng)爭(zhēng)格局。ARM AGI CPU就是CPU復(fù)興最直接的一擊。去年,英偉達(dá)推出NVLink Fusion功能,允許只要CPU或GPU來自英偉達(dá)旗下,就能互聯(lián)互通,也許就預(yù)見到了這一刻。
事實(shí)上,英偉達(dá)也開始出售自己的CPU。一開始,單獨(dú)出售的Grace CPU,主要用于超級(jí)計(jì)算機(jī)和其他高性能計(jì)算應(yīng)用。今年2月,英偉達(dá)與Meta達(dá)成了一項(xiàng)多年協(xié)議,其中包括首次大規(guī)模部署Grace CPU,而下一代的Vera CPU也在接受Meta的評(píng)估。
但是,Meta正是ARM AGI CPU的首位大客戶,事實(shí)上也是這款芯片的設(shè)計(jì)合作者。在硅谷巨頭中,即使是CPU領(lǐng)域,Meta的自研布局也相對(duì)落后。而其他幾乎所有的重要玩家,已經(jīng)都自研了ARM架構(gòu)的CPU,包括亞馬遜AWS的Graviton系列,微軟Azure的Cobalt系列,谷歌云的Axion系列等等。
不過,它們?cè)贏I算力集群中的作用尚不明顯,動(dòng)作最快的,也主要是處于GPU控制節(jié)點(diǎn)的階段,而非轉(zhuǎn)為智能體式AI優(yōu)化。
亞馬遜是首家推出自研CPU的超大規(guī)模云廠商,2018年就發(fā)布了Graviton。去年底,在發(fā)布的Trainium3芯片后,亞馬遜曾透露,基于該芯片的算力集群,將由自己的Graviton5驅(qū)動(dòng)。谷歌兩年前發(fā)布的Axion芯片,目前覆蓋了大約30%的內(nèi)部應(yīng)用,未來,谷歌也會(huì)設(shè)計(jì)用于TPU集群的Axion CPU,以支撐Gemini模型。微軟基于Maia 200的算力集群仍然由英特爾CPU驅(qū)動(dòng)。
看來,正如推理時(shí)代AI芯片走向定制,智能體時(shí)代的CPU復(fù)興,誰都想摻和一把。這可關(guān)系到AGI的實(shí)現(xiàn)呢。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.