近日,埃隆·馬斯克在社交媒體 X 發(fā)文表示:“不出五年,xAI 坐擁的 AI 算力將超越其余所有之總和。”
![]()
(來源:社交媒體 X)
能讓馬斯克放狠話的底牌是位于孟菲斯的 Colossus 超級計算集群。
2024 年, xAI 建成 Colossus 超級計算機集群,初始配備 10 萬塊英偉達 H100 GPU,僅用 122 天完成部署。作為對比,同等規(guī)模集群通常需要 3-4 年時間,涉及到復(fù)雜的選址、電力審批和硬件調(diào)試。
為了快速建成 Colossus 1,馬斯克動用了特斯拉的工程團隊,甚至采用了極度激進的手段:當(dāng)孟菲斯當(dāng)?shù)仉娋W(wǎng)無法及時擴容時,xAI 直接在停車場調(diào)配了 20 臺巨大的移動燃?xì)獍l(fā)電機。
在技術(shù)路線上,xAI 甚至押注了以太網(wǎng)(Spectrum-X)技術(shù)來連接這些芯片,試圖證明通用標(biāo)準(zhǔn)在大規(guī)模集群下依然能跑贏專有的 InfiniBand 網(wǎng)絡(luò)。
利用 Colossus 1,xAI 成功訓(xùn)練出了 Grok 2。目前,Colossus 1 已擴展到約 20 萬塊英偉達 GPU(包括 15 萬塊 H100、5 萬塊 H200 和 3 萬塊 GB200),總功率約 300MW 左右,至今仍是規(guī)模最大的完全運行的單相干集群。
Colossus 2 項目始于 2025 年 3 月,當(dāng)時 xAI 在孟菲斯收購了一個 100 萬平方英尺的倉庫以及兩塊總計 100 英畝的相鄰地塊。截至 8 月,現(xiàn)場已統(tǒng)計到 119 臺風(fēng)冷冷水機組。這意味著大約 200MW 的冷卻能力,足以支持約 11 萬塊 GB200 NVL72 芯片的運行。與傳統(tǒng)的 H100 相比,GB200 不僅訓(xùn)練性能提升 4 倍,其推理性能更是提升了 30 倍。這意味著,在同樣的電力消耗下,xAI 的實際算力產(chǎn)出將是競爭對手的數(shù)倍。
而面對孟菲斯當(dāng)?shù)貙﹄娏υO(shè)施的阻力,xAI 甚至玩了一招“跨州借電”。其在鄰近的密西西比州索斯海文收購了一座發(fā)電廠,并獲得了當(dāng)?shù)乇O(jiān)管機構(gòu)的特批,允許在無正式許可證的情況下運行燃?xì)鉁u輪機長達 12 個月。
為了實現(xiàn)長期規(guī)模化發(fā)展,xAI 正與能源公司 Solaris Energy Infrastructure(SEI)成立合資公司,SEI 持股 50.1%,xAI 持股 49.9%,一條連接密西西比電廠和田納西數(shù)據(jù)中心的中壓輸電線路,將成為 xAI 的生命線。預(yù)計到 2027 年第二季度,Solaris 將為 xAI 提供超過 1.1GW 的全面運行渦輪機。加上其他資源,xAI 的總電力規(guī)模可能會超過 1.5GW。
![]()
圖 | SEI 公司的業(yè)務(wù)增長預(yù)測圖(來源:SEI)
目前,Colossus 2 項目已部分上線,計劃在 2026 年全面擴展到 55 萬-100 萬塊 GPU,總規(guī)模可能達 500MW 以上。
馬斯克表示,目標(biāo)是在未來五年內(nèi)實現(xiàn)高達 5,000 萬臺 H100 級別的 AI 計算能力上限——200 exaFLOPs,這比目前世界上最快的超級計算機的計算能力還要強 20 倍。
此外,自 2025 年 3 月收購 X 平臺后,xAI 獲得了獨家實時數(shù)據(jù)(數(shù)億用戶對話、情感和新聞),這在訓(xùn)練中形成了數(shù)據(jù)護城河。但電力依賴美國電網(wǎng)和臨時燃?xì)鉁u輪機,面臨環(huán)保和供應(yīng)挑戰(zhàn)。
相比之下,OpenAI 與微軟的合作更依賴云基礎(chǔ)設(shè)施和分布式集群。斥資 5,000 億美元打造的星際之門(Stargate)項目的首個數(shù)據(jù)中心已在德克薩斯州投入使用,新墨西哥州和俄亥俄州的數(shù)據(jù)中心也將陸續(xù)開放。累計規(guī)劃容量近 7GW,預(yù)計 2025 年底前達 10GW。OpenAI 的集群規(guī)模達數(shù)百萬等效芯片,但非單一連貫系統(tǒng),依賴 Microsoft Azure 和 Oracle/CoreWeave 等伙伴。優(yōu)勢在于資金和生態(tài),但面臨高估值壓力和投資回報質(zhì)疑。
谷歌在自定義 TPU 上領(lǐng)先。2025 年推出的 TPU v7(Ironwood)支持最大 9,216 芯片 Pod,峰值性能達 9 exaFLOPS,Anthropic 等伙伴已大規(guī)模采用 TPU(Anthropic 計劃用100萬塊TPU)。谷歌內(nèi)部集群規(guī)模達數(shù)百萬 TPU 等效,數(shù)據(jù)優(yōu)勢(YouTube/Search)無人能及,但 TPU 生態(tài)相對封閉,外部可用性有限。
![]()
(來源:谷歌)
Meta 的自建 GPU 集群達數(shù)十萬塊,功率數(shù)百 MW,計劃進一步擴張,支持 Llama 系列開源模型。Anthropic 依賴 AWS Trainium2 和谷歌 TPU,集群規(guī)模數(shù)十萬芯片,重點在安全對齊和企業(yè)應(yīng)用。
縱觀全局,這場算力戰(zhàn)爭已演變?yōu)閮煞N路線的對決。根據(jù) SemiAnalysis 的預(yù)測,雖然 OpenAI 目前仍占據(jù)算力霸主地位,但 xAI 正上演一場驚天逆轉(zhuǎn):Colossus 2 的計算能力預(yù)計將在 2025 年第三季度超越 Meta 和 Anthropic。
與巨頭們依賴分布式云設(shè)施不同,xAI 在孟菲斯打造的是一個物理上徹底連通的硅基大腦。馬斯克賭的是:當(dāng)數(shù)十萬塊芯片在同一個物理空間內(nèi)、通過極低延遲連接時,其訓(xùn)練效率將遠超分布式集群。這種對“單體算力密度”的極致追求,正是 xAI 試圖彎道超車的物理基礎(chǔ)。
![]()
圖 | 各大前沿 AI 實驗室的 AI 訓(xùn)練數(shù)據(jù)中心容量對比(來源:SemiAnalysis)
要理解馬斯克為何如此激進地堆砌算力,必須回溯他與 AI 的復(fù)雜淵源。xAI 的誕生,本質(zhì)上是一場針對 OpenAI 的復(fù)仇,也是馬斯克對自己錯失 AI 早期機會的修正。
鮮為人知的是,馬斯克曾是 OpenAI 的聯(lián)合創(chuàng)始人。2015 年,為了制衡谷歌在 AI 領(lǐng)域的壟斷,馬斯克出資參與創(chuàng)立了 OpenAI,初衷是建立一個非營利、開源的 AI 組織。
然而,隨著理念分歧:馬斯克認(rèn)為 OpenAI 對安全重視不足且開始走向封閉盈利,他在 2018 年退出了董事會。此后,OpenAI 在 Sam Altman 的帶領(lǐng)下?lián)肀④洠⒃?2022 年憑借 ChatGPT 一戰(zhàn)封神。
ChatGPT 的成功讓馬斯克既焦慮又憤怒。他多次公開批評 ChatGPT 帶有強烈的政治正確偏見(他稱之為 “Woke Mind Virus”)。他認(rèn)為,世界需要一個“最大限度求真”(Maximum Truth-Seeking)的 AI,哪怕真相可能冒犯部分人。
帶著這種使命,2023 年 7 月,xAI 正式官宣成立。馬斯克從 DeepMind、OpenAI、Google Research 挖來了一支全明星團隊,誓言要“了解宇宙的真實本質(zhì)”。
![]()
(來源:TECHZINE)
雖然 xAI 是目前 AI 賽道上最年輕的巨頭,但它的成長速度完全是指數(shù)級的。短短兩年多,xAI 通過多輪融資累計籌集超過 200 億美元,估值從年初的數(shù)百億飆升至 2000-2300 億美元區(qū)間。
Colossus 的暴力美學(xué),也直接轉(zhuǎn)化為了 Grok 系列在推理能力上的指數(shù)級躍升。
從發(fā)布略顯稚嫩的 Grok 1,到如今的 Grok 4,xAI 僅用了兩年多的時間就在基準(zhǔn)測試上追平了 GPT-4 的水平。
7 月發(fā)布的 Grok 4 在工具使用和推理上大幅提升,多代理思考使它在復(fù)雜任務(wù)中領(lǐng)先。與 GPT-4o 相比,Grok 4 在 2025 年已全面超越,尤其在數(shù)學(xué)、科學(xué)和代理任務(wù)上。與 GPT-5(8 月發(fā)布)相比,Grok 4 在某些前沿基準(zhǔn)(如 HLE、ARC-AGI)領(lǐng)先,但 GPT-5 在通用性和多模態(tài)(如視覺)上更均衡。11 月發(fā)布的 Grok 4.1 進一步優(yōu)化幻覺減少、情感智能和工具集成,在 LMSYS Text Arena 中領(lǐng)先 Gemini 3 Pro 和 GPT-5 系列。
Grok 5 是 xAI 的下一代旗艦?zāi)P停壳罢幱谟?xùn)練階段,預(yù)計于 2026 年第一季度正式發(fā)布。馬斯克在多個場合表示,該模型參數(shù)規(guī)模達 6 萬億(6 trillion),采用 MoE 架構(gòu),上下文窗口預(yù)計是史上最大,支持原生多模態(tài)處理(包括實時視頻理解、圖像和音頻),并集成實時 X 數(shù)據(jù)流和持久記憶功能,計算力遠超前代。
值得注意的是,馬斯克強調(diào) Grok 5 有 10% 且持續(xù)上升的概率實現(xiàn) AGI(通用人工智能),定義為“能完成人類+電腦能做的任何事,但不一定超越所有人類+電腦組合”。他視其為 AGI 競賽的轉(zhuǎn)折點,預(yù)計在推理、數(shù)學(xué)、編碼和多模態(tài)任務(wù)上大幅領(lǐng)先,并在 AI 工程等領(lǐng)域超越人類專家。
回到馬斯克那句五年內(nèi)算力超越其余所有之總和,我們真正值得關(guān)注的并不是某一次豪言能否精確兌現(xiàn),而是大模型競爭的主戰(zhàn)場正在持續(xù)向基礎(chǔ)設(shè)施遷移,與電力、冷卻、土地、施工交付、供應(yīng)鏈鎖定、運維可靠性與合規(guī)許可等深度綁定。誰能把這些變量長期穩(wěn)定地組織起來,誰就更有可能把模型迭代節(jié)奏保持在領(lǐng)先區(qū)間。
因此,所謂算力戰(zhàn)爭的勝負(fù),未必由某個單一項目的規(guī)模或某個時間點的裝機數(shù)字決定,而更像一場長期的綜合競賽:一邊比拼擴張速度與資源整合能力,另一邊比拼效率提升與投入產(chǎn)出比的可持續(xù)性。
未來幾年,行業(yè)會給出更清晰的答案:算力是否仍是最強的杠桿,以及在算力持續(xù)堆高之后,誰能把它穩(wěn)定地轉(zhuǎn)化為更可靠的模型、更可負(fù)擔(dān)的推理、以及更可持續(xù)的業(yè)務(wù)增長。
1.https://newsletter.semianalysis.com/p/xais-colossus-2-first-gigawatt-datacenter
2.https://www.tweaktown.com/news/106571/elon-musk-230k-ai-gpus-train-grok-at-colossus-1-550k-gb200-gb300s-2-coming-soon/index.html
3.https://www.brownstoneresearch.com/bleeding-edge/the-king-of-agi/
4.https://www.cnbc.com/2025/09/23/openai-first-data-center-in-500-billion-stargate-project-up-in-texas.html?referrer=grok.com
5.https://cloud.google.com/blog/products/compute/ironwood-tpus-and-new-axion-based-vms-for-your-ai-workloads?referrer=grok.com
6.https://www.aboutamazon.com/news/aws/aws-project-rainier-ai-trainium-chips-compute-cluster?referrer=grok.com
7.https://www.cnbc.com/2025/11/25/musk-xai-funding-december.html?referrer=grok.com
8.https://www.anthropic.com/news/expanding-our-use-of-google-cloud-tpus-and-services?referrer=grok.com
9.https://www.techzine.eu/news/applications/130885/musk-hopes-to-raise-20-billion-for-xai/
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.