![]()
準(zhǔn)備在本地運行 27B、32B 甚至更大模型的人,最近可能越來越容易碰到一個問題:GPU 的算力看起來夠用,模型卻因為顯存差幾GB,連加載都完成不了。
這也是銘瑄 Intel Arc Pro B60 Dual 48G Turbo 這款顯卡最近引起熱議的原因。它把兩顆 Arc Pro B60 GPU 做在一張雙槽顯卡上,每顆 GPU 配備 24GB GDDR6 顯存。對于主板插槽有限、又想提高顯存密度的用戶,這種形態(tài)確實少見。
本文依據(jù)YouTube 科技博主 Alex Ziskind的評測內(nèi)容,集中比較一張 Arc Pro B70、單張 B60、兩張獨立 B60,以及一張銘瑄 B60 Dual。視頻中能夠確認(rèn)的硬件平臺包括 Fractal 機箱、華碩專業(yè)級主板和 Intel Xeon 處理器,推理軟件使用 LLM Scaler,也就是基于 vLLM 開發(fā)的一個分支。
一張 48GB 顯卡,系統(tǒng)里其實是兩顆 24GB GPU
先把最容易產(chǎn)生誤會的地方講清楚。
B60 Dual 標(biāo)稱擁有 48GB GDDR6 顯存,系統(tǒng)實際識別到的是兩顆獨立 GPU,每顆 GPU 各有 24GB 顯存。兩部分顯存沒有組成一個能夠被所有軟件直接調(diào)用的統(tǒng)一 48GB 地址空間。
![]()
銘瑄公布的規(guī)格顯示,兩顆 GPU 分別擁有 20 個 Xe 核心、192-bit 顯存位寬和 456GB/s 顯存帶寬,各通過 PCIe 5.0 x8 連接系統(tǒng)。整張顯卡使用一個 12V-2×6 供電接口,標(biāo)稱總板功耗為 400W,尺寸為 300×110×40mm。
當(dāng)模型占用超過單顆 GPU 的 24GB 顯存時,推理框架需要通過張量并行等方式,把權(quán)重和計算任務(wù)切分到兩顆 GPU 上。框架能不能識別兩顆 Intel GPU,模型結(jié)構(gòu)適不適合切分,跨卡通信開銷有多大,都會影響最終結(jié)果。
視頻中使用的又是一張無板載 PCIe 交換芯片的雙 GPU 卡。兩顆 GPU 不能經(jīng)由卡內(nèi)高速互聯(lián)直接交換數(shù)據(jù),通信需要經(jīng)過 CPU 和主板的 PCIe 通道。
第一次開機時,測試平臺甚至完全識別不到這張顯卡。
測試者進(jìn)入主板 BIOS,將原本的 PCIe x16 插槽設(shè)置為 x8+x8 通道拆分,重啟后才識別出兩顆 B60。視頻顯示,兩顆 GPU 此后分別工作在 PCIe 5.0 x8 模式,每顆擁有 24GB 顯存。
這意味著 B60 Dual 并不適合“買回來直接插上就用”的思路。主板需要支持 PCIe Bifurcation,CPU 也要提供合適的通道配置。消費級主板即便提供一個物理 x16 插槽,也未必能把它拆分成兩組 x8。
小模型測試?yán)铮珺70 更快,但完整比較數(shù)據(jù)并沒有披露
視頻首先測試了 Qwen3 4B FP8。
![]()
其中唯一明確說出的完整數(shù)字,是 Arc Pro B70 達(dá)到約 92 Token/s。測試者表示,兩張 B60 通過張量并行運行時沒有超過 B70,單張 B60 又略慢于兩張 B60。
由于轉(zhuǎn)寫沒有記錄 B60 和雙 B60 的具體速度,也缺少輸入長度、輸出長度、批量大小和重復(fù)次數(shù),我們只能得到一個方向性判斷:在這個能夠輕松裝入單卡的小模型上,B70 表現(xiàn)更好。
這個結(jié)果也符合兩款產(chǎn)品的硬件定位。B70 是單 GPU 設(shè)計,擁有 32GB GDDR6 顯存和 608GB/s 顯存帶寬;B60 Dual 的單顆 GPU 帶寬為 456GB/s。面對不需要跨 GPU 切分的小模型,更強的單 GPU 通常更容易發(fā)揮性能。
原稿中“小模型看算力,大模型先看容量”的表達(dá)可以保留,但要加上適用范圍。這是對視頻結(jié)果的解釋,無法替代嚴(yán)格的變量控制實驗。
尤其不能據(jù)此推導(dǎo)出“雙 B60 跑所有小模型都不劃算”。不同框架、量化格式、批處理規(guī)模和并發(fā)數(shù),都可能改變結(jié)果。
27B 模型跨過了容量門檻,性能結(jié)論仍需收緊
更有代表性的一項測試使用了 Qwen3.5 27B 的 INT4 量化版本。
視頻作者稱,該模型文件“接近 30GB”,還需要額外顯存承擔(dān)運行開銷,所以單張 24GB B60 無法加載。B70 可以運行,生成速度約為 28.3 Token/s;兩張 B60 的結(jié)果高于 B70,但轉(zhuǎn)寫沒有保留下具體數(shù)字。
![]()
這里的“接近 30GB”不能簡單理解為 270 億參數(shù)乘以 4bit 后的純權(quán)重體積。
模型實際占用還會受到量化格式、分組參數(shù)、元數(shù)據(jù)、嵌入層處理方式、框架加載方式和運行時緩沖區(qū)影響。推理過程中還需要為 KV Cache、計算中間量及框架自身預(yù)留空間。由于視頻沒有公布這些構(gòu)成,也沒有顯示加載完成后的逐卡顯存占用,我們只能確認(rèn)單張 24GB B60 在該次測試條件下無法運行。
“雙 B60 超過 B70”的說法也需要限定在這一個模型和這套未完全披露的測試環(huán)境中。
容量確實讓兩張 B60 獲得了參賽資格,但視頻沒有提供足夠數(shù)據(jù)證明,雙 B60 在所有 27B 模型、所有上下文長度下都能超過 B70。張量并行還會引入跨卡通信,模型結(jié)構(gòu)和并行策略不同,結(jié)果可能完全改變。
視頻隨后還測試了一個 30B 級 MoE 模型的 INT4 版本。B70 約為 45 Token/s,單張 B60 約為 44.5 Token/s,兩張 B60 的速度反而有所下降,但作者沒有說出具體數(shù)字。
這組結(jié)果恰好說明,增加第二顆 GPU 不會自動帶來性能增長。有些模型受益于并行,有些模型會被通信和調(diào)度開銷拖慢。
因此,這一部分更準(zhǔn)確的結(jié)論應(yīng)該是:兩顆 24GB GPU 可以讓部分超過 24GB 顯存門檻的模型運行起來,速度表現(xiàn)取決于模型和軟件實現(xiàn)。
雙芯卡和兩張獨立 B60
B60 Dual 最值得驗證的問題,是兩顆 GPU 共用一個物理插槽后,性能是否會明顯低于兩張分別安裝的 B60。
![]()
視頻展示的一組 27B 模型數(shù)據(jù)中,畫面出現(xiàn)了約 26.7 Token/s 的平均生成速度,另外兩次讀數(shù)約為 25.3 和 26.6 Token/s。Prompt Processing 速度則在約 1789至2200 Token/s 之間變化。
不過,轉(zhuǎn)寫沒有完整標(biāo)明每一個數(shù)字分別對應(yīng) B60 Dual 還是兩張獨立 B60,也沒有給出相同提示詞下的逐輪對照表。作者最終用“pretty much identical”形容兩種配置,認(rèn)為差異很小。
原稿把它寫成“差異處于測試誤差范圍”,這個表述過強。
視頻沒有說明誤差計算方法、重復(fù)次數(shù)和標(biāo)準(zhǔn)差,自然無法建立統(tǒng)計意義上的誤差范圍。更穩(wěn)妥的說法是:在視頻展示的幾項模型測試中,B60 Dual 與兩張獨立 B60 的結(jié)果接近,沒有觀察到明顯的性能損失。
這項觀察仍然有價值。
它至少說明,在支持 PCIe x8+x8 拆分的測試平臺上,把兩顆 B60 放進(jìn)一個物理插槽,沒有立即出現(xiàn)嚴(yán)重的帶寬瓶頸。至于長上下文、大批量推理、高并發(fā)請求和持續(xù)滿負(fù)載場景是否同樣如此,視頻沒有覆蓋。
48GB 對視頻生成沒帶來幫助
大顯存最容易產(chǎn)生的另一個誤解,是認(rèn)為所有生成式 AI 任務(wù)都會變快。
視頻使用 ComfyUI 運行 LTX-2 文生視頻工作流時,B70 的生成時間約為 167 秒。兩張獨立 B60 中實際參與計算的一顆 GPU 用時約 224.6 秒,B60 Dual 中的一顆 GPU 用時約 226.7 秒。
![]()
這里的關(guān)鍵在于,測試中的 LTX-2 工作流只調(diào)用了一顆 GPU。
B60 Dual 雖然安裝了兩顆 GPU,第二顆 GPU 沒有參與這一段視頻的生成。48GB 總顯存也沒有被當(dāng)成一個統(tǒng)一內(nèi)存池使用。
所以,這組測試能夠支持的判斷很直接:當(dāng)工作流只能調(diào)用單顆 GPU 時,B60 Dual 的第二顆 GPU 對單任務(wù)速度沒有幫助,B70 憑借更強的單 GPU 性能完成得更快。
B60 Dual 仍然可以讓兩顆 GPU 分別處理不同任務(wù)。例如,一顆運行語言模型,另一顆運行圖像或視頻模型;也可以同時為兩組用戶提供服務(wù)。視頻沒有進(jìn)一步測試這些并發(fā)場景,因此文章不對吞吐提升作量化推斷。
LTT Labs 在 2026 年 5 月發(fā)布的評測也遇到了類似的軟件限制。其部分 Blender 和 DaVinci Resolve 測試無法穩(wěn)定調(diào)用兩顆 B60,AI 基準(zhǔn)中的多個項目也只運行在單顆 GPU 上。評測團(tuán)隊最后認(rèn)為,這張卡更適合高密度計算或虛擬化環(huán)境,普通創(chuàng)作者工作站未必能充分利用它。
129W 是一次負(fù)載讀數(shù)
視頻還比較了某項相同工作負(fù)載下的功耗。
B60 Dual 約為 129W,兩張獨立 B60 合計約為 134W。兩者只相差約 5W,作者也認(rèn)為這個差別不大。
![]()
這個數(shù)字必須和產(chǎn)品規(guī)格分開理解。
129W 是視頻中某一項特定負(fù)載下的觀測值。視頻沒有說明它來自驅(qū)動軟件、插座功率計還是其他測量方式,也沒有交代是否包含整機功耗。
銘瑄為 B60 Dual 標(biāo)注的總板功耗是 400W,并配備一個 12V-2×6 供電接口。這個規(guī)格更接近裝機時需要考慮的上限,包括電源容量、線材規(guī)格、機箱風(fēng)道和持續(xù)散熱能力。
因此,不能根據(jù) 129W 的單次負(fù)載讀數(shù),推導(dǎo)這是一張低功耗雙 GPU 卡。更不能按照四張卡都只消耗約 129W 來設(shè)計多卡系統(tǒng)。
如果安裝四張 B60 Dual,僅顯卡的標(biāo)稱總板功耗上限就達(dá)到 1600W。再加上 Xeon 處理器、主板、內(nèi)存、存儲、風(fēng)扇和電源轉(zhuǎn)換損耗,整機供電與散熱已經(jīng)進(jìn)入專業(yè)工作站甚至服務(wù)器的設(shè)計范圍。
7000 美元對應(yīng)四張卡的乘法,還不等于一臺 192GB 工作站
視頻中最抓眼球的一筆賬,是四張 B60 Dual 可以提供 192GB 總顯存。
按照作者當(dāng)時引用的每張 1750 美元計算,四張卡的采購價約為 7000 美元。若用四張售價約 6000 美元的 48GB RTX Pro 5000 達(dá)到相同標(biāo)稱顯存容量,顯卡價格約為 24000 美元。
這只是顯卡數(shù)量與價格的算術(shù)推演。
視頻作者手中只有一張 B60 Dual。他沒有實際安裝四張卡,也沒有運行一個由八顆 GPU 組成的 192GB 推理系統(tǒng)。視頻后段還專門詢問 Level1Techs 的 Wendell,主板能否對多個插槽進(jìn)行通道拆分;對話給出的建議依然是查看主板手冊并逐槽測試。
四卡方案至少還要解決幾項問題:
主板需要提供四個位置合適的雙槽空間,每個插槽都要支持 x8+x8 拆分;CPU 和芯片組需要提供足夠的 PCIe 通道;操作系統(tǒng)和驅(qū)動要穩(wěn)定識別八顆 GPU;推理框架需要支持八卡調(diào)度;電源和供電線路要覆蓋最高 1600W 的顯卡板卡功耗;機箱還要把四張渦輪卡持續(xù)排出的熱量送出去。
此外,192GB 是八顆 GPU 顯存容量的總和,不代表任意一個模型都能無損使用全部容量。模型能否拆到八顆 GPU 上,通信開銷是否能夠接受,都需要實際測試。
銘瑄已經(jīng)把 B60 Dual 定位于高密度部署,并表示其 W790 工作站平臺可以支持最多四張該卡。廠商資料證明這種硬件組合有明確的設(shè)計方向,卻不能代替具體模型、具體框架下的四卡實測。
所以,更準(zhǔn)確的價格表述是:
按照視頻引用的單卡價格,四張 B60 Dual 的顯卡采購成本約為 7000 美元,理論總顯存為 192GB。整機成本、八 GPU 擴展效率與穩(wěn)定性沒有在視頻中得到驗證。
8. 真正需要判斷的,是你缺容量、缺速度,還是缺插槽
看完這些限制,B60 Dual 的適用人群反而更清楚了。
如果主要運行能夠裝進(jìn) 32GB 顯存的小型或中型模型,希望單次對話響應(yīng)更快,同時不想處理 PCIe 通道拆分和多 GPU 配置,B70 通常更容易使用。視頻中的 Qwen3 4B 和 LTX-2 測試也顯示,B70 在依賴單 GPU 性能的任務(wù)里更占優(yōu)勢。
如果模型在當(dāng)前運行條件下超過 24GB、又可以由框架拆分到兩顆 GPU 上,兩張 B60 或一張 B60 Dual 才開始體現(xiàn)容量價值。
兩張普通 B60 占用更多主板空間,但價格可能更低,主板部署方式也更靈活。B60 Dual 的優(yōu)勢集中在插槽密度:用一個物理 x16 插槽和兩個槽位,容納兩顆 GPU 與總計 48GB 顯存。
當(dāng)一臺機器準(zhǔn)備安裝多組 B60 時,這項優(yōu)勢會逐漸放大。可一旦進(jìn)入四卡八 GPU 規(guī)模,項目就已經(jīng)超出普通桌面裝機范疇,需要按照完整的工作站方案評估。
至于軟件,視頻只能反映錄制時所使用的 LLM Scaler 環(huán)境。Intel、銘瑄和相關(guān)開源項目仍在更新驅(qū)動及多 GPU 推理能力,購買前應(yīng)重新核對準(zhǔn)備使用的模型、量化格式和框架版本。廠商目前列出的支持范圍包括 PyTorch、IPEX-LLM 和基于 vLLM 的相關(guān)方案,但“框架支持”不代表所有模型和所有多卡組合都能獲得理想擴展。
這張卡最有價值的地方,依然是它提供了一種少見的硬件形態(tài)。
兩顆 GPU 裝進(jìn)一張雙槽卡,在視頻覆蓋的幾項測試中,沒有看到相對于兩張獨立 B60 的明顯異常。它能否成為高性價比的本地 AI 方案,還要看用戶能不能解決主板、供電、散熱和軟件適配這些問題。
顯存價格只是第一筆賬。能不能把這些顯存穩(wěn)定用起來,才是購買前最該算清楚的部分。
END本文來自至頂AI實驗室,一個專注于對AI計算機、工作站及各類AI相關(guān)硬件設(shè)備,開展基于真實使用場景評測的研究機構(gòu)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.