![]()
作者 | 張建imest
來源 | 至頂AI實(shí)驗(yàn)室
這兩周如果你也刷到了”RTX 3060 12GB全國復(fù)產(chǎn)“的消息,大概會冒出同一個(gè)念頭:它便宜、顯存不算小,還能一口氣多買幾張。那干脆拼三張3060,把顯存堆到比3090還大,是不是反而更劃算?湊巧的是,YouTube頻道Digital Spaceport最近發(fā)布了一期評測,用大約1500美元搭建了一臺本地AI“迷你怪獸”:2張RTX 3060 12GB加1張從家人舊電腦里淘汰下來的RTX 3060 Ti 8GB,三張卡顯存合計(jì)32GB,拿它和1張RTX 3090 24GB對比,測試對象是Qwen3.6 27B Dense、Gemma 4 26B A4B和開源Agent項(xiàng)目Hermes Agent。
看完完整測試數(shù)據(jù)后,這篇文章想把一個(gè)判斷說清楚:多卡拼出來的32GB,確實(shí)不等于一張連續(xù)的32GB大顯存卡——實(shí)測文本生成速度大約只有單張3090的一半;但這個(gè)差距,并不像很多"多卡=性能腰斬"的說法那樣夸張,而是一筆需要按場景具體權(quán)衡的賬。這個(gè)判斷,對正在糾結(jié)本地AI機(jī)器怎么配的個(gè)人開發(fā)者、小團(tuán)隊(duì)技術(shù)負(fù)責(zé)人,以及準(zhǔn)備評估本地化部署的企業(yè)IT決策者,應(yīng)該都有參考價(jià)值。
本地AI的第一道門檻,是顯存,不是算力很多人第一次搭本地AI機(jī)器,會先盯CPU、主板、電源,真正開始跑模型才發(fā)現(xiàn),第一道門檻往往是顯存:模型要先放得進(jìn)去,才談得上跑得快不快。
這一點(diǎn)在視頻實(shí)測里看得很具體。Qwen團(tuán)隊(duì)于2026年4月發(fā)布的Qwen3.6-27B是一個(gè)稠密(dense)模型,全部27B參數(shù)逐token激活,開源協(xié)議為Apache 2.0,常見的Q4_K_M量化下理論需要約17GB顯存;視頻里用Unsloth的UD-Q4_K_XL動態(tài)量化版本實(shí)測,跑到約65K上下文時(shí),實(shí)際顯存占用大約23GB。Gemma 4 26B A4B則是Google的MoE(混合專家)模型,推理時(shí)只激活約4B參數(shù),但全部26B參數(shù)都要先加載進(jìn)顯存才能維持路由速度,理論上Q4量化約需18GB、Q8約需28GB;視頻里同樣用Unsloth的UD-Q4_K_XL量化版本實(shí)測,跑到128K長上下文時(shí),三張卡上的實(shí)際占用大約22GB。也就是說,"只激活4B參數(shù)"并不等于"只占4B顯存",長上下文還會繼續(xù)往上加——這也是為什么作者特別提到,22GB左右的占用"剛好能完全塞進(jìn)一張24GB的3090",這正是他選擇對比這兩個(gè)模型的原因。
長上下文、工具調(diào)用、Agent常駐、多人同時(shí)用,都會繼續(xù)吃顯存和系統(tǒng)內(nèi)存。這也是RTX 3090到現(xiàn)在還被本地AI玩家反復(fù)提起的原因:它不是新卡,也不省電,但24GB顯存這道門檻,比單純堆算力更實(shí)用。
問題是,3090的價(jià)格并不友好,于是用便宜的舊卡拼顯存就顯得誘人。真正的問題是:拼出來的顯存,能不能跟一張大顯存卡劃等號?
32GB還是36GB?先弄清楚這臺機(jī)器到底用了哪幾張卡視頻簡介把這臺機(jī)器稱為"32GB VRAM rig"。這臺機(jī)器裝的并不是三張RTX 3060 12GB,而是2張RTX 3060 12GB,加1張從家人淘汰下來的RTX 3060 Ti 8GB——三張卡顯存合計(jì)正好是32GB(12+12+8)。作者在視頻里特意把它們區(qū)分開來:跑測試用的是兩張12GB的3060,加一張8GB的3060 Ti,不是三張規(guī)格統(tǒng)一的卡。
![]()
這個(gè)區(qū)分很關(guān)鍵,因?yàn)樗f明"湊顯存"在實(shí)際操作中往往比想象中更碎片化:手頭有什么閑置卡,就先用什么閑置卡,未必是專門去買三張完全一樣的卡。作者也提到,如果想復(fù)刻這套方案、手頭沒有閑置的3060 Ti,更推薦統(tǒng)一買三張12GB的3060,這樣能拿到完整的36GB顯存;他自己這次是正好有一張閑置的3060 Ti,才湊出了32GB這個(gè)版本。
多卡顯存池,實(shí)測差距比想象中小——但確實(shí)存在這是這次評測最有價(jià)值的部分:作者把這套32GB的三卡機(jī)器,和換上去的1張RTX 3090,跑了同樣的Gemma 4 26B A4B和Qwen3.6 27B Dense,記錄了從1K到128K不同上下文長度下的提示詞處理(prompt processing)和文本生成(text generation)速度,全程沒有做任何batch調(diào)優(yōu),就是為了讓結(jié)果可復(fù)現(xiàn)。
文本生成(模型真正"吐字"的速度)上,差距是實(shí)打?qū)嵉模号蹽emma 4 26B A4B,三卡機(jī)器在512到8K上下文區(qū)間大致是64-68 tokens/s,單張3090穩(wěn)定在130-133 tokens/s,三卡機(jī)器大約是3090的一半;跑Qwen3.6 27B Dense(稠密模型,本來就比MoE慢),三卡機(jī)器是17.2-17.8 tokens/s,3090是38-40 tokens/s,差距同樣接近一半。作者原本預(yù)期會差到25%左右,結(jié)果"打平"在50%,他自己也說這是意外的好消息。
![]()
但提示詞處理速度(決定一次對話或一次工具調(diào)用"讀完上下文需要多久")上,差距比想象中小得多,長上下文下尤其明顯:跑Gemma 4 26B A4B到128K上下文時(shí),三卡機(jī)器約2026 tokens/s,3090約2109 tokens/s,差距不到5%;跑Qwen3.6 27B Dense到128K時(shí),三卡機(jī)器731 tokens/s,3090是754 tokens/s,差距也很小。換句話說,"讀得快不快"這件事,多卡分?jǐn)値淼膿p耗遠(yuǎn)沒有"吐字快不快"那么明顯。
這組數(shù)據(jù)和泛泛的"多卡=性能嚴(yán)重打折"的說法有出入——至少在這次測試?yán)铮?張3060+1張3060 Ti這套32GB方案的表現(xiàn),比作者自己預(yù)期的好不少。但這不代表"多卡顯存池≠大顯存卡"這個(gè)判斷不成立:50%的生成速度損失依然是實(shí)打?qū)嵉拇鷥r(jià),而且這只是沒做任何調(diào)優(yōu)的baseline結(jié)果——作者明確說,如果花時(shí)間調(diào)batch size,這個(gè)數(shù)字還能往上提,這恰恰說明多卡方案的真實(shí)表現(xiàn)從來不是"顯存加起來就行"的簡單算術(shù)題,而是取決于你愿不愿意、有沒有時(shí)間精力把這套系統(tǒng)調(diào)好。
省下的顯卡錢,從功耗、機(jī)箱和驅(qū)動里重新冒出來先看實(shí)測功耗:這套三卡機(jī)器把單卡功耗墻設(shè)到了大約85%(也就是沒有讓3060/3060 Ti跑滿載),處理高峰時(shí)系統(tǒng)整機(jī)功耗大致在390-526瓦之間,作者記錄到的峰值是580瓦——這是在5950X單線程占用、并沒有跑滿CPU的情況下測得的,1000W電源完全夠用,遠(yuǎn)沒有逼近上限。換上3090之后,視頻里沒有給出對應(yīng)的整機(jī)功耗實(shí)測,但RTX 3090官方TDP是350瓦,單卡功耗比三張降了功耗墻的卡加起來還是低一些,只是差距沒有用理論TDP直接相加算出來的那么夸張。
再看成本:作者給出的實(shí)際清單是,5950X(自己原有的二手件)282美元,技嘉B550 Eagle Wi-Fi6主板110美元,Corsair H170i水冷100-150美元,512GB NVMe約30美元,1000W電源約100-110美元,開放式GPU機(jī)架約65美元,這些"基礎(chǔ)件"加起來接近800美元;顯卡部分,12GB的3060約250美元一張,8GB的3060 Ti約200美元,三張卡合計(jì)約700美元——整機(jī)正好落在1500美元左右。如果想復(fù)刻這套方案、又沒有閑置的3060 Ti,統(tǒng)一換成三張全新12GB的3060,按這份清單算總價(jià)也差不太多。
![]()
軟件和維護(hù)這一層,視頻里也留下了不少線索:B550這塊主板標(biāo)稱5條PCIe x16物理插槽,但電氣層面只有1條是真正的x16,剩下4條都只是x1帶寬——這正是為什么這套方案離不開PCIe riser轉(zhuǎn)接線。Proxmox虛擬化、LXC容器、llama.cpp/llama-server、Unsloth的GGUF動態(tài)量化版本,每一層都是可能出問題、需要人盯著維護(hù)的環(huán)節(jié),不是"裝上就能用"的傻瓜方案。
國內(nèi)現(xiàn)在買,新3060未必比二手3090便宜視頻里的對比基于美元報(bào)價(jià),國內(nèi)讀者需要重新算一遍賬,而2026年6月恰好出現(xiàn)了一個(gè)新變量:RTX 3060 12GB正在以全新形態(tài)重新鋪貨,而不只是二手市場里的舊卡。
![]()
由于GDDR7顯存持續(xù)緊缺、擠占了RTX 5060系列的產(chǎn)能,英偉達(dá)在今年6月恢復(fù)了RTX 3060 12GB芯片的生產(chǎn),七彩虹戰(zhàn)斧系列已率先全國到貨,批量批發(fā)價(jià)2199元,零售價(jià)2349元,華碩、微星、影馳等品牌也將陸續(xù)跟進(jìn)——不過首批區(qū)域到貨量有限(單地僅幾十片),貨源仍偏緊,品牌方計(jì)劃每周常態(tài)化補(bǔ)貨。這意味著,國內(nèi)讀者如果想用三張匹配的12GB新卡復(fù)刻"36GB版"方案,不一定要冒礦卡風(fēng)險(xiǎn)去淘二手,但短期內(nèi)也未必能輕松湊齊三張。
三張全新RTX 3060 12GB,按零售價(jià)粗算大約7000元左右;而二手RTX 3090 24GB目前國內(nèi)成交價(jià)大致在4500元到7000元區(qū)間(具體成交價(jià)隨成色、地區(qū)和短期行情波動)。也就是說,湊足36GB"顯存賬面"的三張新卡,價(jià)格未必比一張24GB的二手3090更便宜,還沒算上三張卡更高的功耗、更復(fù)雜的走線,以及多卡切分帶來的性能損耗。
它適合實(shí)驗(yàn),不適合把生產(chǎn)任務(wù)交給它多卡舊顯卡方案可以關(guān)注,但不建議直接照抄。
值得一提的是,作者自己給這套機(jī)器的定位也很誠實(shí):他本來就有一臺更大的四卡3090服務(wù)器作為主力機(jī),這套32GB的三卡機(jī)器,是專門留的"備用機(jī)"——主力機(jī)器離線維護(hù)、折騰新東西的時(shí)候,用它頂一陣子,"having a small machine that's always on is substantially less disruptive"。也就是說,即便是親手測試、對它評價(jià)相當(dāng)正面的作者本人,也沒有打算把核心任務(wù)長期交給這套多卡方案,而是把它當(dāng)成一個(gè)補(bǔ)位角色。這其實(shí)是對"適合實(shí)驗(yàn),不適合托付"這句話最直接的佐證。
對個(gè)人玩家,它很適合:愿意折騰Linux、驅(qū)動、容器、模型切分和PCIe帶寬,接受baseline沒調(diào)好、還得自己花時(shí)間優(yōu)化,那幾張卡就是理解本地AI基礎(chǔ)設(shè)施的入門課。對小團(tuán)隊(duì),它可以做原型驗(yàn)證——先試試本地Agent有沒有價(jià)值、內(nèi)部文檔能不能被有效檢索,這個(gè)階段,多卡方案可能比一步到位買昂貴工作站更靈活。
但如果要長期跑,尤其是企業(yè)生產(chǎn)環(huán)境,就要謹(jǐn)慎。企業(yè)要的是穩(wěn)定、可維護(hù)、可審計(jì)、權(quán)限可控、故障有人負(fù)責(zé),開放式機(jī)架加幾張消費(fèi)級舊卡(甚至是從家人電腦里拆下來的閑置卡),更像實(shí)驗(yàn)室方案,不像成熟基礎(chǔ)設(shè)施。它能回答"本地AI對我們有沒有用",但很難直接回答"公司能不能把關(guān)鍵任務(wù)交給它"。
同樣預(yù)算下,選擇也不止這一條:如果想少折騰,一張二手RTX 3090或預(yù)算允許上RTX 4090,文本生成速度能穩(wěn)定多一倍,故障點(diǎn)也更少;如果只是偶爾跑模型,云GPU按量付費(fèi)也是一筆能算清楚的賬。
至頂AI實(shí)驗(yàn)室洞見多張消費(fèi)卡拼出來的本地AI服務(wù)器,既不是騙局,也不是無腦省錢方案。實(shí)測顯示,這類方案的文本生成速度大致是單張大顯存卡的一半,但提示詞處理速度的差距其實(shí)很小,整體表現(xiàn)比很多人預(yù)期的要好——這本身就值得糾正一些過于悲觀的"多卡必崩"說法。它適合愿意折騰、能接受baseline性能、愿意花時(shí)間調(diào)優(yōu)的個(gè)人玩家和小團(tuán)隊(duì),用來驗(yàn)證本地Agent和私有推理是否有價(jià)值。
但如果要長期穩(wěn)定使用,尤其是企業(yè)場景,一張更省心的大顯存卡、成熟工作站,甚至云GPU,可能反而更劃算——國內(nèi)RTX 3060復(fù)產(chǎn)后的真實(shí)價(jià)格也說明,"湊顯存"和"省錢"未必是同一件事。就連這套方案的測試者自己,都只把它當(dāng)成主力機(jī)之外的備用機(jī)。
本地AI機(jī)器真正要算的,不是顯卡買得有多便宜,而是模型跑起來之后,誰來保證它一直穩(wěn)定地跑下去。
常見問題
Q:多張消費(fèi)卡拼出來的"顯存池",實(shí)際跑起來速度損失有多大?
A:以視頻實(shí)測的2張RTX 3060 12GB+1張RTX 3060 Ti 8GB(合計(jì)32GB)為例,對比單張RTX 3090 24GB:文本生成速度上,無論是Gemma4 26B A4B還是Qwen3.6 27B Dense,多卡方案大致是單卡3090的50%左右;但提示詞處理速度上,尤其是128K長上下文場景,差距反而很小(多在5%以內(nèi))。也就是說,"吐字"變慢更明顯,"讀上下文"基本不受影響,而且這還是沒做任何batch調(diào)優(yōu)的baseline結(jié)果。
Q:在本地跑Qwen3.6 27B Dense或Gemma4 26B A4B,至少需要多大顯存?
A:理論上Q4量化下,Qwen3.6-27B(稠密模型)約需17GB,Gemma4 26B A4B(MoE模型)約需18GB,Q8則接近28GB。視頻實(shí)測中,跑到長上下文(Qwen約65K、Gemma約128K)時(shí),實(shí)際占用分別約23GB和22GB,這也是為什么22GB左右的占用被作者認(rèn)為"剛好能塞進(jìn)一張24GB的3090"。
Q:企業(yè)能不能直接照搬這種多卡方案做生產(chǎn)部署?
A:不建議。連視頻里親自測試、評價(jià)正面的作者本人,也只把這套機(jī)器當(dāng)成主力四卡3090服務(wù)器之外的"備用機(jī)",而不是生產(chǎn)主力。企業(yè)要的是穩(wěn)定、可維護(hù)、可審計(jì)、故障有人兜底,這更接近實(shí)驗(yàn)室原型,而非成熟基礎(chǔ)設(shè)施。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.