什么?手機內存要騎到處理器頭上了?
近日,海力士在美國掛出了兩個新崗位,希望通過研究“3D堆疊內存”設計,從封裝層面解決端側AI的性能瓶頸。官方明確指出,必須是能夠與美國客戶緊密合作的優秀人才,考慮到招聘位置和過往合作歷史,這家客戶很可能是蘋果。
![]()
(圖源:trendforce)
看到這個信息,我想大部分人都是一頭霧水,這內存設計和端側AI有啥聯系啊?
是這樣的,你別看這兩年手機里的算力漲得飛快,發布會上的數字一個比一個嚇人,但真到本地跑各種大模型應用時,卻經常干著干著開始發熱、降速,最后逼得廠商還是只能把任務丟給云端,實際在端側跑的AI功能還不到十分之一。
但這肯定不行,總不能說大伙吹了三四年的NPU,到最后可能手機淘汰了都沒用過幾次。所以廠商們就去查問題在哪,蘋果這邊得出來的結論是,大模型開始連續生成后,速度往往卡在內存讀取上,芯片算得再快,數據送不過來也只能干等,這就是廠商們開始研究3D堆疊內存的原因。
疊得越多,速度越快?
在了解3D堆疊內存之前,我們得先了解一下現在的手機是怎么做的。
目前市面上的主流旗艦手機,基本用的都是LPDDR5X規格的內存,而這種內存的常見做法是PoP疊層封裝:下面是手機處理器封裝,上面再放一顆內存封裝。
![]()
(圖源:雷科技)
就像上圖這樣,傳統的PoP疊層封裝,兩者看似已經疊在一起,但是中間仍隔著基板、焊點和高速接口,本質上還是兩個獨立封裝。內存只能通過數量有限的線路向處理器送數據,想增加帶寬,主要靠提高每條通道的速度。
而海力士這次要做的3D堆疊DRAM,思路就很直接:把內存外面的部分封裝拆掉,讓內存裸片直接壓在處理器上,再在兩塊芯片之間做出大量垂直數據通道。
至于具體怎么做,海力士還沒公開。
不過參考英偉達的HBM和AMD的3D V-Cache,我認為大致逃不過這幾步:把芯片磨薄,在內部做出上下貫通的通道,再通過銅對銅連接直接把兩層芯片接在一起。
![]()
(圖源:AMD)
按照AMD官方的說法,這種連接方式的密度可以達到傳統平面封裝的200倍以上,做到有效增加I/O數量,也就是讓處理器同時讀寫更多數據,順帶降低等待時間、傳輸功耗和占用空間。
即便單條通道的帶寬是固定的,只要通過3D堆疊把通道數量從幾十、幾百根擴到上千甚至更多,內存讀寫速度自然有望迎來數十倍,甚至成百倍的提升。
這里依然是以普通LPDDR內存為例,正如上文所述,它們的升級主要靠提高每條通道的速度,比如美光把LPDDR5X速率從7.5Gbps提高到10.7Gbps后,總的讀寫帶寬已經來到了85.6GB/s,較目前iPhone 17 Pro的76.8GB/s確實有提升。
![]()
(圖源:美光)
作為對比,已量產的HBM4的帶寬達到了2.8-3.3TB/s。
至于更接近海力士這次“把內存直接放處理器上”的,是d-Matrix驗證中的3DIMC,它利用整片芯片表面建立垂直通道,廠商宣稱單堆疊可達到20TB/s,傳輸能耗約0.3—0.4pJ/bit。
不過20TB/s是數據中心芯片的數據,手機肯定照搬不了。況且海力士現在連人都還沒招齊,具體能做到什么程度,誰也說不清楚。
但從各家透露的數據來看,我確實還挺期待的。
沒有想象中那么好
有趣的是,當手機還在想著怎么疊的時候,電腦這邊早就開始嘗試了。
前兩年,英特爾在酷睿Ultra 200V系列上就做過一次相當激進的嘗試,他們直接把LPDDR5X內存塞進處理器封裝里,雖然還沒到把內存疊在處理器核心上的地步,但是通道距離已經比傳統筆記本短了不知道多少。
這套方案的好處很好理解,內存速度更快、延遲更短,數據來回跑的距離短了,耗電自然也能壓下來,最高能降低40%的整體功耗。主板上不用再給內存單獨留位置,電腦內部可以做得更緊湊,空出來的地方還能塞電池和散熱。
![]()
(圖源:英特爾)
重點是,那批輕薄本的續航和核顯表現都很不錯,這種設計和輕薄本確實相當合拍,畢竟它們本來就不指望用戶自己換內存,能省空間、降功耗,怎么看都挺香。
問題是廠商這邊不滿意了。
要知道,Ultra 200V系列基本只有16GB和32GB兩種選擇,電腦一出廠,內存容量就徹底定死。廠商想做24GB版本難,想沖64GB也不方便,不管其中哪一邊出問題,維修成本都低不了。
當然,這套封裝本身也不便宜。原本大部分人對輕薄本的價格預期就在4000-5000元左右,Ultra 200V系列直接把這個起步線拉到8500左右,雖說基本上都是中高端產品,但也不是普通消費者能消費得起的。
到了酷睿300系列,英特爾干脆又把內存放回了處理器外面,廠商可以自由選擇容量。下至12GB單通道,上至64GB大滿貫,應有盡有,供應鏈和維修都輕松不少。
![]()
(圖源:聯想)
我手上的小新Pro 16 GT用的就是酷睿Ultra5 338H,配的是32GB LPDDR5X內存。
照理說,沒有了一體化封裝,那內存性能必然會下降,本地AI性能多少會受到些影響。可我實際用下來,反而覺得Ultra 300系列的實際體驗比200V時代更好。
原因也不難猜,畢竟Ultra300系列的核顯進步太明顯了。
酷睿Ultra5 338H內置的Arc B370規模更大,性能也更出色。現在不少本地大模型、圖片生成和語音工具,本來就會調用核顯干活,哪怕內存速度上的優勢少了一些,核顯性能卻直接補了回來,跑模型、處理圖片和做一些本地AI任務體驗反而更好。
從各種意義上來說,英特爾的經歷都可以成為手機廠商的前車之鑒。
再看AMD這邊,他們發布的X3D處理器會把額外的L3高速緩存垂直疊在CPU核心上方,一塊就能多出64MB緩存。這樣游戲常用的數據可以留在處理器附近,顯著降低反復讀取內存的次數。
![]()
(圖源:AMD)
不得不說,這招確實牛逼,應付吃緩存、吃延遲的網游,幀數和穩定性提升都很明顯,這些年AMD靠著X3D硬是把不少游戲玩家吃得死死的。
可芯片往上疊,這積熱就成了大問題。
近些年,國內外有不少玩家遭遇了X3D處理器異常高溫的情況,其中部分故障直接導致了整機硬件的損壞,覆蓋范圍從銳龍5000X3D到最新的銳龍9000X3D,而AMD這邊,除了和主板商把SoC電壓限制在1.3V以內,基本沒有給出解決方案。
![]()
(圖源:AMD)
要知道,電腦可是有主動散熱的,放在沒有主動散熱的手機上只會更糟。
堆疊才是芯片的未來?
在小雷看來,把芯片疊起來,大概率會成為以后的常態。
畢竟在摩爾定律逼近瓶頸的當下,芯片越來越難單純依靠縮小尺寸獲得提升,把不同部分拆開制造,再根據需求重新組合,已經是Intel和AMD驗證過的路線,而海力士不過是沿著這個思路繼續推進而已。
其實華為今年提出的韜定律也是一種類似的思路,即通過優化晶體管等設計,突破傳統平面布局的物理邊界,提高系統級并行度和效率,降低端到端響應延遲。
![]()
(圖源:雷科技)
當然了,這種技術短期內肯定輪不到中低端手機。
成本高、封裝麻煩、散熱還不好解決,旗艦機為了端側Agent和本地大模型,或許愿意拿它當新賣點。到了兩三千元的手機上,廠商恐怕還是更愿意把錢花在電池、屏幕和影像上。
至于這玩意能不能解決端側AI的問題,我覺得還是可以謹慎期待一下的。
畢竟海力士這次招人,說明有的廠商已經開始從硬件底層下手了。與此同時,諸如智譜、階躍星辰、面壁智能也都有在做端側大模型優化,至于幾家頭部廠商的Agent應用——Xiaomi miclaw和小布Next都已經在測試中了,端側Agent距離“能用”其實已經不遠了。
7月31日,主題為“與AI同游”的ChinaJoy2026重磅啟幕。
騰訊、網易、索尼、高通、邁從、清閑等共計 900 家泛娛樂展商,聯袂呈現全球娛樂業饕餮盛宴;
AI加持下,終端、外設、機器人、顯示、芯片等硬科技品牌,如何與游戲內容業跨界呈現娛樂新體驗?
由創始人兼總編輯羅超領銜,雷科技 ChinaJoy 2026 報道團,即將空降上海灘重磅呈現,敬請關注。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.