![]()
芯東西(公眾號:aichip001)
作者 云鵬
編輯 漠影
大模型狂飆至今,比拼絕對參數規模早已成為過去時,如何讓AI高效落地成為關鍵。
在AI落地浪潮中,Agent爆發成為關鍵節點,進一步讓AI推理需求呈指數級暴漲。各類Agent開始高效處理復雜任務、編程Agent把過去整個團隊一兩年才能完成的復雜項目縮短至“天級”。
當AI終于可以轉化為直接生產力,真正開始“幫你賺錢”,廠商關注的焦點也從“誰囤的卡多算力多”轉變為“誰能做得多快好省”,算力行業焦點戰場從訓練加速轉向推理。
面對復雜多元的AI推理場景,傳統“大芯片”算力方案瓶頸凸顯,行業迫切需要更加高效、靈活、低成本的算力解決方案,這成為整個國內算力產業面對的新機遇。
在技術摸索過程中,行業逐漸發現,在AI推理落地的諸多場景中,“小芯片”往往能比“大芯片”更能在實際應用中實現優秀表現。
在這樣的行業“拐點時刻”,國產AI算力黑馬企業芯動力科技在上海WAIC期間首次亮出其基于自研RPP(可重構并行處理器)架構芯片打造的全棧AI加速產品矩陣,橫跨云邊端場景,其突出特點是能把每10億Token的推理成本壓縮到行業最優水平,直指大模型落地核心痛點。
![]()
▲芯動力科技WAIC展臺
我們看到,一顆“指甲蓋大小”的AE7100E芯片,可以12片集成到一塊加速卡中,這些加速卡還可以無縫集成至企業級服務器中,基于8卡高密度服務器能支持400B到1.6TB參數的LLM部署,其單卡超大顯存成為突出優勢之一。
![]()
▲基于RPP架構的AE7100E芯片
WAIC期間,芯動力科技接受芯東西獨家專訪,CEO李原首次對外詳解了其自研單芯片覆蓋云邊端全場景技術路徑和背后深入思考。
其自研芯片AE7100E正式擴展至云端,是芯動力的關鍵戰略升級,也是AI推理浪潮中國產算力在云端的一次重要突破。
一、AI編程爆發+開源生態帶來巨大機遇,分布式計算成為大模型推理時代必然方向
基于其自研的RPP架構,芯動力科技很早就在國內算力圈嶄露頭角;雖然RPP架構本身就有著原生靈活、兼顧通用與專用性的特點,但在當下這一行業節點入局云端市場,實則是基于其對AI推理市場發展的關鍵判斷。
李原提到,從去年底開始,大模型在AI編程上取得了重大突破,其團隊自身也在深度使用相關模型和工具。在他親身嘗試過程中,發現AI甚至可以在一天內搞定CPU編譯器這樣的“硬骨頭”,以往需要專業團隊幾年時間完成的工作,被AI在數小時內攻克,這是極具顛覆性的。
并且這樣的能力是可“技能化”的,同樣的模式可以快速復制到不同具體工作中,相比于大模型問答或其他非必要場景,AI編程有極為明確的商業化目的,跟企業“錢袋子”緊密相關。
在芯動力看來,AI編程是大模型推理落地絕佳場景,這是一個明確的未來方向,行業都意識到了它的價值,這一定會成為一個所有人都要使用的剛需場景。
AI編程直接轉化為生產力,以非常標準化的產品形式出現,變成每一家公司的核心生產力工具。
![]()
與此同時,芯動力深入調研發現:全球數據中心大模型調用中,有55%發生在開源模型市場,這無疑會帶來巨大市場機會,因為這意味著:AI編程不再是少數巨頭獨占的游戲,而是人人都能參與的生態。
AI編程作為AI推理落地的核心場景,其需求的爆發無疑會帶來巨大的云端算力新市場,這是算力產業所面對的新機遇,也成為芯動力在當下將其RPP芯片及解決方案擴展到云端的關鍵判斷依據。
當然,看到趨勢還不夠,技術層面到底能不能做、能不能實現,還要有更準確的研判。入局一個新市場的成敗,往往關乎一個企業的生死。
芯動力通過深度技術調研發現,目前超大模型(400B以上)占據了70%的市場份額,而沒有任何單一芯片可以把這些超大語言模型“獨自吃下”,行業利用分布式計算去解決問題已成必然。
團隊研究時發現,在大模型推理的PD分離(Prefill-Decoding)階段過程中,高算力芯片存在巨大資源浪費:在解碼階段,所需算力數據比為1:1,但英偉達計算卡提供的算力數據比約為1000:1。
這就好比“需要1個人就能完成的工作指派了1000個人來做”,在整個算力“流水線”上會形成大量算力閑置與浪費,這也客觀推高了相關方案的最終實現成本。
在Token經濟時代,面對激烈競爭,相比盲目追求昂貴的高容量HBM(高帶寬內存),性價比才是最關鍵的決定性因素。
經過芯動力團隊大量計算和研究,他們發現大模型推理真正需要的是三個核心要素:容量大、帶寬足、成本低,相比HBM,成熟LPDDR技術實則表現不錯,未來甚至會更好。
在這樣的前提下,分布式思路可能是更加正確的方向,可以大幅降低成本,數據中心領域的發展已經證明了這一點,英偉達收購Groq,其底層技術原理就是用上百顆、上千顆芯片分布式地去跑一個大模型。
分布式計算之所以高效,是它把每一個硬件節點都變成了更專業化的應用,進行專業化分區,硬件效率就會大幅提升
值得一提的是,相比云巨頭動用幾百臺服務器構建龐大集群,才在宏觀上完成這種專用化分區,芯動力芯片體積小,在單個板卡可集成十多顆芯片,在單臺服務器內就能實現極度精細的專用化分區,更靈活,這也是芯動力做分布式計算的差異化優勢所在。
![]()
▲基于芯動力RPP架構芯片智能加速卡打造的機架服務器
在逐漸摸清底層技術邏輯后,分布式計算自然就成為芯動力全力攻克的方向,并且團隊發現既有問題都可以被克服,他們可以基于RPP架構做出真正契合市場需求的產品。
從對市場趨勢和需求變化的深度觀察,到技術層面找到可行路徑,AI推理時代,芯動力無疑找到了屬于自己的關鍵機會所在,并探索出一條切實可行且潛力巨大的新路徑。
二、多芯片協同SRAM優勢凸顯,RPP架構讓芯片兼顧“通用”與“專用”,成熟工藝實現先進性能
明確路徑可行且極有潛力和價值,那么接下來要做的就是解決技術層面的問題,實現方案的落地,并真正帶來差異化優勢,讓“小芯片”展現出“大能力”。
全球芯片領域傳奇架構師“硅仙人”、現任AI芯片公司Tenstorrent CEO吉姆·凱勒(Jim Keller)曾在近期接受采訪時提到,AI推理中,不論芯片計算能力多強,對SRAM(片上緩存)的需求都是極強的。
實際上,SRAM總量低是導致很多“大芯片”實際場景表現差的關鍵因素之一,而芯動力在設計之初,就為芯片規劃了比較大的SRAM容量。
其單顆芯片的SRAM規模與英偉達H200相差并不多,但大量芯片組合、堆疊后系統SRAM總量大小,據稱可達到H200的10 倍以上,這是極為可觀的。
當大量芯片協同跑起來時,系統整體帶寬、通訊帶寬等都會呈現線性增長,這也證明,追求用最大、最頂級的單體芯片去實現大模型推理落地并不見得是唯一的最佳方案。
中型、小型芯片分布式協同并行解決問題時,對單顆芯片的帶寬要求、通訊要求、制程要求以及容量要求都會隨之降低。
當然,多芯片如何高效協同并非易事,但用李原的話來說,系統協同與通訊恰恰是芯動力老本行,他們是做通訊出身,因此目標也十分明確:“多芯片間的協同和通訊,芯動力一定要做到極致”。
在實際研究過程中芯動力發現,優秀的通訊并不意味著帶寬越高越好,而是通訊的拓撲結構必須契合算法的網絡架構,這是核心關鍵。
大模型網絡架構是有序的,研發人員可以在網絡拓撲上找到特定路徑,讓硬件網絡結構完美地適配算法的數據通訊,這也是像Groq這類公司可以做好的底層技術原理,其分散的上千顆芯片適應了Transformer的網絡流向。
在實現多芯片分布式協同計算的過程中,芯動力自研的RPP架構發揮了至關重要的作用,很好地解決了專用與通用特性的兼顧。
![]()
具體來看,RPP芯片在系統不同的位置、不同節點,起到的作用不一樣,有一定的“專用化”特征,但要讓一顆芯片在物理上做到如此專用實際上是很困難的。
芯動力采取的方法是利用RPP的可重構特性,在軟件層面進行動態調整,使得硬件在處理每一件具體任務時,都能激發出不亞于專用芯片的性能——無論在什么時間、什么位置,都能把芯片性能發揮到最大,這就是可重構架構在性能上的最優解。
要知道,當前AI模型變化很快,如果能在相對通用的計算能力基礎上,通過調整軟件來適應可變化、可重構的計算本身,是非常關鍵且極具價值的。
生態兼容性方面RPP架構也能幫客戶省去后顧之憂,其獨特之處在于直接構建在CUDA語言生態系統之上,能直接用CUDA編譯運行程序,使其既有專用芯片(TPU)的高能效、低功耗,又避開了專用芯片缺乏生態的短板。
芯動力認為,如果想讓一顆芯片同時具備極強的兼容性、極高的靈活性,并且擁有降維打擊般的性價比,統一算力架構就是實現這一目標的必由之路。而RPP架構正完美兼顧了這些特點。芯動力會堅持做“可編程、可重構”芯片,AI推理市場技術迭代迅速,通用和可編程的并行計算能力依然占據絕對重要地位。
![]()
值得一提的是,如此“多面手”、表現勝過一些頂級“大芯片”的全能GPU芯片,其可以直接基于成熟的14nm工藝實現,這極大提升了其供應的穩定性和產能上限,并進一步擴大了其性價比優勢。
在芯動力看來,從純粹的商業成本和晶體管性價比來評估,最高的工藝制程往往并不是成本最優、成效最好的。作為一家芯片設計公司(Fabless),正確的路徑是選擇最適合當前商業閉環和應用場景的成熟工藝。
關于下一代芯片,芯動力透露,已充分驗證分布式計算巨大優勢,會沿著這條路線繼續深化,“會把之前受限、沒能完全做透的地方徹底推過去”,下一代產品預計在性價比和核心性能上實現4倍左右的巨大提升。
三、從醫療到消費電子,商業化落地提速,死磕并行計算把細節做到極致
一系列技術細節的攻克和優化,最終讓芯動力自研芯有了拓展至云端并實現差異化優勢的底氣。在商業化落地層面,芯動力也透露了不少新進展,基于AE7100E的邊、云解決方案,其在全場景落地的價值和潛力進一步凸顯。
在WAIC展會現場,我們看到基于RPP R8 GPU的解決方案已經覆蓋了智慧城市、機器視覺、AI PC/NAS以及生命科學等前沿領域。
![]()
其中極具代表性的就是芯動力通過一塊集成了12顆AE7100E芯片的板卡,與一家美國客戶深度合作,實現了醫療基因測序的方案落地,最終方案的實際表現已經超過了使用英偉達5nm芯片的同類產品,這一方案中的芯片使用的正是成熟的14nm工藝。
![]()
▲在醫療基因測序領域完成落地的AzureBlade MC2A智能加速卡
在交流中我們了解到,在這一醫療基因測序方案的落地過程中他們發現,這一領域實則數據流非常明確,不需要復雜全局網絡交換,在這樣高度并行的結構下,“小芯片”分布式架構是最優的。
而如果面對更復雜的結構——比如大模型這種芯片之間不能簡單分開、存在大量數據交換和強烈數據依賴性的場景,是否也能做到?調研和實踐證明,答案依然是肯定的。
團隊研究發現,只要仔細研究并抓住其有序、有規律的數據流向,分布式架構同樣能夠完美勝任。只要能把數據的并行切分好,讓它在每一顆芯片上高效完成,分布式就是最優解。
在挑戰更高的AI PC/NAS應用場景中,芯動力已經與全球PC領域頭部廠商聯想實現了深度合作,基于芯動力AE7100E打造的M.2形態產品成功應用于其AI PC產品,這背后的故事令人印象深刻。
![]()
▲應用于AI PC/NAS領域基于AE7100E芯片的M.2規格智能加速卡
芯動力提到,像聯想這樣的國際化大廠是非常嚴謹的,其在全世界范圍內密集篩選,測試所有能夠找到的芯片公司方案,前后一共測試了80家左右的芯片廠商,在經歷極其嚴苛的篩選后,芯動力成為了最終唯一的芯片量產供應商。
很多人都喜歡問一個問題,就是一家公司的核心“技術壁壘”是什么,而在李原看來,尤其在芯片設計這一領域,建立技術壁壘絕非易事,它或許并不是某一個單點的突破,而是體現在每一個近乎苛刻的細節里。
就以這次通過測試為例,有些競品可能在某些方面也能達到標準,但無法在每個環節中都達到最好。用李原的話來說,“前期沒有長期的技術預備和積累,當世界級大廠的戰略機會來臨時,你是根本接不住的。”
李原特別提到了蘋果公司,在他看來,在芯片設計領域,可能有些人也能做到單點,但蘋果每一個微小的細節都做到了極致,這是最終其芯片能夠每年在數億設備中落地并穩定運行、帶來獨特優勢體驗的關鍵。
而芯動力的特點,正是同樣的死磕極高工程細致度。
面對未來,李原給公司的核心定位,就是在并行計算領域做到最好,團隊堅信這是繼CPU之后,人類整個信息產業演進中面臨的最大、最核心的市場。
如今AI正在進一步分化出千姿百態的細分推理場景,很多公司都在努力通過小芯片的思路來應對各種大模型推理需求,這是一個極具想象力的時代趨勢,蘊含著無數的機會。
“其決勝關鍵在于誰能抓得住,能把每一個細節都做到位,在真實的商業場景中脫穎而出。符合浪潮,順應趨勢,才能真正做大。”李原說道。
結語:AI推理落地浪潮澎湃,深耕并行計算給行業提供新解
從在全球80家芯片廠商中脫穎而出躋身聯想AI PC唯一AI芯片供應商,到基因測序領域用成熟工藝自研芯片板卡打贏巨頭高算力方案,芯動力用一系列扎實商業成果落地,驗證了其RPP架構的獨特優勢和突出商業價值。
放眼AI算力產業,開源生態加速生長,以AI編程為代表的大模型推理應用加速成熟,效率、成本成為業內更為關注的焦點,誰能夠在競爭中提供更具性價比的方案,成為勝出關鍵。
在并行計算這一潛力巨大的方向之上,以珠海芯動力RPP為代表的分布式算力技術路線,正展現出旺盛生命力,此次向云端的擴展,不僅是其自身戰略版圖的進一步完善,也給國產算力芯片在AI推理市場中突圍提供了新的方向和思考角度。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.