![]()
來源:AI科技評論
作者:陳嘉欣
編輯:馬曉寧
智譜的當務之急是解決算力供給問題。
AI科技評論獨家獲悉,智譜已經花數億元人民幣收購AI Infra公司中科加禾,試圖補齊模型底層工程能力不足的短板。
中科加禾(XCore Sigma)是一家聚焦編譯技術的AI異構算力軟件基礎設施公司,目標是為國產AI大模型產業提供跨品牌、跨型號的標準化AI軟件底座。
中科加禾的技術源頭是中科院計算所編譯實驗室。創始人崔慧敏博士是中科院計算所編譯團隊負責人,公司核心團隊曾作為核心成員主持或參與過龍芯、神威、寒武紀、華為昇騰等多款國產芯片的編譯器研發工作,具備從虛擬指令集設計到算子生成、轉譯、優化的全鏈條能力,且已有商業化產品驗證。
Infra層的投資一直是智譜生態版圖中的重中之重。此前智譜曾通過星連資本投資了做算力集群的基流科技、做推理優化的無問芯穹、做AI Infra的硅基流動等公司,基本覆蓋了全鏈條。但這依舊改變不了智譜Infra能力備受市場爭議的事實。
因為算力擴容跟不上需求,今年1月智譜宣布將GLM Coding Plan每天開放購買的新用戶名額壓縮到正常水平的20%,以優先保障老用戶體驗。
3月智譜GLM-5模型發布后,Coding Agent每日調用量達數億次。但不久后,用戶就開始反饋GLM-5在復雜任務中出現亂碼、復讀、生僻字等“變笨”現象。
智譜在《Scaling Pain:超大規模Coding Agent推理實踐》博客中一項項排除故障,最后發現問題在于推理架構在高并發下暴露了系統性工程問題。
簡單說,就是“讀題(Prefill)”和“寫答案(Decode)”的服務器在協調“臨時記憶(KV Cache)”時出現混亂,導致了數據沖突。
智譜在博客中提到:“當智能真正進入高并發、長上下文的 Coding Agent 場景后,推理基礎設施的挑戰已經不只是吞吐、延遲和可用性,維護它的輸出質量變得至關重要。”
這點在6月GLM-5.2發布后顯得更為關鍵。GLM-5.2發布后成為Vercel模型聚合平臺增長最快的模型,上線首周日均Token調用量暴漲27倍。
如何解決算力結構性問題,是智譜的當務之急。被列入美國實體清單后,智譜又不得不面對國產芯片廠商適配成本高的問題。
在國內大模型廠商中,智譜是對國產GPU覆蓋最廣、生態綁定意愿最積極的一家。智譜GLM-5.2上市當天就完成了對華為昇騰、平頭哥、摩爾線程等八大國產算力平臺的推理適配。
將不同架構的國產芯片拼裝成一個統一的超大規模訓練和推理集群,在工程上是極難的。但中科加禾的虛擬指令集技術能把這一堆煙囪式生態用一個中間層軟件統一掉,對上是標準接口,對下是各家芯片的適配,同一顆芯片的算力利用率就會比之前高出一截。
此外,中科加禾的SigInfer推理引擎宣稱能將大模型推理時延最高降低74倍、吞吐率最高提升3倍、能效比提升1.46倍,如果這些指標能在智譜的生產環境里兌現哪怕三分之一,對智譜的單位Token成本都是量級上的改善。
但更重要的在于智譜自研芯片的野心。7月7日外媒曾爆料智譜正在與國內芯片設計公司接洽,評估合作開發定制AI推理芯片的可能性。編譯器是自研過程中繞不開的一環。
閱讀最新前沿科技趨勢報告,請訪問21世紀關鍵技術研究院的“未來知識庫”
![]()
未來知識庫是 “21世紀關鍵技術研究院”建 立的在線知識庫平臺,收藏的資料范圍包括人工智能、腦科學、互聯網、超級智能,數智大腦、能源、軍事、經濟、人類風險等等領域的前沿進展與未來趨勢。目前擁有超過8000篇重要資料。每周更新不少于100篇世界范圍最新研究資料。 歡迎掃描二維碼或訪問https://wx.zsxq.com/group/454854145828進入。
截止到2月28日 ”未來知識庫”精選的百部前沿科技趨勢報告
(加入未來知識庫,全部資料免費閱讀和下載)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.