當大模型進入20 萬、100 萬上下文時代,真正拖慢推理速度的,可能已經不是 Attention,而是負責“找誰該參與 Attention”的 Index。
這是清華大學、Z.ai(智譜前身團隊)最新論文《IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse》提出的核心觀點。
論文聚焦于 DeepSeek Sparse Attention(DSA)這一已經應用于生產環境的稀疏注意力機制,并提出一種幾乎不用修改模型結構、也幾乎不增加顯存的新方法,將大量重復的索引計算直接“復用”,從而進一步提升超長上下文推理效率。
![]()
論文首先指出,隨著 Agent、長上下文推理、RAG 等應用興起,大模型越來越頻繁地處理數十萬甚至上百萬 Token。
傳統 Transformer 的 Attention 計算復雜度隨上下文長度平方增長,因此近年來業界普遍開始采用 Sparse Attention(稀疏注意力),例如 DeepSeek 提出的 DSA。
DSA 不再讓每個 Token 與所有歷史 Token 計算注意力,而是先利用一個輕量級 Lightning Indexer 找出最相關的 Top-k Token,再只計算這些 Token 的 Attention,將核心 Attention 的復雜度從 O(L2) 降低到 O(Lk)。
但一個新的瓶頸出現了。
智譜唐杰在社交媒體發文稱,“DSA 讓注意力變快了,卻留下一筆隱性的 O(L2) 開銷:indexer 每層都要重算一次。但相鄰層其實在挑幾乎相同的 token——大多數層根本不需要自己的 indexer。”
也就是說,當上下文越來越長時,這部分計算反而開始成為最大的耗時來源。
![]()
論文給出的數據十分直觀:在 20 萬 Token 上下文下,Indexer 已經占據整個 Prefill 階段約 81% 的時間。
論文分析了 47 層 DSA 模型不同層之間選擇出的Top-k Token,發現相鄰層選擇出的 Token 重疊率達到 70%~100%。
也就是說,大模型大量時間已經不是在思考,而是在一層又一層重復尋找幾乎相同的 Token。
![]()
IndexCache 的核心思想因此非常簡單:既然結果幾乎一樣,就不要每層都重新計算。
論文將 Transformer 層劃分為兩類。
第一類稱為 Full Layer,保留完整 Indexer,正常計算 Top-k;第二類稱為 Shared Layer,不再運行自己的 Indexer,而是直接復用最近一個 Full Layer 已經計算好的 Top-k 索引。
論文還提出了兩種不同實現方式。
第一種是 Training-free IndexCache。它無需重新訓練模型,而是在一小部分校準數據上,通過貪心搜索尋找哪些層應該保留 Indexer,以語言模型損失最小作為優化目標,因此能夠直接部署到已有模型。
第二種是 Training-aware IndexCache。它增加了一種跨層蒸餾損失,讓保留下來的 Indexer 同時學習多個層的注意力分布,從而能夠支持更加激進的跨層共享,在減少更多計算的同時保持模型精度。
實驗結果也是論文最大的亮點。
在一款 300 億參數 DSA 模型上,IndexCache 移除了 75% 的 Indexer 計算,模型質量幾乎沒有下降;在 20 萬 Token 長上下文下,Prefill 加速最高達到 1.82 倍,Decode 加速達到 1.48 倍。
![]()
作者進一步將方案驗證到生產級 GLM-5 模型上。
GitHub 公布的數據表明,僅保留一半 Indexer(1/2 配置)時,GLM-5 整體端到端推理速度提升約 1.2 倍,而 LongBench、MRCR v2、GraphWalks、RULER、AA-LCR、AIME25、SciCode、IFBench 等 10 項長上下文與推理基準成績幾乎保持一致。
例如 AIME25 保持 95.9 分,RULER 為 97.3 分,HLE 保持 30.4 分,IFBench 從 71.0 僅變化至 70.0,整體精度變化極小。
更重要的是,IndexCache 并沒有引入復雜的新架構。
用唐杰的話說就是,“只改了幾行代碼就能實現”。
根據論文和開源倉庫介紹,它只是在現有 DSA 推理流程中增加了一層跨層索引復用邏輯,無需額外 GPU 顯存,僅增加極少量控制邏輯即可部署到 vLLM、SGLang 等推理框架。
目前官方已經支持 DeepSeek-V3.2 與 GLM-5 等采用 DSA 架構的模型。
過去幾年,大模型推理優化主要集中在 FlashAttention、KV Cache、MoE、量化等方向,而 IndexCache 的思路則說明,隨著模型越來越成熟,很多性能提升已經不再來自重新設計 Transformer,而是來自發現系統內部那些長期被忽略的“重復計算”。
對于擁有幾十萬甚至上百萬上下文的大模型而言,這類優化的價值可能會越來越高。
DeepSeek 一直在大模型優化方面思路清奇、屢有驚艷,現在智譜也加入了進來,中國 AI 在大模型基礎算法上的創新空間值得期待。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.