6月8日晚,小米MiMo技術團隊正式上線Xiaomi MiMo-V2.5-Pro-UltraSpeed模式,這是全球首個在通用 GPU 上推理速度突破1000 tokens/s的萬億參數(shù)模型,刷新旗艦模型全球推理最快速度。
MiMo-V2.5-Pro-UltraSpeed通過對模型推理系統(tǒng)的全鏈路工程能力優(yōu)化,在不降低模型能力前提下,首次把推理速度提升至1000 tokens/s,且無需定制芯片、只使用通用GPU即可達成。這一突破打破了“快、強、通用 GPU無法兼得”的行業(yè)不可能三角,小米MiMo大模型推理工程實力躋身全球第一梯隊。
即日起至6月23日 ,MiMo-V2-Pro-UltraSpeed模式將采取申請制限時開放,通過申請的用戶可接入API進行體驗。MiMo-V2.5-Pro-UltraSpeed API 同步上線,采用限時體驗價,定價為 MiMo-V2.5-Pro 的 3 倍,同時提供輸出速度約 10 倍的提升,目前僅支持 API 體驗,不支持 Token Plan。
值得一提的是,自4月底以來,小米AI在模型能力、推理成本和推理效率三個維度接連取得突破:4月23日, MiMo-V2.5-Pro在全球權威大模型測評平臺Artificial Analysis上,獲得綜合智能指數(shù)與Agent指數(shù)全球開源模型并列第一;5月27日,Xiaomi MiMo-V2.5系列模型API因技術優(yōu)化宣布最高降價99%,并同步調(diào)整Token Plan計費體系。6月8日,MiMo-V2.5-Pro-UltraSpeed以1000 tokens/s創(chuàng)下萬億參數(shù)旗艦模型推理速度新紀錄。
![]()
全鏈路優(yōu)化工程能力突破
打破“快、強、通用”不可能三角
過去,大模型領域存在一個隱形瓶頸:速度快的模型往往參數(shù)小、能力弱;能力強的模型又因為體量龐大而響應緩慢,且很多高速推理模型依賴昂貴的專用芯片。
Xiaomi MiMo-V2.5-Pro-UltraSpeed模式用通用GPU實現(xiàn)了萬億參數(shù)模型的1000 tokens/s推理速度,讓大模型在不降低模型能力的前提下,獲得接近實時的復雜任務響應能力,成為全球首個達到這一速度水平的萬億參數(shù)模型。
小米MiMo技術團隊表示,該突破是基于Xiaomi MiMo-V2.5 Pro的SWA架構,疊加了 FP4 Experts、DFlash 解碼以及TileRT團隊的執(zhí)行系統(tǒng) Co?design,從模型到推理引擎再到GPU執(zhí)行路徑進行了全鏈路優(yōu)化。這是小米AI在模型推理系統(tǒng)全鏈路優(yōu)化工程能力的新突破,打破了“快、強、通用GPU無法兼得”的行業(yè)不可能三角,推理工程實力躋身全球第一梯隊。
Xiaomi MiMo-V2.5-Pro-UltraSpeed的發(fā)布,標志著旗艦大模型開始邁入新的推理效率階段,也為未來更廣泛的實時應用場景提供了可能。
![]()
從“聊天實時”邁向“任務實時”
大模型拓寬Agent生產(chǎn)力邊界
作為全球首個在通用 GPU 上突破1000 tokens/s的萬億參數(shù)模型,Xiaomi MiMo-V2.5-Pro-UltraSpeed模式帶來的變化,不僅僅是回答問題快了幾秒,它第一次讓萬億參數(shù)模型能夠真正參與到復雜的實時任務場景。
過去,大模型最典型的使用場景是聊天問答。用戶向模型提問,模型給出答案;用戶繼續(xù)追問,模型繼續(xù)回復。
但隨著Agent興起,大模型開始從“回答問題”轉向“完成任務”。無論是開發(fā)應用、生成代碼,還是多個Agent協(xié)同的復雜工作流,本質上都需要模型在后臺持續(xù)進行大量推理調(diào)用。
過去限制這些場景普及的關鍵因素并非模型能力不足,而是推理延遲過高。當一次任務需要調(diào)用幾十次甚至上百次模型推理時,每輪幾秒鐘的等待都會被不斷放大,最終形成分鐘級甚至更長的響應、執(zhí)行時間。
Xiaomi MiMo-V2.5-Pro-UltraSpeed模式實現(xiàn)1000 tokens/s推理速度后,萬億參數(shù)大模型具備了接近實時完成復雜任務的能力,大模型進入智能編程、Agent協(xié)同、高頻量化交易等復雜任務場景的門檻正在降低。
如果說過去的大模型解決的是“聊天效率”問題,那么更高的推理效率正在推動大模型從“聊天實時”邁向“任務實時”,從信息工具逐步演變?yōu)檎嬲纳a(chǎn)力工具。
![]()
接連完成三項重要技術突破
小米AI進展遠超預期
截至目前,小米AI在短短一個半月內(nèi)已接連完成三項重要技術突破。
4月23日,MiMo-V2.5-Pro在全球權威大模型測評平臺Artificial Analysis上,獲得綜合智能指數(shù)、Agent指數(shù)雙項全球開源模型并列第一。
5月27日,得益于小米MiMo技術團隊持續(xù)優(yōu)化推理系統(tǒng),顯著提升了緩存命中率與推理效率,在保障服務質量的前提下,有效降低了單位token服務成本。Xiaomi MiMo-V2.5系列模型API宣布永久降價,并同步調(diào)整Token Plan計費體系。
6月8日,Xiaomi MiMo-V2.5-Pro-UltraSpeed實現(xiàn)1000 tokens/s推理速度突破,刷新旗艦大模型全球推理速度紀錄。
從模型登頂全球開源模型第一,到技術優(yōu)化驅動API降價,再到推理速度刷新全球記錄,小米AI在一個半月內(nèi)接連完成三項重要突破,進展遠超外界預期。
![]()
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.