什么?大模型終于也開始打減肥針了?
這可不是我瞎說,據(jù)CNBC報道,蘋果正在接洽初創(chuàng)公司PrismML,后者以其最近推出的模型壓縮技術(shù)而著稱,蘋果希望借此評估在iPhone上直接運行更大規(guī)模AI模型的可行性。
![]()
(圖源:CNBC)
要知道這些年,每到手機發(fā)布會的AI環(huán)節(jié),我一般都會下意識拿起水杯。
倒也不是我和廠商有啥矛盾,實在是這套流程大家都太熟了。先讓AI總結(jié)屏幕上的各種東西,再用各種圖像編輯去做點個性化調(diào)色,或者是消掉照片里的路人,然后今年還普遍加了個項目,叫出一個語音助手幫你點杯咖啡。
但這倒不能全怪手機廠商,現(xiàn)在的主流大模型確實塞不進手機里,裁剪后的端側(cè)模型,智商又實在不太夠。到頭來,大家能宣傳的也只有云端更新的東西,你看豆包更了個AI播客功能,主流廠商基本上三個月內(nèi)全部跟進了。
問題來了,如果完整大模型瘦到手機裝得下,端側(cè)AI助手就真的能轉(zhuǎn)正嗎?
54GB降到4GB,模型壓縮技術(shù)要普及?
首先,跟著雷科技(ID:leitech)一起來看看這兩個問題:
PrismML是誰?
根據(jù)官網(wǎng)介紹,PrismML是一家專攻模型壓縮的初創(chuàng)公司,它脫胎于加州理工學(xué)院研究團隊,背后有Khosla Ventures、Cerberus和Google支持,研究重點就是怎么在盡量不把模型壓傻的前提下,把體積和運行成本狠狠干下來。
![]()
(圖源:PrismML)
他們做了什么?
PrismML的思路和BitNet這類低比特模型路線有相似之處,它通過大幅簡化人工智能模型內(nèi)部信息的存儲方式來縮小模型體積,將模型中的每個權(quán)重限制為二值或三值表達(dá),顯著降低存儲和運行模型所需的內(nèi)存。
具體來說,傳統(tǒng)大模型的一個參數(shù),通常需要16bit甚至32bit來保存。
![]()
(圖源:HuggingFace)
在這種情況下,如果一個270億參數(shù)模型采用FP16精度,270億×2 Byte≈54GB,這就是Qwen3.6-27B在FP16下的大致體積。
別說智能手機了,很多消費級PC也很難完整跑起來。
而在PrismML的思路下,1-bit版的參數(shù)都會被簡化為 {-1, +1} ,就像以前照片上的每個像素會保存16級灰度,現(xiàn)在只需要保存黑、白兩種灰度,雖然信息損失巨大,但是體積能壓縮到原版的1/14,并能通過訓(xùn)練方式恢復(fù)推理性能。
![]()
(圖源:PrismML)
在這個技術(shù)的基礎(chǔ)上,他們在7月15日正式推出了Bonsai-27B模型,基于Qwen3.6-27B模型微調(diào),在保留完整上下文的基礎(chǔ)上,將該模型從約54GB縮減至不足4GB,使其可以在12GB內(nèi)存的iPhone上原生運行。
要知道,谷歌面向手機和邊緣設(shè)備推出的Gemma 4 E4B約3.65GB,PrismML等于用差不多的“占地面積”,塞進了名義上270億參數(shù)的密集模型。
使用體驗先不討論,硬件廠商看完肯定兩眼放光。
![]()
(圖源:PrismML)
所以蘋果會對這玩意兒感興趣,一點都不奇怪。
要知道,蘋果自己的端側(cè)模型大約是30億參數(shù),也用了2位量化、緩存共享這些手段,卻只能負(fù)責(zé)手機上的實時翻譯、相冊搜索和郵件摘要這些功能,基本沒有Agent相關(guān)的執(zhí)行能力。
而Bonsai-27B模型,仍保留了Qwen3.6-27B的一部分Agent能力。
當(dāng)然,性能損失還是有的。在PrismML自己的測試?yán)铮蛋婢C合成績大約保留全精度模型的95%,1-bit版約90%,至于工具調(diào)用這些Agent很看重的項目,損失會更明顯。
社區(qū)測試也有人反饋:PrismML三值版本相比Q4_K_XL仍存在幻覺、Agent循環(huán)等問題,不過優(yōu)勢是體積極小,基本做到了以5.9GB媲美17.9GB的效果。
![]()
(圖源:Reddit)
但不管怎么說,能用就是比不能用要強。
從物理意義上的塞不下,到實際體驗?zāi)懿荒芙邮埽^續(xù)這樣推進下去,我覺得后面就有得卷了。
AI手機爆發(fā)在即,端側(cè)AI能力亟待提升
有趣的是,7月15日,蘋果智能、華為小藝、OPPO、小米、vivo等七款提供手機端側(cè)生成式人工智能的模型服務(wù),均已在網(wǎng)信部門完成備案。
你別說,這名單看著挺熱鬧,明顯今年手機廠商都開始認(rèn)真安排端側(cè)AI了。
![]()
(圖源:網(wǎng)信辦)
原因也不難理解,像是通知摘要、通話整理、相冊搜索、圖片識別這些事情,根本沒必要每次都跑去云端排隊。
特別是聊天記錄、照片和文件這種私人信息,能在自己手機里解決當(dāng)然最好,考慮到Grok最近爆發(fā)的隱私門,我完全能理解大家不希望自己的信息在互聯(lián)網(wǎng)上傳來傳去的心情。
![]()
(圖源:雷科技)
問題是,從我個人的體驗來看,目前各家手機AI功能還是以云端為主,絕大部分功能斷網(wǎng)以后就無法使用了。
為什么會出現(xiàn)這種情況?目前手機的端側(cè)AI又發(fā)展到了什么水平呢?
正好,我最近也在Google AI Edge Gallery里試了Gemma 4 E4B,可以給大家分享一下使用體驗。
![]()
(圖源:谷歌)
首先,大家要注意,Gemma 4 E4B已經(jīng)算手機端側(cè)模型里相當(dāng)能打的一款,文字、圖片、音頻都能處理;模型下載好以后,斷網(wǎng)照樣能聊。
比如Ask Image,就實現(xiàn)了以往很多手機端側(cè)AI很難做好的多模態(tài)輸入。
實測下來,Gemma 4有著不錯的圖片識別能力。雖然它對動漫角色依然不太熟,但是對于畫面里的特征捕捉做得很不錯,比較常見的食物、硬件、花卉也都能識別出來。
![]()
(圖源:雷科技)
還有Ask Audio,最多可上傳30s音頻并進行轉(zhuǎn)寫、總結(jié)等。
這個功能就比較遜色了,可能是因為我的錄音比較模糊的緣故,語音轉(zhuǎn)文字出來的內(nèi)容和原音頻幾乎沒有關(guān)系,目前可用性挺一般的,還是老老實實用豆包或者千問來總結(jié)比較好。
![]()
(圖源:雷科技)
至于文本處理嘛...
我給幾個能在手機端部署的模型喂了一篇2500字左右的文章,希望它們給出對應(yīng)的文章總結(jié)。
最終,只有Gemma 3n E4B和Gemma 4 E4B能完成任務(wù),但是前者耗時將近兩分鐘,而且給出的答案抓不住重點,后者給出的答案更加簡明扼要,主要信息點基本都抓到了,拿來快速掃資料完全夠用。
![]()
甚至就連一些過往解決不了的邏輯題,Gemma 4 E4B也能通過長時間思考拿下,只是思考時間遠(yuǎn)超在線大模型的響應(yīng)時間罷了。
在雷科技看來,Gemma 4 E4B已經(jīng)證明,手機本地模型確實能干活。
但只有在拿它做摘要、改寫、簡單識圖,我愿意用;可任務(wù)稍微復(fù)雜一點,尤其涉及長中文、細(xì)節(jié)判斷和內(nèi)容創(chuàng)作時,它和在線大模型之間的差距依然很明顯,就更別說Agent調(diào)用一類的任務(wù)了。
要知道,從壓縮率和功能性上看,Gemma 4已經(jīng)是目前最強的手機端側(cè)AI了。
想要突破這個效果,蘋果只能舍棄現(xiàn)有的壓縮方式,通過在相同的空間內(nèi)塞入更大參數(shù)量的模型,或許才能讓手機擁有一個不那么容易犯傻的大腦。
參數(shù)規(guī)模不重要,效率才是模型應(yīng)用的關(guān)鍵
以前大家談大模型,總覺得參數(shù)越多越有排面。
百億只是起步,萬億也不嫌多,在發(fā)布會上報數(shù)字像菜市場稱重,主打一個“我家蘿卜,又大又壯”。
看起來沒問題,但是實際運行起來就是另一回事了。
根據(jù)Jordan Hoffmann團隊的Chinchilla scaling law研究,在相同訓(xùn)練算力下,訓(xùn)練數(shù)據(jù)更充分的70B模型能夠全面超過欠訓(xùn)練的280B、530B模型,哪怕是萬億參數(shù)的MoE模型,顯存占用和內(nèi)存帶寬依然是不小的問題。
![]()
(圖源:arxiv)
更重要的是,參數(shù)如此龐大的模型,自然不可能進入消費級終端。
端側(cè)模型想要常駐手機,就得提升效率,直面內(nèi)存、功耗和散熱問題。PrismML的壓縮算法,算是給各家硬件廠商指明了一條路,再加上千問、百度與蘋果的本地化合作,也算是讓蘋果三年前承諾的“蘋果智能”距離真正落地又進了一步。
以后大模型的進步,未必還要靠參數(shù)數(shù)字嚇人。
能在不大的存儲空間里穩(wěn)定工作,少犯傻,少發(fā)熱,關(guān)鍵時候真能幫上忙,這才是端側(cè)AI下一階段最該卷的東西。
主題為「智能伙伴·共創(chuàng)未來」的WAIC2026開幕在即。
AI敘事路線從模型參數(shù)堆疊,轉(zhuǎn)變到Agent生產(chǎn)力落地;異構(gòu)協(xié)同、光子計算持續(xù)提高計算上限;具身智能加速應(yīng)用,機器人到家進廠讓物理AI變?yōu)楝F(xiàn)實。
雷科技WAIC探展團已抵達(dá)上海,直擊AI產(chǎn)業(yè)化落地年度巔峰時刻!
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.