![]()
智東西
作者 王涵
編輯 漠影
最近一周,硅谷AI圈的兩件大事將AI的路線之爭(zhēng)推至頂點(diǎn)。
先是黃仁勛首條X推文轉(zhuǎn)發(fā)25家巨頭聯(lián)署公開(kāi)信,呼吁審慎監(jiān)管開(kāi)源AI模型;緊接著,OpenAI與Anthropic罕見(jiàn)聯(lián)手,超1100名員工聯(lián)署呼吁“控速”,Meta創(chuàng)始人兼CEO扎克伯格則公開(kāi)反擊稱(chēng)這是扼殺創(chuàng)新。
硅谷還在吵“該不該開(kāi)源”“該不該踩剎車(chē)”的時(shí)候,大洋彼岸的中國(guó)AI圈,開(kāi)源和前進(jìn)似乎從來(lái)就不是一道選擇題。從DeepSeek到智譜,從阿里通義到螞蟻百靈,中國(guó)大模型的開(kāi)源步伐從未停歇。
7月24日——恰恰是黃仁勛發(fā)推支持開(kāi)源的同一天,螞蟻百靈正式發(fā)布了新一代原生混合推理模型Ling-3.0-flash。該模型在OpenRouter與百靈官方平臺(tái)同步開(kāi)放限時(shí)免費(fèi)API調(diào)用,免費(fèi)期截至8月3日23:00,模型權(quán)重將在免費(fèi)期結(jié)束后正式開(kāi)源。
在Token調(diào)用量排行中,Ling-3.0-flash自發(fā)布其5天內(nèi)從第9位躍升至第6位,7月29日的調(diào)用量?jī)H比DeepSeek V4 Pro低0.5%。
![]()
Ling-3.0-flash總參數(shù)量為124B,激活參數(shù)量?jī)H為5.1B,與其5月開(kāi)源的旗艦級(jí)思考模型Ring-2.6-1T相比,總參數(shù)量約為后者的12.4%,激活參數(shù)量?jī)H為后者的8.1%,卻在12項(xiàng)基準(zhǔn)測(cè)試中有11項(xiàng)表現(xiàn)優(yōu)于Ring-2.6-1T。
![]()
硅谷巨頭們爭(zhēng)論不休的問(wèn)題“開(kāi)源能不能既安全又強(qiáng)大?”螞蟻百靈用產(chǎn)品給出了自己的回答。
一、以小搏大,12項(xiàng)測(cè)試11項(xiàng)超越萬(wàn)億旗艦
先來(lái)看看Ling-3.0-flash的成績(jī):
在基準(zhǔn)測(cè)試上,Ling-3.0-flash在34個(gè)評(píng)測(cè)維度中拿下15個(gè)第一、19個(gè)第二,綜合均分與DeepSeek-V4-Flash并列第一,領(lǐng)先萬(wàn)億級(jí)旗艦Ring-2.6-1T(59.7分)近8分。
螞蟻百靈同步提出了兩項(xiàng)新指標(biāo):智能密度(均分/總參數(shù)量)與智效比(均分/激活參數(shù)量)。Ling-3.0-flash智能密度達(dá)0.5,智效比高達(dá)13.2,在可比模型中雙雙登頂,幾乎是用最少的參數(shù)撬動(dòng)了最高的性能。
在代碼能力方面,在SWE-Bench Pro測(cè)試中,模型需要理解代碼庫(kù)、定位問(wèn)題并生成可通過(guò)測(cè)試的補(bǔ)丁,Ling-3.0-flash以56.6%的得分位居參測(cè)模型第一;在一次性生成完整交互式組件的ArtifactsBench中,其77.0%的得分?jǐn)鄬宇I(lǐng)先,高出第二名10余分。
MiniAppBench要求模型根據(jù)一句話需求生成完整APP,在16個(gè)主流模型平均僅17%通過(guò)率的硬核測(cè)試中,Ling-3.0-flash達(dá)到25.3%,與總參數(shù)約兩倍的開(kāi)源SOTA模型處于同等水平。
通用Agent能力方面,BFCL-v4是行業(yè)通用的函數(shù)調(diào)用評(píng)測(cè),Ling-3.0-flash以73.0%的準(zhǔn)確率與Claude-Sonnet-4.6并列第一。在端到端綜合Agent評(píng)測(cè)GDPVal v2-AA中,Ling-3.0-flash以1107分的成績(jī)?cè)趨y(cè)模型中拔得頭籌。Tau3-banking-AA將模型置于模擬銀行系統(tǒng)中完成金融操作,其28.0%的得分僅次于Claude-Sonnet-4.6。
![]()
搜索Agent能力上,WideSearch測(cè)試中,模型需在海量網(wǎng)頁(yè)中快速定位與用戶問(wèn)題最相關(guān)的信息,Ling-3.0-flash以73.6%排名第三。在多智能體協(xié)作模式下,該模型在BrowseComp測(cè)試中達(dá)到82.0%,與Claude-Sonnet-4.6的82.1%基本持平,驗(yàn)證了其在復(fù)雜網(wǎng)頁(yè)交互中的信息獲取能力。
指令遵循能力決定了模型在嚴(yán)格約束下的執(zhí)行可靠性,IFBench檢驗(yàn)?zāi)P蛯?duì)格式、角色、語(yǔ)氣等多重約束指令的遵循程度,Ling-3.0-flash得分74.5%,排名第三。LIFEBench則測(cè)試多輪對(duì)話中的長(zhǎng)期指令記憶與遵循能力,Ling-3.0-flash以77.3%位列第一,驗(yàn)證了其在長(zhǎng)程交互中的穩(wěn)定性。
推理能力上,在高難度數(shù)學(xué)競(jìng)賽測(cè)試中,Ling-3.0-flash的表現(xiàn)基本與主流模型持平;在專(zhuān)家級(jí)跨學(xué)科知識(shí)推理測(cè)試HLE中,Ling-3.0-flash依然領(lǐng)先萬(wàn)億級(jí)旗艦Ring-2.6-1T。
長(zhǎng)上下文能力是Ling-3.0-flash原生支持256K上下文窗口的直接體現(xiàn)。在MRCR_256K測(cè)試中,模型需在多輪對(duì)話中定位長(zhǎng)文本關(guān)鍵信息,Ling-3.0-flash取得81.1%,在同等規(guī)模模型中表現(xiàn)優(yōu)異。Multi-IF測(cè)試多輪對(duì)話中持續(xù)遵循跨輪指令的能力,Ling-3.0-flash以87.7%位列第二。
![]()
二、能力實(shí)測(cè):快、穩(wěn)、省,三個(gè)字能不能站住腳?
基準(zhǔn)測(cè)試終究是“考試”,模型好不好用,得看它能不能在實(shí)際場(chǎng)景中幫人把事辦成。
與其他模型不同,Ling-3.0-flash的定位非常清晰:不是要取代超大參數(shù)規(guī)模的通用推理模型,而是做那個(gè)可以幫你做事的AI。
在視覺(jué)與互動(dòng)場(chǎng)景中,Ling-3.0-flash的核心能力集中在兩點(diǎn):一是極短的首字響應(yīng)時(shí)間,二是多輪對(duì)話中維持復(fù)雜空間邏輯的能力。
例如在游戲開(kāi)發(fā)場(chǎng)景中,Ling-3.0-flash適合以“結(jié)對(duì)編程”模式參與漸進(jìn)式開(kāi)發(fā)。模型在多輪對(duì)話中能夠維持工程架構(gòu)的一致性——不丟上下文、不跑偏架構(gòu)、不陷入死循環(huán)。
通過(guò)三輪對(duì)話,我們用Ling-3.0-flash做出了一個(gè)3D臺(tái)球模擬器。可以看到,在這個(gè)模擬器中,我們可以控制白球的擊球角度和力度,彩色球被撞擊后的路徑也基本符合物理規(guī)律。在生成過(guò)程中,Ling-3.0-flash的反應(yīng)速度很快,幾乎不需要思考,可以精準(zhǔn)找到BUG,并進(jìn)行迭代優(yōu)化。
在開(kāi)發(fā)者與辦公場(chǎng)景中,Ling-3.0-flash展現(xiàn)的是長(zhǎng)程任務(wù)的穩(wěn)定性、多系統(tǒng)協(xié)同的調(diào)度能力,以及在嚴(yán)格約束下保持輸出質(zhì)量和格式一致性的執(zhí)行力。
在多智能體協(xié)同場(chǎng)景中,Ling-3.0-flash支撐了一套完整的科研工作流。不同Agent角色各司其職:Scientist提出假說(shuō)、Data Analyst檢索與驗(yàn)證、CrossValidator交叉質(zhì)詢、Archivist歸檔沉淀、Writer自動(dòng)產(chǎn)出論文與Slide報(bào)告。
在辦公自動(dòng)化場(chǎng)景中,Ling-3.0-flash通過(guò)掛載Office MCP工具集,將自然語(yǔ)言指令轉(zhuǎn)換為序列化的API調(diào)用,實(shí)現(xiàn)跨應(yīng)用自動(dòng)化工作流。
例如,用戶下達(dá)單次指令后,Ling-3.0-flash自動(dòng)在Excel中填入數(shù)據(jù)并生成透視表,隨后提取核心圖表插入Word文檔并完成排版。整個(gè)過(guò)程中,模型不依賴易出錯(cuò)的GUI模擬操作,而是通過(guò)底層協(xié)議直接驅(qū)動(dòng)軟件,而這正是“穩(wěn)定工具調(diào)用”能力的落地體現(xiàn)。
此外,Ling-3.0-flash無(wú)需外部圖像素材,僅憑代碼便可批量生成視覺(jué)表現(xiàn)力突出的藝術(shù)網(wǎng)頁(yè)。
該模型可以批量產(chǎn)出多款契合不同現(xiàn)代設(shè)計(jì)流派的頁(yè)面,覆蓋包豪斯、波西米亞、酸性設(shè)計(jì)等風(fēng)格,難度梯度由易至難。頁(yè)面完全依托CSS漸變、SVG路徑與版式布局構(gòu)建,脫離外部圖片素材依舊還原了各類(lèi)設(shè)計(jì)流派獨(dú)有的美學(xué)特征。
三、混合線性注意力+1/64稀疏MoE,把每一分算力榨干
“小身材大能量”的背后,是模型架構(gòu)上的創(chuàng)新。Ling-3.0-flash放棄了單純堆砌參數(shù)的思路,從預(yù)訓(xùn)練階段即對(duì)計(jì)算架構(gòu)進(jìn)行了重新設(shè)計(jì)。
Ling-3.0-flash從預(yù)訓(xùn)練伊始即采用原生混合線性注意力架構(gòu),以5:1的比例交替堆疊KDA(Kimi Delta Attention)線性注意力層與MLA(Multi-head Latent Attention)層。
其中,KDA將上一代的Lightning Attention進(jìn)行了升級(jí),在Delta Rule的狀態(tài)更新中引入細(xì)粒度對(duì)角門(mén)控,賦予不同特征通道獨(dú)立的保留、衰減與寫(xiě)入控制能力。這讓模型在處理長(zhǎng)文檔和大型代碼庫(kù)時(shí),能更精準(zhǔn)地記住跨段落的關(guān)鍵信息,避免在長(zhǎng)上下文中“迷失”。
MLA則通過(guò)低秩壓縮將KV Cache大幅縮減,降低推理時(shí)的顯存占用。兩者以5:1的比例交替堆疊,讓模型在長(zhǎng)上下文效率、狀態(tài)記憶與計(jì)算成本之間實(shí)現(xiàn)了協(xié)同躍升。
![]()
百靈團(tuán)隊(duì)提出的“Ling Scaling Law”認(rèn)為:更低的專(zhuān)家激活比例帶來(lái)更高的“效率杠桿”。Ling-3.0-flash進(jìn)一步壓縮了單次計(jì)算的專(zhuān)家激活比例,將每個(gè)Token的專(zhuān)家激活比例由前代的1/32壓縮至1/64。
1/64的稀疏比例意味著,模型雖然總參數(shù)達(dá)124B,但每次推理只需激活5.1B參數(shù)參與計(jì)算。通過(guò)更精細(xì)的專(zhuān)家路由策略,讓每個(gè)Token只調(diào)動(dòng)最相關(guān)的少數(shù)專(zhuān)家,將算力精準(zhǔn)投放到當(dāng)前任務(wù)最需要的地方。
此外,為了讓AI Agent運(yùn)行更快、更穩(wěn),百靈為L(zhǎng)ing-3.0-flash匹配了集群級(jí)的分級(jí)緩存架構(gòu)。模型創(chuàng)新接入了SGLang HiCache與Mooncake分級(jí)緩存體系(物理雙池、集群共享L3),使長(zhǎng)程交互無(wú)需重復(fù)計(jì)算。
該緩存架構(gòu)借鑒了現(xiàn)代CPU的三級(jí)緩存設(shè)計(jì)理念,將GPU內(nèi)存、主機(jī)內(nèi)存與分布式存儲(chǔ)分別組織為L(zhǎng)1、L2、L3三級(jí)緩存。長(zhǎng)對(duì)話和多輪交互中,已計(jì)算過(guò)的KV Cache可以被復(fù)用,避免重復(fù)計(jì)算。實(shí)測(cè)數(shù)據(jù)顯示,長(zhǎng)輸入場(chǎng)景下的首字響應(yīng)時(shí)間(TTFT)降低60%至80%以上。
![]()
在任務(wù)穩(wěn)定性上,百靈還升級(jí)了多智能體協(xié)同架構(gòu)——Ling Multi-Agent。各Agent通過(guò)分工協(xié)作、相互校驗(yàn),有效減少了單一模型在長(zhǎng)程任務(wù)中容易“跑偏”或誤判的風(fēng)險(xiǎn)。
這套架構(gòu)讓Ling-3.0-flash從一個(gè)單點(diǎn)執(zhí)行器,升級(jí)為可支撐多角色協(xié)同的“集團(tuán)軍”作戰(zhàn)平臺(tái),為高頻線上服務(wù)與真實(shí)業(yè)務(wù)落地提供了支撐。
![]()
從混合線性注意力到多智能體協(xié)同,四層架構(gòu)環(huán)環(huán)相扣。正是這套從底層計(jì)算到上層調(diào)度的系統(tǒng)性重構(gòu),讓Ling-3.0-flash以124B總參、5.1B激活的體量,在12項(xiàng)測(cè)試中11項(xiàng)超越萬(wàn)億旗艦成為可能。
結(jié)語(yǔ):開(kāi)源、能干活,才是最大范圍實(shí)現(xiàn)技術(shù)普惠
5 月開(kāi)源萬(wàn)億級(jí)Ling-2.6-1T、Ring-2.6-1T、Ling-2.6-flash,7月推出Ling-3.0-flash并計(jì)劃8月3日開(kāi)源,螞蟻百靈開(kāi)源節(jié)奏持續(xù)提速。
相比單純新增模型,Ling-3.0-flash更大的價(jià)值,是將輕量化高性價(jià)比的技術(shù)路線推向新階段。在高并發(fā)、低延遲的Agent商用場(chǎng)景下,依托約1/12激活算力即可逼近旗艦?zāi)P捅憩F(xiàn),有效降低企業(yè)推理開(kāi)銷(xiāo)。
當(dāng)開(kāi)源模型兼顧實(shí)用性、效果與成本優(yōu)勢(shì),技術(shù)普惠才有落地的現(xiàn)實(shí)基礎(chǔ)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.