![]()
新智元報(bào)道
![]()
五千名工程師,四個(gè)月,把Uber一整年的AI預(yù)算燒成了灰。
面對這張賬單,Uber的COO直接懵了:錢燒成這樣,ROI到底在哪?
緊接著,微軟、Meta、亞馬遜,一個(gè)接一個(gè)開始給員工手里的AI編程工具踩剎車。
魔幻的是,這一切偏偏發(fā)生在Token單價(jià)一路下跌的2026年。
而它背后的「罪魁禍?zhǔn)住梗褪茿gent。
一個(gè)Agent跑完一個(gè)完整任務(wù)吞掉的Token,是過去一次簡單問答的數(shù)倍乃至數(shù)十倍。模型越會(huì)干活,賬單漲得越快。
于是,一門去年還沒人當(dāng)回事的學(xué)問,今年成了顯學(xué)——給AI算賬。
![]()
建模型的時(shí)代過去了
「麻煩」才剛開始
和前兩年相比,現(xiàn)在的模型可以說是多到數(shù)不清。開源的、閉源的、通用的、行業(yè)的,能訓(xùn)的幾乎都訓(xùn)出來了。
但更難的問題隨之而來:模型都有了,怎么讓它們在企業(yè)里跑得又快、又省、又安全?
真實(shí)的現(xiàn)場比想象中更亂。
一家大型企業(yè),應(yīng)用建了百八十個(gè),模型接了四五十個(gè),中間靠一條條硬連接對上。哪個(gè)應(yīng)用走哪個(gè)模型,全憑當(dāng)初誰接的誰。
跑是能跑。但三件麻煩事會(huì)挨個(gè)找上門。
第一件是成本。
不同任務(wù)的復(fù)雜度天差地別,落地時(shí)企業(yè)卻習(xí)慣性地全量呼叫最高性能的模型。資源利用率跌進(jìn)谷底,Token賬單一路飆升。
第二件是治理。
AI已經(jīng)在碰核心業(yè)務(wù)了,但權(quán)限怎么切、操作怎么審計(jì)、敏感數(shù)據(jù)怎么防外泄,這些企業(yè)級的防線普遍千瘡百孔。一個(gè)能直接調(diào)用核心數(shù)據(jù)的AI,如果沒裝安全護(hù)欄,本身就是一枚定時(shí)炸彈。
第三件是國產(chǎn)化。
在央國企主導(dǎo)的私有化機(jī)房里,國產(chǎn)芯片上的推理效率,直接決定這臺AI引擎轉(zhuǎn)不轉(zhuǎn)得起來,轉(zhuǎn)得劃不劃算。
這三件事指向同一個(gè)結(jié)論:企業(yè)AI的重心,正在從「模型能力」轉(zhuǎn)向「AI基礎(chǔ)設(shè)施運(yùn)營」。
換句話說,AI的上半場拼的是誰的模型更強(qiáng),下半場拼的是誰管得住。
而這場控制力之戰(zhàn)的第一塊陣地,正是模型路由。
全都用最強(qiáng)的,這毛病你可能也有
這事你大概也有體感。自己用AI寫代碼的時(shí)候,明明有便宜的檔位擺在那兒,可你還是把檔位拉滿。畢竟,萬一它解決不了怎么辦?
一個(gè)人這么干,浪費(fèi)可能只是這周的訂閱額度。但到了企業(yè)這里,就會(huì)變成一句「我的訂單到哪了」和一份上百頁的合同條款審查,燒掉一樣貴的Token。
實(shí)際上,文本分類、信息抽取這類輕松活兒,跟長文檔分析、復(fù)雜推理這類硬骨頭,對算力的消耗差著好幾個(gè)量級。
「模型路由」要做的,就是讓每個(gè)任務(wù)都匹配到「剛剛好」的模型——
簡單任務(wù)走性價(jià)比,復(fù)雜任務(wù)上高性能,在效果和成本之間找到最優(yōu)解。
企業(yè)與大模型之間的超級立交
就在這屆WAIC上,科大訊飛星火企業(yè)軍團(tuán)給出了自己的答案——「星火Token Factory」。
它的作用,是橫在業(yè)務(wù)和大模型之間的「統(tǒng)一中間層」。
所有模型調(diào)用請求,都先流經(jīng)這一層,由它來統(tǒng)一接入、智能調(diào)度、優(yōu)化成本、把守安全。
最終實(shí)現(xiàn)的是,讓任務(wù)匹配對的模型(算得聰明),砍掉不必要的算力消耗(算得省),把每一筆Token的賬算清(算得明)。
![]()
接下來,我們一件一件拆開看。
把貴的模型用在刀刃上
首先是「星火Token Factory」的第一件事,也是最核心的一件。
它會(huì)根據(jù)Prompt長度、對話輪次、任務(wù)難度和數(shù)據(jù)敏感等級,把請求分成不同的級別,再匹配對應(yīng)量級的模型:
簡單的FAQ交給輕量模型,常規(guī)的公文摘要交給標(biāo)準(zhǔn)模型。復(fù)雜的合同審查等Agent應(yīng)用交給Agent增強(qiáng)模型,而戰(zhàn)略規(guī)劃、安全審計(jì)這類要緊事,強(qiáng)制調(diào)用最高規(guī)格模型。
整個(gè)路由決策,會(huì)綜合考慮「質(zhì)量、成本、延遲、可用性、安全」等五個(gè)因子,而且平均決策延遲壓在100毫秒以內(nèi)。
進(jìn)到真實(shí)業(yè)務(wù)里,這省下來的全是真金白銀。
比如有個(gè)企業(yè)就發(fā)現(xiàn),客服平臺日均數(shù)萬次咨詢中,超過60%的請求不過是查訂單、問退換貨這類不用動(dòng)腦的問題。
接入網(wǎng)關(guān)按難度分流、敏感信息強(qiáng)制走私有化之后,月均Token成本不僅比之前全量灌給高檔模型砍掉了一半還多,而且響應(yīng)速度反而還更快了。
不過,選對模型還只是第一步。接下來這三層,是為了在同一件事上少花冤枉Token。
第一層是語義緩存。遇到相似的舊問題,系統(tǒng)直接從記憶庫里掏出答案。在內(nèi)部知識問答這種高頻轟炸的場景里,命中率能穩(wěn)定在20%到30%。
第二層是Prompt壓縮,第三層是上下文裁剪,各自再精準(zhǔn)剔掉10%到20%的輸入贅肉。
三層疊加,綜合可以削減30%到60%的Token消耗。
對一家日調(diào)用量以億計(jì)的大企業(yè)來說,這幾十個(gè)百分點(diǎn)的落差,就是財(cái)報(bào)上真金白銀的差別。
同樣的卡,扛起翻倍的業(yè)務(wù)
跨過路由這關(guān),還有一塊更硬的骨頭:推理引擎。
在國產(chǎn)化私有部署場景里,推理引擎的強(qiáng)弱,直接宣判了算力利用率和服務(wù)成本。
在這個(gè)場景里,科大訊飛針對DeepSeek、Qwen、GLM等國產(chǎn)主流模型,緊貼昇騰硬件特性,從最底層的算子一路做到最上層的調(diào)度。
顯存?zhèn)扔媚P蛪嚎s和精度優(yōu)化把占用壓下來,讓有限的硬件能吃下更大的模型、更長的上下文;
計(jì)算側(cè)把零散算子融合成高效指令序列,還對多卡通信做了調(diào)度優(yōu)化,讓計(jì)算和通信并行重疊;
緩存?zhèn)纫肟绻?jié)點(diǎn)的KV Cache管理和上下文感知的緩存路由;
解碼側(cè)則上了面向昇騰的并行解碼加速。
實(shí)測顯示,相同硬件條件下,對標(biāo)開源的vLLM-Ascend框架,推理效率提升約為5倍,首Token延遲降低30%到40%。
也就是說,同一批國產(chǎn)算力,現(xiàn)在能硬抗接近翻倍的業(yè)務(wù)量;反過來,企業(yè)也可以用更少的卡,撐起同樣規(guī)模的服務(wù)。
另一家企業(yè)的經(jīng)歷,便是這串?dāng)?shù)字最好的注腳。
他們在自有的8臺8卡昇騰服務(wù)器上,塞進(jìn)了訊飛星火、DeepSeek、Qwen等一眾模型,承載內(nèi)部多個(gè)AI應(yīng)用。
隨著接入的應(yīng)用越掛越多,工作日高峰期的并發(fā)壓力不斷攀升,吞吐終于撞上天花板。響應(yīng)卡頓、排隊(duì)等待,個(gè)別長文本請求甚至?xí)哉纪ǖ溃哑渌陶埱蠡罨钔下?/p>
經(jīng)過評估之后,他們最終決定直接升級高性能推理框架。結(jié)果就是,整體效率提升約50%,等效省下數(shù)百萬元的硬件采購成本。
你只知道花了多少,卻不知道值不值
開頭那張讓大廠高管夜不能寐的賬單里,其實(shí)藏著兩個(gè)問題:錢花在哪了,和這錢花得值不值。
過去企業(yè)能查到的,最多只有前半個(gè)。
某個(gè)API調(diào)了多少次,扣了多少錢,賬單上寫得清清楚楚。但這筆錢辦成了哪件事、頂了幾個(gè)人力、這活到底該不該交給大模型,賬上一個(gè)字都查不出來。
對此,「星火Token Factory」給的答案是全鏈路可觀測。
從用戶、部門、項(xiàng)目、模型一直追蹤到部署方式,用八個(gè)維度把每一筆Token的去向扒得一清二楚,再配上預(yù)算預(yù)警、路由分析和ROI報(bào)表。
這一點(diǎn)對企業(yè)的數(shù)字化部門尤其要命。
一年預(yù)算砸下去,建了幾十個(gè)模型、上百個(gè)應(yīng)用,年底要跟大領(lǐng)導(dǎo)匯報(bào)成效。過去,多半只能靠拼湊和估算,現(xiàn)在總算有據(jù)可查了。
安全那一側(cè),「星火Token Factory」另有一套企業(yè)級體系。
三權(quán)分立加混合授權(quán),管理不碰數(shù)據(jù)、操作不碰權(quán)限、審計(jì)不碰業(yè)務(wù),三者互相獨(dú)立、互相制約;全鏈路審計(jì)記錄不可篡改、不可刪除、不可繞過;敏感信息自動(dòng)識別、分級路由,確保數(shù)據(jù)不出域。
這套治理體系,往往比模型跑分榜上的名次,更能決定一家企業(yè)的掌舵者到底敢不敢把核心業(yè)務(wù)交出去。
AI的下半場,拼的是運(yùn)營力
除了作為調(diào)度中樞的「星火Token Factory」,科大訊飛星火企業(yè)軍團(tuán)這次還發(fā)布了三款企業(yè)級新品。它們合在一起,共同拼出一張「場景—能力—平臺」新產(chǎn)品矩陣。
星火營銷助理,是一個(gè)精通營銷策略、能持續(xù)進(jìn)化的AI營銷數(shù)字員工。它以營銷策略大腦為核心,跑通了「1名真人座席+5個(gè)AI分身」的人機(jī)協(xié)同模式,AI分身的音色和溝通風(fēng)格與真人座席保持一致。在試點(diǎn)中,日均有效溝通時(shí)長被提高了36%。
![]()
星火AI企業(yè)風(fēng)控官,則扛起「企業(yè)風(fēng)險(xiǎn)體檢」這面大旗,把過去高度依賴?yán)蠋煾到?jīng)驗(yàn)的風(fēng)險(xiǎn)判斷,格式化成可解釋、可追溯的標(biāo)準(zhǔn)動(dòng)作。審核決策效率提升5到8倍,目前已經(jīng)穩(wěn)穩(wěn)扎進(jìn)多家頭部銀行的信貸風(fēng)控場景。
![]()
星火智能語音VoiceWise,通過高性能CPU版ASR讓企業(yè)徹底擺脫對昂貴GPU的依賴,同等算力下在線識別并發(fā)路數(shù)提升約90%。全雙工技術(shù)更讓AI能邊說邊聽,在某保險(xiǎn)公司的業(yè)務(wù)高峰期,扛住了7000路實(shí)時(shí)語音并發(fā)。
![]()
如今,全球AI早就跨過了「能不能用」的青澀期。尤其是,中國的日均Token調(diào)用量,兩年漲了超過一千倍。
但Uber們的賬單同時(shí)也在宣告,光會(huì)用,遠(yuǎn)遠(yuǎn)不夠。
真正決定一家企業(yè)能走多遠(yuǎn)的,是下半場的新法則。
當(dāng)模型能力逐漸成為公共品,企業(yè)之間的差距,將越來越取決于誰能把AI管得更精細(xì)、算得更清楚、跑得更穩(wěn)定。
換句話說,未來企業(yè)競爭的,不再只是模型能力,而是AI運(yùn)營能力。
模型路由的調(diào)度、推理引擎的壓榨、安全底線的死守、運(yùn)營數(shù)據(jù)的深度解剖,這些深埋地下的隱形地基,正在成為AI規(guī)模化落地的真正支撐。
這次「星火Token Factory」補(bǔ)上的,正是這塊地基。
它讓語音、營銷、風(fēng)控這些沖鋒在前的能力,得以在企業(yè)的血管里安全高速地奔涌;也讓站在Token經(jīng)濟(jì)與國產(chǎn)化替代雙重路口上的央國企,摸到一條從概念驗(yàn)證走向價(jià)值兌現(xiàn)的清晰航道。
模型參數(shù)還會(huì)繼續(xù)膨脹。但下一張寄到CFO桌上的AI賬單,不該再是一筆糊涂賬。
算得清、接得快、管得住——這是企業(yè)AI下半場的入場券,也正是「星火Token Factory」想替企業(yè)拿到的東西。
https://www.forbes.com/sites/janakirammsv/2026/05/17/uber-burns-its-2026-ai-budget-in-four-months-on-claude-code/
https://www.news.cn/tech/20260326/8026bd54df3f489a8c79d4438cac96b3/c.html
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.