為什么如今 AI 賬單如此難以預(yù)測(cè),以及當(dāng)行業(yè)逐漸解決這個(gè)問(wèn)題之后,會(huì)發(fā)生什么?
Token 爆炸悖論
我們估算,在過(guò)去四年里,全球每季度處理的 token 數(shù)量增長(zhǎng)了大約 17000 倍。
![]()
在此期間,token 價(jià)格大幅下跌。機(jī)器智能的需求具有高彈性,即價(jià)格下降時(shí),使用量的漲幅會(huì)超過(guò)價(jià)格的跌幅。
![]()
原因之一是,價(jià)格走低的token讓智能代理具備了商業(yè)可行性。
與此同時(shí),在單次查詢場(chǎng)景中,智能代理的token消耗速率遠(yuǎn)高于聊天機(jī)器人。
這一點(diǎn)體現(xiàn)在單位輸出token對(duì)應(yīng)的總處理token量上:高端模型會(huì)在用戶不可見(jiàn)的后臺(tái),完成大量運(yùn)算處理。
有個(gè)細(xì)節(jié)是,這一輪增長(zhǎng)中,很大一部分來(lái)自中國(guó)國(guó)內(nèi)需求,以及中國(guó)模型提供商的推動(dòng),尤其是字節(jié)和阿里巴巴這兩個(gè)大廠。
![]()
“幽靈 Token” 的成本
當(dāng)你使用 AI agent 時(shí),你最終看到的結(jié)果,其實(shí)只是 agent 完成全部工作之后的一份總結(jié)。
在背后,它可能已經(jīng)進(jìn)行了幾十次工具調(diào)用,比如瀏覽網(wǎng)頁(yè)、加載文件、檢查與驗(yàn)證結(jié)果等,所有這些步驟,都會(huì)消耗 token。
它們會(huì)變成隱藏的成本乘數(shù),這就是 token amplification(Token 放大效應(yīng))。
一個(gè)運(yùn)行 10 個(gè)回合的 coding agent,可能在每一輪都需要重新讀取完整上下文。
這種反復(fù)讀取上下文的行為,所消耗的 token 數(shù)量,可能達(dá)到同一個(gè)任務(wù)單輪請(qǐng)求的 55 倍。
與之相比,真正用于 active inference(主動(dòng)推理)的 token,實(shí)際上可能只占總消耗的 15% 到 20%。
剩余的大部分 token 消耗,都是用戶看不見(jiàn)的“隱形工作”。
而無(wú)論是作為用戶,還是為此付費(fèi)的公司,很多時(shí)候都沒(méi)有真正把這些成本計(jì)算進(jìn)去。
![]()
Tool Calls 的長(zhǎng)尾成本
Agents 在一次任務(wù)中,通常會(huì)進(jìn)行 5 到 25 次 tool call(工具調(diào)用)。
而每一次調(diào)用,都會(huì)帶來(lái)更多上下文、token 和 API 成本。
同時(shí),它還會(huì)提高模型需要重新嘗試任務(wù)(retry)的概率,以便得到正確結(jié)果。
更關(guān)鍵的是,同一個(gè)任務(wù)的 token 成本甚至可能相差 30 倍,因?yàn)?agent workflow 本身具有高度隨機(jī)性。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.