當(dāng)下,AI 大語言模型越來越多地使用超長上下文,雖然能提升問答、推理等任務(wù)效果,卻也讓 token 調(diào)用、算力成本大幅上漲。
這幾乎成了限制大模型發(fā)展及用戶使用的主要矛盾之一。
為此,各類精簡上下文的技術(shù)層出不窮,比如信息檢索、內(nèi)容壓縮等,但這些方案往往只會(huì)單獨(dú)看模型效果或,運(yùn)行成本,而沒有統(tǒng)一的評(píng)判標(biāo)準(zhǔn),很難判斷哪種方案更適合實(shí)際落地。
針對(duì)該問題,日前,西北大學(xué)、杜克大學(xué)、卡耐基梅隆大學(xué)等組成的研究小組推出《效率前沿:面向大語言模型上下文管理的成本-性能協(xié)同優(yōu)化統(tǒng)一框架》的論文。
![]()
論文提出了“效率前沿”這套全新評(píng)估框架,以平衡大模型上下文管理中的性能與成本問題。
研究團(tuán)隊(duì)選用經(jīng)典問答數(shù)據(jù)集完成測試,覆蓋檢索、內(nèi)容壓縮、全量上下文等主流用法。
論文指出:“英偉達(dá)顯卡相關(guān)邏輯不適用于大模型上下文優(yōu)化,不同場景沒有萬能方案”,實(shí)驗(yàn)證實(shí),結(jié)合實(shí)際使用場景做優(yōu)化,在性能相近時(shí),可將有效 token 用量降低約25%。
這套框架最大的特點(diǎn),是加入了“復(fù)用成本”考量。即,如果一段上下文會(huì)被多次調(diào)用,前期壓縮處理的開銷就能被平攤。在追求更高模型表現(xiàn)的場景下,內(nèi)存壓縮方案相比直接使用全文,token 成本能減少五成以上。
研究也明確了不同方案的適用范圍:追求低成本,優(yōu)先選用輕量化檢索;內(nèi)容反復(fù)調(diào)用,內(nèi)容壓縮性價(jià)比更高;想要拿到最佳效果,就必須保留完整上下文。
整體來看,該成果填補(bǔ)了行業(yè)評(píng)測的空白。它跳出了單純比拼模型精度的思維,幫開發(fā)者根據(jù)業(yè)務(wù)需求、使用頻次選擇最優(yōu)方案。既能控制算力與使用成本,減少資源浪費(fèi),也為大模型高效、可持續(xù)地規(guī)模化部署,提供了簡單可行的參考標(biāo)準(zhǔn)。
以下為論文全文——
《效率前沿:面向大語言模型上下文管理的成本-性能協(xié)同優(yōu)化統(tǒng)一框架》
摘要
當(dāng)下大語言模型(LLM)愈發(fā)依賴長上下文處理能力,但擴(kuò)展上下文窗口會(huì)帶來高昂的計(jì)算與資金成本。現(xiàn)有上下文精簡技術(shù)(包括檢索、內(nèi)存壓縮等方法),通常將性能指標(biāo)與效率指標(biāo)分開評(píng)估,難以開展系統(tǒng)性對(duì)比,也無法結(jié)合實(shí)際部署場景制定決策。
本文提出效率前沿框架,這是一套用于大語言模型上下文管理、實(shí)現(xiàn)成本與性能協(xié)同優(yōu)化的統(tǒng)一體系。
該框架將上下文策略選擇轉(zhuǎn)化為面向?qū)嶋H部署的優(yōu)化問題,結(jié)合平攤成本建模,綜合考量任務(wù)性能、token 開銷與預(yù)處理復(fù)用價(jià)值。以往研究多對(duì)各類方法進(jìn)行孤立測試,而本框架可結(jié)合不同運(yùn)行場景,從決策角度分析各類上下文管理策略的適用條件。
研究基于5000條HotpotQA數(shù)據(jù)集樣本完成實(shí)驗(yàn),清晰劃分出檢索類策略與預(yù)處理類策略的適用區(qū)間及切換邊界。
實(shí)驗(yàn)結(jié)果表明:在模型性能基本持平(F1值≈0.78)的情況下,這套面向部署場景的優(yōu)化方案可將有效token使用量降低約25%;在高性能運(yùn)行場景中,采用平攤式內(nèi)存壓縮方案,相較于全上下文提示方案,token開銷降幅超50%。
總體而言,本框架為評(píng)估和落地可擴(kuò)展、高效率、可持續(xù)的大語言模型系統(tǒng),提供了兼具理論依據(jù)與實(shí)踐價(jià)值的支撐。
![]()
一、引言
近年來,大語言模型技術(shù)發(fā)展迅猛,在搜索、客戶服務(wù)、知識(shí)處理等各類自然語言處理任務(wù)中均展現(xiàn)出優(yōu)異能力。但模型規(guī)模擴(kuò)大、輸入上下文長度不斷增加,也持續(xù)推高計(jì)算成本與使用成本。
隨著上下文窗口不斷擴(kuò)容,新增token帶來的計(jì)算開銷增速,往往遠(yuǎn)超下游任務(wù)的性能提升幅度,如何高效利用上下文,已成為一大重難點(diǎn)。
與此同時(shí),大規(guī)模人工智能系統(tǒng)產(chǎn)生能耗、水資源消耗等環(huán)境問題,其長期可持續(xù)發(fā)展也受到業(yè)界廣泛關(guān)注。上述問題,凸顯出優(yōu)化大語言模型上下文利用率的迫切需求。
目前已有諸多研究探索在保障任務(wù)性能的前提下縮短上下文長度的技術(shù),主流方案包括基于檢索的信息篩選、文本摘要、上下文壓縮等。這類技術(shù)通過保留高價(jià)值相關(guān)信息、剔除冗余低效內(nèi)容來提升運(yùn)行效率。
盡管相關(guān)方法已取得不錯(cuò)效果,但現(xiàn)有評(píng)估體系較為零散。過往研究一般單獨(dú)報(bào)告精確匹配率(EM)、F1值等性能指標(biāo),以及token消耗量、推理時(shí)延等成本指標(biāo),很少綜合評(píng)估成本削減與性能損耗之間的取舍關(guān)系。
此外,檢索法、壓縮法、長上下文方案的實(shí)驗(yàn)設(shè)置各不相同,難以開展橫向?qū)Ρ取R虼耍趯?shí)際部署的約束條件下,如何系統(tǒng)性對(duì)比各類上下文精簡策略、判斷不同場景下的最優(yōu)方案,目前仍缺乏有效手段。
針對(duì)該問題,本文構(gòu)建一套統(tǒng)一評(píng)估框架,規(guī)范化測評(píng)大語言模型上下文精簡技術(shù)的運(yùn)行效率。
我們提出效率前沿概念,這是一套分為三階段的評(píng)估體系,可量化不同上下文管理策略下,任務(wù)性能與計(jì)算成本的制衡關(guān)系。
區(qū)別于以往割裂評(píng)估性能與成本的思路,本框架明確給出上下文策略的選擇邏輯,打通了檢索類方法與長上下文處理方案之間的測評(píng)壁壘。框架引入?yún)?shù)化對(duì)數(shù)效用指標(biāo),用以描述新增上下文帶來的收益遞減規(guī)律,同時(shí)納入預(yù)處理平攤成本。
通過調(diào)整復(fù)用參數(shù)N,該框架可模擬真實(shí)部署環(huán)境,定位不同策略的適用切換區(qū)間,實(shí)現(xiàn)多方案系統(tǒng)性對(duì)比。
除評(píng)估功能外,本框架還能結(jié)合不同成本條件與復(fù)用場景,為學(xué)術(shù)研究和工程落地中的上下文策略選型提供實(shí)操指導(dǎo),將研究重心從單純擴(kuò)充上下文容量,轉(zhuǎn)向優(yōu)化真實(shí)場景下的上下文利用效率。
本文選用HotpotQA數(shù)據(jù)集開展實(shí)驗(yàn),該數(shù)據(jù)集面向多跳推理任務(wù),同時(shí)包含有效上下文與干擾信息,可全面測評(píng)上下文精簡方案對(duì)模型精度造成的影響。
二、相關(guān)研究
2.1 大語言模型評(píng)估體系
現(xiàn)階段大語言模型的評(píng)估體系不再局限于任務(wù)準(zhǔn)確率,還拓展至魯棒性、公平性、泛化能力、計(jì)算效率,以及對(duì)提示詞、交互形式的敏感度等多個(gè)維度。
除任務(wù)性能外,HELM等主流評(píng)測框架及各類專項(xiàng)基準(zhǔn)測試,愈發(fā)強(qiáng)調(diào)對(duì)模型表現(xiàn)的多維度評(píng)估,尤其關(guān)注準(zhǔn)確率與運(yùn)行效率之間的權(quán)衡關(guān)系。
與此同時(shí),面向高效、可持續(xù)人工智能的相關(guān)研究,也凸顯出資源導(dǎo)向型評(píng)估標(biāo)準(zhǔn)的重要性,評(píng)估指標(biāo)涵蓋計(jì)算開銷、能耗、推理時(shí)延等。
例如隨著模型規(guī)模與部署成本持續(xù)攀升,綠色人工智能理念倡導(dǎo)將運(yùn)行效率與資源消耗納入模型評(píng)估體系。
除通用表現(xiàn)與資源消耗外,近期研究提出,還需評(píng)估對(duì)齊系統(tǒng)的適配能力,即系統(tǒng)在現(xiàn)實(shí)環(huán)境擾動(dòng)下的運(yùn)行穩(wěn)定性。
這一轉(zhuǎn)變也說明,評(píng)測工作需要擺脫靜態(tài)基準(zhǔn)測試的局限,采用能夠適配實(shí)際部署場景、具備可靠魯棒性的評(píng)估框架。
但現(xiàn)有評(píng)估方法通常將任務(wù)效果、計(jì)算成本、部署效率視作相互獨(dú)立的指標(biāo)。這種割裂的評(píng)估方式,無法體現(xiàn)實(shí)際部署中的真實(shí)取舍關(guān)系,工程人員也難以在缺乏統(tǒng)一標(biāo)準(zhǔn)的情況下平衡任務(wù)性能與計(jì)算開銷。
多數(shù)研究僅單獨(dú)報(bào)告F1值、壓縮率等性能指標(biāo),或是基礎(chǔ)成本指標(biāo),很少結(jié)合實(shí)際部署場景,端到端對(duì)比不同上下文管理策略下,單條請(qǐng)求的詞元開銷、資金成本與任務(wù)性能的對(duì)應(yīng)關(guān)系。
在長上下文應(yīng)用場景中,這一缺陷尤為突出:上下文長度增加會(huì)大幅抬升計(jì)算成本,卻未必能穩(wěn)定提升下游任務(wù)性能。現(xiàn)有長上下文相關(guān)評(píng)測也證實(shí),單純擴(kuò)充上下文或提升模型復(fù)雜度,無法帶來成比例的性能增益。
2.2 上下文長度擴(kuò)展與收益遞減效應(yīng)
隨著長上下文技術(shù)不斷發(fā)展,大語言模型的最大上下文長度被大幅提升,模型能夠處理更長文本序列,并將更多信息融入推理過程。雖然擴(kuò)大上下文窗口,能夠提升多跳推理、長依賴關(guān)聯(lián)類任務(wù)的表現(xiàn),但實(shí)驗(yàn)證明,這類性能增益普遍存在收益遞減現(xiàn)象。
研究發(fā)現(xiàn),大語言模型并不能始終高效利用超長輸入文本。“中間信息缺失”現(xiàn)象表明,模型往往無法充分利用長序列中段的內(nèi)容;另有研究指出,隨著上下文長度增加,注意力分散、干擾信息增多等問題會(huì)導(dǎo)致模型性能下降。大規(guī)模評(píng)測也進(jìn)一步證實(shí),模型常常無法充分發(fā)揮額外上下文信息的價(jià)值。
與此同時(shí),注意力機(jī)制具備二次復(fù)雜度,長上下文處理的計(jì)算開銷會(huì)隨文本長度呈非比例增長,但性能提升往往增速緩慢、表現(xiàn)不穩(wěn)定。
基于上述問題,業(yè)界開始重點(diǎn)研究上下文精簡與選擇性處理技術(shù),力求在保障任務(wù)性能的同時(shí)提升運(yùn)行效率。不過現(xiàn)有研究大多聚焦于優(yōu)化長上下文能力、開展性能基準(zhǔn)測試,并未系統(tǒng)性建模上下文長度、計(jì)算成本與下游任務(wù)性能三者間的制衡關(guān)系。
2.3 上下文精簡技術(shù)
為解決長上下文處理高成本的問題,大量研究開始探索在保留任務(wù)性能的前提下縮減上下文長度的技術(shù)。
目前已涌現(xiàn)出多種上下文壓縮方案,包括詞元級(jí)壓縮策略、基于指令的路由機(jī)制等,這類方法通過對(duì)輸入詞元進(jìn)行稀疏化處理,降低推理時(shí)延。
還有研究結(jié)合推理增強(qiáng)適配、指令微調(diào)、多模態(tài)融合等技術(shù),優(yōu)化復(fù)雜場景下的上下文理解與利用效率。這類技術(shù)現(xiàn)已廣泛應(yīng)用于時(shí)延敏感型實(shí)時(shí)業(yè)務(wù)。
此外,語義稀疏化、內(nèi)容過濾等上下文精簡方法,可在文本生成前剔除冗余內(nèi)容,提升系統(tǒng)運(yùn)行效率、魯棒性與風(fēng)險(xiǎn)抵御能力。結(jié)合上述思路,學(xué)界還提出了檢索與路由混合方案,進(jìn)一步優(yōu)化上下文篩選效果與系統(tǒng)穩(wěn)定性。
現(xiàn)有研究大多對(duì)檢索、壓縮、長上下文處理三類技術(shù)分別開展評(píng)測,實(shí)驗(yàn)所用數(shù)據(jù)集、提示詞設(shè)置、成本假設(shè)也各不相同。
因此,在同等條件下,很難判定哪一種策略效率更高、效果更好。評(píng)估標(biāo)準(zhǔn)的缺失,導(dǎo)致業(yè)內(nèi)無法系統(tǒng)性分析各類上下文管理策略的效率與性能取舍,這也推動(dòng)了本次統(tǒng)一評(píng)估框架的研究。
三、研究方法
本文設(shè)計(jì)了一套分三階段的結(jié)構(gòu)化框架,用于系統(tǒng)性評(píng)估各類上下文管理策略在性能與計(jì)算成本之間的權(quán)衡關(guān)系。以往方法僅單獨(dú)優(yōu)化準(zhǔn)確率或運(yùn)行效率,而本框架結(jié)合實(shí)際部署約束建立決策模型,可根據(jù)性能要求與系統(tǒng)使用特征選擇最優(yōu)策略。
本研究的核心創(chuàng)新在于,區(qū)分固有成本(單條請(qǐng)求推理成本)與平攤成本(包含可復(fù)用的預(yù)處理開銷),并通過復(fù)用參數(shù)N實(shí)現(xiàn)量化。該模型貼合真實(shí)部署場景,例如共享內(nèi)存系統(tǒng)、摘要緩存、多請(qǐng)求并發(fā)任務(wù)等場景中,一次性預(yù)處理計(jì)算結(jié)果可被多條請(qǐng)求重復(fù)使用。依托該模型,本框架能夠在統(tǒng)一目標(biāo)下,完成不同運(yùn)行模式的效果評(píng)估。(此部分其他細(xì)節(jié)略過)
四、實(shí)驗(yàn)結(jié)果與分析
本文運(yùn)用所提框架,分析不同性能要求、部署約束下各類上下文管理策略的表現(xiàn)。本研究不再孤立對(duì)比單一策略,而是分析最優(yōu)方案如何同時(shí)受目標(biāo)性能、計(jì)算預(yù)算、內(nèi)容復(fù)用特征三者影響。
實(shí)驗(yàn)從三個(gè)維度展開分析:一是效率前沿分析,解讀不同策略內(nèi)部、策略之間的性能-成本取舍關(guān)系;二是分場景決策規(guī)律,根據(jù)性能目標(biāo)匹配不同部署環(huán)境下的最優(yōu)策略;三是總結(jié)結(jié)論與工程落地啟示,提煉可指導(dǎo)大語言模型部署的系統(tǒng)性經(jīng)驗(yàn)。下文所有詞元開銷數(shù)據(jù),均按照公式(1)完成預(yù)處理成本平攤后,基于全部HotpotQA樣本計(jì)算得到的單條請(qǐng)求平均有效詞元用量。
4.1 效率前沿分析
![]()
圖1整體展示了各類策略對(duì)應(yīng)的效率前沿與決策路徑。每張子圖包含三層信息:全部待測參數(shù)配置、固有帕累托最優(yōu)前沿、由效率得分確定的最優(yōu)運(yùn)行路徑。
實(shí)驗(yàn)總結(jié)出核心規(guī)律:每一種策略都存在專屬的固有前沿,但運(yùn)行點(diǎn)位會(huì)隨部署環(huán)境變化。隨著偏好權(quán)重w調(diào)整,最優(yōu)參數(shù)配置會(huì)沿前沿曲線移動(dòng),而非固定不變。
1. 查詢感知型檢索可優(yōu)化固有前沿:相較于基礎(chǔ)版TF-IDF,查詢感知型檢索能在同等成本下實(shí)現(xiàn)更高性能,在不增加預(yù)處理開銷的前提下,抬升帕累托最優(yōu)曲線。
2. 平攤機(jī)制改變內(nèi)存壓縮的綜合表現(xiàn):檢索類方法幾乎無預(yù)處理成本,而內(nèi)存壓縮會(huì)產(chǎn)生高額前期開銷。但隨著內(nèi)容復(fù)用次數(shù)增加,平攤效應(yīng)會(huì)降低其綜合成本,讓內(nèi)存壓縮在全局前沿曲線中占據(jù)更大優(yōu)勢區(qū)間。
圖2整合所有策略,展示全局效率前沿。每條曲線代表權(quán)重w從“優(yōu)先控成本”向“優(yōu)先提性能”切換時(shí),最優(yōu)策略與參數(shù)配置的變化軌跡,曲線拐點(diǎn)即為策略優(yōu)劣切換的臨界點(diǎn)。
實(shí)驗(yàn)呈現(xiàn)統(tǒng)一規(guī)律:內(nèi)容復(fù)用次數(shù)N越高,高前期開銷的策略越占優(yōu)勢。N增大后,平攤效應(yīng)降低綜合成本,內(nèi)存壓縮可在更多均衡型場景中成為最優(yōu)選擇。
這也證明:最優(yōu)策略并非固定不變,而是高度依賴部署場景。單條獨(dú)立請(qǐng)求場景更適合輕量檢索方案;而長期智能助手、企業(yè)知識(shí)庫等高頻復(fù)用場景,采用內(nèi)存壓縮這類重預(yù)處理方案收益更高。
4.2 分場景決策規(guī)律
效率前沿曲線可連續(xù)展示不同偏好下的最優(yōu)選擇,而工程落地中往往需要明確的離散化指導(dǎo):給定目標(biāo)性能,應(yīng)當(dāng)選用哪種策略?為此,本文將前沿曲線轉(zhuǎn)化為面向決策的可視化結(jié)果,結(jié)合不同部署條件,根據(jù)性能目標(biāo)匹配最優(yōu)方案。
結(jié)合業(yè)務(wù)性能要求,本文將運(yùn)行場景劃分為三類:效率優(yōu)先型、均衡兼顧型、高性能型。表1匯總?cè)智把厍€上的典型運(yùn)行點(diǎn)位,將連續(xù)的曲線規(guī)律轉(zhuǎn)化為可直接落地的離散化決策指南。
1. 效率優(yōu)先場景(F1<0.78):輕量檢索方案憑借極低開銷成為主流。在低復(fù)用場景下,問答優(yōu)化版TF-IDF可在最少詞元用量下達(dá)到理想性能。
2. 均衡兼顧場景(0.78≤F1<0.82):該場景下不同部署環(huán)境的策略差異最大。復(fù)用次數(shù)提升后,內(nèi)存壓縮的優(yōu)勢逐步凸顯,在多數(shù)均衡場景中具備競爭力甚至成為最優(yōu)選擇。
3. 高性能場景(F1≥0.82):若要達(dá)到性能峰值,必須采用全上下文提示方案,但該方案成本大幅上漲,開銷通常達(dá)到均衡場景的2倍以上,收益遞減特征十分明顯。
![]()
基于框架可量化不同場景下的效率提升效果:
? 均衡場景中,復(fù)用次數(shù)從N=1提升至N=100,最優(yōu)方案從問答優(yōu)化版TF-IDF(有效詞元數(shù)566)切換為內(nèi)存壓縮(有效詞元數(shù)424),在F1值穩(wěn)定為0.78的前提下,綜合開銷降低約25%。
? 高性能場景(F1≥0.82)必須使用全上下文提示,但其開銷顯著偏高:達(dá)到實(shí)驗(yàn)最高性能時(shí),詞元用量是均衡場景最優(yōu)配置的2倍以上,充分體現(xiàn)高性能區(qū)間的收益遞減規(guī)律。
本次實(shí)驗(yàn)的具體閾值基于HotpotQA數(shù)據(jù)集得出,但不同效率區(qū)間、策略切換邊界是由成本-性能的固有制衡關(guān)系決定,對(duì)于具備相似上下文特征的任務(wù),該規(guī)律均具備通用性。
4.3 實(shí)驗(yàn)結(jié)論與工程啟示
1. 統(tǒng)一評(píng)估框架不可或缺
所有參數(shù)配置的測試結(jié)果表明,性能與token開銷呈強(qiáng)非線性關(guān)系。小幅提升性能,往往需要大幅增加計(jì)算量。
例如性能從中等水平(F1≈0.78)提升至高水平(F1≈0.84), token 用量翻倍。若單獨(dú)評(píng)估性能或成本,會(huì)忽略部署場景帶來的取舍關(guān)系,得出片面結(jié)論。
本文提出的效率指標(biāo)可實(shí)現(xiàn)一體化評(píng)估,支撐各類競爭策略的公平對(duì)比與科學(xué)決策。
2. 實(shí)現(xiàn)系統(tǒng)級(jí)效率躍升
結(jié)合部署場景選擇適配策略,可大幅提升系統(tǒng)整體效率。本實(shí)驗(yàn)中,均衡場景下復(fù)用次數(shù)從N=1提升至N=100,策略切換后詞元用量降低約25%;在均衡場景上限附近(F1≈0.80),策略從全上下文提示切換為內(nèi)存壓縮后,綜合開銷降幅超50%。這類效率提升并非來自單一策略的算法優(yōu)化,而是在對(duì)應(yīng)場景下選擇最優(yōu)方案帶來的成果。
3. 策略選擇必須貼合部署場景
不存在適用于所有場景的萬能策略。成本優(yōu)先場景優(yōu)選輕量檢索方案;內(nèi)容高頻復(fù)用時(shí),內(nèi)存壓縮等預(yù)處理類方案優(yōu)勢顯著;追求性能峰值時(shí),即便成本高昂,也必須使用全上下文提示。這說明評(píng)估與選型必須納入內(nèi)容復(fù)用、性能目標(biāo)等部署要素。
4. 落地使用指導(dǎo)
本框架支持兩種應(yīng)用模式:一是遍歷偏好權(quán)重w,連續(xù)分析性能與成本的制衡關(guān)系;二是依托決策對(duì)照表,根據(jù)目標(biāo)性能直接匹配最優(yōu)策略,可無縫融入系統(tǒng)設(shè)計(jì)與部署流程。
5. 助力人工智能可持續(xù)發(fā)展
該框架能夠系統(tǒng)性削減無效計(jì)算量,為大規(guī)模大語言模型實(shí)現(xiàn)高效、可持續(xù)部署提供可行路徑。摒棄盲目擴(kuò)充上下文的思路,針對(duì)性優(yōu)化上下文使用方式,可在保障任務(wù)性能的同時(shí)降低計(jì)算開銷。
五、結(jié)論
本文提出效率前沿統(tǒng)一框架,用于在明確性能-成本制衡關(guān)系的前提下,評(píng)估大語言模型的各類上下文管理策略。
該框架不再將準(zhǔn)確率與計(jì)算效率作為兩個(gè)獨(dú)立目標(biāo),而是將策略選擇定義為面向部署場景的決策問題,綜合考量任務(wù)性能、推理開銷與預(yù)處理復(fù)用帶來的平攤收益。
基于HotpotQA數(shù)據(jù)集的多組實(shí)驗(yàn),總結(jié)出三條通用規(guī)律:
第一,性能與計(jì)算成本呈強(qiáng)非線性關(guān)系,性能小幅提升往往需要詞元用量大幅增加;
第二,沒有通用最優(yōu)的上下文管理策略,效率優(yōu)先場景以輕量檢索為主,高復(fù)用場景下內(nèi)存壓縮等預(yù)處理方案更具優(yōu)勢;
第三,全上下文提示是達(dá)到性能峰值的必要選擇,但其計(jì)算成本過高,收益遞減現(xiàn)象突出。
本研究彌補(bǔ)了現(xiàn)有上下文精簡技術(shù)評(píng)估體系的多項(xiàng)缺陷:
一是構(gòu)建了同時(shí)兼顧性能與成本的統(tǒng)一優(yōu)化目標(biāo);
二是明確了不同策略之間的實(shí)際切換臨界點(diǎn);
三是結(jié)合內(nèi)容復(fù)用特征、性能目標(biāo),給出貼合部署場景的選型建議。
依托復(fù)用參數(shù)N實(shí)現(xiàn)預(yù)處理成本平攤建模,本框架還覆蓋了現(xiàn)有基準(zhǔn)測試常忽略的真實(shí)場景,例如持久化內(nèi)存系統(tǒng)、共享檢索鏈路、多請(qǐng)求并發(fā)推理等。
該框架兼具學(xué)術(shù)價(jià)值與工程落地價(jià)值。
在科研領(lǐng)域,效率前沿提供了標(biāo)準(zhǔn)化評(píng)測體系,可在統(tǒng)一決策邏輯下對(duì)比各類異構(gòu)上下文管理技術(shù),讓新型大語言模型優(yōu)化算法的評(píng)測結(jié)果更具備可復(fù)現(xiàn)性、更貼合實(shí)際部署需求。
在產(chǎn)業(yè)領(lǐng)域,該框架可結(jié)合時(shí)延預(yù)算、token成本上限、請(qǐng)求復(fù)用特征等運(yùn)行約束,完成系統(tǒng)級(jí)策略優(yōu)化。
實(shí)驗(yàn)證明,結(jié)合部署場景選型,中等性能區(qū)間可在性能持平的前提下將有效詞元用量降低約25%;高復(fù)用場景下,相較于全上下文基線方案,開銷降幅可超50%。上述優(yōu)化無需擴(kuò)容模型、額外訓(xùn)練,僅通過優(yōu)化上下文使用方式即可實(shí)現(xiàn)。
放眼長遠(yuǎn),該框架也為構(gòu)建可持續(xù)的大規(guī)模人工智能系統(tǒng)提供支撐。
隨著大語言模型在企業(yè)、科研、公共服務(wù)領(lǐng)域不斷普及,計(jì)算效率不僅關(guān)系使用成本,更影響基礎(chǔ)設(shè)施擴(kuò)容與生態(tài)環(huán)保。效率前沿框架引導(dǎo)行業(yè)從“一味拉長上下文”轉(zhuǎn)向“精細(xì)化利用上下文”,具備重要指導(dǎo)意義。
未來可從多個(gè)方向開展延伸研究:
第一,將框架從問答任務(wù)拓展至智能體內(nèi)存、代碼生成、文檔推理、對(duì)話助手等各類長上下文任務(wù);
第二,在優(yōu)化目標(biāo)中加入推理時(shí)延、能耗、硬件利用率、資金成本等更多系統(tǒng)指標(biāo);
第三,優(yōu)化現(xiàn)有效用函數(shù),采用自適應(yīng)、可學(xué)習(xí)的偏好模型,適配不同業(yè)務(wù)的個(gè)性化部署需求;
第四,結(jié)合領(lǐng)域知識(shí)、定制化優(yōu)化目標(biāo)改進(jìn)檢索與壓縮技術(shù),進(jìn)一步提升上下文管理效果。已有領(lǐng)域自適應(yīng)表征學(xué)習(xí)相關(guān)研究證實(shí),定制化隱空間建模與優(yōu)化目標(biāo),能夠提升表征保真度,挖掘高維系統(tǒng)中的復(fù)雜關(guān)聯(lián)特征。
綜上,本文提出的效率前沿框架,為大語言模型上下文利用率的部署導(dǎo)向型優(yōu)化,奠定了理論與實(shí)踐基礎(chǔ)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.