![]()
曹羽中
“【提示】2026第六屆數(shù)智化頒獎(jiǎng)典禮將于8月5日在北京舉行頒獎(jiǎng)點(diǎn)擊可報(bào)名參加頒獎(jiǎng)典禮丨此次人物榜單/獎(jiǎng)項(xiàng)的評(píng)選依然會(huì)進(jìn)行初審、公審、終審三輪嚴(yán)格評(píng)定,并會(huì)在國(guó)內(nèi)外渠道大規(guī)模發(fā)布傳播歡迎申報(bào)。
2026年上半年,AI行業(yè)有一個(gè)很少被公開(kāi)承認(rèn)、但從業(yè)者心里都清楚的事實(shí):模型之間的差距正在快速縮小。頭部廠商旗艦?zāi)P驮谥髁骰鶞?zhǔn)上的分差,從兩年前的“代際差”收窄到幾個(gè)百分點(diǎn);Token價(jià)格一年之內(nèi)跌去一個(gè)數(shù)量級(jí);國(guó)產(chǎn)大模型的周調(diào)用量已經(jīng)持續(xù)超過(guò)海外廠商。算力同樣在商品化——GPU可以租,推理按Token計(jì)價(jià),誰(shuí)都能以差不多的價(jià)格,用上差不多的算力。
這帶來(lái)一個(gè)尷尬的處境:對(duì)于絕大多數(shù)任務(wù)而言,今天你把產(chǎn)品底下的模型換掉,用戶幾乎感覺(jué)不出差別。那么,當(dāng)模型與算力都趨同,AI產(chǎn)品之間靠什么分出高下?
我的判斷是:上下文(Context)。下一場(chǎng)AI產(chǎn)品的戰(zhàn)爭(zhēng),是上下文之爭(zhēng)。
Agent的天花板不在模型,在Context
評(píng)價(jià)一個(gè)Agent產(chǎn)品,行業(yè)習(xí)慣先問(wèn)“底下接的是什么模型”。這個(gè)問(wèn)題在2024年有意義,到2026年意義已經(jīng)沒(méi)有那么大了。真正該問(wèn)的是另外的幾個(gè)問(wèn)題:它掌握多少背景?理解多深?它能否理解企業(yè)的業(yè)務(wù)知識(shí)和歷史數(shù)據(jù)?這種理解能延續(xù)多久?
一個(gè)接入頂級(jí)模型、卻沒(méi)有上下文體系的Agent,本質(zhì)上是一個(gè)不理解歷史背景,每天早晨都會(huì)失憶的天才——你昨天與它討論過(guò)的方案、糾正過(guò)的錯(cuò)誤、約定過(guò)的偏好,一覺(jué)醒來(lái)全部歸零。用戶在它身上付出的每一次溝通成本,都無(wú)法沉淀為它對(duì)你的理解。這樣的產(chǎn)品,模型再?gòu)?qiáng),能力上限也被死死鎖住。Agent的天花板不在模型,在Context。
但如果把上下文等同于“記憶”,就把這場(chǎng)戰(zhàn)爭(zhēng)看小了。這兩年AI圈涌現(xiàn)出大量記憶框架、記憶組件項(xiàng)目,它們盯住的都是交互過(guò)程中的記憶:用戶說(shuō)過(guò)什么、Agent做過(guò)什么、上次任務(wù)停在哪一步。這些當(dāng)然有價(jià)值,但只是上下文中最薄的一層。上下文的完整含義,是與當(dāng)前任務(wù)相關(guān)的全部知識(shí)背景。對(duì)企業(yè)而言,上下文就等于企業(yè)現(xiàn)有的業(yè)務(wù)知識(shí)和業(yè)務(wù)數(shù)據(jù)——幾十年沉淀的工藝參數(shù)、風(fēng)控規(guī)則、客戶檔案、合同文書(shū)、故障工單、代碼資產(chǎn)。一個(gè)金融風(fēng)控Agent的能力上限,不取決于它記住了多少輪對(duì)話,而取決于它能否在需要的那一刻,調(diào)取這家機(jī)構(gòu)二十年積累的風(fēng)控案例與規(guī)則庫(kù)。只做交互記憶而不打通業(yè)務(wù)知識(shí),等于守著金礦淘沙。
而一個(gè)能把完整上下文——既包括交互記憶,更包括業(yè)務(wù)知識(shí)與業(yè)務(wù)數(shù)據(jù)——持續(xù)組織起來(lái)的AI系統(tǒng),會(huì)隨著使用時(shí)間越來(lái)越“懂”這家企業(yè)。這種理解不可遷移、不可復(fù)制:算力可以換云廠商或者自建,模型也可以換供應(yīng)商或者自行部署開(kāi)源模型,唯獨(dú)一家企業(yè)與系統(tǒng)之間積累起來(lái)的上下文,搬不走。這才是AI產(chǎn)品真正的護(hù)城河。所以我常說(shuō)一句聽(tīng)起來(lái)有點(diǎn)激進(jìn)的話:誰(shuí)擁有用戶的上下文,誰(shuí)就擁有一切。
算力之外是“知力”:存的不是字節(jié),是可被智能隨時(shí)調(diào)用的知識(shí)
“擁有上下文”說(shuō)起來(lái)輕巧,工程上極其昂貴,而且兩頭都難。動(dòng)態(tài)的一頭:Agent每一次交互產(chǎn)生的KV Cache動(dòng)輒百萬(wàn)Token量級(jí),計(jì)算成K,V張量之后,需要消耗上百GB存儲(chǔ)容量,放進(jìn)GPU顯存放不下——HBM容量有限且昂貴;放在單機(jī)內(nèi)存和本地盤(pán)里共享不了——天然的數(shù)據(jù)孤島;丟掉重算又付不起——Prefill占掉推理算力消耗的75%。靜態(tài)的一頭:企業(yè)幾十年的業(yè)務(wù)知識(shí)和數(shù)據(jù),散落在數(shù)據(jù)庫(kù)、文檔、日志和一代代老系統(tǒng)里,要能被精確檢索,也要能被語(yǔ)義檢索,還要在恰當(dāng)?shù)臅r(shí)機(jī)、以恰當(dāng)?shù)牧6葏R聚成某一次交互的上下文——多一分是噪聲,少一分是盲區(qū)。
把這條鏈路的全過(guò)程能力——全部上下文(業(yè)務(wù)知識(shí)、業(yè)務(wù)數(shù)據(jù)、交互記憶)的存儲(chǔ)、管理、全局共享、精確檢索、語(yǔ)義檢索,直至高效匯聚為某一次模型交互的上下文——行業(yè)習(xí)慣沿著“算力”的對(duì)仗,把它籠統(tǒng)地歸入“存力”。但“存”這個(gè)字,總把人帶向容量、硬盤(pán)、存儲(chǔ)系統(tǒng)等,把這件事看小了。我更愿意給它一個(gè)新名字:知力。知力的“知”,是知識(shí)的知——存得下的只是字節(jié),調(diào)得動(dòng)的才是知識(shí)。1PB無(wú)法被檢索、進(jìn)不了上下文的數(shù)據(jù),談不上知力;一份能在毫秒之間送到模型面前的知識(shí),才是。一句話:知力,決定智力。
知力還有一個(gè)常被忽略的硬指標(biāo):供給效率。上下文不僅要找得到,還要到得快——模型開(kāi)始思考的那一刻,它需要的知識(shí)必須已經(jīng)在場(chǎng)。上下文到得慢,算力就在空轉(zhuǎn);在推理集群里,GPU等待數(shù)據(jù)的每一微秒都是純粹的成本。所以知力天然是一個(gè)性能詞:算力決定AI想得多快,知力決定AI知道多少、想得多對(duì),以及——能不能持續(xù)的深度思考,形成高效的思維鏈。
這也是我們與“記憶組件”路線的根本分野:記憶框架解決的是對(duì)話歷史的取舍,是應(yīng)用層的技巧;知力要修的是從企業(yè)全部知識(shí)資產(chǎn),交互上下文信息到模型和GPU之間的高速公路,是基礎(chǔ)設(shè)施。技巧可以被復(fù)制,基礎(chǔ)設(shè)施才構(gòu)成壁壘。
文明的力量不在節(jié)點(diǎn)
在把節(jié)點(diǎn)連起來(lái)的架構(gòu)
把視野拉遠(yuǎn)一點(diǎn)。人類單個(gè)個(gè)體的腦力,幾千年來(lái)幾乎沒(méi)有變化——今天最聰明的人,未必比亞里士多德更聰明。但文明的能力呈指數(shù)增長(zhǎng)。差別不在節(jié)點(diǎn),而在系統(tǒng)架構(gòu):文字讓經(jīng)驗(yàn)跨越個(gè)體的死亡,印刷讓知識(shí)跨越階層,圖書(shū)館讓記憶跨越世代,互聯(lián)網(wǎng)讓信息跨越地理。文明的力量,從來(lái)不在某個(gè)節(jié)點(diǎn)有多強(qiáng),而在于把無(wú)數(shù)個(gè)“弱節(jié)點(diǎn)”連接起來(lái)的那套系統(tǒng)架構(gòu)。
我認(rèn)為這條規(guī)律同樣適用于機(jī)器智能:依靠單個(gè)節(jié)點(diǎn)的算力,堆不出真正的超級(jí)智能。超級(jí)智能需要的是海量連接、信息共享與交換——成千上萬(wàn)個(gè)Agent各自執(zhí)行任務(wù)、各自積累經(jīng)驗(yàn),而這些經(jīng)驗(yàn)?zāi)軌蛉至魍ā⒈舜藦?fù)用。
面向超級(jí)智能的AI Infra,要架構(gòu)的正是這套底層邏輯。它不會(huì)只有算力。算力之外,必須有知力——上下文知識(shí)、外掛的超級(jí)記憶;還必須有讓這些知識(shí)實(shí)現(xiàn)全局共享的能力。三者缺一,這套架構(gòu)就不成立。
而今天絕大多數(shù)推理集群的現(xiàn)狀,恰恰是反著來(lái)的:每個(gè)節(jié)點(diǎn)各算各的KV Cache,保存在單卡的HBM中,最多是卸載保存在單推理節(jié)點(diǎn)的DRAM中,無(wú)法做到上下文知識(shí)的共享和流動(dòng),多個(gè)Agent面對(duì)同一份知識(shí)各自重算一遍。這相當(dāng)于人類還沒(méi)有文字,沒(méi)有書(shū)籍的遠(yuǎn)古時(shí)代。英偉達(dá)2026年初發(fā)布的CMX上下文存儲(chǔ)分層架構(gòu),把解法寫(xiě)進(jìn)了標(biāo)準(zhǔn):五層存儲(chǔ)體系中,G1到G3(HBM、內(nèi)存、本地NVMe)都只服務(wù)單節(jié)點(diǎn),G4為全局共享的傳統(tǒng)存儲(chǔ)(分布式文件系統(tǒng),對(duì)象存儲(chǔ)等),但是不是為了上下文數(shù)據(jù)而設(shè)計(jì)的,在上下文數(shù)據(jù)的存儲(chǔ),檢索和取回方面無(wú)法匹配推理集群的IO特征和極致性能要求,唯有G3.5全局共享KV池,能讓“上下文”成為整個(gè)集群的公共知識(shí)資產(chǎn)。而我們認(rèn)定這是整套架構(gòu)里最關(guān)鍵的一層,比英偉達(dá)的CMX架構(gòu)發(fā)布還要早——這一點(diǎn),后文再展開(kāi)。
算力是一次性的
知力才有時(shí)間復(fù)利
再往深一層看,算力和知力之間有一個(gè)根本性區(qū)別,行業(yè)討論得太少:算力是一次性的,算過(guò)即忘;知力是可積累的,能產(chǎn)生時(shí)間復(fù)利。
一塊GPU滿負(fù)荷跑一天,電費(fèi)花掉了,如果算的是重復(fù)的上下文,第二天什么都沒(méi)留下——同一份系統(tǒng)提示詞、同一段行業(yè)知識(shí)庫(kù),明天還要原樣重算一遍。當(dāng)下推理集群里高達(dá)75%以上的算力消耗在Prefill上,其中大量是對(duì)已經(jīng)算過(guò)的內(nèi)容的重復(fù)計(jì)算。這是純粹的耗散,不產(chǎn)生任何沉淀。
知力的邏輯完全不同:一份上下文計(jì)算一次,全局留存,千路并發(fā)共享同一份緩存;緩存積累得越多,命中率越高,系統(tǒng)就越快、越便宜——DeepSeek公開(kāi)的實(shí)測(cè)已經(jīng)證明,依托全局KV緩存,同等Token工作量的運(yùn)營(yíng)成本可以比零緩存場(chǎng)景低數(shù)十倍。這就是復(fù)利:投入不再是消耗,而是資產(chǎn),隨時(shí)間滾動(dòng)增值。對(duì)企業(yè)更是如此:業(yè)務(wù)知識(shí)和業(yè)務(wù)數(shù)據(jù)本就是幾十年復(fù)利滾存下來(lái)的資產(chǎn),知力讓這筆沉睡的資產(chǎn)第一次可以被智能按次調(diào)用、按次產(chǎn)生回報(bào)。
人類文明本身就是靠這種復(fù)利建立起來(lái)的。我們不需要每一代人重新證明勾股定理,重新發(fā)明微積分——前人算過(guò)的,記下來(lái),后人直接用。一個(gè)算過(guò)即忘的系統(tǒng),永遠(yuǎn)建立不起文明;同樣,一個(gè)算過(guò)即忘的AI系統(tǒng),也永遠(yuǎn)長(zhǎng)不成超級(jí)智能。文明和超級(jí)智能,只能靠時(shí)間復(fù)利一層層構(gòu)建。有意思的是,漢字里早就寫(xiě)好了這個(gè)答案:“智”這個(gè)字,就是“知”加“日”——知識(shí),乘以時(shí)間,才成為智慧。“日”字代表日積月累的時(shí)間復(fù)利,算力給不了那個(gè)“日”字,知力才能。
所以我堅(jiān)持一個(gè)可能讓一些同行不太舒服的結(jié)論:在推理時(shí)代,繼續(xù)單純堆卡,是在為“遺忘”付費(fèi)。企業(yè)走向智能化時(shí)代的第一優(yōu)先級(jí),不是采購(gòu)更多GPU,而是先讓已經(jīng)算過(guò)的東西,不再被重算。
把判斷變成產(chǎn)品:
我們提前下注的那條路線
判斷誰(shuí)都可以下,先鋒與跟隨者的區(qū)別在于:是否敢在共識(shí)形成之前,把判斷變成產(chǎn)品。
2020年我牽頭創(chuàng)立華瑞指數(shù)云(ExponTech)時(shí),行業(yè)的主流敘事還是“算力為王”。我們選了另一條路:賭基礎(chǔ)設(shè)施的下一個(gè)瓶頸在數(shù)據(jù)、在上下文。而這條路的第一步,是一個(gè)當(dāng)時(shí)看來(lái)最笨、最慢的決定——不做開(kāi)源改造,不借別人的地基,從零自研新一代分布式引擎。
這個(gè)引擎就是WiDE,全自研的下一代分布式引擎,也是整條技術(shù)路線真正的根基。后來(lái)的所有產(chǎn)品——WDS、WFS、WQS、WADP——全部構(gòu)建在WiDE之上。根技術(shù)握在自己手里的價(jià)值,在AI時(shí)代兌現(xiàn)得最徹底:當(dāng)KV Cache這種要求極高并發(fā),極低時(shí)延,小塊隨機(jī)IO,并行KV讀寫(xiě)的全新負(fù)載出現(xiàn)時(shí),我們可以直接在引擎層為它設(shè)計(jì)最為精簡(jiǎn)的數(shù)據(jù)路徑,而不是在現(xiàn)在的存儲(chǔ)架構(gòu)上打補(bǔ)丁,增加更多的冗余層級(jí)。
WDS,基于WiDE的極速分布式塊存儲(chǔ),面向數(shù)據(jù)庫(kù)等企業(yè)關(guān)鍵業(yè)務(wù)系統(tǒng)。2023年,團(tuán)隊(duì)?wèi){借WDS分布式軟件+普通服務(wù)器的組合打破SPC-1全球存儲(chǔ)性能榜的世界紀(jì)錄,終結(jié)了傳統(tǒng)的高端全閃存儲(chǔ)陣列在存儲(chǔ)性能上的長(zhǎng)期壟斷——這是WiDE引擎的超級(jí)性能和并行擴(kuò)展性第一次在世界舞臺(tái)上得到公開(kāi)證明。
WFS,基于WiDE的分布式并行文件存儲(chǔ),承接AI訓(xùn)練與數(shù)據(jù)處理管線,解決海量非結(jié)構(gòu)化數(shù)據(jù)的高吞吐供給問(wèn)題。
WADP,面向AI負(fù)載的數(shù)據(jù)平臺(tái),2025年在MLPerf Storage v2.0中拿下多項(xiàng)全球第一。MLPerf Storage的優(yōu)異測(cè)試結(jié)果意味著,我們對(duì)“AI負(fù)載究竟需要什么樣的存儲(chǔ)和IO處理能力”的理解,經(jīng)受住了最苛刻標(biāo)準(zhǔn)的檢驗(yàn)。
WQS,則是整條路線上最關(guān)鍵的落子:全球最早的AI原生KV Cache存儲(chǔ)產(chǎn)品,直接為“上下文”這種全新的數(shù)據(jù)形態(tài)而生。我們沒(méi)有走行業(yè)普遍的捷徑——拿分布式文件系統(tǒng)封裝改造。分布式文件系統(tǒng)為大塊順序IO優(yōu)化設(shè)計(jì),處理KV Cache所需的小塊隨機(jī)IO時(shí)帶寬斷崖式下跌,八跳IO鏈路、兩次內(nèi)核切換,注定撐不起實(shí)時(shí)推理的熱路徑。WQS依托WiDE構(gòu)建原生KV引擎,用戶態(tài)RDMA直連,兩跳IO路徑、零內(nèi)核切換:16KB到10MB各種尺寸IO均可以穩(wěn)定跑滿物理網(wǎng)絡(luò)帶寬,端到端高并發(fā)讀取時(shí)延控制在200μs以內(nèi);超強(qiáng)的并行隨機(jī)小IO能力,使得我們可以使用更小的緩存block粒度達(dá)到更高的緩存命中率,使用分層流水線加載實(shí)現(xiàn)極低的KV緩存加載時(shí)延,配合CacheBlend等非前綴復(fù)用技術(shù),讓文檔片段、中間知識(shí)段落都能單獨(dú)命中,生產(chǎn)環(huán)境緩存命中率最高達(dá)到98%以上。
這條路線的前瞻性,有一個(gè)最有分量的注腳:早在2025年11月,AI原生KV Cache存儲(chǔ)WQS與英偉達(dá)完成聯(lián)合測(cè)試,驗(yàn)證了與英偉達(dá)Bluefield-3 DPU和Spectrum-x網(wǎng)絡(luò)的軟硬融合方案,與CMX分層緩存架構(gòu)完美契合——而英偉達(dá)正式對(duì)外發(fā)布CMX架構(gòu),是在2026年1月。也就是說(shuō),當(dāng)這個(gè)行業(yè)最重要的架構(gòu)標(biāo)準(zhǔn)公開(kāi)亮相時(shí),我們的產(chǎn)品已經(jīng)在標(biāo)準(zhǔn)發(fā)布之前完成了原生開(kāi)發(fā)和適配驗(yàn)證。不是我們?cè)谧汾s標(biāo)準(zhǔn),是標(biāo)準(zhǔn)印證了我們幾年前的判斷。
落到企業(yè)的賬本上,在推理集群中部署WQS意味著:PD分離集群的Prefill與Decode配比從3:1翻轉(zhuǎn)為1:3,同等規(guī)模集群有效生成Token的算力提升3倍,整體Token吞吐率提升近4~5倍;不新增一張卡,Token產(chǎn)能翻數(shù)倍——這是通過(guò)“上下文存儲(chǔ)節(jié)省算力”路線最直接的商業(yè)證明。
四個(gè)產(chǎn)品合起來(lái),恰好是“知力”的完整拼圖:WDS、WFS守住企業(yè)的數(shù)據(jù)底座,WADP讓業(yè)務(wù)知識(shí)與業(yè)務(wù)數(shù)據(jù)高效供給AI管線,WQS讓動(dòng)態(tài)上下文全局留存、共享與復(fù)用。企業(yè)的歷史知識(shí)進(jìn)得來(lái),交互記憶存得住,每一次模型調(diào)用都能以最低的時(shí)延拿到它需要的全部背景——這才是我們理解的、完整意義上的知力。
同時(shí),這套架構(gòu)從第一天起就按“統(tǒng)一架構(gòu)、按需部署、全域治理”設(shè)計(jì):數(shù)據(jù)分級(jí)、權(quán)限隔離、全鏈路審計(jì)內(nèi)置于底座,支持完全本地化部署,安全管控到位,讓中國(guó)企業(yè)在推進(jìn)本土的智能化的同時(shí),能以同一套基礎(chǔ)設(shè)施合規(guī)出海。
結(jié)語(yǔ):為上下文修建新型知力基礎(chǔ)設(shè)施
回頭看,2020年選擇這條路時(shí),AI 還在神經(jīng)網(wǎng)絡(luò),深度學(xué)習(xí)階段,基于transformer架構(gòu)的模型剛剛嶄露頭角,“KV Cache”,“上下文”,“Agent”等今天的熱詞還沒(méi)有出現(xiàn)。今天,上下文已經(jīng)是承載智能體能力的核心資產(chǎn)形態(tài)。我們比行業(yè)早走了幾年構(gòu)建新一代分布式存儲(chǔ)引擎,構(gòu)建AI原生的并行IO處理能力,不是因?yàn)檫\(yùn)氣,而是因?yàn)槭冀K從第一性原理出發(fā)去推演:智能的本質(zhì)是連接與積累,而不是孤立的計(jì)算。
未來(lái)三到五年,AI產(chǎn)業(yè)的競(jìng)爭(zhēng)會(huì)從“誰(shuí)的模型強(qiáng)、誰(shuí)的卡多”,轉(zhuǎn)向“誰(shuí)能以更低的成本,留存、共享、復(fù)用更大規(guī)模的上下文”。這場(chǎng)上下文之戰(zhàn),比拼的是底層知力基礎(chǔ)設(shè)施的效率、成本與治理能力。中國(guó)企業(yè)依托全球最大規(guī)模的真實(shí)推理場(chǎng)景,完全有機(jī)會(huì)在這一層定義標(biāo)準(zhǔn),而不是追隨標(biāo)準(zhǔn)。
算力讓AI會(huì)思考會(huì)計(jì)算,知力讓AI知道上下文,知道業(yè)務(wù)背景信息——知道得越多、越準(zhǔn)、越快,智力的上限就越高。而無(wú)論文明還是智能,最終都是由知識(shí)與記憶——而非一次次算過(guò)即忘的計(jì)算——一層層壘起來(lái)的。我和團(tuán)隊(duì)會(huì)繼續(xù)做那個(gè)為上下文修建知力基礎(chǔ)設(shè)施的人。
·申報(bào)人“曹羽中”簡(jiǎn)介:
曹羽中,ExponTech 華瑞指數(shù)云聯(lián)合創(chuàng)始人兼CTO。2020年?duì)款^創(chuàng)立公司,帶領(lǐng)團(tuán)隊(duì)從零自研下一代分布式引擎WiDE,并基于WiDE引擎先后推出極速分布式塊存儲(chǔ)WDS、分布式并行文件存儲(chǔ)WFS、AI數(shù)據(jù)平臺(tái)WADP,以及AI原生的KV Cache存儲(chǔ)產(chǎn)品WQS。2023年,其帶領(lǐng)的技術(shù)團(tuán)隊(duì)?wèi){借WDS打破SPC-1全球存儲(chǔ)性能榜的世界紀(jì)錄;2025年,WADP在MLPerf Storage v2.0基準(zhǔn)測(cè)試中獲得多項(xiàng)全球第一;2025年11月,全球最早的AI原生KV Cache存儲(chǔ)產(chǎn)品WQS與英偉達(dá)完成聯(lián)合測(cè)試,完美契合并早于英偉達(dá)CMX架構(gòu)的正式發(fā)布(2026年1月)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.