![]()
押注 AI 的 Memory Layer。
作者|連冉
編輯|鄭玄
5 月底,一家叫 Clipto.AI 的公司,推出一款端側(cè)產(chǎn)品登上了 Product Hunt 全球榜首。
它是一個多模態(tài)搜索工具,用戶可以直接輸入一句自然語言,在數(shù) TB 的視頻、音頻、圖片和文檔中快速找到需要的內(nèi)容。
不過,Clipto 想解決的問題不止搜索。
過去幾年,大模型不斷提升生成能力。AI 會寫代碼、會畫圖、會制作視頻,內(nèi)容生產(chǎn)效率被推到前所未有的高度。但與此同時,另一個問題正在變得越來越突出:人們創(chuàng)造和保存的數(shù)據(jù)越來越多,卻越來越難被重新利用。
電腦里堆積著會議錄音、直播錄像、播客訪談、采訪素材、項目文檔和截圖。對于記者、創(chuàng)作者、律師、研究員等知識工作者而言,真正消耗時間的往往不是生產(chǎn)內(nèi)容,而是在海量素材中尋找內(nèi)容。
在 Clipto 創(chuàng)始人康洪文看來,這暴露出的并不是搜索問題,而是 AI 缺失了一層關(guān)鍵基礎(chǔ)設(shè)施。他把這層基礎(chǔ)設(shè)施稱為 Memory Layer(記憶層)。
AI 一直在構(gòu)建世界模型,卻缺少用戶模型;Agent 越來越聰明,卻因為缺失記憶,始終無法真正理解用戶。
而從視頻理解研究,到 AIGC 創(chuàng)業(yè),再到今天押注 AI 記憶層,康洪文過去二十年的經(jīng)歷,某種程度上也對應(yīng)著 AI 技術(shù)演進的一條隱藏主線:從理解內(nèi)容,到生成內(nèi)容,再到組織內(nèi)容。
01
從搜索工具到記憶層:
Clipto 想解決什么問題?
在康洪文的定義里,Clipto 并不是一款單純的多模態(tài)搜索工具,而是連接個人數(shù)據(jù)與智能體生態(tài)的「記憶層」。
「過去十年,AI 一直在構(gòu)建世界模型,但缺少用戶模型。每個人的數(shù)據(jù)都散落在自己設(shè)備里,尚未轉(zhuǎn)化為 AI 可以持續(xù)理解和調(diào)用的個人上下文。」他這樣總結(jié)行業(yè)的空白,「如果沒有長期記憶,再聰明的 Agent 也無法真正理解用戶。搜索只是開始,Clipto 的最終目標(biāo)是打造 AI 時代缺失的記憶層。」
Clipto 給出的解法,是一套完全跑在本地的多模態(tài)記憶構(gòu)建邏輯:用戶將本地的視頻、音頻、圖片和文檔等多模態(tài)數(shù)據(jù)導(dǎo)入后,系統(tǒng)會依靠設(shè)備自身的 AI 算力與自研端側(cè)多模態(tài)大模型,對所有文件完成感知理解、結(jié)構(gòu)化解析與向量化處理,最終搭建起帶有認(rèn)知圖譜、實現(xiàn)時空對齊的個人記憶系統(tǒng)。
實際使用中,用戶只需用自然語言描述需求,端側(cè)大模型會先完整解析查詢的意圖與上下文,再通過本地搜索 Agent 在數(shù)秒內(nèi)完成精準(zhǔn)定位——無論是特定人物、場景、對白,還是完整的事件段落,都能直接命中對應(yīng)的文件與時間點。
不止于檢索召回,Clipto 真正打通了底層大模型與上層 Agent 之間缺失的記憶通路。在 TB 級的私有數(shù)據(jù)之上,用戶可以以對話形式提問,讓 AI 回答任何與本地記憶相關(guān)的問題,或是基于已有內(nèi)容自動生成摘要、總結(jié)與內(nèi)容梳理。
而所有這些運算與處理,全程都不會離開用戶的本地設(shè)備。這一方面省去了海量數(shù)據(jù)上傳、調(diào)用云端模型產(chǎn)生的高額 Token 成本;另一方面,對于包含商業(yè)機密、敏感信息的工作素材,以及移動辦公、斷網(wǎng)等特殊場景,數(shù)據(jù)不出設(shè)備本身就是一道剛性的安全與可用性門檻。
康洪文認(rèn)為,過去的軟件更多解決的是「存儲」問題,卻沒有真正理解內(nèi)容。Clipto 的核心,就是利用本地多模態(tài)模型把視頻、音頻、圖片和文檔轉(zhuǎn)化為 AI 能理解的數(shù)據(jù)結(jié)構(gòu),讓用戶從「搜索文件」變成「搜索記憶」。
在他看來,搜索只是第一步,更重要的是建立一套能夠持續(xù)積累個人上下文的 Memory Layer。過去十年,AI 構(gòu)建的是關(guān)于世界的知識庫;未來,AI 需要進一步理解每個用戶的個人知識和經(jīng)歷。
02
二十年:從視頻理解到視頻生成
從履歷來看,康洪文幾乎參與并見證了過去二十年 AI 從研究走向產(chǎn)業(yè)化的幾個重要階段。
2004 年,他進入微軟亞洲研究院實習(xí)。那時距離深度學(xué)習(xí)浪潮還有很多年,AI 更多時候還屬于實驗室里的研究課題。
他參與的項目之一,是幫助 Xbox 自動分析用戶拍攝的大量家庭照片和視頻,再從幾個小時素材中自動提取關(guān)鍵片段,最終生成一段家庭短片。
今天聽起來似乎稀松平常。但在當(dāng)時,這幾乎已經(jīng)觸碰到了計算機視覺最核心的問題。
因為機器必須先理解內(nèi)容,才能生成內(nèi)容。它需要知道誰出現(xiàn)了、發(fā)生了什么、哪些畫面重要、哪些畫面可以被忽略。
后來康洪文前往卡內(nèi)基梅隆大學(xué)攻讀博士,師從計算機視覺領(lǐng)域傳奇學(xué)者 Takeo Kanade。
在那里,他繼續(xù)研究圖像與視頻理解,希望讓機器人能夠通過持續(xù)積累視覺經(jīng)驗來理解現(xiàn)實世界。
在很多人眼里,視頻是一段畫面。但視頻本質(zhì)上是一種關(guān)于時間、人物、事件和關(guān)系的復(fù)雜信息結(jié)構(gòu)。理解視頻,本質(zhì)上是在理解現(xiàn)實世界。
2017 年,康洪文創(chuàng)辦慧川智能,隨后推出文字生成視頻平臺智影。此時移動互聯(lián)網(wǎng)和短視頻行業(yè)開始高速增長,大量內(nèi)容創(chuàng)作者進入市場。
新的問題出現(xiàn)了。過去的問題是機器看不懂內(nèi)容。現(xiàn)在的問題是內(nèi)容生產(chǎn)效率太低。
于是康洪文開始把技術(shù)重心從理解延伸到生成。文字生成視頻、智能剪輯、數(shù)字人……這些后來成為 AIGC 熱門賽道的方向,當(dāng)時都已經(jīng)出現(xiàn)在智影的產(chǎn)品探索中。
2020 年底,智影被騰訊收購。康洪文加入騰訊,負(fù)責(zé)騰訊智影團隊,繼續(xù)推動文生圖、文生視頻和數(shù)字人等全棧 AIGC 產(chǎn)品研發(fā)。
如果按照行業(yè)邏輯繼續(xù)發(fā)展下去,他完全可以繼續(xù)押注生成式 AI。但真正讓他產(chǎn)生新思考的,恰恰是生成能力的爆發(fā)。
當(dāng)生成越來越容易的時候,一個新的問題開始浮現(xiàn)。內(nèi)容越來越多了,人們開始擁有海量視頻、海量錄音、海量文檔。新的瓶頸變成了管理。AI 解決了創(chuàng)造內(nèi)容的問題,卻沒有解決理解個人內(nèi)容的問題。當(dāng)越來越多的信息被記錄下來,人們反而越來越難找回自己需要的信息。
這讓他意識到,也許行業(yè)忽略了一個更底層的問題。
在生成之前,需要理解。在理解之后,還需要記憶。而 AI 的下一步,可能正是記憶。
03
AI 的下一層競爭,
為什么會是 Memory
在康洪文看來,Agent 真正走向成熟之前,還有一個問題必須先解決——記憶。
今天的大模型已經(jīng)足夠聰明。它們能夠?qū)懘a、做分析、生成報告,甚至替用戶完成部分工作流程。但無論模型能力多強,它始終存在一個天然缺陷——它不了解用戶。
每次打開一個新的 AI 產(chǎn)品,都像是在和一個失憶的人重新認(rèn)識。你需要重新介紹自己是誰、正在做什么、過去做過什么。而一旦對話結(jié)束,這些上下文又會消失。
在康洪文看來,整個 AI 基礎(chǔ)設(shè)施缺失了一層關(guān)鍵能力——缺少用戶模型。
今天的大模型擁有互聯(lián)網(wǎng)上幾乎所有公開知識,卻無法真正理解一個具體的人。因為關(guān)于這個人的數(shù)據(jù),并不在互聯(lián)網(wǎng)。它們散落在電腦、手機、NAS、網(wǎng)盤、相機、會議記錄和各種本地設(shè)備之中。
對于 AI 來說,這些信息幾乎處于不可見狀態(tài)。而當(dāng) Agent 開始大規(guī)模普及后,這個問題會變得更加明顯。
今天大家討論 Agent,更多是在討論它能夠幫助用戶完成什么任務(wù)。但如果未來真的出現(xiàn)數(shù)百萬甚至數(shù)億個 Agent,那么新的問題也會隨之出現(xiàn):這些 Agent 如何理解用戶?它們?nèi)绾沃烙脩暨^去做過什么?又如何共享同一套個人上下文?
康洪文認(rèn)為,不可能每一個 Agent 都重新構(gòu)建一套用戶記憶。這既不現(xiàn)實,也沒有必要。更合理的方式,是存在一個獨立的 Memory Layer。
![]()
Living Memory Graph
Agent 負(fù)責(zé)執(zhí)行任務(wù),Memory Layer 負(fù)責(zé)管理用戶記憶,所有 Agent 都能夠基于這套統(tǒng)一記憶系統(tǒng)理解用戶。
這有點類似互聯(lián)網(wǎng)時代的操作系統(tǒng),應(yīng)用程序越來越多,但底層文件系統(tǒng)只有一個。
今天的 Agent 生態(tài),或許也需要一個類似的記憶系統(tǒng)作為公共基礎(chǔ)設(shè)施。這也是 Clipto 希望扮演的角色。
在康洪文的判斷里,未來的 AI 架構(gòu)很可能會形成兩層基礎(chǔ)設(shè)施:一層是 Intelligence Layer,負(fù)責(zé)理解世界,一層是 Memory Layer,負(fù)責(zé)沉淀用戶的個人知識、上下文和長期記憶。前者主要由云端大模型提供世界知識,后者則建立在用戶持續(xù)產(chǎn)生的個人數(shù)據(jù)之上。
兩者共同構(gòu)成真正意義上的 Personal AI。這也是為什么他并不認(rèn)為所有 AI 能力最終都會遷移到云端。
過去幾年,整個行業(yè)幾乎都在爭奪云端大模型市場。OpenAI、Google、Anthropic,以及國內(nèi)的大模型公司,競爭焦點始終圍繞著模型能力展開。
但與此同時,另一種趨勢也在出現(xiàn)。Apple M 系列芯片不斷提升神經(jīng)網(wǎng)絡(luò)算力,NVIDIA 開始推動 AI PC,微軟推出 Copilot+ PC。越來越多計算能力正在回到用戶設(shè)備本身。
AI 的計算結(jié)構(gòu)正在發(fā)生變化。過去,大部分 AI 能力運行在云端;未來,隨著個人數(shù)據(jù)越來越重要,越來越多與記憶相關(guān)的能力將運行在用戶設(shè)備上,而推理和世界知識仍將持續(xù)受益于云端大模型。。
因為用戶最重要的數(shù)據(jù),本來就存在本地。采訪記錄、合同文件、財務(wù)資料、創(chuàng)作素材、家庭照片,這些內(nèi)容既不適合頻繁上傳云端,也很難完全依賴云端處理。
更重要的是,數(shù)據(jù)規(guī)模本身正在迅速膨脹。對于影視制作團隊來說,一個項目可能產(chǎn)生數(shù)十 TB 甚至上百 TB 視頻素材。對于媒體機構(gòu)而言,幾年時間積累下來,同樣會形成龐大的內(nèi)容資產(chǎn)。
在這種情況下,云端不一定是最優(yōu)解。本地理解、本地索引、本地推理,反而開始具備新的價值。
不過,康洪文并不認(rèn)為未來屬于「純本地 AI」。他強調(diào),Memory Layer 最終依然會是一個云端與本地協(xié)同的體系。
因為記憶本身并不等于存儲。真正重要的是組織、關(guān)聯(lián)和調(diào)用。用戶的數(shù)據(jù)可能分散在不同設(shè)備和平臺上。
電腦里有文件,手機里有照片、視頻,云盤里還有另一部分資料。未來的記憶系統(tǒng),需要把這些原本割裂的數(shù)據(jù)重新連接起來,最終形成一個能夠被 AI 理解、查詢和調(diào)用的個人知識網(wǎng)絡(luò)。
而這也是康洪文過去二十年思考不斷演化后的結(jié)果。在微軟亞洲研究院,他研究機器如何理解視頻;在智影時期,他研究機器如何生成內(nèi)容;而到了今天,他開始思考一個新的問題:當(dāng) AI 已經(jīng)能夠理解內(nèi)容、生成內(nèi)容之后,誰來組織內(nèi)容。
*頭圖來源:受訪者
本文為極客公園原創(chuàng)文章,轉(zhuǎn)載請聯(lián)系極客君微信 geekparkGO
極客一問
你如何看待 Memory Layer ?
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.