![]()
《西部世界》里的接待員,可能要失業(yè)了。
畢竟,人家一個(gè)樂(lè)園才養(yǎng)多少 NPC。這次,研究者直接照著地球人口規(guī)模,造了 83 億個(gè)數(shù)字人。
最近,哈佛、MIT、斯坦福等一眾頂尖機(jī)構(gòu)聯(lián)合推出 MatrAIx:一套人口規(guī)模的 AI 用戶模擬系統(tǒng)。里面塞進(jìn)了 83 億份 Persona 檔案,數(shù)量幾乎和現(xiàn)實(shí)世界的人口打平。
![]()
名字聽(tīng)起來(lái)有點(diǎn)《黑客帝國(guó)》,玩法卻更像《西部世界》:
先給每個(gè)「人」安排一套完整人設(shè):年齡、職業(yè)、地區(qū)、語(yǔ)言、性格、消費(fèi)習(xí)慣、風(fēng)險(xiǎn)偏好、專業(yè)能力…… 最多 1290 個(gè)維度;再把這些人設(shè)塞進(jìn) GPT-5.5、Claude Opus 4.8 等大模型里,讓它們真的出去「生活」。
有人負(fù)責(zé)逛網(wǎng)站,有人找 AI 聊天,有人填問(wèn)卷,還有人直接打開(kāi) iPhone 上的 Apple News+,看完內(nèi)容、瞅一眼每月 12.99 美元的價(jià)格,再?zèng)Q定:這錢,我掏不掏。
更離譜的是,不同「人」還真有不同脾氣。
同樣面對(duì)漲價(jià),有人立刻猶豫,有人覺(jué)得無(wú)所謂;同一個(gè) AI 助手犯錯(cuò),有人愿意再給一次機(jī)會(huì),有人直接跑路;有人嫌 News+ 沒(méi)有自己熟悉的語(yǔ)言內(nèi)容,有人嫌專業(yè)領(lǐng)域覆蓋不夠。研究團(tuán)隊(duì)一共跑了 18189 次測(cè)試,還發(fā)現(xiàn)這些 Persona Agent 在受控實(shí)驗(yàn)中,有 91.5% 的行為能跟設(shè)定的人格特征對(duì)上。
![]()
視頻鏈接:https://mp.weixin.qq.com/s/Hy-G4O5MoeGInAb40nS7iQ
這下,產(chǎn)品經(jīng)理熟悉的流程可能要多一步了。
以前一個(gè) App 上線前,要找用戶、發(fā)問(wèn)卷、做訪談、跑測(cè)試。
現(xiàn)在可以先問(wèn)一句:要不先放進(jìn)這個(gè)數(shù)字西部世界里,讓幾十萬(wàn)種用戶替我們用一遍?
![]()
- 論文地址:https://arxiv.org/pdf/2608.04205
- 項(xiàng)目地址:https://github.com/MatrAIx-ai/MatrAIx-Persona-8B
- 論文標(biāo)題:MatrAIx: Simulating the World with 8.3 Billion Persona Agents
作者陣容同樣堪稱豪華。哈佛、MIT、斯坦福、伯克利、CMU、普林斯頓、牛津、賓大、康奈爾、哥大等頂尖高校集體出現(xiàn),背后還有 OpenAI、Anthropic、Microsoft Azure、AWS、Meta 提供資金、算力、模型訪問(wèn)及項(xiàng)目支持,從研究機(jī)構(gòu)到 AI 大廠,陣仗基本拉滿。
論文剛發(fā),學(xué)術(shù)圈已經(jīng)坐不住了。
論文上線僅 1 天 5 小時(shí),就被 Nature 的 Senior Editor 注意到,并主動(dòng)聯(lián)系研究團(tuán)隊(duì)。
![]()
X 上的討論熱度也迅速?zèng)_了起來(lái)。大家最先被震住的,還是這個(gè)數(shù)字:83 億。
「差不多相當(dāng)于地球上每一個(gè)活著的人,都有一個(gè)對(duì)應(yīng)的數(shù)字分身。」
![]()
「83 億個(gè)虛擬人的 AI 模擬系統(tǒng),規(guī)模幾乎相當(dāng)于整個(gè)地球人口。」
![]()
接下來(lái),我們具體看看 MatrAIx 到底做了什么。
這項(xiàng)研究首先瞄準(zhǔn)了一個(gè)很現(xiàn)實(shí)的問(wèn)題:
AI Agent,究竟能在多大程度上模擬不同人群的行為和偏好?
研究者首先在評(píng)測(cè)場(chǎng)景中,探索了 agent 模擬人類偏好的可行性。一次高質(zhì)量的用戶研究,往往需要招募、篩選、評(píng)測(cè)和統(tǒng)計(jì)分析,覆蓋幾十人已經(jīng)不易,更不用說(shuō)同時(shí)比較上千個(gè)甚至更大規(guī)模的用戶群體。若依靠真實(shí)用戶完成大規(guī)模的測(cè)試,現(xiàn)實(shí)中時(shí)間和金錢成本都極高。
對(duì)此,MatrAIx 研究團(tuán)隊(duì)的核心思路是,通過(guò)賦予大模型人格,使其模仿多樣的用戶群體完成對(duì)大規(guī)模真人評(píng)測(cè)的模擬。MatrAIx 里 83 億個(gè)帶人格的虛擬用戶能夠高效準(zhǔn)確地完成多種測(cè)試任務(wù),解決產(chǎn)品測(cè)試成本高、耗時(shí)長(zhǎng)、覆蓋率低等一系列問(wèn)題。
MatrAIx 評(píng)測(cè)平臺(tái)主要包含三個(gè)核心部分:1. Persona-8B 人格數(shù)據(jù)庫(kù), 2. 四類仿真環(huán)境, 3. 多領(lǐng)域評(píng)測(cè)任務(wù)。
Persona-8B 人格數(shù)據(jù)庫(kù)
人格維度
MatrAIx Persona-8B 數(shù)據(jù)庫(kù)包含 83 億份人格記錄。每份記錄都基于標(biāo)準(zhǔn)化的 1290 個(gè)人格維度。這些維度分為五個(gè)大類:背景信息 238 維、心理特征 210 維、能力信息 331 維、行為與交互習(xí)慣 124 維,以及生活方式 387 維。從人口與職業(yè)背景一直延伸到價(jià)值觀、專業(yè)能力、交互偏好和日常生活。研究者可以按年齡、地區(qū)、專業(yè)能力或風(fēng)險(xiǎn)偏好篩選人群,也可以比較不同群體針對(duì)同一產(chǎn)品時(shí)的反饋。
![]()
Persona-8B 的五類人格維度。整套框架共包含 1290 個(gè)類別維度,覆蓋背景、心理、能力、行為與交互習(xí)慣和生活方式。表中同時(shí)列出了各類別的維度數(shù)量、代表性屬性及主要數(shù)據(jù)依據(jù)。
數(shù)據(jù)構(gòu)建
Persona-8B 采用兩種主要構(gòu)建方法: 1. 生成合成人格,2. 從已有資料中提取人類畫(huà)像。
針對(duì)人格數(shù)據(jù)合成,MatrAIx 團(tuán)隊(duì)建立了一張有向無(wú)環(huán)圖 (Directed Acyclic Graph),用于描述屬性之間的依賴關(guān)系。比如,教育水平與年齡相關(guān),英語(yǔ)能力則與所在地區(qū)的主要語(yǔ)言相關(guān)。團(tuán)隊(duì)基于依賴關(guān)系依次采樣,并用兼容性規(guī)則排除明顯沖突的組合。以此方式生成的人格同時(shí)保留了單條人格的合理性和總體人口的多樣性.
![]()
Persona-8B 的合成人格依賴圖。每個(gè)節(jié)點(diǎn)代表一個(gè)人格維度,連線表示兩個(gè)維度之間存在條件依賴。生成人格時(shí),按照從父節(jié)點(diǎn)到子節(jié)點(diǎn)的順序逐項(xiàng)采樣,使年齡、教育、語(yǔ)言、職業(yè)等相關(guān)屬性能彼此協(xié)調(diào)。
合成方式可用公式概括。一份人格出現(xiàn)的概率,可拆成 1290 個(gè)條件概率的乘積。生成時(shí)沿著 DAG 順序,根據(jù)當(dāng)前屬性的父節(jié)點(diǎn)計(jì)算下一個(gè)屬性的概率分布。
![]()
![]()
另一部分人格來(lái)自真實(shí)人類資料,包括 Wikipedia 人物百科、Amazon 用戶評(píng)論歷史、Stack Overflow 開(kāi)發(fā)者調(diào)查、General Social Survey、PRISM Alignment,以及 355 名志愿者填寫的 MatrAIx 人格問(wèn)卷。這些資料被映射到同一套 1290 維度中,沒(méi)有足夠證據(jù)支持的屬性會(huì)保留為空。
MatrAIx Playground:四類評(píng)測(cè)環(huán)境
MatrAIx Playground 提供四類環(huán)境:?jiǎn)柧怼I 聊天機(jī)器人、網(wǎng)頁(yè)和應(yīng)用。
- 問(wèn)卷:人格 agent 可以回答產(chǎn)品概念、價(jià)格敏感度、消費(fèi)意愿等問(wèn)題。
- AI 聊天機(jī)器人:環(huán)境會(huì)保留完整對(duì)話,觀察用戶是否追問(wèn)、是否接受修正,以及在 AI 助手出錯(cuò)之后是否還愿意繼續(xù)使用。
- 網(wǎng)頁(yè):允許 agent 瀏覽站點(diǎn)、搜索信息、比較選項(xiàng)并作出選擇。
- 應(yīng)用 App:agent 可以通過(guò)鼠標(biāo)、鍵盤或觸控操作例如 Linux、macOS 和 iOS 應(yīng)用等。環(huán)境會(huì)記錄交互過(guò)程、最終狀態(tài),以及文件、權(quán)限或設(shè)置發(fā)生的變化。
問(wèn)卷關(guān)注選擇和理由等概念測(cè)試,AI 聊天機(jī)器人關(guān)注多輪互動(dòng)下 AI 模型的表現(xiàn),網(wǎng)頁(yè)與應(yīng)用則提供沙箱環(huán)境測(cè)試 AI 與數(shù)字產(chǎn)品。MatrAIx 會(huì)保留完整的交互軌跡作為珍貴的數(shù)據(jù)資產(chǎn),為后續(xù)評(píng)測(cè)分析或模型訓(xùn)練提供高質(zhì)量的數(shù)據(jù)基礎(chǔ)。
![]()
![]()
MatrAIx Playground 的實(shí)驗(yàn)運(yùn)行與結(jié)果分析界面。上圖展示人格篩選、多智能體對(duì)話以及針對(duì)單次交互生成的評(píng)測(cè)結(jié)果;下圖展示群體實(shí)驗(yàn)報(bào)告,研究者可查看關(guān)鍵指標(biāo)、回答分布、人格明細(xì)和驗(yàn)證狀態(tài)。
MatrAIx Applications:多領(lǐng)域評(píng)測(cè)任務(wù)
目前,MatrAIx 收錄了 1010 項(xiàng)任務(wù),包括 621 項(xiàng)問(wèn)卷任務(wù)、371 項(xiàng) AI 聊天機(jī)器人任務(wù)、12 項(xiàng)網(wǎng)頁(yè)任務(wù)和 6 項(xiàng) App 任務(wù),覆蓋商業(yè)、軟件、金融、醫(yī)療等 25 個(gè)以上的領(lǐng)域。每項(xiàng)任務(wù)不僅包含待評(píng)測(cè)的 AI 模型或數(shù)字產(chǎn)品,還配有相應(yīng)的評(píng)測(cè)指標(biāo)和評(píng)分標(biāo)準(zhǔn)。團(tuán)隊(duì)運(yùn)行了其中 8 項(xiàng)代表性任務(wù),共完成 18189 次用戶交互。
![]()
Agent 會(huì)按照指定人格執(zhí)行嗎?
MatrAIx 專門做了 400 次受控試驗(yàn),最終有 366 次符合設(shè)定,整體遵循率為 91.5%。問(wèn)卷、AI 聊天機(jī)器人和網(wǎng)頁(yè)環(huán)境中,各有 10 個(gè)屬性里的 9 個(gè)達(dá)到較強(qiáng)表現(xiàn);應(yīng)用環(huán)境中則是 6 個(gè)。團(tuán)隊(duì)還檢查了從真實(shí)人類資料中提取人格的質(zhì)量,人工評(píng)審(6 名)平均分為 4.135 分,滿分為 5 分。GPT 5.5 和 Claude Opus 4.8 的評(píng)分與人工均分相差不超過(guò) 1 分的比例,分別為 79.2% 和 93.8%。這些結(jié)果說(shuō)明,人格設(shè)定多數(shù)時(shí)候會(huì)直接影響 agent 的實(shí)際行為。
![]()
人格行為遵循度測(cè)試。400 次受控試驗(yàn)中,366 次正確表達(dá)或抑制了指定行為,整體遵循率為 91.5%。
雖然 MatrAIx 驗(yàn)證了多種環(huán)境下人格能實(shí)際影響 agent 行為,但這仍然不能等同于 agent 可以替代真實(shí)人類。論文也明確提醒,重大結(jié)論或涉及重要決策時(shí),真人研究仍然必不可少。
過(guò)去的 AI 評(píng)測(cè)更關(guān)心模型能否給出正確答案、完成指定任務(wù)。MatrAIx 試著補(bǔ)上中間的空缺:不同背景和偏好的用戶會(huì)有怎樣不同的評(píng)測(cè)反饋。 MatrAIx 團(tuán)隊(duì)成功構(gòu)建了一套以 83 億人格數(shù)據(jù)庫(kù)為基礎(chǔ)的模擬用戶評(píng)測(cè)體系,讓大規(guī)模、多樣化的模擬用戶測(cè)試成為可能。
Explore the future today. Simulate before reality.
在今天探索未來(lái),在現(xiàn)實(shí)之前模擬。
關(guān)于 MatrAIx 團(tuán)隊(duì)
![]()
MatrAIx 由 Xiaomin Li 博士和 Yuexing Hao 博士共同組織。Xiaomin Li 畢業(yè)于哈佛大學(xué),獲應(yīng)用數(shù)學(xué)博士學(xué)位,現(xiàn)任微軟 CoreAI 高級(jí)研究科學(xué)家;Yuexing Hao 畢業(yè)于康奈爾大學(xué),獲博士學(xué)位,現(xiàn)任 MIT EECS 博士后研究員及微軟 Office of Applied Science 研究科學(xué)家。團(tuán)隊(duì)匯集了 200 余名研究科學(xué)家、工程師,其中 40 余位來(lái)自 OpenAI、Anthropic、Google DeepMind 和 xAI。項(xiàng)目顧問(wèn)由來(lái)自全球頂尖高校的教授和科技公司的行業(yè)領(lǐng)袖組成,包括科技公司首席執(zhí)行官、計(jì)算機(jī)學(xué)院院長(zhǎng)、首席科學(xué)家、AI 研究副總裁等。更多項(xiàng)目與團(tuán)隊(duì)信息可訪問(wèn) MatrAIx 官方網(wǎng)站:https://matraix.ai。
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.