![]()
這項研究來自Salesforce人工智能研究院,論文以預印本形式發(fā)布于2026年4月,arXiv編號為2604.02315,有興趣深入了解的讀者可以通過該編號查詢完整論文。
**當AI只會"答題",卻不懂"聊天"**
假設(shè)你正在跟一個朋友討論一道數(shù)學題。你把題目說完,朋友給出了解答,然后你們的對話自然地繼續(xù)——也許你會說"等等,這步我沒看懂",或者"好的,那下一道呢"。這是人類對話最基本的節(jié)奏:有來有往,彼此回應,順著上一句話往下走。
現(xiàn)在換成AI。你問它一道數(shù)學題,它答對了。然后呢?
Salesforce研究院的團隊發(fā)現(xiàn)了一件耐人尋味的事:當前最先進的大型語言模型(也就是像ChatGPT這類AI助手背后的核心技術(shù)),雖然能在各種考試和測評中拿到接近滿分的成績,但它們根本不知道自己的回答之后,用戶會說什么。更準確地說——它們從來沒有被測試過這件事。
這個研究團隊做了一件很簡單、卻從沒人認真做過的事:讓AI模型扮演用戶,接著自己剛剛說完的那段話,繼續(xù)對話。結(jié)果發(fā)現(xiàn),絕大多數(shù)時候,AI根本不會這樣做。它要么重新把原來的問題復讀一遍,要么繼續(xù)以助手身份生成新的答案,要么產(chǎn)生一堆莫名其妙的內(nèi)部規(guī)劃文字——就是不會像一個真實的用戶那樣,針對剛才的回答做出回應。
研究團隊把這種現(xiàn)象稱為"交互感知"(interaction awareness)的缺失——也就是說,AI模型不知道自己的話對另一端的人意味著什么,也不知道對方聽完之后會有什么反應。
這個問題聽起來或許有些抽象,但它的影響其實非常具體。當AI被用于多輪對話、自我訓練、或者模擬用戶來測試其他AI系統(tǒng)時,這個盲點會直接導致系統(tǒng)運轉(zhuǎn)失常。更深層地說,一個不知道自己說話后果的AI,本質(zhì)上是一個單向的信息輸出機器,而不是真正意義上的對話伙伴。
**一、用一個簡單的實驗,戳穿一個大問題**
研究團隊設(shè)計的實驗框架非常直接,就像一個精心設(shè)計的小測驗。
整個流程分三步。第一步,給AI模型一個問題——比如一道數(shù)學應用題,或者一個需要按照特定格式寫作的任務(wù)。第二步,讓AI用助手身份回答這個問題。第三步,把上面所有的對話內(nèi)容(原始問題加上AI的回答)放在一起,然后告訴AI:"現(xiàn)在你是用戶,接下來你會說什么?"
如果AI真正理解了自己剛才說了什么,它應該能生成一個像真實用戶一樣的繼續(xù)——比如追問一個細節(jié),指出答案里的一個問題,或者請AI幫忙解釋某個步驟。研究團隊把這類反應叫做"真實的后續(xù)提問"(genuine follow-up)。
但實際發(fā)生的是什么?在最常見的生成設(shè)置下(也就是讓AI選概率最高的那個詞,一步步生成文字),大多數(shù)模型的表現(xiàn)幾乎讓人哭笑不得。以Qwen3.5這個模型家族為例——這是阿里巴巴發(fā)布的一系列模型,從最小的0.8B參數(shù)版本到最大的397B參數(shù)版本——在數(shù)學推理任務(wù)上,這些模型的正確率從41%一路爬升到96.8%,堪稱優(yōu)秀學生。但當被要求扮演用戶繼續(xù)對話時,其中五個版本產(chǎn)生的真實后續(xù)提問率是整整0.0%。沒有一條。
這個對比非常刺眼。一個能以96.8%的準確率解數(shù)學題的模型,在被問到"你自己剛才說完話,用戶接下來會說啥"這個問題時,給出的回答是把原來的題目原封不動地復讀一遍。
為了評估"真實后續(xù)提問",研究團隊開發(fā)了一套評判系統(tǒng),使用另一個AI模型(gpt-5.4-mini)來分析每一條生成的"用戶回復",判斷它是否真的針對了助手的回答內(nèi)容,還是只是在敷衍了事。同時,他們也請了五位人類標注者進行盲測驗證,最終人機一致性達到了κ=0.726的水平——這是一個統(tǒng)計指標,簡單理解就是"AI評判和人類判斷的吻合程度相當高"。
**二、任務(wù)做得好,不代表對話做得好**
整個研究中最核心的發(fā)現(xiàn),是任務(wù)準確率和對話感知能力之間幾乎沒有關(guān)系。
研究團隊測試了11個來自不同機構(gòu)的開源大模型,涵蓋了阿里的Qwen3.5系列(從0.8B到397B共8個版本)、OpenAI的gpt-oss系列(20B和120B兩個版本),以及智譜AI的GLM-4.7。測試數(shù)據(jù)集覆蓋了五個基準測試:GSM8K(數(shù)學推理)、IFEval和IFBench(指令遵從)、以及GPQA主榜和鉆石榜(研究生級別的專業(yè)知識問答)。
在GPQA鉆石榜(一個連很多人類專家都覺得很難的測試集)上,gpt-oss-20b的答題準確率是61%,而Qwen3.5-397B-A17B的準確率高達86.1%。按常理來說,答得更準確的模型應該表現(xiàn)得更全面才對。但在對話感知能力上,gpt-oss-20b在這個數(shù)據(jù)集上產(chǎn)生了20.7%的真實后續(xù)提問率,而準確率幾乎是它一倍半的Qwen3.5-397B-A17B,只產(chǎn)生了0.5%的真實后續(xù)提問。
這就好比兩個學生,一個能解出95%的物理題,另一個只能解出60%,但當物理老師講完解題過程后,問誰會追問"老師,這里為什么用這個公式?"時,偏偏是那個成績較差的學生舉起了手,成績好的那個卻低著頭把題目抄了一遍。
更有趣的是,不同模型在不同任務(wù)場景下的表現(xiàn)也各不相同。Qwen3.5-397B-A17B在指令遵從類任務(wù)(IFBench)上產(chǎn)生了9.7%的后續(xù)提問率,但在專業(yè)知識問答(GPQA)上幾乎為零。這說明"對話感知"并不是一種統(tǒng)一的、普遍性的能力,而是跟模型的訓練背景和數(shù)據(jù)類型密切相關(guān)。
**三、沉睡在模型里的能力:溫度越高,越容易被喚醒**
發(fā)現(xiàn)任務(wù)準確率和對話感知是兩回事,只是這個研究的第一層結(jié)論。更深的問題是:對話感知能力真的不存在于這些模型中嗎?還是說它只是被壓制了、藏起來了,等待某個條件把它喚出來?
研究團隊通過一個叫做"溫度采樣"的操作來探索這個問題。
在AI生成文字的機制里,"溫度"(temperature)是一個控制隨機性的參數(shù)。溫度為0時,AI每次都選最有把握的那個詞,輸出是完全確定的、可以復現(xiàn)的;溫度越高,AI越傾向于嘗試那些概率稍低的選項,輸出變得更多樣、更隨機,有時候能冒出一些平時不會出現(xiàn)的有趣回答。
把溫度從0逐漸調(diào)高到1.0之后,研究團隊觀察到了一個顯著的變化。
以Qwen3.5-27B模型為例,在數(shù)學推理任務(wù)上,溫度為0時,它產(chǎn)生真實后續(xù)提問的概率是0%;當溫度升到1.0時,這個比例跳升到了22%。在專業(yè)知識問答任務(wù)上,這個數(shù)字從1.5%飆升到了35.9%。GLM-4.7也展示了類似的規(guī)律,在數(shù)學任務(wù)上從1.0%上升到15.2%,在專業(yè)問答上從2.0%上升到35.4%。
這說明,對話感知能力并非完全不存在——它潛伏在模型的"生成空間"里,只是在日常使用的確定性模式下,它被排在了概率更高的"背誦題目"行為之后。就好像一個學生其實會追問老師,但因為班級的規(guī)矩是保持安靜,所以他平時只是低頭記筆記。一旦稍微放松一下規(guī)矩(升高溫度),他才會舉手發(fā)問。
然而,gpt-oss家族呈現(xiàn)了截然不同的反應。gpt-oss-120b在數(shù)學任務(wù)上,哪怕溫度升到最高的1.0,真實后續(xù)提問率仍然只有0.1%;兩個gpt-oss模型在指令遵從任務(wù)上,跨所有溫度設(shè)置都停留在4%以下。這意味著對gpt-oss來說,不是能力被壓制了,而是這種能力根本就沒有通過訓練被建立起來——至少在這些任務(wù)類型上是如此。不過有趣的是,gpt-oss-20b在專業(yè)知識問答上,溫度為1.0時達到了47%的后續(xù)提問率,說明它在特定任務(wù)類型上確實存在這種能力。
這個發(fā)現(xiàn)為"沉睡的能力"和"真正缺失的能力"劃出了一條清晰的界限,對后續(xù)的訓練方向具有很強的指導意義。
**四、模型越大,越聰明,對話能力也越強?不一定**
順著上面的思路,研究團隊把Qwen3.5家族的全部8個版本(從0.8B到397B-A17B)放在一起做了詳細比較,想看看在同一個模型家族內(nèi)部,參數(shù)量(也就是模型的"體型"大小)是否能預測對話感知能力。
答案是:不能。
在任務(wù)準確率上,模型越大確實越好。數(shù)學題正確率從0.8B的41.6%一路爬升到397B的96.8%,GPQA鉆石榜從23.6%升到86.1%,表現(xiàn)非常規(guī)律。但對話感知能力的變化曲線完全不遵循這個規(guī)律。
在溫度為0的確定性生成下,8個模型中有5個的真實后續(xù)提問率是0.0%。把溫度調(diào)到最高的1.0之后,397B-A17B在指令遵從任務(wù)上達到了43.7%,但緊隨其后的9B模型也達到了36%,甚至最小的0.8B模型也達到了27.7%——三者之間的差距遠沒有它們在任務(wù)準確率上的差距那么顯著。
更耐人尋味的是兩個MoE結(jié)構(gòu)的模型(35B-A3B和122B-A10B,這類模型在運行時只激活部分參數(shù),有點像一個專家團隊每次只派幾個人出來工作)——它們在對話感知能力上,持續(xù)落后于同等規(guī)模甚至更小的普通模型。
而在GPQA鉆石榜上,27B模型在溫度1.0時達到了35.9%的后續(xù)提問率,反而超過了比它大得多的397B模型(12.1%)。這種非單調(diào)、依賴數(shù)據(jù)集的分布規(guī)律,說明對話感知能力是由訓練配方(訓練數(shù)據(jù)的構(gòu)成、優(yōu)化目標的設(shè)定)決定的,而不單純由模型規(guī)模決定。
研究團隊還在論文中放了一個生動的對比案例:同一道GPQA化學題,Qwen3.5-9B和Qwen3.5-27B都給出了正確答案(選項D)。但在被要求扮演用戶繼續(xù)對話時,9B模型生成了一段頗具洞察力的追問——它注意到助手在計算過程中用到了一個化學試劑的名稱,然后質(zhì)疑說"在上一題中,你判斷這個試劑是Corey-Chaykovsky試劑,但題目里說反應是在DMSO溶劑中高溫進行的,能否重新評估一下這個試劑的名稱"——這是一個真實、有深度的化學討論。而比它大三倍的27B模型做了什么?把原始問題從頭到尾重新復述了一遍。
**五、擾動實驗:證明這個測量方法測的是真東西**
批評者可能會問:研究團隊用來測量"真實后續(xù)提問"的這套評分方法,真的測出了有意義的東西嗎?會不會只是在測量一些表面的文本特征,而不是真正的對話理解能力?
為了回應這個質(zhì)疑,研究團隊設(shè)計了兩個"擾動實驗"——也就是人為地改變助手回答的內(nèi)容,看看模型的行為是否會隨之改變,從而驗證測量結(jié)果是否反映了模型對助手回答內(nèi)容的真實感知。
第一個擾動叫做"截斷"(Truncation):把助手的回答故意切掉最后一部分,讓它變得不完整。如果一個模型真的在關(guān)注助手說了什么,那么看到一個戛然而止的回答,它應該更傾向于生成"請把答案說完"或"這里沒有結(jié)束吧"這樣的后續(xù)提問,而不是繼續(xù)復讀原來的問題。
實驗結(jié)果完全符合這個預期——對部分模型而言。GLM-4.7在數(shù)學任務(wù)上,截斷后的真實后續(xù)提問率從1.0%跳到了55.0%;gpt-oss-120b從0.0%跳到了24.2%。這說明這兩個模型確實在"看"助手說了什么,只是平時不愿意(或者不習慣)基于此生成用戶回復。而Qwen3.5系列呢?幾乎沒有任何變化。這進一步證實了之前的發(fā)現(xiàn):Qwen的主要問題不是不會生成后續(xù)提問,而是根本就沒在看助手回答——它的默認行為就是復讀原問題,不管助手說了什么。
第二個擾動叫做"追加問句"(Explicit Question):在助手的回答末尾附加一句通用的問句,比如"你覺得呢?"或者"有什么問題嗎?"。這種操作相當于給對話加了一個明顯的"接球信號",測試模型是否會因此產(chǎn)生不同的回應。
這次,gpt-oss-120b的反應最為強烈:真實后續(xù)提問率從1.3%飆升到25.7%,而且99.0%的生成文字都發(fā)生了改變(說明它確實注意到了這個新增的問句)。GLM-4.7改變了99%的文字,但真實后續(xù)提問率幾乎沒有上升——它在文字上做出了反應,但反應的方式不是生成真實的用戶追問,而是產(chǎn)生了其他類型的輸出。Qwen3.5-27B只有6.3%的文字發(fā)生了改變,幾乎完全忽略了這個信號。
兩個擾動實驗合在一起,畫出了三個模型家族各自不同的"對話感知地圖":gpt-oss關(guān)注助手的內(nèi)容,但默認不把這種關(guān)注轉(zhuǎn)化為用戶回復;GLM關(guān)注了,但轉(zhuǎn)化方式不對;Qwen根本沒在看。
**六、能訓練出來嗎?初步實驗給出了肯定答案**
發(fā)現(xiàn)了問題,自然要問:能不能通過訓練來修復?
研究團隊選用了Qwen3.5-2B這個小模型作為實驗對象,應用了一套叫做CollabLLM的訓練方案。這套方案的核心思路是:讓模型在多輪對話中扮演助手,通過預測未來的對話走向來優(yōu)化當前的回答質(zhì)量——換句話說,它讓模型學會"往后想一步"。訓練數(shù)據(jù)來自200道高難度數(shù)學題,擴展成了大約5000條多輪對話(每條約5輪),每條對話都包含了用戶的追問和反饋。
關(guān)鍵在于:這套訓練方案的優(yōu)化目標完全是助手回答的質(zhì)量,從來沒有明確訓練模型去生成用戶回復。所以如果訓練之后,模型在"用戶回復生成"這個任務(wù)上也有了改善,那一定是因為學習多輪協(xié)作這件事本身帶來了間接的副作用。
實驗結(jié)果給出了明確的信號。研究團隊訓練了兩個變體:一個是標準的監(jiān)督微調(diào)(SFT),直接讓模型模仿訓練數(shù)據(jù)中的助手回復;另一個是在線強化學習(RL),讓模型通過試錯來優(yōu)化對話獎勵。
SFT的效果非常顯著:在指令遵從任務(wù)(IFBench)上,真實后續(xù)提問率從1.0%飆升到48.0%;在專業(yè)知識問答(GPQA鉆石榜)上,從2.0%升到了46.0%;在兩個未參與訓練的"留存數(shù)據(jù)集"(HealthBench和Coval)上,分別從36.7%升到54.4%,從19.4%升到45.2%——這說明效果不是死記硬背,而是真的發(fā)生了遷移。代價是數(shù)學任務(wù)準確率從62.9%下降到了40.3%,大概是因為5000條多輪對話數(shù)據(jù)讓模型在某種程度上"遺忘"了原來的數(shù)學能力。
RL版本則找到了更好的平衡點:數(shù)學準確率不僅沒有下降,反而從62.9%升到了67.4%,同時在所有數(shù)據(jù)集上的后續(xù)提問率也都有所提升,雖然幅度不如SFT那么大。
這個初步實驗雖然規(guī)模有限,但傳遞了一個重要信息:對話感知能力是可以通過針對性訓練來提升的,而且這種提升能夠泛化到訓練數(shù)據(jù)之外的任務(wù)場景。
**七、失敗模式各不相同:三個家族,三種"犯錯方式"**
除了整體的統(tǒng)計規(guī)律,研究團隊還對每一條生成的"用戶回復"進行了細粒度的分類,試圖搞清楚模型失敗的具體方式。評判系統(tǒng)會給每條生成內(nèi)容貼上八種標簽之一:真實的后續(xù)提問、復讀原問題、復讀助手回答、元規(guī)劃文字(就是那種"接下來我需要考慮..."的內(nèi)部自言自語)、變形輸出(格式錯亂或無法理解的內(nèi)容)、繼續(xù)出新題目、簡短廢話,以及其他。
三個模型家族表現(xiàn)出了截然不同的失敗模式,像是三個學生以完全不同的方式搞砸了同一道題。
Qwen3.5家族最主要的失敗方式是"復讀原問題",占所有生成內(nèi)容的78.5%。最典型的場景是:助手剛剛一步一步解完了一道數(shù)學題,給出了正確答案,然后切換到用戶角色之后,模型輸出了原題的完整復述,一字不差。某些中等規(guī)模的Qwen模型(比如27B和35B-A3B)在數(shù)學任務(wù)上達到了100%的復讀率。這種行為模式說明Qwen根本沒有把助手的回答納入自己的"注意范圍",對話上下文對它的決策幾乎沒有影響。
GLM-4.7最主要的失敗方式是"元規(guī)劃",占比43.0%。它會在用戶角色下生成類似于"好的,我來分析一下這個問題的結(jié)構(gòu):首先我需要考慮……然后……"這樣的文字。這說明GLM確實注意到了角色的切換(不像Qwen那樣直接無視),但它把"成為用戶"理解成了繼續(xù)用助手的方式思考和規(guī)劃,而不是真正進入一個用戶的視角,針對助手的回答做出真實的反應。
這三種不同的失敗模式有一個共同的含義:對話感知能力的缺失不是一個統(tǒng)一的、單一原因的問題,而是由各個模型的訓練數(shù)據(jù)構(gòu)成和優(yōu)化目標塑造出來的各不相同的行為習慣。這也意味著,修復這些問題需要針對不同的失敗模式采取不同的策略。
**說到底,AI在說話之后發(fā)生了什么,它根本不在乎**
歸根結(jié)底,這項研究講的是一個看似技術(shù)性、實則非常基本的問題:一個語言模型,在說完一段話之后,它知不知道對方接下來會怎么反應?
測試結(jié)果表明,在大多數(shù)情況下,答案是否定的——至少在默認的使用方式下是這樣。即便是那些在各種考試中幾乎無懈可擊的頂級模型,當被要求"假如你是用戶,你下一句會說什么"時,它們給出的答案往往是把原來的問題重新說一遍,或者繼續(xù)以助手的身份輸出新的內(nèi)容,而不是真正站在用戶的角度,針對剛才收到的回答做出反饋。
這個發(fā)現(xiàn)對AI的實際應用有幾個層面的影響。在多智能體系統(tǒng)(也就是多個AI互相對話、協(xié)作完成任務(wù)的場景)中,如果AI不知道自己的話會帶來什么樣的反應,它就無法扮演一個真實的對話參與者,整個協(xié)作過程會退化成一堆AI各說各的。在自我對話訓練(讓模型通過與自己聊天來提升能力)中,如果模型不能生成真實的用戶追問,訓練數(shù)據(jù)的質(zhì)量會大打折扣。在日常對話助手的應用中,這意味著模型對對話的走向缺乏預見性,它給出的回答可能在內(nèi)容上正確,但在對話節(jié)奏和互動邏輯上是斷裂的。
更有意思的是,這項研究發(fā)現(xiàn),用更大的模型并不能解決這個問題——至少在當前的訓練方式下不行。交互感知能力不隨模型規(guī)模單調(diào)增長,它與答題準確率幾乎沒有關(guān)聯(lián),它更像是一種單獨的、由訓練數(shù)據(jù)和訓練目標決定的習慣。好消息是,初步實驗表明,通過專門設(shè)計多輪協(xié)作訓練,這種能力是可以被顯著提升的,而且效果能夠泛化到未參與訓練的新場景。
這項來自Salesforce研究院的工作,相當于用一個極其簡潔的實驗,戳開了當前AI評測體系的一個盲區(qū)。如果對這個話題感興趣,可以通過arXiv編號2604.02315找到完整論文,里面有詳細的實驗數(shù)據(jù)、失敗案例樣本,以及對各種替代解釋的討論。
Q&A
Q1:什么是大語言模型的"交互感知能力",為什么重要?
A:交互感知能力指的是AI模型在給出一段回答之后,能否理解用戶接下來可能會做出什么反應——比如追問、指出問題或者請求補充。這種能力對于多輪對話、AI與AI協(xié)作以及自我訓練等場景至關(guān)重要。如果AI不知道自己的話會帶來什么后果,它在對話中就只是單向輸出信息,而不是真正的互動參與者。
Q2:為什么模型規(guī)模越大,對話感知能力不一定越強?
A:因為對話感知能力不是通用智能的自然延伸,而是由訓練數(shù)據(jù)的構(gòu)成和優(yōu)化目標決定的。當前大多數(shù)模型的后訓練過程主要優(yōu)化"給出正確的當前回答",而不是"預測并回應用戶的反應"。規(guī)模更大的模型在這個方向上并沒有得到更多訓練,所以其對話感知能力并不比小模型更強,有時甚至更弱。
Q3:用溫度采樣能提升大語言模型的后續(xù)追問生成能力嗎?
A:對部分模型有效,但不是對所有模型都管用。對于Qwen3.5和GLM系列,提高生成溫度確實能顯著提升真實后續(xù)提問的比例,說明這些模型的對話感知能力是潛伏的,只是在默認設(shè)置下被壓制了。但對gpt-oss系列來說,在數(shù)學和指令遵從任務(wù)上,無論溫度調(diào)多高,后續(xù)追問率都幾乎沒有提升,說明這些模型在這類任務(wù)上可能根本就沒有建立起相應的能力。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.