小模型在解決復(fù)雜問題時(shí),可驗(yàn)證獎(jiǎng)勵(lì)強(qiáng)化學(xué)習(xí)(RLVR)、監(jiān)督微調(diào)(SFT)等傳統(tǒng)方法經(jīng)常失效。
在一項(xiàng)新研究中,谷歌團(tuán)隊(duì)推出了“監(jiān)督強(qiáng)化學(xué)習(xí)”(Supervised Reinforcement Learning,SRL)框架,有效地解決了這一問題。
而且,SRL + RLVR 的組合,能夠進(jìn)一步提升整體性能。
除了推理類基準(zhǔn)測(cè)試之外,SRL 還可以有效地泛化到 Agentic 軟件工程任務(wù)中,是一個(gè)魯棒且通用的、面向推理大語言模型(LLM)的訓(xùn)練框架。
1?? 背景
LLM 在需要多步推理的問題上往往表現(xiàn)不佳。而對(duì)于小型開源模型而言:
1)RLVR 在即使經(jīng)過多次嘗試也很難采樣到正確解決方案時(shí),往往導(dǎo)致失敗;
2)SFT 傾向于通過僵硬的逐個(gè) token 模仿對(duì)長(zhǎng)演示進(jìn)行過擬合,缺乏靈活性。
2?? 方法
不同于 RLVR 和 SFT,SRL 把復(fù)雜推理問題轉(zhuǎn)化為一個(gè)逐步?jīng)Q策過程,在專家指導(dǎo)下逐步探索,每一步就是一個(gè)小型的學(xué)習(xí)過程,有即時(shí)反饋、有獨(dú)立思考空間。
具體而言,專家的示范過程被分解為一系列中間動(dòng)作,每一步都代表一個(gè)有意義的決策節(jié)點(diǎn)。訓(xùn)練過程中,模型首先生成內(nèi)部獨(dú)白,闡述自己的思考過程,然后再執(zhí)行一個(gè)“動(dòng)作”。在每個(gè)步驟上,SRL 都會(huì)根據(jù)模型預(yù)測(cè)的動(dòng)作與專家對(duì)應(yīng)動(dòng)作之間的相似度給予獎(jiǎng)勵(lì),從而實(shí)現(xiàn)細(xì)粒度、可高效計(jì)算的監(jiān)督信號(hào),并能在大規(guī)模數(shù)據(jù)集上擴(kuò)展應(yīng)用。
最終,SRL 使小型模型也能學(xué)會(huì)以往 RLVR 和 SFT 都難以掌握的復(fù)雜任務(wù)。
3?? 結(jié)果
SRL 讓模型能在復(fù)雜的、多步驟的問題上獲得穩(wěn)定學(xué)習(xí)信號(hào),培養(yǎng)更結(jié)構(gòu)化的推理習(xí)慣。
實(shí)驗(yàn)證明,在數(shù)學(xué)推理和 Agentic 軟件工程任務(wù)中的性能,都優(yōu)于現(xiàn)有方法;當(dāng)與 RLVR 結(jié)合(即 SRL→RLVR)時(shí),還能形成一種課程學(xué)習(xí)(curriculum learning)策略,進(jìn)一步提升性能。
谷歌團(tuán)隊(duì)認(rèn)為,SRL 是一種魯棒的、可泛化的推理導(dǎo)向訓(xùn)練框架,為訓(xùn)練能夠真正“理解與思考”的 AI 模型提供新的路徑。
#大模型 #LLM #推理 #強(qiáng)化學(xué)習(xí) #SFT #谷歌 #論文 #學(xué)術(shù)
![]()
![]()
![]()
![]()
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.