Meta 科學家改寫了 Transformers 的思考方式!
[讓我看看]改進的 Transformers 不再只是預測「下一個 token」,還擁有了自身意圖。
在一篇新發表的論文中,Meta 研究科學家 Fran?ois Fleuret 構建了一個生成過程依賴于潛變量的 Transformer 模型——Free Transformer。
有 X 網友評價道,Free Transformer 為大語言模型(LLM)賦予了一個隱藏的“心智”,使得模型能夠在開始“說話”之前自行決定如何生成,“打破了自 2017 年以來大多數 LLM 都遵循的核心規則”。
[強]據論文描述,要實現這一點,編碼器 Transformer 在生成階段只需要一個隨機源,但在訓練階段則需要一個編碼器,從而構成一個條件變分自編碼器(conditional VAE)。
Free Transformer 就是這樣一種“Transformer VAE”。它通過讓編碼器和解碼器共享一半的層結構,并僅為解碼器增加一個專屬模塊,從而減輕了計算開銷。
這個額外的模塊不是因果結構(non-causal)的,因此編碼器可以看到完整的序列。與標準 VAE 類似,編碼器向解碼器傳遞的信息量由 KL 散度項來控制。
在合成序列上的實驗表明,當 KL 散度增大時,模型確實會越來越多地利用潛變量 Z,直到最終出現坍塌(collapse)。
使用 FAIR 框架及不同規模基礎模型進行的實驗表明,這一方法能夠有效提升模型在 GSM8K、MMLU 和 HumanEval 等標準基準測試上的性能。
#大模型 #LLM #論文 #學習 #transformers
paper:https://arxiv.org/abs/2510.17558
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.