AI出圖進階篇 06
LoRA與模型微調入門定制專屬畫風
通用模型畫不出你的風格?用自己的圖訓練專屬LoRA
系列四 · AI出圖進階控制 · 第6篇
前面五篇講的都是在通用模型上做控制——提示詞、ControlNet、局部重繪、放大技巧。
但你會遇到一個天花板:不管怎么寫提示詞,通用模型的畫風始終是"大眾臉"。你想要自己品牌的插畫風格,想要固定的角色形象,想要某種獨特的筆觸質感——通用模型做不到。
這時候就需要LoRA。它是目前最實用的模型微調方案,用少量的圖片就能讓AI學會一種特定風格或角色,訓練成本低、效果好、使用方便。
這篇講清楚LoRA是什么、怎么訓練、怎么用、怎么避坑,讓你從"用別人的模型"升級到"用自己定制的模型"。
![]()
LoRA:在通用模型上疊加一層薄薄的"風格補丁",不改變原模型
LoRA是什么
LoRA全稱Low-Rank Adaptation,低秩適配。名字聽起來很學術,原理其實簡單。
大模型有幾十億個參數,全量微調需要修改所有參數,成本極高。LoRA的做法是凍結原模型所有參數,只在旁邊加一個很小的"補丁"模塊,只訓練這個補丁。
打個比方:大模型是一本百科全書,LoRA是一張手寫便簽貼在某一頁上。便簽上寫著"這個詞條在你這個場景下應該這樣理解"。全書內容不變,但加了便簽之后,AI在特定場景下的表現就變了。
這個補丁很小,通常只有幾十到幾百MB,而大模型動輒幾個GB。所以LoRA文件可以很方便地分享、加載、疊加使用。
和另外兩種微調方式的區別:
Full Fine-tuning(全量微調):修改模型所有參數,效果最好但成本極高,需要專業顯卡和企業級資源,個人基本不考慮。
DreamBooth:介于全量和LoRA之間,訓練效果不錯但生成的模型文件很大(幾個GB),切換不方便。
LoRA:只訓練補丁模塊,文件小、訓練快、效果夠用,是目前個人用戶和中小團隊的首選。
LoRA能做什么
LoRA的用途主要分三類。
風格LoRA:讓模型學會某種畫風。比如你的品牌插畫風格、某個畫家的水彩筆觸、特定動漫風格。訓練好之后,任何提示詞生成的圖都自動帶上這種風格。
角色LoRA:讓模型學會某個特定角色。比如你設計的品牌吉祥物、虛擬代言人、某個虛構人物。訓練好之后,輸入角色觸發詞就能生成這個角色在不同場景、不同姿勢下的圖。
概念LoRA:讓模型學會某種特定概念。比如某種特殊材質(陶瓷釉面)、某種建筑風格(哥特教堂)、某種攝影風格(膠片質感)。比用提示詞描述更精準。
實際應用中,風格LoRA和角色LoRA用得最多,也是商業價值最高的兩類
訓練前的數據準備
LoRA訓練效果好不好,80%取決于數據準備。這是最關鍵的一步。
1. 圖片數量
風格LoRA:15~30張同一風格的圖就夠了。 角色LoRA:20~50張同一角色不同角度、不同表情、不同服裝的圖。 不是越多越好,質量比數量重要。50張精挑細選的圖比200張隨便湊的效果好得多。
2. 圖片質量
分辨率至少512x512以上,最好768x768或更大。 畫面清晰,主體突出,背景不要太雜亂。 風格LoRA選的圖風格要統一,不要混入其他風格的圖。 角色LoRA選的圖要覆蓋正面、側面、半身、全身、不同表情。
3. 裁剪和清理
把圖裁剪成正方形或接近正方形,去掉無關內容。 如果圖上有水印、文字、Logo,用Inpainting清掉。 不要用別人帶版權水印的圖訓練,訓練出來的LoRA也會有水印痕跡。
4. 打標簽
每張圖配一段文字描述,告訴AI這張圖里有什么。 可以用WD14 Tagger自動打標,然后手動修正。 角色LoRA建議給角色起一個獨特的觸發詞,比如"auge_ferly_man"這種不會和普通詞沖突的詞。 風格LoRA可以用"in auge_ferly_style"作為觸發詞。 標簽描述的是畫面內容(人物、動作、場景),不要描述風格本身——風格由LoRA負責,不用寫在標簽里。
5. 數據文件夾結構
建一個文件夾放所有訓練圖,每張圖旁邊放一個同名txt文件寫標簽。 比如img_001.png旁邊是img_001.txt,里面寫"a woman in red dress, standing in a garden"。 文件夾命名用數字開頭,比如"20_augerferly"表示20張圖、觸發詞augeferly。
![]()
數據準備五步:選圖、清理、裁剪、打標簽、組織文件夾
訓練參數怎么設
目前最常用的LoRA訓練工具是Kohya_ss,界面雖然不好看但功能完整。關鍵參數如下。
基礎模型選擇
選你要在上面疊加LoRA的大模型。 如果你要做寫實風格,選SD1.5或SDXL。 如果要做動漫風格,選Anything V5或Nai Diffusion。 訓練用的大模型和使用時加載的大模型必須一致,否則效果會打折扣。
Network Rank(維度)
也叫DIM,決定LoRA的學習能力。 風格LoRA建議設32~64。 角色LoRA建議設64~128。 太低學不夠,太高容易過擬合。先從32開始試,效果不夠再加。
Network Alpha
控制LoRA權重的大小,通常設為Rank的一半。 比如Rank設32,Alpha設16。 這個參數不用太糾結,默認值就行。
Batch Size
每次訓練處理多少張圖。 顯存8GB設1,12GB設2,24GB可以設4。 大batch size訓練更穩定但吃顯存。
Learning Rate(學習率)
最關鍵的參數。 Text Encoder(文本編碼器)學習率:1e-4到5e-5。 UNet學習率:1e-4到5e-5。 學習率太大模型會"學壞",太小訓練時間太長。 建議用cosine調度器配合warmup,前10%的步數用來預熱。
訓練步數
經驗公式:總步數 = 圖片數量 x 重復次數 x Epoch數 / Batch Size。 20張圖、每張重復10次、10個Epoch、Batch Size 1,總步數 = 20 x 10 x 10 = 2000步。 一般1500~3000步就夠了,超過5000步容易過擬合。
分辨率
設512x512。如果你的基礎模型是SDXL,設1024x1024。 訓練分辨率要和實際使用時的分辨率一致。
建議訓練時每500步保存一個檢查點,這樣可以從效果最好的那個檢查點提取LoRA,而不是只用最后一個
![]()
關鍵參數七項:模型、維度、Alpha、Batch、學習率、步數、分辨率
怎么判斷訓練效果
訓練完成后,不要直接拿最后一個檢查點用。要測試不同步數的檢查點,找到最佳的那一個。
方法是用同樣的提示詞和參數,分別用不同檢查點的LoRA生成圖,對比效果。
欠訓練:觸發詞加上去和沒加一樣,風格/角色特征不明顯。說明步數不夠或學習率太低,需要增加步數。
過擬合:畫面出現訓練圖里的具體內容(比如背景、姿勢),而不是學到風格或角色特征。AI在"背誦"訓練圖而不是"理解"風格。說明步數太多或Rank太高,需要減少步數或降低Rank。
剛剛好:觸發詞加上去風格/角色特征明顯,去掉觸發詞就恢復正常。不同提示詞下角色保持一致但場景可以變化。這就是理想狀態。
通常中間的檢查點效果最好,比如總共2000步訓練,800~1200步的檢查點往往比2000步的好。
怎么使用訓練好的LoRA
使用LoRA很簡單,兩步就行。
第一步:把訓練好的.safetensors文件放到模型的Lora文件夾里。
第二步:在WebUI的Lora面板里選中它,或者在提示詞里用格式
調用。
權重默認1.0,可以調整:
權重0.4~0.6:風格/角色特征比較淡,適合和其他LoRA疊加使用。
權重0.7~0.9:特征明顯但不會蓋過畫面內容,最常用的范圍。
權重1.0~1.2:特征非常強,可能影響畫面質量,出現過擬合感。
權重1.3以上:通常不建議,畫面容易崩。
多LoRA疊加是LoRA的強大用法。你可以同時加載風格LoRA+角色LoRA+材質LoRA,生成"用你的品牌風格畫你的品牌角色穿特定材質衣服"的圖。每個LoRA權重建議0.5~0.7,避免互相打架。
實戰案例:葡萄酒品牌專屬插畫LoRA
假設你想給葡萄酒品牌做一套統一風格的插畫,每次出圖都自動帶上品牌調性。訓練一個品牌風格LoRA是最優解。
案例背景
澳格菲爾品牌插畫風格LoRA
目標
讓AI生成任何主題的圖都自動帶有品牌統一的插畫風格(暖色調、柔和筆觸、優雅質感)
訓練數據
25張品牌過往插畫作品,全部裁剪為768x768,清除了Logo和水印,風格統一
觸發詞
augeferly_style(獨特詞,不和任何現有詞沖突)
標簽策略
只描述畫面內容(wine bottle, grapes, wooden table, warm light),不描述風格。風格由LoRA學習。
訓練參數
基礎模型SD1.5,Rank 32,Alpha 16,Batch Size 2,學習率1e-4(cosine+warmup 10%),分辨率512x512,總步數2000步,每500步保存一個檢查點
效果測試
用同一提示詞分別測試500/1000/1500/2000步的檢查點。1000步效果最佳:觸發詞加上后品牌風格明顯,去掉后恢復正常,不同主題的畫面風格一致
使用方式
提示詞里加上
,權重0.8在風格明顯和畫面質量之間取得平衡。日常出圖直接用,不需要每次描述風格。
結果
訓練后所有AI出圖自動統一品牌風格,不再需要每次寫長串風格描述詞。團隊任何人都能用這個LoRA出風格一致的圖,效率提升70%以上。
這個案例的關鍵是標簽不寫風格。如果你在標簽里寫了"warm colors, soft brushstrokes, elegant",AI會把這些當成畫面內容來學,而不是當成風格。結果就是LoRA只能生成帶暖色調的特定畫面,換了主題就不管用了。標簽只寫內容,風格才能被LoRA"抽象"出來,泛化到任何主題。
![]()
同一提示詞,無LoRA vs 加載品牌LoRA:風格立刻統一
五個訓練必踩的坑
1. 訓練圖風格不統一— 風格LoRA混入了不同風格的圖,AI學出來四不像。訓練前一定要人工篩一遍,把風格不一致的圖剔除。寧可少幾張圖,不要混風格。
2. 觸發詞用常見詞— 觸發詞用"girl""style"這種常見詞,和模型已有概念沖突,加載LoRA后不管觸發詞寫沒寫效果都一樣。觸發詞一定要用生造的獨特組合詞。
3. 標簽描述了風格— 標簽里寫"warm tone, watercolor style",AI把這些當畫面內容學了,不是當風格學。標簽只描述內容(有什么),不描述風格(怎么畫的),風格交給LoRA。
4. 訓練步數太多— 覺得訓練越久效果越好,跑到8000步結果過擬合嚴重,生成的圖像是直接從訓練圖里抄的。1500~3000步通常就夠了,一定要測中間檢查點。
5. 訓練模型和使用模型不一致— 訓練時用SD1.5,使用時加載到SDXL上,效果會大打折扣甚至完全失效。訓練用的基礎模型和實際使用的大模型必須一致。
LoRA速查卡片
風格LoRA
15~30張統一風格圖,Rank 32,觸發詞用獨特詞,標簽只寫內容不寫風格
角色LoRA
20~50張多角度圖,Rank 64~128,覆蓋正面側面全身半身不同表情
訓練步數
1500~3000步,每500步存檢查點,測中間步數找最佳點,別只用最后一個
使用權重
單LoRA用0.7~0.9,多LoRA疊加每個0.5~0.7,超過1.2容易崩
LoRA的核心就一句話
不是從頭訓練一個新模型,是給大模型貼一張風格便簽
數據質量決定上限,參數調優決定下限
標簽只寫內容不寫風格,觸發詞一定用獨特詞
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.