![]()
新智元報道
![]()
AI第一次拿起彩鉛畫蒙娜麗莎,但發生了一件奇怪的事:
沒有任何一個模型的最終作品,贏過它自己中途最好那版:它們總在最好的時候改過了頭。
而且,同樣是7幅畫,成本相差了20倍!
![]()
最左為原作,其余四幅依次出自GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash,全部一筆一筆畫成。
AI工具平臺TryAI搭了一個「繪畫競技場」,只給模型一張純白畫布、一套彩鉛工具,然后走開。
GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash四個視覺模型下場,臨摹蒙娜麗莎和梵高的星月夜,再加五道開放式文字命題,一共交出28幅畫。
這不是文生圖。整場實驗里沒有一張圖片是「生成」出來的,每一筆的顏色、粗細、力度都由模型自己決定,一筆一筆疊上去。
7月21日,TryAI把這場實驗的全部記錄放了出來,同時也強調,這并非官方benchmark,排名不是重點。
他們真正想測的不是模型的畫技,而是它作為一個AI智能體,在沒人盯著的幾分鐘里怎么規劃、怎么調工具、怎么評估自己干出來的活。
10件工具
沒有一件替它做決定
模型手里的工具一共十件。
plan,一張不落筆的草稿紙,專門用來想事情;
view_target,再看一眼原作;
view_canvas,把當前畫布渲染出來給自己看:這一步也正是系統給它打分的時刻;
set_color、set_brush、set_pressure,管顏色、筆尖寬度和下筆力度。力度從0到1,壓得輕就是淡淡一層;
draw,一次批量落下若干筆;
smudge,像用擦筆一樣把一塊區域揉開;
erase和clear_canvas,擦掉一塊,或者整張推倒重來。
其中view_canvas是整場實驗的樞紐,模型不是閉著眼睛畫完就交卷,它隨時可以睜眼看一次,再決定下一筆往哪落。
最要命的一條規則是:沒有填充色塊。
想要一片深藍的夜空,只能一層一層疊上去,跟真彩鉛一模一樣。
打分用的是SSIM(結構相似性),把畫布和原作都縮到256×256再比對,取值0到1,越高越接近。
默認情況下這個分數不會告訴模型,它只能靠自己那雙「眼睛」判斷畫成了什么樣。
四個模型的推理強度統一設成high。整套框架以MIT協議開源在GitHub上,換任何一張目標圖、任何一句提示詞,都能自己再跑一遍。
于是先畫哪里、什么時候回頭看、要不要推倒重來,全都得它自己拿主意。
任務分兩類。
臨摹蒙娜麗莎和梵高的星月夜,有客觀分數;
另外5個純文字提示:老漁夫飽經風霜的臉、橙紫色的海上日落、倫勃朗光下的一支紅玫瑰、窗臺上蜷著睡覺的虎斑貓、壁爐燃著的小木屋內景。
這5幅沒有目標圖可以對照,SSIM算不出來,好不好看只能靠人眼判斷。
TryAI也順手試過幾個開源權重模型,結果是連畫都畫不出來。好幾個直接交回了一張白紙。
每個模型7幅,一共28幅。
![]()
「倫勃朗光下的一支紅玫瑰」,四模型交卷。TryAI把Sol這幅列為全場最喜歡的作品之一。
20倍差價
買不到更好的畫
7幅畫跑完,賬單差異很大。
GPT-5.6 Sol:總成本7.74美元,平均6.2分鐘,29步。
Claude Fable 5:總成本160.58美元,平均12.5分鐘,54步。
Grok 4.5:總成本9.21美元,平均4.8分鐘,99步。
Gemini 3.6 Flash:總成本12.87美元,平均6.9分鐘,73步。
同樣7幅畫,Fable 5的賬單差不多是Sol的20倍!
![]()
7幅畫的估算token成本。Fable 5為160.58美元,Sol為7.74美元,差約20倍。
這20倍買到的不是畫質,而是更多的步子、更長的時間和更頻繁的自我檢查:Fable 5平均每幅畫要停下來看自己15.6次,Sol只看6次。
這里還藏著一件反直覺的事:花錢最多的,不是token用得最多的。
Grok 4.5一口氣吞掉3400萬token,全場之最,但其中約98%是緩存讀取,按遠低于常規輸入的價格計費,加上它本身單價最低,最后總賬只有9.21美元。
![]()
總token消耗:Grok 4.5達3400萬居首,賬單卻只有9.21美元,約98%為緩存讀取。
真正在Hacker News上被反復提起的,是Sol和Fable那筆賬。有人把兩邊的數字放在一起對比:340萬token對1460萬,7.74美元對160.58美元。
這個人的結論是:OpenAI在推理這一塊悄悄做出了創新,這個優勢只會越拉越大。
在TryAI的主觀評價里,Sol整體表現最好。
它的星月夜和那支玫瑰是全場最受偏愛的兩幅,考慮到這是從一張白紙上一筆一筆描出來的,觀感確實驚人。
![]()
星月夜原作與四模型作品。Sol這幅被TryAI列為全場最佳之一
除了老漁夫那一幅,它在幾乎每張畫的細節上都壓過其他模型。
TryAI把Fable 5的畫質排在第二,但慢得多、貴得多,在能用的幾個里是最不劃算的選項。
但它也補了一句:Fable在此前的開放任務里贏過GPT-5.6,包括那次音樂視頻挑戰。換一個題目,結論未必還是這個。
Grok在這個任務上則相當粗糙。工具調得最勤,很少畫出能用的東西。TryAI給的評價很直接:暫時還不敢信任它可靠地理解或判斷視覺輸出。
Gemini比Grok明顯強一檔。不過它是Flash型號,拿來跟三個旗艦同場,本來就不太公平。
同一盒筆
四種畫法
四個模型拿到的是同一套工具,用出來的卻是四套完全不同的工作流。
Sol一次都沒單獨調用過設色、設筆、設壓力,全部內聯在下筆動作里。所以它的調用記錄幾乎只有三件事:畫、抹、看。
Grok正相反。
1349次工具調用里,65%花在設顏色、設筆寬、設壓力上,于是一幅畫要走99步。它把絕大部分動作花在了準備上,真正落到紙上的筆觸反而被稀釋了。
Sol七幅畫總共只調用了223次工具,其中52%是真在畫。Grok的調用量是它的六倍,落筆數只有三倍。
Fable重度依賴涂抹,光smudge就調了123次,而且不停回頭檢查。
Gemini則是最癡迷復查的那個。
近三分之一的調用是看畫布,平均每幅畫自查約23次。它和Sol一樣,從沒碰過那三個設置類工具。
沒有人教它們該怎么用這盒筆。這些「技法」都是自己長出來的。
![]()
同一套工具,四份完全不同的調用分布。Sol從未單獨調用設置類工具,Grok有65%的調用花在調筆上。
同一份工具說明書,四個模型讀出了四種手感。
而且步數最多的不是畫得最好的,自查最勤的也不是。工具調用的頻次和最終效果之間,看不出明顯的正相關。
8次臨摹
全部改過了頭
每一次view_canvas都會重新打一次分,于是整場作畫過程被記成了一條曲線。
8次臨摹,4個模型各畫兩幅,曲線呈現出兩個共同特征。
第一,很早就到頂了。
Claude Fable 5為蒙娜麗莎復查了27次,但從第五次之后,分數就基本走平。后面那22次復查,幾乎沒換來任何進展。
第二,8次臨摹,最終作品得分全部低于中途峰值。
GPT-5.6 Sol的蒙娜麗莎,峰值0.352,收尾0.325;它的星月夜落差更大,峰值0.179,交上來的是0.130。
Fable的蒙娜麗莎峰值0.289,最終0.286;星月夜峰值0.176,最終0.153。
最慘烈的是Gemini 3.6 Flash。它是全場最勤快的檢查者,平均每幅畫要看自己23次,也確實摸到了整批作品的最高分:蒙娜麗莎0.449。
然后它一路改回了0.337:落差0.112,是這批畫里跌得最深的一次。
![]()
蒙娜麗莎的相似度曲線。Gemini摸到全場最高的0.449,隨后一路滑回0.337。
TryAI給出了一句結論:更多的檢查,并沒有換來更好的收尾。
![]()
平均每幅畫的自查次數。Gemini約23次為全場最高,跌幅也最大。
這些模型全都在自己畫得最好的那一刻,又多畫了一筆。
更微妙的地方在于,模型其實是「看得見」的。
每次view_canvas,它都真的在看自己的畫,也真的在根據看到的東西下判斷。問題不在瞎改,而是它的判斷里缺了一個選項:什么都不做。
而且,工具箱里有橡皮,全場2561次調用只用掉3次。Sol用了1次,Fable用了2次,另外兩個一次都沒碰過。
這些模型的修改只有一個方向,往上疊。所以曲線一旦過了峰值,就再也回不去了。
還要說清楚一點。
這個分數衡量的是結構和像素上的接近程度,不是美感或創造力。Gemini的原始分最高,但人眼看過去,它并不是最像目標的那一張。
AI學會了下筆
下一課是停筆
過去評一個模型,看的是數學分、編程榜、知識問答,全是一問一答的活。
答對就是答對,交卷之后沒有第二次機會把它改壞。
現在模型一跑就是幾分鐘到幾小時。能力上限換了一批變量:會不會規劃,會不會看自己的結果,以及最容易被忽略的那一項,會不會收手。
這也不是畫畫獨有的毛病。
代碼智能體把本來能跑的版本越改越崩,科研智能體在一個已經成立的結論上繼續繞,自我改進系統在沒有終點的循環里空轉,撞的都是同一道題:怎么判斷那個結果「已經足夠好了」。
人類畫家靠的是一種說不清的東西:老師傅會在某一筆之后放下筆,理由往往只有一句「夠了」。這句「夠了」,恰恰是現在這套評測都沒在測的能力。
四個模型都畫出過一幅不錯的蒙娜麗莎。
只是沒有一個知道,那一筆之后該放下筆。
參考資料:
https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok
編輯:元宇
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.