給他一張白紙,一盒彩色鉛筆工具,然后走開。模型需要自己決定怎么選顏色、筆尖粗細和下筆力度,一筆一筆畫出痕跡,再用涂污模糊、橡皮擦除,反復調用 view_canvas 察看成稿,判斷哪里要改。這是博客作者搭建的繪畫競技場,用來觀察四個前沿視覺模型——GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash——在完全相同的約束下,是照圖臨摹,還是按文字描述自由發揮。
28 幅作品就這樣產生了:臨摹目標是蒙娜麗莎和梵高的《星夜》,用結構相似度(SSIM)客觀評分;另五個開放提示則只給一句描述,沒有參照圖,沒有分數。但作者很快給討論定了調子:這不是模型能力的客觀測試,而是一場刻意設計成開放、模糊的動手任務。上一次他們讓模型做音樂視頻,就有人把這理解為推崇模型的創造力。這一次他們再次強調,跑這些實驗,是想看看模型在工具使用、策略路徑上會走出怎樣截然不同的步子。
![]()
工具記錄把這差異放大了。GPT-5.6 Sol 從未單獨調用 set_color、set_brush 或 set_pressure 這三個設置指令,而是把顏色、筆寬、力度直接寫在每次 draw 調用里,所以它的調用幾乎都是 draw、smudge 和 view_canvas。Grok 4.5 完全相反:在它的 1349 次工具調用里,有 65% 是在做顏色、筆刷和壓力的單獨設置,這直接導致它平均每幅畫要跑 99 步。Claude Fable 5 則在 smudge 上花了大力氣,整整調用了 123 次,頻繁涂抹來尋求過渡。雖然 Gemini 3.6 Flash 的調用模式原文沒有展開,但同一套工具呈現四種完全不同的調用策略,已經把每個模型的解題性格攤在了紙上。
![]()
臨摹任務有客觀分數打底,但作者依然沒有給出具體數字,只列在圖表里。五個開放式提示則像一個小型畫展:老年漁夫在午后暖光里布滿皺紋的臉,夕陽下從橙到紫的寧靜海面,倫勃朗式布光里紅玫瑰與深色背景的強烈對比,蜷在午后窗臺上瞇覺的虎斑貓,還有木屋壁爐里跳動的琥珀色暖光。每個模型在相同的文字前面,交出了屬于自己的筆觸軌跡。
![]()
這場實驗最終沒有捧出“最能畫”的模型。它更像一次對工具理性邊界的好奇觀察:當系統不再替模型決定下筆順序和參數偏好,而只提供一個設置筆工具的沙盒時,模型的“問題解決風格”就變得比畫作本身更有信息量。作者順手把整個測試框架開源在 github.com/hershalb/canvas-arena,任何人都可以指向自己的目標圖或提示詞,親眼看它們怎么一筆接一筆地“畫”。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.