Gemini總算上新了。
沒有發布會,官方發了條播客,三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber就這么直接掛上去了……
說實話,我都快忘記自己上次認真打開Gemini是什么時候了。
這倒不是說Gemini完全不能用,你要知道,我可是去年才整了一整年的Gemini Pro訂閱,當時Gemini 3.1 Pro和Nano Banana2那叫一個意氣風發,即便放到今天依然是中上水平的大語言模型和圖片生成模型。
問題是最近幾個月,外面的模型更新得實在太快。
![]()
(圖源:Gemini)
Kimi K3沖進旗艦模型第一梯隊;DeepSeek V4正式版預計本月上線;Anthropic接連推出Fable 5和Sonnet 5;OpenAI更是剛把GPT-5.6端上來;只有谷歌這邊卻還在循環播放同一句話:Gemini3.5 Pro快來了。
5月說下個月發布,6月沒來,7月還是沒來,Gemini到頭來只有Flash更新了,這多少讓人有些失望。
Gemini三模齊發:更快,更便宜
言歸正傳,咱們來說說Gemini家族的新模型。
只看發布頁和跑分,Gemini 3.6 Flash的賣點被官方概括成一句話:更快、更便宜、更聰明。
為啥?因為基礎參數就沒啥亮點能說的。
谷歌依然沒有公開參數量,3.6 Flash整套架構、訓練數據和硬件信息基本沿用前代,輸入上下文還是104.8token,默認思考等級也是中等,支持文本、圖片、音頻、視頻和PDF。
好消息是,谷歌更新知識庫了,從原有的2025年1月推進到了2026年3月,現在不用聯網也能獲得很多新鮮知識。
![]()
(圖源:谷歌)
至于具體賣點嘛,按照官方博客的說明,第三方基準測試機構Artificial Analysis Index的實測顯示,該模型輸出token使用量較前代降低了17%,在DeepSWE這類代碼測試場景上甚至能減少了65%。
![]()
(圖源:谷歌)
不僅如此,該模型完成多步工作流程所需的推理步驟和工具調用也更少,在OSWorld-Verified計算機使用測試中,3.6 Flash比3.5 Flash少用55.8%的token,推理步驟更少之余,得到的結果也更好。
![]()
(圖源:谷歌)
眾所周知,在大語言模型的設計中,輸出token的數量直接關聯到延遲和費用。
更短的思考鏈,更低的token消耗,帶來了更快的響應速度。根據Artificial Analysis的任務時間測試,Gemini 3.6 Flash每項任務平均耗時約1.3分鐘,相比上一代3.5 Flash約2.7分鐘,減少了整整一半。
![]()
(圖源:谷歌)
不過在成績上,這倆卻是50對50,完全沒有提升可言。
只能說,雖然它沒有更聰明,但是確實做到了能用更少的token、更短的時間完成同樣水平的工作。
至于價格嘛...Gemini 3.6 Flash定價為每百萬輸入1.50美元,每百萬輸出7.50美元。相較于3.5 Flash每百萬輸出token9美元的價格,單次任務的總成本肯定是有所降低的,但依然比國產模型貴得多。
![]()
(圖源:雷科技自制)
至于什么產品落地,客戶追捧,那都屬于互吹,建議大伙別當真了。
再來看看Gemini 3.5 Flash-Lite。
顧名思義,Flash-Lite是Flash系列中更輕量的版本,相比Flash,它犧牲了一部分能力上限,換取了更低的成本和更快的速度。
每百萬輸入0.3美元、每百萬輸出2.5美元,速度更是最高能達到前代的三倍。
![]()
(圖源:谷歌)
不過能力就很弱了,雖然官方介紹各方面性能都有提升,例如代碼和agent基準的 Terminal-Bench 2.1,從31%干到54%,但是橫向對比起來,屬于是遠不如已經預覽了兩個月的DeepSeek v4 Flash,而且輸出價格高了接近10倍。
就...很難想象為什么會有人專門去用它好吧。
至于最后一款模型,Gemini 3.5 Flash Cyber,是專門用來發現和修補網絡安全漏洞的,不會公開提供,僅通過CodeMender平臺向政府和可信合作伙伴開放,和咱們就沒什么關系,所以直接按下不表。
新模實測:小有提升,未達預期
老樣子,咱們過了一遍參數,接下來就該給大伙整點實測了。
目前Gemini 3.6 Flash已經正式上線Gemini網頁版和客戶端,不過由于個人的使用習慣,我這邊還是用AI Studio和Antigravity做測試,畢竟這倆參數比較好調,而且也能直接切換模型進行對比。
我給3.6 Flash和3.5 Flash安排了邏輯、計算和網頁制作幾輪同題測試。兩邊都使用默認的中等思考,不額外進行任何提醒,主打一個讓它釋放天性。
先看邏輯題,我給了一個帶多重條件的座位排列題,故意塞了兩條很容易混淆的限制,要求它們確定五個人從1號到5號的唯一座位順序。
![]()
(圖源:雷科技)
Gemini 3.6 Flash回答得挺快,沒有上來先復述題目,再用幾百字告訴我“這是一個典型的約束滿足問題”,而且直接列條件、逐步排除,最后給出答案,過程和結論也全部正確,最終消耗了2338tokens。
盡管Gemini 3.5 Flash也能完成啦,但是速度慢了約1/3,而且消耗了3707tokens。
![]()
(圖源:雷科技)
這樣看來,Gemini 3.6 Flash的速度更快應該不是token本身算得更快,主要還是靠思考鏈的優化來實現的。
整個問題的思考鏈就下面四段話,簡單明了。
![]()
(圖源:雷科技)
作為反面例子,我也拿這題問了一下DeepSeek v4 Flash,那叫一個停不下來,模型在那里反復窮舉檢查各種可能性,算出來之后,還要回頭重新算一遍的,最終用了76秒才做完。
只能說,還好最后是算對了。
![]()
(圖源:雷科技)
算數環節,我沒拿什么競賽題欺負模型,而是出了一個更貼近日常的問題,“滿減、折扣、稅費、優惠券不能疊加,最后四個人怎么AA”。
這次Gemini 3.6 Flash只用9.4s就思考出了答案,共消耗3505tokens,答案正確。
![]()
(圖源:雷科技)
作為對比,Gemini 3.5 Flash用了12.4s思考答案,共消耗4081tokens,答案正確;DeepSeek v4 Flash則耗時113s,深度思考國產滑三次滾輪都看不完,理論上消耗的tokens差不多也是10倍。
我說思考優化是對的,你們聾了嗎?
不過DeepSeek v4 Flash的輸出價格只有Gemini 3.6 Flash的1/30,所以還是國產更省錢,同價格的API你甚至都能用上GPT-5.6 Luna了...
接下來,我準備不給設計稿,讓它直接寫一個能看的前端頁面。
直接打開Google Canvas,選擇Gemini 3.6 Flash,要求它制作一個“雷科技AI模型評測中心”網站,具體需求如下,主要是想看在沒有明確設計參考的情況下,它到底能做出什么效果。
頁面約一分鐘生成完成,生成過程中,Canvas會實時顯示當前階段,例如定義樣式變量、渲染指標卡等,而不是讓用戶一直面對空白等待。
![]()
(圖源:雷科技)
你別說,這玩意的完成度還真不差,雖然這種設計模板我們在AI生成的網頁里見得多了,但是Gemini 3.6 Flash做到了主標題、指標卡和按鈕層級清楚;配色統一;首屏留白和視覺重心處理得比較成熟。
主題雖然不夠Frutiger Aero,但也卻是做到了三套設計的切換。
![]()
(圖源:雷科技)
此外,各項測試內容都很完整,雷達圖和指標卡能夠正常渲染,確實挑不出什么大問題。
作為對比,這是目前GPT 5.5極速做出來的效果,差不多也是1分鐘。
![]()
(圖源:雷科技)
這是DeepSeek v4 Flash的效果,大部分功能都缺失了,用了3分鐘左右。
![]()
(圖源:雷科技)
然后,這是價格接近的GPT 5.6 Luna做出來的效果,前后用了10分鐘,整體觀感確實更豐富一些,但是很難說和Gemini 3.6 Flash做的網頁有什么代差。
![]()
(圖源:雷科技)
只能說,如果你和我一樣對HTML一竅不通,用它做個可交互的網頁原型,那完成度足夠高;但是要上線的話,肯定還是需要設計師和前端工程師去對數據真實性、可訪問性、移動端細節和交互狀態進行一系列優化的。
這是我偷X上面的提示詞做的行星發動機交互網頁,全程不到兩分鐘,感興趣的可以體驗一下:https://share.gemini.google/NN5vQ7Vdw4ba。
![]()
(圖源:雷科技)
當然,Gemini 3.6 Flash也不能說是全面提升,從推特網友們的反饋來看,這玩意的建模和編程能力都挺拉跨的。
![]()
(圖源:雷科技)
博主表示,輸出的界面代碼邏輯錯亂,組件嵌套混亂,交互邏輯斷裂,完全無法投入實際使用。
至于用它生成的FPS游戲,看起來根本沒法玩,玩家手上沒有生成武器,無法正常調整任務視覺,而且還出現了很多Gemini 3.5 Flash都不會出現的建模錯誤,不過這玩意倒是用兩分鐘就做好了。
![]()
(圖源:雷科技)
嗯...只能說術業有專攻吧,不可能啥都做得又快又好的。
AI掉隊,谷歌正在拼命趕作業了
在我看來,谷歌當然談不上要涼。
目前Gemini應用月活已經超過7.5億,Alphabet年收入超過4000億美元,搜索、安卓、Chrome、YouTube,整套谷歌生態全握在自己手里。當別家還在想辦法搶入口,谷歌已經掌握了西方互聯網的大部分入口。
但在模型這條線上,它現在表現得確實有點菜。
在Gemini 3.6 Flash的發布公告中,谷歌明確提到,Gemini 3.5 Pro還沒有完全準備好,而Gemini 4已開始“目前最雄心勃勃的預訓練”,他們對目前取得的進展感到非常振奮。
![]()
(圖源:雷科技)
步子這么大,谷歌倒是不怕扯著蛋。
與此同時,國產模型正在從兩頭包抄。DeepSeek V4 Flash支持百萬上下文,API輸出價格低至每百萬Token 2元;Kimi K3則在Artificial Analysis基準測試上拿到57分,輕松超過Gemini 3.6 Flash的50分,僅次于Claude Fable 5和GPT-5.6 sol。
論便宜,Gemini怎么都便宜不過DeepSeek V4;論性能,Claude和ChatGPT都不說了,Gemini現在連Kimi都打不過了。
別人既在抬高模型能力上限,也在完善代碼、Agent和辦公產品,谷歌這邊卻忙著給Flash削減Token、提高速度,可以說他們的產品節奏已經開始跟不上模型行業的更新速度了。
要問谷歌還能在AGI競賽中有一席之地嗎?或許只有Gemini 4還剩一絲希望了。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.