如果你從去年就開始用 Gemini,那感覺就像看著自家兄弟慢慢得了阿爾茨海默癥。
這是最近網友對 Gemini 的一句調侃。
按理說,一家公司發新模型,通常是來打臉這種調侃的。可就在剛剛,Google 一口氣發了三個新模型之后,網友非但沒收回這句話,反而笑得更大聲了。多少有種他們都不看好你,可偏偏你最不爭氣的即視感。
![]()
三個模型分別是 3.6 Flash、3.5 Flash-Lite,還有一個專搞網絡安全的 3.5 Flash Cyber。官方博客的措辭也相當眼熟,「更高效」「更聰明」「為大規模 AI agent 而生」,一句不落。
只不過,實際體感卻冰火兩重天。
![]()
主角登場,3.6 Flash 到底強在哪
先說頭牌,3.6 Flash。官方給的定位就倆字——「主力」(workhorse),干活模型。
3.5 Flash 是今年 5 月 I/O 大會上發的,這次算是小版本迭代。
最大的賣點是省 token。
![]()
按 Artificial Analysis Index 的數據,3.6 Flash 比 3.5 Flash 少用 17% 的輸出 token,在 DeepSWE(Datacurve 出的基準)這類場景上甚至能省到 65%。官方還說它跑多步任務時,推理步數和工具調用都更少。 也就是說,干同樣的活,廢話更少,繞路更少,賬單更薄。
![]()
價格也確實降了。輸入 1.5 美元/百萬 token,輸出 7.5 美元/百萬 token——注意,上一代 3.5 Flash 的輸出是 9 美元,這波直接砍到 7.5。又快又省,單個 agent 任務的成本就壓下來了。
![]()
基準測試上,官方擺出了一整排數據。
代碼能力是重點。DeepSWE 從 37% 提升到 49%,官方的說法是多余的代碼改動更少、執行循環也更短,生成的代碼更貼近生產環境的要求。機器學習研究方向的 MLE Bench 提升更明顯,從 49.7% 拉到了 63.9%。
![]()
計算機操作(computer use)能力也有長進,OSWorld-Verified 從 78.4% 升到 83%。并且,「計算機操作」(computer use)也成了Gemini API 和企業版的內置工具,主打一個開箱即用。
知識工作方面,GDPval-AA v2 從 1349 漲到 1421。Hebbia、Harvey 等客戶反饋,它在文檔解析、圖表數據分析、報告起草這類多模態任務上表現尤其突出。Figma、JetBrains 也都出面背書了一番。
哦對了,還有個不起眼但挺實在的更新:知識截止日期終于從 2025 年 1 月推進到了 2026 年 3 月。老黃歷總算翻篇了。
![]()
安全這塊,官方說 3.6 Flash 上了升級版的 Frontier Safety 防護,重點盯著 CBRN(化學、生物、放射性、核)和網絡攻擊這兩類濫用,抗越獄能力更強了,同時又盡量不誤傷正常需求、少亂拒絕。
·以小博大,便宜大碗的 3.5 Flash-Lite 也能更換推理檔位了
第二個是 3.5 Flash-Lite,定位比 3.6 Flash 還低一檔,主打「快」和「便宜」,專治高吞吐、低延遲的任務,比如 agent 搜索、文檔處理。
它是 3.5 系列里最快的,按 Artificial Analysis 的測量是每秒吐 350 個 token。價格更是白菜——輸入 0.3 美元、輸出 2.5 美元每百萬 token。官方說質量比 3 月發的 3.1 Flash-Lite 好一大截。
有個設計挺靈活:它支持調「推理檔位」。低配活兒就開最低檔,圖個快和省;碰上要多步拆解的子任務,就把思考檔位往上撥。電腦操作這次也做成了內置工具。
跟前代比,提升相當明顯:代碼和 agent 任務的 Terminal-Bench 2.1,從 31% 干到 54%;長上下文的 GDM-MRCR v2,從 60.1% 提到 72.2%;真實任務執行的 GDPval-AA v2,更是從 642 飆到 1140。
![]()
最有意思的是,這個「小弟」在不少 agent 和代碼任務上,居然反超了輩分更高的 3 Flash。
比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,屬實有點東西——等于說跑 3 Flash 的活兒,現在有了個更快更強的平替。
![]()
官方還舉了幾個用法:從海量電商數據里抽產品特征、給 3.6 Flash 當副手一口氣生成 25 個網頁設計方案、批量翻譯總結收據、邊玩邊迭代做小游戲。Ashler、Palo Alto Networks、Ramp 這幾家客戶也來夸了它「速度、智能、成本三合一」。
最后一個 3.5 Flash Cyber,畫風突變,專門用來找和修代碼里的安全漏洞。
Google 的邏輯挺有意思:現在 AI 找漏洞的速度,已經比現有系統修漏洞的速度快了。既然漏洞越堆越多,那干脆用便宜高效的 Flash 來批量補鍋。
這個模型是在 3.5 Flash 基礎上微調出來的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好幾個 Flash Cyber agent,協同工作、最后匯總成一份報告。
![]()
在業內有名的 CyberGym 基準上,官方稱它摸到了第一梯隊的水平,還比更大的模型更省 token。
不過這模型我們暫時也用不上。
考慮到「找漏洞」這種能力是把雙刃劍,濃眉大眼的 Google 也學 Anthropic 玩起了安全敘事。把它鎖得死死的——只對「可信合作伙伴」限量開放,走內測。目的是給一線防守方爭取時間,趕在漏洞被人利用前先修掉,同時防著有人拿它去干壞事。
說好的 3.5 Pro 呢?如來
看到這兒你可能會問:發了一堆 Flash,那真正的旗艦 3.5 Pro 去哪了?
官方口徑是「正在和合作伙伴測試,準備好就上」。但這套說辭背后的故事,可能沒那么體面。
![]()
據彭博社等媒體報道,3.5 Pro 的代碼生成能力一直沒達到內部預期。Google 6 月下旬還專門更新了一版訓練數據來補代碼這塊短板,結果成績依舊沒起色。更有傳聞說,Google 干脆推翻了原來的訓練方案,從零開始重訓。
而 Google AI 宣傳委員 Logan Kilpatrick 更是索性在輿論上直接跳過 3.5 Pro,將預告的重點放在了Gemini 4,聲稱他們已經啟動了史上最雄心勃勃的 Gemini 4 預訓練,還放話說進展讓人興奮。
![]()
聽著雖然挺提振人心,但把它放在「旗艦跳票」的背景下看,多少有點轉移視線、畫餅續命的味道了。
除了這些內幕,光看今天剛剛發布的 Flash 模型本身,網友們也并不全然買賬。
第三方評測機構 Artificial Analysis 表示:兩個新模型確實把單任務耗時砍半、token 效率也提升了,Flash-Lite 的智能指數漲了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。
價格沒有便宜到足以忽略能力差距,能力也沒有高到能夠解釋它的成本。
![]()
X 網友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一樣的分,還不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 這一票對手,直呼簡直爛透了(陰陽怪氣 doge)。
![]()
吐槽的還不止一個。
網友 Angel 則直接從性價比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 還高,可智能程度反而更低。又貴又笨,這組合屬實有點尷尬——畢竟 Flash 系列立身的根本就是「性價比」,結果被人當場指出性價比不如對手,等于自砸招牌。
![]()
作為對比,OpenAI 的 Tibo 剛剛也發話了:由于周活躍用戶達到 1000 萬,新的一天,Codex 和 ChatGPT Work 的付費用戶迎來新一輪額度重置,盡情享用。
![]()
這對比,這落差,還有人記得大明湖畔的 Google Gemini 3?
實測派也來補刀。網友 Balder 更是直接開團:
這三個模型性能全比之前的 3.5 Flash 差。他甩出自己的測試吐槽,說問題包括但不限于——基礎解碼就有毛病、中文選詞經常很離譜;生成的圖片視頻質量極差、跟指令對不上還限額嚴重;經常記憶混亂、調用完全錯誤的工具。
![]()
而且他還上了個陰謀論,認為 Google 之所以這么搞,是為了把算力騰出來賣給 Anthropic,還陰陽了一句這就是皮查伊想要的「Cloud First」。
此外,X 網友 Conor Dart 用 Google 自家的 Antigravity 跑了個 AI 生成游戲的測試,結果沒有出乎意料,木頭紋理更差了,大理石看著差不多但還是不能用。他直言這又是一次翻車,表示自己還是等 Gemini 3.5/3.6 Pro 吧。
![]()
簡言之,你別問新模型強不強,你就說 Flash 不 Flash 就完事了。一邊是官方更高效、更便宜、更省 token的漂亮賬本,一邊是大多數網友的當場差評,以及模型背后的旗艦跳票、大牛出走、市值縮水等一連串糟心事。
![]()
這很難不讓人好奇是不是 Google 這次真點歪了科技樹,光顧著省成本忘了提智商,只能先靠幾個 Flash 穩住場子?
反正 Gemini 4 的預訓練都開跑了。這一把要是再翻車,那句阿爾茨海默的玩笑,可就真要成讖語了。
![]()
我們正在招募伙伴
簡歷投遞郵箱hr@ifanr.com
?? 郵件標題「姓名+崗位名稱」(請隨簡歷附上項目/作品或相關鏈接)
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.