7月22日凌晨,谷歌一口氣發(fā)布了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,主打更低成本、更快速度和更高效率。

其中,3.6 Flash的輸出token消耗比前代減少17%,部分工程任務(wù)中最多可減少65%;Flash-Lite每秒可生成350個token;Flash Cyber則專門用于發(fā)現(xiàn)和修復(fù)代碼漏洞。
但外界真正等的Gemini 3.5 Pro,依然沒有出現(xiàn)。 谷歌只表示,這款旗艦?zāi)P腿栽谂c合作伙伴測試。

這次更新,谷歌把"省錢省資源"當(dāng)作了最大的亮點。
在AI模型的商業(yè)應(yīng)用里,token就相當(dāng)于計費(fèi)單位,模型輸出的token越多,開發(fā)者要付的錢就越多。如果能在保持能力不降的前提下,讓模型更"精煉",對大規(guī)模運(yùn)行AI工作負(fù)載的企業(yè)來說,節(jié)省的成本相當(dāng)可觀。
新推出的Gemini 3.6 Flash被定位為絕對主力,它在設(shè)計上就瞄準(zhǔn)了"如何用更少輸出token、推理步驟和工具調(diào)用完成任務(wù)"。
谷歌官方博客引用第三方測評機(jī)構(gòu)Artificial Analysis Index的數(shù)據(jù)顯示,Gemini 3.6 Flash在輸出時消耗的token數(shù)量比上一代Gemini 3.5 Flash平均減少了17%。

在Datacurve的DeepSWE這類長周期、多步驟的工程任務(wù)基準(zhǔn)測試中,谷歌甚至觀察到了最多65% 的token節(jié)省。

價格也隨之下調(diào),每百萬輸入token為1.50美元,輸出為7.50美元。

一同發(fā)布的Gemini 3.5 Flash-Lite則將"極致性價比"推向了新高度。它是谷歌Gemini 3.5系列中最快、最省錢的模型。
根據(jù)Artificial Analysis實測,它每秒能生成350個輸出token,速度大約是上一代Gemini 3.1 Flash-Lite的兩倍。價格更是探到了每百萬輸入token 0.30美元、輸出2.50美元,僅為GPT-5.4 mini的三分之一。
谷歌顯然希望用這款模型來承接那些對延遲極其敏感、需要高吞吐量的任務(wù),比如大規(guī)模文檔處理、智能體搜索、收據(jù)翻譯和摘要這類工作。
第三款模型Gemini 3.5 Flash Cyber則走了專業(yè)路線。它基于Gemini 3.5 Flash微調(diào),專門用來發(fā)現(xiàn)和修復(fù)網(wǎng)絡(luò)安全漏洞。
在流行的網(wǎng)絡(luò)安全基準(zhǔn)測試CyberGym上,這款模型達(dá)到了與Anthropic Mythos等前沿網(wǎng)絡(luò)安全模型接近的性能水平。
據(jù)谷歌透露,在內(nèi)部測試中,該模型在名為V8 JavaScript Engine的復(fù)雜開源代碼里發(fā)現(xiàn)了55個問題,其中包括10個此前未被其他模型發(fā)現(xiàn)的漏洞。
從分發(fā)渠道來看,Gemini 3.6 Flash和Gemini 3.5 Flash-Lite自今天起就通過Google AI
Studio、Android Studio中的Gemini
API向開發(fā)者開放,Gemini 3.6 Flash也可以在Google Antigravity中使用。
企業(yè)用戶可以通過Gemini Enterprise Agent Platform獲取,普通消費(fèi)者則能在Gemini應(yīng)用里體驗這些模型,Gemini 3.5 Flash-Lite也正在谷歌搜索中逐步推出。
然而,價格牌能否真正打動開發(fā)者,還得看模型的實際表現(xiàn)。谷歌目前展示的主要競爭力集中在效率和價格上,而非能力領(lǐng)先。
科技博主 @reight_s評論說:"谷歌正在輸?shù)鬉I智能競賽,但悄無聲息地贏得了廉價競賽。"他進(jìn)一步指出,在大家等一個煮不熟的旗艦產(chǎn)品時,谷歌似乎已經(jīng)將重心轉(zhuǎn)向了降低成本的策略。

但這引發(fā)了另一個問題:如果模型本身不夠聰明,再便宜又有什么用?
02跑分里的"尷尬":贏了自己卻輸給了對手
在谷歌給出的官方基準(zhǔn)測試成績單上,Gemini 3.6 Flash相比前代模型確實有著肉眼可見的提升。
在反映計算機(jī)操作能力的OSWorld-Verified測試中,得分從78.4% 提升到了83.0%,這是所有對比模型中的最高分,甚至高于OpenAI的GPT-5.6 Luna和xAI的Grok 4.5。
在衡量機(jī)器學(xué)習(xí)研究能力的MLE Bench上,Gemini 3.6 Flash得分從49.7% 躍升至63.9%。在DeepSWE基準(zhǔn)測試中,得分從37% 提升至49%。

處理知識型工作的GDPval-AA v2中,這款模型得分也從1349提高到了1421。在SWE-Bench Pro上,它取得了58.7% 的成績,高于前代的55.1%。
在需要處理100萬token長上下文的測試中,Gemini 3.6 Flash得分達(dá)到54.0%,而前代模型連27% 都達(dá)不到。
Gemini 3.5 Flash-Lite同樣有一些亮點。谷歌的資料顯示,這款"Lite"模型在SWE-Bench Pro、OSWorld-Verified等幾項關(guān)鍵評估中甚至優(yōu)于標(biāo)準(zhǔn)版的Gemini 3
Flash。

在終端基準(zhǔn)測試Terminal-Bench 2.1上,它從3.1 Flash-Lite時代的31% 躍升至54%。在現(xiàn)實世界任務(wù)執(zhí)行測試GDPval-AA v2上,Gemini 3.5 Flash-Lite的得分也從642提升至1140。

這意味著,即使是谷歌產(chǎn)品線里最便宜的模型,在某些方面也已經(jīng)具備了過去中端模型的水平。
然而,如果我們把視線從谷歌自家的縱向?qū)Ρ纫崎_,看看橫向競爭,情況就不那么樂觀了。
科技媒體TechCrunch注意到,自2月份谷歌上次更新旗艦?zāi)P鸵詠恚琌penAI已經(jīng)發(fā)布了GPT-5.5并開始推出GPT-5.6,Anthropic則推出了Claude Opus 4.8、Claude Sonnet 5,并擴(kuò)大了其網(wǎng)絡(luò)安全前沿模型Fable 5的訪問權(quán)限。
中國公司也沒有閑著,月之暗面的Kimi K3吸引了大量需求以至于限制了新訂閱,阿里巴巴的Qwen3.8-Max-Preview也剛剛上線。
根據(jù)Artificial Analysis的綜合排名,谷歌在新模型發(fā)布前,甚至沒有一款模型能擠進(jìn)前十。
網(wǎng)友 @synthwavedd尖銳地指出,Gemini 3.6 Flash在Artificial Analysis上的綜合得分和Gemini 3.5 Flash完全相同,遠(yuǎn)遠(yuǎn)落后于Meta Muse Spark
1.1、智譜GLM-5.2、OpenAI GPT-5.6
Luna、Anthropic Claude Sonnet 5以及xAI Grok 4.5等一長串對手。

谷歌自己的測試數(shù)據(jù)非常亮眼,而第三方綜合評分卻原地踏步,這看似矛盾,其實原因并不復(fù)雜。
谷歌選擇展示的OSWorld-Verified、MLE Bench、DeepSWE等測試,恰好是Gemini 3.6 Flash重點優(yōu)化的方向,進(jìn)步自然明顯。但Artificial Analysis的綜合指數(shù)覆蓋維度更廣,包括推理能力、事實準(zhǔn)確率等多項指標(biāo),權(quán)重分配也不同。
Gemini 3.6 Flash在谷歌強(qiáng)調(diào)的幾個賽道上跑出了加速度,放到更全面的競技場上,整體排名并沒有實質(zhì)變化。
正如AI分析師 @Teksart所言,Gemini 3.6 Flash給人的感覺是"谷歌優(yōu)化了效率,而不是能力"。
"Gemini 3.6 Flash運(yùn)行成本更低,但沒有更聰明。這感覺像是Gemini 4處于預(yù)訓(xùn)練階段時的占位發(fā)布。谷歌需要提醒大家它在模型戰(zhàn)爭中依然存在。它成功了,但沒有改變排行榜。"

03實測反饋:速度快了,但輸出質(zhì)量沒有跟上
跑分之外,部分早期用戶也分享了明顯負(fù)面的上手體驗。
一位名為 @LuminaXspace的用戶詳細(xì)記錄了他用Gemini 3.6 Flash構(gòu)建3D金門大橋的失敗經(jīng)歷。

據(jù)他描述,這個過程堪稱災(zāi)難:他不得不重復(fù)提示三次,因為模型反復(fù)忽略指令。
第一次,它沒有按要求創(chuàng)建 .html文件,而是試圖在Gemini應(yīng)用內(nèi)部用模擬方式來完成任務(wù);第二次,它開始從網(wǎng)上找圖片貼到聊天里,而不是真正生成文件;直到第三次才勉強(qiáng)完成,但最終輸出質(zhì)量慘不忍睹。
更讓他沮喪的是,這個結(jié)果竟然比5個月前發(fā)布的、如今已跌出前十的Gemini 3.1 Pro還要差得多。后來他換用Antigravity平臺再次測試,結(jié)果同樣令人失望。他最后的結(jié)論是等待Gemini 3.5 Pro或Gemini 6 Pro發(fā)布再嘗試。
另一名用戶Da7em的體驗更讓人哭笑不得。他給Gemini 3.6 Flash布置了一個中等規(guī)模的任務(wù),本以為會花合理的時間來處理,結(jié)果模型兩分鐘就跑完了。
他一開始還驚嘆于這個速度,"然后我看到了結(jié)果。一個本地的4B模型都能比它做得更好。谷歌人難道沒有羞恥心嗎?"

速度快當(dāng)然好,但如果生成的內(nèi)容連本地小參數(shù)模型都比不上,那這種速度就毫無意義。
在編碼基準(zhǔn)測試方面,網(wǎng)友Ejaaz拋出了兩個讓谷歌臉上掛不住的參照物:一個是月之暗面出品的Kimi K3,另一個是智譜的GLM 5.2。這兩個模型背后實驗室的資金規(guī)模跟谷歌完全不在一個量級。
月之暗面的估值僅為300億美元,而谷歌的市值高達(dá)4.5萬億美元,兩者的差距達(dá)到150倍。 用Ejaaz的原話就是:"無限資本只買來了中規(guī)中矩的結(jié)果。"

普通開發(fā)者的吐槽還顯得有些零散,前谷歌Apps產(chǎn)品負(fù)責(zé)人、現(xiàn)任Abacus.AI聯(lián)合創(chuàng)始人兼CEO賓度·雷迪(Bindu Reddy)的評論更具分量。
她曾親歷谷歌內(nèi)部的產(chǎn)品體系建設(shè),如今以創(chuàng)業(yè)者的身份站在使用者的角度,對谷歌AI產(chǎn)品線做了一次從頭到腳的審視。
她先從開發(fā)者最常用的文本模型說起。她承認(rèn)Flash拿來聊天還行,但一旦進(jìn)入智能體循環(huán)(Agentic Loop)場景,它的表現(xiàn)就被Grok甩開了,哪怕是執(zhí)行簡單的任務(wù)也不例外。

接著她把矛頭指向了Pro系列:這款本該撐門面的旗艦早已名不副實,只是一個停留在過去的老舊模型,跟當(dāng)下前沿競品之間隔著一個代際的差距。
隨后,雷迪把話題延伸到了其他產(chǎn)品線。視頻生成工具Veo太貴,性價比不及競爭對手SeeDance;圖像模型NanoBanana Pro則被GPT的圖像生成明顯甩開。至于這次主打速度和低價的Flash Lite,她認(rèn)為延遲問題讓"低價"的優(yōu)勢打了折。
最后,雷迪總結(jié)道:"谷歌沒有針對核心工作負(fù)載的領(lǐng)先AI模型。即使是在谷歌相對拿手的聊天功能上,Grok和GPT Luna也做得相當(dāng)不錯,而且在遵循用戶指令方面還更勝一籌。"
這番評價等于將谷歌在圖像、視頻、智能體等多個維度的產(chǎn)品都判定為落后于競爭對手。
當(dāng)然,也有站在長期視角上看好谷歌的聲音。有投資者提醒市場注意一個基本事實:人們現(xiàn)在用瘋狂的倍數(shù)給Anthropic和OpenAI估值,基于的是每年200到400億美元的收入預(yù)期,而谷歌今年有望實現(xiàn)4800億美元的收入,完全不在一個數(shù)量級。定制芯片、分發(fā)網(wǎng)絡(luò)和生態(tài)系統(tǒng)構(gòu)成的護(hù)城河,讓"落后"看起來更像是暫時的。
另一種聲音則搬出"馬拉松而非短跑"的老話:現(xiàn)在最聰明的模型不等于第一個到達(dá)AGI的模型,去年Gemini也曾是頂尖,Claude曾經(jīng)排名落后,真正決定勝負(fù)的,是擁有堅實基礎(chǔ)和垂直技術(shù)棧的公司。
04失約的旗艦:Gemini
3.5 Pro去哪了?
在這場新品發(fā)布會上,最引人注目的"主角"反而不是任何一款新模型,而是一款沒出現(xiàn)的模型,Gemini 3.5 Pro。
谷歌在5月份發(fā)布Gemini
3.5 Flash時曾高調(diào)預(yù)告,更強(qiáng)的Pro版本已在內(nèi)部使用,預(yù)計6月推出。然而到了7月下旬,谷歌技術(shù)主管洛根·基爾帕特里克(Logan Kilpatrick)在X上給出模糊回應(yīng):"正在與合作伙伴測試,準(zhǔn)備就緒后立即推出"。
Business Insider在6月就曾報道,谷歌已將Gemini 3.5 Pro的目標(biāo)發(fā)布日期推遲至7月。彭博社隨后報道稱,該模型可能已被進(jìn)一步推遲,原因是難以達(dá)到內(nèi)部性能目標(biāo)。
這些報道勾勒出一個尷尬的現(xiàn)實:谷歌自己的旗艦產(chǎn)品,可能尚未達(dá)到內(nèi)部性能目標(biāo)。
在預(yù)測市場Polymarket上,交易者給出了90%的概率,認(rèn)為Gemini 3.5 Pro不會在7月發(fā)布。
網(wǎng)友 @goodworse基于已經(jīng)泄露信息的評論說:"這個模型將比Mythos還要差,而Mythos是在4個月前發(fā)布的。AI時間線進(jìn)展如此之快,以至于4個月的延遲感覺像是一年。"
他總結(jié)道,谷歌去年擁有一切成為最好的條件,但他們把一切都搞砸了。

更尖銳的評論來自知名報料人"草莓哥(X用戶 @iruletheworldmo)"。
他用一種諷刺口吻描述了當(dāng)前局面:谷歌把自己最好的計算資源都給了Anthropic,人家拿這些資源訓(xùn)練出了Fable,反手就把谷歌的Gemini 3.5 Pro碾壓了,所以谷歌只好含糊地談?wù)撘粋€"雄心勃勃"的新預(yù)訓(xùn)練計劃。

這段話雖然刻薄,但它反映的是社交媒體上一種普遍情緒,作為云服務(wù)商,谷歌在向其他AI公司提供算力,而自家模型的發(fā)布卻一再延期。
CNBC在報道中也提到了一個客觀事實:谷歌云與Anthropic簽有數(shù)十億美元的芯片交易。只是,云服務(wù)收入和內(nèi)部研發(fā)所用的GPU通常是不同的資源池,兩者之間是否存在直接競爭關(guān)系,目前并沒有公開信息能夠證實。
05有錢、有人、有數(shù)據(jù),谷歌為何還跑得這么慢?
6月18日,Gemini聯(lián)合負(fù)責(zé)人諾姆·沙澤爾(Noam
Shazeer)宣布離開谷歌加入OpenAI。第二天,DeepMind關(guān)鍵高管、2024年諾貝爾化學(xué)獎得主約翰·賈珀(John Jumper)也宣布離開,去向是Anthropic。前后腳出走的兩位核心人物,是谷歌AI部門這一年最直白的裁決。對于一家正處于追趕期的公司來說,核心人才的離開不僅是面子問題,更意味著項目的主導(dǎo)權(quán)和技術(shù)判斷力出現(xiàn)真空。
而人才只是問題的一面。另一個被反復(fù)提及的現(xiàn)象是,谷歌同時在推進(jìn)的項目實在太多了,Gemini文本模型、Omni多模態(tài)模型、Nano Banana圖像模型、Genie世界模型……每多一個項目,就多一個分流人才和算力的口子。
問題或許不在于算力夠不夠,而在于組織注意力被攤薄了。當(dāng)競爭對手把所有精力都壓在單一旗艦?zāi)P蜕蠒r,谷歌的精力卻被分散到了近十個不同的戰(zhàn)場上。這種注意力和決策速度上的分散,有時比算力不足更難彌補(bǔ)。
資本市場的耐心也在被消耗。
路透社指出,Alphabet在4月份將2026年資本支出指引提高至1800億至1900億美元,還通過股權(quán)發(fā)行籌集了約850億美元。投入如此巨大,投資者自然緊盯著回報。
Aptus Capital Advisors的投資組合經(jīng)理戴夫·瓦格納(Dave Wagner)表示,谷歌正在錯失AI編碼這個賽道的機(jī)會,這種擔(dān)憂在投資者中相當(dāng)普遍,而且日益加重。在他看來,谷歌目前的戰(zhàn)略核心是押注生態(tài)系統(tǒng)的整體優(yōu)勢,而非在單項能力上爭高下。
不過,市場對這套"生態(tài)系統(tǒng)"故事的耐心正在受到考驗。自4月下旬谷歌公布云銷售數(shù)據(jù)以來,Alphabet的股價已累計下跌約9%,同期表現(xiàn)落后于其他科技巨頭。投資者顯然不再滿足于遠(yuǎn)期愿景,他們更想看到的是模型能力上實打?qū)嵉淖汾s。
來自中國公司的競爭壓力也在加劇。不少開發(fā)者在討論中都提到同一個困惑:為什么資金只有谷歌零頭的實驗室能做出更強(qiáng)的模型?
月之暗面的Kimi K3就是一個典型例子,估值300億美元,是谷歌的1/150,編碼能力卻更勝一籌。這種反差讓谷歌的技術(shù)實力受到了前所未有的質(zhì)疑。

在這種壓力之下,一個越來越明顯的行業(yè)現(xiàn)象是,"最強(qiáng)模型"的稱號正在以周為單位輪換。
馬斯克今天在X上發(fā)過一張梗圖,精確地概括了當(dāng)下的競爭生態(tài):無論哪家發(fā)布新模型,無一例外都會打出"推出全球最強(qiáng)大模型"的標(biāo)語。

xAI發(fā)布Grok新版本,聲稱全球最強(qiáng);谷歌緊接著發(fā)布Gemini新版本,反超并宣稱全球最強(qiáng);Anthropic隨即推出Claude,登頂SOTA;OpenAI不甘落后發(fā)布新模型,再次搶回寶座。
如此循環(huán)往復(fù),霸榜周期往往只有幾個月甚至幾周。
這張圖的調(diào)侃核心在于,只要等上幾個星期,輪盤就會轉(zhuǎn)到下一個廠商發(fā)布"史上最強(qiáng)AI"。
正是在這種"輪流坐莊"的節(jié)奏里,谷歌目前的位置顯得有些尷尬。近幾個月,它始終沒有重新站上綜合能力榜單的頭部位置,上一次有競爭力的文本模型還要追溯到2025年11月的Gemini
3。
3.6 Flash主打省錢高效,可以理解為谷歌在用價格和效率換取時間,為后續(xù)旗艦?zāi)P蜖幦〈翱凇?/b> 但問題在于,當(dāng)所有對手都在用"全球最強(qiáng)"的旗號搶奪開發(fā)者注意力時,一味強(qiáng)調(diào)"便宜"能否真正守住陣地,恐怕連谷歌自己也沒有十足把握。
面對內(nèi)外交困的局面,谷歌似乎也在進(jìn)行戰(zhàn)略調(diào)整。
就在外界對Gemini 3.5 Pro議論紛紛之際,谷歌DeepMind產(chǎn)品技術(shù)主管洛根·基爾帕特里克(Logan Kilpatrick)確認(rèn),團(tuán)隊已經(jīng)啟動了"迄今為止最雄心勃勃的預(yù)訓(xùn)練工作",即下一代基礎(chǔ)模型Gemini 4。
CNBC還報道,谷歌正在開發(fā)一種專為運(yùn)行Gemini而設(shè)計的專用芯片,效率最高可提升10倍。谷歌云發(fā)言人對此回應(yīng)稱,團(tuán)隊一直在做各種創(chuàng)新嘗試來提升性能和效率,雖然不保證每個項目都能落地,但持續(xù)探索本身就是公司"全棧方法"的核心。
大模型測評專家 @kimmonismus對Gemini 4的啟動給出了一個耐人尋味的評論:想必是3.5 Pro的進(jìn)展令人失望,所以他們直接啟動了一個新的預(yù)訓(xùn)練計劃。但他也提醒,谷歌擁有全世界的數(shù)據(jù)和海量計算資源,如果到現(xiàn)在還沒領(lǐng)先,那換個"預(yù)訓(xùn)練程序"恐怕也不是關(guān)鍵。

谷歌這次證明了自己仍能把AI做得更快、更便宜。但市場等的不是又一款省錢模型。
3.6 Flash可以幫助谷歌守住陣地。
真正決定它還能不能反攻的,仍然是遲遲沒有出現(xiàn)的Gemini 3.5 Pro,以及更遠(yuǎn)處的Gemini 4。