今天有個重磅消息,智譜正式發布了 GLM-5.2 模型,同時也開源了。
在全球百萬用戶參與盲測的前端開發評估系統 Code Arena 上,GLM-5.2 取得目前可用模型第一的成績。
![]()
有一說一,國產模型這次真的站在了世界前列,屬于我們普通人能用得上用得起的國產之光了。
這次 GML-5.2 有兩個關鍵信息,我覺得應該重點聊聊。
第一,Coding 繼續保持國產第一、開源第一。
在 FrontierSWE、SWE-Marathon、PostTrainBench 等多個長程任務基準上,GLM-5.2 的表現介于 Claude Opus 4.8 與 GPT 5.5 之間,是排名最高的開源模型。
![]()
我在網上看到一個 AI 博主說,如果你是通過中轉服務使用 Opus,那你可能分不出有可能是 GLM-5.2 冒充的。
第二,1M token 上下文。
注意,不是標稱 1M,是真正能用的 1M。
現在市面上標稱 1M 的模型不少,但大部分到了長上下文后半段效果衰減得厲害。
GLM-5.2 通過注意力結構層面的創新,把 1M 長度下的效果衰減和推理成本同時壓了下來。
說人話,就是它在處理超長任務時不會到后面就開始犯糊涂、忘前面說過什么。
這個能力為什么重要?我換個說法你就明白了。
現在用 AI 寫代碼最大的痛點不是它寫不出來,而是任務一長它就忘了。
你讓它改一個大項目,改到第 30 步的時候它忘了第 2 步定下的規則。你不得不反復提醒它、反復把上下文喂回去,累的不是 AI,是你。
說白了,就是「能干活,但記性差」。
因此,1M 上下文解決的就是這個問題。
一個持續工作數小時的 AI 要經歷幾千次工具調用、讀寫數萬行代碼、積累大量中間狀態。
如果上下文窗口不夠長,模型就被迫不斷壓縮、丟棄、再回憶,每一次壓縮都是信息損耗,每一次遺忘都可能讓任務在第 N 步偏離第 2 步的約束。
長程任務的失敗,很多時候不是模型不夠聰明,而是它忘了。
GLM-5.2 做到的是在一次任務中完整持有整個項目的全部代碼、全部決策歷史、全部約束條件。
這個過程,就像一個不會忘事的工程師,從頭推進到尾。
這里說個案例。
之前我自己用其他模型結合 Claude Code 開發了一個小程序,當時光是 PRD 文檔就有 5000 多字,因為單個文件太大,還是拆分上傳的。
![]()
這次我換成 GLM-5.2 試了下,試圖讓它重構這個項目,還是同一份 PRD 文檔。
開啟 CC 的 Plan Mode 模式后,我先讓模型自己加載分析需求文檔并制定開發計劃,然后再進入開發階段。
過程中,我還加了一些需求,并且對一開始的信息做了修改。此時,GLM-5.2 的 1M 上下文優勢就出來了,全程無紕漏。
![]()
大概用了 25 分鐘左右,這個基于 PRD 的項目就全部開發完了,而且自己調起了本地的微信開發者工具。
我讓它統計了代碼量,總共 16000 行代碼,而且能成功預覽。
不過有一說一,我覺得 GLM-5.2 在前端頁面的設計美觀度上還有提升空間,現在屬于可用,但還不是絕對好的狀態。
![]()
如果是用來做一些大型項目的重構或者開發,這種 1M 上下文空間的體驗就會明顯好很多。
在 Terminal-Bench 2.1 上,這是一個評測 Agent 通過命令行操作一臺計算機的數據集,GLM-5.2僅比Opus 4.8低4%,相比GLM-5.1提升了17.5%。
在 MCP-Atlas 上(工具使用tool-use評測的數據集),GLM-5.2僅比Opus 4.8 低 0.8%。
![]()
此外,能做的事情也變了。
整個代碼庫扔進去做跨文件重構,一句話需求直接出完整全棧項目,大型 SaaS 級工程持續推進不跑偏。
這些場景以前只能拆成無數個小任務反復喂上下文,現在可以一次性給完、一次性干完。
我自己也測了一個場景,就是優化我之前用 Agent 開發的個人網站。
先說下,如果你們想用上 GLM-5.2,就得去搶智譜的 Coding Plan,不過這個現在很緊俏,你們可以每天去盯一盯官方放量的時間。
如果搶到了配額,就可以配置到你的 Agent 里直接開始用,我是用 Claude Code 配合 GLM-5.2 用的。
之前開發這個網站我用了幾個模型混合完成,包括 GLM-5.1、Claude Opus 4.6 和 4.8。
從前端開發質量來看,Claude 的模型確實做得更好,但是在代碼本身的開發質量上,我覺得 GLM 和 Claude 的差距并沒有那么大。
這次優化,我完全用 GLM-5.2 來完成,核心就是優化我之前覺得別扭的幾個模塊。
第一個問題就是我網站上案例墻這部分,現在的問題就是重點不突出、沒有數據、視覺不美觀。
![]()
我跟 GLM-5.2 提的需求并沒有那么明確,只是表達了一句話需求。
但是,它的分析和問題拆解卻很精準,而且還發現了代碼中存在的命名問題。
講真,它跟我說話真的是毫不客氣。
![]()
不僅找準了問題,而且還給出了方案。
![]()
不僅按照這個新方案做了重新開發,還對我原有的代碼結構做了優化,整個網站的代碼都有被它 review。
我有一個很直觀的感覺,就是一次性成功率更高,而且模型在需求理解、代碼執行、完成質量上做得都不錯。
優化后的最終效果,明顯比之前好太多。
![]()
說實話,結果超出預期。
從實際體感來看,我覺得寫出來的代碼質量和最終呈現的效果跟之前我用的 Claude 模型差異并不是很大。
還是我之前說的,現在 GLM 系列的模型在國產 coding 領域的確是做得非常好的一家。
說實話,對于我們這些每天重度使用 AI 的人來說,智譜的操作是值得點贊的。
之前大家選模型默認選海外的,Claude、GPT,能力確實強。
但穩定性呢?可用性呢?賬號說封就封,模型說停就停,上周 Anthropic 的事就是最好的例子。
現在,國產開源模型的價值正在被重新評估。
不是說它今天在所有維度上都比 Claude 好,而是它穩定、可控、不會哪天突然告訴你「因為政策原因,你不能用了」。
還有一點,現在國產 AI 都在不同程度上被限卡,如果這個環節能突破,我覺得不會比國外差。
GLM-5.2 這次的做法也值得一說,Coding Plan 全量用戶直接可用,包括免費的 Lite 版。
這種發布方式本身就是一種態度,不搞花活,你自己試,數據說話。
最后,說下我自己的判斷。
過去一年,行業衡量模型的標準正在遷移。以前比的是誰完成任務更好,誰的 benchmark 分高誰就牛。
現在比的是「能獨立干多久」,誰能持續工作、不跑偏、不忘事,誰才是真正能用的生產力工具。
上下文長度的可用性和長程任務能力,正在成為下一階段模型競爭的主線。
技術要真正普及成生產力,就一定是開放的。
所有的不開放和限制,本身其實就是對生產力進步的一種束縛。
智譜在他們官宣內容的最后提到兩句英文:
A step closer to frontier intelligence for everyone.
The future of AI is open, and it is for the people.
翻譯過來就是:
向前沿智能再近一步,為每一個人。
AI的未來是開放的,它屬于所有人。
國產模型走到這一步,值得被看見。
················· 唐韌出品 ·················
用AI思維發現下一個機會
安可時刻
如果國產模型能解決被限卡的瓶頸,那速度和質量又會上去一個臺階。
其實對于大多數任務來說,現在國產模型已經表現不錯了。從我的日常 coding 場景來看,GLM-5.2 基本也能滿足大多數需求。
國外模型是很強,但我們也要給國產模型一些時間讓他們成長。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.