AI已經(jīng)不再只是實(shí)驗(yàn)室內(nèi)外的技術(shù)展示。當(dāng)模型真正進(jìn)入千行百業(yè),它開(kāi)始不斷暴露真實(shí)世界中的需求,也不斷催生新的技術(shù)演進(jìn)方向。
對(duì)于開(kāi)源模型而言,真正的競(jìng)爭(zhēng)從來(lái)不是誰(shuí)最早發(fā)明一種能力,而是誰(shuí)能夠最快把已經(jīng)驗(yàn)證的前沿能力變成開(kāi)發(fā)者和企業(yè)都能夠使用的基礎(chǔ)能力。也正因如此,前沿能力在哪里,開(kāi)源模型的價(jià)值兌現(xiàn)就在哪里,開(kāi)源模型的競(jìng)爭(zhēng)就在哪里。
過(guò)去兩年,這一規(guī)律已經(jīng)發(fā)生過(guò)兩次。DeepSeek-R1讓推理能力第一次以足夠低的成本走向普及;智譜GLM-5.2讓編碼和智能體能力真正可用,能夠在多數(shù)任務(wù)中替代主流前沿閉源模型。
今天,思維機(jī)器實(shí)驗(yàn)室(Thinking Machines Lab)發(fā)布的Inkling,又是否意味著,開(kāi)源模型正在迎來(lái)第三次價(jià)值兌現(xiàn):安全、可信、可塑的AI能力,開(kāi)始成為新的產(chǎn)業(yè)化對(duì)象?
很長(zhǎng)一段時(shí)間,全球AI行業(yè)都沉浸在“DeepSeek時(shí)刻”帶來(lái)的沖擊之中。它真正改變的,并不是推理模型這一技術(shù)方向本身,而是推理能力的成本結(jié)構(gòu)。DeepSeek-V2通過(guò)架構(gòu)優(yōu)化大幅降低模型成本,隨后V3和R1進(jìn)一步證明,高性能推理模型并不一定需要傳統(tǒng)意義上的巨額投入。
通過(guò)算法創(chuàng)新、工程優(yōu)化和開(kāi)放策略,它讓推理能力第一次以足夠低的成本走向普及,也成為后來(lái)所有競(jìng)爭(zhēng)模型都不得不跨越的一條基準(zhǔn)線。每百萬(wàn)Token API價(jià)格幾乎成為token經(jīng)濟(jì)學(xué)最直觀的尺度;模型競(jìng)爭(zhēng)第一次擁有了清晰的價(jià)格錨。芯片行業(yè)也在最初的恐慌之后,重新拾起“杰文斯悖論”
,相信更低的推理成本終將帶來(lái)更大的算力需求。
但僅靠推理能力,很難支撐模型公司持續(xù)擴(kuò)大的研發(fā)與資本開(kāi)支。市場(chǎng)更愿意為能夠直接完成任務(wù)的AI持續(xù)付費(fèi)。
編碼成為這一階段最重要的突破口,而且?guī)缀跏菑?qiáng)化學(xué)習(xí)最理想的訓(xùn)練環(huán)境。它擁有明確目標(biāo)、可自動(dòng)驗(yàn)證的結(jié)果、快速反饋循環(huán),以及海量真實(shí)世界任務(wù),第一次讓模型能夠在真實(shí)生產(chǎn)環(huán)境中持續(xù)學(xué)習(xí)。Token經(jīng)濟(jì)學(xué)也隨之發(fā)生變化,衡量標(biāo)準(zhǔn)不再只是每百萬(wàn)token的價(jià)格,而是每一個(gè)token究竟創(chuàng)造了多少價(jià)值。
Anthropic正是在這一輪競(jìng)爭(zhēng)中迅速建立優(yōu)勢(shì)。Claude Code并不僅僅是一款編碼產(chǎn)品,它更像是一個(gè)持續(xù)學(xué)習(xí)系統(tǒng):模型不斷進(jìn)入真實(shí)的軟件開(kāi)發(fā)流程,在企業(yè)環(huán)境中獲得反饋,再反哺模型能力本身。它也因此“吞食”著整個(gè)軟件世界的價(jià)值。甚至公司開(kāi)始具備盈利能力,也為持續(xù)投入研發(fā)和基礎(chǔ)設(shè)施提供了更充足的現(xiàn)金流。
今年4月,Mythos預(yù)覽版橫空出世,打破了此前前沿模型能力漸進(jìn)提升的節(jié)奏,證明模型性能仍然能夠繼續(xù)摸高。前美國(guó)艾倫人工智能研究所研究員Nathan Lambert據(jù)此判斷,隨著真實(shí)世界反饋不斷積累,開(kāi)源模型與閉源模型之間的能力差距或?qū)⒅匦吕蟆?/p>
然而,這一判斷很快便遭遇了來(lái)自中國(guó)開(kāi)源模型的挑戰(zhàn)。6月,智譜發(fā)布GLM-5.2。這款專門(mén)面向長(zhǎng)程任務(wù)智能體開(kāi)發(fā)的模型,在多項(xiàng)智能體任務(wù)上達(dá)到Claude Opus 4.7至4.8之間的水平,價(jià)格卻僅為后者的約五分之一,也意味著中國(guó)開(kāi)源模型開(kāi)始進(jìn)入真正的“好用時(shí)刻”。而且,智譜創(chuàng)始人兼首席科學(xué)家唐杰在與馬斯克的社交媒體上的交鋒中,稱將在年底前實(shí)現(xiàn)模型的下一次迭代,達(dá)到Mythos的水平。
有意思的是DeepSeek兩次開(kāi)啟融資的時(shí)間窗口。它的第一次外部融資開(kāi)啟于Myhos發(fā)布后,籌資約70億美元,投后估值520億美元;第二輪融資開(kāi)啟于智譜GLM-5.2發(fā)布后,媒體報(bào)道這次的目標(biāo)投后估值約740億美元。而且,市場(chǎng)還傳出了DeepSeek謀求明年上市的計(jì)劃;而就在兩個(gè)月前,這一切還沒(méi)有時(shí)間表。
這未必意味著兩者存在直接因果關(guān)系,但至少說(shuō)明,DeepSeek也開(kāi)始意識(shí)到,下一階段的競(jìng)爭(zhēng),已經(jīng)無(wú)法僅靠實(shí)驗(yàn)室完成,需要圍繞企業(yè)、智能體和真實(shí)反饋構(gòu)建完整能力體系。DeepSeek遭遇了自己的“DeepSeek時(shí)刻”。
模型的前沿能力仍在擴(kuò)展,企業(yè)真實(shí)環(huán)境復(fù)雜多變,開(kāi)源模型將AI能力更廣泛地?cái)U(kuò)散出去的競(jìng)爭(zhēng),仍在變得更為激烈。到了這個(gè)夏天,在經(jīng)歷了一輪又一輪“堆Token”之后,越來(lái)越多企業(yè)開(kāi)始重新計(jì)算智能體的經(jīng)濟(jì)賬。企業(yè)真正關(guān)心的是真正完成一項(xiàng)工作,究竟要花多少錢(qián)。
一方面,雖然最智能的模型,在解決復(fù)雜問(wèn)題時(shí)依然具有不可替代的優(yōu)勢(shì),但它們也意味著最高的成本;與此同時(shí),中等能力模型在大量標(biāo)準(zhǔn)化任務(wù)中已經(jīng)足夠好用,而且價(jià)格往往只有前者的一小部分。真正的問(wèn)題是如何讓不同模型在同一套系統(tǒng)中各司其職。
另一方面,今年以來(lái),越來(lái)越多企業(yè)開(kāi)始探索利用Harness構(gòu)建長(zhǎng)程智能體。模型被放入一個(gè)包含規(guī)劃、執(zhí)行、驗(yàn)證、返工和重新生成的完整工作流中,以提升復(fù)雜任務(wù)的完成率與穩(wěn)定性。某種程度上,這也讓harness逐步實(shí)現(xiàn)了對(duì)模型“解耦”。
大模型+harness,單位任務(wù)性價(jià)比對(duì)比
![]()
(GLM5.2模型+Pi框架的性價(jià)比,要優(yōu)于Opus4.8模型+Claude Code原生框架)
未來(lái)真正有價(jià)值的模型,并不一定需要在每一項(xiàng)基準(zhǔn)測(cè)試中都排名第一,卻必須能夠適應(yīng)不同任務(wù)、接受組織微調(diào)、理解復(fù)雜上下文,知道何時(shí)調(diào)用工具、何時(shí)承認(rèn)自身的不確定性,并在長(zhǎng)期運(yùn)行中保持穩(wěn)定、安全和可治理。
Token經(jīng)濟(jì)學(xué)也因此進(jìn)入新的階段。企業(yè)尋找的不再只是更便宜的token,或者更有價(jià)值的token,而是在既定成本下獲得更高任務(wù)完成率的帕累托最優(yōu)解。
模型競(jìng)爭(zhēng)也因此發(fā)生變化。前沿模型已經(jīng)做了初步驗(yàn)證。Claude Opus 4.8“最顯著的改進(jìn)之一是其誠(chéng)實(shí)性”。當(dāng)任務(wù)存在未通過(guò)的測(cè)試、未實(shí)現(xiàn)的功能或潛在邏輯漏洞時(shí),Opus 4.8會(huì)更傾向于主動(dòng)暴露問(wèn)題,而非像過(guò)去那樣直接提交錯(cuò)誤結(jié)果;當(dāng)缺少工具、附件或必要權(quán)限時(shí),它也減少了“假裝執(zhí)行”并編造輸出的情況。
這一競(jìng)爭(zhēng)方向,也開(kāi)始成為開(kāi)源模型競(jìng)爭(zhēng)的新主線。唐杰近期分享過(guò)一段思考,認(rèn)為長(zhǎng)周期智能體的發(fā)展,需要記憶、持續(xù)學(xué)習(xí)和自我評(píng)判三大技術(shù)支柱,而自我評(píng)判,本質(zhì)上就是模型的“誠(chéng)實(shí)性”。此外,在最新的內(nèi)部信中,他還進(jìn)一步強(qiáng)調(diào)了極致安全治理的重要性,也讓市場(chǎng)開(kāi)始期待智譜下一代旗艦開(kāi)源模型。
而美國(guó)開(kāi)源模型廠商TML的新模型Inkling,則率先將這一競(jìng)爭(zhēng)方向具象化為一款產(chǎn)品。它擁有9750億總參數(shù)、410億激活參數(shù),支持百萬(wàn)Token上下文,并不是當(dāng)前參數(shù)規(guī)模最大、單項(xiàng)能力最強(qiáng)的模型。但它多模態(tài)原生,能力廣泛而均衡,針對(duì)不同任務(wù)具備靈活的可塑性;而該公司的Tinker就是非常好的滿足定制化需求的微調(diào)工具。
在技術(shù)博客中,團(tuán)隊(duì)重點(diǎn)強(qiáng)調(diào)了該模型的校準(zhǔn)(Calibration)與安全(Safety)。前者意味著模型能夠更準(zhǔn)確地判斷自身把握,在缺乏依據(jù)時(shí)主動(dòng)表達(dá)不確定性,而不是自信地編造答案;后者則意味著,即使模型經(jīng)過(guò)開(kāi)源和企業(yè)微調(diào)之后,仍然能夠保持可治理、可控制的安全邊界。
而對(duì)于DeepSeek而言,Inkling值得玩味的地方,并不在于它承認(rèn)學(xué)習(xí)了DeepSeek-V3的MoE架構(gòu),而在于它暗示DeepSeek已經(jīng)不再是所有開(kāi)源模型默認(rèn)要追趕或?qū)?biāo)的關(guān)鍵坐標(biāo)。
在展示核心能力時(shí),團(tuán)隊(duì)并沒(méi)有選擇最新的DeepSeek-V4,作為開(kāi)源模型的比較對(duì)象,而是將智譜GLM-5.2與英偉達(dá)Nemotron 3 Ultra放了進(jìn)去。這與DeepSeek今年連續(xù)啟動(dòng)融資、籌備上市形成了一種耐人尋味的呼應(yīng)。
后DeepSeek時(shí)代,開(kāi)源模型競(jìng)爭(zhēng)的重點(diǎn),是誰(shuí)能夠最快把下一代AI能力,變成現(xiàn)實(shí)世界最普遍使用的能力。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.