![]()
本文來自微信公眾號: HavenlonLabs ,作者:HavenlonLabs
當"大"的定義開始改變
AI"大力出奇跡"的時代,還能走多久
過去幾年,人工智能產業最有效、也最昂貴的方法論,可以被概括成一句并不嚴謹卻頗為傳神的話——大力出奇跡。
增加參數、擴大數據、投入更多算力,模型的語言能力、知識覆蓋與任務表現通常會隨之改善。
這并非單純的行業信仰。2020年,OpenAI研究者發表的《Scaling Laws for Neural Language Models》顯示,語言模型的損失會隨著模型規模、數據規模與訓練計算量的增長,呈現相對穩定的冪律下降。換言之,在一定范圍內,投入與能力之間存在可被預測的關系。
這種可預測性,給產業帶來了此前罕見的確定性。一家公司不必先回答"智能究竟是什么",也不必完整破解人類推理的機制,只需持續加大投入,然后觀察曲線是否繼續向下。
事實證明,這條路徑在相當長的時間里是有效的。從語言生成、代碼編寫,到圖像理解與復雜推理,越來越多原本需要分別設計的能力,開始集中出現在同一類基礎模型中。
但當模型進入萬億參數量級、數據中心投資持續攀升、推理成本開始成為損益表上的固定項,一個問題變得越來越現實:這條路徑還能走多久?
答案可能既不是"很快終結",也不是"永遠有效"。更接近事實的描述是:規模仍在擴張,但擴張的對象正在改變。
Scaling并沒有消失。正在退場的,是"只把模型做大"的那個版本。
一、"大"從來不只是參數
人們通常把大模型中的"大"理解為參數數量。這種理解不算錯誤,但容易忽略一個事實:能力的增長從來不是單一變量的結果。
參數決定模型能容納多復雜的模式,數據決定模型能觀察到什么,算力決定模型能從數據中學到什么程度,訓練方法則決定有限資源能否被有效利用。真正意義上的Scaling,是這些變量的同步擴大與重新配平——包括模型容量、訓練數據、計算資源、訓練時長、后訓練過程、推理階段投入的算力,以及來自外部工具與環境的反饋。
2022年,DeepMind的Chinchilla研究提供了一個反直覺的證據:在相同訓練計算預算下,700億參數、但使用了數倍數據訓練的Chinchilla,整體表現超過了2800億參數的Gopher。研究結論是,當計算預算固定時,參數與數據應當更均衡地擴大。
這意味著,即便在"大力出奇跡"最典型的階段,行業真正學到的也不是"越大越好"。
規模是有效的,但規模必須被正確配置。
這一點在今天更加明顯。在專家混合(MoE)架構下,模型可以擁有極為龐大的總參數量,卻在每次生成時只激活其中一部分。總參數代表整體容量,并不等于單次推理實際動用的計算量。參數依然重要,但它已經無法單獨說明一個模型有多強、成本有多高,以及能否進入商業場景。
二、冪律本身就寫著"收益遞減"
"大力出奇跡"容易讓人產生一種錯覺:投入翻倍,能力也會翻倍。
尺度定律從未作出這樣的承諾。恰恰相反,冪律關系通常意味著,每獲得同等幅度的性能改善,所需資源會越來越多。
因此,Scaling Law可以同時支持兩個看似矛盾的判斷:繼續擴大規模,模型通常還會進步;而繼續獲得進步,成本會持續上升。
在模型能力較弱的早期,一次規模擴張可能帶來肉眼可見的躍遷——從無法連貫生成長文,到能夠完成摘要、翻譯、編程與問答,用戶可以直接感受到代際差異。
當基礎能力已經具備之后,進一步擴大規模所帶來的改善,往往表現為另一種形態:在少數高難任務上提高準確率、更穩定地處理長任務、減少部分幻覺、提高工具調用成功率、在復雜代碼與數學問題上多推進幾步,以及把"偶爾能做到"變成"可以依賴"。
這些改善依然有價值,甚至可能直接決定模型能否進入企業核心流程。但它們不像早期跨代那樣容易被普通用戶感知。
所以,行業面對的未必是一堵突然出現的"Scaling之墻",而更像一條越來越陡的成本曲線。
限制"大力出奇跡"的,未必是模型不再進步,而是每一點進步是否還值得對應的代價。
三、問題正在從"能不能更強"轉向"值不值得更強"
對前沿實驗室而言,只要能力仍在增長,繼續投入就具備戰略意義。最強模型不只是產品,也是人才、資本、算力與生態位的集中體現。
但對大多數使用AI的企業,判斷標準完全不同。客服系統中的地址確認、知識庫中的文檔檢索、財務流程中的字段提取、固定規則下的工單分類,都未必需要動用成本最高的前沿模型。
產業實踐中,一種分層結構正在成型:簡單任務交給更小、更便宜的模型;復雜任務才調用能力更強、成本更高的模型;確定性任務則盡可能交還給傳統程序、緩存與規則系統。
需求側的變化同樣清晰。亞馬遜在重構Alexa+時采用了所謂"模型無關"的架構,按查詢逐條選擇合適的模型;相關報道指出,這種"模型混合"的做法在開發者中日益普遍,動機之一正是控制成本。
這不是對大模型路線的否定,而是其商業化的必然階段。云計算走過類似路徑:企業最初關心能否獲得更多計算資源,后來才轉向實例類型、資源調度與單位任務成本。
實驗室追求能力上限,企業追求單位成本下的可靠結果。二者并不矛盾,卻會形成兩套不同的Scaling邏輯。
四、算力正在從訓練遷移到推理
如果擴大參數與數據的邊際收益下降,AI是否就會停止進步?目前看,答案是否定的。
產業正在把更多計算,從訓練階段轉移到回答問題的階段。
傳統語言模型通常一次性生成答案。而推理型模型可以在遇到復雜問題時消耗更多計算:嘗試多條路徑、檢查中間結果、調用驗證器、根據反饋修正答案。這一方式通常被稱為測試時計算(test-time compute)。
它的實質,是模型不再對所有問題使用相同資源。簡單問題快速作答;一道復雜數學題、一次大型代碼改動或一項多步驟規劃,則可以獲得更長的思考時間與更高的計算預算。
已有研究表明,合理增加測試時計算,可以在部分任務上明顯改善表現。但同一批研究也提醒,這種增益并非無條件成立——采用何種搜索策略、驗證器是否可靠、如何依據難度分配算力,都會顯著影響最終收益。并行采樣加評分模型篩選,是目前較常見的一種實現路徑。
這代表"大力"發生了一次遷移:過去主要投在訓練一個更大的模型,如今也可以投在讓現有模型對某個具體問題想得更久。
兩者的商業含義完全不同。訓練投入必須在模型發布前一次性完成;推理投入則可以按用戶、任務與價值動態分配。
未來的AI產品,可能不只按"使用哪個模型"計價,也會按"這個問題值得思考多久"計價。
五、數據瓶頸不會終結Scaling,但會改變它
以往的模型擴張,很大程度上建立在互聯網既有的文本、圖像與代碼之上。但公開互聯網中的高質量數據并非無限。
當容易獲取的數據已被反復使用,繼續擴大訓練規模會遇到幾重約束:新增數據質量下降、重復內容增加、模型更容易接觸到由其他模型生成的內容,以及專業領域的高質量數據本就稀缺、昂貴,并受權限與合規限制。
Anthropic關于重復數據的研究發現,數據重復并非總是無害——在特定的重復比例區間,甚至可能造成明顯的性能退化。
因此,下一階段的數據競爭,很可能不再是"誰擁有更多文本",而是:誰能獲得更可靠的數據,誰能組織專家反饋,誰能從真實環境中拿到任務結果,誰能生成并篩選高質量合成數據,誰能判斷一段數據究竟教會了模型什么,以及誰能在數據、訓練與應用反饋之間建立閉環。
原始互聯網內容是一種存量資源,真實任務反饋則是持續產生的增量資源。但擁有更多用戶,并不自動等于擁有更好的模型——只有當用戶行為能夠轉化為合法、準確、有結構的信號,才可能成為改進的基礎。
下一階段最稀缺的或許不是數據本身,而是能夠證明"哪個答案更好"的反饋。
六、最大的模型,未必是參數最多的模型
當模型逐漸學會調用搜索、代碼環境、數據庫、企業軟件乃至其他模型,"模型能力"與"系統能力"之間的邊界開始模糊。
一個參數相對較小的模型,如果能夠找到正確資料、調用可靠工具、保存長期記憶、拆解復雜任務、檢查執行結果、在失敗后重新規劃,其在真實任務中的表現,可能超過一個參數更大、卻只能獨立生成文本的模型。
因此,產業仍會追求規模,但規模的對象正在變化。它可能不再只是一個越來越大的神經網絡,而是一套分工明確的系統:基礎模型負責理解與生成,推理機制負責分配計算,檢索系統負責獲取外部知識,工具層負責與數字世界交互,專業模型處理特定領域,驗證機制負責核查結果,權限與控制系統決定哪些動作可以真正發生。
這與計算產業從追求單核主頻,轉向多核、專用芯片與分布式架構的過程有相似之處。CPU主頻并未停止提高,只是不再是衡量系統能力的唯一指標。
七、三個階段,而非一個終點
認為Scaling即將徹底失效,可能過于武斷。已有研究仍顯示模型、數據、算力與性能之間存在相對穩定的關系;近年的新工作也在改進尺度定律的預測方法——對于耗資巨大的訓練項目而言,能否用小規模實驗預測大規模結果,本身已是關鍵基礎設施。
但認為可以永遠依靠無限增加參數獲得同等幅度的驚喜,同樣不現實。能源、芯片、數據、資本與工程復雜度都會形成約束,而市場最終衡量的不是參數,而是問題是否被解決。
一個可能的框架是把"大力出奇跡"看作三個遞進階段:
第一階段,參數規模化。通過擴大參數、數據與訓練算力,證明通用能力可以從大規模學習中涌現。
第二階段,計算配置化。重新分配預訓練、后訓練與推理之間的資源,借助MoE、測試時計算、數據優化與模型壓縮,提高單位計算的產出。
第三階段,系統規模化。模型與檢索、工具、智能體、驗證器、專業模型和真實執行環境結合。競爭不再只看誰訓練了最大的模型,而看誰能把智能組織成穩定、經濟且可控的系統。
下一場規模競賽,不只是把一個模型做得更大,而是把有限的智能放到最需要它的位置。
結語:終點不是模型停止變大
那么,"大力出奇跡"還能走多久?
它可能還會持續相當長的時間。只要增加計算仍能提高能力,資本與算力就會繼續向前沿集中;總參數可能繼續增長,數據中心仍會擴張,推理階段消耗的算力甚至可能超過訓練階段。
真正接近尾聲的,是把"大"單純理解為參數數量的那個時代。
未來人們會越來越少地追問"這個模型有多少參數",轉而關心:它每次實際激活多少參數?訓練使用了怎樣的數據?完成一個任務的成本是多少?復雜問題能否通過追加推理預算獲得更好結果?它能否調用正確的工具、在真實環境中穩定交付?企業能否控制它最終產生的影響?
當這些問題成為主流,Scaling就不再是一場單純的軍備競賽,而更接近一門資源配置的學問。
參數仍會增長,算力仍會增長,數據中心仍會擴張。只是決定競爭力的,不再是投入了多少"大力",而是能否把參數、數據、算力、工具與反饋組織成有效能力。
"大力出奇跡"不會消失。會消失的,是"只要足夠大,就不必回答效率、可靠性與商業價值"的那個時代。
AI的發展不會從規模退回小規模,也不會簡單地從大模型退回傳統軟件。它更可能進入一個新階段:模型繼續變大,但系統比模型更大;算力繼續增加,但計算開始按任務分配;能力繼續提高,而成本、可靠性與可控性擁有同等重要的位置。
Scaling仍是AI進步的重要動力。只是下一輪"奇跡",未必來自更多參數本身,而可能來自人們終于學會,如何更有效地使用已經擁有的規模。
本內容由作者授權發布,觀點僅代表作者本人,不代表虎嗅立場。如對本稿件有異議或投訴,請聯系 tougao@huxiu.com。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4878177.html?f=wyxwapp
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.