![]()
“中國不需要第101個開源大模型,但需要更堅實的AI數據基礎設施
2026年6月,舊金山Moscone Center。Databricks Data+AI Summit,3萬人到場,超過18項核心產品發布。CEO Ali Ghodsi在臺上說了一句話,被反復引用:“這件事會變得極其昂貴,我們才剛剛開始。”
7月,北京國家會議中心。全球數字經濟大會上,一家中國公司的展位前圍滿了人。
這兩件事之間,隔著太平洋,也隔著一個正在被驗證的判斷——AI的下半場,風向變了。
過去兩年,大模型從千億參數卷到萬億,開源模型和閉源模型輪番刷榜。企業被裹挾在這場狂歡里:買算力、招團隊、部署模型,以為拿到了通往未來的門票。
結果呢?
模型在通用問答里“無所不能”,一進工廠、醫院、能源場就“水土不服”。數據散落在幾十個孤島里,格式不統一、標準不一致、質量參差不齊——數據根本“喂不進去”。
2026全球數字經濟大會上,議題焦點開始改變。人們除了問“哪個模型跑分最高”,還會追問另一個更現實的問題:AI到底怎樣才能真正落地?
一個判斷正在成為共識:AI的下半場,決勝點除了模型benchmark,還在AI數據基礎設施。
AI產業正在切換賽道
從“卷模型”到“卷數據底座”
先講一個典型場景。
一家大型央企的CIO算過一筆賬:集團內部17個業務系統、9個數據倉庫、3朵云,數據格式從Oracle到MySQL到Hadoop到非結構化文檔,五花八門。集團要求“全面擁抱AI”,于是采購了大模型平臺、搭建了算力集群、組建了算法團隊。
半年后,模型部署完成,發現根本跑不起來。
“我們當時想做一個很簡單的應用,讓大模型輔助設備故障診斷。”這位CIO說,“結果模型連設備的歷史維修記錄都讀不懂,因為記錄分散在三個系統里,格式不一樣,字段命名不一樣,還有大量紙質報告掃描件沒處理過。”
這不是個例。
企業AI落地的真實困境:錢花出去了,模型跑不起來
數據散落數十個孤島,格式亂、標準雜、質量差,是絕大多數企業的真實狀態。能源、制造、醫療等傳統領域積累了PB級數據,卻大多沉睡在孤立系統中,難以直接被算法利用。
大模型很強,但它面對的如果是“沒洗過的菜、沒整理過的倉庫”,也做不出一桌“好菜”。
某種程度上,AI規模化的瓶頸,已經從“能不能算”轉向“數據能不能用”。
不是算法不夠好,不是算力不夠強,是數據體系、全域治理與全鏈路工程化閉環能力跟不上。一個無法持續供給高質量數據的企業,就像一個沒有食材的廚房——設備再先進,也做不出一道好菜。
科杰科技董事長于洋的判斷很直白:“AI的上半場,行業更關注通用能力的打造;下半場,當AI要面向大型企業、產業端、政府端發揮更大效能時,我們必須解決最后一個問題:數據的問題。”
Databricks、Snowflake同時掉頭,方向出奇一致
如果說中國企業的困惑還只是個體現象,那全球AI產業鏈的集體動作,則宣告了一個新產業周期的開啟。
先看模型側。
Anthropic做過一次對照實驗:同樣一個Claude模型,裸跑企業數據分析任務,準確率只有21%;接入完整的數據工程體系后,準確率飆升至95%以上。差距不在模型本身,在模型背后那套數據基礎設施。
Anthropic由此搭建了一套“數據基建層→真相來源層→技能層→驗證閉環層”的四層架構。而這一架構,已成為Databricks和Snowflake共同參考的范式。
再看數據平臺側。
2025年起,Anthropic先后與Databricks、Snowflake達成深度合作。Claude原生接入Databricks Data Intelligence Platform,與Unity Catalog打通,統一權限、審計、數據不出庫;同時深度嵌入Snowflake Cortex AI,在數據邊界內完成自然語言查詢、代碼生成、AI智能體開發。
模型廠商與數據平臺廠商,正在從“各自為戰”走向“深度融合”。
![]()
2026年6月,Databricks Data+AI Summit上,這場融合的成果集中釋放。Databricks把所有能力重新畫了一張架構圖:Lakehouse下沉為底座,Agent Runtime升至頂層,治理被前置為AI上崗的第一道關卡。
傳遞的信號很明確,模型與數據基礎設施,正在形成雙向奔赴的協同關系。模型依賴數據底座供給“可理解、可信任”的數據;數據底座借力模型的能力,讓沉睡的數據資產被激活。兩者不再是上下游的線性關系,而是相互增強的閉環。
Snowflake也在做同樣的事。兩家長期競爭的云數據平臺巨頭,在這一點上達成了罕見共識:下一局,拼的是“數據是否就緒”。
中國AI數據基礎設施
應該怎么做?
從舊金山回到北京,視角從全球拉回中國,問題本質上是一樣的:當AI和Agent從技術競賽進入產業化落地階段,我們的數據基礎設施準備好了嗎?
中國的產業場景更復雜。比如,制造業的供應鏈鏈條全球最長、能源網絡的節點密度全球最高、金融機構的合規要求層層疊加,這些場景產生的數據量更大、格式更多樣、質量更參差。而大模型要真正進入這些行業,就必須跨越從“通用智能”到“行業智能”的鴻溝,底層支撐這套跨越的,恰恰是一套堅實、安全、可治理的AI數據基礎設施。
那這套基礎設施該怎么建?科杰科技這個公司的實踐,提供了一個值得觀察的樣本。
科杰的核心產品是KeenData Lakehouse,定位很明確:業內首創Data&AI一體化智能驅動架構。
什么叫“Data&AI一體化”?就是說,它不是傳統湖倉外掛AI,那種做法像是給一輛老車裝了個新發動機,能跑但不好用。它是為AI原生設計的架構,名字叫“AI-in-Lakehouse”,讓數據從存儲那一刻起,就準備好被模型消費。
拆開來看,它做了三件事:
第一,打通全鏈路。從數據工程→模型訓推→Agent工廠→智能應用,打造數據融合、智能治理、模型訓推、Agent全生命周期運營端到端一體化技術閉環。一個平臺,把數據到AI的每一步都串起來。
第二,三大核心技術支撐。AI原生開放湖倉深度融合向量數據庫、多模態存儲能力,原生支持混合查詢;多模態對齊融合消除文本、圖像、音視頻之間的語義隔閡;訓推極致性能則面向GPU做全棧加速——算子融合、顯存調度、混合精度訓練,把硬件的每一分算力榨干。
第三,產品矩陣夠厚。涵蓋數據集成、多模態計算、數據治理、AI模型訓練、Agentic協同應用開發、調度與落地。代碼自研率97%+,滿足信創與安全合規,完整適配國產化軟硬件生態
如果你對比Databricks的架構演進,會發現驚人的一致性。
2026年DAIS峰會,Databricks的核心方向也是把底座做厚、把Agent Runtime做薄——LTAP讓OLTP與OLAP共用一份數據,Lakehouse//RT實現亞百毫秒級實時查詢,Unity AI Gateway把治理前置。
兩家公司隔著一個太平洋,用不同的技術棧、不同的產品形態,往同一個方向走。
Databricks解決的是全球云原生場景下的數據基礎設施,科杰解決的是中國大型組織私有化場景下的數據基礎設施。技術底座邏輯相通,落地環境各有不同。
“模數共振”:Data for AI+AI for Data雙向奔赴
此外,值得指出的是,科杰科技還有一個核心方法論,叫“模數共振”。
2026年,工信部與國家數據局聯合發起“模數共振”行動,科杰是這個概念的實踐者。
什么叫“模數共振”?拆開看就兩層意思:
Data for AI——高質量治理后的行業數據反哺模型,讓大模型“懂行話、知規矩”。例如,石油煉化的歷史運行數據,讓工藝模型懂行業邊界;汽車產線的傳感器數據,讓視覺模型像老法師一樣識別微缺陷。
AI for Data——大模型反向激活沉睡的非結構化數據。比如,醫療大模型從病歷中自動提取專病特征,構建高質量臨床數據集;教育大模型解析教學行為,生成個性化學習路徑。
這不是單向的“數據喂給模型”,是雙向奔赴。數據成為流動的智能燃料,模型成為數據的煉金爐。
![]()
而且,這個方法論在頭部客戶中已經跑通了。目前,科杰科技的客戶案例中,中石化的數據底座被國資委列為央企數字化轉型標桿,30余家央企代表到場聽取報告。此外,面向大模型與Agentic應用的可信數據空間、高質量數據集解決方案,已在全國多城市規模化落地。巧的是,Databricks在2026 DAIS峰會上也發布了Genie Ontology——一個自動生長的企業上下文圖譜,核心目標同樣是讓模型“理解企業數據”。一個叫“模數共振”,一個叫“上下文圖譜”,講的都是同一件事:模型要懂企業的數據,數據要為模型所用。方向趨同,路徑各異,但底層邏輯完全一致。
一個萬億級藍海市場剛剛開啟
講完了科杰是誰、做了什么、跑通了什么,一個更宏觀的問題自然浮現:這個市場到底有多大?這家公司正在進入的,是一個怎樣的賽道?
答案可能會超出很多人的預期。
1.從“應用采購”到“底座重構”
把視線拉回到產業層面。
過去十年,企業數據采購的典型場景是買BI、買報表、買數倉工具。但今天,客戶的需求變了——大模型和Agent來了,舊平臺根本不夠用。
AI不能直接吃原始數據,Agent不能繞過企業權限和流程,大模型輸出必須有可信數據支撐。企業需要的不再是一兩個工具,而是一套能夠持續供給高質量數據、持續迭代模型能力、持續生產智能應用的完整體系。
用科杰的話說,叫“從賣軟件到交付行動系統,從建設平臺到運營生態”。
所以說,AI數據基礎設施這個市場,不是ERP或數據庫那樣的存量紅海,而是AI催生的全新藍海。
市場有多大?從央國企總部延伸到二級、三級公司,從金融、能源延伸到醫療、交通、城市治理,規模可放大數十倍。
2.與國家戰略同頻共振
更重要的是,這個市場正與國家戰略形成共振。
科杰把政策演進梳理為三個階段:從“數據要素制度化”到“國家數據基礎設施建設”,再到“人工智能+行動”。六年三步躍遷,步步都在催生剛性需求。
可信數據空間、高質量數據集、城市大腦,這些政策關鍵詞的背后,是同一個指向:數據底座建設已從企業自主選擇,升級為產業升級的必需品。
目前,科杰已入選國家數據局首批可信數據空間試點典型單位,承建北京、杭州、蘇州、等多地城市數據基礎設施標桿項目。
3.AI數據基礎設施對產業意味著什么?
如果說這些還只是商業層面的判斷,那更深一層的問題是:AI數據基礎設施對產業意味著什么?
PC時代有操作系統,互聯網時代有云,AI時代最底層的基礎設施,是數據底座。
沒有堅實的數據底座,大模型是空中樓閣,智能體是紙上談兵。誰掌握了高質量數據供給體系,誰才能掌握了AI時代的核心競爭力。
科杰給出了一個戰略公式:數據資源×AI數據基礎設施×高質量數據集×行業模型×智能體網絡×場景運營=可持續變現的智能產能。
這個公式背后是一個判斷:AI時代真正稀缺的除了模型、算力,還有讓數據持續變成智能、讓智能持續進入業務、讓業務持續產生收益的基礎設施。
![]()
結語
如果把數字文明的演進拉長到三十年尺度,可以清晰地看到三次基建浪潮:
第一次,是網絡基建。光纖和交換機構建了信息高速公路,讓世界真正“連起來”。
第二次,是算力基建。云和數據中心讓計算能力像水電一樣隨手可取,讓世界“算起來”。
第三次,正在發生——是數據基建。它要讓人類千年積累的知識、經驗和生產數據,第一次真正成為AI可以理解、可以調用的“公共認知”。
無論是美國的Databricks、Snowflake、Palantir,還是中國的科杰科技,他們都恰好踩在了第三次基建浪潮的起點。他們做的事情,是為AI的規模化商用鋪設最后一塊缺失的拼圖——一個讓數據能夠被模型理解、讓模型能夠被產業使用的中間層。
模型提供大腦,算力提供心跳,而數據底座,提供的是讓這一切真正運轉起來的神經系統。三者協同,AI才能真正走出實驗室,走進工廠、醫院、能源場和城市治理的每一個角落。
這一步,決定了中國能否在這場底層競賽中,擁有自己的路基。也決定了AI的產業價值,究竟是一陣短暫的熱潮,還是持續改變世界的力量。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.