![]()
智東西
作者 李水青
編輯 漠影
2026年盛夏,上海世博展覽館內人流如織,世界人工智能大會(WAIC)的展臺間涌動著技術變革的熱浪。
在這場全球AI的頂級盛會中,誕生了諸多“首次”,而最引人注目的變化之一,便是AIoT巨頭海康威視的首次深度亮相,將其已有的上千款大模型產品以精華提煉的方式呈現在展臺上。
![]()
大模型真正進入產業,到底需要什么樣的能力?海康威視試圖給出一個來自物理世界的答案。其以“觀瀾大模型”為核心,構建了一個橫跨云邊端、覆蓋軟硬件的龐大智能物聯體系。
走進海康展臺,最吸引人群的是一系列正在真實場景中工作的AI產品。
在多模態智能攝像機體驗區,觀眾無需編寫復雜規則,只需要一句自然語言指令,攝像機便可以理解需求,對現場畫面進行分析;在智慧體育體驗區,觀眾跳繩、立定跳遠,系統能夠實時識別動作并完成評分;在安全生產展示區,大模型正在嘗試理解復雜工業環境中的人員、設備、行為和空間關系。
![]()
這些體驗背后展示的,是一套已經進入物理世界運行的智能系統。
當大模型開始大步邁向物理世界,我們需要什么樣新的產業標準?當“多模態”從大模型發展的分支變為核心基礎設施,全球首屈一指的物聯感知巨頭如何卡位?這又將如何影響產業格局和行業發展方向?
通過對海康WAIC展區的實地探訪和相關負責人的深度對話,我們試圖對這些問題進行深入探討。
一、當大模型進入物理世界,“多快準省”成硬標準
大模型進入物理世界,首先面對的是遠比互聯網文本復雜的現實環境。
在2026世界人工智能大會主論壇上,復旦大學浩清特聘教授、通用物理智能研究院院長蘇昊在演講中表示,人類在物理世界摸爬滾打了幾百萬年,摔過跤、摸過燙的杯子、接不住掉下來的球,才把這些刻在身體里的經驗壓縮成了語言。但大模型從出生開始,學的就只是這道“影子”:它讀遍了互聯網上的文字,卻從來沒有真正踏入過真實世界,沒有感受過重量、摩擦、重力,沒有為自己的錯誤判斷付出過“摔碎杯子”的代價。
展會上,海康威視現場工作人員也向智東西談及了行業痛點:“互聯網世界的數據相對標準化,文本、圖片、代碼都有明確的表達形式;但物理世界充滿變化:光照會變化,環境會變化,設備狀態會變化,人的行為也會變化。”
![]()
而物理世界的需求也往往復雜。比如,一個工廠里的安全監管,不只是判斷“有沒有人”,還需要理解這個人是否正在進行動火作業,安全距離是否符合規范,防護裝備是否完整;一個園區管理,也不只是識別人車,還需要理解人員行為異常以及事件之間的關聯。
因此,物理AI的核心問題是讓模型真正理解現實世界。
為了加速AI落地物理世界,海康威視打造了 “多、快、準、省”的觀瀾大模型技術體系,希望解決大模型規模化落地過程中最關鍵的問題:感知覆蓋、行業適配、部署效率、規模化應用的成本。
1、多:從攝像機到物理世界的感知入口
在物理世界中,單一維度的信息往往無法還原真相。
現場相關工作人員告訴智東西,海康威視早已不再局限于傳統的攝像機業務,而是在打造物理世界的“眼耳鼻舌身意”。
其感知技術體系已覆蓋了可見光、紅外、X光、毫米波、音頻、多光譜等十余種物理傳感技術,并在此基礎上構建了視覺大模型、音頻大模型、X光大模型、毫米波大模型、光纖大模型等完整的物聯感知能力矩陣。
例如,在高速公路邊坡監測場景中,單純依靠視覺檢測可能會因目標像素太小、光線昏暗或天氣影響出現漏檢、誤檢,而集成了衛星或雷達數據的多模態大模型攝像機,通過視頻、衛星或雷達等不同模態的數據交叉驗證,再經由內置的大模型算法分析,讓邊坡位移或坡面落石的檢測更加準確、高效,從而盡可能減少給人們通行安全造成的威脅。
現場展出的TDLAS氣云成像遙測儀,融合激光監測、氣云成像與可見光三大技術,搭載大模型增強算法,能將不可見的氣體泄漏在畫面中“顯形”——這不是給AI看文本,是讓AI“聞”到化學氣體的濃度和種類,微漏識別率可達90%以上。
![]()
2、快:從月級適配到半天落地
產業AI最大的難題之一,是場景碎片化。工廠、交通、能源、園區、醫療,每個領域都有自己的業務邏輯和特殊需求。傳統方式下,一個新場景往往需要重新采集數據、訓練模型、部署測試,周期可能達到數月。
相關負責人告訴智東西,海康威視希望通過大模型的零樣本、小樣本能力降低這一門檻。據介紹,觀瀾大模型基于海量數據預訓練,具備較強的零樣本、小樣本理解能力,僅需數張至數十張目標樣本微調,即可完成場景適配,將適配周期從月級縮短至半天。
這種快速的交付能力,對于大量行業場景尤其重要。比如對于追求柔性制造的現代工廠而言,其實意味著巨大的時間成本與試錯成本的節約。
![]()
3、準:從看見目標到理解行為
在物理AI的應用中,單純的“看得清”已無法滿足需求,從“看得清”到“看得懂”的認知躍升才是關鍵。
以海康展示的AI多模態安全作業主機為例,其正是試圖解決這類復雜判斷問題。該產品依托多模態大模型,綜合人員、行為、設備、環境等信息,并結合空間邏輯進行分析。例如在動火作業中,可以綜合判斷作業票據、氣瓶間距、防護裝備等因素,實現從機械告警到智能研判的升級。
![]()
在效果層面,觀瀾大模型通過信號處理、模型優化以及軟硬協同,提高復雜環境下的識別能力。例如,周界防范誤報率降低90%以上,工業微孔缺陷檢出率達到99.99%,安檢場景下X光檢出率達到97%以上。
對于物理世界而言,“準”的重要不言而喻。因為一次錯誤判斷,可能影響生產安全、城市運行甚至人員生命安全。
4、省:讓AI真正進入規模化部署
物理世界的AI落地,必須考慮投入產出比。
相關負責人告訴智東西,并不是所有任務都需要調用云端大模型、所有數據都適合上傳,也不可能每個場景都堆砌昂貴的高算力服務器。
因此,端邊云協同成為產業AI的重要方向。海康威視堅持端邊云三層協同的部署哲學,讓簡單場景在端側解決,復雜任務在云端承擔,配合模型壓縮、知識蒸餾、Token優化等推理優化技術,有效控制了部署成本和帶寬開銷。
例如在一些無網無電的農田或水庫監控點,通過前端邊緣計算,僅將報警圖片或幾秒鐘的關鍵視頻回傳,極大節省了傳輸成本,也降低了現場太陽能供電的配置壓力。
這種思路背后,是產業AI與互聯網AI最大的區別:互聯網AI追求極致能力,而產業AI需要在效果、成本、可靠性之間找到平衡。
可以看到,“多快準省”分別對應了AI規模化落地物理世界的覆蓋廣度、交付速度、可靠性與經濟性。而這也成為海康此次WAIC展示出的第一個產業答案。
二、全面AI化:軟硬件產品體系都被大模型改寫
海康威視此次在WAIC的展示,是一場全產品線的全面AI化重構。
從最前端的感知設備,到后端的存儲計算,再到頂層的應用軟件,大模型如同一條貫穿始終的主線,正在重寫智能物聯的每一個環節。我們從海康前后端硬件、軟件的變化,可以窺見一斑。
1、前端:攝像機從“記錄者”,進化為“現場智能體”
“2025年前,將大模型放在前端是我們想都不敢想的事,2025年初發布的大模型周界相機中大概有0.3B的參數量。現在我們做到了2B的參數量,而隨著芯片能力和模型優化,更大參數量的大模型放在攝像機里也是非常有可能的。”相關負責人告訴智東西。
![]()
傳統攝像機只負責“看得見”。海康威視第一款攝像機于2007年發布,此后近二十年時間,整個行業圍繞“看得清、看得全、看得懂”三個目標演進。大模型來了之后,這個目標被重新定義。
這位負責人告訴智東西,大模型給攝像機帶來的改變至少有三重:
第一重是交互升級,從專人編寫復雜規則到用戶直接說出需求;第二重是理解升級,比如傳統攝像機只能看到“有一群人”,多模態攝像機結合場景判斷“他們在游泳,存在溺水風險”;第三重是決策升級,攝像機不再只是報警,而是主動聯動聲光、門禁等設備,形成閉環處置。
要實現這種復雜的端側推理,必須依靠軟硬協同的深厚功力。
據悉,海康威視不僅要在模型層面進行優化,更要在芯片選型、功耗控制、散熱設計以及鏡頭與云臺的機械聯動上進行全棧自研與協同設計,才得以將數十億參數的大模型塞進功耗與體積都極為有限的攝像機機身里,并實現毫秒級的實時響應。
2、后端:錄像庫變成可用自然語言查詢的“視頻數據庫”
視頻行業有一個長期痛點:找一段錄像太難了,就像大海撈針。
據業務相關負責人向智東西介紹,此次展出的“文搜”系列產品,正是對傳統視頻檢索模式的一次顛覆性革新。
比如,過去安保人員要查找一段錄像,需要提供精準的時間、地點或非常明確的目標特征;而文搜技術利用圖文多模態大模型,實現了“用文字,秒搜圖”。用戶只需輸入“穿藍色上衣背背包的人”或“紅色電瓶車”這樣的自然語言描述,系統即可在海量數據中秒級檢索并定位到對應的視頻片段。
這位負責人在采訪中透露,文搜產品發布一年,已銷售約10萬套。海外的起量速度超出預期,海外出貨數量與國內基本持平。以前國內先有先進技術鋪墊,海外再逐步復制,這次是同步起量。
3、軟件:從“人找功能”走向“一句話調度業務”
海康威視在大眾認知里更多是一家硬件公司,但其軟件能力常被低估。其軟件產品負責人告訴智東西,海康威視構建了一個“1+3+X”大模型軟件體系。
(“1”是一個大模型基座,“3”是三類大模型應用:智能工具、智能應用和智能體,“X”是90多個細分行業的軟件平臺。)
![]()
這位負責人告訴智東西,年初可以明顯感受到大家對智能體的理解發生了巨大變化。去年和前年更多集中在智能工具或工作流應用上,這些可以解決一定問題。但對于復雜軟件,比如應急平臺,基于前兩種應用改造只能滿足點狀需求。
而在基于智能體應用進行改造后,團隊發現它能自適應調用系統里已制作的各種工具,執行用戶能力和任務。對用戶來說,使用平臺的負荷大幅降低,培訓成本也大幅降低。
應急指揮智能體是典型例子。一句話就能調視頻、創會議、識隱患、查資源、發指令、打電話。在寧夏應急廳的實戰項目中,接入應急指揮智能體后,突發事件接報響應時效提升約45%,信息處理與系統操作效率提升約83%,指揮體系呼叫時效提升約300%。
ChatBI數據分析智能體實現了“只要會打字,就能進行數據分析研判”。當用戶輸入“幫我分析各個社區的能耗情況,并生成可視看板”,系統會自動完成數據查詢、建模、生成報表,數據分析效率提升超80%。
這位負責人強調,海康的軟件與硬件能力協同后,在落地應用中會發揮出更大的系統優勢。普通行業軟件只能分析用戶的結構化數據,海康的智能體還能調度相機獲取真實需求的數據。比如安全生產場景,軟件可以調度相機、獲取實時畫面、進行分析判斷,形成從數據采集到決策執行的閉環。
![]()
三、搶灘“物理AI”基礎設施,海康的底牌與路徑
當互聯網文本數據訓練見頂,AI的下一輪突破必然向物理世界延伸。
在這一進程中,海康威視二十余年積累的“感知”能力,恰好構成了物理AI不可或缺的“眼耳鼻舌身”,使其在這一輪技術浪潮中占據了獨特的生態位。
海康威視為什么能夠在WAIC上扛起AI進入物理世界的大旗?
一位長期關注AIoT產業的資深人士告訴智東西,其底氣首先來自于極其豐富的感知產品矩陣,這是海康最明顯的特點。海康的戰略定位經歷了從安防到智能物聯的演進,而物理世界的數字化第一步就是“感知”,如果無法獲取高質量的物理信號,再大的模型也只是空中樓閣。
![]()
第二個底牌是扎根行業的場景知識,海康威視擁有扎根行業的場景知識。這位產業人士告訴智東西,海康在深耕90多個垂直行業、服務2000多個場景的過程中,讓它比任何一家純技術公司都更懂客戶的真實痛點在哪里,通過豐富的垂類模型,能既精準又高性價比地解決場景問題。
海康方人士也在采訪中告訴智東西,當銷售人員或行業團隊從一線帶回需求時,公司會進行充分的市場調研與立項評審,確保新產品都是為了解決實際問題而生,而非為了AI而AI。這種對業務的深刻理解,使得大模型技術能夠精準地轉化為解決客戶痛點的生產力。
第三個底牌是軟硬協同的閉環優勢。在WAIC的現場展示中,無論是攝像機聯動聲光報警,還是軟件調度云臺變焦,都體現了這種“硬件采集數據-軟件分析決策-硬件執行動作”的完整業務閉環。
產業鏈人士向智東西分析指出,許多通用大模型廠商在落地時往往面臨“最后一公里”的困境,因為它們缺乏對物理執行設備的控制能力。而海康威視是從底層的傳感器芯片一直做到頂層的行業應用,這種全棧能力使得數據能夠在系統內部高效流動,形成“感知-分析-優化-執行”的數據飛輪,隨著使用時間的增長,系統會越來越聰明。
![]()
據悉,海康威視已經發布上千款大模型軟硬件產品,實現云邊端全覆蓋。這些產品不是停留在實驗室里的技術演示,而是已經進入各行各業的具體場景中,在安全防控、質量提升、成本優化、效率增益等方面持續創造價值。
背后,是海康在AI領域二十年的持續投入。早在2006年,海康威視就組建了智能算法團隊,2019年AI開放平臺被科技部授予“視頻感知”國家新一代人工智能開放創新平臺稱號。2023年推出的海康觀瀾大模型,已通過中國信通院“可信AI大模型能力評測”,模型開發能力獲得業內首個5級評分。
根據官方財報,海康威視近六年累計投入研發費用594.54億元,研發費用率持續保持在10%以上。研發及技術服務人員2.6萬人,占總人數近50%。截至2025年底,公司在全球累計擁有授權有效專利12981萬件,其中發明專利7399件。
結語:大模型下半場,拼的是在現實世界“貼地飛行”
WAIC 2026展館里,大模型的新品發布依然密集,技術參數依然令人炫目。但在海康威視的展臺,觀眾看到的是一種不同的AI敘事。
這里的AI能聽懂“水庫中有人游泳”這樣的自然語言指令,能看懂動火作業是否合規,能判斷安全帶掛鉤位置是否正確,能主動聯動聲光報警器進行干預。大模型的下半場,拼的不再是參數規模,而是誰能在現實世界“貼地飛行”。
海康威視展示了其中一條清晰的路徑:以多維感知為觸角,以軟硬協同為底座,以行業知識為燃料,讓大模型從云端走向地面,從對話走向執行。這條路,可能不性感,但足夠務實。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.