![]()
許多人在討論“養(yǎng)蝦”時,在荒涼的戈壁灘上,一場關(guān)乎能源命脈的技術(shù)革命正在悄然發(fā)生。
當(dāng)?shù)乇頊\層“容易獲取”的油氣資源被消耗殆盡,用腳步丈量大地的“找油人”,將目光瞄向了上萬米的地底深處,要在上千米的地層中找到僅有幾米適合開采的油層。傳統(tǒng)靠經(jīng)驗“開盲盒”式的勘探手段已經(jīng)失效,取而代之的是看不見硝煙的“計算戰(zhàn)”。
為了撥開硬核技術(shù)的面紗,我們與中國石油勘探開發(fā)研究院原首席專家龔仁彬進(jìn)行了一場對話,透過有著40年經(jīng)驗的“石油IT老將”的視角,理解計算怎么重塑人類尋找“黑金”的方式。
01 數(shù)據(jù)量指數(shù)級增長的計算“壓力”
1986年大學(xué)畢業(yè)后,龔仁彬就投身于石油IT系統(tǒng)的建設(shè),親歷了中國油氣行業(yè)從信息化到數(shù)字化再到智能化的跨越。
“老一代石油人找油,靠的是一雙鐵腳板和長期積累的經(jīng)驗。”龔仁彬在對話中向我們描繪了傳統(tǒng)石油勘探的畫面,地質(zhì)學(xué)家們跋山涉水,通過有限的地表采樣和肉眼觀察,再結(jié)合畢生積累的知識與經(jīng)驗,在大腦中構(gòu)建出地下可能存在的油氣構(gòu)造。
![]()
高度依賴人類大腦和體力的模式,已經(jīng)逼近認(rèn)知的極限,橫亙在現(xiàn)代勘探面前,是兩個跳不過的現(xiàn)實挑戰(zhàn)。
第一個挑戰(zhàn)是數(shù)據(jù)量的指數(shù)級甚至是“核爆級”增長。
“我剛參加工作的時候,在地面上放一炮,接收深度1000米,最多能到1500米。”龔仁彬回憶道。那時的勘探更像是在淺水區(qū)摸石頭,而現(xiàn)在勘探的深度,已經(jīng)達(dá)到了驚人的1.5萬米乃至2萬米。
不只是勘探深度的倍增,數(shù)據(jù)采集的維度也在幾何級膨脹。過去放一炮,地面部署的接收傳感器只有120個;現(xiàn)在放一炮,有幾萬個傳感器同時在接收微弱的回波信號,采集到的數(shù)據(jù)呈現(xiàn)出了指數(shù)級增長。
“過去一個數(shù)據(jù)體可能只有幾百兆,后來是幾百個G,現(xiàn)在隨便一個普通的地震勘探工區(qū),都是幾百個TB,有些能達(dá)到數(shù)十個PB級的數(shù)據(jù)量。”龔仁彬還講述了自己親歷的一個“極端例子”,“為了拷取一個150TB的單體原始數(shù)據(jù),光是物理拷貝的過程,就耗費了近一個月的時間。”
第二個挑戰(zhàn)是海量龐雜數(shù)據(jù)對高性能計算(HPC)的“壓力”。
油氣勘探可以比作是給地球做CT,采集的數(shù)據(jù)越多、處理得越精細(xì),對地下地質(zhì)結(jié)構(gòu)的了解就越準(zhǔn)確,找到油的可能性就越大。如果不進(jìn)行去噪、反褶積、疊加等處理,PB級的數(shù)據(jù)幾乎沒有價值。
地震資料處理的一個完整流程多達(dá)幾十步,涵蓋數(shù)百個軟件模塊,涉及大量計算量大的并行作業(yè),對計算精度、時效的要求,遠(yuǎn)非普通計算機(jī)可以滿足的。從我國自主研發(fā)的“銀河二代”巨型計算機(jī)開始,高性能計算就成了處理物探數(shù)據(jù)的“底座”。
時間來到2026年,油氣勘探和油藏模擬已經(jīng)是鯤鵬HPC最大的應(yīng)用和創(chuàng)新場景之一。為了解決多任務(wù)、同數(shù)據(jù)體并行的海量運算需求,基于鯤鵬架構(gòu)和全分布式存儲構(gòu)建的高性能計算平臺,能夠大幅降低I/O等待時間,以滿足油氣行業(yè)對運行速度、并行計算能力的嚴(yán)苛要求。
由此出現(xiàn)了一個“反常識”的現(xiàn)象:過去幾年時間里,智能計算、大模型等概念占據(jù)了輿論焦點,但在AI for Science領(lǐng)域,智能計算應(yīng)用總體僅占30%,大多數(shù)任務(wù)離不開HPC的精確計算能力。
就像在油氣勘探的場景中,只有將HPC將數(shù)據(jù)徹底清洗干凈,AI大模型才具備深度介入、尋找規(guī)律的基礎(chǔ)。
02 工業(yè)級的大模型是怎樣“煉”成的?
有了HPC清洗出的高質(zhì)量數(shù)據(jù),大模型的落地應(yīng)用就有了土壤。但AI在油氣行業(yè)的嘗試,并不像想象中一帆風(fēng)順。
龔仁彬在對話中提到:早在1984年的時候,中文期刊文獻(xiàn)里就提到了“人工智能”在地震資料處理中的應(yīng)用。但隨后的三十多年里,找油人絕大多數(shù)時間還是要靠“鐵腳板”。一位經(jīng)驗豐富的專家通常需要1-2天才能識別一口新井,而一個油田每年就要完鉆數(shù)千口井,工作強度可想而知。
原因并不難解釋。傳統(tǒng)模型過分把精力放在了各種算法的研究上,忽略了海量數(shù)據(jù)的投喂。
“我曾經(jīng)看到過一篇文章,用34口井的數(shù)據(jù)跑出一個模型,就想做測井解釋。好比一個赤腳醫(yī)生,在村里治過34個人,就能在天下行醫(yī)嗎?”龔仁彬用一個生動的比喻,揭示了傳統(tǒng)模型泛化能力差的缺陷。
轉(zhuǎn)折點發(fā)生在2021年末。
龔仁彬在華為杭州研究院調(diào)研時,被盤古氣象大模型的成功深深啟發(fā):既然可以利用海量的氣象數(shù)據(jù)跑出一個顯著提升預(yù)測能力的模型,為什么不能用海量的地震數(shù)據(jù),跑一個用于油氣勘探的“地震解釋大模型”?
厘清了思路的龔仁彬,帶領(lǐng)中國石油勘探開發(fā)研究院的團(tuán)隊,聯(lián)合華為、中國移動等合作伙伴,開始了工業(yè)級大模型的“煉丹”。
![]()
為了保證投喂給大模型的“養(yǎng)料”絕對純凈,團(tuán)隊收集了鄂爾多斯、塔里木、四川等七大盆地共計6萬平方公里、約200TB的真實業(yè)務(wù)數(shù)據(jù)。在前期的數(shù)據(jù)整理階段,通過HPC與人工結(jié)合的方式,進(jìn)行了“寧可錯殺”的數(shù)據(jù)清洗——只要發(fā)現(xiàn)數(shù)據(jù)中摻雜了不合適的人工地質(zhì)解釋信息,就堅決切除,絕不讓劣質(zhì)數(shù)據(jù)把大模型“帶偏”。
經(jīng)過93天日夜不停地訓(xùn)練,“煉”出了一個80億參數(shù)的垂直大模型,并迅速在業(yè)務(wù)一線進(jìn)行了“實戰(zhàn)”。
在四川南充地區(qū),面對25600平方公里的超大數(shù)據(jù)體,傳統(tǒng)的交叉項識別方法費時耗力,大模型介入后,只用10天時間就完成了識別任務(wù),精度接近90%、效率提升了9倍;
在長慶油田的非常規(guī)致密氣預(yù)測中,在沒有依托探井?dāng)?shù)據(jù)的情況下,一周時間就跑出了傳統(tǒng)方法需要三個多月的結(jié)果;
以往需要半年完成的解釋工作,大模型最多兩周就能出結(jié)果,工作效率提高了9到12倍……
讓龔仁彬印象最為深刻的,是大模型涌現(xiàn)出的“反直覺”尋油能力。
傳統(tǒng)勘探高度依賴專家的主觀經(jīng)驗,過去是找油的法寶,現(xiàn)在卻可能形成思維盲區(qū)。而大模型是純粹的“唯物主義者”,擅長從海量數(shù)據(jù)中“掘金”,可以在被專家經(jīng)驗漏掉的數(shù)據(jù)中,精準(zhǔn)捕捉到符合油藏特征的信號。
從“經(jīng)驗主導(dǎo)”向“數(shù)據(jù)驅(qū)動”的跨越,標(biāo)志著在高性能計算、高質(zhì)量數(shù)據(jù)的澆灌下,AI的種子終于在萬米地下“生了根”,等待油氣勘探行業(yè)的,將是從“地里找油”到“云端算油”的新紀(jì)元。
03 如何填補大模型落地時的“深坑”?
算力可以花錢買,模型可以聯(lián)合攻堅,智能化道路上最難跨越的深坑卻是——懂業(yè)務(wù)的不懂AI,懂AI的不懂油田。
在對話中,龔仁彬道出了傳統(tǒng)能源行業(yè)最真實、也最無奈的痛點:“說實話,我們油氣行業(yè)的工資待遇,是沒辦法招到真正的頂尖AI人才的”,并提出了極具實用主義色彩的“三層人才金字塔”破局策略。
第一層是懂業(yè)務(wù)的“提燈人”。
在內(nèi)部篩選對AI感興趣的資深業(yè)務(wù)人員,可能不會寫代碼,但對油氣勘探有深刻的理解,能夠準(zhǔn)確定義問題并提出核心需求。
第二層是內(nèi)部轉(zhuǎn)化的“調(diào)參俠”。
即使招不到AI大牛,還可以從內(nèi)部尋找數(shù)學(xué)、物理、物探基礎(chǔ)好的年輕人,經(jīng)過系統(tǒng)的AI培訓(xùn)后,承擔(dān)開源算法的調(diào)試、常規(guī)模型的微調(diào)和訓(xùn)練工作,一步步成為AI落地的中堅力量。
第三層是外部借腦的“聯(lián)合戰(zhàn)隊”。
在涉及底層創(chuàng)新、架構(gòu)研發(fā)時,選擇與華為、阿里爸爸、科大訊飛等科技企業(yè),以及清華、北大等高校進(jìn)行深度合作,讓外部的通用AI技術(shù),與內(nèi)部深厚的行業(yè)know-how進(jìn)行“碰撞”。
![]()
除了解決人才斷層的系統(tǒng)性方案,龔仁彬還對盲目跟風(fēng)大模型的行業(yè)亂象提出了“警告”。
作為操盤了多個國家級油氣信息化工程的老將,龔仁彬總結(jié)了當(dāng)前智能化轉(zhuǎn)型中最容易踩的四個“坑”,即為了智慧而智慧,脫離生產(chǎn)實際;盲目搞大模型;重技術(shù)輕業(yè)務(wù);重復(fù)建設(shè)嚴(yán)重。
其中“盲目搞大模型”是龔仁彬特別強調(diào)的問題,“既沒有明確需求,也沒有高質(zhì)量數(shù)據(jù)支撐,想都沒想干大模型目的是什么,就盲目上馬。”如果數(shù)據(jù)基礎(chǔ)不夯實,只會把模型“帶進(jìn)溝里”。
龔仁彬的觀點,和中國工程院院士鄭緯民不謀而合。
幾個月前的一場行業(yè)會議上,中國工程院院士鄭緯民在報告中明確提出了“HPC+AI for Science”的概念,并以石油勘探為例解釋了高性能計算與人工智能協(xié)同催生的科研新范式:數(shù)據(jù)預(yù)處理仍由HPC完成,判斷地下是否有石油的預(yù)測環(huán)節(jié)使用大模型。
隱藏在理性思考背后的,是千行百業(yè)數(shù)智化轉(zhuǎn)型的新態(tài)勢:純粹的概念炒作正在退潮,取而代之的是深度的融合創(chuàng)新。
比如HPC與AI底座的深度融合計算,前端利用鯤鵬HPC的高吞吐清洗數(shù)據(jù),后端利用大模型進(jìn)行智能預(yù)測,形成完美的算力閉環(huán);再比如產(chǎn)學(xué)研聯(lián)動的復(fù)合型人才培養(yǎng),正在打破以往理論研究與生產(chǎn)實際相脫節(jié)的壁壘,培養(yǎng)更多既懂行業(yè)也懂AI的年輕人……
有理由相信,當(dāng)懂業(yè)務(wù)的“提燈人”照亮了前行的方向,“調(diào)參俠”與“聯(lián)合戰(zhàn)隊”拉齊了技術(shù)水位,“HPC+AI”的算力底座夯實了路基,曾經(jīng)橫亙在AI與千行百業(yè)間的鴻溝,將被徹底“踏平”。
04 寫在最后
萬米地下的“計算戰(zhàn)”,給當(dāng)下狂熱的“AI亂象”澆了一盆冷水,也為千行百業(yè)指明了一條更清晰的路徑。
大模型從來都不是“即插即用”的產(chǎn)品,更不是包治百病的靈丹妙藥。想要大模型在業(yè)務(wù)一線釋放出應(yīng)有的“魔法”,需要高性能計算清洗PB級的混沌數(shù)據(jù)、需要業(yè)務(wù)專家們梳理出明確的需求、需要在組織體系上承接“從數(shù)據(jù)到?jīng)Q策”的工程化鏈路。
正如龔仁彬在對話中的一句話:落地靠的是“雙向奔赴”,不是單向技術(shù)推動,不是更大的模型,而是更深的融合。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.