![]()
過去三年,AI虛擬細胞(AIVC)賽道擠滿玩家,海量測序數(shù)據(jù)、數(shù)十億參數(shù)模型輪番登場,卻始終卡在同一個死胡同里。
一家名為百曜科技的中國團隊,踩中了行業(yè)最核心的底層矛盾:大語言模型算法架構(gòu)和真實細胞數(shù)據(jù)之間的錯配。
就在近期,這支團隊交出了一條全新解法 —— 全球首個 LLM-JEPA 單細胞世界模型 CellOS 正式對外發(fā)布。
依托 3.905 億條人類單細胞轉(zhuǎn)錄組訓(xùn)練而成的 12B 大模型,它首次用雙視角 JEPA 架構(gòu)讀懂細胞動態(tài)狀態(tài),多項核心評測全面刷新行業(yè) SOTA(State-of-the-Art),或?qū)氐赘膶懼扑幮袠I(yè)生命科學(xué)底層研發(fā)范式。
01
生命科學(xué)必須另辟蹊徑
單細胞測序技術(shù)爆發(fā)的十年后,隨著測序設(shè)備源源不斷產(chǎn)出細胞數(shù)據(jù),加上Transformer架構(gòu)給了第一代AIVC誕生的可能性。
但大模型領(lǐng)域通行的縮放定律 Scaling Law放在 AI 虛擬細胞賽道,這套經(jīng)驗似乎失靈了。
模型能力沒跟上。市面上絕大多數(shù)細胞 AI,照搬 Transformer 完形填空訓(xùn)練邏輯:遮擋一段基因,讓模型猜答案。
這套機制學(xué)的是數(shù)據(jù)表層規(guī)律,本質(zhì)是 “背誦測序表格”,而非理解細胞。
可真正決定疾病發(fā)展、藥物反應(yīng)、細胞分化的,往往是數(shù)十個基因疊加的微弱信號。它們表達量不突出,僅憑表層擬合的模型,永遠抓不住這些關(guān)鍵變化。
2026 年 6 月《Nature Methods》的一篇量化研究,給行業(yè)痛點釘下實錘:用 2220 萬細胞訓(xùn)練的模型,僅投入 1%–10% 訓(xùn)練數(shù)據(jù),性能就徹底停滯,再增加數(shù)據(jù)也無法提升效果。
整個行業(yè)陷入瓶頸:單純堆砌數(shù)據(jù)與參數(shù),彌補不了模型對生物學(xué)底層邏輯的缺失。
百曜科技COO楊帆給出結(jié)論:傳統(tǒng)路線已經(jīng)走到盡頭,生命科學(xué) AI必須換一套底層架構(gòu),行業(yè)需要另辟蹊徑。
02
為細胞創(chuàng)造一個“理解者”
百曜科技此前與行業(yè)主流技術(shù)路線一致,同樣基于 Transformer 架構(gòu)開展探索,但團隊始終希望找到一種能夠從底層降低模型對細胞數(shù)據(jù)偏置與噪聲敏感性的方案。
2025 年,公司首次嘗試在 Transformer 架構(gòu)中引入 GNN(圖神經(jīng)網(wǎng)絡(luò)),希望改善模型對細胞關(guān)系的建模能力,但這一方案仍屬于局部優(yōu)化,并未觸及問題本質(zhì)。直到今年年初,百曜科技決定轉(zhuǎn)向一條研發(fā)難度更高的技術(shù)路線——JEPA(聯(lián)合嵌入預(yù)測架構(gòu))。
這條路研發(fā)阻力層層疊加,是業(yè)內(nèi)公認的 “險途”。
一方面 JEPA 需要在隱空間對齊兩套完全不同的細胞觀測維度,另一方面因果損失(causal loss)還要疊加時序約束,雙重限制極易造成訓(xùn)練震蕩;更棘手的是,細胞基因沒有固定文本序列,語言模型成熟的訓(xùn)練約束規(guī)則完全無法復(fù)用,整套訓(xùn)練邏輯需要從零設(shè)計。
“傳統(tǒng)模型是讓模型復(fù)刻輸入,我們要做的,是讓模型學(xué)會預(yù)測細胞另一維度的隱藏狀態(tài)。” 團隊解釋底層思路。
在Transformer時代,大家常習(xí)慣用完形填空的方式訓(xùn)練模型,讓它猜出蓋住的基因。
這樣的方式只會記憶數(shù)據(jù),而細胞狀態(tài)變化是無數(shù)微弱基因信號共同作用的結(jié)果,單純記憶無法捕捉動態(tài)規(guī)律。JEPA的核心價值,是在隱空間跨視角預(yù)測細胞表征,剝離測序數(shù)據(jù)噪聲,鎖定穩(wěn)定、真實的生物學(xué)特征。
為了落地這套架構(gòu),團隊設(shè)計了獨一份的雙視角觀測體系,也是 CellOS 區(qū)別于所有競品的核心創(chuàng)新:
1、 表達視角(Expression View):清點全部基因表達豐度,還原細胞靜態(tài)基因構(gòu)成;
2、 感知視角(Perception View):計算驚奇分數(shù) Surprisal Score,篩選相較于細胞群體,具備高生物學(xué)價值的關(guān)鍵信號。
兩套視角協(xié)同工作:模型先按基因表達量排序全部信息,再由感知視角過濾無效噪聲,精準捕捉細胞分化、遷移、病變的關(guān)鍵轉(zhuǎn)折節(jié)點。
![]()
Expression View和Perception View的協(xié)同作用機制
為承載雙視角聯(lián)合建模的巨大算力需求,CellOS采用了Dense-to-MoE 三階段訓(xùn)練策略,從輕量化密集模型逐步擴容至 12B 混合專家大模型,全程保留模型已學(xué)習(xí)的生物學(xué)知識,避免擴容后性能滑坡。
整套訓(xùn)練數(shù)據(jù)集規(guī)模創(chuàng)下全球公開模型新高:覆蓋 47845 組測序樣本、3.9 億單細胞轉(zhuǎn)錄組,其中 3.46 億細胞附帶完整精細注釋。
楊帆表示,這是目前全球已公開模型中的最大規(guī)模單細胞基礎(chǔ)模型,3.905 億個人類單細胞轉(zhuǎn)錄組幾乎覆蓋所有重要的人類細胞類型。
![]()
全球主流單細胞模型參數(shù)量對比
03
數(shù)據(jù)全方位碾壓主流競品
路線是否成立,最終要靠對照實驗給出答案。
百曜科技用多組橫向評測,向我們驗證了雙視角JEPA架構(gòu)的絕對優(yōu)勢。
■ 細胞注釋與批次整合:兼顧噪聲消除與生物信息留存
在統(tǒng)一細胞注釋基準測試中,CellOS 生物學(xué)保守分數(shù)達到 0.792,大幅領(lǐng)先 UCE、scGPT、TranscriptFormer 等主流模型。
面對 T 細胞細分亞群、免疫衰老、iPSC誘導(dǎo)多能干細胞分化這類極難區(qū)分細微差異的樣本,模型依舊能精準識別細胞狀態(tài)分層。
批次整合場景下,它平衡了測序技術(shù)偏差與原生生物學(xué)信號:雖然批次混合指標略低于 STACK,但在減少批次效應(yīng)的同時,更好保留細胞狀態(tài)相關(guān)的生物學(xué)信息,更貼合科研與藥企的真實分析需求。
![]()
CellOS在細胞注釋和整合任務(wù)中的評估
■ 藥物/基因擾動預(yù)測:拉開66%性能差距,行業(yè)斷層領(lǐng)先
擾動響應(yīng)預(yù)測是AI制藥最核心的落地指標,直接決定模型能否提前預(yù)判藥物對人體細胞的作用效果。
核心指標 Pearson_edist 上,CellOS得分 0.619,是所有參評模型里唯一突破 0.6 閾值的方案;對比此前最優(yōu)開源模型 TranscriptFormer(0.373),性能提升幅度高達 66%。
散點對照圖清晰可見:CellOS 同時擁有極高生物學(xué)一致性與擾動保真度,落在行業(yè)最優(yōu)的理想?yún)^(qū)間內(nèi)。
![]()
CellOS在藥物/基因擾動響應(yīng)預(yù)測與主流模型的橫向?qū)Ρ葘嶒?/p>
■ 消融實驗驗證架構(gòu)正確性:參數(shù)越大,性能穩(wěn)定正向增長
團隊做了 0.2B、2B、12B 三組參數(shù)規(guī)模消融對照,ARI、NMI、ASW 三項聚類指標全部隨模型擴容持續(xù)上漲,沒有出現(xiàn)性能瓶頸。
穩(wěn)步向上的增長曲線,直接印證JEPA+MoE雙視角路線具備可持續(xù)縮放能力,不存在傳統(tǒng)模型 “數(shù)據(jù)越多越失效” 的短板。
![]()
CellOS參數(shù)消融實驗曲線
“這條清晰向上的性能曲線,是我們研發(fā)路上最實在的正向反饋。” 楊帆談及長達數(shù)年的技術(shù)攻堅,語氣平靜卻篤定。
![]()
全球各AI虛擬細胞基礎(chǔ)模型對比(部分)
04
預(yù)測細胞,才是AI制藥下一輪真正的革命
數(shù)年以來,AI對生命科學(xué)的改造,始終停留在分子層面:AlphaFold 預(yù)測蛋白質(zhì)結(jié)構(gòu)、生成式AI設(shè)計新藥分子、自動化工具完成藥物初篩。
這些工具大幅壓縮新藥研發(fā)周期。
疾病進展、藥物藥效釋放、人體免疫激活,所有生理變化,本質(zhì)都是細胞狀態(tài)持續(xù)演化的結(jié)果。
研究者已逐漸形成共識:能推動AI制藥行業(yè)跨越式升級的,從來不是預(yù)測單個分子,而是完整模擬細胞動態(tài),推演整套生命系統(tǒng)。
AI虛擬細胞,也因此成為全球生命科學(xué)、生物醫(yī)藥、資本圈共同押注的核心賽道。
全球科研院所、創(chuàng)新藥企、AI 技術(shù)公司,都在圍繞 “可模擬、可預(yù)測、可定向設(shè)計的虛擬細胞” 持續(xù)布局。
在此之前,行業(yè)始終困在語言模型的固有框架里,無法真正讀懂細胞;而 CellOS 的出現(xiàn),這條全新的 LLM-JEPA 技術(shù)路線,似乎給出了一套經(jīng)過海量數(shù)據(jù)驗證的可行方案。
人類完整預(yù)測生命系統(tǒng)的目標,或許不再是遙遠的學(xué)術(shù)設(shè)想,而是逐漸清晰的落地路徑。
*封面圖片來源:AI生成
文|趙泓維
微信|qq850860074
添加時請注明:姓名-公司-職位
聲明:動脈網(wǎng)所刊載內(nèi)容之知識產(chǎn)權(quán)為動脈網(wǎng)及相關(guān)權(quán)利人專屬所有或持有。未經(jīng)許可,禁止進行轉(zhuǎn)載、摘編、復(fù)制及建立鏡像等任何使用。文中如果涉及企業(yè)信息和數(shù)據(jù),均由受訪者向分析師提供并確認。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.