Shift Bioscience 發表校準框架,AI 虛擬細胞模型預測能力獲重新評估
Shift Bioscience 與合作者在《Nature Biotechnology》發表論文,橫跨 14 個基因擾動資料集、18 種評估指標,發現 mean squared error 等常用指標校準度差,改用 WMSE、NIR 等加權或排名型指標後,scGPT、GEARS 等早期深度學習模型能超越無資訊基準線;更新的 PRESAGE、scLambda 表現更強。公司計畫將此框架應用於細胞老化與纖維化靶點篩選。
AI 虛擬細胞的價值在於大規模 in silico 篩選取代濕實驗,但若評估工具本身就測不準,整個藥物研發界選模型、選研究方向都可能答錯。這套校準框架讓方法論有了可複製的標準,正在評估是否導入虛擬細胞工具的生技公司,現在有了更可信的判斷依據。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
過去兩年,學界對 AI 虛擬細胞模型普遍存在一個判決:深度學習系統屢屢輸給簡單基準線,做不到真正預測基因擾動對細胞的影響。但 Shift Bioscience 在《Nature Biotechnology》發表的新研究指出,問題不完全出在模型本身,而是出在評估工具太鈍。
核心論點是這樣的:過去慣用的評估指標(如 mean squared error、control-referenced Pearson correlation)在擾動訊號較弱的資料集裡校準度很差,根本分不清「模型抓到了真正的生物訊號」和「模型瞎猜」之間的差距。Shift Bioscience 團隊橫跨 14 個基因擾動資料集、18 種評估指標,做了系統性測試,發現加權型與排名型指標(WMSE、weighted RΔ2、NIR)在各資料集的校準表現一致較高——它們的共同設計邏輯,是把重點放在擾動特異性訊號上,而不是平均誤差。

更關鍵的是方法論的兩項設計:一是「插值複製」正對照(interpolated duplicate positive control),把平均擾動輪廓與獨立技術複製按每個基因的證據強度加權合併,做出一個「理想但可達到的上限」;二是動態範圍分數(DRF),用來量測一個指標能把正對照和負對照分開多少,讓研究者可以事先篩掉沒有辨別力的指標,而不是在結論出爐後才懷疑自己的測量工具。
用校準過的指標重新評估之後,早期模型(scGPT、GEARS)其實能超越無資訊基準線,只是以前的測量工具沒抓到。更新的系統(PRESAGE、scLambda)整體表現更強。此外,訓練資料的覆蓋密度是另一個決定性因素:Norman19 資料集只覆蓋 0.63% 的可能基因組合,簡單加法基準線反而難以打敗;Wessels23 覆蓋 10.3%,多個深度學習模型就能超越加法基準線——意思是模型能學到非線性的基因交互作用,前提是訓練資料要夠廣。
這對產業的意義不僅是「模型比你想的強」這麼簡單。AI 虛擬細胞的應用價值在於用大規模 in silico 篩選取代或大幅減少濕實驗,尤其是在治療靶點發現上。如果這類模型的表現因為測量工具問題被系統性低估,等於整個藥物研發界都在用錯誤的儀器做決策——哪些模型值得繼續投資、哪些研究方向值得追進,全部都可能答錯。
Shift Bioscience 自己打算把這套框架直接套進靶點識別程序,第一個聚焦場景是纖維化相關的細胞老化逆轉。這是他們從方法論貢獻到商業應用的直線:先讓測量工具可靠,才知道模型能不能用,再決定要在哪個治療領域押注。對其他正在評估是否導入 AI 虛擬細胞工具的生技公司來說,這篇論文的訊息很直接:現在的評估框架可能讓你少算了模型的真實能力,而校準框架本身已經有具體的可複製方法。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 129 期 ・ 隨時可退訂

