【對談】Anima Anandkumar:氣象,核融合,碳封存,neural operators 已在部署
物理世界的 AI 還欠一塊。語言模型每天都在搶頭條,但加州理工學院數學暨電腦科學 Bren 講座教授 Anima Anandkumar——曾先後主導 Amazon Web Services 雲端 AI 團隊,以及 NVIDIA AI 研究——最近在 Latent Space 這個面向 AI 與科學交叉領域的播客坐下來講了一件事:現在 AI 最難的問題,不是讓模型更會說話,而是讓它能正確模擬真實世界的物理現象。外界爭論 AI 何時能取代科學家;她已經在氣象預報,核融合反應爐,碳封存上跑出具體成績。這場訪談值得注意,正是因為她不在哲學層次討論 AI 的未來——她在工程層次示範它現在能做什麼。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談有幾個值得說的點。第一,neural operators(神經算子)這個技術架構讓 AI 氣象預報達到傳統超級電腦等級的精度,但快了數萬倍;第二,從氣象到核融合到碳封存,同一套底層邏輯正在複製;第三,她做的 TorchLean 框架,試圖讓神經網路的行為可以被數學嚴格驗證——這是 AI 進入核電廠控制迴路的必要條件;第四,物理世界的 AI 不能只靠資料,球形地球,守恆定律這些結構如果沒有硬編進模型,長期預測就會爆掉;第五,她對整件事的態度是:資料稀少不是障礙,因為物理世界本身就有大量潛在結構等著被挖出來。合起來的意思是:AI for science 和 ChatGPT 那條路是兩件完全不同的事。
◎氣象預報:數萬倍速度,消費級 GPU 跑得動
2021 年,Anandkumar 的團隊拿了一份叫做 ERA5 的開放氣象資料集——由歐洲中期天氣預報中心(ECMWF)整理的全球歷史氣象再分析資料——去訓練 neural operators。氣象科學家當時警告:別白費力氣,傳統物理建模已經累積幾十年,AI 不可能追上。結果出來,精度幾乎與傳統模型持平,速度快了數萬倍,一張消費級顯示卡就跑得動。這件事改變了整個領域的想法。DeepMind,華為隨後一年內各自跟進發布自己的模型。她的團隊是第一個開放原始碼,採用寬鬆授權的——這個決定讓全球氣象機構和小型研究單位都能直接在上面建東西。ECMWF 在 2023 年秋天正式把這類 AI 氣象模型公開上線,之後颶風 Lee 的登陸時間被準確預測出來,比傳統模型早了好幾天。這不是示範,這是部署。
◎球形地球不是小細節,而是長期預測的生死線
ForecastNet 三個版本的演進路線說清楚了一件事:把世界假設成一個矩形,短期預測還撐得住,長期就爆。第一版用了傅立葉神經算子但忽略球形幾何,第二版把地球的球面幾何硬編進去,第三版在此之上加入集成預測(ensemble prediction)——也就是對初始條件加入不同程度的噪音,跑出多條可能軌跡,給出各地區的登陸概率。氣候模型和天氣模型的最大差別就在這裡:不是精度,是能不能反覆往後跑幾個月還不崩潰。Allen AI Institute 現在用她們的 neural operator 架構建氣候模型,她說這是目前唯一一個作為 AI emulator 能跑起來的方案。球形假設不是學術上的潔癖,是工程上的必要條件。
◎核融合反應爐:一百萬倍加速,下一步是預防崩潰
核融合反應爐的 plasma(電漿)有一個叫 disruption 的現象:電漿突然聚成一道細束射向容器壁,可能損毀反應爐,之後只能關機。傳統模擬跑一次就已經很貴,她的團隊與英國原子能機構合作,用 neural operators 建了一個 plasma 的數位孿生體,速度比傳統模擬快了一百萬倍,在幾千筆訓練樣本下就能準確預測 disruption 事件。現在的下一步:把模擬和控制設計放在同一個迴路裡——能不能在 disruption 發生之前,透過調整磁場來穩住電漿?她同時在跑 tokamak 和 stellarator 兩種設計路線,不提前賭哪個贏。這個立場在物理實驗領域是奢侈的,在 AI 輔助設計的框架下是合理的。
◎TorchLean:讓神經網路進核電廠控制迴路之前先證明它安全
神經網路進入控制系統,最缺的不是精度,是可驗證性。TorchLean 是她主導的框架,把神經網路寫進 Lean 這個數學形式驗證語言裡——Lean 是電腦科學界用來對數學定理做機器驗證的工具。這讓人可以對神經網路的行為做出可被機器驗證的數學保證:輸入被擾動一定範圍,輸出最多偏移多少?有限精度浮點運算帶來的誤差有多大?在核反應爐,無人機,任何要求不能出錯的控制場景,這種保證是進門票。目前的限制是 Lean 本身是 CPU-based,大型模型的規模化還有很多工作要做,但框架已經建好了。這條路徑和通用大型語言模型的方向完全不同——一個在追求更大更強,一個在追求可以被數學信任。
◎物理資料少不是弱點,是誤判
氣象模型訓練用了大約五萬筆全球氣象圖;核融合 disruption 預測只用了幾千筆。這個數字放在語言模型動輒數兆 token 的尺度旁邊,看起來微不足道。但 Anandkumar 的邏輯是反過來的:物理世界本身有大量結構,極端事件如颶風有非常具體的物理特徵,不是隨機發生的罕見雜訊。AI 從資料裡挖出的正是傳統數值方法太專注於「每個情況都要算對」而錯過的那些潛在規律。資料少不等於無法學習,等於要更謹慎地把物理約束放進模型。她說的是:守恆定律不是可選的正則化項目,是讓長期預測不爆炸的底線。
語言模型那條路已經有幾千億美元在跑。這場訪談讓人看清楚的是另一條路有多少實際成果,又有多少人在關注它。氣象預報,核融合,碳封存——這些不是 demo,是已經部署或正在部署的系統。Anandkumar 說她希望讓全球南方的小型氣象機構也能用上過去只有大型機構才負擔得起的預測能力,這件事已經在發生。AI for science 還沒有自己的 ChatGPT 時刻,但基礎設施正在悄悄蓋好。
開場即切入核心結論:2021 年團隊用 neural operators 訓練氣象模型,精度接近傳統模型,速度快數萬倍,一張消費級 GPU 即可運行。
解釋為何 TorchLean 存在:AI 語言模型能產生假說,但無法驗證;把神經網路寫進 Lean 形式驗證框架,才能在控制迴路裡給出數學保證。
說明 physics-informed neural networks(PINNs)的侷限:對時間相依,渾沌系統的最佳化難度太高,neural operators 透過引入資料來克服這個問題。
解釋 ForecastNet 三個版本的演進:第一版忽略球形幾何,第三版加入球面幾何與集成預測,才能做穩定的長期氣候滾動預測。
談物理世界資料稀少卻仍可學習的原因:極端事件如颶風有特定物理特徵,結構性強;核融合 disruption 用幾千筆樣本就能預測,速度比傳統模擬快一百萬倍。
展示 tokamak 核融合反應爐的 plasma 數位孿生模型,說明與英國原子能機構的合作現況,以及下一步將模擬與磁場控制設計整合進同一迴路的計畫。
談加入聯合國科學顧問委員會的立場:主張 AI 監管不應一刀切把語言模型與 AI for science 等同看待,兩者的風險與效益結構完全不同。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 95 期 ・ 隨時可退訂
