Agent / 分析
「我们有语言基础模型,但没有物理基础模型」——加州理工教授 Anima Anandkumar
加州理工学院计算机教授 Anima Anandkumar 在 AI 领域深耕二十余年,近年将研究重心转向物理世界的连续系统建模。她带领团队开发了 FourCastNet,这是首批能与传统物理仿真媲美的开源 AI 天气预报模型之一,普通消费级 GPU 即可运行。她的核心技术突破在于神经算子(Neural Operators)——一种将数据与物理定律相结合、支持多尺度输入输出的新型网络架构。与语言模型依赖海量 token 的路径不同,物理系统建模面临数据稀缺、分辨率极高的双重挑战:工业级物理仿真所需的上下文长度可达数千亿乃至万亿,Transformer 架构在此几乎无从施展。Anima 的方法论是将物理先验和归纳偏置内嵌进网络结构,以更少的数据实现更高效的建模,并最终指向一个跨越多种物理现象的「物理基础模型」。
几年前,Anima Anandkumar 决定构建首个开源 AI 天气模型时,业界普遍持怀疑态度。天气系统混沌复杂,传统物理仿真已发展数十年且依赖超级计算机,开放数据集也极为有限。然而她的团队在不到一年内便推出了 FourCastNet,其预测精度可与最先进的物理仿真方案相抗衡,且任何人使用消费级 GPU 即可在短时间尺度内完成准确预报。这一成果催生了整个 AI 气象预报领域的快速发展。
Anima 的核心理论贡献是神经算子(Neural Operators)。与传统神经网络对固定网格建模不同,神经算子将每一层视为一个函数,从而实现对连续演化过程的多尺度建模。这一框架允许研究者将物理直觉转化为网络的归纳偏置,而非单纯依赖数据拟合。其中,傅里叶神经算子(Fourier Neural Operator)直接在频域中学习,其球面变体则为 FourCastNet 提供了稳定的全球天气建模能力,预测窗口从数天延伸至数月。
物理世界建模面临的最大障碍之一是数据与计算的双重瓶颈。许多物理领域的开源数据集仅有数万至数十万样本,远不足以满足 Transformer 的需求。更关键的是,工业级物理仿真所需的空间分辨率会将上下文长度推至数千亿乃至万亿量级。Anima 直言:「全球所有算力加在一起,也不足以支撑这种规模的 Transformer。」这意味着单纯的规模扩展路线在此行不通,必须另辟蹊径。
令人惊喜的是,物理世界对数据的容忍度往往超出预期。在核聚变领域,仅凭数千个样本,神经算子便能预测等离子体扰动,速度比传统仿真快出百万倍。这并非对规模化思路的否定,而是一条通往规模化的不同路径——通过将物理世界本身已有的结构内嵌进模型,而非等待永远不会出现的海量数据。Anima 的终极目标是构建一个能够跨越多种物理现象、同时支持仿真与设计的「物理基础模型」。
除天气和聚变之外,Anima 的研究版图还延伸至 AI 与形式化验证的交叉地带。她的团队开发了 TorchLean 框架,允许研究者在证明助手 Lean 中编写 PyTorch 风格的网络并对其进行形式化验证。这对于将神经网络嵌入安全关键控制系统(如聚变反应堆控制回路)具有重要意义。此外,Anima 近期还被任命为联合国科学咨询委员会成员,致力于将循证视角引入政策制定,推动科学 AI 惠及全球。
要点
- 物理世界建模无法复制语言模型的规模化路径,工业级仿真所需上下文长度可达万亿量级,Transformer 架构在此面临根本性瓶颈
- 神经算子通过将物理先验和归纳偏置内嵌进网络结构,实现了以极少数据完成高效建模,核聚变等离子体预测仅需数千样本即可达到百万倍加速
- FourCastNet 将球面谐波内嵌进网络基底,使全球天气预报在消费级 GPU 上实现月级稳定预测,开创了开源 AI 气象建模先例
- TorchLean 框架将神经网络与形式化证明结合,为安全关键物理系统中的 AI 应用提供了可验证的理论保障
- Anima 的长期目标是构建跨越多种物理现象的「物理基础模型」,这条路比语言模型更长,但结构化归纳偏置正在加速这一进程
原始标题:🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。