引言:精度与效率的困境

我们在晶格动力学中提到过,在绝热近似下,固体的总能量可以写成原子核动能加势能项的形式。这个势能面$E(\{\vec{R}_i\})$原则上由电子结构决定,解这个方程是困难的,我们通常借助DFT来处理它,具体可以参考 第一性原理计算方法Content 。然而DFT的计算量随体系大小以三次方以上的速度增长,能够处理的原子数目不过上千;而分子动力学模拟动辄需要演化纳秒甚至微秒,涉及数十万个原子的体系,DFT在这里完全无能为力。

另一条路是经典力场。经典力场把原子间相互作用写成键长、键角、二面角等经验项的函数,计算成本极低,可以模拟百万原子的体系。但代价是它本质上无法描述化学键的断裂与生成,对电荷转移、极化等量子效应也只能望洋兴叹。

于是问题变成了:能不能构造一个力场,它既有DFT的精度,又有经典力场的效率?机器学习分子力场(Machine Learning Interatomic Potential, MLIP)给出的答案是肯定的。它的核心思想可以概括为一句话:

其中$\epsilon_i$是分配给第$i$个原子的局部能量,$\mathcal{X}_i$是描述其局部化学环境的特征表示。整个框架的成败取决于两个问题:如何为原子环境构造一个好的表示$\mathcal{X}_i$,以及如何从数据中学出从表示到能量的映射。过去二十年MLIP的发展史,几乎就是第一个问题的答案不断演进的历史。

前史:从描述符到端到端

2007年,Behler和Parrinello提出了高维神经网络势(HDNNP),这是现代MLIP公认的起点。他们用一组手工设计的对称函数(径向和高斯型角度函数)把每个原子的环境编码成固定维度的向量,再送入一个小型全连接网络输出原子能量。对称函数的精心设计保证了能量在平移、旋转和同种原子置换下不变——这三条对称性至今仍是所有力场模型必须满足的硬约束。

在此之后,基于描述符的势函数蓬勃发展:GAP引入核方法与SOAP描述符,MTP采用矩张量基组,DeePMD用深度网络改造描述符。这些方法证明了”学出来的势能面可以达到耦合簇精度”,但手工描述符始终有一个天花板:它是固定的、与任务无关的特征,信息瓶颈不可避免。

消息传递框架的提出

突破发生在2017年。Gilmer等人针对分子性质预测提出了消息传递神经网络(Message Passing Neural Network, MPNN)框架,指出当时五花八门的图神经网络其实都可以统一成同一个范式:

其中$h_i^{(t)}$是第$t$轮迭代时原子$i$的特征,$e_{ij}$是边(键)特征,$M_t$是消息函数,$U_t$是更新函数。每一轮迭代中,原子向邻居发送消息并聚合更新自己的表示,$T$轮之后每个原子就”看到”了半径为$T$层邻域的全部信息。

MPNN对MLIP的意义在于:原子环境的表示不再需要人工设计,而是作为网络的中间产物被端到端地学出来。描述符时代的天花板被掀开了。同年SchNet把这个框架第一次完整地搬进了力场领域,从此GNN成为MLIP的主流载体。

不变神经网络

沿着MPNN路线的第一代力场模型,我们统称为不变神经网络:它们输出的原子能量在任意旋转下严格不变,即

实现方式是把原子间的几何信息全部压缩成旋转不变的标量——键长,或者更进一步,键角。这条线上的四个代表工作构成了清晰的进化链:

模型 年份 核心创新 引入的几何信息
SchNet 2017 连续滤波卷积 距离
PhysNet 2019 显式静电与色散项 距离 + 物理先验
DimeNet 2020 方向消息传递 键角
GemNet 2021 两跳有向消息传递 键角 + 二面角

SchNet用径向对称的连续滤波器替代各向异性的滤波器,天然满足旋转不变性;PhysNet发现显式加入静电相互作用的长程渐近行为对定性正确至关重要;DimeNet意识到只看距离会把方向信息丢得一干二净,于是把消息嵌入到以相邻键方向定义的坐标系里,首次实现了对键角的编码;GemNet则证明了两跳消息传递的数学表达力上限更高。

这四个模型的详细解析见 不变神经网络:从SchNet到GemNet 。到GemNet为止,不变网络的精度已经相当可观,但一个根本性的矛盾也逐渐暴露出来。

等变神经网络

矛盾在于:能量是不变的标量,但力是等变的矢量。力$\vec{F}_i=-\partial E/\partial \vec{R}_i$在坐标系旋转时会跟着旋转。不变网络把中间表示全部压成标量,虽然最终能量没问题,但网络内部不得不”绕远路”重新拼凑方向信息;更本质的问题是,分子的很多物理量本身就是张量——偶极矩是矢量、极化率是二阶张量、电荷密度是自旋标量场——把它们全部塞进标量表示无异于削足适履。

出路是把对称性要求从”不变”放宽到”等变”:

即输入旋转多少,输出就跟着旋转多少。这就是等变神经网络(E(3)-equivariant neural network)的核心思想,也是2021年之后MLIP领域的主旋律。技术上它依赖不可约表示(irreducible representation)语言:原子特征不再是标量数组,而是按角动量阶数$l=0,1,2,\dots$组织的不可约表示张量的直和,层与层之间通过球谐函数展开和Clebsch-Gordan张量积耦合。

这条主线的代表工作同样构成一条清晰的链:NequIP首次证明等变消息传递能带来数量级的样本效率提升;Allegro把它推广到纯局域的strictly-local架构;MACE用多体关联的消息传递把表达力推上新台阶;Equiformer系列把等变性嫁接到Transformer上并向大规模训练演化,其中EquiformerV2借助eSCN卷积解决了高阶球谐的计算瓶颈,eSEN则在保持精度的同时大幅改善了力的质量。这些工作的详细解析见:

等变架构的成熟直接催生了下一个时代的到来:当单次训练就能覆盖元素周期表的通用势成为可能时,竞争的主战场就从架构转向了数据和基准。

通用大模型时代

2023年前后,MLIP领域发生了类似自然语言处理中”预训练大模型”的转折。转折的前提有两个:一是高通量DFT数据库的规模终于跨过了千万结构的门槛,二是等变GNN的训练效率足以消化这些数据。

数据集方面,Materials Project的MPtrj(158万结构)、Open Catalyst系列的OC20(1.3亿吸附构型)、Alexandria及其子采样版sAlex(数千万+1100万结构)、微软的MatterSim数据集(1700万结构)、Meta的OMat24(1亿结构)与OMol25(1亿+分子团簇),以及KAIST整合十五个公开库、共2.4亿结构的COSMOS数据集相继登场。它们覆盖了晶体、表面、分子等不同的化学空间,也各有不同的理论水平(PBE、r2SCAN、ωB97M-V……)。详见 通用势的数据集版图

基准方面,Matbench Discovery以WBM测试集上的晶体稳定性预测为核心任务,用F1、DAF以及后来的综合指标CPS给通用势排出座次,是目前公认最重要的晶体领域榜单;OC20排行榜则统治着催化领域。详见 通用势的竞技场:MatBench Discovery与OC20

模型方面,MACE-MP-0、EquiformerV2、CHGNet、M3GNet率先验证了”一个模型走遍周期表”的可行性;此后GRACE、ORB、SevenNet-Omni、DPA-2/DPA-3、PET等新模型不断刷新纪录,Meta的UMA则试图用一个模型同时吃下催化、材料、分子、生物多个领域。截至写作时,MatBench Discovery榜首已被TECE、EquFlashV2、EquiformerV3+DeNS等在合并数据集上训练的新一代模型占据,F1突破0.93。详见 通用势模型巡礼:从MACE-MP-0到UMA

训练方面,还有一根长期被忽视的设计轴刚刚被撬动:几乎所有MLIP的默认优化器都是Adam/AdamW,而LLM领域复兴的矩阵结构优化器(Muon、SOAP)正把目光引向这里——哈佛Kozinsky组2026年的系统对比表明,换用SOAP类优化器可以让NequIP/Allegro的训练收敛快近5倍,力标签减半仍不掉精度。详见 优化器:从SGD、AdamW到Muon与SOAP

EGNN之外的其他框架

以上主线之外,还有几条不容忽视的技术路线,它们大多不依赖E(3)等变的图卷积:

核方法与描述符回归。GAP、MTP、NEP这一脉至今仍在小数据、高精度的场景中占有一席之地,因为它们的归纳偏置更强,几十至几千个结构的数据集上往往比深度网络更稳。

DeepMD家族。DeePMD的描述符-拟合器分离设计使其在大规模并行模拟上无可匹敌,十亿原子级的模拟纪录至今仍由DP系列保持。DPA-1/2/3正是在这个骨架上发展起来的通用势。

非等变Transformer。PET和ORB用纯Transformer架构直接处理点云,放弃了显式的等变约束,靠大规模数据和数据增广硬扛对称性问题,在MatBench Discovery上取得了不逊于等变模型的精度,这至少说明等变性并非唯一答案。

线性代数加速路线。GRACE用ACE框架下的可学习基函数替代球谐张量积,在保持等变性的同时把推理速度提高了数倍;MACE的社区版本也在持续做算子融合优化。

这些路线与EGNN的关系不是取代而是互补:等变架构赢在数据效率和物理可解释性,非等变架构赢在工程灵活性和吞吐量。最终的赢家很可能是两者的混合体——事实上,最新的几个SOTA模型已经在这么做了。

结语

回顾这段不到二十年的历史:Behler-Parrinello确立了原子分解框架,MPNN解放了特征表示,不变网络逐步补齐了几何信息,等变网络让对称性内生于架构,通用大模型则把战场推向了数据与工程的全面竞争。每一步都是在前一步的天花板上凿开一个洞。

接下来的一系列文章会沿着这条线索逐一展开:我们先讲不变神经网络的四部曲 不变神经网络:从SchNet到GemNet ,再进入等变的世界 等变神经网络:原理与脉络 ,随后抵达通用大模型的前沿,最后聊一聊训练本身——从SGD到AdamW再到Muon与SOAP的优化器进化 优化器:从SGD、AdamW到Muon与SOAP