引言

我们在 等变神经网络:原理与脉络 中梳理了等变网络的原理与历史。Tensor Field Networks和SE(3)-Transformer在2018-2020年就搭好了理论框架,但真正让整个力场社区转向等变架构的,是2022年发表在Nature Communications上的NequIP——Batzner、Musaelian等人(哈佛Boris Kozinsky组)的工作。

它回答的问题朴素而致命:等变性到底值多少数据?答案是一千倍。

架构设计

NequIP的骨架是标准的等变消息传递网络,每一层做三件事。

第一步:几何编码。对每条边计算方向单位矢量并展开为球谐函数:

同时距离$r_{ij}$经Bessel基展开后送入一个小的MLP,生成逐边的径向权重$W_{ij}(r_{ij})$。

第二步:张量积卷积。邻居特征与球谐滤波器做Clebsch-Gordan耦合,再按径向权重加权聚合:

特征本身按irrep组织为$\bigoplus_l \mathbb{R}^{2l+1}$的形式,典型配置取$l_{\max}=1$或$2$——阶数不高,这是NequIP速度快的重要原因之一:它证明了低阶等变就已经足够收获大部分收益

第三步:门控非线性与残差更新。用$l=0$标量分量生成门控信号缩放高阶分量,保持等变性的同时引入非线性;随后做交互块间的残差连接。

能量头把最后一层的$l=0$分量过两层MLP后按原子求和:

由于整条链路严格等变,求导得到的力自动满足旋转协变性和牛顿第三定律,不需要任何对称化后处理。训练目标是能量、力的加权最小二乘,可选加入偶极矩监督。

样本效率:数量级的提升

NequIP最著名的实验结论来自MD17基准(八个有机分子的DFT轨迹)。此前最好的不变网络需要约百万构型才能把力误差压到0.9 meV/Å量级,而NequIP只需一千个构型就达到了相当的精度——数据需求降低三个数量级。

这个结论在更难的体系上被反复验证:水相、LiMoS₂、石蜡分子……规律一致。样本效率的意义远不止省钱:高通量DFT计算正是MLIP工作流中最昂贵的一环,三个数量级的数据缩减意味着原本不可行的”按需生成高精度训练集”变成了日常操作。

此外NequIP的外推行为也明显更稳:对超出训练分布的构型,它的势能面不会像不变网络那样出现灾难性的锯齿,这要归功于等变约束本身就是一种强正则化。

影响与局限

NequIP的影响怎么估计都不为过。它之后,力场领域的新模型几乎默认是等变的:同组的Allegro沿用了其核心算子但重构了信息流(见 Allegro:为十亿原子而生的严格局域等变势 ),剑桥Csányi组的MACE则在其上叠加了多体关联(见 MACE:高阶等变消息传递与原子簇展开 )。可以说后续所有等变力场都在NequIP划定的坐标系里做增量改进。

它的局限同样清晰。其一,全局消息传递使得通信开销随体系增大而上升,不利于超大规模并行——这正是Allegro要解决的问题。其二,两体消息传递的表达力有上限,多体关联只能靠堆层数隐式获得——这是MACE的切入点。其三,CG张量积的计算开销在高阶时失控——这条线后来由eSCN接手(见 eSCN:把SO(3)卷积拆成稀疏矩阵 )。