一句话定位

EquiformerV3(arXiv:2604.09130)是等变图注意力 Transformer 的第三代,把”软件加速 + 注意力微改 + 新激活函数”三路增量合成一体。它与 DeNS 去噪配合,在 OC20、OMat24、MatBench Discovery 三个榜单同时拿到 SOTA——在通用势榜单上以 F1 0.931 登顶稳定性分类,CPS 0.902 稳居头部。

它回答了上一章 eqV2 留下的问题:等变 Transformer 家族能不能在”不牺牲物理平滑性”的前提下把精度推到顶尖? 答案是可以——只要用对激活函数。

eqV2 的教训:一段前置史

在讲 EquiformerV3 之前,必须先交代它的大哥 eqV2 留下的遗产。

eqV2(Meta FAIR, 2024,arXiv:2410.12771)是”把催化竞速模型 EquiformerV2 直接当通用势用”的尝试:在 MPtrj + OMat24 上训练,30M-90M 参数档,配 DeNS 去噪预训练。它的 F1 一度很高(0.917),但 $\kappa_\text{SRME}=1.771$ 全场最差之一——因为它是直接力模型(模型直接输出力,而非能量梯度),力的小位移噪声毁掉了声子谱类下游任务。

eqV2 的故事以”大参数量路线的预演 + 直接力教训”载入史册(详细剖析见 eSEN:平滑能量网络,平滑 + 保守力路线的常青树 的声子辩论表)。它对后续的最大贡献是反向的:让行业确立了”保守力 + 平滑势能面”才是通用势的正道。EquiformerV3 正是带着这个共识回归的——它用能量梯度产生力,全程保守。

EquiformerV3:三大增量

EquiformerV3 的三处关键改动(相对 EquiformerV2):

1. 软件层 1.75× 加速:纯实现层面的优化,没有改变模型语义。这让更大规模、更多数据的训练变得可行。

2. 三处架构微调:

  • 等变合并层归一化(equivariant merged layer norm)——把标量流与等变流做联合归一化,让两条流的尺度可比;
  • 改进的 FFN 超参——调整前馈网络结构;
  • 平滑半径截断注意力(attention with smooth radius cutoff)——注意力权重在截断半径附近平滑衰减,避免邻居进出截断边界带来的不连续。

这三条单独看都不起眼,合起来是”平滑性”的重要来源——配合能量梯度产生力,让势能面连续可导。

3. SwiGLU-S² 激活(核心增量):这是 EquiformerV3 区别于前两代的真正创新,下面单独展开。

SwiGLU-S²:为什么能同时保等变与降采样复杂度

SwiGLU-S² 解决的是一个长期矛盾:多体相互作用 vs 严格等变 vs 采样复杂度。

等变网络想表达多体相互作用(三体、四体关联),传统做法是把节点特征投影到 $S^2$ 球面上的离散网格(如经纬网格)再做逐点非线性。但离散网格有两个致命问题:

  1. 等变破坏:网格旋转后节点位置变了,除非网格足够密,否则旋转不变性只是近似;
  2. 高频污染:网格采样不足会引入超越 Nyquist 频率的高频信号,破坏严格等变与能量守恒(这正是 eSEN 批评 eSCN/EquiformerV2 的点,见 eSEN:平滑能量网络,平滑 + 保守力路线的常青树 架构部分)。

SwiGLU-S² 的做法:用 S² 上的连续球谐函数做激活。具体说,它把等变特征表示成 $S^2$ 上的函数,用 SwiGLU 门控的平方-线性结构在连续域做非线性,再投影回不可约表示系数。这样:

  • 严格等变:球谐函数在旋转下是闭包的,连续域运算天然等变,不需要网格;
  • 降复杂度:避免了显式 $S^2$ 网格采样,采样点数从 $O(L^2)$ 降到球谐系数规模;
  • 多体信息:逐点相乘/门控在 $S^2$ 上等价于引入三体以上的角关联,理论上比纯球谐张量积表达力更强。

一句话:SwiGLU-S² 用”连续球谐 + 门控”同时拿下了等变性、平滑性和多体表达力——这也是它能支持能量保守模拟和高阶导数的关键。

榜单成绩

在 MatBench Discovery 榜单上(数据截至 2026-09-23):

指标 EquiformerV3+DeNS-OAM EquiformerV3+DeNS-MP
CPS 0.902 0.830
F1(稳定性分类) 0.931(榜首) 0.863
κSRME 0.118 0.275
RMSD 0.0595 0.0701
参数 30.3M 30.3M
训练数据 MPtrj+OMat24+sAlex MPtrj

几个值得注意的点:

  1. F1 0.931 是榜单最高的稳定性分类分数(数据截至 2026-09-23),说明它的能量排序能力顶尖;
  2. $\kappa_\text{SRME}=0.118$ 远好于 eqV2 的 1.771——同一家族,从直接力改回保守力 + 平滑激活后,声子物理彻底修复,这正是 eSEN:平滑能量网络,平滑 + 保守力路线的常青树 论点的家族内部复现;
  3. 30.3M 参数拿到 0.902 CPS——参数效率远超 PET-OAM-XL(730M、0.898),接近 GRACE-3L(42.1M、0.900)的水平。

局限与影响

局限:

  1. F1 与 CPS 的错位——稳定性分类拿了第一(0.931),但 CPS 只有 0.902(第 4),说明它的几何优化(RMSD 0.0595,第 5)和声子(κSRME 0.118,第 4)单项并非统治级;
  2. DeNS 依赖——它的成绩建立在 DeNS 去噪预训练之上,训练流程比”纯保守 + 编译加速”的 DPA-4 复杂;
  3. 30M 档规模——还没有 TECE(222M)、Prophet(62.3M)那样的大规模版本登顶。

影响:

  1. 证明等变 Transformer 家族路线没有走死——eqV2 的直接力翻车不代表架构失败,改回保守力 + 平滑激活后立刻回到榜首梯队;
  2. SwiGLU-S² 成为”严格等变 + 连续域非线性”的示范,后续模型(如 EquFlash 系列)大量沿用类似思想;
  3. 与 DPA-4 的对比构成 2026 年的双雄叙事:一个用纯保守训练 + 编译加速(DPA-4),一个用 DeNS + 新激活(EquiformerV3)——两条路都拿到了头部精度(对比表见 DPA系列:从注意力势到大模型时代的精度-成本前沿)。

参考文献

  1. Liao, Y.-L., Hoffman, A. J., Shen, S. C., Duval, A., Norwood, S. W., Smidt, T. EquiformerV3: Scaling Efficient, Expressive, and General SE(3)-Equivariant Graph Attention Transformers. arXiv:2604.09130, 2026.
  2. Shoghi, N., et al. From Molecules to Materials: Pre-training Large Generalizable Models for Atomic Property Prediction (eqV2/DeNS). arXiv:2410.12771, 2024.