eqV3 / EquiformerV3:等变Transformer的第三代,平滑与榜首双收
一句话定位
EquiformerV3(arXiv:2604.09130)是等变图注意力 Transformer 的第三代,把”软件加速 + 注意力微改 + 新激活函数”三路增量合成一体。它与 DeNS 去噪配合,在 OC20、OMat24、MatBench Discovery 三个榜单同时拿到 SOTA——在通用势榜单上以 F1 0.931 登顶稳定性分类,CPS 0.902 稳居头部。
它回答了上一章 eqV2 留下的问题:等变 Transformer 家族能不能在”不牺牲物理平滑性”的前提下把精度推到顶尖? 答案是可以——只要用对激活函数。
eqV2 的教训:一段前置史
在讲 EquiformerV3 之前,必须先交代它的大哥 eqV2 留下的遗产。
eqV2(Meta FAIR, 2024,arXiv:2410.12771)是”把催化竞速模型 EquiformerV2 直接当通用势用”的尝试:在 MPtrj + OMat24 上训练,30M-90M 参数档,配 DeNS 去噪预训练。它的 F1 一度很高(0.917),但 $\kappa_\text{SRME}=1.771$ 全场最差之一——因为它是直接力模型(模型直接输出力,而非能量梯度),力的小位移噪声毁掉了声子谱类下游任务。
eqV2 的故事以”大参数量路线的预演 + 直接力教训”载入史册(详细剖析见 eSEN:平滑能量网络,平滑 + 保守力路线的常青树 的声子辩论表)。它对后续的最大贡献是反向的:让行业确立了”保守力 + 平滑势能面”才是通用势的正道。EquiformerV3 正是带着这个共识回归的——它用能量梯度产生力,全程保守。
EquiformerV3:三大增量
EquiformerV3 的三处关键改动(相对 EquiformerV2):
1. 软件层 1.75× 加速:纯实现层面的优化,没有改变模型语义。这让更大规模、更多数据的训练变得可行。
2. 三处架构微调:
- 等变合并层归一化(equivariant merged layer norm)——把标量流与等变流做联合归一化,让两条流的尺度可比;
- 改进的 FFN 超参——调整前馈网络结构;
- 平滑半径截断注意力(attention with smooth radius cutoff)——注意力权重在截断半径附近平滑衰减,避免邻居进出截断边界带来的不连续。
这三条单独看都不起眼,合起来是”平滑性”的重要来源——配合能量梯度产生力,让势能面连续可导。
3. SwiGLU-S² 激活(核心增量):这是 EquiformerV3 区别于前两代的真正创新,下面单独展开。
SwiGLU-S²:为什么能同时保等变与降采样复杂度
SwiGLU-S² 解决的是一个长期矛盾:多体相互作用 vs 严格等变 vs 采样复杂度。
等变网络想表达多体相互作用(三体、四体关联),传统做法是把节点特征投影到 $S^2$ 球面上的离散网格(如经纬网格)再做逐点非线性。但离散网格有两个致命问题:
- 等变破坏:网格旋转后节点位置变了,除非网格足够密,否则旋转不变性只是近似;
- 高频污染:网格采样不足会引入超越 Nyquist 频率的高频信号,破坏严格等变与能量守恒(这正是 eSEN 批评 eSCN/EquiformerV2 的点,见 eSEN:平滑能量网络,平滑 + 保守力路线的常青树 架构部分)。
SwiGLU-S² 的做法:用 S² 上的连续球谐函数做激活。具体说,它把等变特征表示成 $S^2$ 上的函数,用 SwiGLU 门控的平方-线性结构在连续域做非线性,再投影回不可约表示系数。这样:
- 严格等变:球谐函数在旋转下是闭包的,连续域运算天然等变,不需要网格;
- 降复杂度:避免了显式 $S^2$ 网格采样,采样点数从 $O(L^2)$ 降到球谐系数规模;
- 多体信息:逐点相乘/门控在 $S^2$ 上等价于引入三体以上的角关联,理论上比纯球谐张量积表达力更强。
一句话:SwiGLU-S² 用”连续球谐 + 门控”同时拿下了等变性、平滑性和多体表达力——这也是它能支持能量保守模拟和高阶导数的关键。
榜单成绩
在 MatBench Discovery 榜单上(数据截至 2026-09-23):
| 指标 | EquiformerV3+DeNS-OAM | EquiformerV3+DeNS-MP |
|---|---|---|
| CPS | 0.902 | 0.830 |
| F1(稳定性分类) | 0.931(榜首) | 0.863 |
| κSRME | 0.118 | 0.275 |
| RMSD | 0.0595 | 0.0701 |
| 参数 | 30.3M | 30.3M |
| 训练数据 | MPtrj+OMat24+sAlex | MPtrj |
几个值得注意的点:
- F1 0.931 是榜单最高的稳定性分类分数(数据截至 2026-09-23),说明它的能量排序能力顶尖;
- $\kappa_\text{SRME}=0.118$ 远好于 eqV2 的 1.771——同一家族,从直接力改回保守力 + 平滑激活后,声子物理彻底修复,这正是 eSEN:平滑能量网络,平滑 + 保守力路线的常青树 论点的家族内部复现;
- 30.3M 参数拿到 0.902 CPS——参数效率远超 PET-OAM-XL(730M、0.898),接近 GRACE-3L(42.1M、0.900)的水平。
局限与影响
局限:
- F1 与 CPS 的错位——稳定性分类拿了第一(0.931),但 CPS 只有 0.902(第 4),说明它的几何优化(RMSD 0.0595,第 5)和声子(κSRME 0.118,第 4)单项并非统治级;
- DeNS 依赖——它的成绩建立在 DeNS 去噪预训练之上,训练流程比”纯保守 + 编译加速”的 DPA-4 复杂;
- 30M 档规模——还没有 TECE(222M)、Prophet(62.3M)那样的大规模版本登顶。
影响:
- 证明等变 Transformer 家族路线没有走死——eqV2 的直接力翻车不代表架构失败,改回保守力 + 平滑激活后立刻回到榜首梯队;
- SwiGLU-S² 成为”严格等变 + 连续域非线性”的示范,后续模型(如 EquFlash 系列)大量沿用类似思想;
- 与 DPA-4 的对比构成 2026 年的双雄叙事:一个用纯保守训练 + 编译加速(DPA-4),一个用 DeNS + 新激活(EquiformerV3)——两条路都拿到了头部精度(对比表见 DPA系列:从注意力势到大模型时代的精度-成本前沿)。
参考文献
- Liao, Y.-L., Hoffman, A. J., Shen, S. C., Duval, A., Norwood, S. W., Smidt, T. EquiformerV3: Scaling Efficient, Expressive, and General SE(3)-Equivariant Graph Attention Transformers. arXiv:2604.09130, 2026.
- Shoghi, N., et al. From Molecules to Materials: Pre-training Large Generalizable Models for Atomic Property Prediction (eqV2/DeNS). arXiv:2410.12771, 2024.




