eSEN:平滑能量网络与力的质量
引言
eSEN(Fu et al., Meta FAIR, 2025)全称 equivalent smooth energy network,名字里的两个关键词——smooth 和 expressive——对应它要解决的两个问题:平滑性(力的质量)与表达力(消化亿级数据)。
等变网络走向大模型时代有一个绕不开的拦路虎:力的预测质量问题——许多高精度能量模型的力出现尖峰、噪声等病态行为,导致声子谱、过渡态搜索等下游任务翻车。神经网络势能面若不处处二阶可微,求导得到的力就会不连续,分子动力学轨迹上表现为能量的锯齿跳变和声子谱的鬼峰。eSCN解决了”算得动”(见 eSCN:把SO(3)卷积拆成稀疏矩阵),eSEN要解决的是”算得对”。
四层平滑性防线
eSEN把平滑性当作第一等设计目标,系统性构筑了四层防线:
1. 保守力:$F_i = -\partial E/\partial \vec r_i$(对能量做自动微分),保证能量守恒。训练时采用”直接力预训练 → 保守微调”的两阶段协议(详见下文),既拿到直接力的精度与速度,又保住保守力的物理性。
2. 二阶连续($C^2$)平滑截断:常见的 cosine cutoff 在截断半径处一阶导数不为零,原子跨越边界时力发生跳变。eSEN改用二阶连续的平滑截断(多项式包络,源自 DimeNet),让能量、力和它们的导数在 $r_{\text{cut}}$ 处连续消失。
3. 可微激活函数:分段线性或离散网格的非线性会破坏高阶可导性。eSEN采用光滑的 S² 类激活(基于 SiLU 的等变 Gated 非线性),并直接在球谐表示空间里计算,避免了 eSCN/EquiformerV2 那种”投影到离散网格”的做法——离散网格投影会引入超越 Nyquist 频率的高频信号,破坏严格等变与能量守恒。
4. 无邻居数上限 + 小基组:K-nearest 邻居限制在结构微扰下会突变(邻居集合变了),制造不连续;大基组(如 512 个径向基)会引入高频信号。eSEN用纯距离截断(6 Å)+ 少量径向基(默认 10),保证邻域在微扰下稳定、势能面不过敏。
这四层共同保证:势能面在极小位移(0.01–0.05 Å)下平滑且准确——这正是声子计算能否成功的关键。
直接力 vs 保守力:一场关于声子的辩论
eSEN 论文的中心论点是一场关于”力从哪来”的辩论:直接力模型可以在 test MAE 上打平保守模型,但在声子/热导率/MD 能量守恒上灾难性失败。
| 模型 | 力的来源 | $\kappa_\text{SRME}$↓(热导率误差) | 声子 $\omega_\text{max}$ MAE |
|---|---|---|---|
| eSEN-30M-MP | 保守(微调后) | 0.340 | 21 K |
| GRACE-2L-OAM | 保守 | ~0.5 | 19 K |
| eqV2-S-DeNS | 直接预测 | 1.676 | 309 K(0.01 Å位移)/ 61 K(0.2 Å) |
| Orb-MPtrj | 直接预测 | 1.726 | 309 K |
| M3GNet | 直接预测 | 1.409 | — |
| MACE-MP-0 | 保守 | 0.650 | — |
| CHGNet | 混合 | 1.717 | — |
原因在于:三阶力常数(声子-声子散射、热导率需要)没有模型做解析三阶导,全靠 Phono3py/Phonopy 的超胞有限差分(位移 0.01–0.05 Å)。有限差分对”小位移下的力噪声”极其敏感——直接力模型在小位移下力噪声大,差分出来的二阶/三阶力常数全是鬼峰(缺失声学支、虚假虚频);把位移加到 0.2 Å 才勉强可用,精度仍差 3 倍。所以声子精度本质上是”力在小位移下的平滑性”问题,不是”解析三阶导”问题。
MatBench Discovery 正是为此把 $\kappa_\text{SRME}$(热导率对称相对均方误差)纳入了 CPS 复合分——惩罚”test MAE 好看但物理不光滑”的模型。
训练协议与榜单位置
eSEN 揭示了一个实用训练配方(论文 §5.1):先用直接力头预训练 60 epoch(快、可用低精度、给强初始化),再切换到保守力头微调 40 epoch。最终模型超越从头保守训练,且 wall-clock 减 40%。这是目前唯一公开的”鱼与熊掌兼得”方案——直接力的效率 + 保守力的物理。eSEN-30M 也正是这样训出来的:直接力预训练 60 ep + 保守微调 40 ep。
eSEN 的另一项遗产是它的训练数据:以 eSEN-30M 为骨干,在 MPtrj+OMat24+sAlex(OAM 组合)上训练出的通用势在 MatBench Discovery 上长期占据前十,CPS 达 0.888,且是榜单上性价比最高的模型之一。Meta 后来的 OMol25 评测和 UMA 基础模型也沿用了这条技术栈。
不过 eSEN 的”直接力预训练拐杖”并非唯一解——2026 年的 DPA-4 用编译加速的纯保守训练,在 $\kappa_\text{SRME}$ 上反超了 eSEN(0.227 vs 0.340),详见 DPA系列:从注意力势到大模型时代的精度-成本前沿。那篇文章里我们把 eSEN 的 $C^2$ 平滑与 DPA-4 的 $C^3$ 平滑做了逐层对比。




