引言:为什么需要榜单

我们在 通用势的数据集版图 的结尾埋了个伏笔:数据集与榜单深度绑定。事实上,”通用势”这个概念能成立,很大程度上要归功于两个权威基准——晶体领域的MatBench Discovery和催化领域的OC20排行榜。没有它们,每篇论文各说各话、各自挑有利的数据集,领域很快就会陷入不可比性的泥潭。

MatBench Discovery

任务设计:WBM测试集

MatBench Discovery(Riebesell et al., Nature Machine Intelligence 2025)的核心任务设计得很聪明:用模型替代DFT做高通量稳定性筛选。给定WBM(Wang-Botti-Marques)数据库中约21.5万个从未见过的候选晶体结构,模型需要:

  1. 预测每个初始结构的形成能;
  2. 用模型自身的力做结构弛豫,得到弛豫后的能量与几何;
  3. 计算能量高于凸包的距离$E_{\mathrm{hull}}$,判定热力学稳定性。

这个流程完整模拟了真实材料筛选工作流中的每一步——能量回归、力驱动的几何优化、凸包构造——任何一环掉链子都会在最终指标上现形。这正是它优于纯回归型基准(如QM9)的地方。

指标体系

榜单的指标经历了两轮进化:

第一代指标以分类和回归双线并行:

  • F1:稳定性二分类的F1分数(在unique prototypes子集上统计),是最核心的排名依据。注意WBM中稳定晶体的比例只有15.3%,一个全判不稳定的傻瓜模型准确率也有85%——所以F1远比accuracy诚实;
  • DAF(Discovery Acceleration Factor):相对随机筛选找到稳定材料的加速倍数,理论上限约6.5;
  • RMSD:弛豫后几何与DFT结果的均方根位移,衡量力场质量;
  • $\kappa_{\mathrm{SRME}}$:声子热导率的对称相对误差,后来加入的第二战场。

第二代指标CPS(Combined Performance Score):随着模型全面进步,单看F1已难以区分头部模型,于是引入加权综合分

它强制模型在能量分类、热学性质、几何优化三条战线同时在线,堵住了偏科路线的漏洞。

当前格局

截至写作时(2026年8月),榜首梯队的情况:

排名 模型 CPS F1 参数量 训练集
1 TECE-OAM-RRA-1.0 0.908 0.929 222M OAM (660万)
2 EquFlashV2 0.907 0.929 44.9M OAM
3 EquiformerV3+DeNS-OAM 0.902 0.931 30.3M OAM
4 GRACE-3L-OAM-L 0.900 0.925 42.1M OAM
5 PET-OAM-XL 0.898 0.924 730M OAM
7 eSEN-30M-OAM 0.888 0.925 30.2M OAM

几条值得咀嚼的信息:其一,前十名清一色使用OAM配方(MPtrj+OMat24+sAlex),印证了 通用势的数据集版图 的结论;其二,架构多样性惊人——等变Transformer(EquiformerV3)、ACE线性基(GRACE)、非等变Transformer(PET)、eSCN系(eSEN)同台竞技且差距在千分位,说明当前阶段数据的贡献已经超过架构;其三,作为历史参照,2023年第一代通用势的F1大约在0.6-0.75区间(CHGNet≈0.65、MACE-MP-0≈0.72),三年间提升了0.2以上。

OC20排行榜

OC20排行榜(Open Catalyst Project)统治催化场景,核心任务仍是 通用势的数据集版图 中提到的S2EF:预测表面吸附构型的弛豫终态能量与力。主指标是能量权重指标EFwT(energy within threshold)和力MAE。

它与MatBench Discovery的气质截然不同:体系更大(数十至数百原子的表面晶胞)、构型更稠密(吸附位点的组合爆炸)、对力的绝对精度要求更高。因此OC20是可扩展等变架构的第一试炼场——EquiformerV2正是在这里凭借eSCN卷积一战成名,GemNet、PaiNN等不变网络的老将也在这里完成了谢幕演出。

值得注意的是OC20的SOTA长期由GemNet-OC、EquiformerV2把持,但近两年UMA等跨域基础模型的入场正在模糊”催化专属榜单”的边界——一个在OMol25上训练的分子大模型也能在OC20上排进前列,这是基础模型时代才有的奇观。

榜单之外

最后必须泼一盆冷水:榜单分数不等于实际可用性。至少有三类问题被MatBench Discovery和OC20系统性地忽略了:

  1. 化学空间偏差:WBM和MP系数据都以无机晶体为主,对MOF、液相、生物分子的覆盖接近于零;
  2. 理论水平的玻璃天花板:训练集以PBE为主,模型最多学会PBE的误差——r2SCAN乃至CCSD(T)级别的精度需要新的数据引擎(OMol25开了头);
  3. 过拟合榜单的风险:当所有冲榜模型都用OAM训练、按F1调参时,WBM正在从”未见过的测试集”滑向”事实上的验证集”。学界已经开始呼吁引入真正的盲测集。

所以阅读榜单的正确姿势是把它当作下限的证明而非上限的承诺:一个能在MatBench Discovery拿0.9的模型,大概率在你的无机晶体问题上不会太差;但它对你的酶活性口袋好不好使,得另说。下一篇文章我们逐一盘点榜单上的选手们,见 通用势模型巡礼:从MACE-MP-0到UMA