通用势的竞技场:MatBench Discovery与OC20
引言:为什么需要榜单
我们在 通用势的数据集版图 的结尾埋了个伏笔:数据集与榜单深度绑定。事实上,”通用势”这个概念能成立,很大程度上要归功于两个权威基准——晶体领域的MatBench Discovery和催化领域的OC20排行榜。没有它们,每篇论文各说各话、各自挑有利的数据集,领域很快就会陷入不可比性的泥潭。
MatBench Discovery
任务设计:WBM测试集
MatBench Discovery(Riebesell et al., Nature Machine Intelligence 2025)的核心任务设计得很聪明:用模型替代DFT做高通量稳定性筛选。给定WBM(Wang-Botti-Marques)数据库中约21.5万个从未见过的候选晶体结构,模型需要:
- 预测每个初始结构的形成能;
- 用模型自身的力做结构弛豫,得到弛豫后的能量与几何;
- 计算能量高于凸包的距离$E_{\mathrm{hull}}$,判定热力学稳定性。
这个流程完整模拟了真实材料筛选工作流中的每一步——能量回归、力驱动的几何优化、凸包构造——任何一环掉链子都会在最终指标上现形。这正是它优于纯回归型基准(如QM9)的地方。
指标体系
榜单的指标经历了两轮进化:
第一代指标以分类和回归双线并行:
- F1:稳定性二分类的F1分数(在unique prototypes子集上统计),是最核心的排名依据。注意WBM中稳定晶体的比例只有15.3%,一个全判不稳定的傻瓜模型准确率也有85%——所以F1远比accuracy诚实;
- DAF(Discovery Acceleration Factor):相对随机筛选找到稳定材料的加速倍数,理论上限约6.5;
- RMSD:弛豫后几何与DFT结果的均方根位移,衡量力场质量;
- $\kappa_{\mathrm{SRME}}$:声子热导率的对称相对误差,后来加入的第二战场。
第二代指标CPS(Combined Performance Score):随着模型全面进步,单看F1已难以区分头部模型,于是引入加权综合分
它强制模型在能量分类、热学性质、几何优化三条战线同时在线,堵住了偏科路线的漏洞。
当前格局
截至写作时(2026年8月),榜首梯队的情况:
| 排名 | 模型 | CPS | F1 | 参数量 | 训练集 |
|---|---|---|---|---|---|
| 1 | TECE-OAM-RRA-1.0 | 0.908 | 0.929 | 222M | OAM (660万) |
| 2 | EquFlashV2 | 0.907 | 0.929 | 44.9M | OAM |
| 3 | EquiformerV3+DeNS-OAM | 0.902 | 0.931 | 30.3M | OAM |
| 4 | GRACE-3L-OAM-L | 0.900 | 0.925 | 42.1M | OAM |
| 5 | PET-OAM-XL | 0.898 | 0.924 | 730M | OAM |
| 7 | eSEN-30M-OAM | 0.888 | 0.925 | 30.2M | OAM |
几条值得咀嚼的信息:其一,前十名清一色使用OAM配方(MPtrj+OMat24+sAlex),印证了 通用势的数据集版图 的结论;其二,架构多样性惊人——等变Transformer(EquiformerV3)、ACE线性基(GRACE)、非等变Transformer(PET)、eSCN系(eSEN)同台竞技且差距在千分位,说明当前阶段数据的贡献已经超过架构;其三,作为历史参照,2023年第一代通用势的F1大约在0.6-0.75区间(CHGNet≈0.65、MACE-MP-0≈0.72),三年间提升了0.2以上。
OC20排行榜
OC20排行榜(Open Catalyst Project)统治催化场景,核心任务仍是 通用势的数据集版图 中提到的S2EF:预测表面吸附构型的弛豫终态能量与力。主指标是能量权重指标EFwT(energy within threshold)和力MAE。
它与MatBench Discovery的气质截然不同:体系更大(数十至数百原子的表面晶胞)、构型更稠密(吸附位点的组合爆炸)、对力的绝对精度要求更高。因此OC20是可扩展等变架构的第一试炼场——EquiformerV2正是在这里凭借eSCN卷积一战成名,GemNet、PaiNN等不变网络的老将也在这里完成了谢幕演出。
值得注意的是OC20的SOTA长期由GemNet-OC、EquiformerV2把持,但近两年UMA等跨域基础模型的入场正在模糊”催化专属榜单”的边界——一个在OMol25上训练的分子大模型也能在OC20上排进前列,这是基础模型时代才有的奇观。
榜单之外
最后必须泼一盆冷水:榜单分数不等于实际可用性。至少有三类问题被MatBench Discovery和OC20系统性地忽略了:
- 化学空间偏差:WBM和MP系数据都以无机晶体为主,对MOF、液相、生物分子的覆盖接近于零;
- 理论水平的玻璃天花板:训练集以PBE为主,模型最多学会PBE的误差——r2SCAN乃至CCSD(T)级别的精度需要新的数据引擎(OMol25开了头);
- 过拟合榜单的风险:当所有冲榜模型都用OAM训练、按F1调参时,WBM正在从”未见过的测试集”滑向”事实上的验证集”。学界已经开始呼吁引入真正的盲测集。
所以阅读榜单的正确姿势是把它当作下限的证明而非上限的承诺:一个能在MatBench Discovery拿0.9的模型,大概率在你的无机晶体问题上不会太差;但它对你的酶活性口袋好不好使,得另说。下一篇文章我们逐一盘点榜单上的选手们,见 通用势模型巡礼:从MACE-MP-0到UMA 。




