引言:大模型的燃料

我们在 机器学习分子力场:综述 中说过,通用大模型时代的开启需要两个前提:等变架构的训练效率(已由 NequIP:等变消息传递的开山之作 一脉解决)和足够大的数据集。后者常被低估,但看看榜单就知道数据的分量:MatBench Discovery上,同一架构仅因换用不同训练集,F1就能相差0.1以上。这篇文章盘点通用势的主要燃料库。

先明确一个背景:通用势的训练数据几乎全部来自高通量DFT数据库,每条记录包含结构及其能量、力和应力标签。数据集之间的核心差异有三:化学空间覆盖(晶体/表面/分子)、构型多样性(平衡态附近还是整条弛豫轨迹)和理论水平(PBE/r2SCAN/杂化泛函)。

MPtrj与Materials Project谱系

MPtrj(Materials Project Trajectory, Deng et al. 2023)是通用势时代的起点。它把Materials Project中约14.6万个无机晶体的弛豫计算展开成158万个单点构型,每条构型带PBE级别的能量、力、应力标签。

它的历史意义在于催生了第一代通用势:M3GNet和CHGNet都以MP数据为底。CHGNet还额外利用了MP的磁序信息预测电荷分布,开创了”charge-informed”路线。但MPtrj的天花板也很明显:只有弛豫轨迹意味着构型集中在平衡态附近,且PBE对强关联体系(过渡金属氧化物)的系统误差会原封不动地传给模型。

OC20系列:催化专属

Open Catalyst Project(Meta + CMU)的OC20是另一个物种:1.3亿个”表面+吸附分子”构型的弛豫数据,专门面向电催化场景。它定义了S2EF(初始结构到最终能量/力)和IS2RE(直接预测吸附能)两个任务,配套的排行榜统治催化领域至今(见 通用势的竞技场:MatBench Discovery与OC20 )。后续OC22补充了含氧/含金属氧化物的电化学条件数据,ODAC23则聚焦水溶液界面。

催化数据的特点是表面体系的巨大晶胞和高构型多样性——这恰好逼出了EquiformerV2、eSCN这些可扩展架构,可以说OC20是等变大模型的第一块试炼场。

Alexandria与sAlex

Alexandria(Schmidt/Loew et al.)是一个独立于Materials Project的高通量晶体数据库,用自动化工作流枚举并弛豫了数千万无机结构,规模远超MP。

真正在通用势圈子里家喻户晓的是它的子采样版sAlex:为了符合MatBench Discovery的合规要求(不能混入测试集WBM的结构),作者从完整Alexandria中剔除与WBM匹配的体系,再沿弛豫轨迹按能量差>10 meV/atom的标准采样,得到约1100万构型(训练1044万+验证55万)。GRACE、ORB、SevenNet等一大批模型都拿sAlex做主力粮仓。

OMat24:非平衡结构的十倍弹药

OMat24(Meta FAIR, 2024)代表了一次关键的理念升级。此前的数据集以弛豫轨迹为主,构型天然聚集在盆地底部;而MD、过渡态搜索等真实应用恰恰需要势能面上远离平衡的区域。OMat24通过大规模枚举+随机扰动生成了约一亿条非平衡构型的单点计算(PBE与r2SCAN混合标注),外加完整的弛豫轨迹。

效果立竿见影:EquiformerV2、eSEN等模型换上OMat24后,力误差普遍改善30%以上,MatBench Discovery排名集体跳涨。OAM(OMat24+Alexandria+MPtrj)从此成为新一代通用势的标准配方——榜单前十清一色标着这三个名字。

MatterSim数据集

微软的MatterSim(2024)走了差异化路线:1700万构型,覆盖从0 K到5000 K、从高真空到百万大气压的极端温压区间,主动引入分子动力学采样而非单纯弛豫轨迹。这让MatterSim模型成为高温高压、相图计算场景的首选,尽管它在室温晶体基准上并非最强。

OMol25:分子侧的巨无霸

前面全是晶体和表面,分子领域直到OMol25才补齐。Meta FAIR的OMol25包含超过一亿次单点计算,83种元素,覆盖有机分子、生物团簇、自由基、带电体系,理论水平直接上了杂化泛函ωB97M-V/def2-TZVPD——比晶体侧通用的GGA精确一个档次。

它的意义在于让”通用分子势”第一次有了像样的燃料:此前MACE-OFF这类有机势只能靠几十万自采数据。OMol25与UMA基础模型(见 通用势模型巡礼:从MACE-MP-0到UMA )共同构成了Meta的分子野心。

COSMOS:合纵连横的集大成者

COSMOS数据集(KAIST SevenNet团队,arXiv:2510.11241)代表了当前数据工程的最新形态:不做新计算,而是把十五个公开数据库整合成统一的2.43亿构型训练集,涵盖分子、晶体、表面、MOF四大域,多任务联合训练。

用它喂出来的SevenNet-Omni-i12在MatBench Discovery上拿到0.873 CPS,证明了跨域知识的迁移价值。COSMOS的出现也预示着一个趋势:当单个机构的新算力增长放缓时,数据整合与清洗能力将成为新的竞争壁垒。

比较与展望

数据集 规模 理论水平 特色
MPtrj 158万 晶体 PBE 第一代通用势标配
OC20/22 1.3亿+ 表面/催化 PBE(+r2SCAN) 吸附能任务定义者
Alexandria/sAlex 数千万/1100万 晶体 PBE 合规、多样
OMat24 1亿 晶体 PBE+r2SCAN 非平衡构型
MatterSim 1700万 晶体 PBE+ML修正 极端温压
OMol25 1亿+ 分子/团簇 ωB97M-V 杂化泛函精度
COSMOS 2.43亿 全域 混合 十五库合一

几个值得注意的趋势:其一,理论水平正在从GGA向杂化泛函乃至更高爬升(r2SCAN、ωB97M-V),”通用势逼近化学精度”不再是口号;其二,非平衡构型的价值被充分认识,弛豫轨迹独占的时代结束了;其三,数据集与榜单深度绑定(sAlex为合规而生、OAM为冲榜而生),这既是生态繁荣的表现,也埋下了过拟合榜单的隐忧——这个话题留给 通用势的竞技场:MatBench Discovery与OC20