引言:从架构竞赛到数据竞赛

数据集( 通用势的数据集版图 )和榜单( 通用势的竞技场:MatBench Discovery与OC20 )都铺好了,这篇文章承担两个任务:一是以”三代演进”的框架盘点场上的选手,勾勒这条技术脉络的全景;二是作为文献索引中枢——每个模型的详细论文精读单独成篇(04-10 起),本文只在索引表里给你指路。

按时间和技术形态,通用势可以粗分为三代:验证可行性的第一代、专注冲榜的第二代、追求跨域基础模型的第三代。三代之间没有严格的断代,更像三条叠加的浪潮:第一代证明了”一个模型走遍周期表”可行,第二代把精度的边界一次次推高,第三代则开始追问”能不能用一套底座同时服务所有任务”。

第一代:开箱即用的验证者

M3GNet:全周期表的第一次试跑

M3GNet(Chen & Ong, 2022, arXiv:2202.02450)是第一代公认的开山之作。它在 Materials Project 的势与结构数据上训练,第一次让”一个模型覆盖全周期表”不再是天方夜谭。今天看它的指标已经平平(MatBench Discovery CPS 0.428),但它的历史意义在于:把”通用势”从概念变成了产品。详见 M3GNet:全周期表通用势的开山之作 。

CHGNet:电荷感知的先行者

CHGNet(Deng et al., 2023, arXiv:2302.14231)在第一代里走出了一条独特的路线:把氧化态(电荷)和磁序纳入预测。它用 Materials Project 的磁序标注信息做显式电荷预测,对锂离子电池材料这类氧化态敏感体系尤其友好。它的一个常被忽略的细节是能量修正——对含 $d/f$ 电子的强关联体系做 Hubbard U 校正,这使它的能量误差在过渡金属氧化物上显著优于当时的同类模型。详见 CHGNet:电荷感知的先行者 。

MACE-MP-0/MPA-0:生态的奠基者

真正的分水岭是 MACE-MP-0(2024):剑桥团队把 MACE:高阶等变消息传递与原子簇展开 的架构放到 MPtrj+Alexandria 合并集上训练,发布即成为社区默认选择——它以约 15M 参数在 MatBench Discovery 拿到当时领先的 F1≈0.72,且力质量明显优于前两者。后续的 MACE-MPA-0 进一步合并了 MP 2022 的原子间距离标注,把 CPS 从 0.637 抬到 0.795。

MACE-MP-0 的意义不在分数而在生态:微调工作流、主动学习循环、各类下游应用从此有了标准底座。你可以不喜欢它的指标,但绕不开它定义的玩法。详见 MACE-MP-0 与 MACE-MPA-0:生态的奠基者 。

eqV3:等变Transformer第三代的回归

Meta 的 eqV2(EquiformerV2 直接当通用势用,arXiv:2410.12771)曾率先示范”大参数量+大数据”路线的威力,但其直接力(direct forces)训练策略埋下隐患:力的平滑性不足,导致声子谱类下游任务翻车($\kappa_\text{SRME}=1.771$,远超保守力模型的零点几)。这个反面教材恰好为后来 eSEN、DPA-4 的”平滑+保守”路线铺了路,也让 Equiformer 家族一度背上污名。

2026 年,同一家族以 EquiformerV3(eqV3, arXiv:2604.09130)完成正名:靠 SwiGLU-S² 连续球谐激活 + 平滑截断注意力 + 软件层 1.75× 加速,回归保守力路线,以 30.3M 参数拿到 F1 0.931(稳定性分类榜首)、CPS 0.902。“架构失败”的判决被同一架构自己翻案——eqV2 的教训从来不是架构不行,而是力的产生方式错了。详见 eqV3 / EquiformerV3:等变Transformer的第三代,平滑与榜首双收 。

第二代:冲榜军团

第一代证明了可行性,第二代开始用 MatBench Discovery 和 OC20 的榜单互相较劲。这一代的特点是把”数据配方”(MPtrj+OMat24+sAlex 的 OAM 组合)玩成了标配——架构反而退居其次。

等变系:GRACE与TACE

GRACE(Bochkarev, Lysogorskiy & Drautz, Ruhr-Universität Bochum)走的是一条聪明的中间路线:用 ACE(原子簇展开)框架下的可学习径向基函数替代昂贵的 CG 张量积,保持等变性的同时把推理速度提高了数倍。GRACE-1L/2L 系列以极小参数量长期霸榜性价比之王;最新的 GRACE-3L-OAM-L 已冲进 CPS 前五(0.900)。

TACE 则是高阶张量积路线的正统进化,82.9M 参数的 TACE-OAM-L 拿下 0.889 CPS;其继承者 TECE(引入旋转不变注意力的张量等变框架)以 222M 参数的 TECE-OAM-RRA-1.0 拿到 0.908 CPS,长期位居榜首梯队。它们共同说明:等变架构在大数据时代依然有一战之力,关键在于算子的效率。详见 GRACE / TACE / TECE:等变 ACE 系与高阶张量积系 。

非等变系:PET与ORB

这是冲榜军团里最”离经叛道”的一支。PET(Point Edge Transformer, EPFL)和 ORB v3(Orbital Materials)完全放弃显式等变约束,用纯 Transformer 直接处理点云,靠大规模数据和随机旋转增广来隐式满足对称性。

结果出乎很多人的意料:PET-OAM-XL 以 730M 参数拿到 CPS 0.898,ORB v3 以 25.5M 参数拿到 0.860。虽然 PET 的参数效率惨不忍睹,但它证明了等变性是充分条件而非必要条件——只要数据管够,暴力也能出奇迹。这与视觉领域”ViT 战胜归纳偏置”的剧本如出一辙。详见 PET 与 ORB:放弃等变约束的非等变路线 。

DP家族:DPA系列

深势科技(DeepModeling)的 DPA 系列是中国力量的代表。DPA-1/2 延续了 DeePMD 的描述符-拟合器架构,DPA-2 引入多任务预训练+下游微调范式;DPA-3 则在 OpenLAM 计划的 1.63 亿构型上训练,DPA-3.1-3M-FT 以仅 3.27M 参数拿到 0.802 CPS——参数效率全场最佳之一;DPA-4 用 EMFA SO(2) 卷积 + Wigner 双线性网络 + ZBL 原生桥接把精度-成本前沿又推了一步(CPS 0.840,$\kappa_\text{SRME}$ 0.211)。DP 家族的独特优势还在于其极致的并行工程能力:十亿原子级模拟的世界纪录至今仍在他们手中。详见 DPA系列:从注意力势到大模型时代的精度-成本前沿 。

SevenNet与SevenNet-Omni

KAIST 的 SevenNet 从 NequIP 出发做了并行化改造,主打 GPU 集群上的大规模 MD——最初版本直接在 MPtrj 上训练就拿到 CPS 0.714。它的旗舰 SevenNet-Omni-i12 用 通用势的数据集版图 里介绍的 COSMOS 数据集(十五库合一、2.43 亿构型)做多任务训练,CPS 0.873。它是”COSMOS 配方”的第一个成功案例,也宣告了数据整合时代的到来。详见 SevenNet 与 SevenNet-Omni:从 MPtrj 到 COSMOS 数据配方 。

第三代:基础模型的野心

UMA:力场界的GPT

2025 年,Meta 发布了 UMA(Universal Models for Atoms, Wood et al.)——目前最接近”力场界 GPT”的存在。UMA 以 eSEN 风格架构为骨干,在 OC20/OC22、OMol25、OMat24、ODAC23 等多个域的数据上联合训练,通过任务特定的适配头实现跨域切换,分为 Small/Medium 两档规模。详见 UMA:跨域基础模型,力场界的GPT 。

UMA 试图回答的问题是:催化、晶体、分子、界面这些域之间到底有没有可迁移的物理?目前的证据偏向乐观——UMA 在单个域内不总是 SOTA,但作为零样本起点几乎没有短板,配合少量微调就能快速逼近专用模型。这正是基础模型商业逻辑在科学计算中的复刻:与其每个任务从头训练,不如先拿一个通用底座再低成本定制。

MatterSim:温压覆盖的独一档

微软的 MatterSim(arXiv:2405.04967)选择了另一条差异化路线:把训练数据铺满温度-压力相空间(从 0K 到 5000K、到 100 GPa 量级),在高温高压场景——地幔矿物、极端条件材料、金属熔化——拥有其他模型无法企及的覆盖面。它在 MatBench Discovery 的常规榜单上并不突出(CPS 0.767),但在自己的主场几乎没有对手。详见 MatterSim:高温高压相空间覆盖的独一档 。

榜单格局速览

以下是 MatBench Discovery 当前(截至 2026-09-23 抓取)综合指标 CPS 的 Top 榜单快照。榜单以月计变化,本文会随 SOTA 更新机制定期刷新:

排名 模型 CPS F1 κSRME 参数 训练数据 详解
1 Prophet-OAME-MBD 0.912 0.928 0.065 62.3M MPtrj+OMat24+sAlex+ELEMENTA Prophet:谱分解等变骨干 + 显式自旋,三亿构型的当前榜首
2 TECE-OAM-RRA-1.0 0.908 0.929 0.093 222M MPtrj+OMat24+sAlex GRACE / TACE / TECE:等变 ACE 系与高阶张量积系
3 EquFlashV2 0.907 0.929 0.094 44.9M MPtrj+OMat24+sAlex 待增补
4 EquiformerV3+DeNS-OAM 0.902 0.931 0.118 30.3M MPtrj+OMat24+sAlex eqV3 / EquiformerV3:等变Transformer的第三代,平滑与榜首双收
5 GRACE-3L-OAM-L 0.900 0.925 0.121 42.1M MPtrj+OMat24+sAlex GRACE / TACE / TECE:等变 ACE 系与高阶张量积系
6 PET-OAM-XL 0.898 0.924 0.119 730M MPtrj+OMat24+sAlex PET 与 ORB:放弃等变约束的非等变路线
7 TACE-OAM-L 0.889 0.910 0.126 82.9M MPtrj+OMat24+sAlex GRACE / TACE / TECE:等变 ACE 系与高阶张量积系
8 eSEN-30M-OAM 0.888 0.925 0.170 30.2M MPtrj+OMat24+sAlex eSEN:平滑能量网络,平滑 + 保守力路线的常青树
9 EquFlash 0.888 0.919 0.158 28.7M MPtrj+OMat24+sAlex 待增补
10 NequIP-OAM-XL 0.886 0.906 0.125 32.1M MPtrj+OMat24+sAlex 待增补

几个值得咀嚼的结构性事实:

  1. 榜首前十里七个用 OAM 配方(MPtrj+OMat24+sAlex),印证了 通用势的数据集版图 的结论:数据的贡献已经超过架构。同一个架构换数据,F1 能差 0.1 以上。
  2. 架构多样性惊人——等变 Transformer(EquiformerV3)、ACE 线性基(GRACE)、高阶张量积(TACE/TECE)、非等变 Transformer(PET)、eSCN 系(eSEN)同台竞技,且头部差距缩小到千分位。
  3. 直接力 vs 保守力的分野贯穿整个榜单:eqV2/ORB 这类直接力模型的 $\kappa_\text{SRME}$ 是保守力模型的 5-7 倍。这与 eSEN:平滑能量网络,平滑 + 保守力路线的常青树 的论点一脉相承:test MAE 好 ≠ 物理好。
  4. 参数效率与精度的平衡是常青话题:DPA-3.1-3M-FT 用 3.27M 参数拿到 0.802 CPS,GRACE-1L 用 3.45M 参数拿到 0.761,而 PET-OAM-XL 花了 730M 参数才到 0.898——小模型在性价比上的统治力被严重低估。

文献索引表

本系列从 04-10 起逐篇精读经典通用势论文。表格随新文献增补滚动更新:

编号 模型 一句话定位 论文
04-10 M3GNet 全周期表通用势的开山之作 arXiv:2202.02450
04-11 CHGNet 电荷/磁序感知 + Hubbard U 校正 arXiv:2302.14231
04-12 MatterSim 高温高压相空间覆盖独一档 arXiv:2405.04967
04-13 MACE-MP-0/MPA-0 生态奠基者,社区默认底座 arXiv:2401.00096
04-14 DPA 系列 从注意力势到大模型时代的精度-成本前沿 arXiv:2208.08236, 2312.15492, 2506.01686, 2606.02419
04-15 SevenNet 与 SevenNet-Omni 从 MPtrj 到 COSMOS 数据配方 arXiv:2402.03789, 2510.11241
04-16 eSEN 平滑 + 保守力路线,OAM 榜首常青 arXiv:2502.12147
04-17 UMA 跨域基础模型,”力场界 GPT” Meta, 2025
04-18 PET / ORB 非等变 Transformer 路线 Nat. Commun., arXiv:2504.06231
04-19 eqV3(EquiformerV3) 等变 Transformer 第三代,平滑与榜首双收 arXiv:2604.09130
04-20 GRACE / TACE / TECE 等变 ACE 系与高阶张量积系 PRX 14.021036, 2508.17936, 2509.14961, 2607.10664
04-21 Prophet 谱分解等变骨干 + 显式自旋,三亿构型榜首 Kairos Materials, 2026

如何选型

给实践者的速查建议(具体理由见各文献章):

场景 推荐 理由
无机晶体高通量筛选 Prophet / EquiformerV3+DeNS / TECE (OAM) 榜单头部、稳定性分类顶尖
快速原型/教学 MACE-MP-0 / CHGNet 生态成熟、开箱即用
大规模MD(百万原子+) SevenNet / DPA / GRACE 并行效率优先
磁学/自旋体系 Prophet-Spin 显式自旋变量,磁态搜索原生支持
高温高压相图 MatterSim 温压覆盖独一档
有机分子/生物体系 OMol25系模型 / UMA + 微调 杂化泛函精度
精度敏感的定制任务 任意OAM模型 + 少量DFT微调 微调收益巨大
辐照/近距碰撞模拟 DPA-4 ZBL 原生桥接,内区物理正确

最后强调一个所有表格都无法涵盖的事实:这个领域的保质期以月计。本文写作时榜首是 Prophet-OAME-MBD,你读到时可能已经易主三次。真正不会过时的,是这条技术脉络本身——架构如何演化( 不变神经网络:从SchNet到GemNet → 等变神经网络:原理与脉络 )、数据如何积累、评测如何进化。理解了脉络,每一批新模型都只是旧旋律的新变奏。

不过,架构、数据与评测之外,还有最后一根设计轴值得单独一讲:这些模型训练时所用的优化器。Adam 的一统天下正在被 Muon 与 SOAP 撼动,故事见 优化器:从SGD、AdamW到Muon与SOAP 与 调度器:学习率的时间表 。

SOTA更新机制

本专栏采用增量文档管理:每篇经典/新 SOTA 通用势论文单独成文(04-10 起顺延编号),本文作为索引中枢定期刷新。具体流程:

  1. 监控:周期性抓取 MatBench Discovery 榜单(本文初稿抓取于 2026-09-23);
  2. 遴选:凡进入 CPS Top10 的新模型、或引发范式讨论的经典工作,均值得增补一篇;
  3. 编号:新文献按序获得下一个 04-xx 编号(当前 04-22 起);
  4. 刷新:新增文献后同步更新本页”榜单格局速览”与”文献索引表”,并标注抓取日期。

当前已列入待增补队列的 SOTA:EquFlashV2、EquFlash、NequIP-OAM-XL 等(见上文 Top10 表中”待增补”标记)。