DeepH-2:等变局域坐标Transformer
两条路线的僵局
到这里,规范协变性问题的两代解法已经摆在了桌面上。 初代DeepH:用神经网络表示DFT哈密顿量 的局部坐标方案实现简单,但坐标系锚定在最近邻原子上,结构连续变化时会发生跳变,精度也因此受限——问题出在”如何选取局部坐标”缺乏原则性的方案。 DeepH-E3:彻底的等变化 的全等变方案数学上无懈可击,但等变张量积的计算量随最高角动量以$O(L^6)$增长,而电子结构恰恰需要高角动量通道来分辨轨道;严格的表示约束还限制了表达力。
一个简洁、一个优雅,各自卡在自己的短板上,僵局就此形成。
打破僵局的灵感来自隔壁的力场领域。我们在 eSCN:把SO(3)卷积拆成稀疏矩阵 中介绍过,Passaro和Zitnick提出的eSCN卷积证明:把局域坐标信息嵌入等变网络内部,可以把球谐张量积的复杂度从$O(L^6)$降到$O(L^3)$,EquiformerV2借此成为当时最成功的催化势之一。既然力场领域已经验证了这条路,把它移植到电子结构的时机就成熟了——这正是DeepH-2(更准确地说,是其核心架构ELCT)的工作。
从SO(3)到SO(2)
初代DeepH为每对原子构造完整的局部坐标系(需要三个参考原子),DeepH-2的改造大胆得多:每条边只取一个z轴,方向沿键矢$\hat{r}_{ij}$,不定义x轴和y轴。
这个看似偷懒的约定有深刻的群论后果。绕z轴的旋转作用在球谐函数上是平凡的:
非阿贝尔的SO(3)在这个坐标系里退化成了阿贝尔的SO(2),不同$m$通道之间不再通过Wigner-D矩阵纠缠,而是各自携带一个简单的相位因子。于是原本被表示论严格隔开的不同角动量$l$通道可以直接混合,网络层的设计自由度大大放宽;所有运算都退化为逐分量的相位乘加,天然适合GPU并行。
直观地说,DeepH-E3让网络在任意旋转下”端着架子”变换,代价是每一步都要走完整个CG系数的流程;DeepH-2则先把世界沿着键方向”扶正”,剩下的方位角旋转只是无关紧要的相位——繁重的表示论工作被一次性前置到了输入端。等变性依然严格成立,但计算图大幅简化。这就是标题中”融合局部坐标变换的简洁性与等变网络的优雅性”的准确含义。
Transformer骨架
架构层面,DeepH-2没有沿用朴素的消息传递,而是采用了Transformer的经典设计:顶点与边特征经过嵌入后,由多头注意力层迭代更新。注意力权重按邻居的相对重要性计算:
注意力机制允许网络自适应地权衡不同邻居、不同特征通道的贡献,提取多样化的关联模式——对于化学环境千变万化的材料体系,这种灵活性比固定的消息聚合函数更有潜力。
把三样东西——等变性、局域坐标约化、注意力机制——装进同一个框架,就是等变局域坐标Transformer(equivariant local-coordinate transformer, ELCT)。名字里的三个定语恰好对应三条技术线索。
表现:效率与精度的双超越
作者在多种体系上与两位前辈正面比较:在相近的训练设置下,DeepH-2对哈密顿矩阵元的预测误差全面低于初代DeepH与DeepH-E3;同时推理速度更快。两种架构的层内计算量随最高角动量$L$的标度分别是
$O(L^3)$的优势随$L$增大而放大。参数量也上了一个台阶:DeepH-E3的典型模型在$10^6$参数量级,DeepH-2则可以承载$10^7$级别的参数而不牺牲效率。
更大的模型、更高的效率、更好的精度,三者同时达成,这在深度学习中并不常见——通常它们要互相妥协。这组实验指向一个明确结论:ELCT是目前最适合作为通用电子结构模型底座的架构。
通往通用大模型
初代DeepH和DeepH-E3都是”一材一模”的专用模型:换一种材料就要重新准备数据集、重新训练。DeepH-2的效率与表达力第一次让”一个模型吃下周期表”显得不那么遥不可及——后续的UMM通用材料模型正是建立在改进的DeepH方法之上,用万级材料数据库训练单一模型,并演示了微调技术。这条线的展开见 DeepH的应用:杂化泛函与通用模型 。
结语
DeepH-2的故事有一个值得回味的细节:它的关键技巧并非源自电子结构内部,而是从力场领域的eSCN移植而来。两个领域共享同一套等变神经网络的数学基础,却各自独立发展了数年才真正开始互通有无——这也是本博客把力场与哈密顿量安排成姊妹专栏的原因。
至此,监督学习的路线已经相当完善:DFT算数据,网络拟合,前向传播代替自洽迭代。但这条流水线总让人觉得隔了一层——神经网络明明可以做比函数拟合更多的事情。能不能让网络直接参与求解物理问题本身? DeepH-Zero:当能量泛函成为损失函数 会给出一个激进的答案。在此之前,我们先看看把初代范式工程化的官方软件包 DeepH-pack:从论文到工具箱 。




