初代DeepH:用神经网络表示DFT哈密顿量
从映射到网络
我们在 机器学习哈密顿量:综述 中提到,DFT通过自洽场迭代求解Kohn-Sham方程
计算量随体系大小以三次方以上的速度增长。而根据Hohenberg-Kohn定理,材料结构$\{\mathcal{R}\}$与基态哈密顿算符$\hat{H}_{\mathrm{DFT}}$之间存在一一对应,于是存在一个确定的映射
这个映射原则上存在,却没有解析表达式——DeepH(deep-learning DFT Hamiltonian)的出发点就是:既然写不出来,就让神经网络把它学出来。一旦学成,对任意新结构只需一次前向传播就能得到自洽的哈密顿量,后续的能带、态密度等计算全部退化为常规的对角化后处理。
这个想法听起来和MLIP如出一辙,但实现起来要难得多。能量是一个标量,而哈密顿量是一个矩阵,并且是会”变身”的矩阵。在展开技术细节之前,我们先看清横在面前的两座大山。
第一座山:无限维度与近邻性原理
宏观晶体含有阿伏伽德罗常数级别的原子,哈密顿矩阵的独立变量数目是无穷大的——直接学显然不可能,必须先做分解。
出路是局域基组下的近邻性原理(nearsightedness principle)。把$\hat{H}_{\mathrm{DFT}}$在赝原子轨道等局域基下写成矩阵元$h_{ij}$,由于多体本征态之间的相消干涉,远离的轨道交叠趋于零,矩阵元随原子间距迅速衰减:
其中$R_c$是截断半径。无穷大的哈密顿矩阵由此碎裂成无数个有限的子块$[H_{ij}]_{p_1p_2}$,每个子块只由半径$R_c$内的局域化学环境决定。这与 机器学习分子力场:综述 中”原子能量由局域环境决定”的分解完全同构,也预示着同样的技术载体——消息传递神经网络——可以照搬过来。
第二座山:规范协变性与局部坐标系
如果哈密顿矩阵元像能量一样是不变量,故事到这里就可以结束了。麻烦在于它不是。
改变观察者的坐标朝向,或者旋转、混合局域基函数(这类变换统称规范变换),矩阵元会跟着变换:结构转多少,矩阵就按相应的幺正表示跟着变。换句话说,$\{\mathcal{R}\}\mapsto H_{\mathrm{DFT}}$是协变(covariant/equivariant)映射而非不变映射。早期的尝试要么用统计学习方法拟合简单金属的哈密顿量,要么针对固定原子数的小分子设计网络,都因为缺乏对这种变换行为的系统性处理而无法推广到真实晶体。
初代DeepH的处理方式朴素而有效:把协变问题化归为不变问题。具体地,为每对原子$(i,j)$构造一个确定的局部坐标系——由原子$i$、$j$以及$i$的最近邻原子的位置共同定义。在这个局部坐标系中,子块$H_{ij}$的表示是唯一的:无论整体结构如何旋转,局部环境相同则局部坐标下的矩阵元完全相同。于是
坐标系的构造方式如下:取原子$i$、$j$以及$i$的最近邻原子$k$的位置,构造标准正交基
把基函数旋进这套坐标系后,矩阵元成为不变量
其中$R_{ij}$是全局系到局部系的旋转矩阵。不变神经网络学起来轻松,代价全部转移到了坐标系的构造上。这个方案埋着一个隐患:最近邻的选取使得局部坐标系在结构连续变化时可能发生突变,网络输出因此不够光滑——这颗雷要到DeepH-E3和DeepH-2才被彻底拆除。
消息传递神经网络的实现
框架确定后,剩下的就是把上述归纳偏置装进网络。DeepH把材料结构表示为晶体图:每个原子是一个顶点,距离小于$R_c$的原子对之间连边,同时添加自环以处理同位on-site耦合。写成集合论的语言,
顶点初始特征取原子序数$Z_i$的嵌入;边的初始特征取原子间距$|\vec{r}_{ij}|$的高斯基展开,再辅以实球谐函数$\{Y^J_m\}$($J$最高取到4)编码方向信息。随后消息传递逐轮更新顶点与边特征:
$T$轮之后,每条边都汇聚了半径$T$层邻域的信息,最终的边特征经过一层关键的局域坐标消息传递层(LCMP)——该层先把每条边及其邻域旋进各自的局部坐标系再执行消息传递,从而把角向信息编码进边特征,最后经读出函数给出局部系中的哈密顿子块:
作者测试表明LCMP层对精度至关重要。预测完成后,把$H’_{ij}$旋转回全局坐标系即得最终结果。
实现层面还有一个工程选择:可以对不同轨道组合分别训练多个小网络,也可以用单个网络的多维向量输出同时表示所有矩阵块——后者在大体系上效率更高。
精度、效率与可迁移性
训练数据来自OpenMX等DFT软件在局域基下的自洽计算。训练损失是预测矩阵元与DFT标签之间的均方误差,
其中$\lVert\cdot\rVert_F$是Frobenius范数,$N_p$是原子对数。测试覆盖了单层石墨烯、MoS₂及其纳米管、双层铋烯(含强SOC)等多种体系,哈密顿矩阵元的平均绝对误差稳定在meV量级,由之计算的能带结构与DFT基准几乎重合。
效率上的对比更为悬殊:DFT的计算时间大约随体系三次方增长,而DeepH的前向传播严格线性于原子数,且前置因子更小。对MoS₂的$35\times 35$超胞,DeepH把构建哈密顿量的时间缩短了三个数量级;体系越大,优势越明显。
真正体现方法威力的是可迁移性:训练集只需要非扭转的小超胞加上层间滑移与随机位置扰动,训练好的模型却能外推到任意转角的扭转结构。原因不难理解——扭转只是把层间相互作用改写成了各种局域滑移构型的组合,而这些构型已经被训练集完整覆盖。这为下一节的应用铺平了道路。
应用:moiré扭转材料
moiré扭转范德华材料是检验DeepH的理想考场。理论处理的困难众所周知:魔角附近的moiré超胞动辄上万个原子,经验紧束缚和连续模型精度不足,第一性原理又算不动。
DeepH的工作流分三步:对非扭转的双层超胞做扰动生成训练集;训练网络;对任意转角的扭转结构做推理并稀疏对角化。预测得到的哈密顿量配合overlap矩阵$S$,通过广义本征值问题给出能带:
结果是魔角TBG——单个超胞11164个原子——被轻松拿下,费米面附近标志性的平带被精确复现,与平面波基准高度吻合;对强SOC的扭转双层铋烯同样保持了 comparable 的精度。作者还引入了神经网络集成的不确定度作为可靠性指标,
证明大体系的预测精度依然在线。自此,构建扭转材料数据库从空想变成了工程问题。
结语
初代DeepH确立了整个领域的范式:近邻性化解无限维度,局部坐标化解规范协变性,消息传递网络承载一切。它的局限也同样清晰——局部坐标系依赖最近邻选取,天然不光滑,损害分子动力学场景下的表现与泛化能力;而”换一个化学环境就要重新设计数据集”的要求,也离通用模型相去甚远。
下一步的进化有两个方向:要么彻底拥抱等变性,要么改造局部坐标使其连续平滑。这两条路分别通向 DeepH-E3:彻底的等变化 与 DeepH-2:等变局域坐标Transformer ,我们先看前者。




