DeepH-Zero:当能量泛函成为损失函数
监督流水线的隐忧
到目前为止,本专栏介绍的所有方法都运行在同一条流水线上:先跑DFT自洽计算攒出训练集,再用监督学习拟合结构到哈密顿量的映射。这条”DFT产生数据、神经网络消费数据”的两步分离策略有其工程上的好处——研究者可以只关心网络设计而不必深究DFT算法的细节——但也划下了一道无形的墙:神经网络与DFT的方法学各自发展,互不滋养。
更本质的批评是:这条流水线把神经网络用浅了。监督拟合只是把网络当作高维函数逼近器,而物理学家手里明明握着一个更强的工具——变分原理。基态能量在真实解处取极小值,这与深度学习中”损失函数最小化”的结构惊人地同构。既然如此,为什么不直接把物理的能量泛函当成损失函数,让网络在变分极小化中自己走向基态?
这就是DeepH-Zero的出发点,其思想源头可以追溯到神经网络量子态:用神经网络表示多体波函数,以能量期望值为损失做变分优化,无需任何标注数据。DeepH-Zero把同样的哲学搬进了DFT的世界,配套实现称为AI2DFT。
变分原理即损失函数
具体怎么做?DFT的总能量可以写成某个DFT量$Q$的泛函:
其中各项分别是无相互作用动能、外势能、Hartree能、交换关联能与离子—离子库仑能。以电荷密度为基本变量时,动能项显式写成占据KS轨道上的求和:
占据数$f_i$由化学势$\mu$按费米—狄拉克阶跃决定。其中$Q$有多种候选——电荷密度$n$、Kohn-Sham本征态$\{\psi_i\}$、密度矩阵$\rho$、或者哈密顿量$H$本身($n$可以从其中任何一个导出)。变分DFT的选择是:用等变神经网络(沿用 DeepH-E3:彻底的等变化 的框架)把$Q$表示为结构的函数$Q_\theta(\{\mathcal{R}\})$,然后定义损失函数
训练就是纯粹的物理:不断调整$\theta$使总能量下降,直到逼近基态。变分原理保证基态位于泛函的驻点处,
对应深度学习的梯度下降更新
整个过程不需要任何DFT自洽计算的输出作为标签——数据集里只有原子结构,没有”答案”,这正是无监督的含义。而在所有可选的$Q$中,作者选择哈密顿量$H$:它携带完整信息,且局域性最好,学到的模型具有跨体系迁移的潜力。
可微DFT:AI2DFT
要把$E[H_\theta]$变成可求导的损失,整个DFT流程必须可微。AI2DFT的核心工程正在于此:把Kohn-Sham求解——对角化、占据数确定、电荷密度组装、有效势更新——全部改写为可微计算图,让自动微分和反向传播穿透DFT算法本身。梯度从能量泛函出发,一路回传到神经网络的每一个参数。
这个视角下,传统DFT的自洽迭代与深度学习的梯度下降不再是两套语言,而是同一个优化的两种执行方式:前者是物理学家写了一个世纪的定点迭代,后者是可以借助现代加速器与自动微分基础设施批量调度的数值优化。
能量极小化的边界:非占据态难题
故事如果到此为止就太完美了,而DeepH-Zero最有意思的部分恰恰是它撞上的那堵墙。
作者在与SCF-DFT的对比中发现一个微妙的问题:变分极小化能正确给出总能量、电荷密度和密度矩阵,占据态流形也对得上,但哈密顿量本身不对。原因说来简单:零温下基态能量只依赖占据态,对非占据态$\psi_u$的能量变分为零,
非占据态对能量泛函的贡献为零——它们落在变分的”盲区”里,能量极小化无法唯一地确定它们。换句话说,哈密顿量携带的信息虽然完备却冗余,密度矩阵$\rho$才是”恰好够用”的那个量(这正是密度矩阵泛函理论的立足点)。
补救方案也顺势而出:既然变分给出的密度矩阵可靠,就以它为唯一约束重构哈密顿量$\tilde{H}$作为后处理,
得到的基态哈密顿量与SCF结果一致。这个”绕道密度矩阵”的细节生动地说明:把机器学习嫁接到物理上时,物理内部的层级结构(什么量基本、什么量导出)会原封不动地传递为学习的约束条件。
表现与意义
数值实验显示,DeepH-Zero的精度与效率均优于同架构的常规监督式DeepH——毕竟它直接向物理原理看齐,而不必经过”DFT数据质量”这道中间折损。更重要的是范式的开放性:在这个框架里,DFT算法的每一次改进都会立刻转化为更好的损失函数与梯度,两个领域的方法学终于开始互相喂养。
当然,代价也存在:可微DFT的计算图比一次前向传播昂贵得多,训练成本显著上升;非占据态问题也提示变分路线天然适合”只要基态可观测量”的场景。它与监督式方法不是替代关系,而是同一枚硬币的两面。
结语
从初代DeepH到DeepH-E3再到DeepH-2,我们看到的都是”如何把映射学得更好”;DeepH-Zero问的则是”要不要学这个映射”。它把变分原理请回舞台中央,让神经网络直接参与物理问题的求解——这种物理信息驱动的思路,与收官篇将登场的深度学习QMC遥相呼应,我们在 深度学习电子结构:全景与展望 再回头比较。
接下来两篇回到应用的主线:先看DeepH框架如何攻占杂化泛函精度并走向通用模型( DeepH的应用:杂化泛函与通用模型 ),再看磁性超胞上的拓展 xDeepH:磁性超胞的等变网络 。




