有机化学organic chemistry

阅读

1.  introduction

三氟化氮(NF₃)是半导体与光伏制造中不可替代的等离子刻蚀和腔室清洗气体。相较其替代的全氟化碳(PFCs)和 SF₆,NF₃ 在等离子体中的分解率更高(>90%),理论上可降低直接排放。然而,NF₃ 的 100 年全球变暖潜势(GWP)高达 CO₂ 的 17,200 倍,大气寿命约 550 年[1]。Weiss 等[2]于 2008 年首次实测大气 NF₃ 浓度,发现其排放量是工业报告的 4 倍,年增长率约 11%,被称为"被忽略的温室气体"。此后 NF₃ 被纳入《京都议定书》第二承诺期受控气体清单及 GHG Protocol 企业报告标准。工业尾气中未完全利用的 NF₃ 以万公吨/年计,其高效捕获与回收既能满足日益严苛的碳排放监管要求,又具有可观的电子特气循环经济价值。因此,开发兼具高 NF₃ 吸附容量和高 NF₃/N₂ 选择性的吸附材料,是半导体制造业可持续发展的关键技术需求。

金属有机框架(MOFs)因其模块化结构、超高比表面积和可后修饰的孔道化学环境,在气体吸附分离领域展现出传统多孔材料难以比拟的优势。Wilmer 等[3]首次提出利用建筑块组合策略生成大规模假想 MOF 库(137,953 种),并通过 GCMC 计算筛选甲烷储存候选材料,开创了 MOF 高通量计算筛选(HTS)范式。然而,MOF 的化学-结构组合空间近乎无限(>10¹⁰⁰ 种可能拓扑),逐一实验合成不可行,而巨正则蒙特卡洛(GCMC)模拟虽可从第一性原理预测吸附性能,单次计算即消耗数核时,难以覆盖全化学空间。近年来,高通量筛选结合机器学习(ML)代理模型已在 CO₂、CH₄、H₂ 等体系的 MOF 筛选中取得重要进展[4-6],但针对 NF₃ 的 ML-HTS 研究仍面临三方面瓶颈:(i) NF₃ 具有独特的偶极矩(0.234 D)与极化率特性,基于轻气体体系训练的模型无法直接迁移;(ii) 现有 MOF 特征工程缺乏对化学衍生描述符(不饱和度 tunsat、开放金属位点比例 OMS、元素计量比 mperc/omr 等)的系统评估;(iii) 多模型评价多依赖单一误差指标(RMSE 或 R²),缺少统一、量化惩罚过拟合与异常预测偏差的复合排名指标。

本研究构建了一个从多模态特征提取到可解释性分析的 NF₃-MOF 高通量筛选 ML 流程。我们以 3,188 个 MOF 为数据基础,提取 28 维特征(几何结构、元素组成、亨利常数、化学衍生描述符),以 NF₃ 吸附量(NF₃_abs, mol/kg)、NF₃/N₂ 选择性(Selectivity)和权衡指数(TSN)为三目标变量。具体流程为:首先通过 Pearson 相关性与互信息(MI)筛选去除 4 个共线冗余特征及 2 个低 MI 特征(Metalloid%、N_O,归一化阈值 0.03),保留 22 个关键描述符;随后在 5 折交叉验证下评估六种集成学习模型(RF、GBDT、XGBoost、LightGBM、CatBoost、NGBoost[7])的预测性能;进而引入 Z-score 标准化的复合排名指标(CRL),通过贝叶斯优化(scikit-optimize gp_minimize)确定权重 α = 0.06、β = 0.31(Spearman ρ = 0.924),实现过拟合与 MAE 偏差的量化区分;最后基于 SHAP TreeExplainer[8] 解析 NGBoost 的特征重要性,揭示 K_NF3 对吸附量与 TSN 的主导作用(>70% |SHAP|),以及 Qst_NF3_ext 与几何特征在选择性预测中的关键贡献。该流程为低 GWP 电子特气捕获 MOF 的理性设计提供了数据驱动的筛选框架。

2.  research method

2.1.  MOF dataset

使用qmof[9]作为数据集研究,包含20372个MOF结构。

2.2.  Descriptor acquisition

几何描述符

 几何描述符是通过zeo++[10]获取的。分别是LCD,PLD,gASA,Density,porosity,AV,PLD/LCD。

描述符全称单位描述公式
PorosityPorosity孔隙率$\phi = V_{\text{pore}} / V_{\text{total}}$
LCDLargest Cavity DiameterÅ最大空腔直径Zeo++ 几何计算
AVAccessible Volumecm³/g可及孔容Zeo++ 几何计算
DensityFramework Densityg/cm³框架密度$\rho = m / V_{\text{cell}}$
ASAAccessible Surface Aream²/g可及表面积Zeo++ 几何计算
PLDPore Limiting DiameterÅ孔道限制直径Zeo++ 几何计算

热力学描述符

热力学描述符是通过raspa软件包[11]模拟得到的。

描述符全称单位描述公式
K_NF3Henry Constant (NF₃)mol/(kg·Pa)NF₃ 亨利常数$K_H = \lim_{P\to 0} q/P$
K_N2Henry Constant (N₂)mol/(kg·Pa)N₂ 亨利常数$K_H = \lim_{P\to 0} q/P$
Qst_NF3_extExtracted Qst (NF₃)kJ/molNF₃ 吸附热$Q_{st} = RT^2(\partial \ln P / \partial T)_q$

化学描述符

原子数目从cif文件中提取,不饱和度和开放位点使用pymatgen[12]辅助计算

描述符全称单位描述公式
O%Oxygen Percentage%氧原子百分比$N_O / N_{\text{total}}$
C%Carbon Percentage%碳原子百分比$N_C / N_{\text{total}}$
N%Nitrogen Percentage%氮原子百分比$N_N / N_{\text{total}}$
H%Hydrogen Percentage%氢原子百分比$N_H / N_{\text{total}}$
Metal%Metal Percentage%金属原子百分比$N_{\text{M}} / N_{\text{total}}$
NonMetal%Non-Metal Percentage%非金属原子百分比$N_{\text{NM}} / N_{\text{total}}$
Halogen%Halogen Percentage%卤素原子百分比$N_{\text{X}} / N_{\text{total}}$
Metalloid%Metalloid Percentage%类金属原子百分比$N_{\text{Metalloid}} / N_{\text{total}}$
EAPElectronegative Atom Percentage%电负性原子占比$(N_N + N_O + N_F + N_{Cl}) / N_{\text{total}}$
mpercMetal-to-Carbon Ratio金属碳比$N_{\text{M}} / N_C$
omrOxygen-to-Metal Ratio氧金属比$N_O / N_{\text{M}}$
N_ONitrogen-to-Oxygen Ratio氮氧比$N_N / N_O$
OMSOpen Metal Sites开放金属位点比例$N_{\text{M, CN < max}} / N_{\text{M}}$
unsatUnsaturation per Carbon单位碳不饱和度$\text{tunsat} / N_C$
tunsatUnsaturation Degree不饱和度$N_{\text{C,N in 5-6 rings}} / N_{\text{total}}$

2.3 单变量分析

2.4 样本分布

2.5 特征筛选

使用互信息特征选择[13]的方式对特征进行筛选,通过归一化互信息筛选,剔除那些在机器学习训练过程输入特征相关性较高的描述符。

以归一化后的0.03作为剔除阈值。剔除了N_O和Metalloid两种描述符。

2.6 机器学习

使用随机森林(random forest, RF),梯度提升树 (GBDT),极端梯度提升( XGBoost),轻量梯度提升机(LightGBM),类别梯度提升(CatBoost),自然梯度提升(NGBoost)。对筛选后的3188个mof进行训练。使用$R^2$,MAE,RMSE,CRL进行模型评估。

决定系数,$R^2 = 1 - \frac{\sum(y_i - \hat{y}_i)^2}{\sum(y_i - \bar{y})^2}$,越接近 1 越好,衡量模型解释方差比例。

平均绝对误差,$\text{MAE} = \frac{1}{n}\sum_{i=1}^n |y_i - \hat{y}_i|$,越小越好,与目标同量纲 。

均方根误差,$\text{RMSE} = \sqrt{\frac{1}{n}\sum_{i=1}^n (y_i - \hat{y}_i)^2}$,越小越好,对大误差敏感。

 综合排名指标,$\text{CRL} = \text{RMSE}{\text{test}} + \alpha \cdot \max(0, \text{RMSE}{\text{test}} - \text{RMSE}{\text{train}}) + \beta \cdot (\text{RMSE}{\text{test}} - \text{MAE}_{\text{test}})$,同时惩罚过拟合和高估偏差。

 $\alpha=0.06\beta=0.31$,使用贝叶斯优化进行权重值确定[14]

XGboost

RF

GBDT

CatBoost

LGBoost

NGBoost

2.6.1 NF₃ 吸附量 (NF3_abs_mol_kg)

模型Train RMSETest RMSETest MAEOverfit (ΔRMSE)MAE Gap
RF0.00610.01100.00400.00490.0070
LightGBM0.00410.00960.00170.00550.0079
XGBoost0.00050.00980.00190.00930.0079
GBDT0.00100.00900.00350.00800.0055
NGBoost0.00410.00680.00400.00270.0028
CatBoost0.00090.01010.00200.00920.0081

2.6.2 NF₃/N₂ 选择性 (Selectivity)

模型Train RMSETest RMSETest MAEOverfit (ΔRMSE)MAE Gap
RF0.12520.24340.12370.11820.1197
LightGBM0.05060.16110.08300.11050.0781
XGBoost0.01690.17870.08790.16180.0908
GBDT0.02570.21350.10970.18780.1038
NGBoost0.12780.21490.12380.08710.0911
CatBoost0.04450.17960.08660.13510.0930

2.6.3 权衡选择数 (TSN)

模型Train RMSETest RMSETest MAEOverfit (ΔRMSE)MAE Gap
RF0.00600.01070.00320.00470.0075
LightGBM0.00410.00950.00180.00540.0077
XGBoost0.00040.01030.00190.00990.0084
GBDT0.00070.00810.00280.00740.0053
NGBoost0.00240.00680.00250.00440.0043
CatBoost0.00090.01070.00200.00980.0087

Overfit = max(0, Test RMSE - Train RMSE),MAE Gap = Test RMSE - Test MAE。

对这些模型的CRL综合排名

2.7 SHAP值权重分析

[1] Robson, J. I., Gohar, L. K., Hurley, M. D., Shine, K. P. & Wallington, T. J. Revised IR spectrum, radiative efficiency and global warming potential of nitrogen trifluoride. Geophys. Res. Lett. 33, L10817 (2006).

[2] Weiss, R. F., Mühle, J., Salameh, P. K. & Harth, C. M. Nitrogen trifluoride in the global atmosphere. Geophys. Res. Lett. 35, L20821 (2008).

[3] Wilmer, C. E. et al. Large-scale screening of hypothetical metal–organic frameworks. Nature Chem. 4, 83–89 (2012).

[4] Jablonka, K. M., Ongari, D., Moosavi, S. M. & Smit, B. Big-data science in porous materials: materials genomics and machine learning. Chem. Rev. 120, 8066–8129 (2020).

[5] Moosavi, S. M. et al. Understanding the diversity of the metal-organic framework ecosystem. Nature Commun. 11, 4068 (2020).

[6] Daglar, H. & Keskin, S. Recent advances, opportunities, and challenges in high-throughput computational screening of MOFs for gas separations. Coord. Chem. Rev. 422, 213470 (2020).

[7] Duan, T. et al. NGBoost: natural gradient boosting for probabilistic prediction. Proc. ICML 37, 2690–2700 (2020).

[8] Lundberg, S. M. & Lee, S.-I. A unified approach to interpreting model predictions. Adv. Neural Inf. Process. Syst. 30, 4765–4774 (2017).

[9] Rosen, A. QMOF Database. figshare https://doi.org/10.6084/m9.figshare.13147324.v18 (2020).

[10] Willems, T. F., Rycroft, C. H., Kazi, M., Meza, J. C. & Haranczyk, M. Algorithms and tools for high-throughput geometry-based analysis of crystalline porous materials. Micropor. Mesopor. Mater. 149, 134–141 (2012).

[11] Dubbeldam, D., Calero, S., Ellis, D. E. & Snurr, R. Q. RASPA: molecular simulation software for adsorption and diffusion in flexible nanoporous materials. Mol. Simul. 42, 81–101 (2016).

[12] Ong, S. P. et al. Python Materials Genomics (pymatgen): a robust, open-source python library for materials analysis. Comput. Mater. Sci. 68, 314–319 (2013).

[13] Brown, G., Pocock, A. & Zhao, M.-J. Conditional likelihood maximisation: a unifying framework for information theoretic feature selection. J. Mach. Learn. Res. 13, 27–66 (2012).

[14] Wang, Z., Hutter, F., Zoghi, M., Matheson, D. & de Freitas, N. Bayesian optimization in a billion dimensions via random embeddings. J. Artif. Intell. Res. 55, 361–387 (2016).

comments powered by Disqus