1. introduction
三氟化氮(NF₃)是半导体与光伏制造中不可替代的等离子刻蚀和腔室清洗气体。相较其替代的全氟化碳(PFCs)和 SF₆,NF₃ 在等离子体中的分解率更高(>90%),理论上可降低直接排放。然而,NF₃ 的 100 年全球变暖潜势(GWP)高达 CO₂ 的 17,200 倍,大气寿命约 550 年[1]。Weiss 等[2]于 2008 年首次实测大气 NF₃ 浓度,发现其排放量是工业报告的 4 倍,年增长率约 11%,被称为"被忽略的温室气体"。此后 NF₃ 被纳入《京都议定书》第二承诺期受控气体清单及 GHG Protocol 企业报告标准。工业尾气中未完全利用的 NF₃ 以万公吨/年计,其高效捕获与回收既能满足日益严苛的碳排放监管要求,又具有可观的电子特气循环经济价值。因此,开发兼具高 NF₃ 吸附容量和高 NF₃/N₂ 选择性的吸附材料,是半导体制造业可持续发展的关键技术需求。
金属有机框架(MOFs)因其模块化结构、超高比表面积和可后修饰的孔道化学环境,在气体吸附分离领域展现出传统多孔材料难以比拟的优势。Wilmer 等[3]首次提出利用建筑块组合策略生成大规模假想 MOF 库(137,953 种),并通过 GCMC 计算筛选甲烷储存候选材料,开创了 MOF 高通量计算筛选(HTS)范式。然而,MOF 的化学-结构组合空间近乎无限(>10¹⁰⁰ 种可能拓扑),逐一实验合成不可行,而巨正则蒙特卡洛(GCMC)模拟虽可从第一性原理预测吸附性能,单次计算即消耗数核时,难以覆盖全化学空间。近年来,高通量筛选结合机器学习(ML)代理模型已在 CO₂、CH₄、H₂ 等体系的 MOF 筛选中取得重要进展[4-6],但针对 NF₃ 的 ML-HTS 研究仍面临三方面瓶颈:(i) NF₃ 具有独特的偶极矩(0.234 D)与极化率特性,基于轻气体体系训练的模型无法直接迁移;(ii) 现有 MOF 特征工程缺乏对化学衍生描述符(不饱和度 tunsat、开放金属位点比例 OMS、元素计量比 mperc/omr 等)的系统评估;(iii) 多模型评价多依赖单一误差指标(RMSE 或 R²),缺少统一、量化惩罚过拟合与异常预测偏差的复合排名指标。
本研究构建了一个从多模态特征提取到可解释性分析的 NF₃-MOF 高通量筛选 ML 流程。我们以 3,188 个 MOF 为数据基础,提取 28 维特征(几何结构、元素组成、亨利常数、化学衍生描述符),以 NF₃ 吸附量(NF₃_abs, mol/kg)、NF₃/N₂ 选择性(Selectivity)和权衡指数(TSN)为三目标变量。具体流程为:首先通过 Pearson 相关性与互信息(MI)筛选去除 4 个共线冗余特征及 2 个低 MI 特征(Metalloid%、N_O,归一化阈值 0.03),保留 22 个关键描述符;随后在 5 折交叉验证下评估六种集成学习模型(RF、GBDT、XGBoost、LightGBM、CatBoost、NGBoost[7])的预测性能;进而引入 Z-score 标准化的复合排名指标(CRL),通过贝叶斯优化(scikit-optimize gp_minimize)确定权重 α = 0.06、β = 0.31(Spearman ρ = 0.924),实现过拟合与 MAE 偏差的量化区分;最后基于 SHAP TreeExplainer[8] 解析 NGBoost 的特征重要性,揭示 K_NF3 对吸附量与 TSN 的主导作用(>70% |SHAP|),以及 Qst_NF3_ext 与几何特征在选择性预测中的关键贡献。该流程为低 GWP 电子特气捕获 MOF 的理性设计提供了数据驱动的筛选框架。
2. research method
2.1. MOF dataset
使用qmof[9]作为数据集研究,包含20372个MOF结构。
2.2. Descriptor acquisition
几何描述符
几何描述符是通过zeo++[10]获取的。分别是LCD,PLD,gASA,Density,porosity,AV,PLD/LCD。
| 描述符 | 全称 | 单位 | 描述 | 公式 |
|---|---|---|---|---|
| Porosity | Porosity | — | 孔隙率 | $\phi = V_{\text{pore}} / V_{\text{total}}$ |
| LCD | Largest Cavity Diameter | Å | 最大空腔直径 | Zeo++ 几何计算 |
| AV | Accessible Volume | cm³/g | 可及孔容 | Zeo++ 几何计算 |
| Density | Framework Density | g/cm³ | 框架密度 | $\rho = m / V_{\text{cell}}$ |
| ASA | Accessible Surface Area | m²/g | 可及表面积 | Zeo++ 几何计算 |
| PLD | Pore Limiting Diameter | Å | 孔道限制直径 | Zeo++ 几何计算 |
热力学描述符
热力学描述符是通过raspa软件包[11]模拟得到的。
| 描述符 | 全称 | 单位 | 描述 | 公式 |
|---|---|---|---|---|
| K_NF3 | Henry Constant (NF₃) | mol/(kg·Pa) | NF₃ 亨利常数 | $K_H = \lim_{P\to 0} q/P$ |
| K_N2 | Henry Constant (N₂) | mol/(kg·Pa) | N₂ 亨利常数 | $K_H = \lim_{P\to 0} q/P$ |
| Qst_NF3_ext | Extracted Qst (NF₃) | kJ/mol | NF₃ 吸附热 | $Q_{st} = RT^2(\partial \ln P / \partial T)_q$ |
化学描述符
原子数目从cif文件中提取,不饱和度和开放位点使用pymatgen[12]辅助计算
| 描述符 | 全称 | 单位 | 描述 | 公式 |
|---|---|---|---|---|
| O% | Oxygen Percentage | % | 氧原子百分比 | $N_O / N_{\text{total}}$ |
| C% | Carbon Percentage | % | 碳原子百分比 | $N_C / N_{\text{total}}$ |
| N% | Nitrogen Percentage | % | 氮原子百分比 | $N_N / N_{\text{total}}$ |
| H% | Hydrogen Percentage | % | 氢原子百分比 | $N_H / N_{\text{total}}$ |
| Metal% | Metal Percentage | % | 金属原子百分比 | $N_{\text{M}} / N_{\text{total}}$ |
| NonMetal% | Non-Metal Percentage | % | 非金属原子百分比 | $N_{\text{NM}} / N_{\text{total}}$ |
| Halogen% | Halogen Percentage | % | 卤素原子百分比 | $N_{\text{X}} / N_{\text{total}}$ |
| Metalloid% | Metalloid Percentage | % | 类金属原子百分比 | $N_{\text{Metalloid}} / N_{\text{total}}$ |
| EAP | Electronegative Atom Percentage | % | 电负性原子占比 | $(N_N + N_O + N_F + N_{Cl}) / N_{\text{total}}$ |
| mperc | Metal-to-Carbon Ratio | — | 金属碳比 | $N_{\text{M}} / N_C$ |
| omr | Oxygen-to-Metal Ratio | — | 氧金属比 | $N_O / N_{\text{M}}$ |
| N_O | Nitrogen-to-Oxygen Ratio | — | 氮氧比 | $N_N / N_O$ |
| OMS | Open Metal Sites | — | 开放金属位点比例 | $N_{\text{M, CN < max}} / N_{\text{M}}$ |
| unsat | Unsaturation per Carbon | — | 单位碳不饱和度 | $\text{tunsat} / N_C$ |
| tunsat | Unsaturation Degree | — | 不饱和度 | $N_{\text{C,N in 5-6 rings}} / N_{\text{total}}$ |
2.3 单变量分析



2.4 样本分布

2.5 特征筛选
使用互信息特征选择[13]的方式对特征进行筛选,通过归一化互信息筛选,剔除那些在机器学习训练过程输入特征相关性较高的描述符。

以归一化后的0.03作为剔除阈值。剔除了N_O和Metalloid两种描述符。
2.6 机器学习
使用随机森林(random forest, RF),梯度提升树 (GBDT),极端梯度提升( XGBoost),轻量梯度提升机(LightGBM),类别梯度提升(CatBoost),自然梯度提升(NGBoost)。对筛选后的3188个mof进行训练。使用$R^2$,MAE,RMSE,CRL进行模型评估。
决定系数,$R^2 = 1 - \frac{\sum(y_i - \hat{y}_i)^2}{\sum(y_i - \bar{y})^2}$,越接近 1 越好,衡量模型解释方差比例。
平均绝对误差,$\text{MAE} = \frac{1}{n}\sum_{i=1}^n |y_i - \hat{y}_i|$,越小越好,与目标同量纲 。
均方根误差,$\text{RMSE} = \sqrt{\frac{1}{n}\sum_{i=1}^n (y_i - \hat{y}_i)^2}$,越小越好,对大误差敏感。
综合排名指标,$\text{CRL} = \text{RMSE}{\text{test}} + \alpha \cdot \max(0, \text{RMSE}{\text{test}} - \text{RMSE}{\text{train}}) + \beta \cdot (\text{RMSE}{\text{test}} - \text{MAE}_{\text{test}})$,同时惩罚过拟合和高估偏差。
$\alpha=0.06\beta=0.31$,使用贝叶斯优化进行权重值确定[14]
XGboost
RF
GBDT
CatBoost
LGBoost
NGBoost
2.6.1 NF₃ 吸附量 (NF3_abs_mol_kg)
| 模型 | Train RMSE | Test RMSE | Test MAE | Overfit (ΔRMSE) | MAE Gap |
|---|---|---|---|---|---|
| RF | 0.0061 | 0.0110 | 0.0040 | 0.0049 | 0.0070 |
| LightGBM | 0.0041 | 0.0096 | 0.0017 | 0.0055 | 0.0079 |
| XGBoost | 0.0005 | 0.0098 | 0.0019 | 0.0093 | 0.0079 |
| GBDT | 0.0010 | 0.0090 | 0.0035 | 0.0080 | 0.0055 |
| NGBoost | 0.0041 | 0.0068 | 0.0040 | 0.0027 | 0.0028 |
| CatBoost | 0.0009 | 0.0101 | 0.0020 | 0.0092 | 0.0081 |
2.6.2 NF₃/N₂ 选择性 (Selectivity)
| 模型 | Train RMSE | Test RMSE | Test MAE | Overfit (ΔRMSE) | MAE Gap |
|---|---|---|---|---|---|
| RF | 0.1252 | 0.2434 | 0.1237 | 0.1182 | 0.1197 |
| LightGBM | 0.0506 | 0.1611 | 0.0830 | 0.1105 | 0.0781 |
| XGBoost | 0.0169 | 0.1787 | 0.0879 | 0.1618 | 0.0908 |
| GBDT | 0.0257 | 0.2135 | 0.1097 | 0.1878 | 0.1038 |
| NGBoost | 0.1278 | 0.2149 | 0.1238 | 0.0871 | 0.0911 |
| CatBoost | 0.0445 | 0.1796 | 0.0866 | 0.1351 | 0.0930 |
2.6.3 权衡选择数 (TSN)
| 模型 | Train RMSE | Test RMSE | Test MAE | Overfit (ΔRMSE) | MAE Gap |
|---|---|---|---|---|---|
| RF | 0.0060 | 0.0107 | 0.0032 | 0.0047 | 0.0075 |
| LightGBM | 0.0041 | 0.0095 | 0.0018 | 0.0054 | 0.0077 |
| XGBoost | 0.0004 | 0.0103 | 0.0019 | 0.0099 | 0.0084 |
| GBDT | 0.0007 | 0.0081 | 0.0028 | 0.0074 | 0.0053 |
| NGBoost | 0.0024 | 0.0068 | 0.0025 | 0.0044 | 0.0043 |
| CatBoost | 0.0009 | 0.0107 | 0.0020 | 0.0098 | 0.0087 |
Overfit = max(0, Test RMSE - Train RMSE),MAE Gap = Test RMSE - Test MAE。
对这些模型的CRL综合排名
2.7 SHAP值权重分析



[1] Robson, J. I., Gohar, L. K., Hurley, M. D., Shine, K. P. & Wallington, T. J. Revised IR spectrum, radiative efficiency and global warming potential of nitrogen trifluoride. Geophys. Res. Lett. 33, L10817 (2006).
[2] Weiss, R. F., Mühle, J., Salameh, P. K. & Harth, C. M. Nitrogen trifluoride in the global atmosphere. Geophys. Res. Lett. 35, L20821 (2008).
[3] Wilmer, C. E. et al. Large-scale screening of hypothetical metal–organic frameworks. Nature Chem. 4, 83–89 (2012).
[4] Jablonka, K. M., Ongari, D., Moosavi, S. M. & Smit, B. Big-data science in porous materials: materials genomics and machine learning. Chem. Rev. 120, 8066–8129 (2020).
[5] Moosavi, S. M. et al. Understanding the diversity of the metal-organic framework ecosystem. Nature Commun. 11, 4068 (2020).
[6] Daglar, H. & Keskin, S. Recent advances, opportunities, and challenges in high-throughput computational screening of MOFs for gas separations. Coord. Chem. Rev. 422, 213470 (2020).
[7] Duan, T. et al. NGBoost: natural gradient boosting for probabilistic prediction. Proc. ICML 37, 2690–2700 (2020).
[8] Lundberg, S. M. & Lee, S.-I. A unified approach to interpreting model predictions. Adv. Neural Inf. Process. Syst. 30, 4765–4774 (2017).
[9] Rosen, A. QMOF Database. figshare https://doi.org/10.6084/m9.figshare.13147324.v18 (2020).
[10] Willems, T. F., Rycroft, C. H., Kazi, M., Meza, J. C. & Haranczyk, M. Algorithms and tools for high-throughput geometry-based analysis of crystalline porous materials. Micropor. Mesopor. Mater. 149, 134–141 (2012).
[11] Dubbeldam, D., Calero, S., Ellis, D. E. & Snurr, R. Q. RASPA: molecular simulation software for adsorption and diffusion in flexible nanoporous materials. Mol. Simul. 42, 81–101 (2016).
[12] Ong, S. P. et al. Python Materials Genomics (pymatgen): a robust, open-source python library for materials analysis. Comput. Mater. Sci. 68, 314–319 (2013).
[13] Brown, G., Pocock, A. & Zhao, M.-J. Conditional likelihood maximisation: a unifying framework for information theoretic feature selection. J. Mach. Learn. Res. 13, 27–66 (2012).
[14] Wang, Z., Hutter, F., Zoghi, M., Matheson, D. & de Freitas, N. Bayesian optimization in a billion dimensions via random embeddings. J. Artif. Intell. Res. 55, 361–387 (2016).