2020年4月8日
通过利用遗传算法以及半经验和ab initio量子化学的多步构型采样方法,可从低能结构的热化学性质计算弱结合分子簇的大气浓度。
本方案为研究弱结合分子团簇提供了一种灵活且计算上可行的方法,可直接用于深入理解其结构、形成过程及丰度。该技术的主要优势在于能够以不同理论水平高效且灵活地处理分子团簇,涵盖从快速的力场和半经验方法到严格的量子力学方法。大气化学和气溶胶化学领域将从该方法中获益最多,从而推动建立更精确的气候变化模型。
然而,任何涉及分子簇的领域均可利用这一方法。对于从未操作过该技术的人员而言,最具挑战性的步骤是初始程序和脚本的安装,以及将其适配到本地计算环境的过程。计算化学领域的新手学生可通过直观的分步操作演示,克服在使用高性能计算集群过程中面临的学习曲线陡峭问题。
为了在遗传算法构型采样中使用孤立甘氨酸分子的最低能量结构,首先在 Avogadro 中新建一个会话,依次点击“构建”、“插入”、“多肽”、“甘氨酸”,然后点击“插入多肽”,在可视化窗口中生成一个甘氨酸单体。接着点击“扩展”和“Gaussian”,按照提示编辑文本框中的第一行内容。点击“生成”,并将命令文件保存为 glycine.com。
为了获得孤立水分子的最低能量结构,在 Avogadro 中新建一个会话,选择 构建(Build)、插入(Insert)和片段(Fragment)。在过滤文本框中输入 water,选择水分子文件并点击插入(Insert)。点击 扩展(Extensions)和 Gaussian,在文本框中按指示编辑第一行。
单击生成,将命令文件保存为 water.com。然后将两个 com 文件传输到计算集群,并使用相应的提交脚本运行 Gaussian 09 计算。当计算在计算集群上完成后,调用 Open Babel,按照所示命令输入以生成最低能量结构的 xyz 文件。
对于基于遗传算法的构型采样,将所有脚本和模板添加到一个文件夹中,并将该文件夹复制到远程集群。确保所有脚本均可执行,并按照指示使用命令将脚本目录的位置添加到路径环境变量中。为了在较低计算成本的半经验理论水平上获得甘氨酸与水的一组低能结构,创建一个名为 gly-h2o-n 的目录,其中 n 为水分子的数量,并在 gly-h2o-n 目录下创建一个名为 GA 的子目录,用于运行遗传算法计算。
将ogolem输入文件、单体的笛卡尔坐标以及PBS批处理提交脚本复制到GA目录中,并使用经过适当修改的run.pbs提交脚本运行GA计算。计算完成后,切换至gly-h2o-n GA pm7目录,并按提示运行getRotConsts命令,其中13表示团簇中的原子数,zero和nine表示共有10个结构,其索引范围为zero到nine。
这将计算经遗传算法(GA)优化的团簇的转动常数,并生成一个名为 rotConstsData_C 的文件,该文件包含所有 GA 优化团簇构型的排序列表,以及它们的能量和转动常数。将 rotConstsData_C 文件作为输入,运行 similarityAnalysis.py 脚本,以找出并保存唯一的 GA 优化团簇。
Pm7 将用作文件命名标签,以生成名为 uniqueStructures-pm7.data 的文件。该文件包含经过遗传算法优化后得到的唯一构型的排序列表。在 gly-h2o-n GA 目录中,使用 combine-GA。
csh 脚本用于合并多次可比较的遗传算法(GA)运行结果,并在 gly-h2o-n GA 目录中生成一个名为 uniqueStructures-pm7.data 的新唯一结构列表。工作目录应具有如图所示的确切组织和结构。
为了利用更精确的量子力学方法对基于半经验方法的遗传算法得到的甘氨酸水团簇结构进行优化,需在 gly-h2o-n 目录下创建一个名为 QM 的子目录。在 QM 目录下,再创建一个名为 pw91-sb 的子目录,并将 gly-h2o-n GA 目录中的 uniqueStructures 列表复制到 QM pw91-sb 目录中。随后切换至 gly-h2o-n QM pw91-sb 目录,运行小基组密度泛函理论脚本 run-pw91-sb。
csh,其中 sb 是此组计算的标签,Q 是计算集群上首选的队列,10 表示将 10 次计算合并为一个批处理作业。提交的计算完成后,使用 getRotConsts-dft-sb.csh 脚本提取能量,并计算小基组优化团簇的转动常数。
此处,pw91 是所采用的密度泛函,n 是团簇中的原子数目。与之前一样,使用 similaryAnalysis.py 脚本识别独特结构,但使用 sb 作为标签。
在 pw91 631 加 G 星理论级别下优化的一组独特构型将被保存在 uniqueStructures-sb.data 文件中。在 gly-h2o-n QM 目录中,使用组合文件 combine-QM。
用于合并多次可比较的量子力学(QM)运行结果的 csh 脚本。执行 combine-QM.csh pw91-sb 命令将生成一个名为 uniqueStructures-sb 的新唯一结构列表。
gly-h2o-n QM 目录中的数据。为了使用更精确的量子力学描述进一步优化甘氨酸和水团簇的结构,在 QM 目录下创建一个名为 pw91-lb 的子目录。将唯一结构列表从 QM pw91-sb 目录复制到 QM pw91-lb 目录,并将当前目录更改为 QM pw91-lb。
运行大基组密度泛函理论脚本 run-pw91-lb.csh,其中 lb 是此组计算的标签,Q 是计算集群上首选的队列,10 表示将 10 次计算归入一个批处理作业中。提交的计算完成后,使用 getRotConsts-dft-lb。
用于计算大基组优化团簇转动常数的 csh 命令。其中,pw91 是所采用的密度泛函,n 为团簇中的原子数目。使用 similarityAnalysis。
使用之前的 py 脚本,但现在以 lb 作为标签,生成在 pw91 6-311++G** 理论水平上优化的唯一构型列表,并保存至 uniqueStructures-lb.data 文件中。为了获得计算所需热化学校正量所必需的甘氨酸和水团簇的振动结构与能量,请将唯一构型列表从 QM pw91-lb 目录复制到 QM pw91-lb ultrafine 目录,并将当前目录更改为 QM/pw91-lb ultrafine。
运行超精细密度泛函理论脚本 run-pw91-lb-ultrafine.csh,其中 uf 是此组计算的标签,Q 是计算集群上首选的队列,10 表示将 10 次计算归为一批作业。该脚本将自动为 Gaussian 09 生成输入文件并提交所有计算任务。
当提交的计算完成后,使用 getRotConsts-dft-lb-ultrafine.csh 命令计算超精细优化团簇的转动常数。其中,pw91 是所采用的密度泛函,n 为团簇中的原子数目。
使用 similarityAnalysis.py 脚本,像之前一样,但现在以 uf 作为标签,在 pw91 6-311++G** 理论水平下生成并保存一份独特的构型列表,这些构型已针对超精细收敛标准进行优化,并存储在 uniqueStructures-uf.data 文件中。
然后运行 run-thermo-pw91.csh 脚本,并以 uniqueStructures-uf.data 文件作为输入,计算热力学校正。
将命令行输出结果复制并粘贴到名为 gly-h2o-n.xls 的附带电子表格中。随着本计算以及后续 n 等于 2、3、4 和 5 的计算所得的原始能量数据被添加至 gly-h2o-n.xls 电子表格的第一张工作表,水合物分布工作表将自动更新,该工作表可给出在不同温度、相对湿度以及水和甘氨酸初始浓度下的水合物平衡浓度。
此处可以观察到甘氨酸-水团簇中电子能量最低的异构体。注意随着水分子数量的增加,氢键网络的复杂性如何逐渐增加,从基本上是平面的结构发展到当 n 等于 5 时的三维笼状结构。在此表中,展示了 run-thermo-pw91 运行结果的一个示例。
csh 脚本如图所示。对于每个团簇,pw91 6-311++G** 的能量对应于气相电子能,该能量在 pw91 6-311++G** 理论水平上使用超精细积分网格计算,单位为哈特里,同时还包括零点振动能,单位为千卡每摩尔。在每个温度下,给出计算的焓变形成能 ΔH 和吉布斯自由能形成能 ΔG,单位为千卡每摩尔,而计算的熵形成能 S 的单位为卡每摩尔。
本表展示了甘氨酸总水合吉布斯自由能变化及逐步水合过程的代表性计算结果。利用这些数据,可计算出大气中水合甘氨酸的浓度。用户必须安装正确的软件,并将所附脚本添加至自身计算环境中以适配使用。
将脚本的位置添加到用户的路径中至关重要。该技术被用于确定大气水团簇在肽键形成中的催化活性,以推动前生命化学领域的发展。
本文介绍了一种用于研究弱结合分子簇的计算方法,重点关注其结构、形成过程及丰度。该方法结合遗传算法与量子化学技术,以获得低能量构型。
该计算方案能够高效探索弱结合的分子簇,通过降低生物分子相互作用的机制风险来支持靶点验证。通过提供吉布斯自由能曲面和大气浓度预测,该方法增强了在肽类药物和前生命化学应用的早期发现阶段的预测可信度。该方法连接了计算化学与转化应用,为评估分子在生理条件下的稳定性提供了一个可重复使用的框架。
该方法通过提供用于假设检验的结构与热力学输入,整合到早期发现工作流程中,从构型采样推进至量子精修与性质预测。