尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
FAIR Chemistry OMC25 分子晶体数据集与 eSEN/UMA 预训练模型使用指南
FAIR Chemistry OMC25 分子晶体数据集与 eSEN/UMA 预训练模型使用指南【免费下载链接】ocpFAIR Chemistrys library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocp导读OMC25Open Molecular Crystals 2025是 FAIR Chemistry 发布的大规模有机分子晶体数据集包含超过 2500 万个由 VASP 在 PBED3 理论水平下计算的结构标注了总能量eV、原子受力eV/Å与应力eV/ų三类标签。本指南以 src/fairchem/data/omc/README.md 为骨架系统梳理 OMC25 的下载方式、数据格式、计算复现脚本VASP 输入文件生成、配套的 eSEN 与 UMA 预训练模型以及基于该数据集构建的 is2re 与多晶型polymorph基准评测流程帮助读者从数据获取、标签理解、计算复现到模型评测全链路掌握分子晶体领域的机器学习实践。OMC25 数据集概览PropertyValue规模2500 万 结构领域有机分子晶体organic molecular crystals标签总能量eV、受力eV/Å、应力eV/ų理论水平PBED3VASP 计算许可证CC BY 4.0下载地址HuggingFaceOMC25 数据集由超过 2500 万个有机分子晶体结构组成这些结构来自使用 Genarris 3.0 软件包将 OE62 分子随机填充进各种三维晶胞后的弛豫轨迹。所有结构均通过 VASP 计算获得总能量eV、受力eV/Å与应力eV/ų三类标签。其数据主体说明可参见 docs/molecules/datasets/omc25.md。获取 OMC25 数据集与预训练模型训练集与验证集OMC25 数据集的训练集和验证集划分可通过 HuggingFace 仓库facebook/OMC25下载采用CC BY 4.0 许可证。需要特别注意的是下载前必须先在该 HuggingFace 仓库页面申请仓库访问权限apply for the repository access获得授权后才能完成下载。预训练模型FAIR Chemistry 同时开源了面向分子晶体任务的预训练机器学习模型同样托管于 HuggingFaceeSEN 模型位于facebook/OMC25仓库UMA 模型位于facebook/UMA仓库。这些预训练模型采用商业友好的许可证发布包含一些地理与可接受用途限制。在 docs/molecules/models.md 中可以进一步了解分子晶体相关模型的全貌具体的模型清单与权重引用方式则可在 src/fairchem/core/calculate/pretrained_models.json 中查看。数据格式ASE DB 兼容的 LMDB 文件OMC25 数据集以ASE DB 兼容的 lmdb 文件*.aselmdb格式提供。这类文件可通过 ASE 数据库接口直接读取天然兼容 FAIR Chemistry 生态中的多种下游工具数据集加载层面src/fairchem/core/datasets/ase_datasets.py 中的AseDBDataset专门用于读取.aselmdb文件将其中存储的Atoms对象转换为训练/评测所需的图结构评测流程中例如 configs/uma/benchmark/omc-is2re-polymorphs.yaml 直接通过AseDBDataset加载7bt-polymorphs-is.aselmdb多晶型基准文件训练数据管线的数据同步与键映射配置如omc_energy、omc_forces、omc_stress字段的映射则定义在 configs/uma/evaluate/dataset/omc.yaml 中。复现 VASP 计算生成 PBED3 输入文件理论水平说明OMC25 的全部标签均在PBED3 理论水平下通过 VASP 计算得到。若要在自己的研究中复现或扩展这些计算请使用仓库提供的fairchem.data.omc.scripts.create_vasp_inputs.py脚本生成兼容的 VASP 输入文件。脚本用法生成 VASP 输入文件的脚本位于 src/fairchem/data/omc/scripts/create_vasp_inputs.py其命令行接口如下usage: create-vasp-inputs [-h] [-t {relax,static}] [-i INPUT_DIR] [-o OUTPUT_DIR] [-y INCAR_YML_DIR] Write VASP inputs.各参数含义参数说明默认值-t, --type计算类型可选relax弛豫或static静态relax-i, --input-dir输入 CIF 文件所在目录必填无-o, --output-dir输出 VASP 输入文件的目录与输入目录相同-y, --incar-yml-dirINCAR 设置的 YAML 文件目录./incars脚本同目录下的incars/典型用法示例# 从 cif 目录生成弛豫relax输入文件 python -m fairchem.data.omc.scripts.create_vasp_inputs \ -t relax \ -i /path/to/cif/files \ -o /path/to/vasp/inputs # 生成静态static输入文件 python -m fairchem.data.omc.scripts.create_vasp_inputs \ -t static \ -i /path/to/cif/files \ -o /path/to/vasp/inputs脚本底层实现逻辑从源码看create_vasp_inputs.py 的执行流程如下加载 INCAR 设置读取--incar-yml-dir下名为incar_{type}.yml的文件即incar_relax.yml、incar_relax_light.yml或incar_static.yml构造输入生成器relax类型使用atomate2.vasp.sets.core.RelaxSetGenerator默认执行 EDIFFG-0.001 eV/Å 的严格弛豫static类型使用StaticSetGenerator两者均指定user_potcar_functionalPBE_54_W_HASH并开启auto_kspacingTrue读取 CIF递归遍历输入目录下所有*.cif文件用 ASE 的read解析为Atoms对象解析失败的 CIF 会被记录并跳过不会中断整个任务写入 VASP 输入借助pymatgen.io.ase.AseAtomsAdaptor将Atoms转为Structure再调用write_vasp_input_set为每个结构在独立子目录以 CIF 文件名命名中写出 INCAR、POSCAR、POTCAR、KPOINTS若目标子目录已存在则跳过避免覆盖已有输入。INCAR 设置详解仓库在 src/fairchem/data/omc/scripts/incars/ 目录下提供了三套 INCAR 模板严格弛豫incar_relax.ymlOMC25 数据集默认INCAR 参数值说明EDIFF1.0E-06电子自洽收敛阈值EDIFFG-1.0E-03离子弛豫力收敛阈值eV/ÅENCUT520平面波截断能eVGGAPEPBE 交换关联泛函IBRION2共轭梯度离子弛豫算法ISIF3原子位置 晶胞形状 体积全部弛豫ISMEAR/SIGMA0 / 0.10Gaussian 展宽ISPIN1非自旋极化IVDW11D3 色散校正零阻尼 DFT-D3LREALFalse实空间投影关闭精确计算LMIXTAU/LASPH/LORBITTrue / True / 11动能密度混合、球谐增强、投影态密度输出LWAVE/LAECHG/LVTOTFalse不写 WAVECAR、电荷密度、总势场文件节省磁盘NCORE100并行核数需按硬件调整NELM/NELMDL200 / -10电子步上限与初始步数NSW1500最大离子步数PREC/ADDGRIDNormal / True精度级别与补充网格轻量弛豫incar_relax_light.yml与严格弛豫几乎一致唯一的区别是EDIFFG: -1.0E-02收敛判据放宽一个数量级适合快速预扫描结构。如需快速筛选候选结构可先用 light 版本粗弛豫再对感兴趣的结构用默认严格版本精修。静态计算incar_static.yml用于在固定结构上做单点能/受力/应力计算与弛豫版本的关键差异INCAR 参数值说明IBRION-1不做离子弛豫ISIF0晶胞固定不变NSW0零离子步EDIFFG未设置静态计算无需力收敛判据其余参数ENCUT520、GGAPE、IVDW11、ISMEAR0、SIGMA0.10等与弛豫版本保持一致确保标签的理论水平完全对齐。基于 OMC25 的基准评测is2re 与多晶型任务仓库的configs/uma/benchmark/目录提供了直接可用的 OMC25 相关基准配置用于评估 UMA 预训练模型在分子晶体任务上的表现。is2re 基准configs/uma/benchmark/omc-is2re.yaml 针对分子晶体的初始结构到弛豫后能量is2re任务runner使用fairchem.core.components.calculate.RelaxationRunner加载cluster.data_root_dir/omc/is2re-v2目录下的.aselmdb数据集弛豫设置fmax0.001、steps5000优化器为 ASELBFGS配合ase.filters.FrechetCellFilter同时弛豫原子位置与晶胞能量归一化normalize_properties_by.energy nmolecules即按每分子能量energy per molecule评估消除晶胞内分子数差异带来的偏差输出与归约JsonDFReducer输出energy与energy_per_nmolecules两个指标键按sid索引生成基准结果任务规模以 5000 个 array job 并行调度num_array_jobs: 5000超时上限 72 小时。多晶型polymorph基准configs/uma/benchmark/omc-is2re-polymorphs.yaml 用于评测模型对多晶型结构能量排序ranking的能力数据7bt-polymorphs-is.aselmdb共 1030 个 array job弛豫设置fmax0.01、steps500优化器为 ASEBFGS同样配合FrechetCellFilter并开启save_relaxed_atoms: True保存弛豫后结构归约器使用专用组件OMCPolymorphReducer定义于 src/fairchem/core/components/benchmark/_single/omc_polymorph_reducer.py其核心功能包括以energy_per_nmolecules为目标键、molecule_id_target为分子标识键按多晶型分组计算能量排序当calculate_structural_metrics: True时使用pymatgen的StructureMatcherprimitive_cellFalse与JmolNN共价键网络比对结构是否匹配并计算匹配结构的原子位置 RMSD统计指标依赖scipykendalltau、spearmanr与scikit-learnMAE、MSE、R²未安装这些依赖时无法启用运行前提该 reducer 明确要求环境中安装pymatgen、scipy与scikit-learn否则会抛出Requires ...依赖检查错误。这两个基准配置都通过checkpoint: uma_sm与calculator: uma加载 UMA 小模型作为默认评测对象且calculator.task_name: omc表明计算器已针对分子晶体任务进行配置。引用规范当在你的研究中使用 OMC25 数据集或相关预训练模型时请引用以下论文misc{gharakhanyan2025openmolecularcrystals2025omc25dataset, title{Open Molecular Crystals 2025 (OMC25) Dataset and Models}, author{Vahe Gharakhanyan and Luis Barroso-Luque and Yi Yang and Muhammed Shuaibi and Kyle Michel and Daniel S. Levine and Misko Dzamba and Xiang Fu and Meng Gao and Xingyu Liu and Haoran Ni and Keian Noori and Brandon M. Wood and Matt Uyttendaele and Arman Boromand and C. Lawrence Zitnick and Noa Marom and Zachary W. Ulissi and Anuroop Sriram}, year{2025}, eprint{2508.02651}, archivePrefix{arXiv}, primaryClass{physics.chem-ph}, url{https://arxiv.org/abs/2508.02651}, }相关文档导航数据集概述与格式说明docs/molecules/datasets/omc25.md分子晶体模型概览docs/molecules/models.md数据集许可证src/fairchem/data/omc/LICENSE.md数据包__init__与脚本入口src/fairchem/data/omc/init.py【免费下载链接】ocpFAIR Chemistrys library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

方法派表演:从口误看演员沉浸式表演的艺术与挑战

方法派表演:从口误看演员沉浸式表演的艺术与挑战

1. 事件背景还原2023年12月某品牌活动现成,演员陈晓在珠海进行商业代言时,将活动主办方名称"XX珠宝"误称为竞争对手"YY珠宝",这段15秒的现场视频经网络传播后迅速发酵。活动次日,#陈晓口误#话题阅读量突破2.3…

📅 2026/9/18 8:59:46
科创知识图谱构建与应用实战解析

科创知识图谱构建与应用实战解析

1. 科创知识图谱的本质与价值在科技创新领域摸爬滚打十几年,我深刻体会到信息碎片化带来的创新效率瓶颈。去年参与某跨国研发项目时,团队花费了37%的工作时间在重复检索已有研究成果上——这种资源浪费促使我开始系统研究知识图谱技术的落地应用。科创知…

📅 2026/9/18 8:59:46
ThinkPad资产管理标签打印问题解决方案

ThinkPad资产管理标签打印问题解决方案

1. 问题背景与现象描述最近在给公司批量部署ThinkPad设备时,遇到了一个让人头疼的小问题:使用官方资产管理标签打印功能时,标签内容总是显示不全或者格式错乱。原本设计好的一页A4纸打印多个资产标签的方案,在实际输出时变成了各种…

📅 2026/9/18 8:59:46
MORE NEWS

更多资讯

📰

React Native鸿蒙Button组件适配与优化实践

1. React Native鸿蒙Button组件深度解析在跨平台开发领域,React Native已经成为连接不同操作系统的重要桥梁。作为一名专注于移动端开发的工程师,我在将React Native应用迁移到OpenHarmony平台时,发现Button组件的样式定制存在诸多特殊挑战。…

📰

dlt 数据伪匿名化实战:使用 add_map 与加盐哈希隐藏 PII 列

dlt 数据伪匿名化实战:使用 add_map 与加盐哈希隐藏 PII 列 【免费下载链接】dlt data load tool (dlt) is an open source Python library that makes data loading easy 🛠️ 项目地址: https://gitcode.com/GitHub_Trending/dl/dlt 伪匿名化&…

📰

从 Wafer Map 到根因定位:半导体 YMS 良率管理实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Jupyter Notebook安装配置与故障排查实战:从pip到高效使用

1. 搞懂Jupyter是什么,再动手装会省很多事我见过太多人卡在Jupyter安装这一步,不是因为步骤有多难,而是从一开始就没弄明白自己装的到底是什么东西。有人以为它是一个编辑器,装了之后发现没有代码高亮就骂街;有人以为它…

📰

Vue3 对接 DeepSeek 流式输出:SSE 解析与打字机渲染

上个月帮朋友改他们的客服问答页,功能其实早就跑通了,接的是 DeepSeek 的对话接口,一问一答逻辑没毛病。但上线三天,用户的吐槽集中在同一个点上:点完发送之后,界面上除了一个转圈,什么都没有&a…

📰

Chrome扩展开发:declarativeNetRequest原理与实践

1. 理解declarativeNetRequest的核心机制在Chrome扩展开发领域,declarativeNetRequest(简称DNR)是Manifest V3(MV3)中引入的革命性网络请求处理方式。与传统的webRequest API不同,DNR采用声明式规则集来管理…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬