EnsembleCycPerm: 用“构象系综“读懂环肽穿膜——本地部署+实战评测

发布时间:2026/9/10 23:04:38

EnsembleCycPerm: 用“构象系综“读懂环肽穿膜——本地部署+实战评测 欢迎关注我的博客Blockbuster-drug 的CSDN 博客主页专栏推荐多肽性质预测系列 蛋白结构预测 蛋白生成多肽设计环肽设计最大的痛明明靶点亲和力很漂亮一测细胞活性——进不去。这不是你的分子不够好而是传统的单构象预测方法本质上看了一张证件照就去判断一个人的运动能力。2026年7月发表于JCIMD的EnsembleCycPerm用水相氯仿两相构象系综来模拟环肽的分子变色龙效应——让AI同时读取环肽在水里和在膜里的构象变化从而更准确地预测膜渗透性。论文: Wen S, Wang Y, Qian Y. EnsembleCycPerm: Interpretable Modeling of Cyclic Peptide Permeability through Solvent-Dependent Conformational Ensembles.J. Chem. Inf. Model.2026, 66, 8123. doi:10.1021/acs.jcim.6c01213GitHub: GitHub - wsicheng739/EnsembleCycPerm: EnsembleCycPerm is a model for predicting cyclic peptide permeability · GitHubCC BY-NC 4.0一、环肽为什么难穿膜从单构象到构象系综1.1 直觉盲区成环 ≠ 固定很多人对环肽有一个直觉误区都已经成环了结构应该比较固定那找一个最低能量构象、算一下它的极性表面积和疏水性不就能判断通透性了吗真相恰恰相反——同一条环肽在水里和靠近细胞膜时可能采取完全不同的构象水相中暴露极性基团维持溶解膜环境中分子内形成氢键把极性表面藏起来这就是环肽领域所说的分子变色龙效应molecular chameleon。环孢素A是经典范例它并不是依赖一个固定构象穿膜而是能访问多种开放、半开放和闭合状态随环境重新调整构象分布。1.2 核心洞察ΔPSA3D 比绝对值重要EnsembleCycPerm 最核心的发现是决定环肽能否穿膜的关键不是 PSA3D 的绝对值而是它在水→氯仿环境变化中 PSA3D 的改变量ΔPSA3D——即分子在不同环境中收起极性的能力。通过 SHAP 分析研究者发现ΔPSA3D水相 3D PSA − 氯仿 3D PSA是对预测贡献最大的单个特征。模型不是简单地喜欢低 PSA而是在评估一条环肽是否具备极性屏蔽的动态能力。二、模型架构三股信息流融合EnsembleCycPerm 不是端到端的单一模型而是多条支路融合┌─────────────────────┐ │ 环肽序列 (token) │──→ Transformer (循环不变编码) └─────────────────────┘ │ ┌─────────────────────┐ │ │ 5个水相构象 (3D) │──→ GNN encoder ──┤ │ 5个氯仿构象 (3D) │──→ GNN encoder ──┤──→ MLP ──→ PAMPA logP └─────────────────────┘ │ │ ┌─────────────────────┐ │ │ 19个2D描述符 │───────┘ │ 两相Δ特征 │ └─────────────────────┘三个关键设计循环不变 Transformer环肽是头尾相连的ABCDEF和DEFABC对同一个环应等价。模型通过汇总不同循环排列来解决。带温度参数的构象加权 GNN每条环肽在每种溶剂中有5个代表性构象开放→中间→闭合模型不是简单取平均而是学习可训练的温度参数来决定各构象的重要性。Δ描述符ΔPSA3D、ΔRg、ΔIMHB、ΔSASA——这些跨环境变化量捕获了分子变色龙效应的核心物理。三、性能一览3.1 独立测试集PAMPAn675指标值RMSE0.398MAE0.290Pearson R0.845Spearman R0.822R²0.7023.2 统一基线对比同数据集同划分模型RMSEMAEPearson RR²SVM0.470.340.770.59MLP0.520.370.720.49CPMP0.460.340.780.60MSF-CPMP0.610.460.580.26MultiCycPermea0.520.390.730.48EnsembleCycPerm0.400.290.840.703.3 Scaffold 划分更严格指标值MAE0.341Pearson R0.676虽然没有随机划分那么亮眼但 scaffold split 下 R 0.65 在环肽领域属于相当稳健的水平。3.4 迁移学习到其他 ADMET 任务冻结编码器只训练预测头任务Pearson RCaco-20.85 ± 0.02RRCK0.81 ± 0.02MDCK0.81 ± 0.07水溶解度0.66 ± 0.07Caco-2 保持了高相关性说明模型学到的不只是 PAMPA 数据中的疏水规律而是跨任务的环肽构象特征。3.5 最有实际价值的指标单残基替换 ΔPAMPA对于只差一个氨基酸的类似物对|ΔPAMPA| ≥ 0.3模型能做到84.0%的变化方向一致率Pearson Δ 0.790Spearman Δ 0.766在全数据集中2,643 对单残基类似物训练测试方向一致率达到90.9%。这比绝对数值预测更有价值在 lead optimization 阶段你最关心的往往不是这个分子的 logP 到底是多少而是**把 Bn-Gly 换成 Et-Phe通透性能不能提高**。四、本地部署4.1 硬件要求操作系统Linuxmodel.so编译平台内存≥8 GB加载图缓存 ~300MBGPU可选CPU 推理也够快4.2 克隆仓库git clone https://github.com/wsicheng739/EnsembleCycPerm.git cd EnsembleCycPerm仓库大小约 183MB含 41MBcache.tar.gzclone 后先解压tar -xzvf cache.tar.gz -C .解压后生成cache/graph_extreme5/— 675 个预计算图文件.ptcache/data/peptide_features_model_aligned.csv— 特征表4.3 创建 Conda 环境# 创建 Python 3.11 环境 conda create -n admet_infer python3.11 -y这一步很快几十秒搞定生成一个干净的 Python 3.11 环境。不要被Channel nvidia的 warning 吓到——那是 nvidia 频道即将迁移的提示不影响使用。Executing transaction: done # # To activate this environment, use # $ conda activate admet_infer # # To deactivate an active environment, use # $ conda deactivate4.4 安装依赖包含踩坑实录# 用清华镜像加速教育网/国内必加否则 PyTorch 下载很慢 conda activate admet_infer pip install torch numpy pandas scikit-learn tqdm -i https://pypi.tuna.tsinghua.edu.cn/simple下载内容一览~1.1 GB耗时约 8 分钟 1.8 MB/s包名大小说明torch-2.13.0526.6 MBPyTorch 主包nvidia-cudnn-cu13366.2 MBcuDNN 深度神经网络加速nvidia-cusparselt-cu13170.1 MBcuSPARSELt 稀疏矩阵cuda-bindings-13.3.16.7 MBCUDA Python 绑定pandas-3.0.511.3 MB数据处理scikit-learn-1.9.09.3 MB评估指标scipy-1.17.135.3 MB科学计算sympy-1.14.06.3 MB符号数学torch 依赖其他小包~10 MBnetworkx, joblib, tqdm 等⏱ 实际耗时清华镜像 ~8 分钟。如果不加镜像直接用 pypi.orgtorch 的小水管下载可能跑 20 分钟。安装完成后的输出截取关键行Successfully installed cuda-bindings-13.3.1 cuda-pathfinder-1.6.0 cuda-toolkit-13.0.3.0 joblib-1.5.3 mpmath-1.3.0 narwhals-2.24.0 networkx-3.6.1 nvidia-cublas-13.1.1.3 nvidia-cuda-cupti-13.0.85 nvidia-cuda-nvrtc-13.0.88 nvidia-cuda-runtime-13.0.96 nvidia-cudnn-cu13-9.20.0.48 nvidia-cufft-12.0.0.61 nvidia-cufile-1.15.1.6 nvidia-curand-10.4.0.35 nvidia-cusolver-12.0.4.66 nvidia-cusparse-12.6.3.3 nvidia-cusparselt-cu13-0.8.1 nvidia-nccl-cu13-2.29.7 nvidia-nvjitlink-13.3.33 nvidia-nvshmem-cu13-3.4.5 nvidia-nvtx-13.0.85 pandas-3.0.5 scikit-learn-1.9.0 scipy-1.17.1 sympy-1.14.0 threadpoolctl-3.6.0 torch-2.13.0 triton-3.7.1⚠️ 重要踩坑 #1如果pip install输出Requirement already satisfied: numpy in ./.hermes/...——这说明 numpy/pandas 被装到了系统其他 Python 路径而非 conda 环境实测在 Hermes Desktop 终端里pip默认会受PYTHONPATH影响。修复方法用 conda 环境的绝对路径 pip 安装pip install --force-reinstall \ numpy pandas scikit-learn tqdm -i https://pypi.tuna.tsinghua.edu.cn/simple⚠️ 重要踩坑 #2运行时报ModuleNotFoundError: No module named typing_extensions。PyTorch 依赖typing-extensions但它也被装到了别的路径。修复pip install typing-extensions \ -i https://pypi.tuna.tsinghua.edu.cn/simple4.5 验证 GPU 可用性$ python -c \ import torch; print(torch, torch.__version__); print(CUDA:, torch.cuda.is_available()) torch 2.13.0cu130 CUDA available: True本机配置RTX 3060 12GB CUDA 12.4 PyTorch 2.13 (cu130)。PyTorch 2.13 的 cu130 在 CUDA 12.4 驱动上可以正常工作向前兼容。如果输出CUDA: False说明你的 PyTorch 装的是 CPU 版。重新装 CUDA 版pip uninstall torch -y pip install torch --index-url https://download.pytorch.org/whl/cu1304.6 验证安装——跑测试cd ~/EnsembleCycPerm/ # 注意在仓库根目录运行脚本里用相对路径读配置文件 python best_model_test.py⚠️ 踩坑 #3必须cd到仓库根目录。best_model_test.py用Path(./dataset/...)这种相对路径读取数据如果在其他目录跑会报FileNotFoundError。4.7 关键文件说明文件大小说明model/model.so288 KB编译后的 PyTorch 模型保护 IP不可读源码model/__init__.py88 B接口暴露Model, EnsembleDataset, collate 等checkpoints/best_model_random.pt3.4 MB随机划分最佳模型权重checkpoints/best_model_*.pt(×10)3.4 MB10 折交叉验证各折权重model_settings.json7.4 KB模型配置标准化统计量单体词典dataset/CycPeptMPDB_Peptide_All.csv19 MB环肽序列元数据dataset/CycPeptMPDB_Monomer_All.csv913 KB单体氨基酸词典dataset/final_training/—训练/验证/测试集划分cache.tar.gz41 MB预计算构象图需解压五、实战体验5.1 单模型推理GPU 实测$ cd ~/EnsembleCycPerm/ $ python best_model_test.py实际输出12GB GPU, PyTorch 2.13cu130, ~3 秒完成best_model_test.py:60: UserWarning: enable_nested_tensor is True, but self.use_nested_tensor is False because encoder_layer.norm_first was True ---------------------------------------------------------------------- Using cuda ---------------------------------------------------------------------- TEST EVALUATION [LOAD] checkpoints/best_model_random.pt TEST RESULTS n 675 RMSE 0.3976 MAE 0.2898 R 0.8448 R² 0.7016那个UserWarning可以忽略——是 PyTorch 2.13 对norm_firstTrue时的嵌套张量兼容性提示不影响推理结果。实测 GPU 推理 675 个分子 ~3 秒CPU 约 30 秒。都很快。5.2 10 折交叉验证CV交叉验证Cross Validation是把数据集分成 10 等份每次拿 9 份训练、1 份测试轮换 10 遍取平均。目的防止运气好的单次划分误导结论。10 折标准差越小 模型越稳健。$ python cv_ensemble_test.py实际输出10 个 fold 逐一加载权重~30 秒完成Using cuda [LOAD] checkpoints/best_model_random_fold_01.pt [Fold 1] RMSE0.4120 MAE0.3020 R0.8317 R20.6797 [Fold 2] RMSE0.4101 MAE0.2946 R0.8318 R20.6827 [Fold 3] RMSE0.4076 MAE0.2958 R0.8304 R20.6865 [Fold 4] RMSE0.4082 MAE0.2980 R0.8301 R20.6855 [Fold 5] RMSE0.3942 MAE0.2831 R0.8469 R20.7067 [Fold 6] RMSE0.4058 MAE0.2925 R0.8379 R20.6892 [Fold 7] RMSE0.3881 MAE0.2888 R0.8486 R20.7157 [Fold 8] RMSE0.4005 MAE0.2925 R0.8433 R20.6973 [Fold 9] RMSE0.4070 MAE0.2940 R0.8337 R20.6874 [Fold 10] RMSE0.3936 MAE0.2901 R0.8423 R20.7077 CROSS-FOLD MEAN ± STD RMSE: 0.4027 ± 0.0077 MAE: 0.2931 ± 0.0049 R: 0.8377 ± 0.0068 R²: 0.6938 ± 0.011710 折标准差极小RMSE±0.008, R±0.007说明模型对不同数据划分非常稳定——不是靠某一折的好运气。Fold 7 最好R0.849、Fold 3 最差R0.830差异仅 0.018——这意味着无论怎么划数据集模型预测水平高度一致。5.3 模型需要什么输入从model/__init__.py接口可以看到模型接受序列 tokens环肽单体序列 → token 化 → 特征矩阵构象图预计算的 GNN 图文件水相 5 个 氯仿 5 个全局特征19 个分子描述符 标准化统计量直接预测新环肽需要先跑data_preprocess/脚本生成构象图需 RDKit xTB这部分不在推理管线中。作者提供的数据预处理脚本是开源参考但需要额外的量子化学依赖。5.4 能直接拿来做新分子预测吗坦白说——不能开箱即用。模型推理是即插即跑的但要给全新的环肽序列打分你需要生成 3D 构象RDKit ETKDGv3 → 聚类 → 选代表双相优化水/氯仿 GFN2-xTB ALPB 隐式溶剂提取特征PSA3D、Rg、IMHB、SASA 在两相中的值构建图按cache/graph_extreme5/中的格式保存为.pt文件注册单体如果是非天然氨基酸需要在model_settings.json的symbols列表中存在这些步骤在data_preprocess/中有脚本参考resample_per_peptide.py等但需要安装 RDKit、xTB 等重依赖。实用建议如果要批量评估 100 条环肽值得搭预处理流水线。如果只是评估 3-5 条建议直接参考论文中的特征趋势ΔPSA3D、IMHB 等做经验判断。六、模型亮点与局限✅ 亮点亮点说明构象系综建模不是单构象而是水/氯仿两相 5 个代表性构象物理可解释ΔPSA3D 是 top feature与分子变色龙概念一致单残基替换敏感84% 方向一致率可用于 lead optimization跨任务迁移冻结 backbone→Caco-2/MDCK/RRCK 表现不俗10-fold CV 稳健SD 在 0.01 以内❌ 局限局限说明model.so 黑盒网络架构不可查看/修改学术复现有障碍新分子预测需预处理需要 RDKit xTB 生成构象系综门槛较高仅限非商业用途CC BY-NC 4.0 许可氯仿 ≠ 膜隐式溶剂 GFN2-xTB/ALBP 近似真实膜环境非显式溶剂酰胺顺反异构RDKit 半经验方法无法充分处理高能垒异构化桥联水未显式建模水分子介导的膜相互作用七、与其他方法的定位方法适用阶段优势劣势EnsembleCycPerm大规模虚拟筛选 → lead opt可解释性好、单残基替换敏感需预处理构象物理 MD (AMBER/GROMACS)关键分子验证第一性原理、可算 PMF单分子需数天传统 QSPR (SVM/MLP)快速粗筛快精度不足、无构象信息纯序列模型 (HELM-BERT)序列→性质直推无需 3D丢失构象变色龙效应推荐工作流EnsembleCycPerm 筛出 Top-N → 增强采样 MD (如 GaMD/REMD) 验证 → 合成实验。总结EnsembleCycPerm 的核心贡献不是又来了一个 R²0.7 的模型而是把环肽穿膜预测从一张静态结构图升级到理解溶剂依赖的构象系综。通透性不是某个静态结构天然携带的标签而是序列、局部修饰、构象集合、溶剂响应和极性屏蔽共同产生的结果。对于做环肽设计的同学——如果你正在纠结要换哪个氨基酸来提高口服利用度这个模型值得在筛选流程中占一个位置尤其是它的ΔPAMPA 方向预测对 lead optimization 有直接指导价值。参考资料Wen S, Wang Y, Qian Y.J. Chem. Inf. Model.2026, 66, 8123. doi:10.1021/acs.jcim.6c01213Li J, Yanagisawa K, et al. CycPeptMPDB.J. Chem. Inf. Model.2023, 63(7), 2240-2250.GitHub: GitHub - wsicheng739/EnsembleCycPerm: EnsembleCycPerm is a model for predicting cyclic peptide permeability · GitHub关键词环肽膜渗透性构象系综分子变色龙效应ΔPSA3DPAMPAGNNTransformerADMET本地部署欢迎关注我的博客Blockbuster-drug 的CSDN 博客主页专栏推荐多肽性质预测系列 蛋白结构预测 蛋白生成多肽设计
延伸阅读

更多相关文章

2026/9/10 22:59:38

impeccable polish 指南:发布前最后一轮全路径质量打磨

impeccable polish 指南:发布前最后一轮全路径质量打磨 【免费下载链接】impeccable The design language that makes your AI harness better at design. 项目地址: https://gitcode.com/GitHub_Trending/im/impeccable Polish 是 impeccable 技能体系中的收…

2026/9/10 23:49:43

Tracy Profiler 快速上手实战指南:4步定位游戏掉帧元凶

Tracy Profiler 快速上手实战指南:4步定位游戏掉帧元凶 【免费下载链接】tracy Frame profiler 项目地址: https://gitcode.com/GitHub_Trending/tr/tracy 你正在跑一个游戏,画面突然卡了一瞬,重跑一遍问题又消失了,日志里…

2026/9/10 23:49:42

SeaTunnel与Gravitino集成实现元数据自动化管理

1. 项目概述:当数据管道遇上元数据自动化在数据工程领域,手动维护Schema一直是ETL开发中最繁琐的环节之一。最近SeaTunnel与Gravitino的深度集成,通过RestAPI实现了元数据的自动化管理,这个看似简单的技术组合实际上解决了数据管道…

2026/9/10 23:44:42

H指数解析:学术影响力计算与应用指南

1. H指数:学术影响力的量化标尺作为一名长期跟踪学术评价指标的科研工作者,我经常需要向同行解释H指数的精妙之处。这个看似简单的数字背后,蕴含着对学者研究质量的立体化评估逻辑。2005年由物理学家Jorge Hirsch提出的H指数,如今…

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 0:00:55

目录对比去重实战:用哈希算法精准清理重复文件

我电脑里现在还有一块换了三次机的“数据墓地”硬盘,里面存着2016年以前所有旧笔记本的完整备份。平时不觉得有什么,直到前阵子想把它整理归档,发现同一个安装包、同一批照片、同一份论文草稿,在几个不同的备份目录里反复出现。更…

2026/9/10 0:00:55

Leaflet离线地图完整Demo合集:内网部署与坐标纠偏实战

简介:这是一份面向Web GIS开发者的LeafLet离线地图示例合集,帮助开发者快速掌握离线地图从搭建到交互的完整流程。压缩包共723个文件,大小14.06MB,以319个js脚本、175个html页面和29个css样式文件为主体,配合png/svg图…

2026/9/10 0:00:55

MATLAB读取Rinex 3.02观测文件:多系统GNSS数据解析实战

简介:基于MATLAB开发的Rinex3.02版观测文件(o文件)读取代码包,面向卫星定位导航方向的学习者与研究人员,用于解决新版观测文件的数据解析、历元提取与时间转换问题。压缩包共4个文件,包含两个m脚本、一个19…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码