PeptiVerse: AI 设计多肽, 从方法论到工程落地实战指南

发布时间:2026/9/12 16:44:34
PeptiVerse: AI 设计多肽, 从方法论到工程落地实战指南 欢迎关注我的博客Blockbuster-drug 的CSDN 博客主页专栏推荐《多肽性质预测模型实践》《开源蛋白结构预测》《蛋白生成》《开源多肽设计模型部署》《Agent智能体系列》PeptiVerse工作流程与应用概述。(A)数据集收集我们收集了以下肽类性质的实验测量数据集溶血性、溶解度、抗污染性、毒性、渗透性、半衰期以及与蛋白质靶标的结合亲和力。所有性质的测量数据均涵盖经典肽和非经典肽。(B)数据划分非经典肽以Smiles序列表示通过Morgan指纹图谱的Tanimoto相似性进行划分经典肽序列则使用MMseqs2工具进行划分。(C)性质预测针对大多数性质我们比较了多种模型架构的性能表现包括XGBoost、弹性网络、支持向量机SVM、多层感知机MLP、卷积神经网络CNN以及Transformer。结合亲和力回归模型采用基于肽序列与蛋白质序列表示的交叉注意力Transformer架构。(D)应用PeptiVerse的预测结果可用于根据所需性质筛选现有肽化合物或作为性质导向生成模型的奖励信号。(E)验证每个预测性质均可通过下游湿实验进行验证。AI 设计多肽从方法论到工程落地——PeptiVerse 实战指南摘要2026年宾夕法尼亚大学 Chatterjee 实验室接连发表了两篇重磅工作——Biochemistry综述系统梳理了 AI 设计多肽作为生化研究工具的方法论体系bioRxiv论文推出了统一治疗性多肽性质预测平台PeptiVerse。本文融合两篇文献与开源代码打通理论→工具→实战全链路。1. 背景为什么多肽需要 AI抗体统治了生化研究 50 年——Western blot、Co-IP、流式细胞术都离不开它。但抗体的痛点也很致命问题维度具体表现批次稳定性不同批次性能差异显著跨实验室重复困难序列透明度动物免疫来源序列不公开结合机制模糊生产周期免疫到纯化 3–6 个月应用局限无法穿透活细胞胞内靶点需固定/透化优化困难同时优化亲和力、特异性和相容性极为耗时多肽通常 50 个残基恰好卡在小分子和抗体之间的生态位。但天然多肽作为药物开发面临现实困境——膜通透性差限制细胞摄取和口服生物利用度 [Storchmannová et al., 2025]蛋白酶快速降解导致半衰期短需频繁给药 [Werle Bernkop-Schnürch, 2006]低溶解度促进聚集 [Zapadka et al., 2017]双亲性序列还可能通过非特异性膜破坏导致溶血 [Timmons Hewage, 2020]。环化、D-氨基酸、非天然残基等化学修饰可部分缓解这些问题但也让多肽超出了传统蛋白序列预测器的适用范围。AI 的介入正推动多肽发现从**筛选驱动走向设计驱动**。2. AI 多肽设计的方法论体系Chatterjee 团队在Biochemistry综述中将 AI 多肽设计工具划分为三大核心模型2.1 表征学习通过自监督学习Masked Language Modeling从海量序列中学习物理化学和结构特征模型类别代表适用场景蛋白质语言模型pLMESM-2650M、ProtT5标准 20 种氨基酸线性多肽化学语言模型CLMChemBERTa、Chemformer非标准氨基酸NCAA、化学修饰、环肽多肽专用模型pepLMPeptideCLM、PepDoRA、PepLand针对多肽数据微调线性/环状拓扑均支持关键PepLand 采用图神经网络路线将多肽视为二维分子图是另一条有前景的技术路线HELM-BERT 使用 HELM 词汇表天然支持环状拓扑。2.2 性质预测模型既是表征学习的验证手段也是生成框架中的奖励函数或引导信号蛋白-多肽相互作用位点DELPHI、PepNN序列/结构双模式物理化学与药学性质PeptiVerse 统一了 9 项性质预测是目前覆盖最全的平台2.3 生成算法三大路线离散扩散模型当前主流训练时随机掩盖/替换词元推断时从噪声逐步还原。天然适配氨基酸/SMILES 离散字母表支持双向上下文引导。代表PepTune结合 MCTS 多目标引导、TR2-D2RL 指数倾斜扩散。流匹配学习从简单分布到目标分布的连续向量场。MOG-DFM 直接学习多目标 Pareto 前沿AReUReDi 在残基级别做整流更新。强化学习 TransformerHELM-GPT、PepINVENT、PepThink-R1 等通过 RL 同时优化亲和力、通透性、溶解性等多指标。2.4 结构 vs 序列两大设计范式维度基于结构基于序列核心约束蛋白三维坐标氨基酸序列信息代表工具RFdiffusion, BindCraft, BoltzGen, HelixFlowPepMLM, moPPIt, PepTune, TR2-D2适用场景高分辨率结构 明确结合界面无序区域、无结构靶标、多目标优化实验验证生物物理 结构级可在活细胞中直接验证方法选择决策树是否有高分辨率三维结构 ├─ 是 → 结合界面是否已知且结构化 │ ├─ 是 → 结构方法RFdiffusion / BindCraft / BoltzGen │ └─ 否 → 序列方法moPPIt / PepMLM └─ 否 → 知道靶标序列 ├─ 需要多目标优化→ moPPIt / PepTune / TR2-D2 └─ 单目标 → PepMLM / PepPrCLIP3. PeptiVerse统一多肽性质预测平台PeptiVerseZhang et al., bioRxiv 2026的核心设计理念冻结预训练大模型ESM-2 / PeptideCLM的嵌入层仅训练轻量级预测头。这么做有三个好处——计算成本低、泛化能力强、易于部署集成到生成管线。3.1 核心亮点✅双模态输入同时接受氨基酸序列 化学修饰肽 SMILES✅9 大性质溶血性、非污染性、溶解性、细胞穿透性、PAMPA/Caco-2 通透性、毒性、半衰期、结合亲和力✅6 种架构CNN / MLP / Transformer / XGBoost / SVM / ElasticNet✅3 种嵌入骨架ESM-2序列、PeptideCLM ChemBERTaSMILES✅Web 界面Gradio 托管在 HuggingFace Spaces零代码使用3.2 数据与训练论文关键细节数据来源数据来自多个公共数据库覆盖广泛实验条件性质数据来源训练/验证量任务类型HemolysisDBAASP v3.0, PeptideBERT4765/1311−分类Non-FoulingBarrett et al. 201813580/3600−分类SolubilityPROSO II, SoluProtMutDB8785/9668−分类Permeability (Penetrance)22 CPP 研究 UniProt1162/1162−分类ToxicityToxinPred3.05518/5518− (SMILES)分类Permeability (PAMPA)CycPeptMPDB6869 (SMILES)回归Permeability (Caco-2)CycPeptMPDB606 (SMILES)回归Half-LifeTHPdb2, PEPlife, PepTherDia130 (AA) / 245 (SMILES)回归Binding AffinityCAMP (PDB DrugBank)1436 (AA) / 1597 (SMILES)回归数据划分论文采用相似性感知划分比随机划分严格得多序列MMseqs2 聚类min-seq-id 0.3簇级别 80/20 划分SMILESMorgan 指纹 Tanimoto 距离 Butina 聚类簇级别 80/20结合亲和力按亲和力分数分布匹配划分⚠️ PepLand 报告 SMILES 结合亲和力 Spearman ρ0.768但使用随机划分训练/测试集可能有显著化学相似性。PeptiVerse 在相似性感知划分下 ρ0.582——更接近真实场景的外推性能。超参数优化Optuna 框架每配置 200 trialsMLP/CNN/Transformer 等深度模型限制为 50 trials 以控制计算开销SMILES 词元化后序列更长训练更慢。关键发现XGBoost 在多种性质上达到与深度架构相当的性能证明表征质量 下游模型容量是当前瓶颈。3.3 PeptiVerse vs 竞品基准方法结合亲和力 (AA) ρ通透性 (SMILES) ρ穿透性 F1溶解度 F1ESM-20.452–0.8850.725PepLand0.5030.6280.8380.662PepLand ESM-20.454–0.8850.730PeptiVerse0.5570.6710.9290.754PepLand 的 SMILES 结合亲和力 ρ0.768 在随机划分下测得PeptiVerse 使用更严格的相似性感知划分两者不可直接比较。3.4 结合亲和力结构预测 ≠ 结合强度论文特别比较了 OpenFold3 的 ipTM 评分与 PeptiVerse 预测——ipTM 与实验结合亲和力几乎无相关性|ρ| ≈ 0.05。原因多肽配体的高柔性、浅结合界面和多样化化学修饰使结构置信度评分无法捕捉结合能量学。PeptiVerse 采用cross-attention Transformer直接从蛋白和多肽嵌入学习联合表示。非池化嵌入保留残基级位置信息显著优于池化嵌入验证了位置信息对建模蛋白-多肽结合至关重要。4. 实战一行代码预测多肽性质4.1 Conda 环境安装推荐以下提供三种安装方案按需选择。方案 A基础版CPU 推理无需 GPU适用于只想快速试用、仅用 XGBoost 和 Transformer 模型的场景。创建环境到首次推理约 10 分钟。# 1. 创建 conda 环境 (Python 3.10 兼容性最佳) conda create -n peptiverse python3.10 -y conda activate peptiverse # 2. 安装 PyTorch CPU 版体积极小 pip install torch --index-url https://download.pytorch.org/whl/cpu # 3. 安装核心依赖 pip install transformers4.40.0 huggingface_hub datasets xgboost scikit-learn pip install gradio pandas numpy tqdm # 4. 克隆仓库稀疏检出仅下载必要文件 git clone --no-checkout https://huggingface.co/ChatterjeeLab/PeptiVerse cd PeptiVerse git sparse-checkout init --cone git sparse-checkout set \ inference.py download_light.py best_models.txt \ basic_models.txt tokenizer README.md GIT_LFS_SKIP_SMUDGE1 git checkout # 5. 下载基础模型权重约 500 MB python download_light.py # 6. 验证安装 python -c from inference import PeptiVersePredictor; print(✓ PeptiVerse ready)方案 BGPU 加速版CUDA 12.x推荐完整利用 GPU 加速。需 NVIDIA 驱动 ≥525、CUDA 12.x 兼容 GPURTX 20 系列及以上。# 1. 创建 conda 环境 conda create -n peptiverse python3.10 -y conda activate peptiverse # 2. 安装 PyTorch with CUDA 12.4 pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124 # 3. 安装核心依赖 pip install transformers4.40.0 huggingface_hub datasets xgboost scikit-learn pip install gradio pandas numpy tqdm # 4. 安装 RDKit处理 SMILES 必需 conda install -c conda-forge rdkit -y # 5. 确保 Git LFS 可用 # Ubuntu/Debian: sudo apt install git-lfs # 或 conda: conda install -c conda-forge git-lfs -y git lfs install # 6. 克隆完整仓库 下载模型权重约 2 GB git clone https://huggingface.co/ChatterjeeLab/PeptiVerse cd PeptiVerse git lfs pull # 7. 验证 python -c from inference import PeptiVersePredictor from pathlib import Path p PeptiVersePredictor( manifest_pathbest_models.txt, classifier_weight_root., devicecuda ) print(✓ GPU PeptiVerse ready) 方案 C完整版含 RAPIDS cuML解锁 SVM/ElasticNet 模型cuML 提供 GPU 加速的 SVM 和 ElasticNet是论文中部分性质的最优模型。安装较复杂仅推荐有 CUDA 经验的高级用户。# 1. 创建环境注意cuML 要求特定 Python/CUDA 组合 # 推荐 CUDA 12.0 Python 3.10 conda create -n peptiverse-full python3.10 -y conda activate peptiverse-full # 2. 安装 PyTorch pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124 # 3. 安装 RAPIDS cuML从 rapidsai 通道 conda install -c rapidsai -c conda-forge -c nvidia \ cuml24.12 cudf24.12 -y # 4. 安装其余依赖 pip install transformers4.40.0 huggingface_hub datasets xgboost scikit-learn pip install gradio pandas numpy tqdm conda install -c conda-forge rdkit -y # 5. 克隆并下载全部权重 git clone https://huggingface.co/ChatterjeeLab/PeptiVerse cd PeptiVerse git lfs install git lfs pull # 6. 验证 cuML 可用 python -c import cuml print(f✓ cuML {cuml.__version__} ready) from inference import PeptiVersePredictor p PeptiVersePredictor( manifest_pathbest_models.txt, classifier_weight_root., devicecuda ) print(✓ Full PeptiVerse ready (cuML GPU)) 注意cuML 版本需与 CUDA 驱动版本严格匹配。如果conda install cuml遇到冲突可退回到方案 B——SVM/ElasticNet 会被自动替换为 XGBoost 变体推理 API 完全相同。依赖版本速查包名最低版本用途torch2.0深度学习框架Transformer 推理transformers4.40加载 ESM-2 / ChemBERTa / PeptideCLMxgboost1.7树模型推理scikit-learn1.3SVR 模型 数据预处理huggingface_hub0.20模型下载与缓存datasets2.15训练数据加载rdkit2023.03SMILES 分子处理cuml24.06GPU SVM / ElasticNet仅方案 Cgradio4.0Web 界面常见问题Q:git lfs pull报错 batch request: missing protocol这是 LFS 认证问题。先执行git lfs install然后GIT_LFS_SKIP_SMUDGE1 git clone ... cd PeptiVerse git lfs pull。Q:from inference import PeptiVersePredictor报 CUDA/cuML 相关错误设置devicecpu即可跳过所有 GPU 依赖。基础模型在 CPU 上也能运行只是速度较慢。Q: 模型权重下载太慢设置 HuggingFace 镜像export HF_ENDPOINThttps://hf-mirror.com python download_light.pyQ: Conda 环境无法解析 RAPIDS 依赖RAPIDS 的 conda 依赖链较重冲突常见。建议直接用方案 B——缺失的 SVM/ElasticNet 模型会被自动替换为性能接近的 XGBoost 变体。4.2 推理示例from inference import PeptiVersePredictor from pathlib import Path root Path(__file__).resolve().parent predictor PeptiVersePredictor( manifest_pathroot / best_models.txt, classifier_weight_rootroot, devicecuda, # 或 cpu ) seq GIVEQCCTSICSLYQLENYCN # 胰岛素 B 链片段 smiles CC(C)C[CH]1NC(O)[CH](CC(C)C)N(C)C(O)... # cyclosporin A # 溶血性序列 SMILES 双模式 result predictor.predict_property(hemolysis, modewt, input_strseq) # {property:hemolysis,mode:wt,score:0.12,label:0,threshold:0.2801} # 非污染性 result predictor.predict_property(nf, modesmiles, input_strsmiles) # 溶解性 result predictor.predict_property(solubility, modewt, input_strseq) # 细胞穿透性 result predictor.predict_property(permeability_penetrance, modewt, input_strseq) # 毒性仅 SMILES result predictor.predict_property(toxicity, modesmiles, input_strsmiles) # PAMPA / Caco-2 通透性回归仅 SMILES result predictor.predict_property(permeability_pampa, modesmiles, input_strsmiles) result predictor.predict_property(permeability_caco2, modesmiles, input_strsmiles) # 半衰期 result predictor.predict_property(halflife, modewt, input_strseq) # 结合亲和力需靶蛋白序列 protein MTEYKLVVVGAGGVGKSALTIQLIQNHFVDEYDPTIEDSYRKQV... result predictor.predict_binding_affinity( modewt, target_seqprotein, binder_strseq, )4.3 最佳模型速查表最小可部署集无需 cuML性质最佳模型序列最佳模型SMILES阈值序列阈值SMILESHemolysisXGBCNN (chemberta)0.28010.564Non-FoulingTransformerXGB (peptideclm)0.7120.3892SolubilityCNNTransformer (peptideclm)0.3770.329Permeability (Penetrance)XGBXGB (chemberta)0.43010.5028Toxicity–CNN (chemberta)–0.49Binding Affinitypooledpooled (chemberta)––Permeability (PAMPA)–CNN (chemberta)––Permeability (Caco-2)–SVR (chemberta)––Half-lifeTransformerXGB (peptideclm)––5. 应用场景从亲和试剂到蛋白质组编辑5.1 实验适配亲和试剂AI 多肽可在设计阶段即针对特定检测格式Western blot / Co-IP / 流式细胞术 / 高通量筛选定制检测格式靶标状态多肽设计要求Western blot变性蛋白靶向变性后仍暴露的线性表位Co-IP天然构象含洗涤剂靶向天然结合界面或亲和标签流式细胞术天然胞外域控制电荷与疏水性限制非特异性膜吸附序列完全已知 化学合成 表现不佳时直接修改重合成无需重新筛选。5.2 活细胞检测结合细胞穿透肽CPP多肽可进入活细胞完成靶标结合——这是抗体无法做到的。荧光标记多肽可直接用于胞内流式和成像捕捉瞬时蛋白相互作用在接近生理条件下测定靶标结合和位点占用。5.3 蛋白质组编辑多肽的 CRISPR 时刻CRISPR 的核心逻辑是将**靶向gRNA与执行Cas9**解耦。AI 多肽正在蛋白质组层面复刻这一范式用户指定引导多肽 → 融合至效应酶催化结构域 → 招募酶活性至靶蛋白 → 定向功能调控蛋白降解uAbs泛素抗体融合 E3 连接酶催化域 → 靶向泛素化降解蛋白稳定化duAbs 融合去泛素化酶 → 选择性稳定致病蛋白其他修饰DUBTACs去泛素化、DEPTACs去磷酸化当前这些系统依赖融合蛋白形式。但随着多肽设计能力提升全合成版本有望实现——SaLTPepPr、PepMLM、moPPIt 设计的多肽已在 uAb 引导降解中完成体内验证。6. 总结Chatterjee 实验室描绘了一条清晰的路线图表征学习提供基础编码ESM-2 / PeptideCLM / ChemBERTaPeptiVerse统一 9 项关键性质预测冻结嵌入 轻量预测头的设计兼顾性能与效率核心洞见表征质量 下游模型容量相似性感知划分才是真实场景的性能指标结构预测置信度ipTM不能替代结合亲和力预测生成算法离散扩散 / 流匹配 / RL实现多目标约束下的序列从头设计应用出口从亲和试剂到活细胞检测再到蛋白质组编辑从筛选驱动到设计驱动多肽正在成为可编程的分子工具。PeptiVerse 的开源发布让这一范式触手可及。参考文献Hong L, Vincoff S, Chatterjee P.AI-Designed Peptides as Tools for Biochemistry.Biochemistry, 2026. DOI: 10.1021/acs.biochem.6c00138Zhang Y, Tang S, Chen T, Mahood E, Vincoff S, Chatterjee P.PeptiVerse: A Unified Platform for Therapeutic Peptide Property Prediction.bioRxiv, 2026. DOI: 10.64898/2025.12.31.697180 | PMC: PMC12773018PeptiVerse 代码github.com/ChatterjeeLab/PeptiVersePeptiVerse Webhuggingface.co/spaces/ChatterjeeLab/PeptiVerse训练数据huggingface.co/datasets/ChatterjeeLab/PeptiVerse_data本文首发于 CSDN转载请注明出处。