AlphaFold 蛋白质结构预测实战:从部署到结果判读的完整指南

📅 发布时间:2026/9/11 3:55:48
AlphaFold 蛋白质结构预测实战:从部署到结果判读的完整指南
AlphaFold 蛋白质结构预测实战从部署到结果判读的完整指南【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 是 DeepMind 开源的蛋白质结构预测系统输入 FASTA 序列文件输出带置信度分数的 PDB 结构文件。读完本指南你可以独立完成部署Docker 3 TB 遗传数据库配置用run_docker.py跑通第一次单体蛋白预测预测蛋白复合物multimer 模式并按需调参看懂输出文件里的 pLDDT、pTM、PAE独立判断结果可信度。实验方法 vs AlphaFold时间、成本与精度怎么算账本节先回答值不值得上 AlphaFold与 X 射线晶体学、NMR 等实验方法比它把拿到一个结构的时间从周级压到分钟级代价是需要一次性的硬件与存储投入。维度X 射线晶体学 / NMR / 冷冻电镜AlphaFold耗时数周至数月样品制备、上机、建模结构预测部分100 残基约 4.9 s2000 残基约 450 sA1001设备 / 成本同步辐射机时或专用仪器、纯蛋白样品一台 Linux 服务器 一块 NVIDIA GPU 3 TB 存储精度参考标准但只覆盖单一构象CASP14 实测 GDT 达 90.7T1037、93.3T1049与实验结构直接可比大复合物大分子复合物周期长、失败率高v2.3.0 起专门针对 2000 残基复合物加强训练拿到结构后--model_preset决定用哪套模型。按你的场景对号入座使用场景推荐预设说明单条链蛋白结构预测monomer默认速度/精度平衡最好复现 CASP14 结果、对比文献monomer_casp148 倍 ensemble计算成本 8 倍CASP14 域上平均 GDT 仅 0.1多数场景不值得需要 pTM / PAE 成对置信度输出monomer_ptm在结构预测外额外输出全局与残基对置信度结构精度略低于monomer蛋白复合物同源/异源multimer多序列 FASTA 输入需额外下载 UniProt 与 PDB seqres 数据库AlphaFold 安装部署流程与数据库一键下载脚本本节解决从零到能跑的所有前置工作装环境、下数据库、建镜像。系统要求官方在 Google Cloud 上验证的配置12 vCPU、85 GB RAM、A100 GPU、3 TB 数据盘操作系统仅 Linux不支持 Windows / macOSGPU现代 NVIDIA GPU显存越大能预测的结构越大存储完整数据库解压后约 2.62 TB建议 SSD遗传搜索对 IO 敏感降低配置reduced_dbs预设下只需 8 核 CPU、8 GB RAM、600 GB 磁盘安装步骤在仓库根目录执行命令均可直接复制# 1. 先装好 Docker、NVIDIA Container ToolkitGPU 支持与 aria2 # 2. 克隆仓库 git clone https://gitcode.com/GitHub_Trending/al/alphafold cd ./alphafold # 3. 下载全部遗传数据库 模型参数约 556 GB建议后台运行 scripts/download_all_data.sh DOWNLOAD_DIR download.log 2 download_all.log # 4. 验证容器内可见 GPU docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi # 5. 构建镜像 docker build -f docker/Dockerfile -t alphafold . # 6. 安装 run_docker.py 的宿主机依赖 pip3 install -r docker/requirements.txt注意DOWNLOAD_DIR不要放在仓库目录内部否则数据库会被打进 Docker 构建上下文镜像构建极慢。若用低配硬件改用减配数据库scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbs。下载完成后目录结构如下容量来自官方文档full / reduced 二选一目录解压后下载量用途预设bfd/1.8 TB271.6 GB深度同源序列簇HHblits 搜索full_dbssmall_bfd/17 GB9.6 GBBFD 精简版reduced_dbsuniref30/206 GB52.5 GB30% 序列相似性去冗余库full_dbsuniref90/67 GB34 GB90% 序列相似性去冗余库两者共用mgnify/120 GB67 GB宏基因组序列库两者共用uniprot/105 GB53 GBUniProt 全库multimer 必须pdb70/56 GB19.5 GB模板 HMM 搜索库单体必须pdb_mmcif/238 GB43 GB~199,000 个 PDB 结构mmCIF两者共用pdb_seqres/0.2 GB0.2 GBPDB 序列残基记录multimer 必须params/5.3 GB5.3 GB16 个模型文件5 CASP14 5 pTM 5 Multimer LICENSE两者共用读代码时可按需查阅的模块序列到模型特征的转换在 alphafold/data/feature_processing.py神经网络主体在 alphafold/model/model.py坐标与旋转等空间计算在 alphafold/model/geometry/预测后的 Amber 能量松弛在 alphafold/relax/relax.py宿主机脚本 docker/run_docker.py 负责挂卷起容器容器内实际入口是 run_alphafold.py。跑通第一次预测单体蛋白最小路径本节带你用最少的参数完成第一次预测并逐个解释run_docker.py的关键 flag。准备一个 FASTA 文件一条序列、一行头sequence_name SEQUENCE然后执行python3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --max_template_date2021-11-01 \ --model_presetmonomer \ --db_presetfull_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output_dir参数逐个说明参数必填含义--fasta_paths是FASTA 路径逗号分隔可依次预测多个目标文件名basename须唯一它决定输出子目录名--max_template_date是只允许该日期前发布的 PDB 结构作为模板。折叠近年才公开结构的目标时用它可避免用未来结构当模板的信息泄漏--data_dir是第 2 节下载的数据库目录--output_dir否结果目录默认/tmp/alphafold需提前存在且可写--model_preset否默认monomer可选见第 1 节对照表--db_preset否默认full_dbs与reduced_dbs数据库配套使用--models_to_relax否best默认只松弛置信度最高的一模/all/none控制 Amber 松弛范围--use_precomputed_msas否复用上一次运行已算好的 MSA多序列比对即把目标蛋白的同源序列收集对齐后作为主要输入。同一序列反复调参时能省掉最耗时的搜索阶段--gpu_devices否指定使用哪些 GPU默认全部可见卡运行结束后结果写入--output_dir/target_name/子目录解读见第 5 节。进阶多聚体预测与参数怎么选本节解决两类问题复合物怎么投喂、两个 preset 如何取舍。multimer 用法与单体流程相同差别只有两处——FASTA 里放多条序列并设--model_presetmultimerpython3 docker/run_docker.py \ --fasta_pathsheteromer.fasta \ --max_template_date2021-11-01 \ --model_presetmultimer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output_dirsequence_1 SEQUENCE A sequence_2 SEQUENCE A sequence_3 SEQUENCE B上面是一个 A2B 异源复合物的示例同一条链有几份拷贝就在 FASTA 里写几份同源多聚体同理每条拷贝一行。注意 multimer 会额外挂载uniprot/与pdb_seqres/这两个库必须已下载。默认每个模型跑 5 个随机种子、共 25 次预测资源紧张时可用--num_multimer_predictions_per_model1降到 5 次代价是精度略降。参数决策表你的约束建议追求最高精度、硬件充足full_dbsmonomer/multimer默认配置8 核 / 8 GB RAM / 600 GB 磁盘reduced_dbs换 small_bfd 小库速度快只调推理参数、不换序列加--use_precomputed_msastrue跳过 MSA 重算大复合物已知化学计量比v2.3.0 的 multimer 权重必要时把种子数提到 20A100 单卡结构预测耗时参考不含 MSA 与模板搜索3 次 recycle未松弛残基数预测时间1004.9 s30013 s50029 s1,00096 s2,000450 s3,0001,240 s4,0005,660 s5,00018,824 s注意真实跑批时间还要加上 MSA 搜索通常占大头与模板搜索小蛋白若 MSA 已预计算可在 alphafold/model/config.py 里调大subbatch_size进一步提速。结果判读输出文件清单与 pLDDT、pTM、PAE 经验阈值本节教你把跑出来的目录翻译成可信 / 半可信 / 不可信的结论。输出目录结构target_name/ features.pkl ranked_{0,1,2,3,4}.pdb ranking_debug.json relax_metrics.json relaxed_model_{1,2,3,4,5}.pdb result_model_{1,2,3,4,5}.pkl timings.json unrelaxed_model_{1,2,3,4,5}.pdb msas/ bfd_uniref_hits.a3m mgnify_hits.sto uniref90_hits.sto关键文件文件内容ranked_0.pdb置信度最高的结构ranked_i为第 i1 高。默认只有它经过 Amber 松弛unrelaxed_model_*.pdb模型直接输出的原始结构relaxed_model_*.pdb经 Amber 弛豫修正局部几何后的结构result_model_*.pkl原始模型输出逐残基 pLDDT 数组、pTM 标量、PAE 矩阵、距离图ranking_debug.json每个模型的 pLDDT 与模型名映射relax_metrics.json松弛后剩余的几何冲突violations数timings.json各阶段耗时定位瓶颈用三个置信度指标首次出现先给白话解释pLDDTpredicted lDDT逐残基置信度0–100衡量这个残基的位置预测有多稳。常用经验阈值社区惯例非官方定义90骨架位置高度可信70–90整体可信局部可能有偏差50–70部分可信谨慎使用 50低置信多为无序或柔性区别当结构用pTMpredicted TM-score全局 TM 分数单个标量评估整个结构域的打包是否正确。与 pLDDT 的区别pLDDT 看局部pTM 看整体经验上 0.5 可认为整体折叠大概率正确 0.2 基本不可信。PAEpredicted aligned error预测对齐误差N×N 矩阵估计任意两个残基对齐后的距离误差Å0 最可信。对角线附近数值低 该域内部刚性好远离对角线的区块数值高 这两个区之间的相对方位不确定常见于柔性连接或尚未结合的构象态。一个判读结论示例某目标ranked_0.pdb平均 pLDDT 86、pTM 0.71PAE 主对角区块 5 Å但第 320–380 残基区与其余部分交叉区为 15–25 Å。结论单体域折叠可信可直接用于对接设计320–380 区相对方位不确定涉及该区的下游实验如定点突变应保留验证。一个易踩的坑输出 PDB 的 B-factor 列存的就是 pLDDT 值且越大越好与传统 B-factor越小越有序方向相反——拿它做分子替换等用途前先转换。v2.3.0 更新内容与落地场景本节交代当前版本的增量改进和典型使用场景。详细技术说明见 docs/technical_note_v2.3.0.md。训练数据扩展到 2021-09-30较旧版截至 2018-04-30多约 30% 的结构其中冷冻电镜结构 4 倍、2000 残基的大结构 2 倍训练裁剪尺寸从 384 提升到 640 残基模型一次能看到更大的结构片段多聚体模型加大规模训练时链数从 8 增到 20MSA 序列数从 1,152 增到 2,0485 个模型中的 3 个大型复合物精度明显提升推理设置放宽CASP15 基线使用 20 个种子、最多 20 次 recycle带早停官方基线预测结果打包在 docs/casp15_predictions.zip。官方结论化学计量比已知时包括已知是单体的情况优先用 v2.3.0 multimer计量比未知时如基因组规模预测单链模型平均更准。落地场景各一句药物发现对缺乏实验结构的靶蛋白快速产出结构缩短从靶点选择到分子设计的周期基础生物学研究为进化保守性分析、功能位点定位提供结构底图蛋白质工程以预测结构为起点设计突变或全新折叠再回实验验证疾病机制比较野生型与突变体的预测构象评估点突变是否落在结构关键区域。从序列到结构你现在需要的只是一台带 GPU 的 Linux 机器、一次 556 GB 的下载和几分钟等待部署完成后同一序列换参数重跑记得加--use_precomputed_msastrue可以把最耗时的 MSA 阶段直接跳过。方法细节、复合物与 PDB 数据的出处见文末文献123。Jumper, John, et al. Highly accurate protein structure prediction with AlphaFold.Nature596, 7873 (2021): 583–589.↩ ↩Evans, Richard, et al. Protein complex prediction with AlphaFold-Multimer.bioRxiv(2021): 2021.10.04.463034.↩wwPDB Consortium. Protein Data Bank: the single global archive for 3D macromolecular structure data.Nucleic Acids Res.47 (2018): D520–D528.↩【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考