
AlphaFold 跑完还剩一堆文件6 步把 PDB/MMCIF 输出和 pLDDT 分数吃透【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold刚跑完 AlphaFold输出目录里躺着一堆名字很像的文件该看哪个 PDBpLDDTpredicted Local Distance Difference Test预测局部距离差异测试分数存在哪里这是一份关于 AlphaFold 结果解析与 PDBProtein Data Bank/ MMCIFMacromolecular Crystallographic Information File文件处理的实操教程从打开输出目录开始6 步走完挑对结构文件 → 提取 pLDDT → 查看 PAE → 可视化 → 格式转换的完整链路读完你就能写出可复现的解析脚本。示例代码可直接运行只需要装biopython、numpy、matplotlib。一、打开输出目录AlphaFold 输出文件速览运行 run_alphafold.py 后--output_dir下会按序列名即 FASTA 文件名建一个子目录。单体默认 5 个模型副本一次跑完会写出几十个文件但按用途分其实就三类类别文件什么时候用得上结构ranked_N.pdb/ranked_N.cif、unrelaxed_model_N.pdb、relaxed_model_N.pdb要上报的最终结构、对接、可视化置信度confidence_model_N.json、pae_model_N.json、ranking_debug.json质量评估、判断该信哪个模型可复现性features.pkl、result_model_N.pkl、msas/、timings.json重跑、调试、复用 MSA先打开目录扫一眼第二条命令能直接看到模型编号 → 排名的映射ls output_dir/你的序列名/ cat output_dir/你的序列名/ranking_debug.jsonranking_debug.json里只有两个字段各模型的排序置信度plddts字段和排序结果order。所以当你想回答ranked_0 到底对应哪个 model时看它就行。多聚体的文件名会多一个_pred_M后缀例如model_1_pred_0写脚本做文件名匹配时别漏了这一点。.cif文件与.pdb一一对应想省磁盘就只留一种但对外提交流程两种都建议保留。下面这张图是仓库自带的 CASP14 预测示例蓝色是计算预测、绿色是实验结果两者几乎完全重合——这就是 AlphaFold 在建模顺利的目标上能达到的水平。文件在哪知道了下一步是搞清楚该打开哪一个。二、该看哪个 PDBranked、relaxed、unrelaxed 怎么选看结构之前先理清三套文件的关系unrelaxed_model_N.pdb是模型的直接输出经过 Amber 局部能量优化后得到relaxed_model_N.pdbranked_*系列则是前两者的排序副本。默认参数--models_to_relaxbest只优化置信度最高的一个模型所以另外 4 个模型的ranked_N.pdb其实是未松弛内容。✅ 实践建议对外上报、对接、可视化一律默认用ranked_0.pdb只有想对比能量优化改了什么时才去看unrelaxed版本。如果你只是想基于模型原始输出重新导出结构文件比如自己算一遍其他指标直接pickle.load读result_model_N.pkl即可里面存着 pLDDT、PAE 等原始数组不用重跑整个流程。三、PDB 文件 Python 解析用 Biopython 拿坐标和残基 现在把ranked_0.pdb打开看看里面长什么样。PDB 格式是定宽文本每行 ATOM 记录的列位置都是固定的几个关键列如下列号从 1 计内容在你场景下的含义1–6记录类型ATOM是标准原子HETATM是水等13–16原子名CA、N、C、O等18–20残基三字母码ALA、GLY等22链标识A、B等23–26残基序号沿序列从 1 开始31–54x / y / z 坐标单位 Å61–66B 因子AlphaFold 把该残基的 pLDDT【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考