判断 AlphaFold 结构预测是否可信:pLDDT 与 PAE 完整实操指南
【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold
拿到 AlphaFold 的输出,第一眼别急着看结构多漂亮,先看两份"质检单":每个残基的 pLDDT 分数、每对残基的 PAE 误差矩阵。它们共同回答一个问题——这份预测能不能直接写进你的论文。这篇指南不推导公式,只带你完成从"看到结构"到"给出结论"的判断流程。
开场:结构很漂亮,你敢直接写进论文吗?
🎲 你跑完预测,可视化软件里一条彩带螺旋盘绕,看起来毫无破绽。可它到底是可靠的实验级预测,还是模型"一本正经的猜测"?没有置信度信息,这两者肉眼分不出来。
AlphaFold 的每个输出目录都会同时给出结构文件和置信度文件(目录结构见 README 输出说明):ranked_0.pdb是置信度最高的结构,confidence_*.json存逐残基 pLDDT,pae_*.json存 PAE 矩阵。也就是说,可信度判断所需的数据,你本地就有,不用额外跑任何东西。
两把信任标尺:先问它们各自动了什么
这一节只回答:pLDDT 和 PAE 各自动的是什么。
pLDDT:逐片段的质量检验单
pLDDT(predicted Local Distance Difference Test)给每个氨基酸残基打一个 0 到 100 的分,类比成流水线质检:每段产品出厂前都要盖一个"置信/存疑"的章。它回答的问题是**"这一段本身能不能信"**。打开confidence_*.json,按分数着色渲染到结构上,低值区会自己跳出来。
四档读法(与源码 alphafold/common/confidence.py 中的分档一致):
| pLDDT 区间 | 含义 | 对你的意义 |
|---|---|---|
| 90–100 | 非常高 | 侧链级细节可参考,接近原子级精度 |
| 70–90 | 可信 | 骨架可放心使用,做常规结构分析没问题 |
| 50–70 | 低 | 只保留拓扑信息,别在这段上读细节 |
| 0–50 | 非常低 | 大概率是无序/柔性区,单独对待 |
置信度数据在输出里是现成的,也可以几行代码自己算:
import pickle from alphafold.common import confidence with open('result_model_1.pkl', 'rb') as f: res = pickle.load(f) plddt = confidence.compute_plddt(res['plddt']['logits']) print('均值 %.1f,低于 70 的残基数:%d' % (plddt.mean(), (plddt < 70).sum()))PAE:片段间相对位置的误差尺
PAE(Predicted Aligned Error)是一张 N×N 的误差矩阵:每两个残基之间都挂着一把"相对位置误差尺",刻度是埃(Å),告诉你"把整体摆正之后,这两个片段之间的相对位置最多可能偏多少"。它回答的问题是**"这两块拼在一起的那个样子,能不能信"**——这正是多结构域蛋白、蛋白复合物最要命的部分。
30 秒看懂 PAE 矩阵:把pae_*.json画成热图,颜色越红代表相对位置越不确定。对角线上是一格格方块——每个方块对应一个结构域,方块内颜色浅说明域内部稳;方块与方块之间的色块发红,则说明这两个域的相对摆位本身就不确定。多亚基模型同理:链与链之间的区块发红,界面就不可靠。一句话:对角看局部质量,离对角线看全局拓扑。
合读方法:当 pLDDT 和 PAE 给出打架的信号
单看任何一个指标都会留下盲区,正确姿势是把它们当同一结构的两个视角:一个"放大拍"(局部),一个"广角拍"(相对位置)。信号打架时,按下表下结论:
| 冲突场景 | pLDDT 表现 | PAE 表现 | 怎么判 |
|---|---|---|---|
| 域内扎实,域间漂移 | 各段普遍高 | 对角方块间色块红 | 单域结构可信;跨域的相对距离不能当数用,论文中需显式说明 |
| 末端存疑,整体稳固 | 尾端一小段低 | 主体区块误差小 | 大概率是无序末端,把它从结论中剔除即可 |
| 阶梯式分布 | 分段高/低交替 | 对角线呈多个大方块 | 典型多结构域边界信号,先按域拆分再谈细节 |
| 全局都低 | 均值 < 50 | 整体偏红 | 换序列输入或 MSA 参数重跑,仍不行则考虑实验验证 |
判读路径本身可以固化下来,后面每次都照走:
实操决策清单:拿到预测后按 1→2→3 依次核查
这一节是你能直接抄走的流程,每次预测后照做即可。
- 看整体 pLDDT 分布。打开
confidence_*.json,均值 70 以上且没有连续低值长段,结构整体可用;大片橙色(<50)说明模型本身没把握,先别往下走。 - 圈出功能关键位点。活性中心、结合口袋、突变位点——这些残基的 pLDDT 若低于 50,直接判定:围绕这些位点的一切下游结论都不可信,不用再看了。
- 查 PAE 的功能相关区块。你的任务涉及哪两个片段之间(两个结构域?两条链的界面?),就去看矩阵中对应区块的颜色;发红则相对位置降级处理。
- 按下游任务定验收线。要写论文、做分子对接:功能区 pLDDT ≥ 70,且界面/跨域 PAE 不红;只是生成假说或实验设计参考:均值可用即可。
- 低分想翻案时,查 MSA。输出目录的
msas/里是进化比对证据;比对覆盖差、序列数少,低 pLDDT 多半是输入问题,换数据库重跑比纠结结构更划算。
避坑指南:五个"看起来没问题"的高频陷阱
| 陷阱 | 真相 | 对策 |
|---|---|---|
| 把低 pLDDT 当成"预测失败" | 低值往往是在正确预测"这段本来就无序",这本身就是有效结论 | 结合序列特征与文献判断是否真无序,再决定剔除还是保留 |
| 把 pLDDT 当 B 因子读 | pLDDT 是写在 PDB 的 B-factor 字段里的,但方向相反:数值越大越可信,与实验 B 因子越大越灵活的直觉正好相反 | 任何二次处理前记住方向;拿它做分子置换时尤其小心 |
| 只看 pLDDT 均值下结论 | 均值 85 也可能藏着关键位点的低值段 | 永远先看功能位点局部值,再看均值 |
| multimer 界面发红却照用 | 链间 PAE 色块红 = 界面摆位不确定,界面残基的"局部高分"救不了整体 | 界面相关结论降级,或改用复合物专项数据验证 |
| 拿未排序的模型当最终结果 | 5 个模型里ranked_0才是置信度最高的 | 统一使用ranked_0.pdb及其对应置信度文件 |
结论:三句话判断标准
- pLDDT 管"这段片段本身能不能用",PAE 管"片段之间能不能摆在一起"——两个都过关,整份结构才算可信。
- 低 pLDDT 不是失败的代名词:它经常是在告诉你"这段本来就是无序的",这本身就是正确预测。
- 下游任务越硬(论文关键图、分子对接),验收标准越高;均值合格不等于局部合格。
【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考