作者,Evil Genius
今天我们梳理一个案例,来看看分子对接分子动力学的实际运用。
EGFR 是非常适合用来串联“基因突变 → 蛋白结构 → 构象变化 → 分子对接 → 分子动力学 → 药物设计 → 实验验证”的经典案例。
一个完整的结构生物学/计算药物设计工作流:
EGFR突变 → 突变蛋白结构预测 → WT/Mut结构比较 → 突变造成的构象变化 → 找结合口袋 → 药物对接 → MD验证 → MM/PBSA/自由能 → 设计/筛选新抑制剂 → 实验验证
下面以EGFR L858R、Exon 19 deletion、Exon 20 insertion为主线详细拆开。
一、首先要明确:EGFR到底是什么
EGFR(Epidermal Growth Factor Receptor)是一个受体酪氨酸激酶(RTK)。
它大体可以分成:
胞外结构域 │ │ EGF结合 ↓ 跨膜区 │ ↓ 胞内酪氨酸激酶结构域 │ ↓ C-terminal tail │ ↓ 下游信号 RAS-RAF-MEK-ERK PI3K-AKT-mTOR STAT真正适合进行:
结构预测
分子对接
MD
药物设计
的核心,是胞内 kinase domain(KD)。
EGFR激酶结构域大约是:
残基 696–1022
其中最重要的是:
N-lobe ├── β-sheet ├── ATP-binding pocket └── αC-helix ↓ ATP binding site ↓ C-lobe ├── catalytic loop ├── activation loop └── substrate binding regionEGFR 的许多致癌突变,实际上就是改变这个 kinase domain 的构象平衡。
二、EGFR最重要的几个突变
如果你准备建立一个结构计算体系,我建议至少比较:
| 类型 | 突变 | 外显子 | 结构位置 | 主要意义 |
|---|---|---|---|---|
| WT | EGFR-WT | — | — | 对照 |
| L858R | Leu858→Arg | Exon 21 | activation loop | 激活突变 |
| Ex19del | 如 E746_A750del | Exon 19 | β3–αC loop | 激活突变 |
| Ex20ins | 如 D770_N771insNPG | Exon 20 | αC-helix附近 | 激活+TKI耐药 |
| T790M | Thr790→Met | Exon 20 | gatekeeper | 获得性耐药 |
| C797S | Cys797→Ser | Exon 20 | ATP pocket | 三代TKI耐药 |
这里尤其需要注意:
“19、20号外显子突变”不是一种突变。
例如:
Exon 19
最经典的是:
E746_A750del
也就是:
WT: ...E746-L747-R748-E749-A750... Mutation: ... ΔELREA而 Exon 20 则包括很多不同的 insertion,例如:
D770_N771insNPG
它们虽然都叫 Exon 20 insertion,但结构效应并不完全一样。
三、为什么 L858R 会激活 EGFR?
这是整个 EGFR 结构生物学中非常经典的问题。
L858 位于:
activation loop(A-loop)
原本:
L858 = Leucine突变:
L858R Leu → Arg也就是:
疏水氨基酸 ↓ 带正电的大侧链这不是简单的“一个氨基酸换掉了”。
真正重要的是:
它改变了 EGFR kinase domain 的构象能量景观。
1. WT EGFR存在 inactive ↔ active 平衡
可以简单理解成:
┌──────────────┐ │ │ ↓ │ Inactive EGFR ⇄ Active EGFR │ ↓ ATP binding ↓ phosphorylation正常情况下:
inactive state 占比较大的比例。
2. L858R把平衡推向active state
L858R改变activation loop附近的局部环境,使inactive kinase构象不再那么稳定。
结果:
WT Inactive ↑ │ │ equilibrium │ ↓ Active L858R Inactive ↓ ↓ Active ↑↑↑所以:
L858R不是简单地“让ATP结合更强”。
它更核心的作用是:
改变active/inactive构象之间的能量平衡,使active kinase构象更容易出现。
近期结构/动力学研究也支持 L858R 会稳定活性构象,并影响EGFR二聚化及更高阶组装。
四、Exon 19 deletion为什么也会激活EGFR?
这里就非常适合做结构模拟。
经典突变:
E746_A750del
删除:
E746 L747 R748 E749 A750也就是:
ELREA
它所在的位置非常关键:
β3 │ ↓ β3–αC loop │ ↓ αC-helixαC-helix 是EGFR kinase activation的核心结构元件。
可以简单画成:
β3 │ │ └──── loop ──── αC helix │ │ ↓ active/inactive switchExon19 deletion缩短了这个loop。
于是会使αC-helix更倾向于:
inward / active position
而不是:
outward / inactive position
所以:
Ex19 deletion ↓ β3-αC loop缩短 ↓ αC-helix构象受到限制 ↓ active conformation ↑ ↓ EGFR kinase activity ↑这也是为什么 Ex19del 和 L858R 都属于经典的EGFR sensitizing mutations。
不过有一个非常重要的结构计算细节:
不要期待突变后一定出现“肉眼可见的大结构变化”。
一些晶体结构研究发现,Ex19del和WT整体结构差异可能并不巨大,真正重要的可能是构象分布、动态行为以及active/inactive state population改变。
这就是为什么:
MD往往比单纯的静态结构比较更有价值。
五、Exon 20 insertion为什么反而容易耐药?
这就是一个非常漂亮的结构药理学案例。
典型:
D770_N771insNPG
发生在:
αC-helix / αC-β4 loop附近插入的氨基酸形成一个类似:
structural wedge(结构楔子)
把αC-helix推向active conformation。
可以理解为:
WT αC-helix ↔ inactive / active Ex20 insertion NPG ↓ [WEDGE] ↓ αC-helix → ACTIVE因此:
Ex20 insertion ↓ αC-helix被锁定 ↓ active kinase ↓ 持续信号但问题来了:
为什么它不像L858R一样对经典TKI敏感?
关键在于:
ATP affinity 和 inhibitor affinity 的变化不一样。
L858R / Ex19del:
ATP affinity ↓ ↓ TKI相对更容易竞争ATP ↓ drug sensitivity ↑而典型Ex20ins:
ATP affinity ≈ 保持 ↓ ATP仍然强烈竞争 ↓ 经典TKI难以获得足够选择性同时,插入突变会使:
αC-helix + phosphate-binding loop(P-loop)
发生位置变化,部分药物进入结合口袋时出现steric hindrance(空间位阻)。
这就是:
为什么“都是EGFR激活突变”,但药物敏感性却完全不同。
六、所以我们可以建立一个非常漂亮的结构模型
把三个突变放在一起:
EGFR kinase domain N-lobe C-lobe ┌─────────────┐ ┌───────────────┐ │ │ │ │ │ β-sheet │ │ catalytic │ │ │ │ loop │ │ αC-helix │ │ │ │ ↓ │ │ activation │ │ ATP │ │ loop │ └─────────────┘ └───────────────┘ ↑ ↑ ↑ Ex19del L858R T790M ↑ Ex20ins更准确地说:
| 突变 | 主要影响 |
|---|---|
| Ex19del | β3–αC loop / αC-helix |
| L858R | activation loop |
| Ex20ins | αC-helix/αC-β4 loop |
| T790M | ATP pocket gatekeeper |
| C797S | ATP pocket / covalent inhibitor site |
七、接下来就进入你真正关心的:怎么做结构预测?
这里建议你不要一上来就AlphaFold。
如果研究EGFR:
第一优先级
直接使用实验结构。
因为EGFR kinase domain已经有大量:
WT
L858R
Ex19del
T790M
drug-bound
晶体结构。
例如经典EGFR-erlotinib结构:
PDB: 1M17
就是非常经典的EGFR kinase结构。
八、什么时候使用AlphaFold?
如果研究的是:
EGFR-WT EGFR-L858R EGFR-Ex19del EGFR-Ex20ins并且某个具体突变没有实验结构:
可以:
方法1
AlphaFold 3 / AlphaFold 2预测
EGFR-WT ↓ 结构预测 EGFR-L858R ↓ 结构预测 EGFR-Ex19del ↓ 结构预测 EGFR-Ex20ins ↓ 结构预测然后比较。
但是:
AlphaFold给你的主要是一个静态结构模型,而突变导致的功能差异往往属于构象动力学问题。
因此:
AlphaFold → MD
通常比:
AlphaFold → docking
更加合理。
九、推荐完整计算流程
如果以后想真正做一个论文级的EGFR计算药物研究,可以按照:
EGFR mutation │ ┌───────────┼───────────┐ ↓ ↓ ↓ L858R Ex19del Ex20ins │ │ │ └───────────┼───────────┘ ↓ Protein structure ↓ Experimental PDB / AF3 ↓ Structure QC ↓ WT vs mutant comparison ↓ Molecular dynamics ↓ ┌────────────────┼─────────────────┐ ↓ ↓ ↓ RMSD/RMSF Rg/H-bond PCA/DCCM ↓ ↓ ↓ Conformational analysis ↓ Binding pocket ↓ Drug docking ↓ ┌───────────┼────────────┐ ↓ ↓ ↓ Gefitinib Osimertinib New compounds ↓ ↓ ↓ MD simulation ↓ MM/PBSA/MMGBSA ↓ Binding free energy ↓ Lead compound selection ↓ Experimental validation十、第一步:获取EGFR结构
建议优先从PDB获取。
例如:
WT EGFR
可以选择经典:
1M17
EGFR kinase + erlotinib。
还可以寻找:
EGFR WT apo
EGFR L858R
EGFR T790M
EGFR Ex20ins
EGFR + gefitinib
EGFR + osimertinib
十一、第二步:建立突变体
例如你有:
WT EGFR要构建:
EGFR L858R EGFR E746_A750del EGFR D770_N771insNPG EGFR T790M可以使用:
PyMOL
ChimeraX
FoldX
Rosetta/PyRosetta
Modeller
非常建议你把这个EGFR案例作为PyRosetta练习项目。
十二、为什么不能直接把突变后的结构拿去Docking?
这是非常关键的一点。
例如:
WT EGFR ↓ L858R直接:
L858R ↓ Docking ↓ Osimertinib存在一个问题:
突变侧链只是“换了一个氨基酸”,并不代表整个蛋白已经达到了真实的突变构象。
所以需要:
mutation ↓ side-chain repacking ↓ energy minimization ↓ MD equilibration ↓ conformational sampling ↓ representative structure ↓ docking这会更加可靠。
十三、第三步:能量最小化
比如:
EGFR-L858R ↓ 添加氢 ↓ 补缺失原子 ↓ 选择质子化状态 ↓ force field ↓ Energy minimization可以使用:
AMBER
GROMACS
OpenMM
Rosetta
推荐:
GROMACS作为MD主工具。
十四、第四步:MD模拟
这一步实际上是整个研究最关键的地方。
例如:
EGFR-WT EGFR-L858R EGFR-Ex19del EGFR-Ex20ins分别:
Protein ↓ TIP3P water ↓ Na+/Cl- ↓ NPT ↓ Equilibration ↓ Production MD例如可以设计:
每个体系: 3 × 100 ns 或者 3 × 200 ns而不是只跑一次100 ns。
因为:
单次MD trajectory很容易受到初始构象和随机速度的影响。
十五、MD到底看什么?
RMSD、Rg、氢键等。
1. RMSD
看整体结构稳定性:
RMSD │ │ ───────── │ ── │ ── └──────────────── time比较:
WT L858R Ex19del Ex20ins十六、RMSF
看哪些氨基酸运动发生变化:
RMSF │ /\ /\ │ / \ / \ │_____/____\__________/____\____ ↑ αC重点观察:
αC-helix
activation loop
P-loop
gatekeeper region
catalytic loop
如果L858R导致activation loop运动模式改变:
RMSF可能直接体现出来。
十七、Rg
EGFR kinase domain:
Radius of gyration主要用于判断:
整体紧致程度有没有变化。
但对EGFR突变而言:
Rg通常不是最有解释力的指标。
所以不要把论文重点放在Rg。
十八、氢键分析
非常重要。
例如:
L858R ↓ Arg858 ↓ 与附近残基形成新的 electrostatic interaction /H-bond ↓ activation loop稳定这类分析可以直接把:
“突变”
连接到:
“结构机制”。
十九、更加重要:距离分析
例如:
Arg858 │ │ distance ↓ Asp / Glu统计:
distance vs time如果:
WT interaction occupancy = 10% L858R interaction occupancy = 70%就能说明:
突变形成了新的稳定相互作用网络。
二十、非常推荐做DCCM
Dynamic Cross-Correlation Matrix:
residue 1 2 3 4 5... ┌───────────── 1 │ + + - - 2 │ + + - - 3 │ - - + + │它可以回答:
L858R是不是改变了不同结构区域之间的协同运动?
例如:
activation loop ↕ αC-helix ↕ ATP pocket如果突变改变了这些区域之间的动态耦合:
这比单纯说:
“RMSD变化了0.2 Å”
有生物学意义得多。
二十一、PCA也非常重要
Principal Component Analysis:
PC2 ↑ │ WT │ ● ● ● │ │ L858R │ ● ● ● │ └──────────────────→ PC1如果:
WT trajectory和:
L858R trajectory在PCA空间明显分开:
说明:
突变改变了蛋白的主要构象运动模式。
这对于EGFR特别有价值。
二十二、下一步:药物分子对接
假设你研究:
Osimertinib
可以设计:
EGFR-WT + osimertinib EGFR-L858R + osimertinib EGFR-Ex19del + osimertinib EGFR-Ex20ins + osimertinib然后进行:
Molecular docking
常用:
AutoDock Vina
Glide
GOLD
AutoDock4
你已经在学习Vina,因此完全可以用:
Vina → PyRosetta/GROMACS → MD
这个组合。
二十三、Docking真正回答什么问题?
Docking主要回答:
“药物能不能以合理构象进入这个binding pocket?”
例如:
EGFR ┌───────────────┐ │ │ │ ATP pocket │ │ ↓ │ │ ┌───────┐ │ │ │ Drug │ │ │ └───────┘ │ │ │ └───────────────┘然后看:
binding pose
hydrogen bond
π-π interaction
hydrophobic interaction
salt bridge
steric clash
二十四、EGFR药物最经典的结合方式
以第一代TKI为例:
EGFR ATP-binding pocket hinge region ↓ ────────── │ Drug │ ──────────许多ATP竞争型EGFR-TKI会与:
hinge region
形成关键氢键。
所以:
ATP ↓ ATP pocket Drug ↓ 竞争ATP ↓ EGFR phosphorylation ↓ ↓ RAS/MAPK ↓ PI3K/AKT ↓ ↓ tumor cell proliferation ↓二十五、Osimertinib为什么更厉害?
Osimertinib是第三代EGFR-TKI。
它有一个非常关键的特点:
covalent irreversible inhibition
也就是:
EGFR Cys797 ↑ │ └── covalent bond ↑ Osimertinib所以:
Osimertinib ↓ 进入ATP pocket ↓ 识别Cys797附近区域 ↓ 形成共价键 ↓ EGFR kinase被不可逆抑制这也是为什么在结构计算中:
Osimertinib不能完全按照普通reversible docking理解。
最好采用:
covalent docking / covalent modeling
或者至少在MD中明确考虑Cys797共价连接状态。
二十六、然后进入MD验证Docking结果
这一步就是你之前一直在问的:
为什么Vina以后还要做MD?
原因非常简单:
Vina:
静态结构 ↓ 搜索几个可能poseMD:
protein + ligand + water ↓ 真实动态环境 ↓ 100 ns / 200 ns ↓ 判断这个pose是否稳定因此:
Vina ↓ Top 10 poses ↓ 选择合理pose ↓ MD ↓ 稳定pose二十七、MD中重点看Drug-Protein interaction
例如:
Hydrogen bond occupancy
Drug │ ├── H-bond → Met793 │ ├── H-bond → Lys745 │ └── interaction → Cys797计算:
occupancy比如:
Met793 H-bond occupancy = 82% Cys797 interaction = 91%比单纯Docking的:
-8.5 kcal/mol
更有说服力。
二十八、再进一步做MM/PBSA
例如:
WT + drug L858R + drug Ex19del + drug Ex20ins + drug计算:
ΔGbind
通常:
ΔGbind = ΔEMM + ΔGpolar + ΔGnonpolar - TΔS最终可以比较:
| EGFR | Drug | ΔGbind |
|---|---|---|
| WT | Osimertinib | -X |
| L858R | Osimertinib | -Y |
| Ex19del | Osimertinib | -Z |
| Ex20ins | Osimertinib | -A |
如果:
L858R -60 Ex19del -58 Ex20ins -40那么可以提出:
Ex20ins对该药物结合不利。
但要注意:
MM/PBSA适合做相对比较和机制支持,不应该把绝对数值当成真实实验Kd。
二十九、如果要真正“设计药物”,应该怎么做?
这就进入:
Structure-based drug design
整个过程:
Mutation ↓ Structure ↓ Binding pocket ↓ Hotspot identification ↓ Virtual screening ↓ Docking ↓ MD ↓ MM/GBSA ↓ Lead compounds ↓ Molecular optimization ↓ Experimental validation三十、例如你要针对EGFR Ex20ins设计药物
这是非常有研究价值的。
因为Ex20ins存在:
经典TKI耐药问题。
结构研究发现:
Ex20 insertion ↓ αC-helix位置变化 ↓ ATP pocket空间变化 ↓ 经典TKI steric clash ↓ drug resistance因此你的设计策略可以是:
Strategy 1
寻找:
能够避开steric clash的ATP-site inhibitor
Strategy 2
设计:
Covalent inhibitor
寻找Cys797附近合理exit vector。
Strategy 3
设计:
Allosteric inhibitor
不再直接竞争ATP。
而是:
allosteric pocket ↓ 锁定inactive EGFR ↓ 阻止activation这类思路非常重要,因为近年来EGFR结构药理学越来越强调:
conformational/selective allosteric inhibition
而不是单纯ATP竞争。
三十一、这就是“突变 → 药物”的完整逻辑
可以把整个科学问题总结成:
EGFR mutation │ ┌─────────────┼─────────────┐ ↓ ↓ ↓ L858R Ex19del Ex20ins │ │ │ ↓ ↓ ↓ Activation loop αC-helix αC-helix │ │ │ └─────────────┼─────────────┘ ↓ kinase conformation ↓ active/inactive equilibrium ↓ ATP binding ↓ drug binding pocket ↓ ┌────────────┴────────────┐ ↓ ↓ sensitive resistant ↓ ↓ EGFR inhibitors novel inhibitors ↓ ↓ Docking Docking ↓ ↓ MD MD ↓ ↓ MM/PBSA MM/PBSA ↓ ↓ validation optimization三十二、如果把它做成一个真正的科研项目
建议直接做下面这个课题:
“EGFR不同驱动突变的结构动力学特征及靶向抑制剂结合机制研究”
设计4组:
Group 1 EGFR-WT Group 2 EGFR-L858R Group 3 EGFR-Ex19del Group 4 EGFR-Ex20ins每组:
apo protein + drug-bound protein于是:
4 × 2 = 8个体系
例如:
WT L858R Ex19del Ex20ins × apo osimertinib三十三、计算分析指标可以这样安排
第一层:结构
RMSD RMSF Rg SASA secondary structure第二层:构象
PCA DCCM Free energy landscape第三层:局部结构
重点:
αC-helix P-loop activation loop hinge gatekeeper Cys797第四层:药物结合
H-bond hydrophobic interaction π-π salt bridge contact frequency distance第五层:自由能
MM/PBSA MM/GBSA per-residue decomposition三十四、最终最有价值的是“Residue decomposition”
这个非常适合做论文图。
例如:
Residue contribution Met793 ███████████ Leu718 ███████ Val726 █████ Lys745 ████ Cys797 █████████ Arg858 ██然后你就可以回答:
到底是哪些氨基酸决定了突变体与药物的结合差异?
进一步:
Mutation ↓ Residue interaction network ↓ Binding pocket remodeling ↓ Drug binding change这就从:
“做MD”
升级到了:
“解释药物机制”。
三十五、进一步可以做虚拟筛选
如果你不是只研究现有药物,而是想:
“寻找一个新的EGFR突变选择性抑制剂”
可以:
EGFR mutant structure ↓ Binding pocket ↓ ZINC / Enamine / ChEMBL等化合物库 ↓ Virtual screening ↓ Docking ↓ Top 100 ↓ Top 20 ↓ MD ↓ MM/GBSA ↓ Top 5 ↓ 实验三十六、甚至可以进一步做AI药物设计
这就是现在非常热门的方向:
EGFR mutation ↓ Structure ↓ Pocket ↓ AI molecular generation ↓ 生成新分子 ↓ Docking ↓ MD ↓ ADMET ↓ 合成 ↓ 实验验证例如可以结合:
AlphaFold 3
Diffusion-based molecular design
ProteinMPNN(更偏蛋白设计)
RFdiffusion(蛋白/结合蛋白设计)
DiffDock
GNINA
AutoDock Vina
GROMACS
PyRosetta
形成:
AI + Structure-based Drug Design + MD
的完整体系。
三十七、这里有一个非常重要的现实问题
不能简单理解成:
“Docking分数最低 = 最好的药。”
实际上:
Docking score ↓ 只是第一轮筛选真正可靠的证据链应该是:
Docking ↓ 合理binding pose ↓ MD稳定 ↓ 关键H-bond/contact稳定 ↓ PCA/DCCM支持构象机制 ↓ MM/PBSA支持结合差异 ↓ 突变体选择性 ↓ 细胞实验 ↓ 酶活实验 ↓ SPR/ITC/Kd ↓ 动物实验最终才能形成完整的药物发现证据链。
三十八、目前EGFR临床药物也可以作为这个体系的真实案例
对于经典:
Exon 19 deletion / L858R
目前临床上已经有多种EGFR靶向方案,第三代TKIosimertinib是非常重要的代表;FDA也批准其用于这两类EGFR突变的NSCLC,并批准其与铂类化疗联合的一线方案。
此外,2024年FDA还批准:
lazertinib + amivantamab
用于EGFR Ex19del/L858R的一线治疗。
而对于:
EGFR Exon 20 insertion
情况完全不同。
这正好说明:
“同一个靶点、不同突变 → 不同蛋白构象 → 不同药物结合模式 → 不同临床药物敏感性。”
截至目前,FDA已经在2025年批准sunvozertinib用于铂类化疗后进展的EGFR Exon 20 insertion转移性NSCLC。
所以Ex20ins是一个非常适合做:
突变结构 → docking → MD → 药物设计
的真实案例。
最后把整套方法浓缩成一句话
真正要学习的不是“怎么跑Vina”或者“怎么跑GROMACS”,而是下面这个逻辑:
EGFR突变改变局部结构和构象能量景观 → 改变αC-helix、activation loop、ATP pocket等关键区域的动态行为 → 改变ATP/TKI结合模式 → 造成药物敏感或耐药 → 利用结构预测、分子对接和MD寻找稳定结合构象 → 用MM/PBSA和残基能量分解定位关键作用残基 → 根据突变特异性口袋设计/筛选新的EGFR抑制剂 → 最终通过酶活、SPR/ITC、细胞和动物实验验证。
这实际上就是一个完整的结构基础药物设计(Structure-Based Drug Design, SBDD)项目。
下一步最推荐直接做一个“EGFR-L858R从PDB结构获取 → PyMOL构建突变 → GROMACS建模 → 100 ns MD → RMSD/RMSF/PCA/DCCM → AutoDock Vina对接Gefitinib/Osimertinib → 再MD → MM/PBSA → PyMOL出论文级结构图”的完整实战案例。