1. 从二维数据到三维洞察:为什么你需要可视化蛋白互作界面?

如果你已经跟着我们的系列文章一路走来,从蛋白互作数据的筛选、富集分析,再到结构域的预测,那么恭喜你,你已经掌握了从海量组学数据中“挖”出关键蛋白对的本领。但这就像拿到了一张藏宝图,知道了宝藏的大致方位,却还没亲眼看到宝藏本身的样子。蛋白互作界面3D可视化,就是让你亲手“打开”这个宝藏盒子,亲眼看看两个蛋白分子是如何像精密锁钥一样咬合在一起的。

我刚开始做研究那会儿,也常常满足于列表里的一串互作基因和几个抽象的P值。直到有一次,导师指着我的数据问:“你看,这两个蛋白预测会结合,那它们具体是哪几个‘手指头’(残基)握在一起?结合力强不强?空间上有没有阻碍?”我一下子被问住了。自那以后,我深刻体会到,没有三维可视化的互作分析,就像只读了剧本却没看舞台剧,错过了最精彩、最直观的部分

通过像Pymol这样的工具进行3D可视化,你能直接看到:

  • 作用的“战场”在哪里:互作不是整个蛋白的拥抱,而是发生在特定的、局部的结构域或表面上。可视化能清晰勾勒出这个界面的边界。
  • 谁是“关键功臣”:是哪些具体的氨基酸残基(比如带正电的精氨酸ARG、带负电的谷氨酸GLU)伸出了“手”,形成了氢键、盐桥或疏水作用,牢牢抓住了对方?
  • 结合是否“合理”:从空间构象上判断,预测的对接模式是否自然,有无严重的原子碰撞,结合面是否互补。这能帮你从一堆计算对接结果中,筛选出最靠谱的那个模型。

所以,无论你是要验证酵母双杂交或Co-IP的实验结果,还是要为后续的突变实验设计靶点,或者单纯想让你论文中的机制图更具说服力,掌握蛋白互作界面的3D可视化技巧,都是从数据分析走向机制理解的必经之路。接下来,我就手把手带你,用Pymol这个“分子显微镜”,把抽象的互作关系变成眼前触手可及的三维图像。

2. 实战准备:获取与处理你的蛋白“演员”

在让蛋白“登台表演”之前,我们得先找到合适的“演员”(蛋白结构),并给它们换上干净的“戏服”(预处理)。这一步是基础,但也最容易出问题,处理不好会直接导致后续对接或可视化失败。

2.1 去哪里找蛋白结构?

最权威、最常用的来源当然是蛋白质数据库(Protein Data Bank, PDB)。就像基因序列有NCBI,蛋白结构基本都汇聚在PDB。你可以通过蛋白名称、基因名或已知的PDB ID进行搜索。比如,我们想研究人类蛋白TP53和MDM2的互作,就可以在PDB官网搜索“TP53”或“MDM2”。

但这里有个现实问题:不是每个蛋白都有通过实验解析的晶体或核磁结构。特别是对于某些膜蛋白、大型复合物或柔性很大的蛋白,其完整结构的获取非常困难。这时候,AlphaFold数据库就成了我们的救星。由DeepMind开发的AlphaFold2已经预测了几乎整个蛋白质宇宙的结构,其准确性在很多情况下足以媲美实验手段。我的经验是:优先使用实验解析的PDB结构,因为它更“真实”;如果没有,或者PDB结构不完整(比如缺少你关心的结构域),那么AlphaFold的预测结构是非常可靠的选择。

实际操作中,我通常会两个数据库都查一下。比如,在PDB里搜“TP53”,可能会找到多个结构,但往往只包含DNA结合域等核心片段。这时再去AlphaFold数据库查看全长TP53的预测结构,就能获得更完整的视角,用于分析与其他蛋白的互作。

2.2 结构预处理:给蛋白“卸妆”与“瘦身”

下载到的结构文件,无论是来自PDB还是AlphaFold,很少是“即开即用”的。直接用于对接或可视化分析,可能会引入干扰。常见的“杂质”包括:

  • 水分子(HOH):结晶过程中存在的水分子,在分析蛋白-蛋白互作时通常不需要。
  • 离子、辅因子或小分子配体:比如锌离子、血红素、ATP等。如果你的研究不涉及这些配体介导的互作,最好移除。
  • 多聚体:一个PDB文件中可能包含多个相同的蛋白链(同源多聚体)或不同的蛋白链(复合物)。我们需要从中提取出我们关心的那个单体。

以从PDB下载一个蛋白为例(假设ID为1A2B),用Pymol打开后,你会看到右侧有一个“S”按钮(代表Sequence,序列)。点击它,蛋白的氨基酸序列就会显示出来。在序列窗口和3D视图窗口中,你可以用鼠标选择不需要的部分。比如,在序列窗口中,按住Shift键点击选择所有水分子(通常标记为HOH)的行,或者在3D窗口中直接框选一堆密集的小点(水分子),然后右键点击,选择“remove(移除)”。处理多聚体也一样,在序列窗口中找到代表不同链的标识(如Chain A, Chain B),只保留你需要的单链(比如Chain A),将其他的链移除。

一个非常重要的技巧:在删除任何东西之前,建议先保存原始文件,然后通过“File -> Save As”或“Export Molecule”功能,将处理好的单体另存为一个新的PDB文件(例如1A2B_monomer.pdb)。这样你就有了一个干净的、只包含目标蛋白单体的结构文件,后续所有分析都基于这个文件,避免混乱。

3. 核心可视化操作:一步步揭开互作界面的面纱

假设我们已经通过ZDOCK等对接软件,得到了两个蛋白可能形成的复合物模型(通常是一个.pdb文件,里面包含了配体蛋白和受体蛋白)。现在,用Pymol打开这个对接结果文件,真正的探索之旅开始了。

3.1 基础着色与链区分:先给“演员”穿上不同颜色的衣服

打开复合物结构后,两个蛋白可能混在一起,颜色也一样,难以区分。第一步就是让它们变得一目了然。 在Pymol右侧的“Object List”面板中,找到你的复合物对象。点击其名称旁的“C”按钮(Color,颜色),在弹出的菜单中选择“by chain”(按链着色)。Pymol会自动给不同的链(通常对接结果中两个蛋白被标记为不同的链,如A链和B链)分配对比鲜明的颜色,比如一个红色,一个绿色。这样,谁是谁就一清二楚了。

如果你想自定义颜色,可以选中某个蛋白(在图形窗口点击,或在序列面板中选择其残基),然后点击顶部菜单栏的“Setting” -> “Edit All Colors…”,或者直接使用命令set_color,都可以调出颜色面板进行精细调整。我习惯用冷色调(如蓝色系)表示受体,暖色调(如红色系)表示配体,这样在后续生成的图片中更符合常规审美。

3.2 氢键与极性相互作用的分析:找到分子间的“牵手点”

蛋白互作的稳定,主要依靠非共价相互作用,其中氢键是最重要、最直观的一种。在Pymol中分析氢键非常简单。 确保你的两个蛋白对象处于显示状态。然后,在顶部菜单栏点击“A”(Action),选择“find” -> “polar contacts” -> “between chains”。Pymol会立即计算并显示出两个蛋白链之间所有可能的极性接触,其中最主要的就是氢键。

这些氢键会以黑色的虚线显示在3D视图中,非常醒目。一个超级实用的技巧来了:将鼠标悬停在某条黑色虚线上,Pymol会在底部状态栏显示这个相互作用涉及的两个残基名称和原子,以及它们之间的距离(单位是埃,Å)。这个距离信息至关重要,典型的氢键距离在2.5-3.5 Å之间。如果距离远大于3.5 Å,这个相互作用的强度可能就比较弱了。

有时候氢键太多,虚线会显得杂乱。你可以点击“H”(Hide)-> “labels”来隐藏每条氢键上显示的距离数字。需要查看具体某个时,再点击“S”(Show)-> “labels”来显示。通过这个功能,你可以快速评估互作界面的结合紧密程度,并定位那些距离最短、可能最关键的氢键。

3.3 关键残基的标记与高亮:给“功臣”特写镜头

找到了氢键,我们就知道了是哪些残基在“牵手”。下一步,就是把这些“功臣”残基高亮显示出来,以便重点观察和展示。 最直接的方法就是用鼠标在3D视图或序列面板中,点击氢键虚线的一端,Pymol会自动选中形成该氢键的原子及其所属的残基。选中后,你可以通过顶部菜单栏的“S”(Show)选项,改变这些残基的显示模式。我强烈推荐使用“lines”(线状)或“sticks”(棍状)模式来显示被选中的残基。

  • “lines”模式:用简单的线条表示化学键,非常清晰,适合展示残基的骨架走向和侧链取向,在复杂的互作界面中能减少视觉干扰。
  • “sticks”模式:比“lines”更粗壮,能更好地展示原子的空间填充感,特别是对于展示侧链的细节(如芳香环的平面)非常有用。

你可以对每一个感兴趣的氢键两端的残基都进行这样的操作。全部处理完后,互作界面就会变得非常清晰:两个蛋白的主体以平滑的表面或卡通模式显示,而关键的作用残基则以醒目的线状或棍状模式突出出来,就像在平静的湖面上标出了几处关键的连接点。

3.4 添加文字标签与测量:让图片自己“说话”

一张好的科学图示,应该尽可能自明。我们还需要在图上直接标出这些关键残基的名字。 在选中某个残基(比如GAPDH的Tyr45)后,点击“L”(Label) -> “residues”,这个残基的三字母代码和序号(如“TYR45”)就会直接显示在3D视图它旁边。同样,如果标签太多显得乱,可以用“H-labels”隐藏,需要时再“S-labels”显示。

除了残基标签,有时我们还需要展示一些关键的距离。比如,你想强调某个盐桥(带相反电荷残基间的相互作用)的距离非常理想。你可以使用Pymol的测量工具:在顶部菜单栏点击“Wizard”(向导),选择“Measurement”(测量),然后在3D视图中先后点击两个你想要测量距离的原子(比如一个谷氨酸的氧原子和一个精氨酸的氮原子),一条黄色的虚线就会连接它们,并显示出精确的距离值。这个测量线可以和氢键线、高亮的残基一起,构成一幅信息量丰富的互作机制图。

4. 从分析到展示:生成可用于发表的高清图像

所有的分析工作最终都需要凝结成一张或几张高质量的图片,放在你的实验记录、组会幻灯片或研究论文里。Pymol在出图方面功能强大,但也有一些小坑需要注意。

4.1 视角调整与构图美学

在截图或渲染之前,花点时间调整视角。使用鼠标中键(滚轮)旋转,右键拖拽平移,找到最能清晰展示互作界面的角度。通常,一个稍微倾斜的侧视图,能让两个蛋白的接触面以及伸出的关键残基都得到很好的展示。避免纯正面或纯侧面,那样可能会遮挡信息。

构图时,要确保主体突出。如果背景的蛋白表面或卡通条带颜色太深、太满,会抢了关键残基的风头。一个常用的技巧是,将非互作界面的部分(即蛋白的背面)的透明度调高。选中蛋白对象,在右侧控制面板调整“transparency”(透明度)滑块,比如设为0.5,让背景部分半透明,前景的互作界面和关键残基就会更加凸显。

4.2 背景与光线设置

默认的黑色背景在屏幕上看起来很酷,但在论文中,尤其是黑白印刷时,可能效果不佳。大多数期刊更接受白色或浅灰色背景。 点击“Display” -> “Background” -> “White”,即可将背景设为白色。我个人的习惯是使用非常浅的灰色(可以通过“Setting” -> “Edit All Colors”自定义背景色),这样既能保持柔和,又能与白色的蛋白表面或标签文字形成足够对比。

光线对于展示三维结构的立体感至关重要。Pymol有内置的光线追踪渲染器。在调整好视角和颜色后,不要直接截图,而是点击右侧控制面板上的“Ray”按钮(或者点击“Draw” -> “Ray”)。Pymol会花费几秒到几十秒的时间(取决于结构复杂度和你的电脑性能)进行光线追踪计算,生成一张具有阴影、反射和更平滑表面的高清图像。你可以看到,经过“Ray”之后,蛋白的表面质感、残基的立体感会有质的提升。

4.3 导出高分辨率图片

“Ray”之后,图像就保存在Pymol的视图缓冲区了。这时,点击“File” -> “Export Image As…” -> “PNG…”(或其他格式如TIFF)。在弹出的对话框中,最关键的是设置图像分辨率。默认的宽度和高度可能只有几百像素,用于论文是远远不够的,打印出来会模糊。

我的常用设置是:将宽度(Width)设置为3000像素以上,高度(Height)会自动按比例调整。分辨率(Dots Per Inch, DPI)至少设置为300 DPI,这是出版印刷的常用标准。设置好后,点击“Save”,就能得到一张足够清晰、可以直接插入论文或海报的高分辨率图片。如果导出TIFF格式(无损压缩),质量会更高,但文件也更大。

5. 进阶技巧与避坑指南

掌握了基本流程,你已经能完成80%的工作。但要想做得更高效、更专业,下面这些我踩过坑才总结出的技巧,或许对你有帮助。

5.1 使用命令行与脚本实现批量操作

如果你需要分析多个对接结果,或者对同一个复合物进行多种样式的出图,每次都手动点击菜单会非常低效。Pymol支持Python脚本和命令行操作。你可以把一系列操作写成.pml脚本文件。 比如,一个简单的脚本可以自动完成打开文件、着色、显示氢键、高亮特定残基并渲染出图的所有步骤:

# load_complex_and_analyze.pml
load my_dock_result.pdb
color chain, red, chain A
color chain, blue, chain B
show surface
find polar contacts between chain A and chain B
select resi 45+60+78 around 5.0
show sticks, sele
label sele, resi
set ray_shadows, 1
ray 3000, 2000
png my_output_image.png, dpi=300

把这个脚本保存为.pml文件,然后在Pymol命令行输入@your_script.pml,它就会自动执行所有命令。这对于需要重复性分析或生成一系列标准图片的工作流来说,是巨大的效率提升。

5.2 处理复杂界面与多重相互作用

有些蛋白互作界面非常大,涉及几十对氢键和疏水作用。全部显示出来会变成一团乱麻。这时候需要做减法聚焦

  • 按距离筛选:不是所有计算出来的极性接触都是强氢键。你可以通过命令只显示距离小于3.2 Å的强氢键,忽略那些较弱的相互作用。
  • 按残基类型聚焦:如果你怀疑互作主要由电荷作用驱动,可以专门选择带正电(ARG, LYS, HIS)和带负电(GLU, ASP)的残基,查看它们是否在空间上接近并可能形成盐桥。
  • 分图层展示:不要试图在一张图里展示所有信息。可以制作系列图。第一张图展示整体复合物和互作界面概览(用表面或卡通表示)。第二张图聚焦界面一隅,用线状/棍状模型详细展示3-4对最关键的氢键和残基。第三张图可以用示意图总结互作模式。

5.3 常见问题与解决方案

  • 问题:打开AlphaFold结构后,发现某些区域(尤其是N端或C端)是松散、无序的线团,干扰视图。
    • 解决:AlphaFold会对结构的每个残基给出一个置信度分数(pLDDT)。在Pymol中,你可以根据这个分数给结构着色(通常蓝色表示高置信,红色表示低置信)。对于低置信度的无序区域,如果它们远离你关心的互作界面,完全可以直接选中并“remove”掉,或者将其显示模式设为“dashes”(虚线),表示其不确定性。
  • 问题:对接结果看起来不自然,两个蛋白有部分原子重叠(碰撞)。
    • 解决:刚性对接软件(如ZDOCK)有时会产生这种不合理的模型。这正是可视化分析的价值所在——帮你筛选掉不合理的预测。你可以用Pymol的“clash”检测功能(在“Action” -> “find”菜单下)快速找出原子碰撞严重的区域。通常,排名靠前的对接结果中,至少前几个应该是相对合理的。如果所有结果碰撞都很严重,可能需要回头检查你输入的蛋白单体结构是否本身有异常。
  • 问题:生成的图片中,标签文字太小或位置重叠。
    • 解决:在渲染出图前,可以手动调整标签的位置。选中标签,用鼠标拖动它到合适的位置。也可以通过命令set label_size, 20来调整标签的字体大小。记住,最终目的是清晰可读,必要时可以牺牲一点自动排版的整洁,进行手动微调。

说到底,蛋白互作界面的3D可视化,是一门结合了科学判断和美学设计的手艺。它没有唯一的标准答案,但遵循“清晰、准确、重点突出”的原则,多练习、多尝试不同的显示组合和视角,你就能创造出既能揭示分子奥秘,又具有视觉冲击力的科学图像。当你第一次亲手“点亮”那两个关键残基间的氢键,并清晰地看到它们如何跨越空间紧紧相连时,那种从数据中亲手挖掘出机制的快感,正是生物信息学分析最迷人的地方之一。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐