AlphaFold2 / AlphaFold3 结构预测
正问题的王炸:给定序列预测结构。AlphaFold2 精度达到实验级;AlphaFold3 扩展到蛋白—核酸—小分子配体复合物和翻译后修饰预测。
- 网页版:AlphaFold3 Server(免费、无需 GPU)
- 本地版:代码开源,但需要较强 GPU
- 设计流水线里主要用来做「自洽性回测」
按「结构预测 → 序列设计 → 生成式设计 → 经典设计套件 → 可视化 → 实验验证」分类。 新手建议从 Colab 版工具开始,不用配 GPU 也能跑通。
| 工具 | 分类 | 一句话 | 上手难度 | 要不要 GPU |
|---|---|---|---|---|
| ColabFold | 结构预测 | AlphaFold2 的加速版,浏览器里跑 | 入门 | Colab 免费额度够用 |
| AlphaFold3 | 结构预测 | 预测蛋白—配体—核酸复合物 | 入门 | 网页版即可,本地版较重 |
| ProteinMPNN | 序列设计 | 逆折叠主力,给骨架配序列 | 入门 | Colab 可跑 |
| RFdiffusion | 生成式设计 | 扩散模型生成全新骨架/binder | 中等 | 建议 GPU(Colab 可跑小任务) |
| Rosetta / PyRosetta | 经典套件 | 物理能量函数 + 采样,设计界的标准套件 | 中等偏难 | CPU 即可 |
| Foldit | 经典/入门 | 游戏化折叠,零基础入门神器 | 入门 | 不需要 |
| PyMOL / ChimeraX | 可视化 | 看结构、做图、分析界面 | 入门 | 不需要 |
正问题的王炸:给定序列预测结构。AlphaFold2 精度达到实验级;AlphaFold3 扩展到蛋白—核酸—小分子配体复合物和翻译后修饰预测。
AlphaFold2 的加速重实现(用 MMseqs2 快速搜索同源序列),不用装任何东西,在 Google Colab 里点两下就跑。单体、复合物都能预测。
不需要 MSA,一条序列几秒出结构。精度略低于 AlphaFold,但特别适合「快速浏览大量序列」和设计流水线里的粗筛。预测可以在网页上直接用,也整合在 ESM 仓库里。
与 AlphaFold2 同期发布的预测器,用更轻的「序列+结构+MSA」三轨网络。RF2 在线服务器可预测复合物;RoseTTAFold All-Atom 扩展到配体小分子。与 RFdiffusion 是同一家族。
独立复现并开源训练的 AlphaFold2,支持从头训练和微调,是研究「模型内部发生了什么」和定制预测的首选框架。如果你未来想改模型、做新任务,从这里开始。
让「AlphaFold3 级别」的复合物预测完全开源:蛋白、核酸、小分子配体、金属离子都能处理。Boltz-2 进一步支持共价修饰和更广的化学空间,正在成为本地预测的标准选择。
深度学习之前的主流路线,理解它们能帮你读懂老文献:I-TASSER 靠线程化组装模板片段;SWISS-MODEL 和 MODELLER 用已知同源结构搭模型。现在主要用于「没有同源序列时」的补充和教学。
给一个骨架设计序列的默认工具。图神经网络逐位预测「这里放哪个氨基酸最合适」,可以固定某些残基(比如功能位点),可以生成多条候选。实验成功率远高于传统方法。
序列设计时把口袋里的配体、辅因子、核酸、金属离子也考虑进去——设计酶口袋或设计「围绕小分子」的蛋白时比 ProteinMPNN 更合适。
把序列当语言学的模型。ESM2 可用于序列合理性打分和突变效应预测;ESM3 能按「序列+结构+功能」条件联合生成,比如给定一个功能位点让模型补齐其余部分,甚至设计荧光蛋白。
当前从头设计的主角。从随机噪声扩散出全新骨架,支持多种任务:motif scaffolding(把功能基序装进新支架)、binder design(对着靶点表面长结合蛋白)、对称自组装、单体/复合物设计。生成的结构与目标功能位点高度一致。
另一个扩散式生成模型,特色是「程序化约束」:可以指定对称性、尺寸、甚至掩码区域,直接采样完整复合物或功能化的蛋白。API 和本地代码都开源,值得和 RFdiffusion 对比着玩。
早期把扩散模型用在蛋白骨架上的学术方法(SE(3) 扩散、等变图网络)。现在主流工作流不用它们,但读 2022–2023 年的文献会频繁遇到,值得知道「RFdiffusion 站在谁的肩膀上」。
物理+统计能量函数的集大成者,从结构预测到序列设计、对接、酶设计全覆盖。核心概念:能量函数打分、蒙特卡洛/模拟退火采样、relax(结构松弛)、FixBB(固定骨架设计序列)、FastDesign(骨架+序列联合优化)。
用 Python 操作 Rosetta:读结构、打分、design、relax。配套教程从安装到高级设计逐步讲解,比命令行应用更适合理解每一步在做什么。许多 Baker lab 入门课程都基于它。
把蛋白折叠做成解谜游戏:拖拽、摇摆、打分实时反馈。零基础也能玩,玩家社区甚至帮科学家解出了晶体结构(Khatib 2011)。强烈推荐作为「第一个动手项目」。
射线图、表面、静电、突变标注、交互式脚本。文献里绝大多数结构图都是它做的。开源版功能足够学习,教学版也免费。
处理密度图、体积数据、界面分析非常顺手,交互界面现代,还有大量教学资源。做 cryo-EM 的你大概率已经很熟——设计这边它同样适合看模型与密度对比、算界面接触。
做分子动力学模拟、看轨迹、算相互作用时最常用。设计候选做 MD 稳定性验证时会用到。
拿到设计蛋白的实验结构后,用 Coot 手动调模型、Phenix 做精修。这是「设计闭环」的最后验证环节——你的实验结构会和设计模型对比,回填到 PDB 里。
计算设计产出候选序列后,实验闭环大致是:基因合成(Twist/GenScript)→ 表达纯化(大肠杆菌/酵母/哺乳动物细胞)→ 基本表征(SEC 判断是否单分散、CD/Tm 看折叠和稳定性、质谱看分子量)→ 功能/结合验证(BLI/SPR、酵母展示或噬菌体展示筛库)→ 结构验证(晶体或 cryo-EM)。