零基础友好 中文讲解 覆盖主流软件 必读文献清单

蛋白质设计,一套看得懂的自学路线

从氨基酸和折叠原理,到 AlphaFold、Rosetta、RFdiffusion、ProteinMPNN—— 把「结构生物学 + 机器学习」这条路上需要知道的概念、软件和文献, 按阶段整理成一份可以跟着做的中文指南。

什么是蛋白质设计?

一句话版本:结构预测是「给我一条序列,我告诉你它长什么样」; 蛋白质设计反过来——「给我一个想要的结构或功能,我来设计一条能折叠成它的序列」。 传统方法靠物理能量函数(Rosetta)搜索序列空间;2022 年以来,深度学习(AlphaFold、扩散模型、语言模型) 让这条流水线又快又准,2024 年诺贝尔化学奖颁给了计算蛋白设计的开创者 David Baker 和 结构预测的 Demis Hassabis / John Jumper,就是这个领域最好的注脚。

给有结构生物学背景的你 你已经会 PyMOL / ChimeraX、看得懂 PDB、做过 cryo-EM——恭喜,这已经超过 80% 刚入门的人。 这份指南的重点是补上「计算设计」这一侧:能量函数、逆折叠、扩散模型,以及怎么把你的实验技能接进设计闭环。

学习路径(5 个阶段)

每一阶段都有明确产出。勾选完成项,进度会自动保存在本机浏览器里(localStorage)。

已完成 0 / 0 项
  1. 0

    打地基:结构生物学快速复习

    约 1–2 周
    产出:能在 10 分钟内用可视化软件讲清一个蛋白的结构特征。
  2. 1

    第一次「设计」:玩转预测与逆折叠

    约 2–4 周
    产出:从「只会预测」跨越到「能做设计」——这是本阶段最重要的心智转变。
  3. 2

    经典计算设计:Rosetta / PyRosetta

    约 1–3 个月
    产出:能解释「为什么要能量函数」「Rosetta 和深度学习的关系」。
  4. 3

    AI 生成式设计:扩散模型与语言模型

    约 3–6 个月
    产出:能独立设计一条骨架并用 ProteinMPNN 得到候选序列,知道每一步的局限。
  5. 4

    做自己的课题:设计—实验闭环

    长期
    你的 cryo-EM 技能在这里就是杀手锏——很多设计论文的「最后一幅图」就是电镜结构。

六张地图,随意翻阅

不需要按顺序读。遇到不懂的词去术语表,想知道用什么软件去软件页。

第一步做什么?

  1. 花 30 分钟读 核心概念页 的「基础概念」部分,把术语表里不认识的词过一遍。
  2. 装一个可视化软件(PyMOL 或 ChimeraX),打开一个你感兴趣的 PDB 结构随便玩玩。
  3. 周末跑第一个 ColabFold:预测你研究里一个蛋白的结构,看看 pLDDT 图长什么样。
开始第一步 →