按主题筛选 每篇附阅读建议 从 1973 到 2025

重要文献清单

从「序列决定结构」的第一性原理,到 AlphaFold 革命、扩散模型与语言模型, 再到结合体、酶和纳米材料的应用案例。每篇都有「一句话 + 为什么重要 + 怎么读」。

2024 年诺贝尔化学奖背景 一半授予 David Baker(计算蛋白质设计),另一半共同授予 Demis Hassabis 和 John Jumper(AlphaFold 蛋白质结构预测)。 这个领域的「学科史」很短,从 2003 年 Top7 到 2023 年 RFdiffusion 只用了 20 年——这也是为什么经典文献值得读:每一步都是里程碑。

《Principles that Govern the Folding of Protein Chains》

Anfinsen, C. B. · Science, 1973

为什么重要:整个蛋白设计学科的第一性原理——序列决定结构。没有它,就没有「设计序列等于设计结构」这件事。

怎么读:篇幅不长,读结论部分即可。理解「复性实验为什么能证明序列决定结构」这一个点就值回票价。入门

《Design of a Novel Globular Protein Fold with Atomic-Level Accuracy》(Top7)

Kuhlman, B. et al. · Science, 2003

为什么重要:第一个在实验室里被证实「自然界不存在、纯计算设计」的全新蛋白折叠。晶体结构几乎与设计模型逐原子吻合,证明从头设计可行。

怎么读:读摘要 + 结果前两节 + 图 1。你会看到经典 Rosetta 流水线的原型。入门

《The Coming of Age of De Novo Protein Design》

Huang, P.-S., Boyken, S. E., Baker, D. · Nature, 2016

为什么重要:读懂这篇综述 = 建立从头设计的完整框架。它系统讲了「设计什么结构、怎么生成骨架、怎么设计序列、怎么验证功能」。

怎么读:这是你第二篇该读的文献。花一个下午精读,边读边对照概念页。入门

《Advances in Protein Structure Prediction and Design》

Kuhlman, B., Bradley, P. · Nature Reviews Molecular Cell Biology, 2019

为什么重要:AlphaFold 之前最后一篇权威综述,把「预测」和「设计」两条线放在一起讲清楚。

怎么读:重点读「设计」相关章节,理解 2019 年之前工具的能力边界,能帮你体会后来深度学习的跨越有多大。入门

《Directed Evolution: Bringing New Chemistry to Life》

Arnold, F. H. · Angewandte Chemie, 2018(诺贝尔演讲)

为什么重要:设计的另一半——进化。计算设计给起点,定向进化给「能用的蛋白」。读懂进化筛选逻辑,你的设计项目成功率会翻倍。

怎么读:当故事读,1 小时。重点理解「突变 → 筛选 → 扩增」循环和筛选压力的设计。入门

《Crystal Structure of a Monomeric Retroviral Protease Solved by Protein Folding Game Players》

Khatib, F. et al. · Nature Structural & Molecular Biology, 2011

为什么重要:Foldit 玩家靠「手感」解出了困扰科学家多年的结构——证明折叠目标函数是可以被直觉理解的,也顺带是 Foldit 的绝佳背书。

怎么读:读图 + 玩家社区故事即可。入门

《Highly Accurate Protein Structure Prediction with AlphaFold》

Jumper, J. et al. · Nature, 2021

为什么重要:结构预测从「难」变「解决」。AlphaFold2 的架构(Evoformer + structure module)也直接影响了后来所有结构类深度学习模型。

怎么读:第一遍读摘要和结果,第二遍精读 Methods 里的架构图,第三遍去看 ColabFold 代码对应关系。中等

《Accurate Prediction of Protein Structures and Interactions Using a Three-Track Neural Network》

Baek, M. et al. · Science, 2021

为什么重要:AlphaFold2 的同期对手,用更轻的三轨网络(序列、结构、MSA)达到相近精度。它的开源生态(包括后来的 RFdiffusion)是 Baker lab 深度学习布局的起点。

怎么读:重点读架构设计差异,理解「轻量」与「精度」的权衡。中等

《Biological Structure and Function Emerge from Scaling Unsupervised Learning to 250 Million Protein Sequences》

Rives, A. et al. · PNAS, 2021

为什么重要:蛋白语言模型的奠基论文。证明「只学序列」就能隐式学到结构/功能/进化信息,为 ESMFold、ESM3 和无数下游应用铺路。

怎么读:读「模型在无监督下学到了什么」的验证实验部分,非常直观。中等

《Accurate Structure Prediction of Biomolecular Interactions with AlphaFold3》

Abramson, J. et al. · Nature, 2024

为什么重要:把预测从「蛋白单体」推广到「蛋白—核酸—小分子—修饰」复合物。设计界用它回测「设计好的蛋白会不会和靶点/配体正确结合」。

怎么读:重点看它支持哪些分子类型、读 ipTM 评估和与 AF2 的对比图。中等

《OpenFold: Retraining AlphaFold2 Yields New Insights into Its Learning Mechanisms and Challenges for Generalizability》

Ahdritz, G. et al. · Nature Communications, 2024

为什么重要:把 AF2 完全开源复现并训练,让「研究模型、改模型、训练自己的预测器」成为可能。

怎么读:想做模型研究再精读,否则读摘要即可。硬核

《Boltz-1: Democratizing Access to Large-Scale Protein Structure Prediction》

Wohlwend, J. et al. · 2024(arXiv 预印本,后发表于 Nature Methods)

为什么重要:首个开源复现 AlphaFold3 级复合物预测的模型,让本地跑「蛋白+配体+核酸」预测不再依赖闭源服务器。

怎么读:使用向(跑一遍 Colab/GitHub)为主,Methods 可跳过。中等

《Robust Deep Learning-Based Protein Sequence Design Using ProteinMPNN》

Dauparas, J. et al. · Science, 2022

为什么重要:逆折叠的转折点。图神经网络让序列设计又快又好,实验成功率大幅提升,从此成为「设计流水线里不可缺的一步」。

怎么读:精读。理解输入输出(骨架坐标 → 序列)、如何固定残基、如何采样多条序列。这是你第一个要完全吃透的模型。中等

《De Novo Design of Protein Structure and Function with RFdiffusion》

Watson, J. L. et al. · Nature, 2023

为什么重要:当前从头设计的主角论文。扩散模型生成骨架,实验验证的成功率从「万里挑一」变成「十之七八」,binder、酶、对称组装全面开花。

怎么读:先读摘要 + 图 1(流水线总览)+ 各任务的结果图;Methods 里重点看「条件生成」和 binder 模式怎么定义热点。然后跑一遍官方 Colab。硬核

《Illuminating Protein Space with a Programmable Generative Model》

Ingraham, J. B. et al. · Nature, 2023(Chroma)

为什么重要:另一个扩散生成模型,亮点是「程序化约束」——对称性、尺寸、功能条件都能直接编码进采样,实验验证了一批全新蛋白。

怎么读:与 RFdiffusion 对比读,重点看约束表达方式的差异。硬核

《Simulating 500 Million Years of Evolution with a Language Model》

Hayes, T. et al. · Science, 2025(ESM3)

为什么重要:把「序列 + 结构 + 功能」统一进一个生成模型,能按条件生成蛋白(经典例子:从远古祖先蛋白生成有活性的新荧光蛋白)。代表「多模态生成」方向。

怎么读:读摘要 + 荧光蛋白案例故事;技术细节可后补。中等

《Diffusion Probabilistic Modeling of Protein Backbones in 3D for the Motif-Scaffolding Problem》

Trippe, B. L. et al. · ICLR, 2023(arXiv 2022)

为什么重要:把扩散模型引入蛋白骨架生成的开创性工作,直接催生了 RFdiffusion。读它能理解「motif scaffolding」的问题定义。

怎么读:了解问题设定和直觉即可,不必抠细节。硬核

《SE(3) Diffusion Model with Application to Protein Backbone Generation》

Yim, J. et al. · ICML, 2023(FrameDiff)

为什么重要:强调「等变性」的骨架扩散方法,让生成结果天然满足旋转平移对称。技术上有教学价值。

怎么读:可选。想深入理解扩散模型在 3D 结构上的数学再读。硬核

《Massively Parallel De Novo Protein Design for Targeted Therapeutics》

Chevalier, A. et al. · Nature, 2017

为什么重要:从头设计流感血凝素结合体的里程碑,展示了「计算设计 + 酵母展示高通量筛选」的经典组合拳。

怎么读:读图 1(设计流程)和图 2(筛选与命中)。这是 binder 设计的标准教材。中等

《De Novo Design of Potent and Selective Mimics of IL-2 and IL-15》

Silva, D.-A. et al. · Nature, 2019

为什么重要:把「从头设计结合体」用在细胞因子模拟上——设计出的 IL-2/IL-15 模拟物在动物体内有真实疗效。设计 → 治疗的直接示范。

怎么读:读摘要 + 设计策略部分,感受「功能导向设计」的思维方式。中等

《Design of Protein-Binding Proteins from Target Structure Alone》

Cao, L. et al. · Nature, 2022

为什么重要:仅凭靶点结构就能设计高亲和力 mini-protein binder(包括 SARS-CoV-2 RBD)。流程简单、成功率高,是「现代 binder 设计」的标准范本。

怎么读:精读。理解 hotspot 定义、骨架生长、序列设计、实验筛选的每一步——这就是你未来课题的工作模板。中等

《De Novo Computational Design of Retro-Aldol Enzymes》

Jiang, L. et al. · Science, 2008

为什么重要:从头设计催化「自然界没有专门酶」的反应的里程碑,展示了「催化位点几何 → 骨架设计」的思路。

怎么读:读图 1(theozyme 思路)和「进化提升活性」的讨论。中等

《Kemp Elimination Catalysts by Computational Enzyme Design》

Röthlisberger, D. et al. · Nature, 2008

为什么重要:与 retro-aldol 同期,证明计算酶设计可以创造全新催化活性,也是「计算设计 + 定向进化」组合的经典案例。

怎么读:读摘要和催化机制部分即可。中等

《Computational Design of an Enzyme Catalyst for a Stereoselective Bimolecular Diels-Alder Reaction》

Siegel, J. B. et al. · Science, 2010

为什么重要:设计出催化自然界不存在反应的酶,且立体选择性可控——酶设计的「造物主时刻」。

怎么读:当案例故事读,重点在「过渡态几何设计」和「进化后的活性提升」。中等

《Design of a Hyperstable 60-Subunit Protein Icosahedron》

Hsia, Y. et al. · Nature, 2016

为什么重要:从头设计 60 个亚基自组装成二十面体纳米笼,为疫苗递送、纳米材料铺路。展示「对称设计」的威力。

怎么读:读摘要 + 图 1 的对称设计思路。中等

《Induction of Potent Neutralizing Antibody Responses by a Designed Protein Nanoparticle Vaccine for Respiratory Syncytial Virus》

Marcandalli, J. et al. · Cell, 2019

为什么重要:把设计好的抗原展示在自组装纳米颗粒上,引发远超可溶性抗原的免疫应答——「设计疫苗」从概念走向临床前验证。

怎么读:读摘要 + 设计示意图,理解「支架展示抗原」的价值。中等

David Baker · 2024 年诺贝尔化学奖演讲

NobelPrize.org, 2024

为什么重要:领域奠基人亲自讲 20 年研究历程,从 Top7 讲到 RFdiffusion,是最好的「领域地图」和英文听力材料。

怎么读:1 小时视频或讲稿,值得完整看一遍。入门

拓展方向:Heterochiral / 镜像蛋白设计

你的关注方向 · 追踪卢培龙实验室等课题组

为什么重要:用镜像(D-氨基酸)或非天然化学拓展设计空间,可能做出抗蛋白酶降解的结合体、体内更稳定的药物前体——是结合体设计的前沿变体。

怎么读:用 PubMed 关键词检索跟踪最新论文,同时把你桌面「卢培龙」文件夹里的文献读一遍,用本页结构做笔记。进阶

精读优先级 时间有限时按这个顺序:Huang 2016 综述 → ProteinMPNN 2022 → RFdiffusion 2023 → Cao 2022。 这四篇读透,你就能看懂 90% 的现代设计论文在做什么。