50+ 词条 中英对照 支持搜索

术语表

读文献、跑软件时随手查。按英文关键词也能搜到(例如输入 pLDDT 或 diffusion)。

氨基酸

Amino acid

组成蛋白质的 20 种标准分子,按侧链化学性质分疏水、极性、带电和特殊四类。

主链 / 侧链

Backbone / Side chain

主链是所有氨基酸共有的 N-Cα-C 骨架;侧链是每个氨基酸独有的部分,决定化学性质。

肽键

Peptide bond

连接氨基酸的共价键(C-N),具有部分双键性质,使肽键平面刚性。

二级结构

Secondary structure

局部规律折叠:α 螺旋、β 折叠片和 loop,主要由主链氢键稳定。

α 螺旋

Alpha helix

每圈约 3.6 个残基的右手螺旋,靠 i→i+4 主链氢键稳定,是设计的常用积木。

β 折叠片

Beta sheet

相邻肽段靠主链氢键形成的片层结构,可平行或反平行排列。

环

Loop

连接二级结构的柔性区域,常承担结合或功能角色,设计时往往需要固定关键残基。

三级结构

Tertiary structure

整条多肽链的三维空间结构,即通常说的「蛋白结构」。

四级结构

Quaternary structure

多条链(亚基)组装成的复合物,如血红蛋白四聚体。

结构域

Domain

可独立折叠、常具有独立功能的结构单元,设计时常作为「支架」。

基序 / 模体

Motif

具有特定功能或结构特征的小片段(如锌指、卷曲螺旋),可被「支架化」进新蛋白。

折叠

Folding

氨基酸链自发形成三维结构的过程,由序列和溶剂环境决定。

安芬森原理

Anfinsen's dogma

序列原则上决定天然结构。蛋白设计的理论根基。

能量景观

Energy landscape

把蛋白所有构象画成能量地形图,天然结构在最低谷。设计就是「挖深目标谷」。

自由能

Free energy

决定折叠平衡的热力学量。折叠态自由能越低越稳定,实验上可用 ΔG、Tm 衡量。

疏水效应

Hydrophobic effect

非极性侧链躲进水中的驱动力,是蛋白折叠和界面结合的主要能量来源。

熔球态

Molten globule

折叠中间态:有二级结构但侧链堆积松散,常见于不稳定设计。

PDB

Protein Data Bank / .pdb 文件

实验结构数据库,也是结构文件格式名。设计流程的输入输出基本都带 PDB 文件。

分辨率

Resolution

实验结构的清晰程度(Å)。分辨率越高,模型可信度越高。

RMSD

Root-mean-square deviation

两个结构叠合后原子位置的平均偏差(Å)。设计回测中,预测结构 vs 设计骨架 RMSD 越小越好。

TM-score

Template modeling score

结构相似度指标,0–1。>0.5 通常认为同折叠,>0.9 几乎相同。

pLDDT

Predicted local distance difference test

AlphaFold 输出的逐残基置信度,0–100。>90 高质量,<50 提示无序或错误。

pTM

Predicted TM-score

整体结构置信度,0–1。设计自洽性验证常看 pTM > 0.8 作为及格线。

ipTM

Interface pTM

复合物界面预测置信度,判断两个蛋白是否真的会按设计结合。

PAE

Predicted aligned error

预测两个残基之间相对位置的误差矩阵。看界面和结构域相对方位是否可靠。

MSA

Multiple sequence alignment

把同源序列对齐排列,进化保守信息是 AlphaFold 等模型的重要输入。

同源建模

Homology modeling

用已知同源结构为模板搭模型,传统方法(SWISS-MODEL / MODELLER)。

从头设计

De novo design

不模仿天然蛋白,从功能出发设计全新蛋白。

逆折叠

Inverse folding

给定骨架设计能折叠成它的序列,ProteinMPNN 解决的核心问题。

定向进化

Directed evolution

突变 → 筛选 → 扩增的迭代循环,实验室里「人工演化」蛋白(Arnold 诺奖工作)。

高通量筛选

High-throughput screening

一次实验测成千上万候选的方法,是设计后「找命中」的关键。

噬菌体展示

Phage display

把蛋白展示在噬菌体表面,通过结合筛选富集高亲和力变体。

酵母展示

Yeast surface display

把蛋白展示在酵母细胞表面,用流式分选筛亲和力,binder 设计常用。

热区

Hotspot

界面上对结合能贡献最大的残基,是 binder 设计的「锚点」。

结合界面

Binding interface

两个蛋白接触的表面区域,形状互补和疏水/极性匹配决定亲和力。

扩散模型

Diffusion model

通过「加噪—学去噪—从噪声采样」生成新数据的模型,RFdiffusion/Chroma 的核心。

去噪

Denoising

扩散模型的训练目标:从带噪声的结构恢复干净结构,生成时从纯噪声逐步去噪。

潜空间

Latent space

模型内部压缩表示数据的空间,相似蛋白在潜空间里距离近。

嵌入

Embedding

把序列/结构编码成数值向量,供模型使用或分析(如 ESM embedding)。

蛋白质语言模型

Protein language model (PLM)

在蛋白序列上训练的 Transformer,学到进化/结构/功能知识(ESM 系列)。

注意力机制

Attention

模型让不同位置「互相看」的机制,AlphaFold 和语言模型的共同核心。

图神经网络

Graph neural network (GNN)

在「节点+边」结构上学习的网络,ProteinMPNN 把骨架残基当节点、距离当边。

等变性

Equivariance

模型输出随输入旋转平移而一致变化的性质,让结构预测/生成不依赖坐标系。

Rosetta 能量函数

Rosetta energy function

物理+统计项的加权打分函数(范德华、氢键、溶剂化、二面角偏好等),设计搜索的目标。

Relax

Relax

Rosetta 的结构优化流程,交替骨架和侧链微调让结构落入低能态,设计前的标准预处理。

打分函数

Scoring function

给一个结构/序列打「好不好」的函数,Rosetta 能量、pLDDT、语言模型概率都算。

蒙特卡洛采样

Monte Carlo sampling

随机扰动并按能量接受/拒绝的搜索方法,Rosetta 设计的核心采样手段。

模拟退火

Simulated annealing

先高温随机探索、再逐步降温收敛的优化策略,避免陷入局部最优。

二硫键

Disulfide bond

Cys 侧链间的共价键,可显著提高设计蛋白的稳定性,也增加表达难度。

氢键

Hydrogen bond

氢原子在电负性原子间的弱相互作用,稳定二级结构和界面。

盐桥

Salt bridge

正负电荷侧链间的静电相互作用,可稳定结构和界面。

Colab / GPU

Google Colab

谷歌的免费云端笔记本,可免安装跑 AlphaFold/ProteinMPNN 等工具;GPU 加速大模型推理。

基因合成 / 质粒

Gene synthesis / Plasmid

把设计序列交给公司合成 DNA 并克隆到表达载体(如 Twist、GenScript),进入实验验证的第一步。

B-factor

B-factor / temperature factor

PDB 里反映原子位置不确定度的参数,数值越高越柔性/不可信。

自洽性验证

Self-consistency check

设计出序列后用 AlphaFold 再预测一遍结构,看是否回到设计骨架——现代设计流水线的质检环节。