大自然蛋白质折叠的不合理冗余

查看原文 HN 讨论

文章摘要

作者 Arda Goreci 提出了一个观点:尽管蛋白质的氨基酸序列极其多样,但这些蛋白质实际采用的结构形态(折叠,fold)却远比序列多样性所暗示的要有限和重复得多。研究团队原本期望,把海量的基因组数据库(来自宏基因组学的数十亿条序列)转换成预测结构后,能获得同样多样的结构训练数据。然而他们发现,”天然蛋白质似乎并没有均匀地探索骨架空间”——重复去除之后的数据集只对应大约两万五千个”结构邻域”,而非预想中的数百万。

什么是蛋白质折叠?折叠指的是氨基酸链所采用的三维结构架构。文章举例说明:三个共享同一折叠的蛋白质,序列相似度只有 23.9%–28.3%,这证明差异巨大的序列可以编码出完全相同的结构形态。

聚类结果令人惊讶:196 万个 MGnify 片段被聚成约 25,300 个结构组;其中排名前 1000 的聚类就包含了全部片段的 71.5%。这揭示了一种极端的集中现象——折叠空间遵循幂律分布,被少数常见的”骨架”(scaffold)所主导。

方法论上,研究者开发了一些精巧的过滤技术:用图论的谱二分法(spectral bisection)来智能地拆分多结构域蛋白(识别”瓶颈”连接,而不只依赖置信度分数);审计 Foldseek 把某些结构判为”孤立单例”的结论,发现号称独特的 1000 个结构里有 373 个实际上能以 TM-score ≥ 0.8 聚到一起。

对酶设计的启示有两种相反的策略:一是”师法自然”——专注于在熟悉的骨架内优化活性位点,而非寻找全新的骨架;二是”大胆探索”——质疑那些主要基于天然折叠训练的模型,究竟能否突破”天然折叠流形”,进入演化从未触及的结构创新领域。作者最后指出,最终答案有待实证:观察计算设计出的酶能否表达、折叠并发挥功能,才能揭示在冗余的天然结构上训练是否会限制设计潜力。

HN 评论精华

jyounker 给出了资深视角:对于有本科生化知识的人来说,这一切都不算特别意外。三十年前他的蛋白质课教授就讲过几个要点:酶结构中只有少数几个氨基酸是高度保守的(数百个中通常不到十个);它们一般位于反应中心;几乎所有单点序列替换对结构和功能都没有可测影响;跨物种的”同一”蛋白序列可以分化达 40%,却保持相同结构。他总结道:”唯一的教训就是,对生化学家而言这个结果并不意外。”

DrScientist 进一步澄清,提醒大家不要错过文章真正的重点:文章想说的是,对于不同的功能,同样的基本折叠被一次次地复用。问题在于稳定折叠的结构空间是否本身就很小(受限于有限的二级结构种类)。

resiros 回应说这是生物学的基本事实,并举了 Rossmann 折叠为例——它是被许多不同功能复用的模板;flobosg 补充 TIM barrel 折叠也是如此,能催化各种反应。resiros 还提出有趣的问题:是否存在演化未曾发现、但同样有用的折叠?Baker 实验室(David Baker 组)创造了一批全新折叠,但不确定它们是否和演化发现的一样有用——毕竟”演化拥有比我们更多的算力”。

hirenj 指出这一思路与几年前的 TED 方法类似,当时也没发现荒诞的折叠多样性:”原来演化并不排斥适度的蛋白质’剽窃’。”由此引出关于折叠空间是”能量可达极限”还是”演化可达极限”的讨论:pfdietz 提出还可能是”演化可达性”——序列空间中的吸引盆地必须足够大,演化才可能偶然撞上它。

spwa4 认为这只是自然选择基于现有蛋白构建新蛋白的产物,而非真正的设计极限,主张若从第一性原理设计蛋白质就不会有这种限制。gilleain 反驳:随机序列很可能根本不会折叠;稳定折叠的妙处在于序列空间中”相邻”的序列(即点突变)采用相同折叠,这让突变不那么具有破坏性。

flobosg(多次出现的生物专家)澄清了若干概念:结构由序列决定,因此两者同等重要;但结构比序列更保守,主要源于支配蛋白折叠的物理化学约束;许多酶可以删去大量序列/结构仍保持功能,天然蛋白携带大量演化”冗余垃圾”。

此外,flobosg 引用了 François Jacob 的名言来比喻演化:自然选择不像工程师那样工作,而更像一个”修补匠”(tinkerer)——他不确切知道自己要造什么,只是用手边能找到的一切(绳子、木片、旧纸板)拼凑出某种能用的东西。多位评论者也吐槽该网站滚动卡顿、需要开阅读模式,但也有人称赞内容”全在页面上”而非靠脚本拼凑。