蛋白质工程的游戏规则,正在被两个参数改写。美国杜克大学医学院研究团队开发出一款名为Raygun的人工智能工具,可像翻译器一样从海量数据中提炼规律,在保持蛋白质结构与功能的前提下,对其尺寸和性质进行大规模改造。这项成果于7月29日刊发于《自然》杂志,被学界评价为给生命科学装上了简易开关。
与从零设计全新蛋白质的路径不同,Raygun基于已训练完成的蛋白质语言模型开展工作。这类模型通过分析数百万条天然蛋白质序列,掌握了氨基酸排列与蛋白质结构、功能之间的潜在规律。研究团队发现,这些规律可以被转化为标准化的数学表征,使不同长度的蛋白质能够在同一维度下进行比较和运算,从而为定向改造提供基础。这意味着,过去需要数年摸索的定向进化任务,可能被压缩到几天完成。
Raygun的创新在于一套精巧的数学转化。大多数蛋白质语言模型将蛋白质表示为不同长度的氨基酸序列,这种体系使得在不同尺寸下保持蛋白质整体结构和功能变得困难。而基于ESM-2的Raygun采用了更数学化的方法:不再将每种蛋白质表示为高维空间中长度可变的序列,而是将其编码为固定维度下的概率分布。具体来说,Raygun把蛋白质的嵌入向量分成50个连续片段,每个片段的平均向量近似服从多元正态分布。
通过这种转化,无论一个蛋白质的氨基酸序列有多长,都能被压缩到一个固定的64000维空间中。随后,研究人员只需要调整两个参数:噪声控制替换率,目标长度控制插入和删除,就能在不破坏蛋白质结构完整性和功能位点的前提下,快速生成各种不同尺寸的新蛋白质。这种参数化调控的设计,让蛋白质改造从依赖经验的试错,转变为可精确控制的工程操作。
在实际操作中,研究团队用Raygun对四种不同大小的蛋白质进行了缩小测试,从由147个氨基酸组成的血红蛋白,到由2549个氨基酸构成的mTOR不等。结果显示,Raygun在不损害这些蛋白质原始结构和功能的前提下,将它们的氨基酸数量减少了15%到20%,部分甚至超过50%。这种大规模改造能力,是以往蛋白质工程工具难以企及的。
Raygun最直观的成果体现在荧光蛋白的小型化上。研究团队生成了红色荧光蛋白mCherry和绿色荧光蛋白eGFP的微型版本,这两种荧光蛋白常通过与其他蛋白融合来标记目标,但它们的尺寸偏大,与其他蛋白融合时可能会干扰其功能。Raygun将这两种荧光蛋白的氨基酸数量减少了10%到16%,最小的eGFP版本仅199个氨基酸,最小的mCherry仅206个氨基酸,已比荧光蛋白数据库中记录的几乎所有荧光蛋白都要小,同时仍保持了特有的结构形状和发光能力。
更值得注意的是,研究团队并未刻意保留荧光蛋白的关键结构发色团序列,而Raygun完全自学成才,自主保留了这些关键结构,甚至设计了非经典的发色团序列。这表明Raygun有能力探索超越常规的设计空间,找到自然进化未曾触及的优化路径。随后,团队挑战了更有难度的目标TurboID,一种已被广泛用于蛋白质组学研究的合成生物素蛋白质。使用Raygun生成的大量变体中,最引人注目的TurboID-11只有165个氨基酸,几乎只有原版的一半,为构建更小、更灵活的分子工具提供了新可能。
在功能增强方向上,Raygun同样表现亮眼。研究团队测试了表皮生长因子EGF的改造,Raygun生成的一系列变体中,部分设计相比原始EGF表现出更强的结合能力。EGF既是促进伤口愈合的重要因子,也是癌症研究中备受关注的细胞生长信号调控靶点。这一结果说明,Raygun探索的不只是更像天然蛋白的序列,而是在保持蛋白合理性的同时,寻找自然进化尚未探索到的优化方向。
Raygun的问世,为蛋白质工程提供了全新的研究模式。传统蛋白质工程依赖假设、突变设计、筛选、按需调整的人工进化流程,周期长、成本高、成功率不稳定。而Raygun选择修改现有蛋白质,采用与自然进化相同的步骤:添加或删除单个蛋白亚基,或将一个蛋白亚基替换为另一个。这种先设计稳定性再进化功能的工作流,对蛋白质科学具有广泛意义。
从产业应用看,Raygun的潜力集中在多个高价值方向。在基因疗法领域,更小尺寸的蛋白质工具更容易通过病毒载体递送,有望提升基因治疗的效率;在生物技术领域,优化的荧光蛋白和标记酶能提升科研工具的灵敏度;在酶工业领域,改造后的酶可能具备更强的稳定性或催化效率,直接服务于工业生产。研究团队表示,未来随着蛋白质语言模型和实验验证体系进一步结合,Raygun有望帮助科学家发现新的蛋白,并参与设计更加适合医学、工业和生物技术应用的定制化分子工具。
当然,目前相关研究仍处于基础验证阶段,Raygun是否适用于所有类型的蛋白质尚需更多实验支撑,后续转化应用也还有很长的路。但正如《自然》同期评论所指出的,Raygun的价值不在于它造出了自然界没有的蛋白,而在于它把蛋白质工程推向了一个参数化调控的新阶段,两个参数就能操控尺度与功能,这对基因治疗、酶工业乃至癌症靶向都是强心剂。
Raygun背后的方法学意义,值得单独展开。传统蛋白质语言模型把蛋白质视为不同长度的氨基酸序列,本质上是把蛋白质当作一段文本处理。但这种序列视角存在天然局限:蛋白质的结构和功能取决于三维折叠,而序列长度差异让不同蛋白质难以在同一坐标系中比较。Raygun的突破口,是把这个序列视角升级为概率分布视角,把蛋白质的嵌入向量分段后建模为固定维度的多元正态分布,让长度不再是障碍。
这一转换的学术价值,在于它打通了蛋白质工程与数学工具之间的桥梁。一旦蛋白质被表示为固定维度的分布,就能借用成熟的统计与优化工具进行定向修改,噪声参数和目标长度参数分别控制修改幅度与尺度变化,相当于给蛋白质工程提供了标准化的操作界面。这种可计算化的思路,正是AI驱动蛋白质科学从经验学科走向工程学科的关键一步,也呼应了近两年蛋白质语言模型从预测到设计的范式迁移。
从更广阔的视角看,Raygun与AlphaFold、ESMFold等结构预测模型形成了互补关系。结构预测模型回答蛋白质会折叠成什么形状,Raygun则回答如何修改序列才能获得想要的尺寸与性质,前者是理解工具,后者是改造工具。当理解与改造在同一生态中协同进化,AI在蛋白质科学中的角色将从辅助计算升级为自主设计,这正是AI for Science从论文走向产业的底层逻辑。