技术进展

苹果公布SimpleDesign蛋白质设计模型

Heooo 09月12日13时33分 42 阅读

「苹果研究人员公布蛋白质设计模型SimpleDesign,论文以预印本形式发布在arXiv。该模型联合生成氨基酸序列与三维结构,直接在原始数据上端到端训练,省去自编码器等中间表示环节,延续SimpleFold思路,使用超200万组配对数据训练,在多项基准测试中表现具有竞争力。」

苹果公司的研究人员公布了一项名为SimpleDesign的蛋白质设计模型,相关研究论文以预印本形式发布在arXiv上。该模型能够联合生成蛋白质的氨基酸序列和三维结构,其最大特点在于直接在原始数据上训练,省去了传统多阶段训练流程中的中间表示转换环节。

研究人员在论文中提到,现有不少蛋白质联合设计模型需要先训练自编码器,把蛋白质结构转换为离散的潜在表示,再训练生成模型去处理这些表示。SimpleDesign则直接使用氨基酸序列和连续三维坐标进行端到端训练,让结构信息以连续形式保留在模型内部,从而避免了中间表示带来的信息损失与流程复杂化。

这项研究延续了苹果此前SimpleFold项目的技术思路。SimpleFold通过流匹配模型,根据氨基酸序列直接预测蛋白质三维结构。SimpleDesign则将这一简化架构扩展至蛋白质设计任务,不仅预测结构,还尝试同时生成能够形成相应结构的氨基酸序列。

在训练数据方面,研究团队使用了超过200万组蛋白质序列与结构配对数据,主要来自AFESM数据集。该数据集整合了AlphaFold数据库的预测结构以及其他样本。训练过程中,模型会随机遮盖氨基酸序列中的部分内容,同时向对应的三维结构添加噪声,通过这种方式构造出多样化的学习任务。

通过调整序列和结构的破坏程度,模型可以学习不同的蛋白质任务。当序列基本完整而结构受到较大干扰时,任务类似于蛋白质折叠,即根据已知序列恢复结构;当结构基本完整而序列被大量遮盖时,则类似于逆折叠,即生成能够形成指定结构的氨基酸序列;当序列与结构同时受到部分破坏时,模型需要联合处理两类信息,从而学习蛋白质序列与结构的协同设计。论文特别注明,蛋白质折叠是指氨基酸链形成特定三维结构的过程,逆折叠则是根据目标结构寻找可能对应的氨基酸序列。

根据研究结果,SimpleDesign在蛋白质联合设计、结构生成和序列生成等基准测试中取得了具有竞争力的表现。研究人员还发现,该模型能够生成具有合理形态的蛋白质结构,生成的氨基酸序列整体质量与多数竞品多模态模型相当或更好。这一结果表明,去掉中间表示环节的端到端路线在蛋白质设计任务上具备可行性,也为简化蛋白质生成模型的训练流程提供了一种可参考的架构思路。

不过,论文目前仅报告了计算机评估结果。研究团队尚未通过实验验证生成蛋白质能否实际折叠、发挥功能或在生物系统中安全运行,因此这些结果还不能直接证明模型设计出的蛋白质具备实际应用能力,后续仍需湿实验层面的进一步检验。

# 蛋白质设计 # SimpleDesign # 苹果

来源:Heooo AI工具导航