苹果新AI模型简化蛋白质设计,同时生成序列与结构
SimpleDesign是苹果在蛋白质设计上的新模型,能同时生成氨基酸序列和三维结构。这不是苹果第一次碰蛋白质。2024年9月,苹果发过SimpleFold,用流匹配模型从氨基酸序列直接预测蛋白质结构。
流匹配的思路是:从一个带噪声的随机起点出发,走一条相对直接的路到最终结果。扩散模型不同,它靠反复去噪慢慢逼近。这两种方法过去多用于图像生成,苹果的研究者也试过把扩散模型用在文本和代码上。SimpleFold的简化在于,把流匹配和文本生成常用的Transformer块配在一起。AlphaFold这类模型常用的高计算成本技术,它避开了。
SimpleDesign把这套简化思路往前推了一步。蛋白质设计比结构预测更麻烦。现有模型一般分两阶段训练。先让自编码器把数据压成token化的潜在表示,再在这个表示上训练生成模型。SimpleDesign觉得这一步没必要。它跳过token化,直接从配对的氨基酸序列和三维坐标学习,端到端生成序列和结构。
训练数据超过200万对蛋白质序列和结构,主要来自AFESM数据集。这个数据集由AlphaFold数据库的预测结构和额外样本组成。训练时,序列和结构会被一起破坏:氨基酸被随机遮盖,三维结构加噪声。破坏程度可以调节,模型会学到不同的任务。序列基本完好、结构被破坏,模型学的是蛋白质折叠。结构完好、序列被遮盖,对应逆折叠。两者都部分受损,则是在学共设计。
SimpleDesign在共设计、结构生成和序列生成三个基准上拿到了有竞争力的结果。它在训练流程上简单得多。它生成的氨基酸序列,通常和大多数竞争多模态模型相当或更好。不过,这些结果全来自计算机评估。生成的蛋白质没有做过实验验证。它们在真实生物系统里能不能正确折叠、正常发挥功能,还无法确认。
如果实验验证能跟上,这套简化方法的价值在于降低门槛。计算成本降下来,更多实验室也能做蛋白质设计。从模型到新药或生物材料,还有很长的路。