MotifAE:利用蛋白质语言模型无监督发现功能性序列模式

蛋白质语言模型(pLM)通过在海量蛋白质序列上进行自监督训练,能够学习进化尺度上的序列规律,并已被广泛用于蛋白质结构、功能和突变效应预测。进一步将潜在特征与深度突变扫描实验数据对齐后,研究人员构建了监督扩展版本 MotifAE-G,筛选出与蛋白质折叠稳定性相关的潜在特征,并利用这些特征调整蛋白质序列设计方向。研究表明,MotifAE 为解析蛋白质语言模型内部学习到的功能序列规律提供了一种通用方法,并有望用于蛋白质功能注释、突变效应解释和理性蛋白质工程。

原文连接