AlphaFold2、ESMFold 与 RoseTTAFold 等结构预测方法
基于多序列比对的方法在有同源信息时精度较高,适合常规单体和同源复合物;蛋白语言模型类方法不依赖比对,速度快,适合大批量筛查或孤儿序列。设计序列和人工骨架常超出训练分布,结果要更谨慎看待。
19个分析 Skill · Codar 生信插件
结构生物学关注蛋白质、核酸及其复合物的三维构象,以及构象如何决定功能。常见数据是氨基酸序列、PDB 与冷冻电镜结构、配体小分子文件和分子动力学轨迹。在 Codar 里,这个方向覆盖结构预测与质量评估、结合口袋识别、分子对接、突变效应评估,以及蛋白设计和轨迹分析。
先说清是要单体结构、复合物界面、口袋定位还是设计新序列,不同目标后续取舍完全不同。
准备 FASTA 或已有结构并做预处理:补缺失残基、去水、拆链、统一编号与质子化状态。
可做单体、同源多聚体与复合物结构预测,也可检索结构数据库、冷冻电镜数据和结构相似序列。
看置信度与几何合理性,低置信区段多为柔性环或无序区,不宜直接当作刚性构象使用。
识别口袋后做配体对接与界面分析,按需做突变效应评估、逆折叠、结合蛋白设计或溶解度优化。
输出结构图、分析表和可复现脚本,参数与版本一并留存,便于补算和投稿时复核。
基于多序列比对的方法在有同源信息时精度较高,适合常规单体和同源复合物;蛋白语言模型类方法不依赖比对,速度快,适合大批量筛查或孤儿序列。设计序列和人工骨架常超出训练分布,结果要更谨慎看待。
pLDDT 反映残基局部构象的可信程度,PAE 反映残基对之间相对位置的不确定性,判断域间摆放和复合物界面时更看 PAE。低置信区段通常对应柔性环、末端或天然无序区,不等于预测错误,但不宜当作确定构象。
经典打分函数速度快,适合从大批化合物里排序富集;基于物理的自由能方法更接近实际,但计算量大,常用于少量候选的复核。打分值不是亲和力,跨靶点横向比较意义有限,姿势合理性要结合口袋形状和已知结构验证。
几何与能量方法可找出表面凹腔并给出体积、深度等描述,用于判断可成药性;界面分析则统计埋藏面积、氢键和盐桥。静态结构常漏掉隐蔽口袋,必要时结合多个构象或动力学轨迹一起看。
共 19 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「结构生物学」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
帮我预测这条蛋白序列的结构,评估置信度,并识别可能的配体结合口袋。
可以作为起点,但要先看口袋区域的置信度。主链折叠通常可靠,侧链朝向和柔性环的摆放不一定准,口袋处于低置信区时对接结果波动很大。实践中常先做结构预处理和质量评估,必要时取多个构象分别对接,再看结果是否一致。
单体主要看链内折叠,复合物还要判断两条链是否真的结合、以什么界面结合。界面的不确定性通常明显高于链内结构,残基对误差估计是关键依据。生物学上不互作的两条链也会被摆出一个界面,所以还要有共表达、互作实验或同源复合物等独立证据。
常见原因有三类:序列确实缺少同源信息;该区段天然无序或高度柔性;需要配体、金属离子或翻译后修饰才能稳定折叠。前者可换用不依赖比对的方法试试,后两者属于真实的构象多样性,更合适的做法是把该区段按柔性处理,而不是强行追求单一构象。