ESM-2 与 ESM3 等蛋白质语言模型
ESM-2 侧重表征与变体打分,可用掩码似然做零样本突变效应评分,也可取嵌入接下游分类器。ESM3 支持序列与结构的联合生成建模,适合设计类任务。语言模型打分反映进化约束,不区分功能增强还是丧失,判断表型方向仍要靠实验。
8个分析 Skill · Codar 生信插件
生物基础模型是在大规模序列或单细胞数据上预训练的通用模型,把 DNA、蛋白序列和细胞表达谱映射成可直接用于下游任务的表征。常见用法是零样本打分、提取嵌入做分类或微调到自己的小数据集。在 Codar 里,这个方向覆盖 Evo 2 基因组建模、scGPT 与 Nicheformer 细胞表征、ESM 蛋白嵌入与突变评分。
先区分是零样本打分、提取嵌入做下游模型,还是要微调。三者对数据量和算力的要求差别很大。
序列任务需规范的 FASTA 或区间坐标;单细胞任务需过完质控的表达矩阵,基因名要与模型词表对齐。
可用 ESM-2、ESM3 做蛋白任务,Evo 2 做基因组序列,scGPT、Nicheformer 做细胞表征。
先跑零样本看是否够用,再决定是否微调;显存不足时可缩短上下文或分块处理长序列。
用已知阳性阴性位点或已标注细胞类型做对照,确认打分方向和阈值,不要直接采信原始分数排序。
把嵌入或打分接回常规分析:降维可视化、富集分析、位点排序,并保留随机种子和模型版本。
ESM-2 侧重表征与变体打分,可用掩码似然做零样本突变效应评分,也可取嵌入接下游分类器。ESM3 支持序列与结构的联合生成建模,适合设计类任务。语言模型打分反映进化约束,不区分功能增强还是丧失,判断表型方向仍要靠实验。
这类模型在核苷酸级别建模,上下文窗口远大于早期序列模型,因此能覆盖启动子、增强子与基因间区的长程依赖,常用于非编码变异打分和调控元件识别。植物等非模式物种有专门的长上下文模型,跨物种直接套用效果通常下降。
scGPT 把细胞表示为基因表达的序列化输入,可做细胞类型注释、批次整合和扰动响应预测;Nicheformer 面向空间数据,表征里带入邻域信息,适合识别微环境相关的细胞状态。两者都对质控和基因命名敏感。
零样本不需要标签,适合快速筛查和没有训练数据的情形;线性探针用少量标签训练浅层分类器,稳定且不易过拟合,小样本时常是性价比最高的选择;全参数微调潜力最大,但需要较多标注和算力,样本少时容易把噪声学进去。
共 8 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「生物基础模型」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
帮我用 ESM-2 对这个蛋白的所有单点突变打分,找出可能影响功能的位点。
方向上常常相关,但不是一回事。模型打分本质是在衡量某个突变在进化上有多罕见,对破坏型突变识别较好,对轻微影响或功能获得型突变区分有限。实践中常把语言模型打分与结构稳定性评估、保守性分析一起看,再挑位点做实验验证。
各有适用场景。基础模型注释速度快、对批次相对稳健,适合初步分型和大规模数据;但遇到罕见细胞类型、非常规组织或模型训练数据没覆盖的物种,结果可能不准。常规做法是先用模型给一版注释,再用已知 marker 基因逐群核对,有分歧的群落单独检查。
取决于模型规模和任务。较小的蛋白嵌入模型和单细胞模型推理可以在常见的消费级显卡上完成,长上下文基因组模型和全参数微调通常需要更大显存。实践中可以缩短上下文、分块推理或降低精度来适配本地环境,必要时把计算放到服务器上执行。