Codar
下载

8个分析 Skill · Codar 生信插件

生物基础模型 AI 分析

生物基础模型是在大规模序列或单细胞数据上预训练的通用模型,把 DNA、蛋白序列和细胞表达谱映射成可直接用于下游任务的表征。常见用法是零样本打分、提取嵌入做分类或微调到自己的小数据集。在 Codar 里,这个方向覆盖 Evo 2 基因组建模、scGPT 与 Nicheformer 细胞表征、ESM 蛋白嵌入与突变评分。

生物基础模型能回答哪些研究问题

  • 哪些点突变可能影响蛋白功能?
  • 基础模型注释单细胞类型比传统方法好吗?
  • 非编码区变异的致病性怎么预测?
  • 蛋白嵌入能否替代序列比对做相似性判断?
  • 空间转录组数据怎么做细胞表征?

生物基础模型分析流程

  1. 1

    确定任务类型

    先区分是零样本打分、提取嵌入做下游模型,还是要微调。三者对数据量和算力的要求差别很大。

  2. 2

    准备输入数据

    序列任务需规范的 FASTA 或区间坐标;单细胞任务需过完质控的表达矩阵,基因名要与模型词表对齐。

  3. 3

    选择模型

    可用 ESM-2、ESM3 做蛋白任务,Evo 2 做基因组序列,scGPT、Nicheformer 做细胞表征。

  4. 4

    推理或微调

    先跑零样本看是否够用,再决定是否微调;显存不足时可缩短上下文或分块处理长序列。

  5. 5

    校准与验证

    用已知阳性阴性位点或已标注细胞类型做对照,确认打分方向和阈值,不要直接采信原始分数排序。

  6. 6

    整合与出图

    把嵌入或打分接回常规分析:降维可视化、富集分析、位点排序,并保留随机种子和模型版本。

常用方法与怎么选

ESM-2 与 ESM3 等蛋白质语言模型

ESM-2 侧重表征与变体打分,可用掩码似然做零样本突变效应评分,也可取嵌入接下游分类器。ESM3 支持序列与结构的联合生成建模,适合设计类任务。语言模型打分反映进化约束,不区分功能增强还是丧失,判断表型方向仍要靠实验。

Evo 2 等长上下文基因组模型

这类模型在核苷酸级别建模,上下文窗口远大于早期序列模型,因此能覆盖启动子、增强子与基因间区的长程依赖,常用于非编码变异打分和调控元件识别。植物等非模式物种有专门的长上下文模型,跨物种直接套用效果通常下降。

scGPT、Nicheformer 等单细胞基础模型

scGPT 把细胞表示为基因表达的序列化输入,可做细胞类型注释、批次整合和扰动响应预测;Nicheformer 面向空间数据,表征里带入邻域信息,适合识别微环境相关的细胞状态。两者都对质控和基因命名敏感。

零样本、微调与线性探针的取舍

零样本不需要标签,适合快速筛查和没有训练数据的情形;线性探针用少量标签训练浅层分类器,稳定且不易过拟合,小样本时常是性价比最高的选择;全参数微调潜力最大,但需要较多标注和算力,样本少时容易把噪声学进去。

需要准备的数据

  • 蛋白质 FASTA 序列与突变位点表
  • 基因组序列或变异位点坐标
  • 单细胞表达矩阵(h5ad / mtx)
  • 空间转录组表达与坐标文件
  • 下游任务的标注标签或表型

能得到的结果

  • 突变效应零样本评分与排序
  • 蛋白或细胞的嵌入矩阵
  • 细胞类型注释与置信度
  • 非编码变异的功能影响打分
  • 降维可视化与聚类结果
  • 模型配置与可复现脚本

生物基础模型插件包含的分析能力

共 8 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • Evo 2基因组序列建模
  • scGPT单细胞表征与注释
  • Nicheformer空间细胞表征
  • ESM3蛋白质生成与结构建模
  • 生物医学时间序列预测
  • MGM微生物组基础模型
  • ESM-2蛋白质嵌入与突变评分
  • 植物长上下文基因组序列建模

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「生物基础模型」

    在插件页找到「生物基础模型」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我用 ESM-2 对这个蛋白的所有单点突变打分,找出可能影响功能的位点。

生物基础模型常见问题

蛋白质语言模型的突变打分和实验测得的影响一致吗?

方向上常常相关,但不是一回事。模型打分本质是在衡量某个突变在进化上有多罕见,对破坏型突变识别较好,对轻微影响或功能获得型突变区分有限。实践中常把语言模型打分与结构稳定性评估、保守性分析一起看,再挑位点做实验验证。

用 scGPT 注释细胞类型比传统 marker 注释更好吗?

各有适用场景。基础模型注释速度快、对批次相对稳健,适合初步分型和大规模数据;但遇到罕见细胞类型、非常规组织或模型训练数据没覆盖的物种,结果可能不准。常规做法是先用模型给一版注释,再用已知 marker 基因逐群核对,有分歧的群落单独检查。

基础模型需要什么样的算力,能不能在本地跑?

取决于模型规模和任务。较小的蛋白嵌入模型和单细胞模型推理可以在常见的消费级显卡上完成,长上下文基因组模型和全参数微调通常需要更大显存。实践中可以缩短上下文、分块推理或降低精度来适配本地环境,必要时把计算放到服务器上执行。

其他生信插件