Codar
下载

39个分析 Skill · Codar 生信插件

单细胞与虚拟细胞 AI 分析

单细胞研究在单个细胞分辨率上刻画细胞类型、状态和相互作用,常见数据是 scRNA-seq、scATAC-seq 和 CITE-seq 计数矩阵。Codar 的这个插件覆盖质控、双细胞与环境 RNA 校正、批次整合、聚类注释、轨迹与 RNA 速度、细胞通讯,以及 Perturb-seq 和虚拟敲除预测。

单细胞与虚拟细胞能回答哪些研究问题

  • 肿瘤样本里有哪些免疫细胞亚群,比例在组间如何变化?
  • 刺激后哪些细胞类型的基因表达响应最强?
  • 分化过程的起点、分支和终末状态分别是什么?
  • 肿瘤细胞与巨噬细胞之间有哪些配体-受体通讯?
  • 敲除某个基因后,细胞状态可能向哪个方向偏移?

单细胞与虚拟细胞分析流程

  1. 1

    读取与质控

    读取 10x 输出、h5ad 或 Seurat 对象,按 UMI 数、基因数和线粒体比例过滤,阈值参考样本分布来定。

  2. 2

    去除技术噪声

    识别双细胞,校正环境 RNA 污染;多个样本时先评估批次效应,再决定是否整合及用哪种方法。

  3. 3

    降维与聚类

    选取高变基因,做 PCA、邻接图聚类和 UMAP,聚类分辨率要结合标记基因反复确认。

  4. 4

    细胞类型注释

    结合已知标记基因和参考图谱映射注释细胞类型,对难以判断的簇保留原标签再核查。

  5. 5

    下游分析

    按研究问题做差异丰度、伪时间轨迹、RNA 速度、细胞通讯或扰动效应分析。

  6. 6

    结果交付

    输出 UMAP、点图、细胞比例图和通讯网络图,以及带注释的 h5ad 文件和分析脚本。

常用方法与怎么选

Seurat 与 Scanpy

两者是最常用的单细胞分析框架,分别基于 R 和 Python,覆盖质控、标准化、聚类和可视化。选哪个主要看团队习惯和下游工具;两种格式可以互转,但转换后要核对元数据和降维结果是否完整。

Harmony、scVI 与 BBKNN

Harmony 在 PCA 空间校正批次,速度快;scVI 用深度生成模型直接建模原始计数,适合样本多、批次复杂的数据;BBKNN 通过调整邻接图整合。整合过度会抹掉真实差异,校正后要检查已知细胞类型是否仍能区分。

CellTypist、SingleR 与参考映射

CellTypist 用预训练模型自动注释,免疫细胞模型较完善;SingleR 把细胞与带标签的参考表达谱比较;Seurat 参考映射可把数据投射到已有图谱。自动注释适合作起点,最终标签仍要用标记基因核对。

CellChat、CellPhoneDB 与 NicheNet

CellChat 和 CellPhoneDB 根据配体-受体对的表达推断细胞间通讯;NicheNet 进一步把配体与靶细胞的下游基因变化联系起来。这些结果基于表达推断,不等于实际的蛋白互作,需要空间数据或实验支持。

需要准备的数据

  • Cell Ranger 输出目录或 mtx、h5 计数矩阵
  • 已有的 h5ad 或 Seurat RDS 对象
  • 样本元数据:来源、分组、批次
  • 可选:参考图谱或已知标记基因列表
  • 或公开数据的 GEO 编号

能得到的结果

  • 质控报告与过滤前后的细胞数统计
  • 聚类与细胞类型注释的 UMAP 图
  • 各簇标记基因表及点图、热图
  • 组间细胞比例与差异表达结果
  • 轨迹、RNA 速度或细胞通讯分析图
  • 带注释的 h5ad 文件与分析脚本

单细胞与虚拟细胞插件包含的分析能力

共 39 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • 单细胞CNV推断
  • scRNA-seq预处理
  • scATAC-seq预处理
  • 单细胞多组学预处理与整合
  • 单细胞批次整合
  • 双细胞检测
  • 环境RNA污染校正
  • 线粒体比例质控
  • 单细胞降维与聚类
  • 单细胞类型注释与参考映射
  • 细胞状态与周期评分
  • RNA速度与细胞命运推断
  • 单细胞轨迹与伪时间分析
  • 单细胞细胞通讯分析
  • Perturb-seq扰动分析
  • 虚拟敲除与扰动预测
  • 单细胞药物响应模拟
  • CITE-seq分析
  • 单细胞转座元件表达分析
  • 代谢物介导的细胞通讯分析
  • 分泌蛋白活性推断
  • 单细胞调控网络分析
  • 单细胞跨队列整合与元分析
  • scVI单细胞概率建模
  • 单细胞差异丰度分析
  • 单细胞公共数据检索
  • 单细胞可变剪接分析
  • 单细胞数据格式与读写
  • 单细胞遗传变异检测
  • 单细胞分阶段分析工作流
  • 转录组状态转换的逆向扰动推断

nf-core 标准流程(8 个)

  • nf-core-hadge流程
  • nf-core-marsseq流程
  • nf-core-pixelator流程
  • nf-core-scdownstream流程
  • nf-core-scflow流程
  • nf-core-scnanoseq流程
  • nf-core-scrnaseq流程
  • nf-core-smartseq2流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「单细胞与虚拟细胞」

    在插件页找到「单细胞与虚拟细胞」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我基于 GSE96583 单细胞转录组数据,解析 IFN-β 刺激后 PBMC 的细胞类型特异性响应。

单细胞与虚拟细胞常见问题

单细胞差异表达该用单个细胞还是 pseudobulk?

比较不同样本组之间的差异时,通常建议先按样本和细胞类型聚合成 pseudobulk,再用 DESeq2 或 edgeR 分析。把每个细胞当作独立样本会忽略样本间变异,p 值偏小、假阳性偏多。单细胞层面的检验更适合找各簇的标记基因。

单细胞数据需要去除双细胞和环境 RNA 吗?

通常需要。双细胞会形成看似处于中间状态的假簇,常用 scDblFinder、DoubletFinder 识别;环境 RNA 会让本不表达的基因出现在多种细胞中,可用 SoupX 或 CellBender 校正。这两步一般放在聚类和注释之前。

RNA 速度和伪时间分析有什么区别?

伪时间分析(如 Monocle3、Slingshot)按表达相似性给细胞排序,起点需要指定,本身不判断方向;RNA 速度(如 scVelo)利用未剪接与已剪接读段的比例估计变化方向,对变化较快的分化过程更有参考价值。

相关实践案例

其他生信插件