Codar
下载

31个分析 Skill · Codar 生信插件

转录组学 AI 分析

转录组学研究基因在不同条件下如何表达和加工,常见数据是 Bulk RNA-seq 的 FASTQ 或计数矩阵,也包括 small RNA、Ribo-seq、CLIP-seq 等测序。Codar 的转录组插件覆盖表达定量、差异表达、可变剪接、融合转录本、RNA 编辑与修饰、非编码 RNA、翻译组和转录因子活性推断。

转录组学能回答哪些研究问题

  • 处理组和对照组之间有哪些基因显著上调或下调?
  • 药物处理后哪些外显子跳跃或内含子保留事件发生了改变?
  • 肿瘤 RNA-seq 中能否检出有支持证据的融合转录本?
  • 哪些转录因子的活性在两种条件之间发生了变化?
  • 转录水平的变化是否同样体现在翻译效率上?

转录组学分析流程

  1. 1

    核对实验设计

    整理样本表中的分组、批次和配对关系,确认单端或双端、是否链特异,这决定后续模型和定量参数。

  2. 2

    质控与比对

    检查测序质量、接头和 rRNA 残留,比对到参考基因组或做伪比对定量,注释版本要前后一致。

  3. 3

    表达定量

    生成基因和转录本层面的计数矩阵,用样本相关性和 PCA 找出离群样本与批次效应。

  4. 4

    差异与专项分析

    按设计矩阵做差异表达,再视问题做可变剪接、融合转录本、RNA 编辑或非编码 RNA 分析。

  5. 5

    调控层面解读

    推断转录因子活性,把差异基因列表转成调控层面的线索,必要时结合 Ribo-seq 看翻译变化。

  6. 6

    整理交付

    输出火山图、热图、差异结果表和分析脚本,并记录软件版本与参数,便于写方法部分。

常用方法与怎么选

STAR、HISAT2 与 Salmon

STAR 比对准确、对剪接位点敏感,但内存占用高;HISAT2 内存需求小,适合普通工作站;Salmon 直接估计转录本丰度,速度快。只做定量可选 Salmon,要做剪接、融合或 RNA 编辑分析则需保留基因组比对结果。

DESeq2、edgeR 与 limma-voom

三者都以原始计数为输入,不能用 TPM 或 FPKM 代替。DESeq2 的离散度收缩在小样本时较稳健,edgeR 建模更灵活,limma-voom 适合样本量较大或协变量较多的设计。已知批次应写进模型。

rMATS、SUPPA2 与 leafcutter

rMATS 按外显子跳跃、内含子保留等事件类型比较组间差异;SUPPA2 基于转录本定量计算 PSI,运行快;leafcutter 从剪接读段聚类出发,不依赖注释,便于发现新剪接点。剪接分析对读长和深度更敏感。

STAR-Fusion 与 Arriba

两者都基于 STAR 的嵌合比对检测融合基因,是肿瘤 RNA-seq 的常用工具。不同工具的候选常有差异,有跨断点读段支持、且被多个工具检出的融合更可信,关键候选通常还需 RT-PCR 验证。

需要准备的数据

  • 原始 FASTQ 文件或已生成的基因计数矩阵
  • 样本信息表:分组、批次、配对关系
  • 参考基因组与注释版本,如 GRCh38 与 GENCODE
  • 或公开数据的 GEO、SRA 编号

能得到的结果

  • 基因与转录本表达矩阵(counts、TPM)
  • 差异表达结果表及火山图、热图
  • 样本 PCA 与相关性质控图
  • 可变剪接事件与融合转录本候选列表
  • 转录因子活性推断结果
  • 可复现的分析脚本与参数记录

转录组学插件包含的分析能力

共 31 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • 转录与翻译调控元件分析
  • 可变剪接分析
  • Bulk RNA-seq差异表达分析
  • 融合转录本检测
  • RNA修饰位点分析
  • 非编码RNA分析
  • CLIP-seq与RBP结合分析
  • Ribo-seq翻译组分析
  • RNA编辑检测
  • RNA-seq表达定量
  • 转录因子活性推断
  • 转录本组装

nf-core 标准流程(19 个)

  • nf-core-alleleexpression流程
  • nf-core-cageseq流程
  • nf-core-circrna流程
  • nf-core-clipseq流程
  • nf-core-dartseq流程
  • nf-core-denovotranscript流程
  • nf-core-lncpipe流程
  • nf-core-nanostring流程
  • nf-core-nascent流程
  • nf-core-riboseq流程
  • nf-core-rnafusion流程
  • nf-core-rnaseq流程
  • nf-core-rnasplice流程
  • nf-core-rnastructurome流程
  • nf-core-rnavar流程
  • nf-core-slamseq流程
  • nf-core-smrnaseq流程
  • nf-core-stableexpression流程
  • nf-core-tfactivity流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「转录组学」

    在插件页找到「转录组学」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
读取 counts.csv 和 samples.csv,核对样本与分组,用 DESeq2 做差异表达分析,并输出火山图和差异基因表。

转录组学常见问题

TPM、FPKM 和 counts 有什么区别,差异分析该用哪个?

TPM 和 FPKM 对测序深度和基因长度做了标准化,适合展示或样本内比较;差异表达分析应使用原始 counts,交给 DESeq2、edgeR 等工具在模型里完成标准化。直接对 TPM 做 t 检验会忽略计数数据的方差特性。

RNA-seq 测序深度多少够用?

只做基因水平的差异表达,常见经验是每个样本 2000 万到 3000 万条读段;要分析可变剪接、低丰度转录本或融合基因,一般需要更深的测序和双端读长。预算有限时,增加生物学重复通常比单纯加深度更有帮助。

RNA-seq 的批次效应怎么处理?

如果批次与分组交叉分布,较稳妥的做法是在差异分析模型中把批次作为协变量;ComBat-seq 等方法校正后的矩阵更多用于可视化和聚类。若批次与分组完全重合,统计上无法区分两者,只能在实验设计阶段避免。

相关实践案例

其他生信插件