STAR、HISAT2 与 Salmon
STAR 比对准确、对剪接位点敏感,但内存占用高;HISAT2 内存需求小,适合普通工作站;Salmon 直接估计转录本丰度,速度快。只做定量可选 Salmon,要做剪接、融合或 RNA 编辑分析则需保留基因组比对结果。
31个分析 Skill · Codar 生信插件
转录组学研究基因在不同条件下如何表达和加工,常见数据是 Bulk RNA-seq 的 FASTQ 或计数矩阵,也包括 small RNA、Ribo-seq、CLIP-seq 等测序。Codar 的转录组插件覆盖表达定量、差异表达、可变剪接、融合转录本、RNA 编辑与修饰、非编码 RNA、翻译组和转录因子活性推断。
整理样本表中的分组、批次和配对关系,确认单端或双端、是否链特异,这决定后续模型和定量参数。
检查测序质量、接头和 rRNA 残留,比对到参考基因组或做伪比对定量,注释版本要前后一致。
生成基因和转录本层面的计数矩阵,用样本相关性和 PCA 找出离群样本与批次效应。
按设计矩阵做差异表达,再视问题做可变剪接、融合转录本、RNA 编辑或非编码 RNA 分析。
推断转录因子活性,把差异基因列表转成调控层面的线索,必要时结合 Ribo-seq 看翻译变化。
输出火山图、热图、差异结果表和分析脚本,并记录软件版本与参数,便于写方法部分。
STAR 比对准确、对剪接位点敏感,但内存占用高;HISAT2 内存需求小,适合普通工作站;Salmon 直接估计转录本丰度,速度快。只做定量可选 Salmon,要做剪接、融合或 RNA 编辑分析则需保留基因组比对结果。
三者都以原始计数为输入,不能用 TPM 或 FPKM 代替。DESeq2 的离散度收缩在小样本时较稳健,edgeR 建模更灵活,limma-voom 适合样本量较大或协变量较多的设计。已知批次应写进模型。
rMATS 按外显子跳跃、内含子保留等事件类型比较组间差异;SUPPA2 基于转录本定量计算 PSI,运行快;leafcutter 从剪接读段聚类出发,不依赖注释,便于发现新剪接点。剪接分析对读长和深度更敏感。
两者都基于 STAR 的嵌合比对检测融合基因,是肿瘤 RNA-seq 的常用工具。不同工具的候选常有差异,有跨断点读段支持、且被多个工具检出的融合更可信,关键候选通常还需 RT-PCR 验证。
共 31 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「转录组学」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
读取 counts.csv 和 samples.csv,核对样本与分组,用 DESeq2 做差异表达分析,并输出火山图和差异基因表。
TPM 和 FPKM 对测序深度和基因长度做了标准化,适合展示或样本内比较;差异表达分析应使用原始 counts,交给 DESeq2、edgeR 等工具在模型里完成标准化。直接对 TPM 做 t 检验会忽略计数数据的方差特性。
只做基因水平的差异表达,常见经验是每个样本 2000 万到 3000 万条读段;要分析可变剪接、低丰度转录本或融合基因,一般需要更深的测序和双端读长。预算有限时,增加生物学重复通常比单纯加深度更有帮助。
如果批次与分组交叉分布,较稳妥的做法是在差异分析模型中把批次作为协变量;ComBat-seq 等方法校正后的矩阵更多用于可视化和聚类。若批次与分组完全重合,统计上无法区分两者,只能在实验设计阶段避免。