QIIME 2 与 DADA2
扩增子分析的常用组合。DADA2 用错误模型降噪得到 ASV,可分辨单碱基差异;QIIME 2 提供从导入、降噪、注释到多样性分析的完整框架。16S 注释常用 SILVA 或 GTDB,ITS 常用 UNITE 数据库。
36个分析 Skill · Codar 生信插件
微生物组研究关心一个环境或宿主部位里有哪些微生物、各占多少、具备什么功能。常见数据是 16S/ITS 扩增子测序和宏基因组鸟枪法测序。这个插件在 Codar 里覆盖扩增子分析、物种分类与丰度估计、组装与 MAG 重建、功能组成、多样性和差异丰度、耐药基因、生物合成基因簇以及菌株追踪。
收集 FASTQ 或 SRA 编号,整理分组、采样部位、时间点等元数据,确认引物区段和测序平台。
去除接头和低质量序列;宏基因组样本需比对宿主基因组去除宿主读段,扩增子需切除引物。
扩增子用 ASV 降噪并注释分类,宏基因组用基于标记基因或 k-mer 的方法估计各物种丰度。
计算 α、β 多样性并做组间检验;差异丰度要选能处理成分数据的方法,并校正混杂因素。
按需做功能组成、耐药基因、生物合成基因簇分析,或组装并分箱得到 MAG 后评估质量。
输出丰度表、多样性图、差异结果、报告和可复现脚本,注明数据库版本。
扩增子分析的常用组合。DADA2 用错误模型降噪得到 ASV,可分辨单碱基差异;QIIME 2 提供从导入、降噪、注释到多样性分析的完整框架。16S 注释常用 SILVA 或 GTDB,ITS 常用 UNITE 数据库。
宏基因组物种分类的两类思路。Kraken2 基于 k-mer 匹配,速度快,覆盖面取决于数据库,常配合 Bracken 重估丰度;MetaPhlAn 基于物种特异标记基因,假阳性较少,但检测不到库外物种。
用于组装和分箱重建 MAG。MEGAHIT 内存占用低,适合大样本组装;MetaBAT2 按序列组成和覆盖度分箱;CheckM 评估完整度与污染度。MIMAG 标准中高质量 MAG 需完整度 >90%、污染度 <5%。
微生物组数据是成分数据,直接对相对丰度做 Wilcoxon 检验容易出现假阳性。ANCOM-BC 和 ALDEx2 从成分数据角度建模,MaAsLin2 便于纳入协变量。各方法结果常不一致,可报告多种方法的交集。
共 36 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「宏基因组与微生物组」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
帮我分析这批 16S 扩增子测序数据,比较两组的 α 和 β 多样性,并找出差异丰度的菌属。
16S 成本低、对宿主污染不敏感,适合大样本量的群落组成和多样性研究,但通常只能稳定分到属水平,功能只能预测。宏基因组能分到种甚至菌株,还能直接分析功能基因和耐药基因,代价是测序量和成本更高,宿主含量高的样本还需足够深度。
OTU 按 97% 等相似度阈值把序列聚类,结果依赖数据集和阈值;ASV 通过降噪得到精确序列,可区分单碱基差异,不同研究间可以直接合并比较。目前新研究多采用 ASV,分析旧数据或与既往结果对照时仍会遇到 OTU。
这一点存在争议。稀释抽平能消除测序深度对 α 多样性的影响,但会丢弃数据;差异丰度分析一般不建议抽平,而是用模型处理文库大小。常见做法是 α 多样性用抽平或稀释曲线确认深度足够,差异分析使用原始计数配合相应方法。