BWA-MEM 与 minimap2
BWA-MEM 是 Illumina 短读长数据的常用比对工具;minimap2 更适合 PacBio、Nanopore 长读长和组装序列的比对。参考基因组版本及是否含 alt、decoy 序列,都会影响后续变异检测。
57个分析 Skill · Codar 生信插件
基因组学研究 DNA 序列层面的变异和基因组结构,常见数据是短读长 WGS、WES、靶向 panel,以及 PacBio、Nanopore 长读长测序。Codar 的这个插件覆盖 FASTQ 质控与修剪、读段比对、胚系小变异、结构变异与 CNV 检测、长读长分析、基因组从头组装与注释,以及 VCF 整理和功能注释。
统计碱基质量、接头和重复率,必要时修剪接头和低质量末端,多个样本的质控结果汇总到一份报告里。
把读段比对到 GRCh38 等参考基因组,排序、标记重复后生成 BAM 或 CRAM;参考版本要和后续注释保持一致。
统计平均深度、目标区域覆盖度和捕获效率,WES 和靶向测序要特别留意覆盖不足的外显子。
检测胚系 SNV/Indel,按研究需要补充结构变异、CNV 和 LOH;长读长数据使用专门的比对和检测方法。
对 VCF 规范化并做过滤或质量校准,检查 Ti/Tv、杂合比和样本一致性,排除样本混淆和污染。
注释变异所在基因、功能后果和人群频率,输出过滤后的 VCF、变异表和可复现脚本。
BWA-MEM 是 Illumina 短读长数据的常用比对工具;minimap2 更适合 PacBio、Nanopore 长读长和组装序列的比对。参考基因组版本及是否含 alt、decoy 序列,都会影响后续变异检测。
两者都常用于胚系 SNV/Indel 检测。GATK 流程成熟、文档完善,多样本可做联合基因分型;DeepVariant 基于深度学习,针对不同测序平台提供单独模型。重要结论可借助 GIAB 标准样本做基准评估。
短读长数据常用 Manta、Delly,依据异常配对读段和断裂读段识别结构变异,但对重复区域和大片段插入灵敏度有限;长读长数据常用 Sniffles 等工具,读段能跨越重复序列,插入和复杂重排检出更完整。
长读长从头组装中,hifiasm 常用于 PacBio HiFi 数据,Flye 对 Nanopore 等错误率较高的读段适用面较广。组装完成后通常用 BUSCO 评估基因完整性,并结合 N50 和污染检测判断组装质量。
共 57 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「基因组学」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
帮我对这批全外显子测序数据做质控、比对和胚系变异检测,输出过滤后的 VCF 和质控汇总。
WES 只测编码区,成本较低,目标区域深度高,适合寻找编码区变异;WGS 覆盖非编码区且覆盖更均匀,对结构变异和 CNV 检测更有利。预算允许且关注结构变异或调控区时,通常优先考虑 WGS。
人类胚系变异检测中,WGS 常见做法是平均 30× 左右,WES 目标区域平均深度通常在 100× 上下;检测嵌合变异或低频体细胞变异需要更高深度。除了平均深度,还要看覆盖均匀性和低覆盖区域的比例。
短读长准确率高、成本低,适合 SNV/Indel 检测和大样本队列;PacBio HiFi、Nanopore 等长读长能跨越重复序列,更适合结构变异、串联重复、单倍型分相和从头组装。实际研究中两者也常组合使用。