Codar
下载

57个分析 Skill · Codar 生信插件

基因组学 AI 分析

基因组学研究 DNA 序列层面的变异和基因组结构,常见数据是短读长 WGS、WES、靶向 panel,以及 PacBio、Nanopore 长读长测序。Codar 的这个插件覆盖 FASTQ 质控与修剪、读段比对、胚系小变异、结构变异与 CNV 检测、长读长分析、基因组从头组装与注释,以及 VCF 整理和功能注释。

基因组学能回答哪些研究问题

  • 这批外显子样本里有哪些可信的胚系 SNV 和 Indel?
  • 测序覆盖度和捕获效率是否达到变异检测的要求?
  • 样本基因组中有哪些大片段缺失、倒位或拷贝数变异?
  • 用长读长数据能否组装出连续性较好的新物种基因组?
  • 线粒体 DNA 上有哪些变异,异质性水平有多高?

基因组学分析流程

  1. 1

    原始数据质控

    统计碱基质量、接头和重复率,必要时修剪接头和低质量末端,多个样本的质控结果汇总到一份报告里。

  2. 2

    比对与整理

    把读段比对到 GRCh38 等参考基因组,排序、标记重复后生成 BAM 或 CRAM;参考版本要和后续注释保持一致。

  3. 3

    覆盖度评估

    统计平均深度、目标区域覆盖度和捕获效率,WES 和靶向测序要特别留意覆盖不足的外显子。

  4. 4

    变异检测

    检测胚系 SNV/Indel,按研究需要补充结构变异、CNV 和 LOH;长读长数据使用专门的比对和检测方法。

  5. 5

    过滤与样本核对

    对 VCF 规范化并做过滤或质量校准,检查 Ti/Tv、杂合比和样本一致性,排除样本混淆和污染。

  6. 6

    功能注释

    注释变异所在基因、功能后果和人群频率,输出过滤后的 VCF、变异表和可复现脚本。

常用方法与怎么选

BWA-MEM 与 minimap2

BWA-MEM 是 Illumina 短读长数据的常用比对工具;minimap2 更适合 PacBio、Nanopore 长读长和组装序列的比对。参考基因组版本及是否含 alt、decoy 序列,都会影响后续变异检测。

GATK HaplotypeCaller 与 DeepVariant

两者都常用于胚系 SNV/Indel 检测。GATK 流程成熟、文档完善,多样本可做联合基因分型;DeepVariant 基于深度学习,针对不同测序平台提供单独模型。重要结论可借助 GIAB 标准样本做基准评估。

Manta、Delly 与 Sniffles

短读长数据常用 Manta、Delly,依据异常配对读段和断裂读段识别结构变异,但对重复区域和大片段插入灵敏度有限;长读长数据常用 Sniffles 等工具,读段能跨越重复序列,插入和复杂重排检出更完整。

hifiasm、Flye 与 BUSCO

长读长从头组装中,hifiasm 常用于 PacBio HiFi 数据,Flye 对 Nanopore 等错误率较高的读段适用面较广。组装完成后通常用 BUSCO 评估基因完整性,并结合 N50 和污染检测判断组装质量。

需要准备的数据

  • 双端 FASTQ,或已比对的 BAM/CRAM 文件
  • 参考基因组版本(如 GRCh38)
  • WES 或靶向测序的捕获区域 BED 文件
  • 长读长数据:PacBio HiFi 或 Nanopore
  • 样本信息表:样本名、性别、分组或家系

能得到的结果

  • FASTQ 质控与多样本汇总报告
  • 排序去重后的 BAM/CRAM 与覆盖度统计
  • 过滤后的 VCF 和带功能注释的变异表
  • 结构变异、CNV 与 LOH 检测结果
  • 基因组组装序列、组装质控与基因注释
  • 可复现的分析脚本与参数记录

基因组学插件包含的分析能力

共 57 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • 测序读段比对
  • SAM、BAM与CRAM文件处理
  • FASTQ质量评估
  • 基因组结构与功能注释
  • 生殖系CNV检测
  • 杂合性缺失与拷贝中性LOH分析
  • 长读长测序质控
  • 线粒体变异与异质性分析
  • 多样本质控汇总
  • 测序读段修剪
  • 长读长串联重复位点分析
  • 胚系小变异检测
  • 结构变异检测
  • 靶向测序分析
  • 变异过滤与质量校准
  • WES分析
  • 短读长WGS分析
  • Nanopore碱基识别
  • 测序覆盖度与捕获效率评估
  • VCF质量统计与样本一致性
  • 长读长变异检测
  • 基因组从头组装与质控
  • 长读长从头组装
  • 跨物种基因注释投影
  • 基因组浏览器与轨道制作
  • 长读长序列比对
  • 泛基因组与共线性分析
  • 基因组污染检测
  • VCF规范化与整理
  • 变异功能注释

nf-core 标准流程(27 个)

  • nf-core-bamtofastq流程
  • nf-core-createpanelrefs流程
  • nf-core-deepvariant流程
  • nf-core-demultiplex流程
  • nf-core-denovohybrid流程
  • nf-core-detaxizer流程
  • nf-core-exoseq流程
  • nf-core-fastqrepair流程
  • nf-core-fastquorum流程
  • nf-core-genomeannotator流程
  • nf-core-genomeassembler流程
  • nf-core-genomeqc流程
  • nf-core-genomeskim流程
  • nf-core-isoseq流程
  • nf-core-kmermaid流程
  • nf-core-mitodetect流程
  • nf-core-multiplesequencealign流程
  • nf-core-nanoseq流程
  • nf-core-ncrnannotator流程
  • nf-core-neutronstar流程
  • nf-core-pacvar流程
  • nf-core-pairgenomealign流程
  • nf-core-pangenome流程
  • nf-core-readsimulator流程
  • nf-core-sarek流程
  • nf-core-seqinspector流程
  • nf-core-variantbenchmarking流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「基因组学」

    在插件页找到「基因组学」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我对这批全外显子测序数据做质控、比对和胚系变异检测,输出过滤后的 VCF 和质控汇总。

基因组学常见问题

WGS 和 WES 该怎么选?

WES 只测编码区,成本较低,目标区域深度高,适合寻找编码区变异;WGS 覆盖非编码区且覆盖更均匀,对结构变异和 CNV 检测更有利。预算允许且关注结构变异或调控区时,通常优先考虑 WGS。

全基因组测序需要多少测序深度?

人类胚系变异检测中,WGS 常见做法是平均 30× 左右,WES 目标区域平均深度通常在 100× 上下;检测嵌合变异或低频体细胞变异需要更高深度。除了平均深度,还要看覆盖均匀性和低覆盖区域的比例。

短读长和长读长测序有什么区别?

短读长准确率高、成本低,适合 SNV/Indel 检测和大样本队列;PacBio HiFi、Nanopore 等长读长能跨越重复序列,更适合结构变异、串联重复、单倍型分相和从头组装。实际研究中两者也常组合使用。

其他生信插件