Codar
下载

28个分析 Skill · Codar 生信插件

表观基因组学 AI 分析

表观基因组学研究不改变 DNA 序列却影响基因表达的调控层面,包括染色质开放、组蛋白修饰、DNA 甲基化和三维基因组结构,典型数据有 ATAC-seq、ChIP-seq、CUT&Tag、亚硫酸氢盐测序和 Hi-C。Codar 的这个插件覆盖峰识别与差异分析、基序与足迹、差异甲基化、增强子靶基因关联和 TAD 分析。

表观基因组学能回答哪些研究问题

  • 处理后哪些区域的染色质可及性发生了改变?
  • 差异开放区域富集了哪些转录因子的基序?
  • 肿瘤与癌旁组织之间有哪些差异甲基化区域?
  • 某个增强子可能调控的是哪个靶基因?
  • 疾病相关位点与候选基因是否落在同一个 TAD 内?

表观基因组学分析流程

  1. 1

    比对与去重

    检查测序质量后比对到参考基因组,去除 PCR 重复和低质量读段,ATAC-seq 还要看线粒体读段比例。

  2. 2

    信号质控

    评估片段长度分布、TSS 富集和 FRiP 等指标,先判断实验本身是否成功。

  3. 3

    峰识别

    按数据类型选择窄峰或宽峰模式,有 input 或 IgG 对照时一并纳入。

  4. 4

    差异分析

    在一致峰集上统计计数,按分组做差异可及性、差异结合或差异甲基化分析。

  5. 5

    调控解读

    做基序富集与足迹分析,把峰注释到邻近基因,并推断增强子与靶基因的关联。

  6. 6

    结果交付

    输出 bigWig 信号轨迹、峰文件、差异区域表、热图和分析脚本。

常用方法与怎么选

MACS2、SEACR 与 Genrich

MACS2 是 ChIP-seq 和 ATAC-seq 最常用的峰识别工具,支持窄峰和宽峰;SEACR 为背景低的 CUT&Tag 类数据设计;Genrich 常用于 ATAC-seq。H3K27me3 一般按宽峰处理。

DiffBind 与 csaw

DiffBind 在一致峰集上计数,再调用 DESeq2 或 edgeR 做差异结合分析,是常用选择;csaw 采用滑动窗口,不依赖预先识别的峰,更适合宽峰信号。两者都需要生物学重复,单样本对比只能做描述。

HOMER、chromVAR 与 TOBIAS

HOMER 常用于峰区域的已知基序和从头基序富集;chromVAR 在样本或单细胞层面估计各基序的可及性偏差;TOBIAS 利用 Tn5 切割模式做足迹分析,推测转录因子是否实际结合,对测序深度要求较高。

Bismark、DSS 与 minfi

Bismark 是亚硫酸氢盐测序常用的比对和甲基化提取工具;DSS、methylKit 用于识别差异甲基化区域;450K、EPIC 芯片通常用 minfi 或 SeSAMe 预处理。血液和组织样本还要考虑细胞组成的影响。

需要准备的数据

  • 原始 FASTQ 或已比对的 BAM 文件
  • 样本信息表:分组、重复、input 或 IgG 对照
  • 甲基化芯片的 IDAT 文件(如适用)
  • 参考基因组版本与基因注释
  • 或公开数据的 GEO、ENCODE 编号

能得到的结果

  • 比对与信号质控报告(TSS 富集、FRiP 等)
  • 峰文件与 bigWig 信号轨迹
  • 差异可及性或差异甲基化区域表
  • 转录因子基序富集与足迹结果
  • 峰注释、热图与信号 profile 图
  • A/B 区室、TAD 与染色质环结果

表观基因组学插件包含的分析能力

共 28 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • ATAC-seq染色质可及性分析
  • 序列驱动的调控效应预测
  • 组蛋白ChIP-seq分析
  • 染色质环与增强子-启动子互作
  • CUT&RUN与CUT&Tag分析
  • 差异甲基化区域识别
  • DNase-seq染色质可及性分析
  • 增强子与靶基因关联
  • 增强子与超级增强子识别
  • 转录因子基序与足迹分析
  • Hi-C数据处理与质量控制
  • 亚硫酸氢盐测序与DNA甲基化分析
  • 甲基化芯片预处理与细胞组成校正
  • 染色质状态与等位基因特异分析
  • 染色质区室与TAD分析

nf-core 标准流程(13 个)

  • nf-core-atacseq流程
  • nf-core-callingcards流程
  • nf-core-chipseq流程
  • nf-core-cutandrun流程
  • nf-core-epigenomesegmentation流程
  • nf-core-hic流程
  • nf-core-hicar流程
  • nf-core-methylarray流程
  • nf-core-methylong流程
  • nf-core-methylseq流程
  • nf-core-mnaseseq流程
  • nf-core-sammyseq流程
  • nf-core-ssds流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「表观基因组学」

    在插件页找到「表观基因组学」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我分析这组 ATAC-seq 数据,比较处理组和对照组的差异可及性区域,并做转录因子基序富集。

表观基因组学常见问题

CUT&Tag 和 ChIP-seq 该怎么选?

CUT&Tag 和 CUT&RUN 在原位切割目标区域,背景低、所需细胞少,适合样本有限或研究组蛋白修饰;ChIP-seq 方法成熟,公开数据和抗体资料更多。部分转录因子在 CUT&Tag 中信号不稳定,选择前最好查阅已有数据。

ATAC-seq 需要生物学重复吗?

需要。差异可及性分析和 ChIP-seq 一样依赖重复来估计组内变异,通常建议每组至少 2 到 3 个生物学重复,ENCODE 的数据标准也要求重复间有一致性。没有重复时只能做描述性比较,结论需要谨慎。

Hi-C 数据一般分析哪些结构?

通常从三个尺度解读:A/B 区室反映开放与紧缩染色质的大尺度分隔,TAD 是内部互作频繁的结构域,染色质环对应增强子与启动子等特定位点之间的接触。能分析到哪个尺度取决于测序深度,染色质环的检测对深度要求最高。

其他生信插件