Codar
下载

32个分析 Skill · Codar 生信插件

群体遗传学 AI 分析

群体遗传学研究遗传变异在人群中的分布,以及变异与性状、疾病之间的关联,典型数据是芯片或测序得到的个体基因型和公开的 GWAS 汇总统计。Codar 的这个插件覆盖 GWAS 与数据质控、基因型填充、精细定位与共定位、孟德尔随机化、PRS、TWAS、遗传力估计、群体结构和自然选择分析。

群体遗传学能回答哪些研究问题

  • BMI 升高是否会增加 2 型糖尿病的发病风险?
  • 这个 GWAS 显著位点背后最可能的效应基因是哪个?
  • 两个性状的关联信号是否由同一个因果变异驱动?
  • 我的样本存在群体分层或混合祖源吗?
  • 这个性状的 SNP 遗传力有多高,和哪些性状遗传相关?

群体遗传学分析流程

  1. 1

    数据质控

    个体基因型按缺失率、MAF、HWE 和亲缘关系做样本与位点质控;汇总统计先统一基因组版本、等位基因方向和列格式。

  2. 2

    填充与群体结构

    按需做相位推断和基因型填充,用主成分或祖源分析评估群体分层,结果作为关联分析的协变量。

  3. 3

    关联分析

    做 GWAS 或稀有变异关联分析,检查 QQ 图和基因组膨胀系数,输出曼哈顿图和显著位点表。

  4. 4

    位点解释

    对显著位点做精细定位、共定位和位点到基因排序,结合分子 QTL 与 TWAS 判断可能的效应基因。

  5. 5

    因果与预测

    按研究问题做孟德尔随机化、遗传相关或 PRS 构建,并配套敏感性分析和独立样本验证。

常用方法与怎么选

PLINK、REGENIE 与 SAIGE

PLINK 常用于基因型质控和常规关联分析;REGENIE 和 SAIGE 基于混合模型思路,能处理样本亲缘关系和群体结构,适合大规模队列。病例对照比例严重不平衡的二分类性状,常选用 SAIGE 控制假阳性。

TwoSampleMR 与 MR 敏感性分析

两样本 MR 常用 TwoSampleMR 等 R 包,以 IVW 为主分析,再用 MR-Egger、加权中位数、MR-PRESSO 检查水平多效性。工具变量需满足相关性、独立性、排他性假设,弱工具和样本重叠会引起偏倚。

SuSiE、FINEMAP 与 coloc

精细定位常用 SuSiE 或 FINEMAP,给出每个变异的后验包含概率和可信集;coloc 用于判断两个性状(如 GWAS 与 eQTL)在同一区域是否共享因果变异。三者都需要与汇总统计人群匹配的 LD 参考。

LDSC、PRSice 与 PRS-CS

LD 分数回归(LDSC)常用来估计 SNP 遗传力和遗传相关,并区分多基因信号与群体分层造成的膨胀。PRS 构建中,PRSice 采用聚类剪枝加阈值筛选,PRS-CS 采用贝叶斯收缩,两者都应在独立样本中评估预测效果。

需要准备的数据

  • PLINK 或 VCF 格式的个体基因型
  • 表型与协变量表:年龄、性别、主成分等
  • 公开或自有的 GWAS 汇总统计
  • 与研究人群祖源匹配的 LD 参考面板
  • eQTL、pQTL 等分子 QTL 数据(可选)

能得到的结果

  • 基因型质控报告与群体结构主成分图
  • 曼哈顿图、QQ 图和显著位点表
  • 精细定位可信集与共定位后验概率
  • 孟德尔随机化效应估计与敏感性分析图
  • PRS 评分及预测效果评估
  • 遗传力、遗传相关结果与可复现脚本

群体遗传学插件包含的分析能力

共 32 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • 基因渗入与群体混合检测
  • 群体等位基因频率分析
  • 基因型与表型关联分析质控
  • GWAS关联分析
  • GWAS荟萃与跨祖源分析
  • GWAS汇总统计质控与标准化
  • 连锁不平衡与单倍型分析
  • 遗传力、遗传相关与Genomic SEM分析
  • 系统发育树构建与评估
  • 群体结构与祖源分析
  • PRS多基因风险评分
  • 分子QTL与药物靶点因果优先排序
  • 稀有变异关联分析
  • 自然选择信号分析
  • 孟德尔随机化因果分析
  • 基因型填充与相位推断
  • TWAS转录组关联分析
  • GWAS功能解释
  • PheWAS全表型关联分析
  • GWAS位点到基因优先排序
  • 遗传共定位分析
  • GWAS精细定位

nf-core 标准流程(10 个)

  • nf-core-eager流程
  • nf-core-genephylomodeler流程
  • nf-core-genomicrelatedness流程
  • nf-core-gwas流程
  • nf-core-phaseimpute流程
  • nf-core-phyloplace流程
  • nf-core-radseq流程
  • nf-core-rarevariantburden流程
  • nf-core-reportho流程
  • nf-core-variantcatalogue流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「群体遗传学」

    在插件页找到「群体遗传学」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我用这两份 GWAS 汇总统计做两样本孟德尔随机化,评估 BMI 对 2 型糖尿病的因果效应,并做敏感性分析。

群体遗传学常见问题

孟德尔随机化的工具变量怎么筛选?

常见做法是选取与暴露达到全基因组显著(P<5×10⁻⁸)的 SNP,按 LD 做 clumping 去除相关位点,计算 F 统计量排除弱工具,再对齐暴露和结局的效应等位基因,并处理回文 SNP。

GWAS 需要多少样本量?

没有统一门槛,取决于位点效应大小、等位基因频率和性状的遗传结构。复杂性状单个位点效应通常很小,往往需要较大样本才有足够检验效能。样本有限时可先做效能估算,或通过荟萃分析合并多个队列。

共定位分析和孟德尔随机化有什么区别?

共定位回答两个性状在某个区域是否共享同一个因果变异,不估计效应大小;孟德尔随机化把遗传变异当作工具变量,估计暴露对结局的因果效应。两者常配合使用,例如用共定位支持药物靶点 MR 的结论。

其他生信插件