PLINK、REGENIE 与 SAIGE
PLINK 常用于基因型质控和常规关联分析;REGENIE 和 SAIGE 基于混合模型思路,能处理样本亲缘关系和群体结构,适合大规模队列。病例对照比例严重不平衡的二分类性状,常选用 SAIGE 控制假阳性。
32个分析 Skill · Codar 生信插件
群体遗传学研究遗传变异在人群中的分布,以及变异与性状、疾病之间的关联,典型数据是芯片或测序得到的个体基因型和公开的 GWAS 汇总统计。Codar 的这个插件覆盖 GWAS 与数据质控、基因型填充、精细定位与共定位、孟德尔随机化、PRS、TWAS、遗传力估计、群体结构和自然选择分析。
个体基因型按缺失率、MAF、HWE 和亲缘关系做样本与位点质控;汇总统计先统一基因组版本、等位基因方向和列格式。
按需做相位推断和基因型填充,用主成分或祖源分析评估群体分层,结果作为关联分析的协变量。
做 GWAS 或稀有变异关联分析,检查 QQ 图和基因组膨胀系数,输出曼哈顿图和显著位点表。
对显著位点做精细定位、共定位和位点到基因排序,结合分子 QTL 与 TWAS 判断可能的效应基因。
按研究问题做孟德尔随机化、遗传相关或 PRS 构建,并配套敏感性分析和独立样本验证。
PLINK 常用于基因型质控和常规关联分析;REGENIE 和 SAIGE 基于混合模型思路,能处理样本亲缘关系和群体结构,适合大规模队列。病例对照比例严重不平衡的二分类性状,常选用 SAIGE 控制假阳性。
两样本 MR 常用 TwoSampleMR 等 R 包,以 IVW 为主分析,再用 MR-Egger、加权中位数、MR-PRESSO 检查水平多效性。工具变量需满足相关性、独立性、排他性假设,弱工具和样本重叠会引起偏倚。
精细定位常用 SuSiE 或 FINEMAP,给出每个变异的后验包含概率和可信集;coloc 用于判断两个性状(如 GWAS 与 eQTL)在同一区域是否共享因果变异。三者都需要与汇总统计人群匹配的 LD 参考。
LD 分数回归(LDSC)常用来估计 SNP 遗传力和遗传相关,并区分多基因信号与群体分层造成的膨胀。PRS 构建中,PRSice 采用聚类剪枝加阈值筛选,PRS-CS 采用贝叶斯收缩,两者都应在独立样本中评估预测效果。
共 32 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「群体遗传学」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
帮我用这两份 GWAS 汇总统计做两样本孟德尔随机化,评估 BMI 对 2 型糖尿病的因果效应,并做敏感性分析。
常见做法是选取与暴露达到全基因组显著(P<5×10⁻⁸)的 SNP,按 LD 做 clumping 去除相关位点,计算 F 统计量排除弱工具,再对齐暴露和结局的效应等位基因,并处理回文 SNP。
没有统一门槛,取决于位点效应大小、等位基因频率和性状的遗传结构。复杂性状单个位点效应通常很小,往往需要较大样本才有足够检验效能。样本有限时可先做效能估算,或通过荟萃分析合并多个队列。
共定位回答两个性状在某个区域是否共享同一个因果变异,不估计效应大小;孟德尔随机化把遗传变异当作工具变量,估计暴露对结局的因果效应。两者常配合使用,例如用共定位支持药物靶点 MR 的结论。