Codar
下载

9个分析 Skill · Codar 生信插件

法医基因组学 AI 分析

法医遗传学用遗传标记回答身份识别与亲缘判定问题,常见数据是电泳得到的 STR 分型表、测序的 SNP 分型和线粒体序列。在 Codar 里覆盖 STR 分型与 VNTR 谱型整理、身份 SNP 与祖先 SNP 分析、亲缘关系与 IBD 推断、混合样本解析,以及 Y 染色体与 mtDNA 单倍群判定。相关分析面向科研,不作为司法鉴定结论。

法医基因组学能回答哪些研究问题

  • 这两份样本之间属于什么亲缘关系?
  • 混合样本里至少有几个贡献者?
  • 身份 SNP 组合的随机匹配概率怎么算?
  • Y-STR 和 mtDNA 能追溯到哪条世系?
  • 降解样本还能得到可用的分型结果吗?

法医基因组学分析流程

  1. 1

    整理分型数据

    统一位点命名和等位基因记法,核对所用的分型体系与参考序列版本是否一致。

  2. 2

    质量评估

    检查位点缺失、等位基因失落和影子峰,标注降解或抑制导致的不完整分型。

  3. 3

    频率与匹配概率

    选定参考群体的等位基因频率,计算谱型频率和随机匹配概率,注明群体来源。

  4. 4

    亲缘关系推断

    在似然比框架下比较待检假设与无关假设,必要时加入突变率和近亲可能性。

  5. 5

    混合样本解析

    估计贡献者人数,结合峰高比与等位基因共享情况做去卷积,保留多种可能解。

  6. 6

    世系与祖先分析

    判定 Y 染色体和 mtDNA 单倍群,用祖先信息 SNP 估计群体成分比例。

常用方法与怎么选

STR 与身份 SNP 两类标记

STR 多态性高、单个位点信息量大,是现有数据库和常规检验的主流标记;身份 SNP 片段短,在高度降解的样本里成功率更高,且适合高通量测序平行检测。两者可以互补使用,但由于历史数据多以 STR 记录,跨体系比较需要谨慎。

似然比框架下的亲缘关系推断

做法是计算观测分型在待检关系假设下与在无关假设下的概率之比。父子、全同胞、半同胞等关系预期的等位基因共享模式不同,远亲关系区分能力下降。结论受所用群体频率、位点数量和突变模型影响,这些参数应在报告里写清。

混合样本的贡献者估计与去卷积

常见思路是先从每个位点观测到的等位基因数推断最少贡献者人数,再利用峰高和比例关系分离各贡献者谱型。贡献者比例接近、样本降解或存在等位基因共享时,不确定性明显增加,通常给出多个候选解并量化各自的似然。

Y 染色体、mtDNA 与祖先 SNP

Y 染色体沿父系传递,mtDNA 沿母系传递,两者都不发生重组,适合追溯世系和区分家系分支,但同一世系内的个体无法相互区分。祖先信息 SNP 则用群体间频率差异估计祖先成分,分辨率取决于参考群体覆盖范围。

需要准备的数据

  • STR 分型表或电泳峰数据
  • 测序得到的 SNP 分型文件
  • 线粒体或 Y 染色体序列
  • 参考群体等位基因频率数据
  • 待检的关系假设与样本关系说明

能得到的结果

  • 标准化分型结果与质量标注
  • 谱型频率与随机匹配概率
  • 亲缘关系似然比与关系判断
  • 混合样本贡献者估计与候选谱型
  • 单倍群归属与祖先成分估计
  • IBD 共享片段与关系图

法医基因组学插件包含的分析能力

共 9 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • 祖先SNP
  • IBD分析
  • 身份SNP
  • 亲缘关系分析
  • 混合分析
  • 线粒体单倍群
  • STR分型
  • VNTR谱型
  • Y染色体与mtDNA

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「法医基因组学」

    在插件页找到「法医基因组学」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我根据这组 STR 分型结果做亲缘关系分析,计算两份样本的似然比。

法医基因组学常见问题

STR 和 SNP 在法医分析里各有什么优势?

STR 单位点多态性高,少量位点就能达到很强的个体识别力,并与既有数据库兼容。SNP 扩增片段短,在降解样本中更容易成功,还便于一次检测大量位点用于祖先或表型推断。实践中常以 STR 为主,SNP 作为降解样本和补充信息的手段。

亲缘关系的似然比要多大才算支持?

没有统一数值标准。似然比的大小取决于位点数量、所用群体频率、关系类型和设定的先验,远亲关系即使位点很多也可能得到中等数值。通常的做法是报告似然比及其敏感性分析,说明换用不同频率库或突变模型时结果的变化范围。

混合样本最多能解析出几个贡献者?

可解析的人数没有固定上限,取决于贡献者比例是否悬殊、样本是否降解以及位点数量。人数增加时等位基因重叠严重,不同组合可能给出相近的解释,不确定性迅速上升。可靠做法是先评估最少贡献者数,并把多种可能解一并呈现。

其他生信插件