[已完结] 关于Polygenic risk score 计算步骤中clumping的问题

 关闭 求助已关闭
2dolist 发表于 2023-8-31 10:52:49 | 显示全部楼层 |阅读模式
悬赏30积分

第一次尝试PRS的计算,我是先跟着网上的教程(https://choishingwan.github.io/PRS-Tutorial/plink/)做了一遍,但是回头读原文章的时候对于clumping有一些困惑。在QC之后,筛选SNP这一步,我使用的是作者推荐的C+T方法,我想问的是
1)clumping在计算LD时,是针对base data 还是target data 进行的呢?

2)如果我根据另一篇文章已经选好了,只有24个candidate SNPs (作者应该是已经确定他们是independent effect 的了),我还需要clumping和thresholding这一步吗?
3)如果在aligning snps between base data and target data 这里匹配成功率很低 (60-70%),ancestry 的差别能解释所有吗,或者代表我其他步骤出问题了?

谢谢!

已采纳

1)在多态性关联研究(Polygenic Risk Score, PRS)中,"clumping" 是一个用于筛选关联SNP的步骤,目的是从基础数据(base data)中选择最具代表性的SNP,以用于构建多态性风险评分(PRS)。这个步骤通常是在目标数据(target data)上进行。 在进行clumping时,你会从基础数据中选择一个已知相关性(association)的SNP作为种子(seed SNP),然后从基础数据中选择与种子SNP存在一定程度的连锁不平衡(linkage disequilibriu ...

查看完整内容

全部回复2 显示全部楼层
plvto 发表于 2023-8-31 10:52:50 | 显示全部楼层

1)在多态性关联研究(Polygenic Risk Score, PRS)中,"clumping" 是一个用于筛选关联SNP的步骤,目的是从基础数据(base data)中选择最具代表性的SNP,以用于构建多态性风险评分(PRS)。这个步骤通常是在目标数据(target data)上进行。

在进行clumping时,你会从基础数据中选择一个已知相关性(association)的SNP作为种子(seed SNP),然后从基础数据中选择与种子SNP存在一定程度的连锁不平衡(linkage disequilibrium, LD)的其他SNP。这些SNP被认为在基因座(locus)上可能共享类似的信号,因此会被一起考虑构建PRS。

要注意的是,这些被选择的SNP仅来自基础数据,因为基础数据中的关联信息会被用来指导选择。然后,这些被选择的SNP会用于计算PRS,应用到目标数据中,从而预测个体在目标数据集中的多态性风险。

所以,回答你的问题,clumping 是在计算LD时针对基础数据(base data)进行的,然后选择的SNP集合会被用于在目标数据(target data)上计算PRS。

2)如果你已经根据另一篇文章选定了24个候选SNP,并且这些SNP被认为是独立影响(independent effects),通常情况下是不需要进行进一步的clumping和thresholding步骤的。

Clumping和thresholding步骤通常是在你没有先验信息的情况下,在大规模基因关联研究数据中识别潜在相关性SNP时使用的。这两步的目标是从大量的关联SNP中选择出一组独立的、代表性的SNP,以用于构建PRS模型。但是,如果你已经有了一个经过严格筛选的SNP集合,并且确定它们是独立影响,那么这些步骤就不再必要。

在你的情况下,你可以直接使用这24个候选SNP来构建多态性风险评分(PRS),而不需要进行额外的clumping和thresholding。这些步骤主要是为了从大规模的基因关联数据中提取信号,并减少多重比较的影响,但由于你已经有了一个明确定义的候选SNP集合,这些步骤不会增加太多价值。

3)匹配成功率低可能有多种原因,而不仅仅是由于祖源(ancestry)的差异引起的。在进行SNP匹配时,确实需要考虑祖源的差异,因为不同的人群可能会在基因变异上存在差异,从而导致在不同数据集之间的SNP匹配困难。然而,如果匹配成功率非常低,可能还有其他因素需要考虑。

以下是一些可能导致匹配成功率低的其他因素:

质量控制问题: 数据集中的SNP可能因为质量问题或者变异情况而被过滤掉,从而导致匹配困难。

数据处理差异: 数据集的预处理步骤可能在不同的数据集中有差异,比如合并、过滤等操作,这些差异可能影响SNP的匹配。

检测平台差异: 不同的基因分型检测平台可能会涵盖不同的SNP,从而导致在不同数据集之间匹配困难。

人口结构差异: 除了祖源差异,人口结构的差异也可能影响SNP匹配。如果数据集包含不同亚群或次人群,匹配就会更加困难。

缺失数据: 数据集中某些SNP可能在某些样本中缺失,导致匹配失败。

技术偏差: 不同实验室或技术平台的偏差也可能影响SNP的匹配。

综上所述,虽然祖源的差异可能是匹配成功率低的一个因素,但还需要考虑其他可能性。检查数据的质量控制步骤、预处理步骤、检测平台、人口结构以及SNP的缺失情况等因素,以确定是什么导致了匹配成功率低。在确定问题后,你可以采取相应的措施来提高匹配成功率。

以上来自ChatGPT
2dolist 发表于 2023-8-31 17:53:48 | 显示全部楼层
回答地很详细,谢谢!

发表回复

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

注册会员
  • 发布

  • 回复

  • 积分

    130

返回列表