面向个人与科研机构的生命数据服务平台

了解我们的科学标准

GENETIC STATISTICS

多基因风险评分是什么:统计模型、适用范围与误读风险

多基因风险评分把许多遗传位点的统计效应合并成一个分数,用于描述样本在特定研究人群中的相对位置。它是统计模型,不是疾病诊断器;分数离开参考人群和验证场景后,解释力会迅速下降。

评分是怎样计算出来的

研究人员先在大型关联研究中估计不同位点与某性状的统计关系,再将位点效应按照模型加权求和。模型可能包含数百到数百万个位点,具体取决于性状、研究设计和纳入阈值。

最终分数通常会经过标准化,再与参考样本比较百分位。百分位表达的是相对位置,不等于个人未来发生事件的直接概率。

参考人群决定了结果的可迁移性

如果训练数据主要来自某一祖源人群,模型在其他人群中的预测性能可能下降。原因包括连锁不平衡结构、等位基因频率和环境暴露差异,而不只是样本数量问题。

因此报告必须注明训练队列、验证队列和适用人群。没有这些信息的“高风险”标签,很难判断它究竟反映真实信号,还是反映模型与人群之间的距离。

统计关联不是因果关系

一个位点与性状相关,可能是直接功能影响,也可能只是与真正的因果位点共同遗传。多基因评分更不能解释个人为什么会出现某个症状,也不能替代影像、实验室指标或家族史评估。

生活方式和环境因素同样可能改变实际结果。对可干预的健康主题,评分最合理的用途通常是帮助提出问题,而不是给出确定的行为命令。

什么时候应该谨慎使用

当模型没有外部验证、参考人群不匹配、样本质量不足或结果涉及高风险医疗决策时,不应直接依据评分采取行动。需要医疗判断的场景,应由临床团队结合经过验证的检测和病史评估。

用户阅读报告时,可以重点查看模型版本、参考人群、置信区间、验证结果和免责声明。一个专业平台会把这些信息放在结果附近,而不是藏在很难找到的脚注中。

继续了解