参考人群不是一张固定的世界地图
祖源算法需要一组具有相对稳定群体结构的参考样本。参考样本的地域覆盖、样本量和历史迁徙都会影响模型如何定义“相似”。某个地区样本较少时,结果往往会被归入更大的邻近群体。
因此比例中的小数点不应被理解为精确测量。它反映的是当前数据库和模型下的最佳估计,数据库扩充或算法更新后,比例发生变化并不奇怪。
遗传片段、窗口和概率分配
模型通常把基因组划分为多个片段,再比较每个片段与参考群体的相似程度。片段越短,局部信号越容易受到随机波动影响;片段越长,又可能掩盖较近时期的混合历史。
最终比例还取决于模型是否允许一个片段属于多个群体、如何处理不确定片段,以及是否设置最低置信度阈值。报告应当说明这些规则的大致范围。
母系、父系与常染色体回答的问题不同
常染色体祖源覆盖父母双方多条家族线索,适合观察相对近期的群体混合;线粒体 DNA 沿母系传递,Y 染色体沿父系传递,更适合追踪单条家系的远期分支。三者不能互相替代。
Y 染色体分析只适用于具有 Y 染色体的样本。家族研究中需要明确每位成员的授权和比较目标,避免把单倍群结果误当成近亲关系证明。
如何与家谱和历史资料结合
更可靠的家族研究会把祖源结果与出生证明、族谱、迁徙记录、家族访谈和历史地图并置。结果可以帮助提出新的问题,但不能单独推翻有明确来源的身份文件。
当报告出现低比例或与家庭叙事冲突的信号时,先查看参考人群和置信度,再考虑增加亲属样本或寻找原始档案。不要根据一个百分比做重大身份决定。