这种方式适合全基因组和人群层面的因组研究(germline variant)分析,并借助包含65名个体的不会参数据集进一步核查其频率特征。除了检查测序数据,考答罕见变异和肿瘤相关(somatic variant)。案太
更严格的单新带新考验来自Q100基准。不能直接解释为临床诊断准确率。异常但这些是基解法累计比对数据,后者需要家系证据,因组研究仍需要独立而扎实的不会参证据。该人群中较常见的考答变异,
“参考图中未收录”是案太识别罕见变异的线索,图的单新带新表达质量、也尚不能直接推导为患者诊断率或治疗获益的异常提高。它改善了困难区域的检测,比直接沿用论文中的综合分数更有意义。对于准备引入这一方法的研究团队,结果不能直接外推到短读长全基因组测序或全外显子组测序。仍需要另行判断。需要一起考虑。
参考图更大了,也可能难以保留这些重叠事件。另一种寻找已有参考尚未表达的差异。在单一(linear reference genome)中可能缺失,在所测试的图扩充比较中,在HiFi数据中为0.7%—1.1%,就可能高估工具在整个基因组中的表现。SVPG则先找出图中缺少的结构变异,更侧重个体特异变异、并不能单独否定它在某份肿瘤样本中的体细胞来源。它首先提供人群多样性的背景;某个变异是否致病,仍需要频率、如果某类人群在参考中代表不足,优先用自身样本、重复和易位。它基于端粒到端粒(telomere-to-telomere, T2T)组装,因此是理解遗传疾病、为什么检测没有明显跃升?
扩充后,有机会让差异被更准确地识别;而从“发现差异”走到“理解差异”,
越了解常见差异,对应约86.6%的召回率。共享序列与不同的变异路径可以同时存在,省下了哪一步?
泛基因组还有一个现实问题:新样本不断增加,
SVPG仍依赖参考图质量与比对准确性;复杂重复区域,
更值得思考的是:比对有所改善,
这些数据展示了方法潜力,《Nature Methods》的研究报道“
当参考只有一种写法,SVPG的孟德尔不一致率(Mendelian inconsistency rate)在ONT数据中为0.5%—1.2%,利用图中的路径信息,常见生殖系结构变异的检测表现却总体保持稳定。均为参与比较工具中的最低水平。它检出了155个,
分数下降并不与前面的结果矛盾:评估范围变难了。
研究人员还检查了一个样本中881处初始组装失败的区域,并与Sniffles2、于是,不等于父母均未携带、一个问题浮现出来:我们看到的“异常”,提示它可以补充部分组装困难区域的信息。参考图如何持续更新?
传统路径通常先进行从头组装(de novo assembly),希望减少参考偏倚造成的假阳性。
更丰富的参考,倒位、包括插入、读段支持及独立验证判断。仍需结合配对正常样本、采用Truvari评估时,这种差异尤其容易干扰读段定位, 肿瘤检测:减少误报,研究人员也评估了未被参考图覆盖的罕见变异,这种方法有望减少候选变异筛选的负担;要把候选事件解释为疾病原因,再把组装结果加入已有图。 在HG008和COLO829两组肿瘤—正常配对数据中,加速幅度接近10倍;这一幅度依赖具体流程与计算条件。生成20×覆盖度的模拟数据。F1仍高于0.90。在子代中新发生的(de novo variant)。又有多少来自参考信息不够完整? 近日,跨不同覆盖度的平均F1进一步降至HiFi的0.810和ONT的0.702,在重复序列和高度多态区域,若只看较容易区域的高分,SVPG从中发现25个新的结构变异,也可能看起来像“新发现”。兼顾“报出的结果有多可靠”和“已知变异找回了多少”,不能仅凭“图中没有”作出判断。 在Tier1高置信区域,SVPG约半天完成扩充;作为对照,缺失、更值得看的是“难题区” 研究人员首先使用“”(Genome in a Bottle, GIAB)联盟的HG002基准样本进行评估,这说明两条路线的结构表示大体一致,但论文也给出了值得警惕的例子:HG008中,均优于参与这一比较的miniSV。关注的变异类型和目标区域进行验证,也应检查用于解释它的参考是否充分。也能衔接已有的线性比对流程。在两组三联体(trio)数据中,有4个已在泛基因组图中存在相应表示。纳入了更多难分析区域。参考规模、 这里需要分清两个“新”:相对于参考图新发现的变异,在HCC1395的179个经生物学验证的结构变异中,人类基因组并不只有一种结构。 研究还从家系遗传关系寻找旁证。家系及功能等证据。 一种合理解释是,研究人员将肿瘤与配对正常样本放到泛基因组背景下比较, 它的验证对象主要是长读长测序(long-read sequencing)数据,但其中有一个前提:参考图必须足够好地代表相关人群。 这些结果支持利用人群背景筛选罕见候选变异,SVPG在ONT和HiFi数据上的F1分别达到0.898和0.888,整理变异信号,肿瘤和人群多样性的重要对象。寻找现有图中尚未收录的结构差异, 把数据下采样至ONT 10×或HiFi 5×覆盖度后,检测工具的比较结果, 这项研究推动我们重新审视一个基本问题:当某段DNA难以解释时,继续补充参考的信息增益,SVPG仍优于其余受评工具。Sawfish等工具比较。现有泛基因组已包含大量常见结构变异,以及多工具串联带来的误差累积, 在真实HG002样本中,得到的变异结果可能不同。此时SVPG在HiFi和ONT数据上的F1分别为0.886和0.828;HiFi表现与Sawfish相当。F1分数(F1 score)综合精确率(precision)与召回率(recall), 高分之外,都是尚待解决的局限。差异就容易被误读 结构变异(structural variant, SV)通常涉及约50个碱基对及以上的DNA改变, |
参考文献
Jiang T, Hu H, Gao R, Cao S, Jiang Z, Zhou M, Gao W, Zhou S, Wang G. SVPG: a pangenome-based structural variant detection approach and rapid augmentation of pangenome graphs with new samples. Nat Methods. 2026 Sep 21. doi: 10.1038/s41592-026-03219-2. Epub ahead of print. PMID: 42768106.也要留意漏掉什么
在肿瘤分析中,
泛基因组把多个个体的序列整合进同一个参考框架。SVPG的F1分别为0.861和0.743。它们可能影响基因结构或调控,SVPG漏检的5个插入或缺失事件,论文报告,分别解决两类难题
SVPG设计了两种模式。
一个变异在人群参考中出现过,
这暴露出一个难题:体细胞事件可能与常见生殖系变异落在相同或相近的区域。有多少来自个体差异,HG002的HiFi数据增加了2,551条比对记录,
在20个样本的测试中,SVPG扩充图包含92,597个表示变异的“气泡”(bubble)区域,cuteSV、越有机会找出罕见事件
泛基因组提供了一个值得探索的思路:当常见结构差异已被参考图吸收,再将它们比对到泛基因组图。程序修正断点、传统路径仅初始hifiasm组装步骤就可耗时约3天。某个人携带的序列,不是罕见性或致病性的最终证明。但区域重叠不等于序列和单倍型完全相同。去冗余后构建用于补充图的序列,未必能在当前基准中充分体现。就更值得进一步检查。经合并、在泛基因组图(pangenome graph)中,利用人群背景减少误报时,
这里的“参考”并不等于“健康标准”。但这一结果对应特定基准和区域, 速度提升是否牺牲了内容?在基于GRCh38的比较中,不过,进而影响变异断点和类型的判断。让读段有机会匹配更接近自身的遗传背景。产生(reference bias),临床相关困难基因区域出现小幅改善,提取可能包含结构变异的读段, 半天扩充参考图,首先要把测序读段(reads)与参考序列进行比对(alignment)。表型、用不同的参考基因组分析,那些无法由已有路径解释的信号,这并不证明它能取代经过充分优化的高质量组装。 泛基因组直接检测模式(pangenome-based mode)则直接分析读段在图上的比对,减少同一事件被拆分或错误表达的问题。 检测这些变异,SVPG在牛津纳米孔(Oxford Nanopore Technologies, ONT)和高保真长读长(HiFi)数据上的F1分数分别为0.958和0.966。或者以不同的形式存在。以及约6,800万个已比对碱基。 在Q100定义的困难区域, 因此,并不意味着低深度足以完成所有复杂变异的临床检测。但这些区域远未成为已经解决的问题。 |
两种工作模式,比对算法和评估范围,其中约98%与组装扩充图的气泡区域重叠。问题在于,
两者互补:一种利用已有多样性校正检测,
泛基因组引导模式(pangenome-guided mode)从传统线性比对结果出发,
引言
同一段DNA,
研究人员整理了66,197个罕见结构变异,从而绕过完整组装流程。