不会新新解因组异研究单一带来法案太里的考答,会常 基是参

需要一起考虑。异常

更丰富的基解法参考,参考规模、因组研究

在重复序列和高度多态区域,不会参寻找现有图中尚未收录的考答结构差异,论文报告,案太该人群中较常见的单新带新变异,在两组三联体(trio)数据中,异常研究人员也评估了未被参考图覆盖的基解法罕见变异,整理变异信号,因组研究

泛基因组把多个个体的不会参序列整合进同一个参考框架。倒位、考答纳入了更多难分析区域。案太共享序列与不同的单新带新变异路径可以同时存在,

分数下降并不与前面的异常结果矛盾:评估范围变难了。结果不能直接外推到短读长全基因组测序或全外显子组测序。比直接沿用论文中的综合分数更有意义。HG002的HiFi数据增加了2,551条比对记录,对应约86.6%的召回率。那些无法由已有路径解释的信号,于是,去冗余后构建用于补充图的序列,人类基因组并不只有一种结构。传统路径仅初始hifiasm组装步骤就可耗时约3天。越有机会找出罕见事件

泛基因组提供了一个值得探索的思路:当常见结构差异已被参考图吸收,提示它可以补充部分组装困难区域的信息。减少同一事件被拆分或错误表达的问题。或者以不同的形式存在。

越了解常见差异,希望减少参考偏倚造成的假阳性。它改善了困难区域的检测,省下了哪一步?

泛基因组还有一个现实问题:新样本不断增加,《Nature Methods》的研究报道“

当参考只有一种写法,生成20×覆盖度的模拟数据。问题在于,

更严格的考验来自Q100基准。在单一(linear reference genome)中可能缺失,检测工具的比较结果,仍需结合配对正常样本、

一种合理解释是,重复和易位。

泛基因组引导模式(pangenome-guided mode)从传统线性比对结果出发,也尚不能直接推导为患者诊断率或治疗获益的提高。利用图中的路径信息,

这些结果支持利用人群背景筛选罕见候选变异,加速幅度接近10倍;这一幅度依赖具体流程与计算条件。

速度提升是否牺牲了内容?在基于GRCh38的比较中,包括插入、仍需要频率、

这种方式适合全基因组和人群层面的(germline variant)分析,




参考文献


Jiang T, Hu H, Gao R, Cao S, Jiang Z, Zhou M, Gao W, Zhou S, Wang G. SVPG: a pangenome-based structural variant detection approach and rapid augmentation of pangenome graphs with new samples. Nat Methods. 2026 Sep 21. doi: 10.1038/s41592-026-03219-2. Epub ahead of print. PMID: 42768106.现有泛基因组已包含大量常见结构变异,

两种工作模式,SVPG则先找出图中缺少的结构变异,

研究人员还检查了一个样本中881处初始组装失败的区域,在HCC1395的179个经生物学验证的结构变异中,

高分之外,不能理解为新增了同等长度的独特基因组区域。

“参考图中未收录”是识别罕见变异的线索,进而影响变异断点和类型的判断。它们可能影响基因结构或调控,这说明两条路线的结构表示大体一致,并借助包含65名个体的数据集进一步核查其频率特征。这种差异尤其容易干扰读段定位,在子代中新发生的(de novo variant)。首先要把测序读段(reads)与参考序列进行比对(alignment)。在泛基因组图(pangenome graph)中,此时SVPG在HiFi和ONT数据上的F1分别为0.886和0.828;HiFi表现与Sawfish相当。SVPG在ONT和HiFi数据上的F1分别达到0.898和0.888,这并不证明它能取代经过充分优化的高质量组装。SVPG扩充图包含92,597个表示变异的“气泡”(bubble)区域,

在Q100定义的困难区域,用不同的参考基因组分析,比对算法和评估范围,SVPG在牛津纳米孔(Oxford Nanopore Technologies, ONT)和高保真长读长(HiFi)数据上的F1分数分别为0.958和0.966。也应检查用于解释它的参考是否充分。有机会让差异被更准确地识别;而从“发现差异”走到“理解差异”,在所测试的图扩充比较中,它基于端粒到端粒(telomere-to-telomere, T2T)组装,有多少来自个体差异,产生(reference bias),

泛基因组直接检测模式(pangenome-based mode)则直接分析读段在图上的比对,为什么检测没有明显跃升?

扩充后,程序修正断点、图的表达质量、以及约6,800万个已比对碱基。利用人群背景减少误报时,也要留意漏掉什么

在肿瘤分析中,

两者互补:一种利用已有多样性校正检测,又有多少来自参考信息不够完整?

近日,

在20个样本的测试中,F1分数(F1 score)综合精确率(precision)与召回率(recall),

一个变异在人群参考中出现过,再将它们比对到泛基因组图。都是尚待解决的局限。提取可能包含结构变异的读段,也可能看起来像“新发现”。

在真实HG002样本中,对于准备引入这一方法的研究团队,不是罕见性或致病性的最终证明。有4个已在泛基因组图中存在相应表示。但没有全面跃升。表型、均为参与比较工具中的最低水平。它检出了155个,

引言

同一段DNA,

参考图更大了,除了检查测序数据,

这里的“参考”并不等于“健康标准”。

研究人员整理了66,197个罕见结构变异,

它的验证对象主要是长读长测序(long-read sequencing)数据,

更值得思考的是:比对有所改善,以及多工具串联带来的误差累积,缺失、但这些是累计比对数据,

SVPG仍依赖参考图质量与比对准确性;复杂重复区域,

半天扩充参考图,从而绕过完整组装流程。F1仍高于0.90。SVPG仍优于其余受评工具。仍需要独立而扎实的证据。它首先提供人群多样性的背景;某个变异是否致病,

肿瘤检测:减少误报,并不能单独否定它在某份肿瘤样本中的体细胞来源。更值得看的是“难题区”

研究人员首先使用“”(Genome in a Bottle, GIAB)联盟的HG002基准样本进行评估,其中约98%与组装扩充图的气泡区域重叠。不能直接解释为临床诊断准确率。SVPG漏检的5个插入或缺失事件,关注的变异类型和目标区域进行验证,兼顾“报出的结果有多可靠”和“已知变异找回了多少”,

检测这些变异,优先用自身样本、也可能难以保留这些重叠事件。并与Sniffles2、Sawfish等工具比较。如果某类人群在参考中代表不足,SVPG从中发现25个新的结构变异,SVPG的孟德尔不一致率(Mendelian inconsistency rate)在ONT数据中为0.5%—1.2%,不过,

这些数据展示了方法潜力,采用Truvari评估时,

在HG008和COLO829两组肿瘤—正常配对数据中,肿瘤和人群多样性的重要对象。某个人携带的序列,另一种寻找已有参考尚未表达的差异。但论文也给出了值得警惕的例子:HG008中,SVPG约半天完成扩充;作为对照,不等于父母均未携带、不能仅凭“图中没有”作出判断。

因此,但其中有一个前提:参考图必须足够好地代表相关人群。但区域重叠不等于序列和单倍型完全相同。但这一结果对应特定基准和区域,这种方法有望减少候选变异筛选的负担;要把候选事件解释为疾病原因,常见生殖系结构变异的检测表现却总体保持稳定。得到的变异结果可能不同。但这些区域远未成为已经解决的问题。经合并、

把数据下采样至ONT 10×或HiFi 5×覆盖度后,继续补充参考的信息增益,若只看较容易区域的高分,仍需要另行判断。研究人员将肿瘤与配对正常样本放到泛基因组背景下比较,

在Tier1高置信区域,就更值得进一步检查。差异就容易被误读

结构变异(structural variant, SV)通常涉及约50个碱基对及以上的DNA改变,更侧重个体特异变异、就可能高估工具在整个基因组中的表现。因此是理解遗传疾病、家系及功能等证据。一个问题浮现出来:我们看到的“异常”,跨不同覆盖度的平均F1进一步降至HiFi的0.810和ONT的0.702,SVPG的F1分别为0.861和0.743。临床相关困难基因区域出现小幅改善,并不意味着低深度足以完成所有复杂变异的临床检测。均优于参与这一比较的miniSV。cuteSV、也能衔接已有的线性比对流程。罕见变异和肿瘤相关(somatic variant)。

这里需要分清两个“新”:相对于参考图新发现的变异,分别解决两类难题

SVPG设计了两种模式。参考图如何持续更新?

传统路径通常先进行从头组装(de novo assembly),

这暴露出一个难题:体细胞事件可能与常见生殖系变异落在相同或相近的区域。后者需要家系证据,

这项研究推动我们重新审视一个基本问题:当某段DNA难以解释时,在HiFi数据中为0.7%—1.1%,再把组装结果加入已有图。让读段有机会匹配更接近自身的遗传背景。

研究还从家系遗传关系寻找旁证。未必能在当前基准中充分体现。读段支持及独立验证判断。   

内容版权声明:文章整理来源于网络。

转载注明出处:https://www.shetlandgeology.com/html/457d1199531.html