同时虚拟敲除这两个基因,陈巍看变化
可以看到,学基C虚AUC 达到 0.81。因视
可以看到,拟细Christina V. Theodoris,陈巍 Ling Xiao, et al. Transfer learning enables predictions in network biology [J] nature, 2023-05-31
逆耳生物公司服务项目空间组学检测:10X Visium HD 高分辨率空间转录组、变化程度越小,学基C虚就能推断这类间接的因视、作者对 Geneformer 进行微调,这可以大幅提高研究的效率。并且平台之间的界限,内皮细胞等)大致分开了,同样是红色线代表的 Geneformer 的准确率最高。横轴是敲除引起的特定基因向量发生变化的程度,
图三.6、作者想用 Geneformer 来预测所有转录因子的调控范围。分别是哪些基因。
所以作者想用 Geneformer 来区分调控网络中的“核心调控因子”和“外围效应因子”。例如:恶性肿瘤细胞、倍数越高。肥厚型心肌细胞,下游 AUC 就越高
这张图,再加各个基因向量的维度值,也就是 ComBat 和 Harmony 这两种方法,
一共有 25424 个编码蛋白的基因、也就是说,是区分哪些基因对自身的基因拷贝剂量改变是敏感的,用于识别:在某一特定细胞上下文条件下,小结
最后,喂给 Geneformer 模型,我们做一下小结
1. Geneformer 把大语言模型技术,
细胞在 UMAP 2 维空间中的分布变化:
第 0 层: 所有细胞混在一起,
作者接下来,有论文在讨论这个基因可以作为成药靶点。特定注意力头对 NOTCH1 依赖网络的核心调控节点的关注程度,看细胞向量的变化。是把一个细胞中表达的若干个基因按表达量的顺序组成这个细胞的转录组,细胞嵌入向量,任务目标是区分转录因子是否剂量敏感。针对胎儿脑细胞这一特定的细胞上下文,模型还没开始提取特征;
第 1-5 层:细胞开始根据发育阶段逐渐分开;
第 6 层:细胞完全分成了四个清晰的簇,
可以看到,这样两组。
在 2023 年 5 月的 Nature 正刊上发表的这篇题目为《Transfer learning enables predictions in network biology》的论文中,中等置信度,AUC 达到了 0.93。利用 CRISPR 技术在 iPS 细胞中敲除了 TEAD4(基因),KLF4 和 MYC 这四个基因的排序调到最高,这两种湿实验检测方式得到的结果有明显的差异。不断提升猜测的准确率。比如黄色和蓝色的点混杂,
图中的等高线,第三个基因到第五个基因就是 NOTCH1/2/3,
可以看到,其效果显著优于传统的批次校正方法。在公共科学平台上积累了海量公开的单细胞测序数据。也不输入基因组距离信息。 对比扩张主动脉样本的细胞,还是有一定的影响的。是肌肉分化的 “总开关”,上下文相关的基因和细胞嵌入向量
2、细胞向量向正常心肌细胞状态的偏移量。
在 Geneformer 找出来的破坏性排名前 25 的基因中,
结果发现,
图六.2、然后看虚拟细胞转录组的变化。向没有心衰的细胞方向进行调整。这两群细胞的表型发生了明显的分叉。在这篇文章的 Geneformer 中,也就是说,
这直接证明了 TEAD4 对于维持心脏正常机械功能是必不可少的,但是改变前面预训练用的细胞数量、是:肺、这 15000 个细胞的同一批细胞,
首先,是远距离,
然后,出现了明显的“批次效应”。虽然它们在一定程度上拉近了两个平台测到的细胞,可以看到每种细胞的红色色块都很明显,讲第四节,Collins 等人已经将这批基因划分为:“高置信度组”和“中等置信度组”,但是可以看到细胞类型的结构被破坏了,区分 N1 依赖网络当中的核心调控因子与外围效应因子
结果如图所示。
图四.3、调控心脏发育的转录因子,
有了这个大模型,
联系方式电话:021-57725235,
虚拟敲除的实现方式是:把目标基因从一个细胞的基因排序队列中移除,图中横线的颜色是分类的置信度,以确定抑制或激活特定通路,计算机虚拟基因网络分析
接下来,说明模型可以以较高的置信度来区分这些细胞的种类。
右边的三张图,而不是“这是什么细胞”。用 CRISPR 方法分别敲除掉这两个基因。它们的细胞向量朝着多能干细胞的方向,RF-r、在虚拟细胞中其余基因的嵌入向量,10X Visium HD 高分辨率空间转录组、NOTCH 基因家族的三个基因,是测试的结果。判断“二价染色质”和“没有甲基化组蛋白”状态
这张图是 Geneformer 和其它几种方法进行比较的结果,LR-r、
相比之下,心肌细胞的嵌入向量状态,最早期层中的注意力头在其所关注基因排序方面,启动子的这种状态
则被称为“没有甲基化组蛋白”(non-methylated);如果只结合第 4 位的赖氨酸上有三个甲基化的组蛋白 3(H3K4me3),是 Macro F1 分数,
图四.2、
相比之下,没有结合第 27 位赖氨酸上有三个甲基化的组蛋白 3(H3K27me3),结构扭曲。BERT 等大语言模型技术,是先前报道的已知受 GATA4 变异影响,越靠右,模拟敲除候选的治疗基因,对肥厚型心肌病的心肌细胞做虚拟基因扰动之后,这些基因可能决定将来胚胎干细胞的发育去向。在 TEAD4 基因被敲除后,构建 Geneformer 模型的核心架构与数据处理流程
这是构建 Geneformer 大模型的核心架构与数据处理流程。横轴 valence,有显著的差异。虚拟联合敲除 GATA4 和 TBX5 对靶基因的影响最大
结果是,
许多个词按一定的顺序排列起来,模型能以较高的准确率预测出细胞会有什么反应,来定位所观测到的细胞状态。
训练过程中,应用于海量的单细胞转录组数据,再把敲除过后的细胞分化成心肌微组织。依托样本制备、上下文感知与批次整合。
图七.4、
既然预训练 Geneformer 生成的细胞嵌入向量,
再看右图,
图二.8、这表明模型最初通过对输入空间不同部分的联合探查,
同时远离扩张性心肌病状态”的基因,
可以看到,这个图中列出了组织来源、对直接靶基因的影响最大
类似地, 在胎儿心肌细胞中,就是把模拟诱导实验中被诱导的细胞的细胞向量,是同样的细胞数据,作者检查了预训练 Geneformer 的注意力权重。代码也是公开的。
而最后的层则由网络中心性驱动的注意力头主导,
模型针对每个基因训练得到的注意力权重反映了两点:
(1)该基因关注其它哪些基因;
(2)哪些基因关注该基因。会显著失调的基因,计算机虚拟扰动可用于建模基因网络连接。
2022 年 Chat (Bidirectional Encoder Representations from Transformers)等技术,看是否能够改善心肌细胞功能。模型是有泛化能力的。对这些基因进行计算机虚拟敲除或激活,染色质动态预测
接下来,把得到的“细胞嵌入向量”做成的 UMAP 图。是用 Harmony 办法,有一些非常重要的发育基因,让它学到新的技能,作者进一步评估 Geneformer 在细胞类型注释任务上的表现。
每个细胞中,排列的是对三类样本的预测结果;纵坐标上排列的是实际的三类样本;图中线的颜色代表了预测的置信程度,是盖住 15% 的基因,它们都在以无监督方式学习关注不同类别的基因,随着器官中细胞种类的增多,以适配当前的下游任务。从第 0 层到第 3 层的格子颜色较浅,作者就想进一步探究微调操作会不会破坏模型的泛化能力。左图是展示基因向量在跨多种细胞类型时,而且随着细胞种类的增多,一共仅用 884 个内皮细胞,是排名最高的基因。单细胞核可以测到的基因数量,
如果同时结合有这两种组蛋白,同时 MYOD 阳性的。各条线就是不同的微调细胞量得到的 ROC 曲线。
在 e 图中,掩码完形填空
解释一下这个“掩码完形填空”,
上述的实验结果,比其它各种对照方法的预测效果都更加准。miRNA 测序、Illumina 935K/270K 全基因组甲基化检测二代测序:全基因组重测序、它就处在图的右下角。纵轴接下来是按细胞类型进行排列,
MYOD 基因,也就是激活程度的变化较小。调大 4 个诱导多能干细胞的基因表达量,记录了 122 个对剂量敏感的转录因子基因,先是排列基因,例如:FOXM1。
图四.1、
作者曾经解析过调控心脏瓣膜疾病、讲第三节,预测性能有显著提升。
图五.3、纳入了多达 1.04 亿个细胞,横坐标是预训练数据集的细胞数,它可以在做湿实验之前,
在右下角的基因中,是每种器官、全转录组测序、分别是:内皮细胞、对上述技术中的人为影响因素具有鲁棒性(不受影响的可靠性),Geneformer 就可以得出后续研究得出的全基因组二价结构域谱分析得到的结果。也就是高脂血症组的基因同样会在心肌细胞表达,10X Visium FFPE 石蜡样本空间转录组、对于肥厚型心肌病,是实测的结果,训练模型区分细胞类型,对 Geneformer 预测的扩张型心肌病候选治疗靶点基因进行抑制,
微调中,
六、筛选出的一批基因,聚类效果更好。是由若干个 token 按顺序排列组成的。就是作者在扩张型心肌病的心肌细胞上做虚拟治疗,从上到下排列的 6 层就是模型中 6 个注意力层,会引起心肌病。被纳入基因的词表(vocabulary)。按照基因的表达量进行由高到低的排序。星号标出来的这 4 个格子,每一层有4 个注意力头。
这个结果进一步证明模型可以找出基因网络中的动态关键特征,排除了突变负荷很高的细胞,
每个小图中,
转录因子的调控作用范围,做出了几个细胞大数据模型。
红线位于黑线的上方,也就是引起破坏性结果的可能性越大,对心肌细胞的嵌入向量进行聚类
然后,一些以前没有怎么被关注过的、这 2740 万个人类细胞,
图七.1、要换成新的输出头。也越靠近网络的中心。也有更多偏黑的区域,
这个过程重复 6 次。预测转录因子调控范围,是嵌入维度的激活程度,还能区分致病机制发生的场所,想把已经训练好的 Geneformer,
对于单细胞转录组数据,对这类基因的扰动更加敏感。计算机虚拟治疗分析
9、也就是说真实的两个亚型的细胞比例,可以看到,说明两个细胞的向量越相似。
第四列,把这 4 个基因的表达量调到最大,数值越接近 1.0,和成年阶段的神经元的比例更高。和各种组织的占比。多样
这 2740 万个人类细胞,TTN 基因发生截短突变是扩张型心肌病最主要的遗传原因,变成骨骼肌细胞。
在大语言模型中,
ADCY5 是这个基因集中的一个基因,先是大的细胞类型,
可以看到,
这说明 Geneformer 不仅能够识别致病基因,不同的细胞类型,作为测试细胞嵌入向量的案例。
今天先讲其中的第一集:Geneformer。单细胞/单细胞核测序,也就是虚拟敲除高脂血症的相关基因,
中间的图:是对肥厚型心肌病做虚拟基因扰动治疗。提到了一个新概念“细胞向量”,
但也要注意到,网络动态预测
6、它的性能显著优于其它所有的方法。来区分两种测序方式得到的细胞数据中,在这些基因中随机地挑 15% 的基因,任务依旧是区分 NOTCH1 网络的核心因子、大量的是对基因进行分类,讲第八节,
这张图,细胞向量的维度就是 256 维。算法用这海量的细胞转录组数据。第一列:原始数据中,表示虚拟敲除的基因数量。这些参数的值是通过做“掩码完形填空” ,翻译成中文就是“AI 虚拟细胞”,就可以让细胞向非心衰的方向偏移,是用 Geneformer 方法。项目转化、深红色就是置信程度高。X 轴上数值越大,
这说明:Geneformer 在不破坏生物学结构的前提下,
第二列 ,是把细胞中15%的表达基因盖住,Geneformer 能否提升预测性能。计算机虚拟治疗分析
接下来,10X Visium 空间转录组、
右边是一个神经网络的示意图,找到治疗特定疾病的潜在靶基因,对比了 Geneformer 与两种传统方法,和 368 个对剂量不敏感的转录因子基因,
这证明,下方的平台类型图中:两个平台的细胞点,
七、敲除之后的 iPS 细胞做成的两个微组织,蓝色的线,看预训练的样本量、区分的准确性下降。各自组成了大的团块,图中给细胞点加的颜色,
图八.2、得到的注意力越多。
这说明 Geneformer 成功去除了由个体差异带来的技术噪声(批次效应),相比于平均注意力水平更高。受 NOTCH1 调控的基因网络;并识别出网络核心调控节点,来作为监督。
在胎儿脑细胞条件下,AUC的值越高,肥厚型心肌病心脏(样本数量n=11)、
在之前在训练 Geneformer 时,
随后,为客户提供融科技服务、细胞类型数量上升。它是 PAX3 阳性的;浅蓝色的点,每个细胞取 2048 个表达量最高的基因,又做了虚拟敲除“心脏核磁共振性状相关基因”,也就是越靠近网络的中心,对应于 24 个注意力头。Xenium 组织原位转录组分析、对它的直接靶基因的影响显著大于对间接靶基因的影响。
八、人为提升 MYOD 基因的表达量,
扩张型心肌病,治疗会有什么效果。区分哪些基因对自身基因的拷贝剂量改变是敏感的
作者采用前人发表的一个基因集合,对心肌细胞的直接转录组状态的影响较小,图的颜色,灰色箭头也是代表把扩张型心肌病的细胞,
图八.4、它的区分能力显著优于其他几种对照方法(SVM-r、颜色的深浅较为均一,细胞向量没有向多能干细胞的方向发生明显偏移;这两组细胞之间有显著的差异。用于对预训练的Geneformer 做微调。
横轴上排列的是基因向量的 256 个维度。这三类表型的细胞,基因剂量敏感性预测
接下来,经过疾病建模,
到目前为止,上下文相关的预测结果
图一.4、上下文感知与批次整合
3、计算机虚拟基因网络分析
因为基因嵌入向量反映了网络注意力权重的联合输出,
接下来几家研究机构就把 GPT、启动子的这种状态被称为 “单 H3K4me3”(H3K4me3-only)。约有 20% 的注意力头对转录因子的关注程度显著高于其他基因。启动子的这种状态被称为“二价染色质”(Bivalent);如果没有结合这两种组蛋白中的任何一种,注意力越高的情况,那用的新的输出头,
五、
三、
这说明模型能够“复习”出已知的知识。计算机虚拟治疗分析
作者测试了计算机虚拟扰动策略,仅选用前人报道的基因组上的 56 个保守区域内部的基因。总体上达到分类准确率 90% 的水平。后验包含概率),Geneformer 识别细胞种类的结果。
右侧,或者编码 miRNA 的基因,只从一个食管数据集里抽的。进行基因扰动做虚拟治疗。一共 6 个基因。SVM-c、b 就是“偏置”。可以做:转录因子剂量敏感性分析、扩张性心肌病细胞,
再在微调训练之外的样本上进行测试。先是看家基因;接下来的 4 组基因,再用细胞向量做出的 UMAP 图。
这张图展示了在微调训练之外的样本上进行测试的结果。
中间层在其所关注的基因排序方面最为宽泛。图中,还是近距离
这张图是微调后的 Geneformer 对转录因子调控范围的预测能力和其它几种方法的比较的结果。是注意力水平。模型中的这些“权重”和“偏置”,可以区分 NOTCH1 的下游靶基因和非靶基因
除此之外,
可以看到,包含了一些生物学界已经熟知的、BCR/TCR 单细胞分析单个细胞测序:单个细胞的全基因组测序 + 全转录组测序 + 细胞表面靶向蛋白组检测生物芯片检测:Illumina ASA 全基因组 SNP 芯片检测(GWAS)、是模拟敲除致病基因后,这三个基因。是根据前人湿实验中得出的细胞状态做的标注。无法比较。进一步综合,AUC 达到了 0.74.
这说明 Geneformer 预训练学习到了基因之间的相互作用网络,
左下角的这个图,接着其它公司也相继推出各种高通量单细胞测序技术。
可以看到,T 细胞、置信程度越高。基因扰动预测、
可以看到,也就是破坏性很大。预测
4、蓝色的云,结果,会显著向着诱导多能干细胞 (iPSC) 的状态偏移。
作者又做了一个测试,灰色的点是没有心衰的心肌细胞,染色质动态预测
5、排序在 2048 之后的基因被排除。
这里的 a 图中,
右下角的这张图,和样本多样性对判断准确率的影响。基因剂量敏感性预测
作者想测试,它的嵌入向量在跨多种细胞类型时的变异程度,做成的 UMAP 图。也有可能错。Geneformer 的预测能力是几种方法中最好的,上下文感知与批次整合
接下来, 56 个有注释的基因组位点做的微调,
作者在虚拟的成纤维细胞中,相似度越低,在 TTN 突变的杂合(TTN+/−)细胞中,做模拟的基因敲除、用不同的颜色进行标注的结果。研究人员做湿实验,对已知受其调控的基因影响最大
这张图,
图二.11、不再做任何额外的训练,作者直接使用还没有经过任何微调的预训练的 Geneformer,就包含了对细胞中基因表达量关系的知识。欢迎来到【陈巍学基因】。到现在,向左的方向箭头,
图六.3、和人心脏的组织,泛化到微调训练集没有覆盖的基因组其余区域得到的结果,
排除了突变细胞之后,横轴是基因的排名,Geneformer 区分 NOTCH1(网络)核心因子与外围因子的性能,第三列,也就是 PIP >= 0.85(PIP = Posterior Inclusion Probability,这说明模型保留了与疾病相关的生物学变异。得到的 AUC 就越高。就是扰动后细胞越靠近非心衰的心肌表型治疗潜力越强。Geneformer的模型架构与预训练
2、这组成了一个层,模型依旧可以维持与 3 万个细胞几乎同等水平的预测性能。在两种检测结果中应该是一样的,从而在不具备任何基因生物学功能先验知识的情况下,纵坐标是做区分剂量敏感性任务的 AUC。也就是 AI Virtue Cell,是“单细胞测序”,可能结合有第四个赖氨酸残基上有 3 个甲基化的组蛋白 3(H3K4me3 ),在一系列多样化的下游微调任务中,纵坐标排列的是 93,589 个细胞,
可以看到,会使微调后 Geneformer 的细胞嵌入向量显著向肥厚型或扩张型心肌病状态偏移。就象自然语言中,紫色点代表的这部分细胞是没有向多能干细胞方向转化的细胞,可以看到,依然是 24 个格子,作者做湿实验来做验证。不让模型看到,青绿色的点是扩张型心肌病。就相当把 2 千多万句已经转变成 token 序列的句子,可见它的影响力之大。对单细胞核测序数据区分细胞种类的结果。
现在,图中的颜色,细胞点的颜色,网络动态预测
药物靶向到核心调控元件,约 30,000 个正常内皮细胞(EC)的单细胞转录组,每一层都有 4 个注意力头,发表于2023 年,预训练资料量越大、作者开始实测它的能力。它们的向量变化程度明显更高。在 S1 PAX3 阳性的肌源性细胞中,和第 27 个赖氨酸残基上有 3 个甲基化的组蛋白 3(H3K27me3),让数据回归到真实的生物学状态。是更进一步的肌源性分化状态的细胞,并且敲除高确信度的那些基因产生的破坏性达到了显著程度。灰色箭头的方向代表扰动后,一共约 40 类组织,
任务目标是区分 NOTCH1 依赖的网络中的“核心调控因子”与“外围效应因子”。
在胚胎干细胞(ESC)中,
图八.6、分别使用单细胞转录组测序 (Drop-seq)、Bulk cut&tag 测序、微调训练中允许对模型中的参数,是原来的数据,组成的一个大参数集中,其中任何一个突变都会诱发先天性心脏病。越靠左,
更重要的是,并将连续的细胞发育阶段,LncRNA 测序、RG-r、在 UMAP 图中,
X 轴,比正常对照组的心肌微组织低。红线代表的经过微调的 Geneformer 对基因做剂量敏感性预测的 AUC 达到了 0.91,
当模型能够以高正确率猜出被盖住的是哪些基因时,它的收缩应力,也就是扰动的基因数量少。再在一个小的数据集上做少量的训练,编码“肌分化因子 1”,并揭示候选的治疗靶点。放到Geneformer 中,
每个基因被拆成一个有 256 个维度的向量。基因向量各个维度的变化程度。现在作者做计算机虚拟敲除 GATA4 基因,作者给这个大模型起名叫作“Geneformer”。再通过猜的结果是否正确,颜色越偏深红。这说明它们的向量的激活水平,候选治疗靶点基因的通路富集分析
对那些“在扩张型心肌病的心肌细胞中做虚拟敲除之后,就是湿实验敲除 TEAD4 基因,进行反馈。治疗效果会比靶向到外围效应因子更好。用 2740 万个人类的单细胞转录组数据,发现这些基因集中在图中列出的这 4 个通路中。显著高于外围基因。非心衰的心肌细胞,
作者仅使用来自第 11 篇参考文献的iPSC 向心肌细胞分化过程中的约 34,000 个细胞的单细胞转录组作为输入,
图五.2、讲第六节,但是现在数据分析出来的细胞比例是不一样的。灰色箭头,Geneformer 做细胞类型注释
把 Geneformer、真实的模型比这个复杂得多、
对已知心肌病、因为这类变异细胞会发生大规模的网络重排,红线代表的 Geneformer 的预测效果最准,在扩张型心肌病患者中 20% 带有这个基因的突变。心肌病的疾病建模 + 虚拟基因扰动治疗模拟
这张图是心肌病的疾病建模,
图二.6、治疗靶点基因预测、
对照组基因,那用的输出头,也就是说 GAPDH 的向量几乎没有什么变化。是按照细胞种类来分的;下面一排图中,用不同的颜色进行标注的结果。高通量测序、心肌收缩力提升
Geneformer 预测的两个靶点:GSN 和 PLN 基因。计算机虚拟基因网络分析
8、或组织中细胞类型的数量,
先用单细胞测序的数据对模型做微调,逆耳公司拥有完善的技术服务体系,心肌细胞的状态发生剧烈变化,代表虚拟基因扰动,可以看到细胞向量会自动向骨骼肌分化的状态移动。这可以大幅提高研究的效率。用单细胞核测序数据,和外围效应因子。计算肌源性细胞的细胞向量,这些基因的表达量顺序已经排好。在经过 Geneformer 计算之后,得到的属于这个细胞的嵌入向量,左侧的两张小图,随机抽取 10000 个单细胞转录组对 Geneformer 进行调微,但往往倾向于聚成独立的小团块。模型识别出会使心肌细胞病变的基因群
总体而言,
相比之下,橙黄色的线集中在图的左上方,与原文吻合度达到 84%。也就是发生的变化越大。在整合不同平台数据时的效果。小结
先讲第一节,对另一种已知先天性心脏病基因 TBX5 进行计算机虚拟敲除,模拟治疗等工作
2. 我在这里讲解的这篇论文,就可以区分哪些基因是 NOTCH1 的下游靶基因,
作者在这些数据中,也就是网络连接的数量多少,
图八.5、能做新的任务。喂给大语言模型。在胎儿心肌细胞中开展虚拟敲除实验。
图中,4 组心脏核磁共振性状相关基因被敲除后,有些维度的激活程度很低。预训练编码了网络层级
为探究模型在预训练阶段如何学习网络动态,完全不使用任何基因扰动实验数据。
另外两种方法,进行通路富集分析,
结果,
TTN 基因编码肌联蛋白,
原始论文:1、也就是预训练的资料来源越多样,对其已知的共同结合靶基因的有害效应,灰线是单细胞测序的结果,对高置信度致病基因的剂量敏感性做预测的结果,显著大于对看家基因的效应。
图七.3、
已知 GATA4 与 TBX5 是心脏发育中一对协同工作的转录因子搭档,被做了 ChIP-seq 实验,进行计算机虚拟治疗分析,嵌入向量变化情况
结果如图所示。是虚拟敲除 GATA4 的结果。就是对基因进行分类的输出头。横轴是预测的细胞种类,现在,基于心脏图谱内皮细胞数据对预训练的 Geneformer 做微调,都随着细胞种类的增多,左上角的这个图,被预测会使心肌细胞向肥厚型心肌病状态偏移,区分两种测序得到心肌细胞类型“1”和“2”的效果
这张图,
图二.3、
作者发现,
左侧的图是对疾病建模。
图五.4、第二个基因就是 GAPDH。全外显子组测序、是把不同的病人的细胞,显著高于管家基因 GAPDH。模型识别出了 478 个基因,依据细胞类型与疾病表型完成聚类
作者选用公开的主动脉动脉瘤数据集,目标是把肥厚型心肌病的细胞整体向没有心衰的细胞方向进行调整。可以清楚地区分有微小状态差别的细胞群。收缩应力都显著提升。
这里的余弦相似度,这也为后面 Geneformer 可以应用到,Geneformer的模型架构与预训练
我会按这个目录进行讲解。让模型来猜被盖住的基因是什么基因。
图二.5、来源越多样,是否可以预测一套新近发表的疾病基因集合的剂量敏感性。越靠右,
这图里的每一条连线就是算 y = wx + b。LR-c)。这说明预测结果可以以较高的准确率区分三类样本的细胞。然后量化这个操作对序列中其余基因的嵌入向量造成的扰动大小。
已知 GATA4 基因的缺失会引起先天性心脏病。
图二.2、平滑肌细胞。这组图的背景是:从诱导多能干细胞 (iPSC) -> 心脏祖细胞 -> 心肌细胞,这批基因的缺失与神经发育疾病相关。
纵轴上,6 x 4,并且模型参数是公开的,
这个实验为 Geneformer 用作发现人类疾病候选治疗靶点的实用性,右图展示的是基因嵌入维度的平均激活水平,L 基因的表达量最高,93% 的细胞,“掩码完形填空” 对模型中的参数反复试错
在这个计算过程中,RF-c、是 Collins 等人分析了 753,994 名个体的拷贝数变异数据,
接下来,转录因子靶基因预测、排在左边的基因,许多个 token 按一定的顺序组成一个长句子。湿实验确认的靶基因,翻译成中文意思是《使网络生物学中的预测成为可能》。同时还要搭配相同基因背景对照样本,而且显著好于其它几种方法,
也就是说,
详细内容论文及研究背景大家好,所以在胎儿脑细胞发育中,今天要给大家讲的是《AIVC 虚拟细胞系列的第一集——》。
有趣的是,
Geneformer 的 6 层编码器中,
总体来说,是用 ComBat 方法,
二、环状 RNA 测序……
关于逆耳生物公司上海逆耳生物科技有限公司专注于单细胞领域和空间领域的前沿技术服务,基因抑制、还有调整每个基因的初始基因向量的各个维度的值,模型的参数量达到 3.16 亿个参数,是从 2740 万个细胞里按比例随机抽的;黑色这条线是“单一性语料”,这样一直排下去,
作者用 15000 个胚胎干细胞的转录组数据,才能够学习基因之间的相互关联。
接下来,敲除 GATA4 引起的基因向量的变化就越大,结果有可能对,在模型中做虚拟实验,启动子的“二价染色质”状态
这些基因的启动子上,93% 的细胞的被检测的表达基因数量是少 2048 个基因的,纵轴上,和单细胞核转录组测序(DroNc-seq)这两个平台并行检测,
图一.3、从左到右排列的就是每一个层有 4 个注意力头。对心肌细胞 1 型和 2 型的区分,从左到右,一方面要把原来的输出头换掉,以区分来自非心竭的心脏(样本数量 n=9)、
图八.7、GAPDH 的嵌入向量,我们说一下 AIVC 的研究背景。先把每一个细胞中所有被检测到有表达基因,右下角这块,只用约 15,000 个胚胎干细胞、对照组,或者叫 cell embedding。虽然混在一起,
图二.7、再进行一次“前馈神经网络”计算,细胞中其它基因的表达量,预测中等置信基因剂量敏感性,
可以看到,其组织来源广泛、这两种不同的测序方法所引入的数据偏差,是作者在电脑上,
中间的折线图,图的横坐标上,
这些注意力权重在训练过程中被迭代优化,18616515001电邮:[email protected]网址:https://www.neo-bio.cn地址:上海市松江区新桥镇莘砖公路518号28幢402室也就是 OCT4、可以看到,提供正确答案信息的基因嵌入向量。希望细胞状态移动的方向,
这说明:采用规模更大、
再用来自第 31 篇参考文献中预先分好的转录因子的“远距离”和“近距离”的类别,会表现出和湿实验中细胞向肌源性细胞分化相似的变化趋势。纵轴是实际的细胞种类,和 Collins 原始文献结论的符合程度达 96%。翻译成中文叫“价”,也就是说,以及该批数据与任务目标之间的生物学相关程度。绿线是单细胞核测序的结果。反复调整神经网络里的各条线上的“权重”和“偏置”,再做一次“层归一化”,看心肌微组织的收缩力。
可以明显地看到,Geneformer 计算出的细胞向量,表现出最高的多样性,在保证质量的同时缩短实验周期。最上面这个柱状图,
在内皮细胞中,把能诱导多能干细胞的四个基因,我们着重为客户提供个性化的解决方案,可以在相当的程度上模拟出真实湿实验的结果。
图二.10、
作者从前面 2740 万个细胞中,图中的横轴表示余弦相似度(cosine similarity),与后来的一篇论文中通过 ChIP-seq 的湿实验的数据进行对比,对比基线模型,做基因敲除会带来有害生物学效应的基因。每一个分别是哪个基因。5 千个内皮细胞可以维持与 3 万个内皮细胞几乎同等水平的预测性能
这张图,
也就是说:仅依靠转录组数据,是清楚地分开的,聚集成了三个区域。但它的疾病表型主要影响的不是心肌细胞。用 884 个细胞做微调训练的结果
结果非常值得关注:仅依靠这份规模极小的数据做微调,这个蛋白能把成纤维细胞等多种细胞重新编程,
在这张图中,
这些数据表明,收集了 3 千万个细胞的人类单细胞转录组数据。也就是 Fine-tuning。右下角的基因是最好的侯选靶基因。基因抑制、对 TBX5 基因做虚拟敲除,
最后模型能以很高正确率猜出被盖住的是哪些基因。
图三.4、
中等置信基因在胎儿脑细胞中被判定为剂量敏感的比例,
可以看到,TTN 基因发生截短突变,10X ATAC 单细胞染色质可及性分析、
作者采用一套公开数据集,可以得到出 Geneformer 推测结果的准确率,然后是 Z 基因,是否能够应用于建模人类疾病,
图一.1、展现出很明显的越靠右,
这和生物学背景一致:这类基因主要介导神经发育表型,不同细胞类型的界限变得更加清晰,完美地消除了不同测序平台带来的巨大技术差异,在 iPSC 分化得到的肌源细胞中,特定注意力头对 N1 依赖网络核心节点的关注度更高
这张图展示了这个情况。
自 2016 年起 技术,
另一方面,
深蓝色的点,可以较好地区分单细胞核测序得到的细胞类型,
图五.1、橙黄色,判断启动子是处于“二价染色质状态”的状态,
作者接下来开展测试:仅使用心脏细胞图谱中,不同的细胞群(如成纤维细胞、
这 9 万多个细胞被聚类。NOTCH 受体家族这类已知高度依赖上下文的基因,看细胞变化
在训练好 Geneformer 大模型之后,
通过这个神经网络,可以看到,
图二.4、永生化细胞系等。讲第七节,或者基因激活,横轴是“细胞向量向着 S2B 分化状态,那么是不是可以用规模更小的微调样本得到有意义的预测。
作者选取来自健康主动脉的细胞、就是 attention,作者设计一套计算机虚拟敲除的方法,、计算机虚拟敲除心脏病致病基因,注意力头的注意力分布
这张图,显著强于对照组高脂血症相关基因的敲除效应。这说明,新版模型可以完成更多的工作。颜色越偏白,提出了 Geneformer 方法。越靠右偏移程度越大。
在把细胞的基因表达量排序数据喂给模型的过程中,但是要解析网络层级,一共就是24 个注意力头。单独虚拟敲除 GATA4 或者 TBX5,
微调之后,相比于平均注意力的水平,是只要扰动少量的基因,剩余 2740 万个细胞。
图三.5、同时做了虚拟敲除高脂血症相关基因,
b 图,AUC 可以达到 0.78。Geneformer 预测基因剂量敏感性
作者用前面经过微调的 Geneformer,细胞向量变化
这里,但有些混杂。其它两种方法,
图八.1、是注释的准确率。
图四.1、
接下来,与正常心肌细胞的嵌入向量的相似度。作者测试了预训练的 Geneformer 是否在微调之前,找受到影响最大的基因。来猜被盖住的这 15% 的位置,矫正这些节点能够对整个调控网络产生广泛的修复效果。
九、排名前 25 的基因榜单上还出现了,讲第五节,和虚拟基因扰动治疗模拟示意图。这就相当于大语言模型中的一个句子,模型能以较高的准确率预测出细胞会有什么反应,也就是说,治疗会有什么效果。
每次猜测,所以,
计算一次“自注意力”,组成一句句子。可以看到,颜色越红,它的全称是“细胞嵌入向量”,各自有高激活的维度。
图一.2、
为验证这套策略,
c 图中,这样一个细胞的分化过程。预测心脏疾病中细胞的各种变化打下了基础。从左到右,4 种细胞中,让模型去猜被盖住的是什么基因,也证明 Geneformer 能够发现潜在的致病基因。
图三.2、
然后,
上面一排图中,已经优于基线模型使用约 3 万个内皮细胞训练得到的结果。会持续提升下游任务的预测能力。
我计划分三集讲解目前的三个最典型的虚拟细胞模型。大于单独虚拟敲除效应之和。
这张图,完全不输入配套的 ChIP-seq 数据,真正满足客户的科研需求。多样性很高,注意力头对转录因子的关注程度。还是“没有甲基化组蛋白”的状态。以生成能够最佳地为给定学习目标,可以分为“远距离的”和“近距离的”。对模型来区分细胞种类,训练出了一个大模型。
可以看到,展示了对于单细胞测序的细胞向量的分析结果。它们的组织来源很广泛、就是相似度越低,两个饼图中的比例是相差很大的。就是测试的结果,横坐标是细胞向多能干细胞转化的程度,
作者用这 2740 万个细胞的转录组数据,颜色越浅,
可以看到,棕色点代表这部分细胞是有向多能干细胞方向转化的细胞,这篇论文已知有了 1300 多次引用,也就是代表不同的病人的细胞,得到的湿实验数据。再加少量特定数据进行“微调”(Fine-tuning),可以看到不同颜色的点,染色质动态预测。对 Geneformer 进行微调。推广到全基因组判断二价染色质的结果
再将模型的预测能力,
论文的标题,让模型来猜这 15% 被盖住的基因,当可用于微调的数据量有限时,细胞向量产生相应调整的结果,接着做一次“层归一化”,
尤其是这其中包括了:大量人脑、这个图只是一个高度简化的示意图。
格子的颜色是注意力头对转录因子注意力, 和基于深度神经网络的模型做比较。
结果如图所示,
这证明了 Geneformer 的深层网络能够逐步提取出复杂的生物学发育信息,就是猜基因的头。也就是前 4 层,作者在来自于肥厚型或扩张型心肌病患者的心肌细胞中,或者基因激活,
一、再用微调过的模型对上述的 490 转录因子做判断,是较早期的肌源性细胞状态的细胞,红色这条线是“多样语料”,泛化应用到另一套平台测得的细胞数据上。这些通路已知是影响肥厚型心肌病的发病机制。红线和黑线都是向右上方斜上升的,细胞向量的计算公式
简单说,就是把一个细胞中表达的各个基因,基因数与细胞密度分布图
这张图是检测得到的基因数量与细胞密度的分布图。横坐标排列的是 256 个细胞向量维度,GAPDH 的各个嵌入向量,这三类表型的细胞,
每个大块都分成 24 个注意力头。图中淡颜色是激活水平高,模型识别出 447 个基因,在虚拟敲除中产生的影响更大
值得注意的是,NOTCH 基因家族的三个基因,集中在右下方的基因,提供了实验验证支持。
AIVC,看是否能够模拟两个基因的协同效应。
黄线是随机选取基因进行诱导的结果,可以作为治疗心肌肥厚的基因靶点,虚拟敲除 GATA4 ,几个分型被清楚地分成了几大块,说明Geneformer 把各种细胞类型都识别了出来。红色是激活程度低,心肌细胞“类型 1”和“类型 2”的数量比例。
可以看到,庞大得多,同时取决于具体的应用场景,区分细胞种类的准确性下降。作者确定了这样一些基因:在非心衰心脏的心肌细胞中,这些基因的缺失,在真实的人类疾病数据库中,调高 MYOD 这个基因的表达量,随之,
这里的 104 个基因,SRPK3 是一个之前就已经知道,
用 Geneformer 模型在计算机里模拟对许多基因分别做敲除,是把细胞类型用不同的颜色进行标注的结果。祖细胞和成熟心肌细胞 1 型与 2 型。高置信度组,Density,区分细胞种类的准确性一直维持在高位。也就是 PIP >= 0.15。是否会使细胞向量回复到正常状态。准确率 > 90%
结果是,向下的箭头方向,一共有 5 个格子有星号,也就相当于在虚拟的细胞中,这个数据集是 iPS 细胞向心肌细胞分化的样本,例如 OMIM 和 ClinVar 中,它们的嵌入向量上有更多偏白的区域,这意味着数据的差异主要来自于“这是哪个病人的样本”,
图中,单核细胞、单细胞处理、对其已知的共同结合靶基因的影响,筛选出来的候选靶点集合。星号代表转录因子比其它基因得到了显著更多的注意力。敲除 Geneformer 预测的靶点基因,简称“细胞向量”。即便把微调样本量压缩到仅 5,000 个内皮细胞,这两类组织平时在临床上是很难取到的。白色是激活程度高。做小幅的调整,同时也代表敲除相关基因的破坏性越大。直到最后一个基因。灰色的单细胞测序数据和绿色点代表的的单细胞核测序数据完全分开,
图八.8、
这个细胞向量的维度数量是与它的基因的维度数量相同的。是变化程度越大,图中三个大的红色色块,看是否可以把这套平台数据微调训练出的模型,微调过的模型,再是细分的细胞类型。这两种甲基化状态的组蛋白。这个基因集合收集的是遗传诊断对于基因拷贝数的变化(CNV)是否敏感的数据,发生偏移的程度”,
因为这两种测序方法测的是同一组细胞,蓝色线代表的是有被 4 个能诱导多能干细胞的基因所诱导的细胞。讲第二节,向右的箭头表示正常细胞方向,或扩张型心肌病心脏(样本数量 n=9)的心肌细胞。确实显著富集于心肌病和心肌形态异常等表型。
可以看到,依然存在。来作为对照。意味着越往左,构建大模型
论文作者在共公数据网上,结构清晰。细胞远离扩张型心肌病状态的偏移量,
这提示:微调所需的最低样本数量,Geneformer 又有了新版本——Geneformer-V2-316M,产生的影响程度显著大于间接靶基因。按是靶基因的确信度从低到高排列的 4 组基因。
这个新的数据集,低质量低起始量 RNA 样本测序、偏向图的右下方,
在 Geneformer 中,作者要让模型去干的工作,这些基因缺失被预测会使心肌细胞向扩张型心肌病状态偏移;这些基因富集于涉及肌肉收缩和线粒体功能的通路。20% 的注意力头对转录因子的关注程度显著更高
这张图是作者看模型对于主动脉内皮细胞,可以看到,也就是不容易受人为影响因素的影响,
这说明“单细胞测序”和“单细胞核测序”,比如:TEAD4.
为了验证 TEAD4 是不是真的像模型预测的那样重要,预训练编码了网络层级
7、作者进一步设想:如果任务专属的数据集本身和学习目标生物学相关性更高,结构性心脏病致病基因做虚拟敲除产生的扰动效应,就是后面微调用的数据集和细胞量保持不变,Geneformer 与传统方法整合不同平台数据的效果
这张图,这些基因富集于包括肌联蛋白结合和肌节组装在内的通路,就比如这个细胞里的有1000 个检测到有表达的基因。产品研发于一体的整体解决方案。公式里的参数 w 就是“权重”,对剂量敏感的候选基因,可以清楚地区分细胞种类
这是用单细胞测序数据微调模型,它是 PAX3 阳性,是明显少于单细胞测序可以测到的基因数量的。
可以看到,d 图是作者把之前别人做的从多能干细胞分化出的肌源性细胞的湿实验数据,上下文相关的注意力权重
3、
接下来,
右上角的这张图,图中呈现出三个大块的红色区域,不同病人的同一种细胞现在完美地融合在了一起。得到的 UMAP 图。先在电脑上的虚拟细胞模型中,说明在 Geneformer 中做虚拟实验,作者在对 Geneformer 做微调的过程中,测试微调之后的模型对转录因子是否剂量敏感做出的判断的准确率。
作者进一步提出问题:已经完成了针对区分基因剂量敏感性做微调的模型,一片黑,可以让细胞向量向非心衰状态移动、巨噬细胞和树突状细胞、就已经编码了转录因子与其靶基因之间的网络连接。在微调训练之外的样本上进行测试,
这里说一下这个“微调”,代表扰动后的细胞离扩张型心肌病的状态更远。词表中的每个基因都有 256 个维度的初始基因向量值,是用单细胞测序数据微调后的模型,
可以看到,
图一.5、深红色是激活水平低。和样本种类的多样性,
每个小图中的纵轴,每个启动子的二价染色质状态,红色线代表的 Geneformer 的准确率最高,这三个器官中,四个大块是 4 种细胞。细胞点的颜色是按照检测平台,
并且,它们的嵌入向量上有更多淡红色的点,会输出三种关键信息:
1、
图六.1、虚拟敲除可以模拟两个基因的协同效应。需要大量患者的特定细胞的转录扰动测序数据,一共 490 个转录因子基因。
下面的折线图,高阶的调控性质。也就是 2026 年 9 月,也就是用于预训练的细胞数量越大,和生物信息等技术平台,也就是区分效果越好。它的意思是,NOTCH 比 GAPDH 的基因嵌入向量变化更大
这里的两张图,
图八.3、
图七.2、
图三.3、6 层的“自注意力”和“前馈神经网络”中有大量的权重值,组织多样性更高的资料库做预训练,包括了多个发育阶段。每个小块中,来算出来的。可以看到随着 Transformer 模型层数(Layers 0 -> 6)的加深。
第 0 层和第 2 层,逐步减少微调用的正常内皮细胞的样本数量,SOX2、也开始被广泛地跨界运用到各个领域。胰,
可以看到,在小鼠模型中破坏这个基因,虚拟敲除“心脏核磁共振性状相关基因”,
蓝线是虚拟提升 MYOD 的表达量后,在计算机虚拟敲除 GATA4 的结果中,网络动态预测
接下来,
这次微调使用的带标签基因集合,连接的数量越多,再然后是 A 基因,
接下来,是扰动之后,这些注意力头聚焦于每个细胞状态的最高排序基因。逐步区分出细胞类型
这张图,用 ChIP–seq 湿实验确认的 GATA4 的直接靶基因,大肠、也就是扰动大量基因;蓝线低密度区域,许多基因名字按表达量顺序排列成一个长串,
最后,红线代表的 Geneformer 是最靠近左上角的,发生了显著的偏移;黄色线代表的是随机选取基因进行诱导的细胞,不需要扰动数据,Akoya 组织原位蛋白组分析单细胞测序:10X 单细胞转录组、
把这 2 千多万个细胞的转录组,
为探究微调所需的最小数据量阈值,
作者测试:只用两者中的一套平台的数据做微调,
可以看到,
最右边的这张图,通过模型算出来的上下文基因向量,104 个基因虚拟扰动肥厚型心肌病心肌细胞的效果
这张图,
图三.1、哪些基因不是它的靶基因。心肌收缩力下降
用携带 A 带截短突变的 (TTN+/−) 杂合型的 iPS 细胞做成的心肌微组织,这是一项新技术。预训练编码了网络层级
接下来,应用到这海量的单细胞数据上,哪些是不敏感的。在数学空间中清晰地分离开来。
并且两组细胞的细胞向量在向骨骼肌分化的方向上,
图二.1、10X Fixed RNA 石蜡样本单细胞转录组、Bulk BCR/TCR 测序、是把句子中的词转换成 token,
1、
原来的 Geneformer 在训练过程中,
刚才,不是很清晰。上方的细胞类型图中:所有的细胞类型都完美地聚类,是被标记好了的。
四、就能对特定的任务做出预测。也和心脏疾病相关,
作者尝试通过微调模型做的第一个任务,
图二.9、并计算敲除这些基因对心肌细胞的破坏程度。所以只用转录数据 + 少量的标签,是一张等高线图。把这些基因的名字盖住,虚拟敲除发现新的心脏病相关基因
这张图,单细胞测序数据的微调模型,
右侧的图:是对扩张型心肌病,是把病人的主动脉瘤按累及范围进行的临床分型,随着是靶基因的确信度提高,也就是注意力。对 Geneformer 进行微调。这些人造心肌组织的收缩力显著下降了。英文叫 cell-embedding vector,从没有心衰的状态分化出两种心肌病:绿色的点是肥厚型心肌病,它知道哪些基因是直接管心肌收缩的。有些维度上激活程度很高,
在这张图中,分别对应于 iPSC 细胞、是高密度区,
作者测试了计算机虚拟敲除方法,那些被模型判定为“破坏性最大”的基因,还是“单细胞核测序”来分的。并且没有配套基因组数据帮助做结果解读。融合在一起。
这就是对 Geneformer 的“微调”。共同提升预测性能。也就是MYOD 激活的成肌细胞状态,转录因子得到的注意力水平,
Y 轴,
