尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
方法分享--ResolVI:解决空间转录组学中的噪声与偏差
作者Evil Genius祝大家国庆快乐。今日我们分享文献摘要在完整组织切片中、以高空间分辨率、高通量估计RNA表达的技术空间转录组学为细胞如何通讯以及组织如何运作提供了新见解。分析亚细胞分辨率空间转录组技术生成的数据的一个基本步骤是定量即分割平面内区域每个区域近似一个细胞然后汇总每个区域内的分子以估计细胞表达谱。尽管该领域有许多进展一个持续存在的问题是分子到细胞的错误分配这限制了当前许多应用只能停留在预先定义的细胞亚群水平并使新细胞状态的发现复杂化。本研究开发了resolVI一个在任何分割算法下游运行的模型生成概率表示校正分子错误分配以及批次效应和其他干扰因素。研究证明resolVI提高了区分细胞状态、识别空间中细微表达变化以及跨数据集整合分析的能力。ResolVI作为scvi-tools中的开源软件提供。引言空间转录组学的机遇空间转录组学ST为研究组织结构和功能提供了强大工具。一类快速发展的ST技术以低于细胞大小的分辨率运行从而允许表示组成组织的单个细胞及其RNA表达谱。这些表示为研究细胞如何在其组织背景中运作以及通过细胞间相互作用塑造组织功能提供了新机会。高分辨率ST技术的分类高分辨率ST技术大致分为两类一类依赖于对结合到亚微米空间条形码斑点的RNA进行RNA测序RNA-seq另一类依赖于对单独标记的RNA分子进行成像。为了从这些测量中获得组织的细胞分辨率视图必须进行细胞分割。即将组织分成小区域每个区域代表一个细胞并计数每个区域内的分子以估计每个细胞中每个基因的表达。分割算法的挑战用于ST分割的早期算法包括来自显微镜的遗留方法依赖于描绘单个细胞核或细胞膜的组织图像。尽管该领域最近有进展正确界定细胞边界仍然困难主要注意事项包括高细胞密度、细胞染色信号弱和不规则细胞形状。结果推断的片段可能无法正确区分细胞的数量或形状。这导致随后的表达定量错误产生错误的表达估计例如暗示来自不同细胞谱系的标记基因的共表达。扩散现象最近旨在解决这一问题的方法包括观察到的RNA分子作为额外信息源来帮助指导分割。尽管这种分割和定量的耦合在很大程度上提高了准确性但上述问题仍然存在如本文所证明。事实上除了分割困难外还有一些直接与定量步骤相关的注意事项一些分子出现在错误细胞的边界内。这种所谓的扩散现象可能由组织处理问题导致的RNA分子泄漏或细胞在第三垂直于profiled平面维度的重叠引起该维度通常以低分辨率和受限通常几十微米宽度进行profiling。ResolVI的开发为了解决这些挑战研究团队开发了resolVI一个用于表示ST数据的概率框架同时考虑分割和定量中的错误。ResolVI不是从头解决这个问题而是在任何分割和定量算法下游运行将细胞中基因表达的初始估计作为输入。其基础是认识到信号扩散是一种应该被表征然后控制的伪影。依赖于自编码变分贝叶斯resolVI提供伪影校正的和概率的细胞低维表示及其基因表达谱估计。通过一系列基于图像和测序技术的测试案例证明resolVI大幅提高了识别细胞群体的能力。此外证明resolVI能够消除错误的共表达模式同时保留反映细微细胞群体的意外共表达模式。概率模型使差异表达和细胞共定位的稳健假设检验成为可能。ResolVI作为scvi-tools下的开源项目提供。结果部分 1ResolVI概述输入与输出ResolVI的输入是细胞中基因表达矩阵、它们各自的空间位置和各自的组织切片如果有多个组织切片。这些矩阵由任何定量算法从原始ST数据斑点的RNA-seq或单个分子的位置生成。ResolVI的输出是每个细胞状态的伪影校正的概率低维表示以及其表达谱的估计校正了伪影。模型架构为实现这一点resolVI使用变分自编码器VAE推断的潜变量模型。模型将观察到的计数表示为三个组分的总和相应细胞中的真实表达、来自邻近细胞的表达和由于非特异性背景每个组织切片恒定的表达。细胞中的表达前两个组分使用负二项分布建模。对于第三个组分背景假设无过度离散并使用泊松分布建模。每个细胞中的计数从反映其细胞状态的低维潜在表示生成。对细胞状态的不确定性使用高斯混合分布表示。与VAEs中使用的标准单峰方法不同这种选择有助于更好地区分细胞类型并为用户提供在训练期间包括预定细胞类型标签的选项。模型估计模型通过优化证据下界ELBO估计由三个神经网络组成表达编码器从观察到的计数估计细胞状态。表达解码器给定细胞状态生成真实表达。扩散编码器为每个细胞估计三个组分真实表达、邻居和背景的权重。解码器网络接受每个细胞的批次ID作为输入而编码器默认不接受有助于减轻批次效应。ResolVI能够区分真实和错误计数的直觉在于其隐含期望数据可以用低维编码描述。由于定量错误观察到的表达谱可能比真实表达谱更复杂。因此最小化ELBO损失鼓励将不相关分子分配给背景组分或邻近细胞。计算性能ResolVI的实现设计使用图形处理单元GPUs加速训练。所有实验在配备Nvidia 3090 GPU和128 GB内存的工作站上进行。最大的测试案例包括来自52个切片的140万个细胞训练时间不到6小时。相比之下分割单个中等规模实验的切片需要从使用ProSeg的数小时到使用Baysor的数天。因此将resolVI纳入工作流程仅增加很小的计算开销。结果部分 2ResolVI提高小鼠脑数据中的细胞类型分辨率并校正虚假共表达模式小鼠脑数据使用荧光-based 10x Xenium技术profiled的正常小鼠脑单切片。该数据集包含248个基因面板已被原作者分割为13万个细胞。分割和定量程序基于细胞核分割和随后的扩张这将组织分成围绕每个细胞核的凸多边形。计数每个多边形内的分子以估计各自的表达水平。由于数据没有细胞类型标签应用了依赖于细胞类型标记物手动curation和标签转移的注释策略。无监督和监督模式应用resolVI于观察到的表达计数使用两种模式无监督模式仅使用基因表达数据和细胞位置。监督模式通过将高斯混合先验的模式与不同细胞类型连接并添加一个细胞类型分类器以潜在空间坐标为特征预测细胞类型考虑细胞类型标签。细胞类型区分无监督resolVI模型推断的潜在表示可视化表明其很好地捕获了细胞类型间的区分特别是与观察到的表达计数的PCA分析相比。使用scib-metric生物保守性度量量化这一点。scib-metrics还提供了评估批次效应校正程度的方法。由于在此情况下不适用数据由单个切片组成将细胞分为resolVI估计的低和高错误表达率。当分配给扩散或背景组分的分子比例即α1α2大于20%时定义细胞为高错误率。期望良好的整合方法将相同类型的细胞拉在一起尽管错误分子分配率作为数据质量的代理存在差异。发现添加监督提高了resolVI整合低质量和高品质分割的能力。此外resolVI无论有无监督在生物保守性和批次校正方面均优于scANVI后者也使用回归、scVI和PCA。扩散率估计ResolVI估计每个细胞的扩散率即所有基因中来自邻近细胞的计数比例。考虑其空间分布发现高细胞密度区域特别是皮层和丘脑有高扩散率可能是因为细胞密度使这些区域更难分割。预测基因表达分析关注小胶质细胞因为它们在resolVI校正前形成几个簇。这些细胞表达Trem2支持其标记为小胶质细胞。然而在下丘脑高预测扩散区域这些细胞也对Slc17a6呈阳性这是兴奋性神经元的标记物。相比之下运行resolVI后小胶质细胞中Slc17a6的假阳性表达大幅减少而这些细胞仍被预测表达Trem2。这突出resolVI可以减少虚假表达模式可能由分割过程中细胞边界描绘错误引起同时保留正确的表达模式。广泛量化使用来自小鼠脑的单细胞RNA-seq数据集识别对不同细胞类型特异性的基因因此不期望由同一细胞表达。评估每对细胞类型的错误双阳性程度使用各自细胞类型标记基因的归一化总和的余弦相似性。发现resolVI生成的校正数据包含比原始计数显著更少的错误双阳性。使用基因对水平统计确认这些发现发现resolVI检测为高质量的细胞显示相似的共表达模式。重要的是resolVI不强迫数据符合细胞类型及其标记物的先入之见。例如虽然许多错误共表达模式被移除resolVI仍然预测内皮标记物和Lyz2的共表达后者通常是髓系细胞的标记物。内皮细胞确实可以表达Lyz2这在各自的单细胞RNA-seq数据集中不明显。这突出resolVI可以识别和保留意外的共表达模式甚至那些被单细胞RNA-seq遗漏的模式。另一验证探索每个细胞推断的虚假信号程度即α1α2与同一细胞类型标记物共表达水平真阳性对或不同细胞类型标记物共表达水平假阳性对之间的关系。总体而言考虑预期共表达的基因对发现原始和校正计数之间的双阳性率相等并且与估计的虚假信号率无相关性。相比之下对于不应共表达的基因对应用resolVI后发现共表达明显减少。最后发现resolVI对虚假信号程度的估计在没有细胞类型标记物知识的情况下计算明显随着假双阳性数量的增加而增加基于细胞类型标记物知识。结果部分 3在不同分割场景下评估ResolVI分割算法的影响分割算法的选择可以显著影响分子到细胞的错误分配程度。研究分割算法选择对resolVI下游分析质量的影响。Baysor和ProSeg分割从图2的脑切片开始使用Baysor和ProSeg添加了三个分割两者都使用基因表达信息更好地描绘细胞间边界以及使用10x分割管道无额外扩张的细胞核分割。将图2的细胞类型标签转移到每种分割生成的细胞以注释细胞然后使用预期或不预期由同一细胞类型表达的基因对列表量化错误分配程度。发现分割算法的选择有显著影响表达感知算法产生更低的错误双阳性率。然而这种明显的错误分配仍然存在。将resolVI下游应用于每种分割发现它明显减少两种情况下剩余的错误的双阳性数量。最近提出了其他算法用于校正基于图像的ST。Ovrlpy校正由于3D中重叠细胞导致的分子到细胞的错误分配并在将分子分配给细胞之前移除这些分子而ProSeg在学习校正的基因表达模式的同时执行分割。发现两种算法都未能移除大多数错误信号而resolVI减少错误信号而不减少在scRNA-seq数据中共表达的分子共表达。癌症活检数据集添加第二个更复杂的用例聚焦于癌症活检。使用来自两名患者的两个肝癌活检数据集使用Vizgen MERSCOPE平台profiled。该数据集包含约150万个细胞和550个基因面板。考虑六种分割算法作为处理这些数据的替代方案。四种方法不使用基因表达数据包括Vizgen MERSCOPE的原始分割和在Vizgen后处理工具中实现的三种Cellpose设置使用单层或三层z层的细胞分割以及三层z层的细胞核分割。作为另外两种方法使用表达感知的Baysor和ProSeg。发现使用这两种表达感知分割算法时分子到细胞的分配更高Baysor膨胀了分割细胞的数量。由于该数据集未提供细胞类型标签手动注释ProSeg分割细胞使用标记基因然后将这些标签转移到所有其他分割。整合和细胞类型区分无论分割算法如何发现当比较resolVI的潜在空间与PCA或Harmony计算的嵌入时两个组织切片之间的整合和细胞类型间的区分明显改善。这在考虑密切相关的细胞类型如B和T淋巴细胞之间的区分时尤其突出。此外发现两种表达感知分割都改善细胞类型间的区分无论是在应用resolVI之前还是之后表明将充分的分割与resolVI结合提供了良好策略。双阳性率估计使用来自健康肝脏的单核测序数据集作为参考估计该数据集每个定量中的真和错误双阳性率。在添加resolVI之前发现不同分割产生相似比例的真双阳性率表达感知的Baysor显示最低的错误双阳性率。应用resolVI将所有情况下的双阳性率降低到可比水平。个体基因对分析考虑Baysor和原始分割中个体基因对的双阳性率真和错误。在原始分割中发现resolVI导致错误双阳性明显减少。然而错误共表达仍然存在例如成纤维细胞标记物与其他谱系特别是髓系和内皮标记物共表达。当比较观察到的表达与原始分割和Baysor分割后的估计时发现这些共表达模式大幅减少并在应用resolVI后变得更少。这突出resolVI的校正准确性在一定程度上取决于初始分割的质量。重要的是并非所有根据单核参考意外的共表达模式都被resolVI消除。例如resolVI估计VEGF在单核数据中显示为成纤维细胞标记物与内皮标记物共表达。VEGF是一种生长因子在缺氧条件下特异性自分泌作用于淋巴内皮细胞。缺氧是肿瘤的常见特征这解释了为什么在癌症中除了成纤维细胞外VEGF也在内皮细胞中表达。再次比较resolVI的估计与使用Ovrlpy和ProSeg校正生成的计数。ResolVI减少互斥基因对的雙阳性表达量而两种其他方法几乎没有任何改善。结论是使用Baysor作为初始分割步骤对下游分析表现最佳在本文其余部分提供Baysor分割的结果。结果部分 4ResolVI促进大型测序数据集的分析Stereo-seq数据集基于测序的ST可能显示类似的虚假双阳性问题。由于这些测定中通常捕获大量基因表达感知分割算法无法容易地应用因为它们需要过多内存分割使用更简单的方法执行。作为第三个测试案例使用Stereo-seq2 profiled的冠状小鼠脑的基于测序数据集评估resolVI。该数据集包括超过24,000个检测基因和超过50,000个细胞。与大多数表达感知分割方法不同resolVI可以高效应用运行时间小于20分钟内存使用低于30 GB以所有基因作为输入。发现应用resolVI后错误标记基因共表达量明显减少。例如在原始表达数据中14.8%的对神经元细胞类型标记物Slc17a7呈阳性的细胞也对少突胶质细胞标记物Mbp呈阳性。在resolVI生成的计数中这种模式基本消除0.01%的Slc17a7阳性细胞。此外resolVI推断的细胞嵌入和校正计数大幅提高将细胞分层为细胞类型的能力。小胶质细胞在原始数据中难以区分而在resolVI的潜在空间中清晰区分。这在标记基因如Trem2、Csf1r、C1qa和Ctsx的表达中明显。最后resolVI生成的计数有助于区分抑制性Gad1和Gad2和兴奋性神经元Slc17a7。Visium HD数据集还将resolVI应用于使用10x Visium HD收集的近期数据集。该测定以2 μm的空间分辨率捕获RNA转录本。使用8 μm分箱数据而非分割细胞如制造商推荐。这产生453,820个斑点17,797个表达基因。ResolVI在所有可用基因上训练20分钟。发现应用resolVI后错误标记基因共表达量减少。使用resolVI生成的潜在维度和PCA对该数据集进行UMAP嵌入和聚类。识别出一组表达Slc6a1和Gad1的神经元在PCA-based UMAP嵌入后与兴奋性神经元重叠。应用resolVI后能够区分这些神经元的多个亚群包括皮层VIP神经元、SST抑制性神经元和NPY抑制性神经元。这些神经元表现出 distinct 的空间位置。ResolVI有助于在Visium HD数据中揭示充分描述的神经元群体并使其空间模式研究成为可能。结果部分 5ResolVI揭示人类肝癌中功能相关的空间域肝癌数据集为了在实际分析场景中评估resolVI将其应用于健康和癌性肝脏样本的比较研究使用Nanostring CosMx2 profiled包括1,000个基因和120万个细胞。尽管这些数据由作者使用非表达感知方法分割选择用Baysor重新处理因为其与resolVI的组合在之前的评估中提供了有效策略。通过转移原始数据集提供的注释使用InSituType分配标记新分割的细胞如之前部分使用resolVI并使用细胞类型监督的resolVI模型进行进一步分析。健康肝脏分析肝细胞通常沿肝小叶表现出强区带化模式SAA1标记门静脉周围区域而GLUL标记中央静脉周围区域。基于这两个标记物表达水平差异的肝细胞区带化在resolVI校正和未校正数据仅Baysor中都清晰可见。在门静脉周围区域进一步期望看到表达SOX4、KRT13和EPCAM标记基因的胆管细胞这些基因通常表达水平低于GLUL和SAA1。在未校正数据中发现这些低表达标记物也在中央静脉周围区域检测到而运行resolVI后它们表现出清晰的门静脉周围模式。为证实这一点发现这三个基因在校正前在各种细胞类型中大量表达而运行resolVI后它们的表达对胆管细胞特异性。这种校正证明了考虑背景表达的价值图1α2组分因为这种错误信号不是来自空间邻近细胞的真实表达因为这些标记物在中央静脉周围区域的任何细胞类型中都不表达。共表达分析使用来自健康肝脏的单核测序参考发现校正健康肝脏样本后意外基因对例如髓系细胞和胆管细胞的基因对的共表达大幅减少。相比之下考虑癌性样本时发现髓系和胆管细胞标记物之间的共表达即使在resolVI校正后仍然存在。观察个体基因对这种剩余信号是由于SPP1和髓系标记基因如CD68的共表达。进一步检查校正数据突出癌性肝脏的独特性质其中肿瘤相关巨噬细胞表达SPP1这是其与肿瘤细胞相互作用的关键介质。肝癌细胞空间异质性鉴于应用resolVI后共表达模式检测改善的证据接下来研究肝癌细胞中的空间异质性。首先应用基于自相关的热点算法使用空间坐标评估细胞-细胞邻近性以及resolVI校正计数来检测空间共表达基因模块。该分析揭示两个模块由肿瘤内不同位置的癌细胞表达。为全面研究这些位置肿瘤细胞之间的差异将lvm-DE算法使用潜变量模型的差异表达适配到resolVI生成模型。发现在模块2区域抗炎基因如MIF、ENO1和SPP1以及缺氧标记物如SOX4、VEGFA和VEGFB上调。这种组合突出一个缺氧区域其中癌细胞表现出免疫抑制功能。在另一个区域干扰素调节基因如MX1、IFI6、STAT1和OAS2上调表明促炎功能的相反趋势。肿瘤微环境影响为研究这些生态位对癌症微环境的影响接下来关注健康和癌性肝脏中的巨噬细胞。这些细胞的亚聚类揭示健康肝脏中表达Kupffer细胞标记物的髓系细胞与肝癌中表达免疫抑制和促炎功能的标记物的群体之间的区分。促炎亚群表达IFI27、IFI6和CXCL9而抗炎群体表达SPP1、ENO1和MIF。抗炎巨噬细胞还表达最高量的TGFBI这是癌症中免疫抑制的关键细胞因子。两个巨噬细胞亚群存在于肿瘤的不同区域。抑制性群体以及中性粒细胞群体表达S100A8和S100A9与表达SPP1的免疫抑制肿瘤亚群共定位而促炎巨噬细胞与促炎癌症亚群共定位。将分析扩展到T细胞能够识别T细胞状态如Tres和CXCL13-high CD8细胞它们在促炎区域富集而免疫抑制区域缺乏T细胞浸润。总之resolVI帮助揭示肝癌样本中的空间区室化具有 distinct 的肿瘤状态、免疫微环境和浸润模式免疫抑制区域中的中性粒细胞和促炎区域中的T细胞。结果部分 6ResolVI揭示DSS结肠炎后不完全再生DSS结肠炎数据集为了在大型研究中基准测试resolVI使用最近关于葡聚糖硫酸钠DSS诱导结肠炎的研究这是炎症性肠病的小鼠模型。作者使用MERFISH研究了急性暴露于DSS后不同时间点的小鼠使用990个基因面板和52个样本中共140万个细胞。第3天样本指示炎症的初始迹象而第9天样本显示最高量的组织损伤。第21天组织恢复明显而第35天在原始论文中描述为几乎完全恢复的结肠。无监督ResolVI模型作者已使用三个粒度级别注释了该数据集从第0天到第21天的部分对上皮和基质群体具有特别高的粒度。为审查此注释首先在该子集上训练无监督resolVI模型。发现resolVI推断的真计数少于20的细胞不表达大多数标记基因并且位于意外位置。因此从进一步分析中排除这些细胞。此外从在无监督resolVI嵌入中邻域混合不同细胞类型的细胞中移除细胞类型标签。半监督ResolVI模型使用每种细胞类型剩余的高置信度标记细胞并为其他细胞不提供标签然后训练半监督resolVI模型即仅对某些细胞可用标签信息。使用该模型通过resolVI的细胞类型分类器重新标记所有细胞。确认这组新标签显示与标记基因的改进匹配。为resolVI实现了类似于scArches的网络手术程序并使用该程序将第35天样本整合到参考模型中不影响第0-21天样本。细胞类型标签转移使用resolVI进行。总体而言发现每个时间点内样本的良好整合特别是使用监督模型而不同时间点在潜在空间中显示 distinct 分布由于持续的结肠炎。细胞类型频率分析根据各自的细胞类型频率表示所有时间点发现与疾病前组织偏差最大的是DSS攻击后9天。最低偏差在恢复阶段DSS后35天。然而即使在这个晚期时间点一些差异仍然存在。在上皮细胞中观察到第3天向炎症相关上皮亚群1IAE1转变第9天亚群2和3IAE2/3第21天修复相关上皮细胞。在第35天发现更多goblet 2细胞但更少过渡扩增TA细胞。为量化这一点执行差异细胞类型丰度测试将Milo应用于第0天疾病前与第35天样本的resolVI嵌入。发现第35天干细胞、结肠细胞和TA细胞减少。此外确认原始研究的发现报告第35天浆细胞、成纤维细胞4和炎症相关成纤维细胞2IAF 2增加。空间背景分析为研究其空间背景的变化接下来考虑小组织区域的组成而非单个细胞。为此用其最近30个空间邻居中预测细胞类型频率的向量表示每个细胞。这些表示在UMAP中的嵌入表明第0天和第35天之间邻域组成的显著重连特别是围绕2型成纤维细胞在原始研究中被解释为隐窝尖端成纤维细胞。具体而言发现第35天2型成纤维细胞与TA细胞、结肠细胞和goblet细胞共定位减少使用resolVI内的差异共定位测试。相比之下发现2型成纤维细胞与基质细胞如IAF 3、Fibro 6和2以及不同巨噬细胞的共定位增加。考虑Fibro 2的空间组织发现这些细胞在第0天散布在结肠隐窝之间到达每个隐窝的顶部。相比之下在第35天观察到Fibro 2细胞在黏膜下层的密集聚集体。为研究基因表达变化首先识别与结肠细胞共定位的Fibro 2细胞的标记物通过计算与干细胞共定位和与结肠细胞共定位隐窝尖端的那些细胞中的差异表达基因。发现几个Bmp基因表达增加这些基因对结肠细胞沿隐窝轴的正常发育至关重要。与失去与结肠细胞共定位的Fibro 2细胞一致还发现第35天Fibro 2细胞中Bmp基因表达减少。证实上皮细胞成熟中断虽然在第0天沿隐窝轴发现干细胞向结肠细胞转变的 distinct 梯度在第35天观察到上皮层组织的整体中断。为研究这些中断在第35天高结肠细胞密度区域和其他区域之间进行差异表达分析。发现许多结肠细胞区域中屏障促进基因如Cldn4、Cldn23、Tnfaip3和Il22ra1的高表达。这假定即使在急性DSS炎症后很长时间和宏观再生已经发生后屏障功能仍然丧失。屏障通透性增加是炎症性肠病的已知问题即使在急性炎症控制后也是如此。讨论核心贡献开发了resolVI一种概率建模方法用于清理ST数据分析中的噪声和偏差。在细胞水平分析ST数据集需要细胞分割。不正确的细胞分割将分子分配给邻近细胞导致虚假共表达模式。证明在依赖图像数据或分子位置的各种分割方法中虚假共表达存在而resolVI在所有测试技术和分割算法中减少这种共表达模式。错误共表达模式通过使用文献curated的基因以及从scRNA-seq数据中共表达模式curated的基因建立。在真实数据中建立金标准共表达模式具有挑战性结合两种方法作为基准分割算法的既定代理尽管证明这些基因列表高度依赖于上下文应用于新上下文需要审查。虽然resolVI减少所有分割中的偏差但其性能取决于初始细胞分割的质量。发现使用Baysor分割时假共表达量最低。在实践中推荐使用ProSeg进行初始分割因为Baysor倾向于分割许多只有少量分子的细胞膨胀细胞数量。下游分析改进显示使用resolVI改进细胞类型分辨率、整合和下游分析如不同空间生态位之间的差异表达和差异邻域组成分析。ResolVI使用变分自编码器瓶颈层鼓励校正计数数据因此对潜在空间的选择敏感。为减轻这一点resolVI可以在监督模式下使用其中细胞类型标签提供给算法以改进基因表达校正。在整篇论文中执行计数的归一化处理并将每个细胞的计数视为干扰因素发现技术伪影是每个细胞计数的主要驱动因素。然而resolVI还允许按细胞大小归一化因此也可以应用于建模分子密度。这对于差异表达测试尤其关键其中偏斜的基因面板可能偏倚差异表达基因的检测。肝癌应用将resolVI应用于人类肝癌研究证明具有促炎和抗炎表型的癌细胞异质空间生态位以及髓系和T细胞表型的相应变化。此外证明resolVI生成的表达保留肿瘤和健康组织之间的基因表达差异。DSS结肠炎应用为突出resolVI的下游能力将resolVI应用于DSS结肠炎的纵向分析。证明resolVI可以有效地将查询样本映射到现有参考数据集。为进一步改进整合和执行标签转移在resolVI中提供半监督模式提供细胞类型预测的不确定性。使用这些不确定性提供空间邻域的空间生态位嵌入和空间邻域内细胞类型差异丰度测试的框架。使用该框架发现DSS结肠炎后35天隐窝尖端成纤维细胞位置的变化。此时期望健康结肠的恢复。然而这些成纤维细胞在健康小鼠中定位于隐窝尖端并向肠上皮细胞提供Bmp信号而DSS结肠炎后这些细胞与其他成纤维细胞在黏膜下层聚集体中共定位。与Bmp信号减少一致证明屏障促进上皮细胞频率减少。人类炎症性肠病样本的ST将揭示这些发现的转化相关性。ResolVI是scvi-tools框架的一部分目前示例在GitHub - scverse/scvi-tools: Deep probabilistic analysis of single-cell and spatial omics data · GitHub。方法模型ResolVI假设细胞n和基因g的观察表达x_ng从由细胞真实表达z_n、错误分割的邻近细胞N(n)的基因表达和背景基因表达bg_g定义的潜在状态采样。生成模型使用高斯混合先验、Dirichlet分布、指数分布和Gamma-Poisson公式。α_n0...2是通过扩散编码器学习的混合比例该编码器以细胞自身的基因表达x_ng为输入。背景使用Poisson分布建模真实表达使用负二项分布。f_θ是细胞n和所有邻近细胞共享的解码器函数。β_nN(n)是每个邻居对扩散引起的表达的贡献。使用MAP推断这些参数不进行摊销。使用径向基函数核将距离信息纳入Dirichlet先验。背景使用Dirichlet(1)先验为每个批次s单独学习。数据增强在ST中发现大量低计数细胞。编码器倾向于不正确编码这些细胞的信息。然而在ST中过滤低计数细胞减少关键见解如细胞-细胞相互作用或空间生态位嵌入。因此选择每个细胞20个分子的低截止值进行过滤然后运行resolVI。为增加低计数细胞的信息在训练期间使用多项采样重新采样表达x_ng然后将这些采样的计数输入表达编码器。实现ResolVI构建在scvi-tools内使用Pyro作为后端支持GPU加速计算。使用十个潜在维度用于编码器编码器有两个隐藏层编码器中dropout率为0.05编码器每个隐藏层128个节点解码器每个隐藏层32个节点。不编码协变量既不是潜在编码器也不是混合比例编码器而解码器使用批次ID作为协变量。使用自定义guide函数实现摊销。对于α的摊销使用默认scVI编码器3D输出无dropout使用softmax激活函数。在训练期间不计算f_θ中x_N(n)的梯度。因此对于邻近细胞仅应用推断而对于细胞n解码器被训练。这提高稳定性和训练速度。每个resolVI模型包含五个 distinct 模型(1) 无条件模型(2) 通用模型(3) 校正模型(4) 残差模型(5) 简化模型。大小归一化在resolVI中执行计数归一化。作为替代建模方案使用物理细胞大小a_n面积或体积并学习每个细胞的缩放因子β_n。动机是假设细胞内RNA分子密度的变化是由于细胞状态之间基因表达的生物学差异而不是检测差异。监督场景ResolVI接受关于每个细胞细胞类型分配的先验知识的可选输入。以两种方式使用这些输入首先在监督场景中强制高斯混合与细胞类型注释对齐。其次在潜在嵌入z_n上训练分类器同时训练预测细胞类型标签的模型。迁移学习对于迁移学习采用scArches for Pyro模型的方法。由于一些参数是非摊销的将细胞索引定义为分类字段并在执行迁移学习时扩展此字段。对于迁移学习识别scArches中需要更新的参数批次依赖和非摊销参数并阻止所有其他参数。差异表达将ref.10的方法适配到Pyro。具体而言将重要性采样的方法更改为与Pyro对齐。使用简化模型其中损失限制在潜在空间中的KL散度、重建和混合比例对数概率。然后执行重要性采样并计算预测真实表达的经验边际。为鼓励采样低伪影细胞基于给定生成真实基因表达的观察基因表达的概率执行加权采样。差异生态位丰度计算类似于差异表达函数。不是执行重要性采样而是从所有邻近细胞的潜在编码中随机采样并使用细胞类型分类器预测细胞类型概率。为产生每个细胞长度等于细胞类型数量的向量基于与中心细胞的空间距离对向量加权并对所有邻近细胞求和。生态位嵌入计算每个细胞空间邻域中细胞类型预测的加权按空间连接性平均值。这些细胞类型频率向量使用UMAP嵌入。分割对于脑10x Xenium数据使用xenium-resegment并通过将扩张距离设置为零执行细胞核分割。对于Baysor将先验分割设置为原始细胞分割置信水平为0.2并在将组织子集为70个区域后运行分割。对于ProSeg使用细胞核分割作为先验分割并通过设置Xenium标志使用默认ProSeg设置。指标整合指标使用scib-metrics默认值基准整合。禁用PCR比较因为期望大多数变异是由于不正确分割。双阳性指标使用单细胞参考测序数据集。假设在单细胞测序中不共表达但在ST中共表达的基因可能是由于技术问题。下游分析在分析中使用resolVI生成的表达。执行计数归一化。执行归一化计数的平方根变换。对于所有UMAP图首先使用RAPIDS计算20个最近邻居然后使用UMAP包中的实现执行UMAP。肝脏Nanostring CosMx分析在图4a中突出SAA1减去GLUL表达的计数归一化基因表达这突出中央静脉周围到门静脉梯度。使用空间位置作为嵌入空间计算生成表达中的热点模块。在图4h中使用resolVI计算抗炎和促炎热点模块阳性细胞之间的差异表达。结肠炎数据首先在第0-21天细胞中训练无监督resolVI模型。在resolVI的潜在空间中执行细胞的kNN分类。使用100个最近邻居计算k最近邻图并使用邻域连接性作为分类器的权重。预测的确定性是具有该标签的连接性之和除以所有连接性之和。将粗标签tier1不确定性高于5%和细标签tier3不确定性高于40%或更多的所有细胞的标签设置为未知。移除这些细胞的标签后在细标签上训练半监督resolVI模型并预测所有细胞的标签。为整合第35天数据使用scArches对这些细胞执行查询映射。关键结论ResolVI框架一个在任何分割算法下游运行的概率模型校正分子错误分配、批次效应和其他干扰因素生成细胞状态的概率低维表示和校正的基因表达谱。三组分模型观察到的计数表示为真实表达、来自邻近细胞的扩散表达和非特异性背景的总和。真实表达和扩散使用负二项分布建模背景使用泊松分布建模。广泛适用性在基于图像Xenium、MERSCOPE、CosMx和基于测序Stereo-seq、Visium HD的ST技术中验证跨多种组织和分割算法。改善细胞类型分辨率ResolVI潜在空间在生物保守性和批次校正方面优于PCA、Harmony和scANVI。消除虚假共表达ResolVI大幅减少来自不同细胞谱系的标记基因的错误双阳性同时保留意外的真实共表达模式。依赖初始分割质量ResolVI的校正准确性取决于初始分割的质量。Baysor分割结合resolVI提供最佳结果。下游分析能力ResolVI支持差异表达、差异生态位丰度、生态位嵌入和迁移学习。肝癌应用揭示具有促炎和抗炎表型的癌细胞异质空间生态位以及髓系和T细胞表型的相应变化。DSS结肠炎应用揭示即使在宏观再生后屏障功能仍然丧失隐窝尖端成纤维细胞位置改变Bmp信号减少。可用性ResolVI作为scvi-tools中的开源软件提供支持GPU加速可高效处理百万级细胞数据集。生活很好有你更好。
RELATED

相关推荐

大模型上下文窗口翻倍,为什么你还是需要 RAG

大模型上下文窗口翻倍,为什么你还是需要 RAG

不少团队把「解决大模型知识不足」的希望寄托在上下文窗口上:窗口从 8K 涨到 128K,再到百万级,似乎把文档全塞进去就行。实际项目里你会发现,窗口翻倍并没有解决根本问题,RAG(检索增强生成)仍然…

📅 2026/10/2 5:55:16
AI Agent 记忆与上下文工程实战(6):工具定义的生命周期:大量工具的裁剪与动态注入

AI Agent 记忆与上下文工程实战(6):工具定义的生命周期:大量工具的裁剪与动态注入

第三个窗口大户进场 上一篇把多 Agent 的共享边界划清:黑板只放断言、过程留在私域。同一条"稀缺窗口只配给信息量"的原则,今天要施给一个长期被豁免的对象——工具定义。复盘上下文开销,多数团队只盯着对话历史与检索注入&#xf…

📅 2026/10/2 5:55:16
AI Agent 记忆与上下文工程实战(4):记忆检索时机:注入方式如何影响回答质量

AI Agent 记忆与上下文工程实战(4):记忆检索时机:注入方式如何影响回答质量

从"存得进"到"用得上" 上一篇把长期记忆的写入路径铺好了:向量库管联想,结构化表管断言,写入过闸门。但存储的全部意义在于使用——同一条记忆,在第几轮被查、查完塞进消息数组的哪个位置、以什么形态呈现&am…

📅 2026/10/2 5:55:16
MORE NEWS

更多资讯

📰

让Claude Code成为生产力:快捷键、Hooks与Plugins实战

先把话撂这儿:Claude Code 是 Anthropic 官方出的命令行 AI 编程代理,装好之后你可以直接在终端里让它读代码、改文件、跑命令、提 PR。但说句实话,真正让它从“能跑”变成“生产力工具”的,反而是看着不起眼的三样东西&#xff1…

📰

小妖工具集正式上线!纯前端黑科技拆解:Canvas 语音记账与证件照制作的 AI 辅助开发实践(TaoToken 统一 Key 通道)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

AIbase MCP服务库上线:TaoToken统一Key接入服务器与客户端教程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

2026年5月会议纪要产品评测:TaoToken统一Key接入随身鹿的实测记录

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

CUDA、HIP、OpenCL和oneAPI编程模型总结及比较:用TaoToken统一Key跑通四类异构计算示例

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Windows+Mac 双端适配 OpenClaw 2.9.0,零基础完整搭建教程(TaoToken 统一 Key 接入版)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬