多重成像数据分析长期依赖繁琐的聚类,效率低下且通用性差。Nimbus模型的出现改变了这一现状,它作为一个预训练的深度学习工具,能直接从图像解码细胞表型,无需针对新数据重新训练。这一突破不仅提升了分析的准确性和通用性,也为自动化识别细胞亚群提供了可能,极大地推动了相关领域的研究进程。
智能速览
传统多重成像分析依赖繁琐的无监督聚类,存在效率瓶颈。
研究团队构建了包含1.97亿个注释的Pan-M大型数据集以训练模型。
Nimbus是一个预训练深度学习模型,可直接预测细胞标记物表达。
该模型无需重新训练,即可跨组织、跨平台精准分类细胞。
Nimbus预测准确率匹配或超越传统方法,并能识别精细细胞亚群。
研究团队已将模型与数据集开源,推动领域发展。
精华内容
Nimbus的核心价值在于其强大的泛化能力与高精度,它如何实现这一点,并在实际应用中超越传统方法?
构建Pan-M数据集
训练深度学习模型需要海量高质量数据。为此,研究团队构建了Pan-M数据集,它整合了来自不同成像平台和组织类型的数据,包含1500万个细胞、共计1.97亿个标记物表达注释。
该数据集通过“银标准标签”流程生成,即基于已有聚类结果映射细胞类型与标记物阳性关系。为了确保质量,研究人员还耗时对9万个独立细胞进行了人工校对,生成了超过100万个“金标准”注释,其数量远超此前所有已发表的总和。生成金标准标签所需时间约为银标准标签的900倍,这凸显了构建大规模数据集的挑战与创新。
模型设计与性能验证
Nimbus基于U-Net架构设计,输入仅为单个细胞的分割掩码和单通道图像,即可输出该细胞对特定标记物的阳性得分(0-1)。这种设计使其能够独立处理每个标记,无需知道数据集的整体标记组合,从而实现通用性。
性能测试显示,Nimbus的预测准确性与各研究独立使用的聚类方案相当。在与七种主流方法的对比中,Nimbus在MIBI乳腺和CODEX结肠数据集上表现最优。即使是仅在单个数据集上训练的Nimbus子模型,也优于多数需要重新训练的对比方法。特别是MAPS和STELLAR等方法在跨数据集预测时表现不佳,而Nimbus则展现了强大的泛化能力。
超越集成表达分析
传统方法常用细胞内标记物的“集成表达”(平均值)作为聚类输入,但这会丢失空间信息。Nimbus评分则能清晰区分金标准定义的阳性和阴性细胞群体,而集成表达值则存在大量重叠。
例如,对于染色微弱或位于细胞边缘的阳性细胞,集成表达值可能偏低,但Nimbus能准确识别。反之,对于因邻近细胞信号溢出导致表达值偏高的阴性细胞,Nimbus也能正确判断。通过专家盲审对比,使用Nimbus评分进行的细胞表型分配,其准确率(65%)显著高于基于集成表达的传统方法(23%),证明了其优越性。
驱动下游精准分群
Nimbus的最终价值在于赋能下游分析。研究将Nimbus生成的评分作为输入,结合自组织图进行无监督聚类,成功在三阴性乳腺癌(TNBC)和导管原位癌(DCIS)数据集中识别出癌细胞、免疫细胞、基质细胞等主要谱系。
更精细的亚群,如调节性T细胞(Treg)和抗原呈递细胞,也被准确鉴定。在这两个数据集中,通过Nimbus与聚类算法的结合,高达94.66%的细胞被成功分配到特定细胞簇中,证明了其在实现自动化、高精度细胞表型分析中的实用价值。
Nimbus通过预训练模型和大型开源数据集,成功解决了多重成像数据分析中的关键瓶颈。它不仅提升了分析的效率与准确性,更降低了技术门槛,为研究人员提供了一种强大而通用的自动化工具。未来,这类模型能否进一步整合空间转录组等多模态数据,揭示更深层的生命规律?