耶鲁:将虚拟对抗训练首次引入单细胞半监督整合领域
摘要仅依赖转录组数据的单细胞RNA测序整合方法通常难以保留近缘细胞亚型间的精细差异导致原始数据中可区分的细胞类群在整合后过度混合降低生物学分辨率与可解释性。引入标记基因信息有望解决这一问题但现有标记集的异质性与复杂性限制了其有效应用。为此本研究提出半监督整合模型scCRAFT通过虚拟对抗训练VAT创新性融合标记基因信息。该模型联合优化标记衍生的监督信号与全转录组表征利用VAT约束转录相似细胞间的局部预测平滑性在提升整合质量与细胞类型自动注释效果的同时增强了对含噪声标记注释的鲁棒性。该定向策略可显著提升注释准确性与稳定性尤其适用于标记基因集不完整或存在错误的场景。基准测试结果表明scCRAFT的性能始终优于现有无监督与有监督整合方法可实现更优的整合效果与具备生物学意义的细胞亚型自动注释。https://github.com/ch2343/scCRAFTplusch2343yale.eduleying.guanyale.edu#单细胞RNA测序 #半监督数据整合 #虚拟对抗训练 #细胞类型自动注释 #批次效应校正结果scCRAFT方法概述图1scCRAFT方法概述(a) 标记引导VAT模块示意图。给定外部标记基因列表scCRAFT通过标记表达排序计算U分值并锐化为标记衍生的软标签矩阵Y。软标签通过分类交叉熵CCE提供弱监督同时局部分布平滑LDS正则化约束隐空间内的预测局部平滑性。(b) VAT引导的学习过程示意图。面板I展示标记衍生的预标注与VAT联合目标函数面板II展示转录一致邻域内经VAT平滑后的分类器预测结果面板III展示最终VAT引导的嵌入与自动注释结果零散错误标签被修正同时主要细胞类型结构得以保留。scCRAFT对不完整、含噪声的注释具有鲁棒性图2细胞类型注释不完整、含噪声场景下半监督与有监督方法的整合性能基准测试(a) 4项数据整合任务的生物变异保留能力取3项生物保守性指标的平均值与批次混合效果取5项批次混合指标的平均值以完整细胞类型标签缺失率0%为输入逐步提升细胞类型标签缺失比例最高至70%。(b) 4项数据整合任务的生物变异保留能力生物指标均值与批次混合效果批次校正指标均值以全部已知标签中含10%错误标签为起点逐步提升错误细胞类型标签比例10%~70%。纳入scCRAFT的无监督版本scCRAFT、ssSTACAS的无监督版本Seurat、scANVI的无监督版本scVI作为参照。基于标记的自动预注释可提升scCRAFT的整合性能图3自动注释细胞类型标签下4项整合任务的方法性能对比(a) 各方法的平均生物保守性得分与平均批次混合得分散点图。(b) PBMC数据集的UMAP可视化展示未整合原始数据及4种半监督整合方法的嵌入结果分别按批次、细胞类型着色。scCRAFT对错误标记基因集具有耐受性图4使用正确与错配标记集时半监督整合方法的性能对比(a) 肺数据集整合的UMAP可视化展示应用不同标记集时scCRAFT的整合性能。(b) 平均生物保守性得分与平均批次混合得分散点图展示4种半监督方法在4项整合任务中的表现。图例标注各任务使用的标记集「正确」指与数据集匹配的标记包括PBMC与人免疫数据集采用PBMC 3级标记列表、肺图谱采用HLCA 2级标记、胰腺数据集采用胰腺特异性标记「肺」指将肺特异性标记应用于非匹配数据集「胰腺」「PBMC」分别指将对应组织的标记用于非匹配数据集。scCRAFT提供可靠的高分辨率细胞类型注释图5scCRAFT在人免疫数据集上的细胞类型自动注释基准测试(a) 人免疫全数据集的冲积图对比原始标签与scCRAFT的预测标签。(b) 预测细胞亚型中T细胞与NK细胞标记基因的平均表达水平。(c) 人免疫数据集中T细胞与NK细胞的scCRAFT嵌入UMAP可视化分别着色为原始细胞类型、scCRAFT预测标签、Azimuth 3级自动注释结果。详细总结思维导图参考Robust semi-supervised scRNA-seq integration from virtual adversarial learningdoi: https://doi.org/10.64898/2026.06.07.730754260611scCRAFT.pdf注AI辅助创作如有不当欢迎指出。内容仅供参考不构成任何建议。

相关新闻