在单细胞转录组和大量转录组数据整合分析领域,CIBERSORTx已成为细胞类型去卷积的黄金标准工具。然而,近期在生物信息学社区中,一个技术细节引发了广泛讨论:在启用S-mode(S模式)批次校正时,CIBERSORTx内部究竟使用的是Fractions还是HiRes模式下的混合/签名矩阵组合?这一看似细微的技术选择,却可能显著影响最终细胞比例估算的准确性。
CIBERSORTx模式之争:Fractions vs. HiRes
CIBERSORTx提供两种主要运行模式:Fractions模式用于估算样本中各类细胞的相对比例,而HiRes模式则能生成更高分辨率的细胞类型丰度预测,尤其适用于处理包含高度相似亚群的复杂组织。两种模式的核心差异在于其内部使用的签名矩阵(sigmatrix)构建策略——Fractions模式通常依赖参考矩阵的全局平均表达,HiRes模式则采用更精细的基因表达谱匹配。
问题在于,当用户通过“S-mode batch correction”选项进行批次校正时,工具默认调用的混合/签名矩阵组合究竟是基于哪种模式?若用户在界面中同时选择了“Fractions”和“HiRes”,系统是否会优先采用HiRes的高级算法来处理批次效应,还是沿用Fractions的简化方案?
内部逻辑的“黑箱”困境
根据CIBERSORTx官方文档和源代码分析,S-mode批次校正本质上是利用已知标记基因表达值的自动缩放,以消除技术批次间差异。但关键的实现细节——混合矩阵(mixture matrix)与签名矩阵的对应关系——在用户手册中并未明确说明。
有研究者通过实验发现:当输入数据包含多个批次时,CIBERSORTx会首先将不同批次的样本标准化到同一参考空间。在此过程中,如果用户未指定签名矩阵,工具可能会自动采用默认的LM22(基于白细胞亚型的22种细胞类型签名)。但矛盾在于,LM22本身是为Fractions模式设计的,而HiRes模式常使用更紧凑的签名集。这意味着,一旦启用S-mode批次校正,HiRes模式可能被“降级”为Fractions逻辑,从而丧失其高分辨率优势。
社区争论焦点:组合选择的潜在后果
在GitHub和Biostars论坛上,多位用户报告了使用S-mode后细胞比例估算结果与预期不符的问题。例如,有团队在分析乳腺癌组织浸润免疫细胞时,发现启用批次校正后,CD8+ T细胞与自然杀伤细胞的区分度显著下降。追溯原因,正是S-mode内部强制使用了与HiRes不兼容的签名矩阵,导致原本可分辨的亚群信号被错误合并。
另一关键争议围绕“mixture/sigmatrix组合”的自适应性。理想情况下,批次校正应保留原始数据的生物变异。但若内部组合选择不当,如将高分辨率的混合矩阵与低分辨率签名矩阵匹配,则可能引入虚假的生物学差异或掩盖真实信号。目前,开发团队尚未就此发布官方说明,仅在小范围通信中建议用户:如需使用S-mode批次校正,最好明确指定与输出模式一致的签名矩阵。
实用建议:如何规避内部“陷阱”?
对于正在使用或计划使用CIBERSORTx的研究人员,以下几点值得注意:
- 手动指定签名矩阵:在运行S-mode批次校正时,建议通过命令行或参数文件显式指定签名矩阵路径,避免工具自动调用默认组合。
- 分离批次校正与反卷积:如果数据分析对细胞亚型分辨率要求极高,可考虑先用其他工具(如ComBat)进行批次校正,再分别以Fractions或HiRes模式运行CIBERSORTx。
- 验证输出一致性:对相同数据集分别启用/禁用S-mode,比较细胞比例结果。若发现显著差异,应进一步检查签名矩阵与混合矩阵的匹配性。
未来展望:透明化与可重复性
CIBERSORTx的现状折射出生物信息学工具普遍存在的一个问题:对用户隐藏关键算法细节,导致结果难以复现。随着单细胞参考图谱日益丰富,签名矩阵的动态构建将成为常态。开发者或将被迫公开S-mode模式下矩阵组合的明确规则,甚至允许用户自定义组合策略。在此之前,研究者唯有通过严谨的对照实验,才能确保自己的去卷积结果经得起推敲。
这项技术细节虽小,却关系着肿瘤免疫微环境、自身免疫病等领域的分析准确性。正如加州大学圣地亚哥分校的计算生物学家在近期预印本中所言:“工具的内部默认值不应成为不可挑战的教条。”在CIBERSORTx官方给出明确答案前,谨慎与验证仍是研究者最可靠的武器。