CosMx单细胞空间转录组揭示小细胞肺癌原发灶与转移灶微环境差异
2026/9/8 12:42:14 网站建设 项目流程

一个癌种,原发灶和转移灶的微环境能差多少?过去我们只知道SCLC恶性程度高、转移快、预后差,但“快”和“差”背后的空间机制一直说不清。这篇用CosMx单细胞空间转录组学做的研究,直接把这个问题的颗粒度拉到了单细胞和空间位置同时可见的程度——原发灶和淋巴结转移灶在细胞组成、功能状态、空间组织结构、细胞通讯网络上的差异,全部可视化出来了。

这篇文章适合正在做肿瘤微环境研究、空间转录组数据分析、或者打算用CosMx平台做临床样本的人阅读。哪怕你暂时不碰空间组学,里面关于肿瘤转移微环境的细胞行为描述,也值得一读。下面我按这篇文献的核心内容,把技术方案、关键发现和实操经验一起整理出来,尽量说人话,尽量给干货。

1. 内容整体设计与思路拆解

1.1 为什么要做SCLC原发灶与转移灶的单细胞空间转录组

小细胞肺癌在肺癌里属于一个特殊的存在:它跟吸烟高度相关,占肺癌总数的13%到15%,但恶性程度极高,增殖快、早期转移倾向极其明显,很多患者确诊时就已经是广泛期。化疗和免疫治疗是主要手段,但耐药来得快,长期生存率一直上不去。这里面的一个核心问题是:SCLC的转移为什么这么容易发生?原发灶和转移灶的微环境状态是不是有本质差异?

几十年来,我们对SCLC的研究主要依赖bulk转录组和传统病理切片。但这些方法有个共同的问题——它们把组织当作一个“匀浆”来处理,测出来的信号是成千上万细胞的平均值。原发灶里可能有五个不同的细胞亚群,其中一个与转移高度相关,但在bulk数据里它的信号可能完全被另外四个亚群淹没。空间转录组学就是为了解决这个问题出现的。

这篇文献选择了一个非常具体的对比维度:同一批SCLC患者的原发灶和配对淋巴结转移灶。配对设计是关键,因为不同患者之间的个体差异太大了(遗传背景、治疗史、生活习惯都不同),如果把A患者原发灶和B患者转移灶比,很难说清差异到底来自肿瘤进展还是来自个体差异。配对样本能把这种干扰降到最低。

1.2 CosMx平台在这个研究中的不可替代性

空间转录组技术现在选择不少:10x Visium分辨率是55微米左右的spots,一个spot里可能包含几个到十几个细胞;Slide-seq分辨率能到10微米级,但一次测的基因数有限;MERSCOPE和CosMx属于单细胞分辨率的靶向空间转录组。为什么这篇文献选CosMx?

核心原因有三个。第一,RNAscope-based的原位杂交化学加上微流控流水线,让CosMx能做到亚细胞级别分辨率(100纳米级),这意味着可以准确判断一个转录本位于哪个细胞的哪个区域。对于肿瘤微环境研究,你得能清楚地判断一个巨噬细胞是贴着肿瘤巢还是浸润在基质里,这决定了它的功能状态完全不同。

第二,CosMx Human 2.0 panel一次能检测约6000个基因的mRNA,虽然比全转录组少,但对于微环境免疫分型来说,这个覆盖度已经足够抓到关键信号了。肿瘤细胞、T细胞、B细胞、巨噬细胞、成纤维细胞、内皮细胞的核心marker都在panel里。

第三,样本兼容性好,特别是对FFPE样本友好。SCLC临床样本很多是穿刺活检得到的,样本量极少,能做冰冻切片已经是运气好。CosMx对FFPE的兼容性,让研究者可以用多年前存档的病理蜡块来做回顾性研究,这对分析预后和转移差异非常重要。

2. 核心细节解析与实操要点

2.1 样本选择与分组策略的技术考量

这项研究纳入的是SCLC患者的原发灶和配对的淋巴结转移灶组织。实际操作中,配对的FFPE样本并不好获取,淋巴结转移的穿刺组织往往很小,细胞密度又不均匀。研究者需要先由病理医生复核HE切片,确认肿瘤区域和非肿瘤区域的分布,然后选取代表性蜡块。

这里有一个实操上的重要原则:肿瘤组织空间组学的切片区域选择一定不能只看肿瘤细胞密度,还要看肿瘤巢周围是否有足够间质成分。如果你只选了一个“满屏都是癌细胞”的区域,最后分析时免疫细胞数量太少,空间统计就没有意义;如果你选的区域全是坏死或出血区,那质量也很差。理想的挑选标准是肿瘤巢、癌巢周边间质、以及相对正常的组织结构共存于同一视野中。

对于SCLC这类细胞密度极高的肿瘤,切片厚度也是一个值得注意的参数。CosMx官方推荐的FFPE切片厚度是5微米,但实际经验是,对于SCLC的密集小细胞形态,4微米表现更好,组织重叠更少,单细胞分割的成功率更高。太厚的切片会导致细胞核在Z轴方向重叠,分割算法会把两个细胞识别成一个,直接污染下游数据分析。

2.2 CosMx实验流程中的关键质控节点

CosMx的平台流程可以简单分成几步:切片准备与抗原修复、探针杂交和连接、原位扩增、循环成像与解码、细胞分割与数据导出。每一步都有质控节点,但有几个是新手最容易忽略的。

第一个是探针杂交的质量评估。CosMx的探针针对RNA设计,杂交条件是严格的温度和甲酰胺浓度体系。如果杂交温度偏高,非特异性信号增多;温度偏低,真实信号丢失。平台一般会有试剂盒内部控制探针,但更重要的是看管家基因的表达模式——比如GAPDH和ACTB的信号应该均匀分布在所有有核细胞中。如果管家基因信号都稀疏,不用犹豫,直接判定该样本杂交失败,重新优化条件后再上机。

第二个是细胞分割的后续人工检查。CosMx的细胞分割基于DAPI核染色和形态学膜染色,但对小细胞肺癌这种核质比极高的肿瘤,膜边界往往难以准确识别。此时,如果只依赖自动分割,很容易把紧密排列的SCLC细胞合并成巨型细胞(artifact),导致后续的单细胞转录组分析出现大量“双细胞”或“多细胞”信号。我的建议是每张切片随机抽20个视野,人工检查分割边界。如果超过15%的视野存在明显分割错误,需要在分析软件里调整细胞边界参数或增加分割约束条件。

第三个是测序深度与数据稀疏性的平衡。CosMx虽然能测6000个基因,但每个细胞的转录本捕获量通常在几百到几千之间,和单细胞测序的几万UMI相比,数据稀疏程度高得多。这意味着下游分析不能直接套用Scanpy或Seurat的默认参数,需要针对空间靶向数据做专门的降噪处理。

3. 实操过程与核心环节实现

3.1 从切片到表达矩阵的完整分析链路

CosMx输出的原始数据是带有空间坐标的转录本列表,每一行是一个被检测到的RNA分子,包含它的x/y坐标、基因名称、所属细胞ID等信息。这个格式非常适合空间分析。整个标准分析流程可以拆成这样几步:

第一步是生成细胞表达矩阵。将转录本按细胞ID汇总成基因表达矩阵,同时记录每个细胞的空间坐标、细胞面积、形态学特征。对于6000基因的panel来说,典型的组织切片能捕获几万到几十万个细胞。需要提醒的是,肿瘤组织和正常组织比较时,细胞数的差异会很大,SCLC区域细胞密度极高,一平方毫米可能就有上万个细胞,而淋巴结转移灶的坏死区域可能只有几百个。后续的统计分析中,必须处理这种细胞数不平衡问题。

第二步是数据质控过滤。常规空间转录组质控指标包括每个细胞的转录本总数(nCount_RNA)、检测到的基因数(nFeature_RNA)、线粒体转录本比例。但CosMx数据有自己的特殊性——靶向panel本身不覆盖线粒体基因的每一个转录本,但通常包含MT-CO1、MT-ND4等核心线粒体基因。过滤标准不能直接照搬单细胞测序的“线粒体比例>20%剔除”规则,而应该结合切片质量调整。根据这篇文献的经验,他们设定的转录本下界是50,基因数下界是30,低于这个值的细胞大概率是细胞碎片或切片边缘的破损细胞。

第三步是聚类与细胞类型注释。SCLC的表达特征比较明确,常用marker包括NEUROD1、ASCL1(代表经典神经内分泌型)、POU2F3(代表非典型/簇状细胞型)等。在CosMx panel中,这些基因都有覆盖。聚类策略上,建议先用harmony或scVI做批次效应校正,再用Leiden聚类。注释时要特别留意肿瘤细胞和正常上皮细胞之间的边界——SCLC的肿瘤细胞往往表达上皮marker(EpCAM、KRT8),单靠这些无法和正常上皮区分,需要结合NEUROD1等神经内分泌marker以及拷贝数变异特征做判断。

第四步是空间可视化。这一步最直观,也最容易出成果。把细胞类型映射回原始组织坐标,就能看到原发灶和转移灶的细胞分布格局差异。比如,研究结果可能显示,在原发灶中T细胞和巨噬细胞主要分布在间质区域,很少真正浸润到肿瘤巢核心位置;而在转移灶中,免疫细胞向肿瘤巢内的浸润程度更高,但处于耗竭状态的T细胞比例也更高。这种空间分布信息是静脉抽血测循环肿瘤DNA、或者把组织磨碎做单细胞测序都无法获得的信息。

3.2 细胞邻域分析和生态型划分的计算方法

单纯看细胞类型的位置分布还不够。空间转录组学的核心优势在于能计算“细胞邻域”(cellular neighborhood)和“组织生态型”(ecotype/niche)。邻域计算的基本思路是:以每个细胞为中心,划定一个半径范围(比如30微米),统计这个范围内每种细胞类型出现的频率,然后基于这些频率特征对中心细胞聚类,得到不同的组织微环境单元。

参数选择上,半径大小很关键。5到10微米是最常用的范围,因为这个距离基本对应相邻细胞的直接接触和旁分泌信号范围。在SCLC这种细胞密度极高的肿瘤里,30微米的范围内可能包含10到15个细胞,已经足够计算邻域结构了。

生态型分析本质上是把细胞邻域进一步抽象成“微环境模块”。比如,一个生态型定义为“密集肿瘤巢内部、免疫细胞稀缺”,另一个生态型定义为“肿瘤间质边界、富含CD8+ T细胞和树突状细胞”。通过比较原发灶和转移灶中各个生态型的比例和空间分布,研究者可以发现哪些组织结构被肿瘤“重塑”了,这正是理解转移机制的抓手。

这篇文献的核心发现之一,可能就是在原发灶中有较高比例的“免疫排斥型”生态型(肿瘤细胞周围只有少量免疫细胞),而淋巴结转移灶中有更多“免疫浸润但耗竭型”生态型。这两个生态型对免疫治疗应答的意义完全不同,也为后续的预测标志物开发提供了候选。

4. 常见问题与排查技巧实录

4.1 不同批次切片的信号漂移与批次效应处理

在实际操作中,很多研究者会在同一个载玻片上放多张组织切片,以最大化利用一次实验的通量。但不同切片之间会有微小的环境差异,比如组织厚度不均、探针扩散效率不同,结果导致同一种细胞类型在不同切片上测到的转录本数量有系统性差异。这在空间转录组中非常常见。

排查技巧是:先画每个切片的总转录本数分布图和中位基因数分布图。如果切片之间这些指标差异超过两倍,就要考虑是否因为组织本身质量差异还是实验操作因素。如果排除质量因素,需要在生信层面做批次校正,推荐用harmony,因为它能在保留细胞类型异质性的同时,消除切片间的系统差异。

另一个容易踩坑的地方是使用固定阈值筛选阳性基因表达。CosMx数据中,如果直接用“表达>0”作为阳性标准,几乎所有细胞都会表达数十个基因,因为低水平背景信号是存在的。建议先计算背景信号的中位数加3倍标准差作为阈值,再判定某个基因在某个细胞中是否阳性。

4.2 低质量细胞与双细胞的识别与去除

空间转录组数据的低质量细胞来源有两个:一是组织切片边缘的破损细胞,RNA信号大量丢失;二是坏死区域细胞,转录本降解严重,表现上调的往往是热休克蛋白和凋亡相关基因。

识别方法比较实用的是看转录本总数和基因数之间的关系。正常细胞的基因数会随转录本总数增加而增长到一个平台期;低质量细胞则表现为转录本数很低但基因数也很低,或者某些细胞转录本数异常高但基因数变化不大——后者往往是双细胞信号。

CosMx后续版本在分割算法中整合了基于形态学的doublet检测,但效果有限。手工清理在高密度SCLC组织中是必要的。最有效的策略是做一个“细胞面积”过滤。SCLC细胞直径普遍在8到12微米之间,细胞核面积在30到80平方微米左右,如果检测到细胞面积为150平方微米以上,大概率是分割合并了两个以上细胞,建议直接过滤。这个经验值在不同切片上会有一定波动,建议用DAPI信号面积的分布图来确定自己数据集的合理阈值。

4.3 空间数据分析工具选择的个人体会

空间转录组数据分析目前还没有一个“标准答案”式的流程。我的经验是,CosMx自带的AtoMx平台足够做基础的分析和可视化,但如果要做更深入的生态型分析或细胞通讯推断,还是要用开源工具。

Python生态里,Squidpy是目前最为成熟的针对空间分子数据做邻域分析和图像分析的工具包;R生态里有Giotto和Seurat的Spatial方法。推荐新手从Squidpy入手,因为其文档全、社区活跃、教程多。细胞间通讯分析可以用CellChat的spatial模式,但需要先确认配体-受体对在靶向panel中的覆盖情况,CosMx的6000基因panel覆盖的配体-受体对比较完整,可以放心使用。

需要注意的是,空间数据的细胞通讯推断比S单细胞数据更复杂,因为需要进行邻近细胞配对分析,并对空间共定位给出背景校正。如果你只是把单细胞通讯分析流程原样搬来,结果可能会有大量假阳性。

5. 可复现分析流程与必要参数建议

5.1 一套适用于SCLC空间数据的标准分析流程

这里给出一套最小可复现的分析流程模板,可以直接迁移到自己的项目上。假设数据已经通过CosMx平台QC和细胞分割,拿到了表达矩阵文件和细胞注释文件,后续分析可以分为六个模块:

  1. 数据读入和QC过滤。读取表达矩阵,过滤低质量细胞和双细胞信号。
  2. 标准化。因为是靶向面板数据,标准化方法建议用log1p标准化,配合ScaleData处理。
  3. 降维与聚类。用PCA降维,取前30个主成分,接Leiden聚类,分辨率参数从0.5起步,根据marker的可分离性调节。
  4. 细胞类型注释。按marker基因表达自动或手动注释。
  5. 空间邻域分析。计算每个细胞的邻域组成向量,聚类定义生态型。
  6. 组间比较。原发灶和转移灶的细胞比例与生态型比例做差异分析。

每一步的具体参数,都要根据自己数据的质量分布调整。说句实在话,空间转录组目前仍然没有“一键生成结果”的流程,想要结论可靠,每个参数都值得认真看一遍分布图。

5.2 关于生态型划分的关键参数选择

生态型划分是空间分析中最影响结果解读的一步。它本质上是一个聚类问题:输入是每个细胞的邻域组成向量,输出是几个微环境模块。这里有几个参数需要考虑。

第一是邻域半径。30微米是常见选择,但它对细胞密度很敏感。在SCLC原发灶里细胞密度高,30微米可能覆盖到两三层细胞,细胞间直接接触信号和旁分泌信号会混在一起;而在淋巴结转移灶里密度相对低,30微米可能只能覆盖一层细胞。建议根据两组样本的细胞密度差异,分别计算平均最近邻距离,再设置半径,保证邻域内细胞数的中位数在8到15之间。

第二是生态型数量的确定。用Leiden聚类时,分辨率参数决定生态型数量。一个实用的方法是:对多个分辨率参数跑结果,然后检查每个生态型的细胞组成是否有生物学意义。不要只依赖轮廓系数或Davies-Bouldin指数这类纯数据指标,因为这些指标不会告诉你“这个生态型是不是一个真实存在的组织结构”。

5.3 从分析到结论:如何设计有说服力的对比策略

拿到聚类结果和生态型分布后,怎么提升结论的严谨性?我个人建议在组间比较时至少做三件事:一是细胞类型比例的差异检验,使用Wilcoxon秩和检验并做FDR校正;二是生态型比例的置换检验,因为生态型之间存在空间自相关,常规统计检验会低估P值;三是尽量在独立验证队列中做多重验证。

空间自相关是空间组学数据分析和传统组学差异分析最大的不同点——邻近细胞不是独立的。你取了两块相邻的组织区域,它们的微环境本来就高度相似,如果你把它们当作独立样本检验,等于变相增加了样本量,P值会非常乐观。推荐用置换检验或空间块bootstrap方法来校正。

6. 这项技术还能走多远

SCLC只是CosMx平台应用的一个场景,但这项技术本身的价值远不止于此。原发灶和转移灶的微环境差异,不仅存在于肺癌,在乳腺癌、结直肠癌、胰腺癌等多个实体瘤中也同样关键。CosMx平台如果能在成本控制上再进一步,未来完全可能成为临床病理科的标准工具——一张切片,不仅能看组织形态,还能同时看到几十种关键基因在每个细胞中的表达位置,辅助确诊、分型、用药决策。

单细胞空间转录组学目前仍处于快速发展阶段,但它的应用场景从基础科研到临床转化都越来越清晰。对于研究者来说,现在入局这个方向还有很大的红利期:平台数据量在增长,分析工具的成熟度也在提升,发表高质量文章的机会窗口仍然很宽。

在我个人看来,空间转录组技术最有魅力的地方,不是它测了多少个基因,而是它第一次让我们能直接“看到”肿瘤微环境。肿瘤不是一堆癌细胞的无序堆积,它内部有自己的社会分工、空间格局和交流网络。理解这个网络,才有机会从更高维度去干预它。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询