肿瘤细胞异质性高怎么办:从实验设计到数据分析的完整处理思路
2026/9/9 5:35:19 网站建设 项目流程

肿瘤细胞异质性过高怎么办?最近这个提问在课题设计、论文返修和基金本子写作里反复出现。讲真,做肿瘤研究的人早晚都会撞上这堵墙:你以为自己建了一个稳定的细胞模型,结果传几代之后增殖速度、药物敏感性甚至表面标志物各干各的;你以为单细胞测序能帮你揪出关键亚群,结果UMAP图上样本之间各占一隅,组内根本不重叠。异质性过高确实会让很多常规实验“算不准、验不动、讲不清”,但这不是死路,很多时候只是研究框架需要换一换。

这篇内容写给正在被异质性困扰的硕博生、临床科研人员,以及所有想在肿瘤样本里找到稳定规律的同行。我不写教科书式的定义,只拆解一套从“发现问题”到“重新设计实验”的完整思路,再把每一步该做什么、别踩什么坑讲透。如果你手里的模型或数据也出现了“同一个实验重复不出来”“分群乱成一锅粥”“关键分子不是每批都阳性”这类现象,这篇文章应该能帮你省下至少一两个月的摸索时间。

1. 先弄明白一件事:异质性高是“实验失败”,还是“生物事实”

很多人一看到异质性高就急着想办法去“消除”它,比如反复传代筛选、拼命提高测序深度、强行合并样本找差异基因。但在动这些操作之前,必须先回答一个问题:你观察到的异质性,到底源于研究对象本身,还是源于操作流程?这两种情况的解法完全不同,搞反了会浪费大量时间。

1.1 异质性会破坏哪些常见实验场景

先说三个我在实际工作和帮人看数据时最常撞见的场景,每一个都是典型的高异质性翻车现场:

  • 场景A:类器官或原代细胞药敏实验。同一个患者样本来源的肿瘤类器官,在同一个96孔板上加同一种药物,一半孔IC50在低微摩尔,另一半孔却几乎不响应。如果直接取平均,会得出一个“中间偏低”的假阳性结论;如果只看敏感孔,又会高估治疗潜力。

  • 场景B:单细胞转录组/蛋白组数据分析。不同个体或同一个体的不同病灶样本合并聚类后,样本之间先按“个体”分开,而不是按“细胞类型”分开。差异分析做出来全是批次基因,真正的肿瘤相关信号被淹没。

  • 场景C:稳定细胞株体内外结果对不上。体外敲低靶基因后增殖明显受抑,但移植瘤模型没差异。解剖一看肿瘤内部存在大片未敲低区域,或者移植后亚群比例发生漂移——体外那套结果只是初始细胞混合群体里的平均效应。

这几个场景的共同点在于:研究对象本身不是一个均质的“单位”,而是一个由不同亚克隆、不同分化状态、不同微环境组成的动态集合体。此时如果不改变研究粒度,继续套用“整群平均”的经典思路,很多结论都会失真。

1.2 异质性的主要来源,以及如何快速分辨

肿瘤细胞异质性可以从四个层面去归因,每个层面对应的应对方式差异很大:

异质性来源主要特征最常见于哪种样本可执行的处理方向
亚克隆多样性不同细胞携带不同基因突变或拷贝数改变原代肿瘤、PDX、低传代细胞克隆化、单细胞分选,或使用人群观测策略避免过度解释
表型/分化状态可塑性同一克隆内细胞处于不同转录状态,相互可转换类器官、体外长期培养明确检测时间窗口、控制诱导条件、禁止“顺手传代”
微环境因素基质细胞、免疫细胞、氧浓度、代谢差异影响肿瘤细胞组织中分离的细胞、活检样本严格标记并剔除或保留分析特定群体
技术性批次效应样本处理时间不同、酶消化时长、建库批次单细胞测序、蛋白组学批次归一化、设计可交叉平衡的实验方案

还有个很实际的分辨技巧:如果你把样本重新按处理批次、操作人员或实验日期分组,异质性只在组间出现,组内特别稳定,那大概率是批次效应;反过来,组内重复也乱、同一个培养瓶相邻孔都差异很大,那才是真实的生物学异质性。处理的优先级完全不同——前者靠实验设计和算法去校正,后者需要改变体外系统或分析方法,绝不能靠数据“硬磨”。

1.3 一个常见的误区:把生物学异质性当成噪音强行去掉

这个误区在我见过的课题里出现频率极高。很多研究者一旦看到某个样本异质性高,就直接对离群细胞做“数据清洗”,看到类器官内部形态不整齐就以为培养失败。实际上,肿瘤异质性本身就是值得研究的表型,比如:

  • 治疗前肿瘤里的预先存在的耐药亚克隆,恰恰预测了靶向治疗后的复发。
  • 异质性高的肿瘤往往免疫浸润模式和细胞因子网络更复杂,免疫治疗响应可能更好,也可能更差——这种关系本身就是课题。
  • 转录状态的可塑性,经常是上皮-间充质转化和转移启动的驱动力。

所以当你面对高异质性,第一个判断不是“怎么去掉它”,而是“在这个课题框架里,它代表的是待排除的混杂因素,还是核心科学问题的一部分”。如果它属于后者,强行降低异质性等于把最重要的发现一起抹掉了。后面我讲的所有方法里,有一条底层逻辑是不变的:分离异质性,而不是消灭异质性。

2. 从样品到数据:异质性条件下不能省的几个湿实验细节

如果已经确定需要处理高异质性样本,不能拿着一管解冻细胞就直接开做实验。很多异质性“虚高”的假象,其实是样本制备和培养过程人为放大的。以下三个环节值得花时间严格把控。

2.1 样本解离与活细胞分选的标准动作

原代肿瘤组织或患者来源异种移植瘤组织消化成单细胞后,细胞组成非常混杂。如果不做任何分选直接建库或铺板,后续看到的异质性有一半可能是残存的成纤维细胞、免疫细胞、血管内皮细胞贡献的。高异质性场景的第一步,通常是标记并去除这类“非肿瘤细胞群体”。

  • 推荐在消化后做CD45阴性分选去除白细胞,同时用肿瘤谱系标志物(根据癌种而定:上皮源肿瘤用EpCAM,间叶源肿瘤用其他谱系标志,肉瘤类要格外小心)初步确认肿瘤细胞占比。
  • 红细胞裂解后镜检仍可见明显细胞团块的,要用40微米或70微米滤网再处理一次,尽量保证单细胞悬液没有黏连。黏连是单细胞测序高异质性的一大源头,两个不同细胞被算成一个“新类型”就是这么来的。
  • 如果用于类器官培养,消化时间宁短勿长。以结直肠癌为例,胶原酶消化超过40分钟容易导致表面分子丢失,细胞状态快速漂移,后续传代差异会叠加上去。

实际操作中,我发现一个特别容易忽略的指标:消化后细胞的活率和细胞直径分布。活率低于80%的样本做单细胞测序,线粒体基因比例会显著升高,并在聚类中形成“即将死亡”的假亚群。看到此类亚群时,先别急着当成新细胞类型,仔细看一下是不是线粒体基因占比和核糖体基因占比呈两极分化,如果是,基本可以确认来自细胞应激。

2.2 体外培养中避免选择性压力叠加

肿瘤细胞在体外培养时,每传一代都可能经历一次“人工选择”。培养基配方、血清批次、细胞密度、传代方法都在施加筛选压力。高异质性样本最怕的就是在培养过程中反复筛选,最后留下的不是原来的肿瘤全貌,而是恰好适应了培养条件的一小撮细胞。

  • 原代肿瘤组织或类器官建系时,建议使用条件培养基或成分更明确的培养基,但不能完全依赖商业化的“万能滋养配方”。不同癌种、不同亚型对营养需求的差异很大,实际摸索时至少要记录每个批次的传代倍率和形态变化。
  • 血清批次必须做平行测试。同一款培养基配不同批次胎牛血清,肿瘤细胞的增殖率和表面标志物都可能不一样,这不是玄学,是激素和生长因子浓度的真实波动。
  • 传代尽量做到“定时代、定密度、定比例”。固定每72小时更换培养基、以1:2或1:3传代,比“长满了再传”更有利于维持亚群结构稳定。长期培养中代数越高、异质性越趋同,这是选择压力叠加的结果。

很多人会问:既然如此,是不是应该越早做实验越好?答案是肯定的。拿到原代样本后,如果条件允许,在第2代到第6代之间完成主要功能实验。这类低代数样本的异质性丰度最接近体内,但代价是样本量有限。可以“多冻存、多备份、提前扩增”,但不要把每一批实验都建立在无限传代的基础上。

2.3 批次设计层面的交叉平衡

高异质性的样本如果只是按照“对照组处理完再做药物组”,很容易把时间因素和药物因素混淆。正确做法是:每个处理组应包含来自不同批次、不同培养孔甚至不同个体移植瘤的样本,并在样品处理顺序上达到交叉平衡。

具体到一个药物筛选实验,可以这样设计:

  • 将每个生物学重复的样本在种板前先混合后再分到不同处理组,避免同一孔的细胞只来自同一个亲本孔。
  • 每个处理组至少设置3个以上独立培养孔,后续分析时用孔间变异来估计实验误差,而不是默认孔内细胞是均一的。
  • 如果要做单细胞测序且样本异质性高,建议每个样本留出一部分做重复上机,至少要有两个技术重复来区分生物学差异和文库制备批间差异。

我见过很多人在数据分析阶段花大量时间做批次校正,却忽略了湿实验阶段本可以通过一小时的重新排布避免的批次混杂。高异质性场景尤其考验实验设计的前瞻性,很多信息缺失后无法在计算上弥补。

3. 数据分析策略:不强行“拉平”,而是分层处理

异质性高的高维数据(单细胞转录组、空间组学、CyTOF等)之所以让人头疼,是因为传统分析流程默认“所有细胞来自同一个总体”或者最多“若干个离散类型”。当真实结构是连续状态+离散亚群的混合体时,常用算法就会陷入两难,最终给出一个看起来分得很干净、但回不到生物意义的图谱。下面几条策略是我反复验证后觉得最靠谱的。

3.1 先做恶性细胞判定,再做聚类

做肿瘤单细胞数据分析时,最致命的错误之一是直接用全部分细胞做聚类并注释细胞类型,因为肿瘤细胞和正常上皮细胞经常混在一起,而肿瘤细胞内部又因为拷贝数变异表现出很强的转录异质性,这会导致:

  • 肿瘤细胞被分成很多个“亚型”,但实际上这些只是不同染色体区域的拷贝数差异造成的转录波动。
  • 正常细胞混进肿瘤细胞群,使差异基因列表里出现大量增殖或应激相关基因,干扰下游功能判断。

我的习惯是第一轮先做质量控制,然后用inferCNV或CopyKAT这类工具,依据基因表达推断染色体拷贝数状态,区分恶性细胞和正常细胞。对恶性细胞内部,继续用染色体级别的CNV模式而非基因级别表达量去定义“克隆株群”。比如,同一份胶质瘤样本里,EGFR扩增且CDKN2A缺失的细胞明显与PTEN缺失的细胞占有不同表达空间,这种差异可能对应不同亚克隆,而不只是细胞状态波动。在确定克隆框架后,再回到转录状态层面的分析,才能把两个问题分开回答:肿瘤有哪些亚克隆,每个亚克隆内部是否又有不同的可塑状态。

3.2 处理连续状态与离散亚群并存的体系

很多高异质性样本并不是“几团离散细胞”,而是从一个干细胞样状态到分化终末状态的连续谱系,再加上少数真正的离散亚克隆。这类数据用常规的Louvain/Leiden聚类很容易把连续谱系截成几个硬边界,导致后续比较基因时出现假阳性。

面对这种情况,我建议分析流程里加入两个不那么流行但极好用的环节:

  • RNA velocity或CellRank分析,不去看细胞“归属于哪一簇”,而是看细胞在拟时间轨迹上的方向性和来源。对于可塑性高的肿瘤,这样可以区分出“正在转化的过渡态”和“稳定的终末态”。
  • 转录因子调控网络推断(如SCENIC),寻找驱动高异质性状态的核心转录因子模块,而不是仅仅找差异表达基因。异质性高的系统往往由数个转录因子“开关”控制,找到这些开关通常比描绘全部差异基因更接近机制。

还有个细节值得提醒:很多高异质性数据分析用的标准归一化方法会“过度平滑”细胞间的差异。对于异质性特别高的样本,建议对比几种归一化方式(LogNormalize、SCTransform等)对细胞亚群注释结果的影响,确认哪些差异是跨方法稳健存在的。不能只报一种分析参数下的结果。

3.3 批量样本的去卷积与“信号锚定”

如果是bulk转录组或少量单细胞样本,面对异质性高的问题常需要用到去卷积算法(如CIBERSORTx、MuSiC、BisqueRNA),估算样本里不同细胞亚群的比例。但这类算法极度依赖高质量的参考矩阵。如果你的参考矩阵本身来自另一批异质性样本,去卷积结果很可能不太可靠。

我的建议是:先把你自己手里的单细胞数据做成参考矩阵,再对bulk数据进行去卷积,这样得到的结果和实际情况最匹配。同时可以把去卷积结果与免疫组化/多重免疫荧光中实测的细胞比例进行比对——假设你估算巨噬细胞占比30%,那组织切片里大概也应能看到对应密度的CD68阳性细胞。这种“锚定验证”做得越多,结论越稳。

还可以借助一个另类思路:对于异质性极高的样本,与其把所有细胞比例都纳入差异比较,不如把分析焦点收缩到少数完全明确的细胞状态标记物上。比如只比较“CYTOKINE高表达的T细胞亚群占比”或“SERPINE1阳性间充质样肿瘤细胞的比例”,用清晰的单变量指标替换复杂的全谱差异模式,往往在论文里更有说服力,也更容易在不同实验平台间复现。

4. 实验系统层面的破局思路:克隆化、原代模型与表型分离

分析做得再好,最终还是要落到实验验证上。如果异质性高到常规方法根本无法给出可重复结果,那么该考虑更换实验系统本身。下面是我实操中验证过的三条破局路径,按“模型可控性从弱到强”的顺序排列。

4.1 克隆化:从混合群体到单一来源群体

最直接的解决办法是“单细胞克隆化”,意思是从原始细胞群中取出单个细胞,扩增成一个遗传背景完全一致的细胞群体。这个办法对贴壁肿瘤细胞系非常有效,也能用于部分可单细胞铺板的类器官体系。

具体流程可以概括为:

  • 用流式分选仪把单个活细胞分配到96孔板,每个孔只接收一个细胞,铺板前确认分选参数;
  • 加条件培养基或滋养层,许多肿瘤细胞在极低密度下无法自行生长,关键是让单细胞存活并开始增殖;
  • 大约10到20天后开始出现肉眼可见的克隆,挑取生长状态良好的克隆传代扩增;
  • 扩增后分别抽提DNA做全外显子或靶向测序,确认不同克隆间的拷贝数谱差异,以此证明克隆来源均一。

克隆化的直接收益是“把群体平均变成单克隆行为”。如果你想知道某个基因突变是否导致耐药,最理想的体系就是“同源配对”的单克隆:一个克隆携带该突变,另一个不携带,背景尽可能一致。

克隆化也有代价:单细胞生长能力不能代表原来群体的构成,一些依赖群体效应才能生长的细胞会在分选中丢失。所以做克隆化之前要想好——你是需要“代表性”还是“纯净性”。如果目标是验证某个特定分子机制,纯净性优先;如果目标是刻画患者的整体肿瘤特征,克隆化并不合适。

4.2 原代模型与类器官的低代数冻结策略

另一种思路不是让细胞变均一,而是尽量在体外保留原来的异质性,控制在最早期完成实验。患者来源类器官,或者患者来源异种移植瘤的低代数样本,目前是保留肿瘤异质性相对较好的模型系统。

  • 建系后的类器官在代数越低时,分化状态和亚克隆结构与原发灶越相似;传代超过15代之后,亚克隆比例通常会发生漂移。
  • 建议每一代都冻存足量细胞,建立“主细胞库+工作细胞库”两级管理。每个功能实验都从低代数工作库中复苏,用完即弃,不反复传代。
  • 复苏后要给细胞足够的恢复时间。冻存复苏后第一代细胞的很多基因表达处于应激态,此时做药物实验通常会得到与实际不符的高耐药性。

使用类器官时还有一个很隐秘的影响因素——基质胶批次和浓度。高异质性肿瘤类器官对基质胶的响应不同,有些亚群在Matrigel浓度偏低时更容易向间充质方向分化,导致同一个样本两种培养基条件下得到的亚群比例完全不同。建议同一批实验固定基质胶来源和批号,并在文章方法学里写明浓度,这个细节经常是别人重复不出来的原因。

4.3 表型分离与预筛选:建立一个可重复的读出具

如果在不均一的系统里做机制研究总是失败,最后一个迂回思路是:不要试图解释系统中所有细胞的平均表现,而是先找出一个可重复的“入选标准”,只研究符合该标准的那一个细胞群体。

举个例子:有些肿瘤细胞系在体外天然含有CD44高低两个亚群,混合状态下测干细胞相关基因表达时,结果飘忽不定。正确做法是用流式分选出CD44高和CD44低分别培养,在各自群体内进行功能检测。这种“表型预筛+亚群验证”策略的最大优点,是把隐含的异质性转变成显式的分组变量,差异分析、统计检验都会清晰很多。

类似的策略还包括按药物处理后的“存活/死亡”状态分选、按细胞周期状态分选、按迁移能力分选等。文献里常说的“耐药亚群”很多时候就是这么先分离出来再做机制的。关键操作要领是分选后尽快做下游实验,因为许多表型状态在离开体内/原始培养条件后会迅速改变。

5. 把高异质性局面转成论文叙事:常见问题与调整清单

写作科研论文或准备课题汇报时,异质性高通常是一个“论文里的缺点”,但换个角度也能成为一个“扎实的分析亮点”。关键在于你如何论证自己处理异质性的逻辑,以及如何用多种互补手段验证同一个结论。

5.1 面对审稿人质疑时的应对框架

审稿人看到异质性高的数据,最常批评的几句话包括:“你的重复性不足”“这个结论只适用于某个亚群”“你的取样偏差会导致结论不成立”。应对思路不是解释当时为何做不好,而是提供多层次的论证:

  • 同一个结论是否能在不同模型系统中复现?比如体外细胞系里观察到的耐药表型,是否能在类器官里通过不同患者样本验证?
  • 同一个结论是否能在不同分析粒度上复现?比如全转录组的差异基因方向,是否与免疫组化蛋白结果一致?
  • 是否做了正交实验来区分“常见事件”和“个别事件”?比如对克隆化的多个单克隆分别做药物曲线,如果多数单克隆都表现出耐药,那就是稳定的群体特征,而非某一个亚克隆的偶然属性。

我习惯把这类证据组织成“主结论+辅证”的结构:先用最可控的均质模型(比如单克隆细胞)证明机制,再回到高异质性患者样本里指出该机制相关标志物的富集模式。两者互相印证,审稿人很难再用异质性过高来否定核心发现。

5.2 高异质性样本处理速查表

下面这张表是我在实验室里贴在操作台边上的速查单,整理成了“什么阶段看到什么问题,优先查哪里”的排查形式,方便直接对照:

观察到的现象最有可能是哪类问题优先排查和处理路径
不同培养孔之间药敏结果差异很大细胞种板不均一或不同孔亚群比例漂移检查种板时细胞悬液混匀程度;做克隆化或预筛选;增加每组的培养孔数量
同一个孔内细胞形态参差不齐真实瘤内异质性或分化状态差异做谱系标志物染色确认亚群;按表型分选后分别培养
单细胞聚类总是先按样本或批次分开技术性批次效应或样本组成差异大先做样本间基因表达相关性和批次校正;若仍分开,则可能是生物学差异,需要换研究方向解读
连续传代后某标志物比例越传越高培养条件在施加选择压力降低传代倍数、换条件培养基或尽快使用低代数细胞
同一批肿瘤样本不同个体的异质性差异极大个体间遗传背景差异按分子亚型重新分组,减少比较对象之间的基线不平衡
单细胞转录组里出现大量双阳性的过渡态细胞技术黏连或真实连续状态先做Doublet检测,再用轨迹分析确认是否为连续态

这个表实际操作时比长篇大论更管用。团队里换人接手时,直接给这张表配上原始数据截图,通常半天就能定位问题出在哪个层面。

5.3 从“高异质性”到“有价值”:我自己的实战体会

分享一个此前成功调整方向的经历。之前帮同事看过一批三阴性乳腺癌样本的类器官筛选结果,前两轮实验的结论几乎互相打架:载体对照组和给药组的细胞活力差异有时显著、有时没有,常规的基因表达检测也出现自相矛盾的结果。查看单细胞测序数据才发现,不同患者样本里上皮-间充质状态的分布差异极大,有的样本以上皮样细胞为主,有的样本里间充质样亚群已经占了大多数。表面的“药物响应差异”本质上是亚群组成差异。

我们没有去“消除”异质性,而是改用以下方式把课题救了回来:

  • 先用上皮和间充质标志物对样本分层,将所有细胞分到两类状态明确的组里;
  • 分别测定两种状态对实验药物的富集响应,结果在间充质样亚群中看到了稳定的靶点激活;
  • 再回到原发肿瘤组织切片里做多重免疫荧光,验证这两个状态的空间分布和比例与预后相关。

这个结果虽然比最初设想的复杂,但结论反而更经得起验证,后续实验都能重复,最后还因此确定了一个由间充质亚群驱动的耐药机制。回头看,如果当初强行把数据平均化,只会得到一个“部分有效但很难解释”的中间结论,无法形成一个像样的课题。

5.4 写在样本处理之后的实用技巧

每次处理高异质性样本时我还会留一份备份样本放液氮,样本量足够时多做一套不同处理条件的备份。尤其是在原代样本数量极度有限的情况下,这一个小小的操作能避免很多“后面想补一个关键实验但细胞已经没了”的尴尬。对于规模不大的实验室,共享一份样本记录表也很有帮助,写明每管细胞的组织来源、代数、分选日期和培养基批次,后面分析数据时能快速排除很多批次因素。

另外,不要低估“多做几个时间点的快照”的价值。高异质性样本的状态本身随时间是流动的,单时间点看到的差异很可能是随机抽样的结果。在可控的体外体系里,设计一个前中后三个时间点的采样方案,往往比单一终点的实验结果更能说明异质性对表型的影响。

我个人最终体会是:面对肿瘤细胞异质性过高,最关键的不是马上找一套降维打击的分析工具,而是先诚实回答自己的研究问题和研究模型是否匹配。模型不适合,再高级的算法也只是在复杂数据里画圈;模型选对了,异质性这个曾经让人头疼的特征,反而能成为课题里最扎实的突破口。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询