☰
UPR通路泛癌解析:多组学揭示未折叠蛋白响应与肿瘤进展关联
2026/10/10 14:24:28 网站建设 项目流程

未折叠蛋白响应(UPR)是我这两年做泛癌数据时最常被“打脸”的通路之一。教科书上它是内质网里的“质检员”,负责把错误折叠蛋白修好或清掉;可一到肿瘤里,它就像一张双面牌:一边保护癌细胞扛住恶劣微环境,一边又在极端压力下推细胞走向凋亡。到底哪个方向占上风、跟肿瘤进展什么关系,一直是悬案。海南大学的盛夏课题组做了一项泛癌尺度的系统解析,把UPR活性拿到三十多种癌型里统一度量,再与肿瘤分级、突变负荷、免疫浸润和干性特征逐一对表,给出了一个层次非常完整的答案。这篇博文我想从项目本身出发,把这项研究的底层逻辑、技术路线、核心发现以及我个人复现同类分析时踩过的坑完整拆一遍。

先说清楚这篇内容适合谁看。如果你正在做通路活性类的泛癌分析,或者准备用TCGA/ICGC这类公开数据构建分子分型,想搞明白“一个通路如何影响肿瘤进展”这类问题到底该怎么下手,这篇文章值得看完。如果你只是好奇UPR是什么、为什么研究团队要把它做成“泛癌”,我也会用尽量白的语言把原理讲透,不堆黑话。

1. 从一条“细胞自救通路”,到一张泛癌全景图:项目要回答什么问题

1.1 为什么UPR是肿瘤研究里绕不开的主角

未折叠蛋白响应(Unfolded Protein Response,UPR)本质上是内质网压力下的三条信号通路联动。当细胞内错误折叠蛋白积累到一定程度,三个传感器——PERK、IRE1α和ATF6——会被激活,各自往下游传递信号。PERK通路通过磷酸化eIF2α抑制全局翻译,减少新蛋白合成,同时激活ATF4转录程序;IRE1α通过剪切XBP1 mRNA产生有活性的转录因子XBP1s,上调内质网分子伴侣和脂质合成相关基因;ATF6则转移至高尔基体被剪切后激活ERAD相关基因,加速降解错误蛋白。

你可以把UPR想象成工厂里的“应急指挥中心”:生产线上废品变多了,指挥中心先下令减速生产线(PERK),再让人手去修理废品(IRE1α/XBP1),最后紧急调度垃圾清运车把修不好的废品拖走(ATF6)。这套机制在正常细胞里是短时应急的,压力解除就关闭。但肿瘤细胞不一样,它们长期处于缺氧、营养匮乏、酸中毒和氧化应激状态,内质网里永远有修不完的蛋白。于是UPR从“应急模式”变成了“常开模式”,癌细胞逐渐依赖UPR来维持蛋白稳态和存活。

这就是所谓的“非致癌性成瘾(non-oncogene addiction)”——癌细胞并没有突变UPR通路本身,而是依赖这条通路的高活性来生存。这个特性让UPR成为非常有潜力的治疗靶点,但问题是:UPR在三通路的相对强度上差异极大,有时候PERK分支占主导,有时候IRE1α分支更活跃;不同癌种里主导分支甚至可能相反。若是把UPR当作一个整体去看,容易得出互相矛盾的结果。这也是当前文献里UPR与肿瘤预后关联众说纷纭的根源:结论吵架,往往不是数据错了,而是“UPR”这个定义本身就太宽泛。

1.2 泛癌视角为什么重要

大多数靶向UPR的研究集中在单一癌种,比如胰腺癌、乳腺癌或多发性骨髓瘤。单癌种研究能挖得很深,但得到的结论很难迁移。举个例子,在一种癌里UPR高活性与不良预后相关,换一个癌种可能完全反转。这种差异可能来自肿瘤起源组织本身对蛋白分泌压力的耐受度不同,也可能来自微环境里免疫细胞构成的差异。如果视线钉在一个癌种上,你会误以为UPR有“固定的”临床意义,但真相可能是“因癌而异”。

泛癌分析解决的就是这个问题。它把三四十种癌症拉到同一把尺子下量一遍,先看普遍规律,再看组织特异性的偏差。这种分析做得好的话,能回答几个单癌种回答不了的问题:UPR高活性到底是多数实体瘤的共同特征,还是只在特定癌型里显著?UPR的哪条分支与肿瘤分级、转移的关系最强?UPR活性和免疫细胞浸润之间的关联,是免疫“热肿瘤”更依赖UPR,还是“冷肿瘤”更依赖?

海南大学的这个项目,出发点本质上就是这些问号。该团队没有把UPR当成一个简单的“高风险基因集”去套预后模型,而是把激活状态拆成三个功能分支,再用多组学数据交叉验证,最后落回到肿瘤进展的临床指标上。这种“机制先行、验证兜底”的思路,比一上来就堆预后模型的做法稳妥得多。

2. 数据从哪里来,怎么看:本次分析的技术栈与数据策略

2.1 多组学数据整合:单一数据源做不了这件事

要做泛癌UPR分析,第一步就是选数据。这个研究走的是公开多组学路线,主阵地是TCGA(The Cancer Genome Atlas)泛癌数据,覆盖三十多种癌型。TCGA的好处是:每个样本都同时有转录组、甲基化、拷贝数变异、体细胞突变和临床注释,而且样本量、批次控制都经历过严格质控。对UPR这种需要“多角度互证”的通路,转录组打分只是起点,还需要蛋白层面、DNA层面和单细胞层面的数据来交叉验证。

具体来说,本研究的验证链条大概是这样设计的:先用TCGA转录组做全癌种UPR活性打分,得到UPR高/低的初步分层;再用蛋白组学数据(比如CPTAC里的磷酸化蛋白组,或反相蛋白阵列RPPA)看关键标志物(如p-eIF2α、XBP1s)在蛋白层面的趋势是否吻合;接着用单细胞转录组数据(主要来自公共数据库如GEO、HCA或其自有数据)确认信号来自恶性细胞还是微环境细胞;最后回到临床表型(分期、分级、生存)看差异是否有实际意义。

这种“多组学交叉验证”的思路很值得学习。很多人做泛癌分析时只盯着表达矩阵,算完ssGSEA分数就急着跑Cox回归,结果遇到芯片批次效应、基因覆盖不全、或者干扰细胞类型占比变化等问题时完全没有排查手段。而加入了蛋白组和单细胞层面的验证之后,至少能区分“转录层面的UPR升高”到底是肿瘤细胞真实上调了通路,还是只是微环境里免疫细胞比例变化带来的“假阳性”。

2.2 UPR活性如何量化:直接决定结论质量的第一步

这是整个项目里最容易被低估的环节。UPR不是单基因,而是一组动态联动过程。早期研究爱用几个标志基因(如HSPA5/BiP、DDIT3/CHOP、XBP1)的表达量均值为代表,但这种方法有两个明显缺陷:一是标志基因的选择主观性很强,换个标志基因结论可能就变了;二是它完全看不出来“三条分支谁主导”这个关键结构。

目前主流的方法是基因集打分,代表性工具有ssGSEA(单样本基因集富集分析)、GSVA、singscore、AUCell等。它们的共同思路是:给定一组代表该通路的基因,计算该通路在单个样本中的综合活性分数,而不是看某一个基因的表达量。实际操作里,我见过很多人用GSVA去打分,但GSVA在不同数据集之间的绝对分数可比性较差,泛癌跨数据集比较时容易出偏差;ssGSEA在泛癌分析里应用更广,因为它对基因数量的敏感性更低、更适合跨平台数据。

团队在做UPR打分时,没有只挑一组“总UPR基因集”,而是把UPR拆成了三个功能性分支基因集:PERK/eIF2α/ATF4轴、IRE1α/XBP1s轴、ATF6轴。每个分支单独打分,再综合出UPR总活性。拆开打分有个明显的好处:可以观察到在特定癌种里,UPR总活性可能变化不显著,但某一条分支明显上调。如果只看总量,这个信号就被稀释掉了。我自己的经验也是这样——只报告“UPR活性高低”而不拆分支,等于把篮球比赛简化成“谁得分多”,完全丢了比赛节奏和打法信息。

2.3 肿瘤进展的表型怎么刻画:不止是“好坏预后”

UPR打分完成之后,下一步是建立“UPR活性-肿瘤进展”的关联。肿瘤进展不是一个单一维度,团队的做法是把进展拆成多个可量化表型:病理学层面看TNM分期和分级;分子层面看肿瘤突变负荷(TMB)和拷贝数变异;免疫层面看免疫浸润丰度、细胞毒活性和免疫检查点表达;干细胞层面看干性指数(mRNAsi)。一套做下来,UPR就不再只是一个“预后基因标签”,而是和肿瘤行为的各个侧面形成了关联网络。

这里要特别说一下干性指数。肿瘤干细胞样细胞被认为是最难被药物清除的种群,而最近几年有多篇重要文献明确指出UPR与肿瘤干细胞维持密切相关。比如PERK-ATF4轴可诱导癌细胞向高间质/干细胞样状态转化。团队把干性指数纳入分析的聪明之处在于:它提供了一个“功能视角”——即便UPR活性与分期和生存没有直接线性关系,只要它与干性指数强相关,也足以说明该通路正在为肿瘤的“耐药蓄水池”添水。分析这类关联时还有一个可选方向就是代谢重编程打分,因为UPR的ATF6分支会直接调控脂质合成,脂代谢又与肿瘤膜完整性密切相关。把这些表型合并起来看,UPR的“全貌”才开始真正浮现。

3. 团队最核心的发现:UPR活性与肿瘤进展的关联网络

3.1 UPR高活性的肿瘤亚型长什么样

基于上述打分系统,研究团队把泛癌样本分为UPR高活性组和低活性组,然后系统比较了两组间的分子与临床特征。最直观的发现是:UPR高活性组在多种癌型里表现出更高的组织学分级和更晚的分期。也就是说,肿瘤越“恶劣”,UPR的灯往往亮得越猛。但这并不是一个绝对规律——在某些癌型里,UPR高活性反而集中在早期,说明UPR激活的时机可能存在癌种特异性的“窗口效应”。

更值得关注的是,UPR高活性组里,不仅三个分支的转录本上调,连带着内质网分子伴侣、ERAD组分和脂质代谢相关的基因也同步上调。这提示该高活性状态不是单纯“应激失控”,而更像是一整套蛋白稳态调节程序被肿瘤主动锁定。换句话说,肿瘤细胞不只是在硬扛压力,它已经把“抗压程序”整合进了自己的生存策略。

团队还观察到,UPR高活性的肿瘤亚型往往伴随间质成分增加,间质评分和上皮-间质转化(EMT)相关特征在高活性组显著富集。这个发现很有故事性:UPR可能不只是被动应对压力,还在主动改变肿瘤细胞的分化状态,让细胞变得更具“侵袭性”。

3.2 与免疫微环境的交互:既是“护盾”也是“信号”

泛癌UPR分析里最吸引人的部分,当属UPR与免疫微环境的关系。团队的结果显示,UPR高活性组通常伴随更低的抗肿瘤免疫浸润水平,尤其是CD8阳性T细胞和自然杀伤细胞的丰度显著降低;而调节性T细胞、肿瘤相关巨噬细胞等免疫抑制性种群则相对富集。这暗示了一个可能机制:UPR激活可促进肿瘤细胞分泌免疫抑制因子,同时通过下调表面抗原提呈相关分子来“隐去身份”,从而躲过免疫攻击。

更有意思的是UPR与免疫检查点分子的关系。在部分癌型中,UPR高活性组与PD-L1(CD274)高表达显著相关。这条线索把UPR和“免疫检查点抑制治疗耐药”联系了起来:肿瘤细胞使用UPR来维持存活,又通过上调PD-L1等分子抑制T细胞攻击。两个机制叠加,形成一道复合盾牌。这样的发现对临床有直接参考价值——如果未来的确要通过药物靶向UPR,那就要考虑与PD-1/PD-L1抑制剂联用,而不是单兵作战。

需要提醒的是,这类关联分析看到的只是共变关系。要证明“UPR高是通过某个具体的配体-受体轴来抑制免疫”,还需要细胞共培养、条件性敲除等实验。但泛癌分析的作用在于:它能从几十万个数据点里画出一条最值得验证的因果候选路径,告诉实验团队“往哪打靶”,这远比漫无目的的筛选高效。

3.3 驱动基因突变与UPR活性的耦合

最后一块拼图是UPR活性与肿瘤驱动突变的关系。团队分析了TCGA的体细胞突变数据,发现UPR高活性组的肿瘤突变负荷(TMB)整体偏高,且某些已知驱动基因突变与UPR活性显著共存。比如在特定癌型里,TP53突变样本的UPR活性明显高于野生型样本。这个耦合背后是有逻辑的:TP53突变会让细胞逃逸凋亡,被压垮的内质网压力没法通过p53介导的凋亡来“清算”,细胞只能长期维持UPR来续命。

类似地,KRAS、EGFR等癌基因突变也会驱动异常蛋白质合成,进一步加重内质网负担。肿瘤细胞相当于“一边踩油门一边开风扇散热”。泛癌数据把这些“司机突变”和“散热系统”之间的统计学关联展示出来,为后续构建基因型-通路表型联合分层提供了线索。

这一部分也能看出团队在分析上的克制。他们没有给每个突变和UPR的关系套上“因果关系”的帽子,而是用“共变”“共存”“显著关联”这类限定词。这个态度是对的——泛癌数据分析真正能提供的是“候选假说”,不是“因果判决书”。实验验证的事,应该留给湿实验室。

4. 这套分析里的方法学亮点与可复现性陷阱

4.1 评分构建:别小看基因集的选择

UPR打分系统的质量,很大程度上取决于基因集的质量。目前公开的通路数据库(如Hallmark、KEGG、Reactome)里都有“UPR相关通路”,但直接用会出现几个问题:一是不同数据库对“UPR”边界的定义不一致,Hallmark里的“Unfolded Protein Response”只有113个小鼠基因对应的人类同源基因,偏重应激核心模块;二是泛癌场景下,基因在不同组织里基线表达差异就很大,单个基因的绝对表达水平跨癌种可比性差。

团队处理的思路是:从文献和数据库里筛选出经过功能验证的UPR核心基因,再手动合并同源关系,确保三个分支都覆盖到,而不是直接拉取某个数据库的整套基因。这个“人工审查+数据库兜底”的基因集构建方式,听起来毫不惊艳,但恰恰是决定后续结论稳定性的关键动作。我在多年分析里多次遇到过:换一套来源的基因集,ssGSEA分数和后续生存分析的显著性直接变脸。所以如果读者打算复现这类分析,第一优先级就是“把基因集固定下来”,并且把基因构成、版本日期作为分析元数据写入方法部分,否则半年后你自己都说不清当时用的是哪一版。

4.2 共识聚类与鲁棒性验证:别让你的亚型是一次性的

当团队基于UPR三个分支的评分去区分亚型时,用到的不是主观阈值,而是共识聚类(consensus clustering)。共识聚类的思路是用不同的样本子集和聚类算法反复跑,最后汇总出一个“共识矩阵”,观察样本被稳定分到哪一组。这样做的好处是:亚型的划分不是赌在某一次聚类结果上,而是经过多次重采样后依然稳健的样本归属。这个策略能大幅降低“靠运气分型”的概率。

我见过许多人做分型时只跑一次k-means或者层次聚类,然后看一眼热图就说“我们发现了两个亚型”。这种做法的风险在于,聚类的类数选择(k值)本身带有主观性,不同的采样或特征选择都可能让样本“换组”。合理的做法是:对k进行扫描(比如k=2到k=6),结合共识矩阵的CDF曲线、PAC分数、silhouette分数综合确定k值,然后固定k值后再评估组间差异的生物学意义。团队在方法学上对鲁棒性验证着墨不少,这值得每一位做分子分型的读者认真学一遍。

4.3 时间分辨率:从静态走向动态

TCGA数据本质上是一张“静态快照”——每个样本只反映肿瘤被切除那一刻的分子状态。但对于UPR这种动态响应的通路,静态数据只能告诉你“灯亮着”,却不能告诉你“灯是刚亮还是即将熄灭”。为了弥补这个缺陷,团队借助了体外分化或药物处理条件下UPR周期的时间序列转录组数据,尝试将横截面信号向动态轨道映射。比如某些基因在UPR早期被诱导、后期回落,单看TCGA快照会误判为“不响应”。

这是泛癌分析最容易忽视的坑:把所有差异都当成稳定差异。实际上,UPR的很多标志基因是瞬时性表达的,采样的时机可能决定了是否能检测到差异。对这类通路,最理想的策略是叠加动态模型或速度分析来模拟过程变化。团队在这条路上做了尝试,虽然没有做到单细胞水平的RNA velocity级别的动态重建,但至少向领域内传达了一个信号——做应激通路分析,不能只看静态表达,还要想法子把动态维度补进来。

5. 对想做同类泛癌分析的后来者,我的几条实操经验

5.1 数据下载与批次效应的坑

泛癌分析最耗时也最劝退的环节之一就是数据准备。TCGA的数据可以通过GDC下载,但要注意:下载的表达矩阵有多个版本,有STAR-Counts、TPM、FPKM、RPKM等多种形态。做通路活性分析时,我通常建议用TPM,因为它相对更适合跨样本比较,且在ssGSEA打分前应该再做一次log2转换。如果你直接用FPKM或者RPKM,高表达基因的方差会被放大,会直接扭曲基因集富集结果。

批次效应也是个大坑。TCGA本身由多个中心测序,不同平台(如Illumina GA、HiSeq 2000、HiSeq 2500)之间表达定量的batch差异可能掩盖真实的生物学差异。处理办法是:要么使用官方推荐的统一处理后的数据版本,要么明确用ComBat-seq之类的工具做批次校正。但注意,校正本身也可能抹掉部分真实生物学信号,所以校正前后都应该跑一遍核心结论,确保结论不是“校正出来的”。

5.2 通路活性打分工具的选用

现在有很多UPR打分工具或通路活性推断方法可选,我按自己的经验列个参照表:

工具/方法输入要求适用场景注意事项
ssGSEA表达矩阵+基因集泛癌跨样本比较,最常用需对表达量做秩次变换,本质是比较“基因集在尾部表达的高于整体”的程度
GSVA表达矩阵+基因集样本数量较少时的探索性分析对不同数据集的绝对分数可比性更差,不适合直接跨项目合并
singscore表达矩阵+基因集简单快速,适合单个通路的粗筛对基因集长度敏感,基因越多分数越稳定
AUCell单细胞表达矩阵单细胞数据的通路活性打分需要先建立基因排序,计算量大

如果做的是UPR这样的多分支通路,我强烈建议先算主成分,再把三个分支的分数分别映射到主成分上,看它们在PCA空间里的方向是否分离。这样能比较直观地确认“三条通路是否提供独立信息”还是“只是同一个程序的不同侧面”。团队在文章里用了类似的多变量思路,虽然具体方法表述各不相同,但原理是共通的:用数据自身结构去验证基因集的生物学结构,而不是默认数据库的划分一定正确。

5.3 多表型验证:从关联到因果

到最后一步,很多人的分析就停在了“UPR与预后显著相关”这句话上。但这个结论对治疗的指导价值其实有限。高水平的泛癌分析一定要往前走一步,做多表型验证。具体到UPR这个话题,我建议至少从四个方面补数据:蛋白层面有没有对应改变;单细胞层面信号是否定位在恶性细胞;免疫微环境里是否有对应的细胞组成变化;体外实验或已有药物库里有没有可以对照的表型数据。逃过这些验证的“相关”,才有资格被称为“候选因果”。

这里提一个我自己踩过的坑。以前我分析某个通路和免疫浸润的相关性,得出了一个非常显著的结果。后来加上单细胞数据一看,那个信号完全来自微环境里巨噬细胞占比的变化,肿瘤细胞本身根本没上调那套通路。如果我当时直接下结论,整篇文章的方向都会带偏。所以,当你发现UPR活性与表型强相关时,先别急着高兴——多问一句,这个信号是“肿瘤细胞内在的”,还是“微环境细胞贡献的”。泛癌数据里,这个区分往往需要通过CNV推断的恶性细胞评分(如inferCNV)或单细胞亚群注释来完成。

最后分享一段个人操作体会

做这类泛癌通路分析几年下来,我最深的体会有两点。第一,基因集的定义要“锁死”。同一个UPR,用Hallmark版本和用Reactome版本,得到的样品分层可以差出去一大截。建议在做项目的第一天就把基因集导出存档,并记录来源版本,后续所有讨论都基于这个固定版本,不要中途频繁换基因集做对比,否则你会陷入“换一个基因集出一个故事”的循环里。第二,分析结论一定要在蛋白组或者单细胞层面试一次水。TCGA表达矩阵太干净了,容易给人一种“通路很听话”的错觉;只有等你打开单细胞图谱,看到信号确实集中在恶性细胞亚群里,心里那块石头才会真正落地。

海南大学的研究组把UPR在泛癌层面的“作战地图”铺开了,后续的机制深挖和药物联用实验必然还有很多硬仗要打。对同样想做通路类泛癌研究的人而言,我建议用这篇研究当模板,从基因集构建、分支打分、多组学验证到稳健分型,每一步都走扎实,最后产出的结论一定比单纯堆一个预后signature要耐得住检验。希望这篇拆解能帮你少踩几个我自己踩过的坑。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询