1. 先从中心法则说起:为什么lncRNA、miRNA、circRNA突然成了热点
十年前你要是跑到实验室说“RNA不只是信使”,很多老前辈可能觉得你在玩概念。现在再去看各大数据库,人类基因组里能编码蛋白的基因也就两万出头,但转录出来的RNA序列超过九成,剩下的绝大部分都是非编码RNA。那些不编码蛋白的转录本,很长一段时间被当作“转录噪声”,直到最近十来年才被真正拆开来看——其中miRNA、lncRNA、circRNA这三类,是研究最集中、机制最清晰、也最容易被混淆的组合。
先说这个概念本身。中心法则里RNA是DNA到蛋白质的中介,也就是mRNA。但同样的转录机制,还会产生一堆不翻译成蛋白的RNA,它们直接以RNA分子的形式干活。miRNA是长度约22个核苷酸的小RNA,主要绑定mRNA,抑制翻译或者诱导mRNA降解。lncRNA是长度超过200个核苷酸的长链RNA,作用模式五花八门,可以在细胞核里当支架,也可以跑去细胞质里吸附miRNA。circRNA则是封闭环状RNA,没有5'端和3'端,比线性RNA稳定得多,所以能在血液里稳定检出,被当作潜在标志物。
这三种RNA各有各的“诞生”路径,也各有各的“使命”。这篇文章我从一个做过几年RNA实验的人的角度,把它们的合成机制、调控逻辑、研究工具和容易踩的坑一次说透。不管你是刚进实验室的研究生,还是想了解肿瘤标志物开发思路的临床人员,按这个思路往下读,基本能把框架立起来。
注意:后面涉及大量实验细节,但不涉及具体湿实验protocol的逐字操作,更多是策略与原理层面的拆解。想直接上手的话,我建议配合你所在实验室的标准操作手册同步看。
2. miRNA的诞生与使命:最微小的序列,最精准的“基因音量旋钮”
2.1 从基因组到成熟体:miRNA的“生产线”
miRNA虽然成熟时只有21到23个碱基,但它不是直接合成的。绝大多数miRNA基因由RNA聚合酶II转录,初始产物是几百到几千碱基的pri-miRNA,带着帽子结构和poly(A)尾巴。这个pri-miRNA在核内被Drosha和DGCR8组成的微处理器复合物识别,切掉两端,释放出约70个碱基的发夹结构pre-miRNA。接着pre-miRNA被Exportin-5和RanGTP运出细胞核,在胞质里被Dicer切割成双链,其中一条作为成熟miRNA被装载进RISC复合物,另一条通常会降解。
这套流程里最值得留意的是Drosha的切割位点。它并不随机切,而是通过DGCR8识别pri-miRNA中发夹结构周围的单链区与双链区交界处。如果这个结构域有突变或者局部配对异常,会导致成熟miRNA表达量下降甚至完全缺失。我做过一批组织样本的miRNA测序,发现某些样本中一个特定miRNA的reads数从几千掉到几十,后来一查是SNP影响了pri-miRNA二级结构。这种问题在常规差异分析里特别容易被忽略,等你做qRT-PCR验证的时候才暴露出来。
除了经典通路,还有一小部分miRNA不走Drosha,比如miR-320、miR-451这类,它们依赖其他机制直接产生pre-miRNA或者绕过部分加工步骤。这类“非经典miRNA”在生信分析中经常被过滤掉,因为很多流程默认按miRBase前体注释来比对,导致漏掉。现在Ribo-seq和降解组测序的数据越来越多,这类非经典miRNA的功能也在被重新评估。
2.2 种子序列与靶标识别:那个“8个碱基”说了算
miRNA发挥作用的核心规则是种子序列,也就是成熟体5'端第2到第8个核苷酸。这7到8个碱基与靶mRNA的3'UTR完全互补后,即便其他位置配对一般,也能启动调控。正因为识别区域这么短,一个miRNA能同时调控几百个靶基因,这也解释了为什么单个miRNA的表达波动就足以影响一条完整通路。
靶基因预测工具基本都是靠种子匹配来找候选靶点。TargetScan要求更严格的保守性,miRanda给了更宽松的分数阈值,而miRDB基于高通量测序实验的数据训练模型。各工具结果交集越小越可靠,我常用的策略是取至少两个工具的交集,再结合表达负相关性筛一轮,最后用双荧光素酶报告基因验证。有些文章只做预测就开始讲故事,一旦碰到3'UTR上的SNP或者碱基修饰,就会影响miRNA与靶标的结合亲和力,结论很容易翻车。
miRNA的“使命”在实际生物学功能上,更像一个音量旋钮而不是开关。它很少把靶基因完全沉默,而是把表达水平调低20%到50%,这种“微调”对于发育过程中的基因精细调控特别有意义。比如肌肉分化时miR-1和miR-133对目标转录本的调控,就是典型的小幅度、多点位协同调控,而不是一击致命。
2.3 实验关键:定量、内参和物种化命名
miRNA的qRT-PCR跟普通mRNA不一样。成熟miRNA没有poly(A)尾巴,用常规oligo(dT)反转录是拿不到信号的。常见的做法是加poly(A)酶处理后用加尾法反转录,或者用茎环法引物特异性反转录。茎环法的特异性更好,但换成新批次引物后必须重新做标准曲线验证扩增效率。
内参选择也经常被忽略。U6虽然是经典内参,但它在某些组织里表达并不稳。有文献在肿瘤组织里发现U6波动明显,我自己的经验是,先测三到五个候选内参(比如U6、SNORD44、SNORD48、miR-16、miR-191),用NormFinder或geNorm跑一遍稳定性,再定最终内参。别嫌麻烦,这一步能让后续一批样本的结论靠谱很多。
命名上有个高频坑:hsa-miR-21-5p和hsa-miR-21-3p是来自同一条前体的两条臂,它们的靶基因可能完全不同。如果没有特别注明,盲猜哪条臂是主要功能链,在做功能实验时容易得到相反的表型。严格习惯是,测序报告里写明的5p/3p信息直接采用,不写的话去miRBase查前体结构判断。
3. lncRNA的诞生与使命:长链、低表达、高特异的“分子杂工”
3.1 长链非编码RNA到底怎么定义
lncRNA的定义听起来很简单——长度超过200个核苷酸、不编码蛋白的RNA。但实际操作里这个标准很模糊,因为“是否编码蛋白”本身取决于你的检测工具和数据库注释状态。很多lncRNA上其实存在小的开放阅读框,有的甚至可以结合核糖体产生短肽,只是这些短肽通常不稳定、丰度低、功能证据不足,注释上依然归类为lncRNA。
lncRNA的转录方式非常多样:有从基因间区独立转录的lincRNA,有从反义链转录并覆盖蛋白编码基因的natural antisense transcript,还有从基因内部内含子区域转录的。它们大多数由RNA聚合酶II转录,所以也有5'帽子和poly(A)尾巴,这也是为什么常规mRNA测序建库时,带poly(A)富集的文库能顺带捕获不少poly(A)+的lncRNA。但要小心,一部分lncRNA是没有poly(A)尾巴的,比如某些增强子RNA,这部分在poly(A)富集文库中丢失严重,需要去核糖体RNA文库才能抓到。
lncRNA的低表达是另一个特点。它们往往比mRNA低一到两个数量级,在组织间呈现极高的特异性。很多lncRNA只在特定细胞类型或者特定发育阶段表达,这意味着做组织块测序时信号容易被稀释。单细胞测序的应用让lncRNA的细胞特异性逐渐被看到,但大部分公共数据库仍然基于bulk组织数据,解读时得留个心眼。
3.2 工作台上的“多面手”:lncRNA的六类调控模式
lncRNA的功能模式没有统一规则,但大体可以归成几类。第一类是信号分子,它的转录本身就代表某个调控事件的发生,比如特定通路的激活会导致某个lncRNA即时表达。第二类是诱饵,例如部分lncRNA能结合转录因子,把它们“拽走”,从而间接激活或抑制下游基因。第三类是引导,lncRNA把染色质修饰复合物导向特定基因组位点,例如Xist介导X染色体失活就是一个经典引导模型。第四类是支架,lncRNA把两个或多个蛋白聚到一起形成复合物,HOTAIR就是同时结合PRC2和LSD1的典型。第五类是竞争性内源RNA,在细胞质中吸附miRNA,把miRNA对靶mRNA的抑制“释放”掉。第六类还可以直接结合mRNA影响其稳定性和翻译效率。
这个列表看着像万金油,却是lncRNA研究的双刃剑。功能模式的多样性意味着一次实验很难证明“它到底怎么干活”。EZH2是PRC2的催化亚基,很多文章动不动就说“某lncRNA通过结合EZH2抑制某基因”,但RNA免疫沉淀和染色质免疫沉淀的数据质量如果不匹配,这种结论就非常危险。我在审稿时看到过不少案例,RNA pull-down和RIP的结果根本无法呼应,却被强行说成直接调控关系。
3.3 从序列到功能:如何开展lncRNA的功能验证
如果你拿到一个新的lncRNA序列,第一步建议先做编码潜能评估。目前常用的是CPAT和CPC2,结合PhyloCSF评分看保守性。然后看亚细胞定位,核定位的lncRNA偏向表观调控和转录调控,胞质定位的偏好miRNA海绵或翻译调控。可以用核质分离加qRT-PCR确认,公共数据库如LNCatlas也有部分细胞系的定位数据可参考。
功能实验的思路一般是:先做细胞表型筛选(增殖、凋亡、迁移之类的),再用敲低或过表达验证表型是否被逆转。正义/反义敲低设计时要注意特异性,因为lncRNA与邻近mRNA可能在基因组上有重叠区域,siRNA序列如果设计到重叠区域,会误伤mRNA,得到假阳性。RACE实验能确认全长序列和转录起始位点,但很多lncRNA存在广泛的可变剪接,序列版本众多,这又是一个容易翻车的环节。
提示:做lncRNA过表达时,用全长序列比用剪接变体更稳,但前提是你能确认哪个剪接体在目标组织中真实存在。先跑一次RACE或者至少查GTEx的junction read信息,别只依赖Ensembl的自动注释。
3.4 数据库与工具的选型心得
lncRNA研究对数据库的依赖很强。LNCipedia收录了大量人类lncRNA转录本,而且会标明编码潜能打分。NONCODE整合了多物种注释,更新速度不错。LncBook则更偏功能注释和疾病关联。做进化保守性分析用LNCipedia的保守性评分或者UCSC的phastCons都比较顺手。
值得注意的是,不同数据库注释的lncRNA数量差别非常大,从几万到十几万条不等。这意味着你拿到的“新lncRNA”很可能是别的数据库早就注释过的,搜索时要多用几条别名交叉查。我习惯在拿到候选序列后,先在NONCODE、LNCipedia、Ensembl三个库各查一遍,并把reads比对可视化到IGV上确认转录结构,再做后续实验。
4. circRNA的诞生与使命:闭环结构、反向剪接、以及“海绵经济学”
4.1 反向剪接:circRNA是怎么来的
circRNA最核心的机制是反向剪接。常规剪接是把外显子按线性顺序连接,反向剪接则是把下游的剪接位点连到上游的剪接位点上去,最终形成一个共价闭合的环。这个过程需要剪接体参与,而且效率通常比线性剪接低得多,这也是大多数circRNA丰度远低于同源线性mRNA的原因。两侧的内含子上的ALU重复元件或互补序列,往往能通过拉近两个剪接位点来促进反向剪接的发生。
部分circRNA由外显子直接环化,称为外显子来源circRNA,主要定位在细胞质。另一部分由内含子保留形成,称为外显子-内含子circRNA,这类通常会留在细胞核内,可能调控其亲本基因的转录。还有一类完全由内含子组成的ciRNA,功能研究相对较少,但也在转录调控中有报道。
正因为circRNA没有游离末端,它不像线性mRNA那样容易被核酸外切酶降解。在血清、血浆、尿液这些体液中能长时间稳定存在,这是它作为疾病标志物的最大优势。但也因此,circRNA的可变剪接极其丰富——同一个基因位点能产生几十甚至上百种不同的环状转录本,因为你很难用一个统一规则定义“全长环”的边界。做circRNA鉴定时低质量比对和假阳性问题需要特别注意,尤其是那些来自高表达基因的环化事件。
4.2 作为miRNA“海绵”的实质:竞争性吸附的动力学问题
circRNA被讨论最广的功能是作为miRNA海绵,比如著名的CDR1as,含有超过60个保守的miR-7结合位点,能把miR-7吸附住,从而解放miR-7的下游靶基因。这个模型的逻辑很漂亮:circRNA用大量的miRNA结合位点“吸走”miRNA,变相增加了miRNA靶基因的表达。
不过“海绵”这个概念在水文里被用得太宽泛了。一个真正有效的miRNA海绵,需要在细胞里达到足够高的拷贝数来竞争miRNA,并且结合位点必须具备真实的结合能力,而不是简单用序列里有没有种子匹配来判定。有研究指出,许多circRNA的表达量远低于其潜在miRNA靶标,所谓的“海绵效应”在实际细胞内可能微乎其微。要做这种结论,AGO2-CLIP数据、表达相关性、双荧光素酶报告系统三个层面的证据缺一不可。
定量上有一个容易被忽视的前提:circRNA的特异性检测需要设计跨接合区(back-splice junction)的引物,否则普通外显子引物会把线性RNA一并扩进来。引物跨接合区只是第一步,还需要用RNase R处理样本验证,因为RNase R能消化线性RNA但对环状RNA几乎无影响。没做RNase R对照的circRNA数据,在审稿时基本不会过关。
4.3 不只当海绵:翻译短肽与亲本基因调控
最近几年的研究显示,部分circRNA在特定条件下可以被翻译,产生小肽。circRNA内部的IRES或m6A修饰能够启动翻译,开放阅读框跨越接合区的话,得到的肽段序列是线性转录本没有的。这种由环形模板翻译出的新肽段,可能具有独特的生物学功能,比如调控肿瘤细胞的线粒体代谢或者增强自噬。不过这类工作的证据门槛更高,通常需要质谱鉴定特异肽段、敲低/突变翻译起始位点、以及抗体验证,全套下来周期长、费用高。
另外一类功能是调控亲本基因。有些circRNA的形成会与线性mRNA剪接竞争,改变亲本基因最终成熟mRNA的比例,比如促进某些外显子的跳跃。有些环内含子circRNA则在转录水平上增强亲本基因的表达。这层调控的复杂性就在于,你观察到某个circRNA变化时,亲本基因的表达可能也在变,先确认表型是由circRNA本身而非亲本基因的剪接改变引起的,非常关键。
4.4 组织特异性与作为标志物的开发路径
circRNA的环状结构让它不需要像线状RNA那样依赖5'帽子结构,因此在细胞外囊泡里富集程度很高。外泌体包裹的circRNA有相对稳定的微环境,同时排除了游离RNA酶的降解风险,这让外泌体circRNA成为热门液体活检候选物。常规流程是抽血后分离血浆,用超速离心或试剂盒提取外泌体,再通过circRNA测序或者qPCR筛选候选标志物。这套流程在肿瘤、心血管疾病、神经系统疾病里都有大量报道,但距离临床转化还有几步路要走,关键卡在敏感性和重复性上。
开发一个circRNA标志物要注意三点。一是样本采集标准化,采血时间、放置时间、冻存条件都会影响外泌体产量和RNA完整性。二是要在独立队列中验证,训练集和验证集不能是同一个队列。三要关注性别、年龄、用药史对表达的影响,这些因素在回顾性样本里特别容易造成混杂偏倚。
5. 共调控网络与实验设计:ceRNA假设、竞争风险与整体思路
5.1 从“一对一”到“全网联动”:ceRNA调控网络
ceRNA的概念是2011年前后提出的。它的大意是:所有含有miRNA结合位点的转录本,都可能通过竞争同一miRNA而相互调节。mRNA、lncRNA、circRNA、甚至假基因转录本,都可以作为ceRNA参与网络调控。这样一来,一个miRNA的表达变化,会影响一群ceRNA的相对活性,反过来一个高表达的ceRNA也能缓冲miRNA的效应。
实际做ceRNA网络时,常见的错误是把预测的相互作用直接画成网络图,图上连线几百条,但没有一条被实验证实。从生物信息学角度合理的工作流至少应该包含三部分:差异表达分析、miRNA靶标预测、以及基于样本表达谱的相关性分析。值得强调的是,ceRNA网络依赖的是转录本之间的竞争关系,而不仅仅是表达相关性,所以靶标预测的可靠性和实验验证率直接决定网络质量。细胞质定位也是筛选前提,两个RNA如果分别待在细胞核和细胞质,就不可能发生ceRNA互作。
5.2 三种RNA同时纳入分析时,样本处理和建库策略
现在很多项目想同时看miRNA、lncRNA、circRNA,最常见的方式是抽完总RNA后分三份做不同建库:一份做small RNA建库,一份做rRNA去除的链特异性建库,一份做RNase R处理的circRNA建库。但样本量有限时,就需要按优先级来取舍。
如果关注的重点是lncRNA和mRNA差异表达,链特异性rRNA去除文库最合适;如果关注的是miRNA和isomiR,small RNA文库必不可少;如果专门研究circRNA,那必须做RNase R消化后测序,否则环状转录本reads只占总reads极小比例,很难圈出来。这里有个我自己踩过坑的经验:别在提取的总RNA里直接做RNase R处理再建库,因为RNase R处理会同时降解大部分线性RNA,导致整个文库复杂度下降,后面的差异表达分析会受很大影响。正确做法是专门为circRNA留一份RNA做酶处理,其余样本按常规流程建库。
5.3 多组学整合的经典分析流程
拿到数据后,先做质量控制,剔除低质量碱基和接头残留,再用STAR或HISAT2比对到参考基因组。miRNA部分用miRDeep2或miRBase注释来量化,lncRNA和mRNA用featureCounts统计reads数,circRNA用CIRI2、find_circ或circRNA_finder鉴定。对于circRNA的鉴定结果,至少要两个软件取交集,再用samtools检查比对信号,降低假阳性率。
差异分析首选edgeR或DESeq2,对于一个生物学重复3到5例的实验,用DESeq2更稳健;如果样本量少或者技术重复比较多,用edgeR的经典负二项模型也没什么大问题。得到差异RNA后,接下来才是区分三条线的信息整合阶段:miRNA靶基因富集分析,lncRNA可能的顺式调控靶标筛查(上游/下游10kb以内的基因),circRNA的宿主基因关联分析。富集分析不要只跑一个数据库,至少用GO、KEGG和GSEA三个维度交叉验证,才能让通路层面的结论站得住脚。
5.4 课题设计初期就应该避开的逻辑陷阱
最常见的问题是把相关性当因果。差异共表达只是给出候选关系,不等于调控关系。要确立一条ceRNA调控轴,常规证据链必须至少包括:RNA表达相关性、RNA结合蛋白(AGO2)参与的CLIP证据、双荧光素酶报告实验、以及回复实验(rescue)。比如你声称某lncRNA通过吸附miR-X来上调基因Y的表达,就要证明:敲低lncRNA后,miR-X游离量增加,Y下调;同时抑制miR-X,应能回复Y的表达水平。如果只做敲低lncRNA后Y变化一步,无法排除其他通路的参与。
另一个高频错误是混淆细胞内定位。ceRNA机制要求lncRNA或circRNA与miRNA在细胞质共定位。如果你的lncRNA测出来在核里占80%,就别硬凹“它与miRNA竞争靶基因”的故事。同理,circRNA鉴定时如果比对验证发现主要保留内含子序列,胞质富集解释也要谨慎。
6. 常见问题与实操避坑指南:实录我的踩坑心得
6.1 内参选择时最容易栽的跟头
我看到过太多刚入门的同学,miRNA实验一开始就用U6做内参,结果肿瘤样本里miRNA表达趋势一算全乱。不同组织条件下U6稳定性差异很大,尤其是肿瘤与癌旁比较时,U6可能本身就因为细胞增殖状态改变而变化。做三到五个内参候选并用软件筛选,虽然是举手之劳,但经常被省略。如果你已经用U6跑完一批样本,也别灰心,把同一批cDNA补测几个候选内参,重新归一化后再比较差异倍数,多数情况下能挽回结论。
对于lncRNA和circRNA表达检测,线性mRNA内参和环状RNA内参要分开考虑。circRNA用GAPDH做内参在很多实验里已经被证明有偏倚,这是因为RNase R处理后GAPDH会被消化,但在未处理样本中它表达正常。你只能保证同一批实验的cDNA来源和处理条件完全相同,才能用同一组内参。如果看的是血清样本,用cel-miR-39作为外参加样,比依赖内源内参更稳定,但外参的加样体积和浓度需要固定,否则样本间不均一还是会引起偏差。
6.2 circRNA实验里的假阳性和扩增异常
circRNA qPCR的最大问题是引物特异性。基因组DNA的污染在circRNA检测中长期存在,引物虽然没有内含子干扰,但在逆转录之前如果用DNase I消化不彻底,后续扩增信号可能有一部分来自基因组DNA。建库测序得到的circRNA如果是基因间区来源,基因组DNA带来的假阳性风险更高。可行的做法是设置无反转录对照组,如果这个对照的Ct值跟样本Ct接近,说明DNA污染已经严重到数据不可用了。
有时候扩增曲线出现双峰或者非特异性条带,未必是引物设计问题,也可能反转录引物带来的。检测circRNA时,反转录用随机六聚体引物比用oligo(dT)更合理,因为环状转录本没有poly(A)尾巴。加完随机引物后,建议在程序里延长退火时间,提升环状模板的反转录效率。
6.3 生信流程中参数选择与数据库版本依赖
不同版本的注释文件会直接改变基因的定量结果。把Ensembl或GENCODE版本升级后,之前注释为lncRNA的转录本可能变成蛋白编码,或者反之。我建议每次分析尽量锁定同一个注释版本,并在方法里写清楚。circRNA的检测结果更依赖参考基因组版本,所以如果是跨平台比较,最好先把所有样本重新比对一次,再做联合分析。
还有一个容易忽略的问题是链特异性。lncRNA注释和定量高度依赖链的方向,如果建库是非链特异性,reads会同时比对到正义链和反义链,很多反义lncRNA的表达量会被严重低估。做lncRNA研究,如果经费允许,尽量用链特异性建库,否则后面所有的方向信息都靠推断,功能解读很容易出错。
6.4 公共数据挖掘时的常见隐患
利用GEO、TCGA等公共数据做二次分析时,很多人习惯直接下载别人处理好的表达矩阵,却不检查这些矩阵是否统一用了同一参考基因组版本和注释版本。不同数据集之间差异表达结果一合并,可能混入了批次效应。更稳的办法是拿到原始reads,统一走一遍分析流程,或者至少在合并前用ComBat-seq做批次校正,并在报告里说明批次处理方式。
另外,公共数据里的miRNA表达谱往往来自不同平台,有芯片有测序,直接合并的数字不具备可比性,通常需要各自内部标准化后再做跨平台Meta分析。我对公共数据二次挖掘的建议是:多平台数据各自先做差异分析,再在参数级别合并P值或效应量,而不是直接拼表达值。
6.5 命名与数据库检索规范:别在文章里写错名字
RNA命名看起来是小事,但其实非常影响同行可复现性。人类miRNA标准写法是hsa-miR-21-5p,其中hsa是物种代码,miR代表成熟miRNA,mir则指基因或前体,两者大小写不一样,别混用。同源miRNA在不同物种中有相同序号时,如果序列完全一致,可以直接写miR-21,不需要带物种前缀;如果序列不完全一致,就需要后缀区分,比如hsa-miR-21和mmu-miR-21。
lncRNA的命名更混乱,同一转录本在不同数据库里可能叫法完全不同。建议在文章第一次出现时写官方名称,并在括号里标注别名和Ensembl转录本ID,方便检索。circRNA的命名至今没有统一标准,一般以来源基因名加环化坐标表示,比如circ_0001234,这是circBase的标准编号方式,但不同软件生成的后缀可能不一致,所以发布数据时附上坐标信息比只看名字要靠谱得多。
6.6 功能实验证据链的完整度评估
很多文章宣称“某lncRNA可能是某miRNA的海绵”,但细看证据只有序列预测和表达负相关,这种结论的力度很弱。我经手过一批项目,凡是最终能站住脚的ceRNA故事,大部分都补了四个层面的实验:确定亚细胞定位、验证直接结合、确认调控方向、验证回复效应。如果你想发好一点的期刊,从一开始就按这个标准设计,后面返工的概率会小很多。
要提醒的是,回复实验的具体操作也有讲究:先敲低候选ceRNA并加miRNA抑制剂,或者过表达ceRNA并加miRNA模拟物,观察下游靶基因和细胞表型是否被回复。两种回复路径如果结果一致,结论才坚固。只做一条路径容易出现假阴性,因为miRNA抑制剂本身存在脱靶效应,这会让阴性结果无法解释。
写在最后:我的一点实际体会
从miRNA、lncRNA到circRNA,每类RNA的研究都走过“发现—功能—机制—标志物”相似的路径。miRNA的研究框架最成熟,lncRNA的调控模式最多样,circRNA的稳定性优势最突出,但真要结合到一个课题里,它们的共性和差异都值得仔细掂量。我实际做下来最大的感受是,别把这三类RNA看成三个独立领域,它们在细胞里本来就在同一张调控网上,只有把“诞生”机制放在准确位置,“使命”的解读才不会跑偏。
最后分享一个实用技巧:无论你选哪类RNA做研究,先花一个下午把你要研究的RNA在至少三个数据库里的注释信息核对清楚,包括序列版本、坐标、组织表达谱和命名别名,然后把这个信息表打印出来贴在实验记录本第一页。后面每次分析、实验、写文章,都会省下大量跟命名和注释纠缠的时间。这一步看起来笨,但长远看是性价比最高的一件事。