去年夏天我从葡萄园里出来的时候,手机显示地表温度已经逼近40℃。回来以后一直和一个做葡萄种质资源的朋友讨论耐热性问题,最后发现我们俩的结论落到同一个点上:要搞清楚品种间耐热性差异,光看转录组不够,得把转录因子在基因组上的结合图谱拿到手。于是就有了这篇关于DAP-seq在葡萄耐热性研究里怎么落地、怎么用、有哪些坑的内容。
高温对葡萄的影响远不止“晒伤”这么简单:气孔关闭引起光合速率断崖式下跌,呼吸消耗反而加剧,活性氧大量积累,蛋白质发生变性失活,最终花青素合成被压制、糖酸比崩掉。耐热性本身是典型的多基因控制数量性状,但所有耐热响应都要靠一类蛋白来统领——转录因子(Transcription Factor, TF)。它们像总开关一样决定下游热激蛋白(HSP)、抗氧化酶、渗透调节相关基因要不要打开。
如果你想给自己研究的非模式作物引入新的调控研究手段,或者刚接触这个方向想找一条完整可复现的技术路线,那这篇内容应该对你有用。我尽量把材料选择、蛋白表达、文库构建、数据分析再到种质资源变异挖掘的链路都讲透。
1. 高温面前,葡萄的“耐热性”到底被谁决定
1.1 高温胁迫不是简单的热损伤
高温下葡萄最先崩掉的其实不是果皮,而是叶片的光合系统。PSII反应中心对温度极其敏感,温度一上来,电子传递链就会过还原,导致活性氧(ROS)爆发。紧接着叶绿体结构受损、Rubisco活化酶失活,碳同化直接停摆。与此同时,呼吸消耗一路走高,果实里本来该积累的糖分被白白烧掉。花青素合成通路在高温下会被抑制,这也是为什么夏季热浪一过,转色不好的“红葡萄”满园都是。
这一长串反应,如果都靠植物一条条逐步响应,根本来不及。植物进化出来的策略是用转录因子在第一波信号到达后“成批”启动防御基因。Hsf家族和DREB/CBF家族的转录因子激活HSP和多种保护性蛋白的转录,WRKY、NAC、bZIP等则参与更广泛的激素和胁迫信号整合。
拿葡萄里的Hsf家族举例。这是一个不算大的基因家族,从葡萄基因组里能找出来的成员也就十几个。别看数量少,功能却不简单。HsfA1是热胁迫响应的主导调控者,它会直接激活HsfA2和一系列HSP基因;HsfA2又进一步放大信号,形成正反馈。DREB2A的情况也类似,它在正常温度下被泛素化降解,热胁迫一旦发生就稳定下来,然后跑到下游靶基因的启动子上,开启脱水素、抗氧化基因的转录。
把转录因子比作配电房的“总闸”很合适——单独一个传感器只能控一条线路,总闸一动,整片区域的用电负荷都调整过来了。所以想研究耐热性的调控机制,绕不开转录因子这一层。
1.2 转录组能告诉你表达差异,但回答不了“结合在哪里”
很多实验室第一步都会做转录组,比较耐热品种和敏感品种在高温处理前后的基因表达差异。这当然有用,能筛出一堆显著上调的热响应基因。但问题也随之而来:差异表达基因里,哪些是转录因子直接调控的?这些转录因子结合在基因组的什么位置?结合位点上存在怎样的等位基因差异,导致不同种质耐热性表现不同?
这个问题靠转录组回答不了。要回答就必须做全基因组水平的TF结合位点鉴定。以前大家首选ChIP-seq,但葡萄这种多年生、无参考抗体的非模式作物做起来确实很痛苦,后面我会细说为什么。
1.3 从“表达调控”到“调控网络”的认知升级
种质资源在这里的意义在于,它提供了一个天然的等位基因变异池。不同品种的同一个Hsf基因,启动子区和编码区的序列并不完全一样;蛋白质与DNA结合的结构域也可能存在细微差异。有些差异可能不影响蛋白结构,但有些SNP正好落在结合位点区域内,那就可能改变这个转录因子的下游调控范围。这个层面的差异,正是同一种胁迫下不同品种表现分化的重要原因。
把某转录因子在特定条件下的全基因组结合图谱拿出来,再叠加转录组差异、表型差异,就能拼出“谁在调控谁、在哪里调控、不同种质之间有什么不同”的完整图景。这正是耐热机制研究从单基因水平转向调控网络水平的关键一步,也是DAP-seq这类技术被反复提及的原因。
2. DAP-seq是什么:不依赖抗体的体外全基因组结合位点鉴定方案
2.1 ChIP-seq在多年生木本植物上的三大痛点
ChIP-seq(染色质免疫沉淀测序)的流程大家都不陌生:固定细胞中的蛋白质-DNA复合物,断裂染色质,用目标蛋白的特异性抗体把复合物拉下来,再释放DNA测序。这个方法在模式作物上没什么问题,但在葡萄这种木本植物上会让人抓狂。
第一个痛点是抗体。葡萄的转录因子很多没有商品化抗体,自己制备周期长、成本高,还不一定好用。第二个痛点是组织量。ChIP-seq对起始材料要求不低,从田间或者组培苗取材后还得及时交联固定,不可控因素太多。第三个痛点是背景噪音。木本植物组织里次生代谢物多,抗体验富集很容易出现信噪比很糟糕的情况。更别提如果要比较多个品种,每个品种都要重新做一遍ChIP-seq,实验量直接失控。
2.2 DAP-seq的核心逻辑
DAP-seq(DNA Affinity Purification sequencing,DNA亲和纯化测序)走的是另一条路。它不依赖抗体,也没有交联步骤。核心逻辑是把转录因子蛋白体外表达出来,然后拿到含有目标基因组DNA的文库里去“钓鱼”,凡是能结合上去的DNA片段,最后都会被一起拉下来测序。
具体流程可以拆成这样:
- 提取目标材料的基因组DNA(比如葡萄叶片),用Tn5转座酶(Nextera体系)打断并加上测序接头,做成gDNA文库。这一步只需要极微量的DNA。
- 体外表达目标转录因子蛋白。用得最多的是小麦胚芽无细胞表达系统,也可以在细菌或昆虫细胞里表达。蛋白需要带上亲和标签,比如FLAG或HaloTag。
- 把体外表达的TF蛋白和gDNA文库混合孵育。转录因子会在体外条件下找到自己偏好的结合序列。
- 用标签对应的亲和介质(比如anti-FLAG磁珠)把蛋白-DNA复合体拉下来,洗掉非特异结合的背景DNA。
- 洗脱DNA、PCR扩增、上机测序。随后通过peak calling找到富集区域,就是该转录因子的候选结合位点。
这里面最巧妙的一点是:整个过程不需要知道细胞里这个TF表达到什么水平,也不需要和实验处理保持同步。这对多年生果树的研究场景太友好了——只要你有足够的基因组DNA,就能相对标准化地批量测试多个转录因子。
2.3 与其他主流方法的差异对比
用一个表格直观一点:
| 方法 | DAP-seq | ChIP-seq | Y1H | EMSA |
|---|---|---|---|---|
| 是否需要抗体 | 不需要 | 必须 | 不需要 | 不需要 |
| 是否体内进行 | 体外 | 体内 | 酵母体内 | 体外 |
| 全基因组范围 | 是 | 是 | 否(通常是筛选) | 否(单片段) |
| 对材料要求 | 仅需gDNA | 需目标组织并交联 | 需酵母转化 | 需纯化蛋白和探针 |
| 适合非模式物种 | 很适合 | 较困难 | 一般 | 适合验证 |
| 能否批量做 | 能 | 较难 | 一般 | 难批量 |
从这个表能看出来,DAP-seq不是要取代ChIP-seq,而是在某些场景下比ChIP-seq更合适。如果研究目的是“在多个种质资源材料上系统比较一个TF的结合谱差异”,DAP-seq是更现实的选择。反过来,如果想确认这个TF在特定组织、特定条件下的体内真实结合情况,ChIP-seq或CUT&Tag仍然有不可替代的价值。
3. 动手做之前,先把实验设计里的三个关键点想清楚
3.1 材料选型:种质资源圃是最好的起点
做耐热性相关研究,第一件事是确定代表性材料。我会建议从种质资源圃里挑出两个耐热性差异最大的品种,而不是随便挑两三个常用品种。怎么确认差异真实存在?可以分两步:一是查已有的田间观察记录或耐热性评价数据;二是自己做短期的半致死温度评估,比如对盆栽苗进行40℃、42℃、44℃梯度处理,测定叶片最大光化学效率(Fv/Fm)、相对电导率、丙二醛含量这些经典生理指标。只有生理数据支撑的耐热差异,才经得起后续审稿人的追问。
这里要特别提醒一点:DAP-seq用到的gDNA不一定非要来自热胁迫处理过的材料。因为TF在体外识别DNA序列时,结合偏好主要由自身的DBD结构域决定,和材料当时有没有被热处理关系不大。这一点和转录组设计完全不一样,也是刚接触的人最容易绕晕的地方。
3.2 转录因子候选怎么挑
DAP-seq一次只能做一个或少数几个TF,所以“做谁”这个选择很关键。我会看三类数据:一是物种中该TF家族的进化分析和保守性;二是高温处理前后该TF在转录组里的表达变化;三是该TF在瞬时转化或过表达材料里的表型证据。筛选优先级按“表达受高温诱导、家族成员耐热功能被报道、有初步表型数据”来排基本不会错。
比如你手里的材料里某个HsfA1的表达在热胁迫下显著上调,它在其他作物里的同源基因又被反复验证是耐热开关,那这个基因就值得优先做DAP-seq。如果一上来就选一个表达没变化、功能证据也不足的TF,后面数据出来了也很难讲出故事。
3.3 蛋白表达和gDNA文库质控
DAP-seq最常见的翻车点有三个:蛋白没表达出来、gDNA文库的背景污染高、没设好负对照。
蛋白表达建议优先尝试无细胞表达体系。小麦胚芽无细胞体系可以直接在96孔板里高通量表达蛋白,反应体系里背景蛋白复杂度也比较低。表达完之后不要直接拿去孵育,先取一部分做SDS-PAGE或Western blot确认蛋白大小对不对、有没有严重降解。这一步只花两三个小时,能省下后面整个测序周期的钱。
gDNA文库这边,Nextera转座体系对DNA质量比较敏感。葡萄叶片本身多酚多,最好在常规提取后再加一次酚氯仿抽提,或者用专门的去多糖多酚试剂盒再纯化。转座时间要控制在合适范围,转座过头会导致片段过短、文库多样性下降;转座不够又会造成大片段残留,影响后续上机数据产出。
负对照是重灾区。无论用哪种表达系统,都要设一个“只加标签蛋白”或者“不加蛋白”的对照文库,后续peak calling才有基线可以扣除。我见过不少第一批数据没做负对照的案例,最后只能凭经验扣背景,审稿环节非常被动。
4. 数据下机以后:从reads到可信结合位点的完整处理链路
4.1 比对与质控的常规动作
DAP-seq下机数据本质上是DNA测序数据,没有链特异性,也不需要表达定量,处理起来比RNA-seq要省心一些。我习惯的顺序是:FastQC看碱基质量和接头情况,cutadapt或Trimmomatic去接头和低质量碱基,然后BWA或bowtie2比对到葡萄参考基因组。
fastqc *.fastq.gz cutadapt -a AGATCGGAAGAGC -q 20 -m 30 -o trimmed.fastq.gz input.fastq.gz bwa mem -t 8 reference.fa trimmed.fastq.gz | samtools sort -o aligned.bam picard MarkDuplicates I=aligned.bam O=dedup.bam M=dup_metrics.txt比对率一般能做到80%以上,如果低于60%,先回头检查参考基因组版本和接头去除参数。比对后记得去重,DAP-seq的文库扩增容易引入大量PCR重复。去重率能反映文库复杂度,复杂度太低说明建库有问题,测出来的peak可信度也不高。
4.2 Peak calling参数的一些心得
peak calling我用MAC S2,这点大家基本没争议。但DAP-seq和ChIP-seq的参数习惯不太一样。ChIP-seq通常跑窄峰模式,而DAP-seq结合位点同时包含启动子和部分远端增强子区域,可以根据TF类型选择窄峰或宽峰。对于大部分转录因子,窄峰就够了;如果做某些结构特殊的超大蛋白复合体,再考虑带--broad参数。
macs2 callpeak -t treated.bam -c control.bam -f BAMPE -g 475000000 -q 0.01 --outdir macs_outMACS2的默认cutoff(q < 0.05)在DAP-seq里略宽松,建议用q < 0.01甚至更严格,同时要求peak与负对照相比富集倍数至少2倍。我有一次跑某个NAC家族TF的时候,q < 0.05环境出来接近两万个peak,明显是背景噪音;把q收紧到0.01并去掉负对照富集不到2倍的区域后,剩下大概四千个peak,后续分析就扎实多了。
4.3 Motif分析与靶基因注释
peak拿到了,接下来两件事:一是看TF结合序列有没有富集出已知的motif,二是给peak注释到对应的基因。
motif分析我用HOMER做de novo,同时用MEME Suite和JASPAR数据库做验证。这里有个很实际的经验:de novo motif富集出来的核心基序,一定要和该TF家族已知的cis-element比对。如果富集出的序列完全对不上已知motif,先不要急着宣布发现了“新motif”,大概率是peak calling出了偏差,或者输入了错误的蛋白信息。
peak注释可以用ChIPseeker这个R包,输入peak的BED文件和参考基因组注释GTF。ChIPseeker可以输出peak落在启动子、外显子、内含子、基因间区等位置的分布。通常转录因子peak会显著富集在启动子区(TSS上下游2 kb以内)。如果富集不出来,还是先检查参考基因组的注释版本是否完整。
5. 单看DAP-seq远远不够:和转录组、生理实验怎么互相验证
5.1 为什么DAP-seq结果不能当“实锤”
DAP-seq本质是体外结合实验,它反映的是转录因子“有能力结合哪些地方”,不等于它在细胞内真实结合了这些地方。染色质状态(比如是否开放、甲基化水平)、其他蛋白的竞争结合、转录因子自身的翻译后修饰,都会影响体内的真实结合情况。所以DAP-seq筛出来的候选靶基因,一定要经过其他实验的证据链支撑才能形成结论。
5.2 一个典型的联合分析逻辑
我个人比较喜欢这样的分析顺序:
- 对高温处理前后的耐热品种RNA-seq数据做差异表达分析,得到DEG集合。
- 用bedtools把DAP-seq peak(尤其落在启动子区域的)和DEG的启动子区域取交集。
- 对交集靶基因做GO和KEGG富集分析。如果富集到的正好是protein folding、response to heat这类条目,可信度就上来了。
- 挑几个关键靶基因仔细看表达趋势。
整套逻辑用一句话概括:一个TF要有贡献,至少得“能结合到启动子区域”和“下游靶基因表达受影响”这两件事同时成立。如果DAP-seq结合位点里的基因在转录组里根本没有响应,那它大概率只是体外偏好,体内作用有限。
5.3 湿实验验证的优先级排序
验证可以按由易到难的顺序推进:
- qRT-PCR检验调控关系:TF过表达或沉默以后,候选靶基因的表达是否跟着变化。
- 双荧光素酶(Dual-LUC)瞬时表达实验:把靶基因启动子构建到LUC载体里,同时共表达TF,看LUC信号是否被激活或抑制。这是目前做转录因子验证最常用的手段,成本低、周期短。
- EMSA进一步确认体外结合的直接性:把关键靶基因启动子片段设计成探针,看TF蛋白是否能直接结合并导致条带迁移。
- 稳定转化或CRISPR突变体验证表型:这一步在葡萄上特别费时间,但抗性验证最扎实。
按这个优先级推进,整个证据链会比较完整,也不至于一上来就被困在稳定转化这种大工程里。
6. 种质资源是天然变异库:结合位点差异如何转化为育种价值
6.1 从单一TF图谱到群体结合差异
DAP-seq的另一个高价值应用,是把同一个TF放到多个种质资源里做比较。葡萄种质资源圃里的材料基因型差异大,同一个TF结合位点上可能天然存在SNP或小的InDel。这些变异如果改变了TF与DNA的互作强度,就有机会解释不同品种在耐热性上的部分差异。
具体做法不复杂:先对核心种质做重测序,或者基于已有的变异数据,把DAP-seq peak区域内的SNP提取出来;然后按耐热等级把品种分成高低两组,统计peak区域SNP的等位基因频率分布。如果某些位点的变异和耐热等级显著共分离,这些位点就可以作为候选分子标记进行后续开发。
6.2 这个策略能回答什么新问题
把传统研究路径和加入DAP-seq之后的研究路径放在一起,差别很明显:
| 传统研究 | 加入DAP-seq后 |
|---|---|
| 找到一个TF在耐热材料中上调 | 知道它上调后结合了哪些靶基因 |
| 找到一个启动子变异与耐热相关 | 知道该变异是否正好落在TF结合位点上 |
| 有两个品种耐热表型不同 | 知道是因为TF结合目标区域的能力存在差异 |
这种信息的价值在于,把过去只能关联到“这个位点和耐热有关”的未知区域,变成“这个位点是我的TF的直接结合区域,而这里的等位基因差异改变了结合强度”。这样就更接近分子层面的因果机制,育种标记的可靠性也更高。
6.3 局限与拓展
诚实地说,DAP-seq有它的局限。体外结合实验无法模拟体内染色质的可及性,DNA甲基化修饰在gDNA文库中也被丢掉了,而这些因素在细胞内是可以干扰TF结合的。所以DAP-seq更适合作为“快速全基因组筛选+候选变异定位”的手段,而不是研究的终点。
如果想继续往深处走,可以和ATAC-seq叠加,通过染色质开放性进一步过滤结合位点;或者结合eQTL分析,看TF结合位点的等位基因变异是否影响下游靶基因的表达。这套思路在葡萄种质资源方向同样可以迁移到冷害、干旱、盐胁迫等其他非生物胁迫的研究里,逻辑完全一致。
最后分享一点个人体会。DAP-seq技术刚火起来的时候,不少同行觉得它“没有体内证据、容易被审稿人挑刺”,多多少少有点观望。我实际用下来的感受是,它最大的价值不在于替代ChIP-seq,而在于把非模式物种转录因子全基因组结合位点鉴定的成本和门槛降了下来。对葡萄这种多年生木本作物来说,DAP-seq加转录组加种质资源变异分析这一套组合,是当前从调控网络入手做耐热机制研究的一条切实可行的路线。如果你正打算开展类似课题,建议先从耐热性差异清晰的两个品种入手,用一个功能证据比较明确的TF把全流程跑通,再根据数据情况决定要不要放大到更多材料。把管线跑通本身就是项目里最花时间也最值得的部分。