来源:Chromosome-scale genome assembly and integrated transcriptomic analysis reveal candidate regulators of omega-3 fatty acid and triacylglycerol biosynthesis in sacha inchi (Plukenetia volubilis)(Industrial Crops and Products)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
印加果(Plukenetia volubilis L.)是一种新兴木本油料作物,种子含油量高达35–60%,其中α-亚麻酸(ALA)占40–50%。然而,缺乏染色体级参考基因组严重限制了对其独特脂质合成通路的解析。本研究报道了印加果高质量染色体级基因组组装,跨度710.62 Mb,BUSCO完整性达94.3%,并将86.32%的序列锚定到29条假染色体上。结合发育转录组分析,揭示了TAG积累与合成基因持续表达及降解基因低活性相关,FAD2/FAD3表达分别与C18:2/C18:3积累正相关,并鉴定出可能调控核心脱饱和酶基因转录的候选lncRNA。
研究背景
印加果又称印加花生,原产于南美安第斯地区高海拔雨林,属大戟科。其种子是南美土著居民的日常食物,已被广泛研究用于营养、化妆品和药品开发。印加果种子含35–60%脂质、25–30%蛋白质,以及生育酚、多酚和甾醇等活性成分。其种子油中ALA含量高达40–50%,而亚油酸仅约30%,这种高ALA/LA比例对人体健康具有重要作用。然而,此前该物种仅有转录组研究,缺乏染色体级参考基因组,严重制约了对独特脂质合成通路的深入解析。本研究旨在填补这一空白。
研究方法
2.1 植物材料
选取一株生长于中国科学院西双版纳热带植物园(21°54’N, 101°46’E,海拔580 m)的一年生印加果(Plukenetia volubilis,基因型PvX1)植株进行全基因组测序。基因组DNA从叶片组织中提取。
【数据】材料:印加果叶片;基因型:PvX1;生长地点:西双版纳热带植物园;植株年龄:1年
2.2 印加果染色体数目测定
为研究印加果染色体数目,从种子萌发的植株上采集1–2 cm长的新鲜根尖。根尖用2 mM 8-羟基喹啉在20°C预处理2 h,然后用Carnoy固定液(甲醇:冰醋酸 = 3:1)固定。根尖在37°C下用2%纤维素酶 + 1%果胶酶溶液处理60 min。在预冷载玻片上进行染色体压片,随后用含DAPI的抗淬灭溶液(Vector)染色。使用配备微CCD相机的Zeiss A2荧光显微镜(Carl Zeiss,德国)拍摄图像。
【数据】试剂:2 mM 8-羟基喹啉、Carnoy固定液(甲醇:冰醋酸=3:1)、2%纤维素酶+1%果胶酶、DAPI;温度:20°C(预处理)、37°C(酶解);时间:2 h(预处理)、60 min(酶解);仪器:Zeiss A2荧光显微镜
2.3 基因组大小估算
来自220 bp文库的Illumina读数(27.24 Gb数据,约39.34×)经质量修剪获得clean reads,用于生成clean k-mer数据进行基因组大小估算。该分析使用Biomarker Technologies开发的"kmer_freq_stat"软件完成。基因组大小估算公式如下:G = Nk/d,其中G代表估算的单倍体基因组大小,Nk表示有效k-mer总数,d对应纯合主峰的k-mer覆盖深度。同时采用流式细胞术估算印加果基因组大小,以水稻(Oryza sativa L. ssp. Japonica)为参考标准,使用碘化丙啶(PI)进行核荧光染色。
【数据】测序数据量:27.24 Gb;覆盖度:约39.34×;文库插入片段:220 bp;参考标准:水稻;染色:PI;公式:G = Nk/d
2.4 基因组测序与组装
采用改良CTAB法提取基因组DNA。改良CTAB提取缓冲液含0.1 M Tris-HCl、0.02 M EDTA、1.4 M NaCl、3%(w/v)CTAB和5%(w/v)PVP K40。向CTAB提取缓冲液中加入0.5%(v/v)β-巯基乙醇以确保DNA完整性和质量。构建了15个不同插入片段大小的文库,包括两个短插入片段配对末端文库(220 bp和500 bp)和十二个mate-pair文库(插入片段为3 kb、4 kb、8 kb、10 kb、15 kb和17 kb)。PacBio长读长测序在PacBio RS-II平台以C4化学试剂完成,平均测序深度达11.73×。印加果基因组首先使用ALLPATHS-LG软件以默认参数基于Illumina读数进行组装。所得contig进一步用SSPACE v2.3以默认设置连接成scaffold,scaffold内的gap用GapCloser v1.12(SOAPdenovo包)以默认参数填补。在预组装基础上,利用PBJelly v14.9.9以推荐默认参数,用校正后的PacBio读数进行gap填补。
【数据】CTAB缓冲液:0.1 M Tris-HCl、0.02 M EDTA、1.4 M NaCl、3% CTAB、5% PVP K40;β-巯基乙醇:0.5%(v/v);文库:15个(220 bp、500 bp双末端;3、4、8、10、15、17 kb mate-pair);PacBio深度:11.73×;软件:ALLPATHS-LG、SSPACE v2.3、GapCloser v1.12、PBJelly v14.9.9
2.5 Hi-C辅助基因组组装
为获得高分辨率基因组接触图谱,参照前期研究方案并进行部分修改,采用in situ Hi-C方法。新鲜植物叶片用1%甲醛交联以稳定染色质相互作用。甲醛固定的叶片组织研磨成粉末并重悬于裂解缓冲液中,以破坏细胞壁并释放完整染色质。使用限制性内切酶MboI消化DNA,随后进行生物素化残基标记。近端DNA连接后,逆转交联,DNA经纯化和超声波片段化。通过生物素亲和纯化富集生物素化DNA片段,最后连接测序接头构建文库进行高通量测序。Hi-C文库在BGISEQ-500平台进行100 bp双末端测序。使用HiC-Pro流程进行质量控制。在所有864,873,129个原始双末端读数中,17%(147,193,076)的Hi-C双末端读数为有效读数,适用于后续分析,对应有效Hi-C覆盖深度为42.52×。染色体级scaffolding采用基于3D-DNA的层级策略。基于有效Hi-C读数,使用Juicer和Aiden实验室的Hi-C组装流程进行基因组组装,主要参数为"-m haploid -s 4 -c 29"。鉴于原始基因组中极短scaffold(短于500 bp)的Hi-C接触较少且难以分析,将这些scaffold从最终组装中移除。
【数据】交联剂:1%甲醛;限制酶:MboI;测序平台:BGISEQ-500;读长:100 bp双末端;原始读数:864,873,129个;有效读数:147,193,076个(17%);有效覆盖深度:42.52×;参数:-m haploid -s 4 -c 29;过滤标准:<500 bp scaffold移除
2.6 基因组注释
基因组注释包括四个部分:重复序列注释、蛋白编码基因预测、功能注释和ncRNA注释。重复序列通过多种方法注释。使用Tandem Repeats Finder(4.07)搜索基因组中的串联重复序列。转座子元件(TE)通过基于同源性的RepeatMasker(4.0.6)和基于蛋白的RepeatMasking以及从头方法LTR_FINDER(1.0.6)和RepeatModeler(1.0.8)进行预测。来自不同方法的冗余和重叠注释被合并,重叠区域被解析以生成最终的非冗余重复元件集合。蛋白编码基因基于ab initio、保守蛋白同源物和组装转录本的组合进行预测。AUGUSTUS(3.1)和GlimmerHMM(3.0.4)用于ab initio预测。AUGUSTUS使用橡胶树(Hevea brasiliensis)蛋白进行训练,GlimmerHMM使用拟南芥特化的预训练参数运行。从repeat-masked基因组序列预测基因。将拟南芥、橡胶树、麻风树、亚麻、木薯、毛果杨、蓖麻、油桐和葡萄的蛋白序列用BLAT与印加果基因组比对,最佳命中作为GeneWise(2.4.1)的输入以预测基因模型。转录本使用Trinity(2.6.6)组装。三类预测结果由GLEAN整合。ncRNA通过搜索各种RNA文库鉴定。tRNAscan-SE(1.3.1)用于鉴定tRNA。rRNA序列基于与已发表植物rRNA序列的同源性进行注释。snRNA和miRNA通过INFERNAL(1.1.1)软件搜索Rfam(版本12.0)数据库进行注释。使用INFERNAL中的"cmsearch"程序鉴定非编码RNA,e-value截断值为0.01。
【数据】软件:Tandem Repeats Finder 4.07、RepeatMasker 4.0.6、LTR_FINDER 1.0.6、RepeatModeler 1.0.8、AUGUSTUS 3.1、GlimmerHMM 3.0.4、GeneWise 2.4.1、Trinity 2.6.6、GLEAN、tRNAscan-SE 1.3.1、INFERNAL 1.1.1;数据库:Rfam 12.0;e-value截断:0.01;参考物种蛋白:9种
2.7 比较基因组分析
对于比较基因组分析,从选定物种的基因集中筛选高质量基因用于下游分析,包括基因家族聚类、系统发育分析、基因组共线性分析和全基因组复制分析。首先选择1:1单拷贝家族构建系统发育树。使用MUSCLE(3.8.31)对13个选定物种的单拷贝家族蛋白和CDS进行比对。四重简并……
【数据】分析内容:基因家族聚类、系统发育、共线性、WGD分析;物种数:13个;软件:MUSCLE 3.8.31;比对类型:1:1单拷贝家族
研究结果
3.1 基因组测序与组装
选取一年生印加果植株进行全基因组测序。为便于基因组组装,首先分析了印加果染色体数目。结果显示印加果染色体数为2x = 58(图1A),与前期研究一致——该研究在印加果72个观察细胞中,最常见的染色体数为2x = 58。使用Illumina HiSeq 2500平台,共产生275.34 Gb的clean双末端读数,对应印加果基因组397×以上的覆盖度,基于K-mer分析估算基因组大小为689.37 Mb。使用AllPaths-LG软件对这些序列进行从头组装,获得707.39 Mb的组装结果,contig N50为82.55 kb,scaffold N50为1.32 Mb。为进一步填补gap,通过PacBio测序进行长读长测序,获得716.52 Mb的组装结果,contig N50为194.13 kb,scaffold N50为1.34 Mb。随后使用Hi-C技术将组装序列锚定到染色体上,将86.32%的组装序列锚定到29条染色体上,最大和最小长度分别为35.98 Mb和11.04 Mb(图1B)。值得注意的是,86.32%的染色体锚定率与已发表的油料作物染色体级组装相当,包括麻风树(81.7%)和芝麻(85.3%),这些组装均支持了种子脂质生物合成通路的系统解析。未锚定部分主要由富含LTR反转录转座子的短片段组成。这些重复密集区域缺乏足够的独特染色质相互作用读数,无法实现精确的Hi-C排序和定向,这是Hi-C scaffolded植物基因组的常见特征。由于这些区域很少含有完整的多个外显子功能基因,且本研究中分析的所有核心脂质生物合成基因均完全锚定到染色体上,未锚定序列对下游基因组、转录组和调控网络分析无实质性影响。最终高质量组装为710.62 Mb,包含29条染色体和14,504个scaffold,N50为20.37 Mb,接近K-mer分析和流式细胞术估算的基因组大小。印加果基因组GC含量为29.97%,低于大多数已测序植物物种。与其他大戟科物种已发表基因组相比,印加果基因组基因间区的GC含量显著较低,而基因和外显子区域的GC含量相似。为评估组装质量,将220 bp文库的Illumina读数(27.24 Gb数据,约35.26×)用BWA比对到组装基因组。读数比对率和基因组覆盖度分别为95.24%和89.50%,表明基因组中错误组装频率较低。通过将1440个BUSCO用BUSCO v3.0.2比对到组装基因组来检查基因组完整性;该验证显示94.3%的BUSCO被组装基因组覆盖,其中74.2%为单拷贝,20.1%为重复,仅2.2%为片段化匹配。此外,印加果高度保守核心基因家族(coreGFs)的加权得分为98.6%。重复BUSCO比例相对较高主要归因于未 collapse的杂合单倍型,这是中等杂合度二倍体基因组从头组装的公认特征。在等位基因差异较大的区域,两个亲本单倍型通常组装成独立contig而非合并为单一共有序列,导致保守单拷贝基因产生假性重复信号,而非真正的基因家族扩增。低片段化率主要对应于重复密集的异染色质区域,如着丝粒和端粒,这些区域固有地难以用短读长测序数据完全解析。总之,94.3%的整体完整性确保了常染色质基因空间的全覆盖,完全足以满足本研究所有下游基因组和转录组分析的需求。

【数据】染色体数:2x = 58;Illumina数据:275.34 Gb(>397×);K-mer估算基因组:689.37 Mb;AllPaths-LG组装:707.39 Mb(contig N50 82.55 kb,scaffold N50 1.32 Mb);PacBio组装:716.52 Mb(contig N50 194.13 kb,scaffold N50 1.34 Mb);Hi-C锚定率:86.32%;染色体数:29条;染色体长度范围:11.04–35.98 Mb;最终组装:710.62 Mb,N50 20.37 Mb;GC含量:29.97%;比对率:95.24%;覆盖率:89.50%;BUSCO:94.3%完整(74.2%单拷贝、20.1%重复、2.2%片段化);coreGFs得分:98.6%
3.2 基因组注释
印加果基因组共含379.86 Mb(53.45%)重复序列,与蓖麻(50%)和Mercurialis annua(51.5%)相似。最丰富的转座子元件为长末端重复(LTR)家族,约占基因组组装的46%。通过基于5′和3′solo-LTR之间距离的差异来推算所有完整LTR结构的插入时间,研究了印加果反转录转座子活性,发现LTR插入时间约在1.6百万年前达到峰值。蛋白编码基因基于ab initio、保守蛋白同源物和组装转录本的组合进行预测,转录本来自我们产生的六个发育阶段种子(授粉后1周至17周(成熟))的转录组,以及其他已发表的不同组织转录本。从repeat-masked基因组序列预测基因。三类预测结果由GLEAN整合。最终共预测出37,570个蛋白编码基因,编码序列、外显子和内含子的平均长度分别为1145.3 bp、261.3 bp和490.8 bp。29条组装染色体的注释基因和核心基因组特征染色体分布总结在circos图中(图2)。其八个同心轨道依次显示染色体坐标、重复序列覆盖度、蛋白编码基因密度、GC含量变异、小非编码RNA(miRNA、tRNA、snRNA)位置和基因组内共线性片段。该图谱清晰展示了37,570个预测蛋白编码基因的不均匀染色体分布,并证实了印加果染色体级基因组组装的质量。印加果与其他七个植物物种的基因组比较揭示了基因数量、mRNA/编码序列/内含子/外显子平均长度、每个基因平均外显子数以及基因组GC含量比例的差异。BUSCO评估显示,1440个BUSCO中93%为完整,4%为片段化。预测基因的注释通过将其氨基酸序列与多个蛋白数据库比对完成,包括InterPro、KEGG、Gene Ontology、Swiss-Prot、NR和TrEMBL。总体而言,共33,959个(90.39%)蛋白编码基因能被上述至少一个数据库注释。此外,通过搜索各种RNA文库鉴定非编码RNA,最终鉴定出129个miRNA、158个rRNA和543个tRNA。

【数据】重复序列:379.86 Mb(53.45%);LTR占基因组:约46%;LTR插入峰值:约1.6 Mya;蛋白编码基因:37,570个;CDS平均长度:1145.3 bp;外显子平均长度:261.3 bp;内含子平均长度:490.8 bp;BUSCO:93%完整、4%片段化;功能注释率:90.39%(33,959个);miRNA:129个;rRNA:158个;tRNA:543个
3.3 比较系统发育与全基因组复制分析
(此节原文未完整提供,以下基于可获得的原文内容翻译)
通过比较基因组学方法,对印加果与其他大戟科植物进行了直系同源基因家族分析、系统发育构建和分化时间估算。维恩图展示了印加果与其他大戟科植物的直系同源基因家族重叠情况。分子钟分析构建了系统发育树并估算了分化时间,根部的数字代表分化时间,每个分支上方的数值表示……

【数据】分析内容:直系同源基因家族维恩图、系统发育树、分化时间估算;物种:印加果及其他大戟科植物
3.4 油生物合成相关基因在印加果种子中的表达谱
对印加果种子油生物合成相关基因的表达谱进行了分析。热图底部色标显示log10(RPKM+1)值。在Push模块中,BCCP1(异质型ACCase的生物素羧基载体蛋白1)、BCCP2(异质型ACCase的生物素羧基载体蛋白2)、BC(生物素羧化酶)……

【数据】表达量表示:log10(RPKM+1);分析模块:Push模块、Pull模块;基因:BCCP1、BCCP2、BC等
3.5 C18:1、C18:2和C18:3脂肪酸含量与SAD、FAD2和FAD3编码基因表达水平的关系
分析了C18:1、C18:2和C18:3脂肪酸含量与编码SAD、FAD2和FAD3的基因表达水平之间的关系。图5展示了多个物种中的这种关系:(A)紫苏,(B)亚麻,(C)印加果,(D)拟南芥,(E)花生,(F)棉花,(G)麻风树。(H)显示了FAD3/FAD2表达比与……之间的正相关关系。

【数据】物种:紫苏、亚麻、印加果、拟南芥、花生、棉花、麻风树;分析内容:FA含量与脱饱和酶基因表达相关性
3.6 WGCNA鉴定阶段特异性ALA相关lncRNA模块及与核心脂肪酸脱饱和酶基因共表达的代表性lncRNA
通过WGCNA分析,鉴定了与ALA积累相关的阶段特异性lncRNA共表达模块。图6A展示了四个lncRNA共表达模块与六个种子发育阶段(1、5、7、10、15、17 WAP)之间的模块-性状相关性热图。热图中的数值表示……

【数据】分析方法:WGCNA;lncRNA模块:4个;种子发育阶段:6个(1、5、7、10、15、17 WAP)

【数据】原文未详述
讨论与解读
本研究报道了印加果首个染色体级参考基因组组装,并辅以覆盖六个关键种子发育阶段(包括mRNA、miRNA、circRNA和lncRNA)的综合转录组图谱。这一整合基因组资源为解析印加果种子高含油量和异常ALA积累的分子基础提供了宝贵线索。
保守脂质合成框架与物种特异性时间优化。 植物种子油合成遵循高度保守的代谢框架。本研究的转录组数据显示印加果脂质生物合成基因具有明显的阶段特异性表达模式。具体而言,推定Push模块(从头脂肪酸合成)的基因在所有种子发育阶段均显示组成型高表达,暗示脂肪酸前体的持续供应;相比之下,推定Pull模块的基因——特别是塑造油脂不饱和度的脱饱和和酯化步骤——在中期至后期(10–15 WAP)表现出显著上调。该表达轨迹与活跃的ALA合成及其掺入一致。
编译者解读: 该研究为木本油料作物的基因组学研究树立了新标杆。染色体级组装与多组学整合策略的联合应用,使研究者能够从基因组结构、表达动态到调控网络多层次锁定关键候选基因与lncRNA。值得肯定的是,研究者将FAD2/FAD3表达与终产物C18:2/C18:3含量直接关联,为后续分子标记辅助育种提供了明确靶点。然而,lncRNA的功能仍停留在共表达推断层面,缺乏实验验证是该研究的主要局限。未来通过基因编辑或转基因手段验证这些候选调控因子的功能,将是推动印加果油脂品质改良的关键一步。
参考来源
Pan, B.-Z. (2026). Chromosome-scale genome assembly and integrated transcriptomic analysis reveal candidate regulators of omega-3 fatty acid and triacylglycerol biosynthesis in sacha inchi (Plukenetia volubilis). Industrial Crops and Products. DOI: 10.1016/j.indcrop.2026.124222
DOI: 10.1016/j.indcrop.2026.124222