来源:Ecological specialization and admixture drive the genomic and phenotypic diversity in Yarrowia lipolytica(Cell Reports)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
微生物多样性源于进化过程对基因组与表型性状的塑造。本研究以非常规酵母解脂耶氏酵母(Yarrowia lipolytica)为对象,对来自全球多样环境的126株菌株进行全基因组测序与表型分析,揭示了由生态特化和基因流动共同驱动的复杂种群结构。研究发现,部分谱系表现出生态过滤、遗传多样性降低和特有基因含量,反映出对乳制品或烃类等底物的特化适应;而其他谱系则维持较高的遗传多样性和更宽泛的表型能力。该研究展示了种群水平数据如何为工业性状的定向生物勘探提供依据。
研究背景
微生物在从营养丰富的基质到极端贫瘠的生态系统中广泛分布。理解微生物多样性如何在自然和人为环境中产生并持续存在,是进化生物学的核心挑战,对生态学、生物技术和微生物生物勘探具有重要意义。真核微生物中,酵母因世代短、易培养且基因组研究充分,成为研究这些动态过程的理想体系。酵母亚门(Saccharomycotina)的物种反复适应自然和人为环境,为探索环境压力如何驱动多样化、特化和基因组进化提供了宝贵框架。
与酿酒酵母(Saccharomyces cerevisiae)不同——其多样性主要受富含糖类的人类相关发酵环境影响——解脂耶氏酵母为研究发酵中心系统之外的微生物多样性提供了补充性框架。该物种广泛分布于食品、宿主、工业和城市环境、海水及土壤等多种生态位,其种群结构反映了基因流动与选择共同作用的复杂进化历史。
研究方法
菌株材料
本研究共汇集126株解脂耶氏酵母菌株,来源于全球培养物保藏中心和研究实验室,涵盖多样的生态位(食品来源、宿主、工业和城市环境、海水、土壤)和地理区域(北美洲、亚洲、北非和欧洲)。欧洲分离株占整个菌株库的50%以上。其中,67株为本研究新测序,其余59株的基因组数据来自Bigey等人(Table S1)。根据分离来源,菌株被分为以下类别:乳制品(Dairy);其他食品(除乳制品外的所有食品来源);海洋(海水);土壤;烃类(受烃类污染的环境,主要是土壤和燃料相关栖息地如燃料箱);宿主(从动物或人类中分离,包括临床样本);以及其他人类相关环境(与人类活动相关的环境,如城市区域或工厂)。
DNA提取与全基因组测序
酵母在YPD琼脂培养基(10 g/L酵母提取物、20 g/L蛋白胨、20 g/L葡萄糖、15 g/L琼脂)上、25°C培养24小时。生物量用Lyticase(Sigma-Aldrich)在37°C处理过夜。细胞裂解使用SDS(14%)和蛋白酶K在60°C处理1小时,随后进行CTAB/NaCl处理。DNA用氯仿:异戊醇(24:1)提取,乙醇沉淀,洗涤后重悬于Tris-EDTA缓冲液中。RNase处理(3 μL,10 mg/mL)去除RNA污染物。DNA质量通过凝胶电泳和NanoDrop分光光度法验证。测序使用Illumina NovaSeq 6000平台(双端150 bp读长,Novogene公司完成)。
【数据】培养基:YPD琼脂(10 g/L酵母提取物、20 g/L蛋白胨、20 g/L葡萄糖、15 g/L琼脂);温度:25°C(培养)/37°C(Lyticase)/60°C(裂解);时间:24h(培养)/过夜(Lyticase)/1h(裂解);试剂:Lyticase、SDS(14%)、蛋白酶K、CTAB/NaCl、氯仿:异戊醇(24:1)、RNase(3 μL,10 mg/mL);测序平台:Illumina NovaSeq 6000,双端150 bp
读长质量控制与变异 calling
使用FASTQC(v0.11.9)评估读长质量,Fastp(v0.20.1)进行修剪以去除低质量碱基(q < 20)、接头和poly-G序列。通过BWA-MEM(v0.7.17)比对到参考MAT位点并根据各位点读长计数确定交配型和倍性。一株二倍体菌株(CBS 6614)被排除。过滤后的读长使用BWA-MEM默认参数比对到修订的E150参考基因组。比对质量用Qualimap(v2.2.2)评估,丢弃比对率<60%的菌株。比对结果用samtools(v1.6)排序和索引,Picard(v2.27.4)标记重复。变异 calling 使用GATK(v4.1.9)的HaplotypeCaller、GenomicsDBImport和GenotypeGVCFs流程。变异按质量和深度过滤(--minQ 30,--min-meanDP 20),仅保留双等位基因SNP(v0.1.16)。
【数据】过滤参数:q < 20(低质量碱基);比对率阈值:<60%丢弃;变异过滤:--minQ 30,--min-meanDP 20;仅保留双等位基因SNP;工具版本:FASTQC v0.11.9、Fastp v0.20.1、BWA-MEM v0.7.17、Qualimap v2.2.2、samtools v1.6、Picard v2.27.4、GATK v4.1.9
种群基因组学与遗传多样性分析
使用207,153个过滤后的双等位基因SNP探究126株解脂耶氏酵母菌株间的系统发育关系。数据转换为PHYLIP格式后用IQ-TREE(v2.0.3)生成最大似然系统发育树。进行模型测试以选择最佳拟合模型,使用超快bootstrap选项和 ascertainment bias 校正构建系统发育树(-st DNA -o “outgroup” -m GTR+F+G4 -nt 8 -bb 1000)。系统发育树用ggtree R包(v3.6.2)可视化。
种群结构初步用ADMIXTURE(v1.3.0)评估,聚焦于未连锁的双等位基因SNP子集。基于连锁不平衡(LD)的双等位基因SNP过滤使用plink(v1.90b6.21)完成,参数为--indep-pairwise 50 10 0.2。祖先群体数(K)从2到16进行测试。使用Puechmaille方法选择最优K值,因为交叉验证误差方法在本数据集中倾向于高估K值。这种高估可能反映了群体间高水平的基因流动和渐渗,使遗传结构复杂化并导致标准方法得出膨胀的K值。渐渗菌株定义为在ADMIXTURE分析(K = 8)中单一群体祖先比例低于90%的菌株。
为验证种群结构,使用fineSTRUCTURE和主成分分析(PCA)。对于fineSTRUCTURE,SNP数据用PLINK格式化,染色体 painting 使用ChromoPainter V2完成,假设基于酿酒酵母的恒定重组率(0.4 cM/kbp)。fineSTRUCTURE(v4.1.1)运行参数为-x 100000 -y 100000 -z 1000。PCA使用eigensoft包(v8.0.0)中的SMARTPCA完成。
遗传群组基于整合多种证据的综合方法定义。ADMIXTURE分析、PCA和fineSTRUCTURE聚类共同支持八个遗传群组的存在。最大似然树的系统发育关系和SNP密度模式识别出支持良好的分支,如W29分支因其克隆性和独特的基因组谱而被归类为独立的遗传群组。这些遗传推断的群组根据其最具代表性的地理起源和分离来源命名,但Eur1/Mix-A、-B和-C除外,它们保留Eur1/Mix前缀以反映其密切的系统发育关系和更多样的来源。需要强调的是,这些名称是解释性总结,而非分组标准。
遗传多样性参数计算包含所有菌株,以评估群体内多样性。
【数据】SNP数量:207,153个双等位基因SNP;系统发育构建参数:-m GTR+F+G4 -nt 8 -bb 1000;LD过滤参数:--indep-pairwise 50 10 0.2;K值测试范围:2-16;渐渗定义阈值:单一群体祖先<90%(K=8);重组率假设:0.4 cM/kbp(基于酿酒酵母);fineSTRUCTURE参数:-x 100000 -y 100000 -z 1000
研究结果
渐渗与对不同人为环境的生态特化驱动解脂耶氏酵母的种群结构
为探索解脂耶氏酵母的基因组多样性和适应潜力,我们汇集了来自广泛分离来源的126株菌株的全基因组序列数据集。大多数分离株(70.3%)来源于人为环境,包括食品以及城市和工业环境,这反映了培养物保藏中心的全球菌株组成(Table S1)。基于207,153个全基因组SNP的物种种群结构分析揭示了八个遗传群组(图1A和1B)。这些聚类得到互补方法的一致支持,包括主成分分析、基于单倍型的聚类和SNP密度图谱(图S1、S2A、S2B和S3),并显示与分离来源和地理均显著相关(卡方检验,p = 5.29 × 10⁻¹² 和 8.38 × 10⁻⁷,分别对应图S4A和S4B)。

根据其主要生态和地理起源,我们将遗传推断的群组命名如下:北美植物基工业环境菌株(IndNA);欧亚土壤和烃类相关菌株(soil-hydrocarbon,So-HC);欧洲食品和宿主相关菌株(Eur1/Mix-A、-B和-C);以及欧洲乳制品来源菌株(Eur2/Dairy)。此外,含有参考菌株W29的克隆谱系被命名为W29分支(深蓝色,图1A),若干渐渗菌株归入Mosaic组(灰色,图1A)。系统发育和种群结构分析共同表明,北美菌株(IndNA)早期分化,随后其余欧亚谱系适应不同人为环境而多样化。
【数据】人为环境来源菌株比例:70.3%;SNP数量:207,153个;遗传群组数:8个;卡方检验p值:p = 5.29 × 10⁻¹²(分离来源)、8.38 × 10⁻⁷(地理)
为更好地理解种群结构模式背后的基因组基础,我们进行了解脂耶氏酵母的泛基因组分析。所得泛基因组包含6,707个基因,其中6,389个核心基因(所有菌株共有)和97个软核心基因(>95%菌株共有)。辅助基因组由221个基因组成,分为中频基因(5%–95%菌株,97个基因)和稀有基因(<5%,124个基因)。泛基因组是开放的(Heap's α = 0.83),意味着随着更多基因组的加入将发现新基因(图S5)。值得注意的是,辅助基因组中的基因含量变异受种群结构影响,这解释了24.2%的观测方差(PERMANOVA,置换多元方差分析;p = 0.001,图S6)。有趣的是,图S6中的PC2根据交配型将菌株分开,突显每个遗传群组有其偏好的交配型状态。
【数据】泛基因组:6,707个基因(6,389个核心基因 + 97个软核心基因 + 221个辅助基因);辅助基因组:97个中频基因(5%–95%菌株)+ 124个稀有基因(<5%);Heap's α = 0.83(开放泛基因组);PERMANOVA:基因含量变异24.2%由种群结构解释,p = 0.001
同时,我们研究了拷贝数变异(CNV)作为基因组可塑性的另一来源。我们鉴定了3,029个CNV事件,影响1,804个编码序列,不包括转座子和假基因(Table S2)。CNV频率和总基因组长度在遗传群组间的获得和缺失方面均存在显著差异(Kruskal-Wallis检验,p < 0.01,图S7)。
【数据】CNV事件:3,029个;受影响编码序列:1,804个;Kruskal-Wallis检验:p < 0.01(CNV频率和总长度,获得和缺失)
关于Mosaic、Eur1/Mix-A、Eur1/Mix-B和Eur1/Mix-C菌株,这些群组表现出较弱的种群结构,其较低的成对遗传分化(Fst = 0.08–0.38,图S8A)和较高的核苷酸多样性(π = 1.2–1.8 × 10⁻³,图S9A)模式与渐渗历史一致。事实上,图1B显示这些群组在低K值下与彼此以及W29分支和Eur2/Dairy共享祖先。单倍型共祖先分析(图S2A)揭示了Eur1/Mix-A和IndNA菌株之间广泛的SNP共享,而Mosaic菌株显示与W29分支和IndNA的基因流动(D统计量:D = 0.61,Z = 7.65,p = 2.02 × 10⁻¹⁴;D = 0.57,Z = 9.22,p = 2.3 × 10⁻¹⁶,分别对应)以及与Eur1/Mix-A到C的低分化,尽管它们在系统发育上分离(图1A),证实了跨谱系的渐渗和历史连通性。
鉴于这一复杂的进化背景,我们应用了多层次分析框架,结合基于分化的指标(成对Nei祖先距离,Da)、明确的渐渗检验(基于窗口的D统计量)和种群图谱推断来解决欧洲相关的渐渗模式。为获得更高分辨率,Eur2/Dairy内部亚分支(I和II)被独立评估。成对Da显示Eur1/Mix-A和Eur1/Mix-B各自与Eur1/Mix-C的相似度高于彼此之间的相似度,这一模式与Eur1/Mix-A的系统发育不一致,提示差异性的共享祖先。然而,这些谱系的密切相关性限制了我们在某些比较中区分保留的祖先多态性与基因流动的能力(基于窗口的D ≈ 0)。另一方面,基于窗口的基因组相似性和D统计量均一致表明Eur1/Mix-B与Eur2/Dairy-II亚分支之间存在渐渗,以及Eur1/Mix-C与Eur2/Dairy-I之间存在渐渗(图S10)。这些事件得到祖先重组图推断的进一步支持,该推断将Eur1/Mix-B与Eur2/Dairy-II定位在一起,Eur1/Mix-C与Eur2/Dairy-I定位在一起,为基因流动提供了独立支持(图S11)。

其他谱系(IndNA、So-HC、W29分支和Eur2/Dairy)表现出较低的核苷酸多样性(π = 1.7 × 10⁻⁵ 至 9.57 × 10⁻⁴,图S9A),与遗传瓶颈或有限的standing variation一致。这得到中等正值Tajima's D的进一步支持(图S12),表明过去的人口收缩或种群结构。相比之下,Eur2/Dairy表现出接近中性的Tajima's D(−0.02),提示该群体接近突变-漂移平衡。
【数据】Fst范围:0.08–0.38(Mosaic、Eur1/Mix-A、-B、-C);π范围:1.2–1.8 × 10⁻³(Mosaic、Eur1/Mix-A、-B、-C);π范围:1.7 × 10⁻⁵ 至 9.57 × 10⁻⁴(IndNA、So-HC、W29分支、Eur2/Dairy);D统计量:D = 0.61,Z = 7.65,p = 2.02 × 10⁻¹⁴(Mosaic-W29);D = 0.57,Z = 9.22,p = 2.3 × 10⁻¹⁶(Mosaic-IndNA);Tajima's D:Eur2/Dairy为−0.02
由于全基因组趋势可能掩盖基因水平模式,我们进行了位点水平的正选择检验(dN/dS分析,即非同义替换与同义替换之比),在1,957个基因中鉴定出4,238个正选择位点(p值 < 0.05)。这些结果表明,在广泛的基因组模式之外,大量基因带有生态特化的特征。
【数据】正选择位点:4,238个(p < 0.05);涉及基因:1,957个
与这些基因组特征一致,这些谱系还拥有独特的基因含量谱,可能反映对特定生态压力的适应性反应。例如,So-HC群体包含一个克隆性欧洲亚群,富含参与铁获取的基因,可能反映对土壤和烃类污染环境的适应(图1A)。Eur2/Dairy因其极低的核苷酸多样性(图S9A和S9C)和最小的基因含量变异性而突出,与克隆性一致。它缺乏谱系特异性基因,扩增基因组长度最短,受扩增影响的基因数最少(图S7A和S7B)。其少数CNV获得大多与转座子相关序列有关。这些发现,加上Eur2/Dairy形成最独特的共祖先聚类(图S2B)并占据系统发育中的末端分支(图1A),支持其作为近期分化群体的地位,由克隆增殖和生态约束塑造。

总之,我们的发现揭示了解脂耶氏酵母基因组多样性的两个主要驱动力:渐渗和选择。渐渗在欧洲与多种人为环境相关的谱系中尤为明显,贡献了更高的遗传变异;而选择似乎在紧密关联特定生态位(如乳制品或富含烃类的环境)的群体中占主导。这种生态特化伴随着基因含量的方向性变化和基因组多样性的降低,这是生态位适应的标志,并强调了该物种在人类改造环境中功能和生态分化的总体趋势。
【数据】So-HC特征:克隆性欧洲亚群,富含铁获取基因;Eur2/Dairy特征:核苷酸多样性极低、无谱系特异性基因、扩增基因组长度最短、扩增影响基因数最少、CNV获得多与转座子相关
解脂耶氏酵母的功能多样性反映种群结构和生态特化
为探索遗传多样性如何转化为表型差异,我们对覆盖整个数据集生态多样性的105株菌株子集进行了高-throughput表型分析。该分析评估了多种条件下的生长表现,包括不同碳源、氮源、温度和胁迫条件。

【数据】表型分析菌株数:105株;条件类型:碳源、氮源、温度、胁迫条件(原文未详述具体清单)
讨论与解读
通过将种群基因组学与高通量表型分析相结合,本研究提供了解脂耶氏酵母自然多样性的全面画像。与酿酒酵母不同——其多样性主要由富含糖类的人类相关发酵环境塑造——解脂耶氏酵母为研究发酵中心系统之外的微生物多样性提供了互补框架。其种群结构反映了基因流动与选择共同作用的复杂进化历史:Eur2/Dairy和So-HC等谱系表现出核苷酸多样性降低、基因含量特化和栖息地特异性表型,与近期生态特化和可能的驯化一致;而Mosaic和Eur1/Mix-A至C等群体则表现出更高的遗传多样性、广泛的渐渗和重组证据,提示由基因流动塑造的更动态的进化轨迹。
该研究的一个核心亮点在于,表型变异与遗传差异之间的直接关联——例如,烃类适应菌株在乙酸盐上的生长改善与调控变异相关。这为从自然多样性中定向挖掘工业相关性状提供了概念验证。
编译者解读
本研究展示了种群基因组学在工业微生物开发中的独特价值。传统生物勘探多依赖随机筛选,而本研究通过系统解析126株菌株的种群结构与生态适应逻辑,为"按图索骥"式地寻找特定工业性状(如乙酸盐利用、烃类耐受)提供了可推广的方法论框架。值得关注的是,泛基因组分析揭示的开放性质(Heap's α = 0.83)提示该物种仍有大量未发掘的遗传资源。一个潜在局限在于,培养物保藏中心的菌株偏向人为环境来源(70.3%),可能低估了自然环境中的多样性——未来结合环境宏基因组学或可弥补这一盲区。总体而言,这项研究为"生态进化理论指导工业菌株开发"提供了有力范例。
参考来源
期刊:Cell Reports, 2026
DOI: 10.1016/j.celrep.2026.117163
DOI: 10.1016/j.celrep.2026.117163