One Health视角下大肠杆菌β-内酰胺耐药基因组监测

来源:Global genomic surveillance of β-lactam resistance in Escherichia coli across human, animal, and environmental reservoirs(Infection, Genetics and Evolution)| 编译:DNA Lab Space | 原文许可:elsevier-subscription

📎 相关工具:高级引物设计工具

导读

大肠杆菌β-内酰胺耐药性的全球蔓延已成为公共卫生领域的重大威胁。本研究对2000至2025年间来自126个国家的30,554株大肠杆菌全基因组序列进行了One Health框架下的系统分析,整合了耐药基因组、序列分型、致病型分类及机器学习预测模型。研究揭示了ST131、ST11、ST10等优势克隆的全球分布格局及其宿主偏好性,刻画了β-内酰胺酶等位基因的时空动态,并利用梯度提升算法基于耐药基因谱预测最小抑菌浓度。该研究为耐药性监测和抗菌药物管理提供了迄今规模最大的基因组流行病学基线。

研究背景

大肠杆菌既是肠道共生菌,也是人类疾病的重要致病菌,可引发尿路感染、血流感染、新生儿脑膜炎及食源性腹泻。其跨越人、动物与环境的生态广度,使其成为One Health框架下抗菌药物耐药性(AMR)出现与传播的哨兵指标。β-内酰胺类抗生素至今仍是人类与兽医临床经验性和靶向治疗的基石,但其疗效正被跨宿主、跨地域传播的多层耐药机制不断侵蚀。理解这些机制如何在成功谱系中组装、如何随时间演变、以及不同储库间存在何种差异,对于设计适应性监测、诊断和抗菌药物管理策略至关重要。

大肠杆菌的β-内酰胺耐药由获得性β-内酰胺酶与染色体适应性改变的多样化组合驱动。超广谱β-内酰胺酶(ESBLs)以CTX-M家族变异体为全球主导,削弱了第三代头孢菌素的活性。质粒介导的AmpC β-内酰胺酶——尤其是bla CMY-2及相关基因编码者——拓宽了头孢菌素耐药谱并增加了表型检测的难度。碳青霉烯酶(如bla NDM、bla OXA-48样)的出现进一步压缩了治疗选择。与此同时,染色体层面的改变——包括ftsI基因中PBP3的YRIN/YRIP四氨基酸插入以及ompC、ompF孔蛋白变异——也在调节β-内酰胺敏感性中发挥作用。本研究利用One Health全基因组数据,对上述耐药决定因素的时空分布、宿主关联及谱系动态进行了大规模系统解析。

研究方法

2.1 研究设计与数据来源

本研究开展了一项回顾性、大规模的大肠杆菌基因组监测分析,旨在表征跨人类、动物和环境储库的β-内酰胺耐药基因组流行病学特征。从美国国家生物技术信息中心(NCBI)检索了2000至2025日历年的公共组装序列和BioSample元数据(https://www.ncbi.nlm.nih.gov/biosample/)。纳入标准为:分类学归属于大肠杆菌、具有组装FASTA文件、关联BioSample及采集年份。经质量控制后,分析队列包含来自126个国家的30,554个基因组。组装序列按完整水平分类:完整基因组(n = 2015)、染色体水平(n = 177)、支架水平(n = 8310)和重叠群水平(n = 20,052)。宿主/来源类别统一归为人类(n = 14,320)、动物(n = 8184)、环境(n = 3941)和未知(n = 4109)。各组中大多数分离株完成了多位点序列分型(MLST)分配(人类14,004;动物7901;环境3821;未知3922)。

【数据】基因组总数:30,554;国家数:126;年份跨度:2000–2025;完整基因组:n=2015;染色体水平:n=177;支架水平:n=8310;重叠群水平:n=20,052;人类来源:n=14,320;动物来源:n=8184;环境来源:n=3941;未知来源:n=4109;MLST分型:人类14,004、动物7901、环境3821、未知3922

2.2 基因组处理与质量控制

从NCBI报告中解析组装统计信息。在保留的基因组中,平均总长度为5,120,982.99 ± 255,022.2 bp,平均注释基因数为5099.98 ± 365.46,其中蛋白编码基因4832.85 ± 330.07个,假基因180.14 ± 73.50个。连续性指标(重叠群N50和支架N50)平均值分别为645,096.35 ± 1,436,703.41 bp和686,349.67 ± 1,470,454.5 bp。对于将基因组特征对采集年份进行回归的分析(基因组大小;总基因数、蛋白编码基因数和假基因数),在组装水平分层内应用四分位距规则去除统计离群值,以尽量减少组装质量而非生物学因素带来的混杂。所有下游分析均使用质控后数据集。

【数据】平均总长度:5,120,982.99 ± 255,022.2 bp;平均注释基因数:5099.98 ± 365.46;蛋白编码基因:4832.85 ± 330.07;假基因:180.14 ± 73.50;重叠群N50:645,096.35 ± 1,436,703.41 bp;支架N50:686,349.67 ± 1,470,454.5 bp

2.3 β-内酰胺耐药基因的检测与整理

使用AMRFinderPlus(https://www.ncbi.nlm.nih.gov/pathogens/antimicrobial-resistance/AMRFinder/)鉴定获得性耐药决定因素,软件版本4.2.5,采用数据库版本2025-12-03.1的精选点突变目录,使用默认核苷酸和蛋白质搜索参数。β-内酰胺酶等位基因统一为标准化名称(例如bla CTX-M-15、bla CTX-M-114、bla CTX-M-55、bla CTX-M-65、bla TEM-1、bla OXA-1和bla OXA-10、bla CMY-2、bla NDM-5)。为便于解读,基因按功能类别分组:超广谱β-内酰胺酶(ESBLs;主要为bla CTX-M变异体及ESBL型bla TEM/bla OXA)、质粒介导的ampC(bla CMY-2及近缘基因)和碳青霉烯酶(bla NDM、bla OXA-48样、bla KPC、bla IMP、bla VIM,如存在)。当可检出时,纳入调节β-内酰胺敏感性的染色体位点(特别是ftsI中PBP3改变,包括四氨基酸YRIN/YRIP插入,以及ompC[如R195L]和ompF孔蛋白变异)。每分离株β-内酰胺抗生素耐药基因(ARG)负荷定义为检测到的独特β-内酰胺耐药基因数量。

【数据】AMRFinderPlus版本:4.2.5;数据库版本:2025-12-03.1;搜索参数:默认核苷酸和蛋白质参数;ARG负荷定义:每分离株检测到的独特β-内酰胺耐药基因数

2.4 致病型与毒力谱分析

使用NCBI AMRFinderPlus并启用毒力基因检测功能鉴定毒力因子。输出表经过滤仅保留注释为毒力决定因素的位点,质量指标(百分比一致性和百分比覆盖度)从AMRFinderPlus报告中保留。毒力判定通过组装标识符与MLST数据关联。使用--plus选项鉴定AMRFinderPlus精选数据库中包含的选定毒力相关基因,指定生物体为埃希菌属。致病型分类采用基于已建立毒力标志特征的规则框架。该方法在大肠杆菌基因组流行病学中广泛使用,因为它提供了一种透明、可重复且可扩展的方法,可根据国际公认的致泻性大肠杆菌(DEC)和肠外致病性大肠杆菌(ExPEC)定义对大型异质性基因组集合进行分类。此外,它支持跨不同宿主、地理区域和时间段的标准化比较,同时适应水平基因转移产生的基因组可塑性和杂交致病型。致病型通过将毒力决定因素折叠为分离株水平标志位点的存在/缺失谱来分配。优先考虑毒素定义的组别以解决重叠。分类标准如下:推定EHEC,存在stx和eae;LEE阳性STEC,存在stx但无eae;EPEC,存在eae但无stx,进一步分为典型EPEC(tEPEC,存在bfpA时)和非典型EPEC(aEPEC,不存在bfpA时);ETEC,存在eltA和/或eltB,和/或estA和/或estB;推定EAEC,存在aggR、aatA和/或aaiC;推定EIEC定义为存在ipaH及至少一个侵袭质粒相关标志物(如virF或invE);携带NMEC相关标志物的基因组被分类为具有推定NMEC相关毒力谱,而非确定性NMEC;ExPEC相关基因组定义为存在以下标志物组中至少两个:papA/papC、sfa/foc、afa/dra、kpsM II和iutA。仅当有兼容的尿液来源元数据时才分配UPEC;否则,基因组被描述为携带UPEC相关毒力谱;APEC,存在iroN、iss、hlyF、ompT和iutA五个标志物中至少四个;推定DAEC,afaC、daa或dra。当应用多个规则集时,分类遵循上述优先顺序。优先层级基于已建立的致病型定义先验设定,并实施以确保携带重叠毒力决定因素的分离株获得互斥分类。该方法防止基因组在致病型类别间的重复计数,并与依赖毒力标志物谱进行致病型推断的大规模基因组流行病学研究一致。未检测到毒力位点的分离株明确标记为未分类。

【数据】毒力基因检测工具:NCBI AMRFinderPlus(--plus选项);目标生物体:埃希菌属;分类标准:EHEC(stx+eae)、LEE阳性STEC(stx无eae)、EPEC(eae无stx,tEPEC需bfpA)、ETEC(eltA/eltB/estA/estB)、EAEC(aggR/aatA/aaiC)、EIEC(ipaH+virF/invE)、ExPEC(≥2个标志物组)、APEC(≥4/5标志物)、DAEC(afaC/daa/dra)

2.5 多位点序列分型与系统发育群分配

使用MLST(版本2.19.0)(https://pubmlst.org/bigsdb?db=pubmlst_spyogenes_seqdef)(Achtman方案)从组装序列推断ST。使用ClermonTyping标志物组合(arpA、chuA、yjaA、tspE4.C2、trpA/B)进行计算机系统发育群分配。对于宿主组成和富集分析,保留至少8个基因组的ST以提供稳定的比例估计。

【数据】MLST软件版本:2.19.0;方案:Achtman方案;系统发育群分配方法:ClermonTyping(arpA、chuA、yjaA、tspE4.C2、trpA/B);ST纳入阈值:≥8个基因组

2.6 元数据协调

使用受控词汇表和基于规则的逻辑,将描述分离株来源的BioSample属性映射为四个标准化宿主类别(人类、动物、环境、未知)。当可用时优先使用"host"和"source"字段;如缺失,则使用"isolation_source"和"collection_site"。如提及"食物"且与动物直接相关(如来自动物的肉),归入"动物";如提及其他类型食物,归入"环境"。任何无法归入上述或其他定义类别的样本来源标记为"NA"(不可用)。国家名称标准化为ISO 3166-1 alpha-3代码(如"United States"→"USA","United Kingdom"→"GBR");领地和争议地区映射至主权国家以保持计数和可视化的一致性。在30,642个样本中,3,322个(11%)缺失采集年份,这些样本被排除在时间分析之外。

【数据】宿主类别:人类、动物、环境、未知;缺失采集年份:3,322/30,642(11%);国家编码标准:ISO 3166-1 alpha-3

2.7 结局定义与患病率计算

我们总结了三个主要耐药终点:(i)每基因组总体β-内酰胺ARG负荷;(ii)ESBL/ampC负荷(ESBL加质粒ampC基因计数);……

【数据】主要耐药终点:①每基因组总体β-内酰胺ARG负荷;②ESBL/ampC负荷(ESBL+质粒ampC基因计数);③原文节选在此处中断,其余终点原文未详述

研究结果

3.1 研究队列与测序/注释概要

共纳入30,554个大肠杆菌全基因组序列。组装状态为:2015个完整基因组、177个染色体水平、8310个支架水平和20,052个重叠群水平组装。每分离株平均注释基因总数为5099.98 ± 365.46;其中蛋白编码基因平均4832.85 ± 330.07个,假基因平均180.14 ± 73.5个。平均序列长度为5,120,982.99 bp ± 255,022.2。组装连续性指标为重叠群N50 = 645,096.35 bp ± 1,436,703.41,支架N50 = 686,349.67 bp ± 1,470,454.5。分离株报告自126个国家,跨越2000–2025年;最大贡献来自中国(n = 6177)。其中3,322个分离株(30,554的11%)缺失采集年份。这些缺失条目被排除在所有时间分析之外。由于相当比例的基因组以重叠群水平组装形式提供(65.6%),在解读基因患病率估计时应考虑组装碎片化对质粒相关耐药决定因素检测的潜在影响。研究纳入的组装类别分布见补充图1。由于研究基于所有符合纳入标准的公共可用基因组,地理代表性固有地依赖于序列可用性和提交实践。因此,测序活动更广泛的国家——特别是中国——对数据集贡献不成比例,患病率估计应在此不均衡地理分布的背景下解读。2019年年度提交量最高(n = 2645)。代表国家包括:AFG、DZA、AGO、ZWE。地理和宿主水平分布见图1。

Geographic and host distribution of sequence types (STs) in the study. (A) Dominant ST by country (top 20). Each of the top 20 countries (ranked by total ST count) is labeled with its name, and the colour indicates the most prevalent sequence type within that country. This panel provides a national
▲ Geographic and host distribution of sequence types (STs) in the study. (A) Dominant ST by country (top 20). Each of the top 20 countries (ranked by total ST count) is labeled with its name, and the colour indicates the most prevalent sequence type within that country. This panel provides a national

图1A显示了前20个国家各自的主导ST,揭示ST131是中国、美国、法国及其他多个国家的主导ST,而ST10在印度和孟加拉国占主导,ST155在坦桑尼亚占主导。图1B呈现了前20个国家与前8个ST的热图,显示每个ST在各国内的百分比分布。跨国比较中,ST131、ST10和ST410始终位列最流行ST,但其相对比例因地理区域而差异显著。年度提交量汇总于补充表1。

【数据】基因组总数:30,554;完整基因组:2015;染色体水平:177;支架水平:8310;重叠群水平:20,052;平均注释基因数:5099.98 ± 365.46;蛋白编码基因:4832.85 ± 330.07;假基因:180.14 ± 73.5;平均序列长度:5,120,982.99 ± 255,022.2 bp;重叠群N50:645,096.35 ± 1,436,703.41 bp;支架N50:686,349.67 ± 1,470,454.5 bp;国家数:126;中国贡献:n=6177;缺失年份:3322(11%);重叠群水平占比:65.6%;2019年最高提交:n=2645;主导ST:中国/美国/法国为ST131,印度/孟加拉国为ST10,坦桑尼亚为ST155

3.2 按宿主划分的序列型组成时间变化

2000–2025年的堆叠条形图揭示:(i)临床数据集始终以ST131、ST73和ST1193为主导,新高风险克隆逐渐积累;(ii)动物数据集持续以ST10和ST744为主导,周期性出现额外谱系;(iii)环境数据集显示高更替率,ST58、ST155等交替占据优势。前100个ST的聚类热图证实了宿主特异性聚类,跨宿主谱系(如ST410、ST648)桥接各聚类(补充图2)。ST的地理分布汇总于国家水平矩形树图(图1C),展示了全球性和区域性模式:ST131和ST410的全球传播;ST10在亚洲/非洲的频率较高;以及区域性富集如非洲的ST155和欧洲/美国的ST1193。所有宿主中ST组成的总体时间变化见补充图3。为进一步表征研究期间的谱系更替,检查了主要上升和下降ST的时间轨迹(图2)。

Rising and declining Escherichia coli sequence types and their associated β-lactam resistance and virulence profiles (2000–2025). Temporal changes in the prevalence of major Escherichia coli sequence types (STs) between 2000 and 2025 and their associated β-lactam resistance and virulence-factor prof
▲ Rising and declining Escherichia coli sequence types and their associated β-lactam resistance and virulence profiles (2000–2025). Temporal changes in the prevalence of major Escherichia coli sequence types (STs) between 2000 and 2025 and their associated β-lactam resistance and virulence-factor prof

若干谱系,包括ST410、ST38、ST155和ST69,在多个年份中表现出持续增加,而ST131、ST11、ST21和ST95则显示相对下降。这些模式表明种群结构的长期变化,而非局限于个别采样年份的突然波动。

【数据】临床主导ST:ST131、ST73、ST1193;动物主导ST:ST10、ST744;环境主导ST:ST58、ST155;跨宿主谱系:ST410、ST648;上升谱系:ST410、ST38、ST155、ST69;下降谱系:ST131、ST11、ST21、ST95

3.3 全球序列型景观:最新数据

使用最新的ST流行率数据集(分型n = 29,648个基因组),全球前五位ST为ST131(1693;5.71%)、ST11(1653;5.58%)、ST10(1526;5.15%)、ST410(1247;4.21%)和ST38(988;3.33%)。其他高频ST包括ST155(707;2.38%)、ST21(663;2.24%)、ST101(599;2.02%)、ST73(499;1.68%)和ST117(477;1.61%)。前20个ST占所有分型分离株的45.8%,表明其余2000多个ST构成低频谱系的长尾。这些全球频率与宿主和国家矩形树图(图1D)及补充表2中的ST频率表一致。

【数据】分型基因组数:29,648;ST131:1693(5.71%);ST11:1653(5.58%);ST10:1526(5.15%);ST410:1247(4.21%);ST38:988(3.33%);ST155:707(2.38%);ST21:663(2.24%);ST101:599(2.02%);ST73:499(1.68%);ST117:477(1.61%);前20 ST占比:45.8%;剩余ST数:>2000

3.4 MLST谱系的最小生成树分析

为可视化2041个……

Minimum spanning tree (MST) of 2041 sequence types (STs) from 30,642 E. coli isolates. The tree was constructed using Multilocus Sequence Typing (MLST) profiles with a threshold of three allele differences to define clonal complexes (CCs). Each node (circle) represents a unique ST, with node size pr
▲ Minimum spanning tree (MST) of 2041 sequence types (STs) from 30,642 E. coli isolates. The tree was constructed using Multilocus Sequence Typing (MLST) profiles with a threshold of three allele differences to define clonal complexes (CCs). Each node (circle) represents a unique ST, with node size pr

【数据】原文节选在此处中断,具体数据原文未详述

讨论与解读

这项覆盖126个国家、30,554个大肠杆菌基因组的大规模时间分辨基因组分析,提供了跨人类、动物和环境储库的β-内酰胺耐药演化的全面One Health视角。通过整合种群结构、耐药组动态、毒力谱和基于机器学习的表型预测,本研究在生态广度和时间分辨率上均超越了以往的基因组荟萃分析。研究发现与先前大肠杆菌和肠杆菌目的大规模基因组分析一致——这些研究一致报道了ExPEC谱系ST131的全球主导地位以及bla CTX-M-15作为临床环境中最流行ESBL决定因素的核心角色。既往研究还描述了碳青霉烯酶基因如bla NDM和bla OXA-48样以及CTX-M变异体(如bla CTX-M-14、bla CTX-M-27)在多个序列型中的传播,通常由IncF质粒介导,凸显了克隆扩增和水平基因转移在ESBL流行病学中的联合作用。与这些报道一致,本研究确认了上述全球模式,并通过更大的样本量和更广的生态覆盖对其进行了扩展。

Distribution of sequence types across host categories. This bar plot illustrates the distribution of 30,554 Escherichia coli isolates categorized by host types: Human, Animal, Environmental, and Unknown. Each colored bar represents the proportion of sequence types from each host source, with colors
▲ Distribution of sequence types across host categories. This bar plot illustrates the distribution of 30,554 Escherichia coli isolates categorized by host types: Human, Animal, Environmental, and Unknown. Each colored bar represents the proportion of sequence types from each host source, with colors
宿主类别中的致病型流行率。主要大肠杆菌致病型(ExPEC/UPEC、EAEC、EPEC、ETEC、STEC/EHEC)在人类、动物和环境分离株中的比例分布。
▲ 宿主类别中的致病型流行率。主要大肠杆菌致病型(ExPEC/UPEC、EAEC、EPEC、ETEC、STEC/EHEC)在人类、动物和环境分离株中的比例分布。
Pathotype landscape of 29,648 E. coli isolates. Pathotype assignment was performed using a rule-based gene-calling approach with first-match priority. (A) Overall pathotype prevalence across the entire cohort, showing the percentage and absolute count (n) for each pathotype. ExPEC (generic) was the
▲ Pathotype landscape of 29,648 E. coli isolates. Pathotype assignment was performed using a rule-based gene-calling approach with first-match priority. (A) Overall pathotype prevalence across the entire cohort, showing the percentage and absolute count (n) for each pathotype. ExPEC (generic) was the
Prevalence of antimicrobial resistance genes among E. coli isolates. Each horizontal bar represents a specific resistance gene, with its percentage prevalence and the total number of positive isolates (n) displayed beside it. Distribution of acquired beta-lactamase genes across isolates, highlightin
▲ Prevalence of antimicrobial resistance genes among E. coli isolates. Each horizontal bar represents a specific resistance gene, with its percentage prevalence and the total number of positive isolates (n) displayed beside it. Distribution of acquired beta-lactamase genes across isolates, highlightin
Trend of gene β-lactam gene prevalence (%) in Escherichia coli by host category. This figure shows the temporal trends in the prevalence of antimicrobial resistance (AMR) genes in Escherichia coli isolates from three host categories: Human, Animal, and Environment. The data spans multiple years, wit
▲ Trend of gene β-lactam gene prevalence (%) in Escherichia coli by host category. This figure shows the temporal trends in the prevalence of antimicrobial resistance (AMR) genes in Escherichia coli isolates from three host categories: Human, Animal, and Environment. The data spans multiple years, wit
Global dynamics of β-lactamase alleles and resistance gene families in Escherichia coli (2000–2025). Distribution, temporal dynamics, and co-occurrence patterns of major β-lactamase determinants among MLST-typed Escherichia coli genomes collected between 2000 and 2025. The figure summarizes the most
▲ Global dynamics of β-lactamase alleles and resistance gene families in Escherichia coli (2000–2025). Distribution, temporal dynamics, and co-occurrence patterns of major β-lactamase determinants among MLST-typed Escherichia coli genomes collected between 2000 and 2025. The figure summarizes the most
Temporal trends in antimicrobial resistance gene (ARG) burden across E. coli host categories (2000–2025). This figure displays bubble plots of linear regression trends for the mean AMR gene burden per isolate, stratified by host source (Human, Animal, Environment). Each plot represents the annual me
▲ Temporal trends in antimicrobial resistance gene (ARG) burden across E. coli host categories (2000–2025). This figure displays bubble plots of linear regression trends for the mean AMR gene burden per isolate, stratified by host source (Human, Animal, Environment). Each plot represents the annual me
Host-stratified temporal dynamics and diversity of major Escherichia coli sequence types. Host-specific population structure of Escherichia coli across human, animal, and environmental reservoirs. The figure summarizes dominant sequence types, temporal changes in lineage composition, diversity trend
▲ Host-stratified temporal dynamics and diversity of major Escherichia coli sequence types. Host-specific population structure of Escherichia coli across human, animal, and environmental reservoirs. The figure summarizes dominant sequence types, temporal changes in lineage composition, diversity trend
Temporal trends in genome size and gene content across sequence types (STs). (A) Relationship between sequence length (bp) and collection year across 124 isolates with Chromosome-level assemblies. A significant negative correlation was observed (r = −0.41, p < 0.001), indicating a reduction in genom
▲ Temporal trends in genome size and gene content across sequence types (STs). (A) Relationship between sequence length (bp) and collection year across 124 isolates with Chromosome-level assemblies. A significant negative correlation was observed (r = −0.41, p < 0.001), indicating a reduction in genom

编译者解读

该研究的核心价值在于将One Health理念真正落地为可量化的基因组监测框架——30,554株菌株的规模、2000–2025年的时间跨度以及跨人-动物-环境三储库的同步比较,为耐药性传播的源头追踪提供了基线数据。方法上,基于规则的多位点序列分型和致病型分类保证了大规模异质性数据的可重复性,梯度提升算法预测MIC则展示了基因型到表型映射的计算潜力。局限同样明显:公共数据库的地理偏倚(中国贡献n=6177)和组装质量差异(65.6%为重叠群水平)可能影响质粒介导耐药基因的检出率,而回顾性设计无法确立因果关系。对合成生物学而言,该研究提示:工程菌株的环境释放评估需要纳入类似的跨储库耐药基因流动监测框架。

参考来源

期刊:Infection, Genetics and Evolution, 2026

DOI: 10.1016/j.meegid.2026.105998

DOI: 10.1016/j.meegid.2026.105998

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12