EcoFoldDB 是一个数据库与注释流程,能够在宏基因组尺度上实现由蛋白质结构引导的生态相关微生物性状功能分析。传统的序列相似性方法在多样的环境微生物组中经常会遗漏远缘同源蛋白,而 EcoFoldDB 则借助 Foldseek 利用 3D 结构相似性,来识别并分类参与关键生物地球化学过程的微生物蛋白。该系统可处理从单个蛋白质到宏基因组研究中典型的数百万条序列的输入规模,使其成为面向生态系统尺度功能分析的现实工具。
传统的基于序列的注释工具(如 BLAST、DIAMOND、HMMER)依赖氨基酸序列相似性来分配功能。这种方法存在一个根本局限:具有相同折叠和功能的蛋白质在序列上可能会产生极大分化,导致相似度降至检测阈值以下。在环境微生物组中,绝大多数生物尚未被培养且在参考数据库中缺乏充分表征,这种序列相似度的“模糊地带”会导致对具有重要生态学意义的性状出现严重漏检。EcoFoldDB 通过比较蛋白质结构而非序列来解决这一问题,因为在漫长的进化过程中,结构的保守性远比序列一致性更为持久。该数据库专门针对生态相关的微生物功能进行精心构建,将条目组织成结构化的功能本体,涵盖八大生物地球化学类别。
EcoFoldDB v2.0 包含 843 个精选的蛋白质结构条目,涵盖八大生态类别。每个条目均注释有基因名称、蛋白质描述、分层功能分类、EC 编号、KEGG KO 标识符和 UniProt 编号。下表概述了其生态学覆盖范围。

输入文件:
FASTA格式的蛋白序列文件,文件名中避免出现空格或中文字符,若需分隔符,建议使用下划线 '_',如:CENA-BCM007_proteins.fa

小工具结果:
*.ecofolddb_annotations.txt

query:输入中的查询蛋白标识符;target:EFDB 目标结构 ID(例如 AF-P19913-F1-model_v4);evalue:结构比对的期望值;qcov:查询覆盖率(被比对的查询序列的比例);tcov:目标覆盖率(被比对的目标序列的比例);Gene:基因名称(例如 coxL, pmoA, rbcL);Protein:完整的蛋白质描述;Category:顶级功能类别(例如 Trace gas oxidation, Carbon cycling);Sub-category:功能子类别(例如 Atmospheric hydrogen oxidation);Pathway/Activity:特定通路或活性名称;EC:酶学委员会编号;KO:KEGG 直系同源标识符。
软件版本:
foldseek Version: 10.941cd33
EcoFoldDB-annotate v2.1.0
参考文献:
van Kempen, M., Kim, S.S., Tumescheit, C., Mirdita, M., Lee, J., Gilchrist, C.L.M., Söding, J., and Steinegger, M. Fast and accurate protein structure search with Foldseek. Nature Biotechnology, doi:10.1038/s41587-023-01773-0 (2023)
此版本为1.0,上架时间为2026-06-29