收藏小工具

ISEScan:插入序列元件识别和注释

ISEScan 是一个基于 Python 的计算流程,旨在识别和注释原核生物基因组及宏基因组中的插入序列(IS)元件。IS 元件是一类小型、可移动的 DNA 序列,能够通过“剪切-粘贴”或“复制-粘贴”机制在基因组内移动,在细菌进化、抗生素耐药性传播和基因组可塑性方面发挥着关键作用。与现有的 IS 元件识别工具不同,ISEScan 能够唯一地报告末端反向重复(TIR)序列——这是侧翼于许多 IS 元件的特征性边界特征——从而为识别出的元件提供了更深入的结构见解。
本流程已累计运行5次。
基因组与功能注释
请选择计算文件

运行状态

计算结果

下载计算结果

ISEScan 是一个基于 Python 的计算流程,旨在识别和注释原核生物基因组及宏基因组中的插入序列(IS)元件。IS 元件是一类小型、可移动的 DNA 序列,能够通过“剪切-粘贴”或“复制-粘贴”机制在基因组内移动,在细菌进化、抗生素耐药性传播和基因组可塑性方面发挥着关键作用。与现有的 IS 元件识别工具不同,ISEScan 能够唯一地报告末端反向重复(TIR)序列——这是侧翼于许多 IS 元件的特征性边界特征——从而为识别出的元件提供了更深入的结构见解。


ISEScan 的独特之处

ISEScan 通过几个关键能力将自己与其他工具区分开来,解决了早期 IS 识别方法的局限性。该流程可以处理多种类型的基因组数据,包括完整基因组、包含重叠群的草稿基因组和组装好的宏基因组,且对序列长度没有理论限制。一个关键优势在于其处理包含未知碱基(表示为 'N')序列的能力,这在草稿组装中很常见。也许最重要的是,ISEScan 是唯一能够系统性地检测并报告 TIR 序列的工具,使研究人员能够根据这些特征性的反向重复序列来验证完整的 IS 元件结构。

该流程支持灵活的报告模式:你可以选择仅识别完整的 IS 元件,或者同时捕获完整和部分元件。这种灵活性使得 ISEScan 适用于各种研究场景——从在新测序的基因组中发现新型移动元件,到在宏基因组数据集中全面编目所有与 IS 相关的序列。


ISEScan 的系统架构

该流程首先使用 FragGeneScan(用于从头基因预测)或 NCBI GenBank 注释(当 .gbk 文件可用时)将基因组 DNA 序列翻译为蛋白质组。然后,它将这些预测的蛋白质与预构建的转座酶谱隐马尔可夫模型进行搜索比对,转座酶是负责 IS 元件移动的酶。通过 E-value 过滤、相邻编码区的开放阅读框(ORF)合并以及冗余去除来优化匹配结果。核心创新发生在 IS 元件分析阶段,Smith-Waterman 算法(通过 Striped Smith-Waterman 库)在此检测候选 IS 元件周围的 TIR。最后,结果被格式化为标准文件类型(CSV, TSV, GFF)以便于下游分析和可视化。


输入文件

FASTA 格式的输入序列文件


输出文件

├── proteome/        # 预测的蛋白质序列
│ └── *.faa
├── hmm/         # HMM 搜索结果
│ ├── clusters.faa.hmm.*.faa
│ └── clusters.single.faa.*.faa
├── *.sum     # 按 IS 家族汇总
├── *.csv     # 详细结果(逗号分隔)
├── *.tsv     # 详细结果(制表符分隔)
├── *.raw     # 详细结果(原始格式)
├── *.gff     # GFF3 格式,包含 IS 拷贝和 TIR
├── *.is.fna    # IS 拷贝的核苷酸序列
├── *.orf.fna   # 转座酶基因的核苷酸序列
└── *.orf.faa   # 转座酶的氨基酸序列


软件版本:isescan 1.7.3

参考文献:

Zhiqun Xie, Haixu Tang, ISEScan: automated identification of insertion sequence elements in prokaryotic genomes, Bioinformatics, Volume 33, Issue 21, November 012017, Pages 3340–3347, 

https://doi.org/10.1093/bioinformatics/btx433
暂无内容