发布时间:2026/8/27 18:14:03
NextDenovo v2.5.2 安装与使用进阶--生信工具081 NextDenovoNextDenovo 是一款基于字符串图string graph的长读长序列从头组装软件适用于 CLR、HiFi 和 ONT 等长读长测序数据。该软件采用与 canu 相似的 “先校正后组装” 策略PacBio HiFi 读长无需校正步骤但所需的计算资源和存储空间显著更少。组装完成后序列的单碱基准确率约为 98%-99.8%若需进一步提升单碱基准确性可尝试使用 NextPolish 软件。我们以人类和黑腹果蝇的 Oxford Nanopore 长读长数据、拟南芥的 PacBio 连续长读长CLR数据为基准将 NextDenovo 与其他组装软件进行了对比测试。结果表明与其他工具相比NextDenovo 组装得到的序列连续性更好重叠群contig数量更少且在组装一致性和单碱基准确性方面NextDenovo 也表现出较高的组装精度。https://github.com/Nextomics/NextDenovo #官网安装环境要求Python支持 python 2 和 python 3需安装 Paralleltask 模块执行命令pip install paralleltask安装方法点击此处下载或执行以下命令wget https://github.com/Nextomics/NextDenovo/releases/latest/download/NextDenovo.tgz tar -vxzf NextDenovo.tgz cd NextDenovo若需从源码编译安装执行git clone gitgithub.com:Nextomics/NextDenovo.git cd NextDenovo make测试执行以下命令进行测试nextDenovo test_data/run.cfg常用命令及参数NextDenovo 至少需要一个读长文件参数input_fofn作为输入支持 gzip 压缩的 FASTA 和 FASTQ 格式所有运行参数均通过配置文件传递。输入项input_fofn一行一个文件可通过以下命令生成该文件ls reads1.fasta reads2.fastq reads3.fasta.gz reads4.fastq.gz ... input.fofn配置文件配置文件为文本文件包含一组键值对keyvalue形式的参数用于设置 NextDenovo 的运行参数。以下是典型的配置文件示例该文件也位于 doc/run.cfg 路径下[General] job_type local job_prefix nextDenovo task all rewrite yes deltmp yes parallel_jobs 20 input_type raw read_type clr # 可选值clr, ont, hifi input_fofn input.fofn workdir 01_rundir [correct_option] read_cutoff 1k genome_size 1g # 预估基因组大小 sort_options -m 20g -t 15 minimap2_options_raw -t 8 pa_correction 3 correction_options -p 15 [assemble_option] minimap2_options_cns -t 8 nextgraph_options -a 1输出项workdir/03.ctg_graph/nd.asm.fastaFASTA 格式的重叠群contig文件。FASTA 标题行包含序列 ID、类型、长度、节点数等信息序列中连续的小写字母区域表示弱连接区域单个小写字母标记低质量碱基。workdir/03.ctg_graph/nd.asm.fasta.stat组装结果的基础统计信息文件包含 N10-N90、总长度等指标。参数说明全局参数job_type sge任务运行的调度类型可选值local本地、sge、pbs、lsf、slurm 等默认值sge。job_prefix nextDenovo任务的前缀标签默认值nextDenovo。task all, correct, assemble需要执行的任务类型correct仅执行校正步骤assemble仅执行组装步骤仅当 input_type corrected 或 read_type hifi 时生效all执行校正 组装全流程默认值all。rewrite no是否覆盖已存在的输出目录可选值yes、no默认值no。deltmp yes是否删除中间结果文件默认值yes。rerun 3未完成任务的重试次数直至任务完成或达到设定次数设为 0 表示不重试默认值3。parallel_jobs 10并行运行的任务数量默认值10。input_type raw输入读长的类型可选值raw原始数据、corrected已校正数据默认值raw。input_fofn input.fofn输入文件列表路径要求一行一个文件必填参数。read_type {clr, hifi, ont}读长类型必填参数clrPacBio 连续长读长Continuous Long ReadshifiPacBio 高准确度长读长Highly Accurate Long Readsont纳米孔 1D 读长NanoPore 1D reads。workdir 01.workdir工作目录默认值当前目录 ./。usetempdir /tmp/test计算节点上的临时目录用于避免高 IO 等待默认值无。nodelist avanode.list.fofn可用节点的主机名列表一行一个节点非 sge 调度类型下需配合 usetempdir 使用。submit auto提交任务的命令auto 表示由 Paralleltask 自动设置。kill auto终止任务的命令auto 表示由 Paralleltask 自动设置。check_alive auto检查任务状态的命令auto 表示由 Paralleltask 自动设置。job_id_regex auto用于从提交命令输出中解析任务 ID 的正则表达式auto 表示由 Paralleltask 自动设置。use_drmaa no是否使用 drmaa 接口提交和控制任务。校正参数read_cutoff 1k过滤长度小于该值的读长默认值1k。genome_size 1g预估的基因组大小支持 K/M/G 单位后缀用于计算 seed_cutoff/seed_cutfiles/blocksize 及平均测序深度若手动设置 seed_cutoff该参数可省略。seed_depth 45预期的种子序列测序深度用于计算 seed_cutoff需与 genome_size 配合使用建议设置为 30-45 以获得更优组装结果默认值45。seed_cutoff 0种子序列的最小长度≤0 表示通过 bin/seq_stat 工具自动计算。seed_cutfiles 5将种子序列拆分为指定数量的子文件默认值与 pa_correction 取值一致。blocksize 10g并行运行的块大小将非种子序列拆分为多个小文件每个文件的最大大小为 blocksize默认值10g。pa_correction 3并行执行的校正任务数量每个校正任务约占用 总输入碱基数 / 4 字节的内存该参数仅覆盖此步骤的 parallel_jobs 取值默认值3。minimap2_options_raw -t 10minimap2 运行参数用于寻找原始读长间的重叠区域详见 minimap2-nd 说明文档。sort_options -m 40g -t 10排序参数详见 ovl_sort 说明文档。correction_options -p 10校正参数具体说明如下-p/--process设置校正使用的进程数默认值10-b/--blacklist关闭过滤步骤保留更多校正后数据-s/--split将包含未校正区域的种子序列拆分默认值False-fast加速模式速度提升 0.5-1 倍准确性略有下降默认值False-dbuf禁用 2bit 文件缓存减少约 总输入碱基数 / 4 字节的内存占用默认值False-max_lq_length校正后种子序列中连续低质量区域的最大长度值越大校正数据量越多但准确性越低默认值自动适配 [pb/1k, ont/10k]。组装参数minimap2_options_cns -t 8 -k17 -w17minimap2 运行参数用于寻找校正后读长间的重叠区域。minimap2_options_map -t 10minimap2 运行参数用于将读长比对回组装序列。nextgraph_options -a 1nextgraph 运行参数。

相关新闻

2026/8/27 18:14:03

3年Java程序员转行做AI大模型,自学成功上岸!!!

前言 我从事 java 3年左右开始转AI大模型,现在自觉也还在过程中。 我的路径相对曲线。我首先到了一个AI相关工作的部门做 java 工程,偏AI产品包装落地。这个部门本身不负责算法,基都是工程相关的同学,但接触算法的机会非常多。 运…

2026/8/27 18:14:03

AI大模型面试时被问到“Scaling Law”,怎么答?

前言 在大模型的研发中,通常会有下面一些需求:计划训练一个 10B 的模型,想知道至少需要多大的数据?收集到了 1T 的数据,想知道能训练一个多大的模型?老板准备 1 个月后开发布会,给的资源是 100 …

2026/8/27 18:09:02

RAG知识库质量优化全攻略:评估方法与改进技巧(收藏必备)

简介 文章详细介绍了RAG知识库的质量评估与优化方法。首先构建了基于余弦相似度的评估指标体系(召回率、正确度、是否基于知识),并与RAGAS框架进行对比,指出RAGAS判断力更强但成本更高。随后提出了两大改进方向:提升召…

2026/8/27 19:39:16

1.6万元预算游戏主机:9800X3D + 5060 Ti 16G配置与装机全攻略

1.6万元预算组一台打游戏的主机,核心锁定 AMD 9800X3D 和华硕 5060 Ti 16G 显卡,这个方案的重点不是把配件列表拉满,而是把预算、兼容性和实际游戏体验一起考虑清楚。很多人看到“X3D 16G显存”就觉得可以通吃所有场景,实际装机时…

2026/8/27 19:39:16

驯服 PUNKs:ES|QL 如何查询 Elasticsearch 从未被告知的字段

作者:来自 Elastic Alexander Spies 在 Elasticsearch 9.5 中,ES|QL 可以查询未映射的字段。它会从 _source 中读取这些字段,或者返回 null,因此即使某个字段从映射中消失,查询仍然可以正常工作,从而避免需…

2026/8/27 19:39:16

AI使用与职业疏忽:从注意义务到可辩护的决策流程

不使用AI会不会有一天被定性成疏忽?这个问题最近在我自己团队里被问了很多次。往年大家讨论的是“AI能做什么”,现在已经开始讨论“不用AI会不会担责”。这个变化非常实际,因为它把AI从一个效率工具抬升到了责任工具的位置。围绕这个问题的答…

2026/8/27 19:34:16

海外品牌发声无门怎么办?传播易如何构筑企业全球话语权?

在国内企业品牌出海的攻坚路上,“传播失语、发声无门”是绝大多数品牌面临的共性核心难题,也是制约中国品牌全球化发展的关键短板。不少出海企业深耕产品研发、打磨供应链体系、夯实产品品质,打造出具备国际竞争力的优质产品与品牌故事&#…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/27 10:58:22

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/27 7:46:21

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/27 0:01:16

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

2026/8/27 0:01:16

LeetCode Hot100(51-60)算法精解与面试技巧

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

2026/8/27 0:01:16

CRC校验实战:从模2除法到HJ212协议排错

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…