Skip to content

Latest commit

 

History

39 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

seqs

seqs is a simple and fast CLI tool designed to summarise common bioinformatic sequence files in FASTA or FASTQ format.

It supports:

  • FASTA: .fasta, .fas, .fa, .fna, .ffn, .faa, .mpfa, .frn
  • FASTQ: .fastq, .fq
  • tar/zip archive files
  • gzip/bzip compressions

Quickstart

  1. Grab the latest binary from the releases section (No official releases yet), or build from source cargo build --release.
  2. Open a terminal and execute seqs --help to view the integrated help.
  3. Execute seqs followed by any valid files to generate a summary. You can also specify the metrics you want with --metrics <METRICS>.

Example

FASTA

Using the OX090893.1 (Escherichia phage vB_Eco_PATM genome assembly, chromosome: 1) sequence

$ seqs OX090893.1.fasta
File                         Format  Seq type    Seq count  Len sum  Avg len  Min len  Max len  
tests/data/OX090893.1.fasta  FASTA   Nucleotide  1          146804   146804   146804   146804

With --metrics all to output all available metrics

$ seqs --metrics all OX090893.1.fasta
File                         Time       Format  Seq type    Seq count  Ambiguous  Gaps  GC%    Len sum  Avg len  Min len  Max len  Q1      Q2      Q3      N50     L50  Avg quality  Q20%  Q30%  
tests/data/OX090893.1.fasta  415.61µs   FASTA   Nucleotide  1          0          0     37.42  146804   146804   146804   146804   146804  146804  146804  146804  1    NaN          NaN   NaN

FASTQ

Using reads from the NCBI's Sequence Read Archive: SRR39423861

$ seqs --metrics all SRR39423861_1.fastq SRR39423861_2.fastq
File                 Time     Format  Seq type    Seq count  Ambiguous  Gaps  GC%    Len sum   Avg len  Min len  Max len  Q1   Q2   Q3   N50  L50    Avg quality  Q20%   Q30%   
SRR39423861_1.fastq  99.17ms  FASTQ   Nucleotide  109476     0          0     58.59  32842800  300      300      300      300  300  300  300  54738  33.65        91.24  81.17  

File                 Time     Format  Seq type    Seq count  Ambiguous  Gaps  GC%    Len sum   Avg len  Min len  Max len  Q1   Q2   Q3   N50  L50    Avg quality  Q20%   Q30%   
SRR39423861_2.fastq  98.88ms  FASTQ   Nucleotide  109476     0          0     57.86  32842800  300      300      300      300  300  300  300  54738  30.60        81.73  68.50

Archives and compressed files

$ seqs --metrics all SRR39423861.tar.gz
SRR39423861.tar.gz | 423.452283ms
    File                 Time      Format  Seq type    Seq count  Ambiguous  Gaps  GC%    Len sum   Avg len  Min len  Max len  Q1   Q2   Q3   N50  L50    Avg quality  Q20%   Q30%   
    SRR39423861_1.fastq  204.96ms  FASTQ   Nucleotide  109476     0          0     58.59  32842800  300      300      300      300  300  300  300  54738  33.65        91.24  81.17  

    File                 Time      Format  Seq type    Seq count  Ambiguous  Gaps  GC%    Len sum   Avg len  Min len  Max len  Q1   Q2   Q3   N50  L50    Avg quality  Q20%   Q30%   
    SRR39423861_2.fastq  218.40ms  FASTQ   Nucleotide  109476     0          0     57.86  32842800  300      300      300      300  300  300  300  54738  30.60        81.73  68.50

About

A simple and fast FASTA/FASTQ summariser

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Contributors

Languages