Sign inSign up

bioedge/nmdc_mags

By bioedge

Updated over 6 years ago

Image
0

510

bioedge/nmdc_mags repository overview

The NMDC_MAGS are wrapped around the MetaWrap pipeline for metagenome assembly and MAGs (metagenome assembled genomes) generation.

In addition to the docker image, you will need to mount some databases to /databases directory into container that you downloaded onto your host system.

Download databases from web server
  1. checkM database

    #CheckM database is 275MB contains the databases used for the Metagenome Binned contig quality assessment. (requires 40GB+ of memory)

     mkdir -p CHECKM_DB  && cd CHECKM_DB
     wget https://data.ace.uq.edu.au/public/CheckM_databases/checkm_data_2015_01_16.tar.gz
     tar -xvf *.tar.gz
     rm *.gz
    
  2. NCBI taxonomy (optional for blobology and classify_bins)

    mkdir NCBI_tax && cd NCBI_tax
    wget ftp://ftp.ncbi.nlm.nih.gov/pub/taxonomy/taxdump.tar.gz
    tar -xvf taxdump.tar.gz
    rm *gz
    
  3. NCBI NT database (optional for blobology and classify_bins)

    mkdir NCBI_nt && cd  NCBI_nt 
    wget "ftp://ftp.ncbi.nlm.nih.gov/blast/db/nt.*.tar.gz"
    for a in nt.*.tar.gz; do tar xzf $a && rm $a; done
    
Usage
for de novo Assembly
docker run --rm -it  -v /path/data:/data bioedge/nmdc_mags \
    metawrap assembly -t 8 -1 /data/readsX_1.fastq.gz -2  readsX_2.fastq.gz -o assembly_output --megahit
for MAGs
  ## Binning
docker run --rm -it -v /path/checkM:/databases/checkM \
    -v /path/data:/data bioedge/nmdc_mags \
    metawrap binning -t 8 -a /data/assembly.fa -o bin_output --metabat2 --maxbin2 --concoct  readsX_1.fastq  readsX_2.fastq

  ## Refine Bins
docker run --rm -it -v /path/checkM:/databases/checkM \
    -v /path/data:/data bioedge/nmdc_mags \
    metawrap bin_refinement -t 8 -o refinebin_output -A /data/bin_output/metabat2_bins -B /data/bin_output/maxbin2_bins -C /data/bin_output/concoct_bins
Paths to fastq and fasta data (working directory)

/data

  • Note that the reads need to strictly name by xxxx_1.fastq and xxxx_2.fastq and only support paired-end reads.
  • reads fastq can be gzip compressed.
  • You can download example dataset from ENA. ex: SRR7877884
Paths to databases when mounted into the container.

/databases/checkM

/databases/NCBI_NT_DB

/databases/NCBI_TAX_DB

Tag summary

Content type

Image

Digest

Size

1.9 GB

Last updated

over 6 years ago

docker pull bioedge/nmdc_mags