Sign inSign up

maadsdocker/tml-privategpt-with-gpu-nvidia-amd64

By maadsdocker

•Updated over 1 year ago

This container provides GPT access to LLM running insider Docker...you need an NVidia GPU.

Image
3

1.1K

maadsdocker/tml-privategpt-with-gpu-nvidia-amd64 repository overview

Model descrption: https://huggingface.co/TheBloke/Mistral-7B-Instruct-v0.1-GGUF⁠

Embedding Model: https://huggingface.co/BAAI/bge-small-en-v1.5⁠

Run this container:

docker run -d -p 8001:8001 --gpus all --net=host --env PORT=8001 --env GPU=1 --env WEB_CONCURRENCY=2 --env COLLECTION=tml-cisco --env 
CUDA_VISIBLE_DEVICES=0  --env temperature=0.1 --env vectorsearchtype="Cosine" --env contextwindowsize=8192 --env vectordimension=384 maadsdocker/tml-privategpt-with-gpu-nvidia-amd64

Now, enter: http://localhost:8001/⁠ (in your browser)

NOTE: You MUST have the Qdrant VectorDB container running as shown below:

 docker run -d -p 6333:6333 -v $(pwd)/qdrant_storage:/qdrant/storage:z qdrant/qdrant

This private GPT container is 100% local, FREE, secure and production ready. This repo is cloned from https://github.com/imartinez/privateGPT⁠.

There is a container that will access NVidia GPU enabled server. This container can also be accessed via MAADSTML Python Library API.

open chrome or browser: localhost:8001

Details of LLM:
llm_load_vocab: special tokens definition check successful ( 259/32000 ).
llm_load_print_meta: format = GGUF V2
llm_load_print_meta: arch = llama
llm_load_print_meta: vocab type = SPM
llm_load_print_meta: n_vocab = 32000
llm_load_print_meta: n_merges = 0
llm_load_print_meta: n_ctx_train = 32768
llm_load_print_meta: n_embd = 4096
llm_load_print_meta: n_head = 32
llm_load_print_meta: n_head_kv = 8
llm_load_print_meta: n_layer = 32
llm_load_print_meta: n_rot = 128
llm_load_print_meta: n_embd_head_k = 128
llm_load_print_meta: n_embd_head_v = 128
llm_load_print_meta: n_gqa = 4
llm_load_print_meta: n_embd_k_gqa = 1024
llm_load_print_meta: n_embd_v_gqa = 1024
llm_load_print_meta: f_norm_eps = 0.0e+00
llm_load_print_meta: f_norm_rms_eps = 1.0e-05
llm_load_print_meta: f_clamp_kqv = 0.0e+00
llm_load_print_meta: f_max_alibi_bias = 0.0e+00
llm_load_print_meta: f_logit_scale = 0.0e+00
llm_load_print_meta: n_ff = 14336
llm_load_print_meta: n_expert = 0
llm_load_print_meta: n_expert_used = 0
llm_load_print_meta: causal attn = 1
llm_load_print_meta: pooling type = 0
llm_load_print_meta: rope type = 0
llm_load_print_meta: rope scaling = linear
llm_load_print_meta: freq_base_train = 10000.0
llm_load_print_meta: freq_scale_train = 1
llm_load_print_meta: n_yarn_orig_ctx = 32768
llm_load_print_meta: rope_finetuned = unknown
llm_load_print_meta: ssm_d_conv = 0
llm_load_print_meta: ssm_d_inner = 0
llm_load_print_meta: ssm_d_state = 0
llm_load_print_meta: ssm_dt_rank = 0
llm_load_print_meta: model type = 7B
llm_load_print_meta: model ftype = Q4_K - Medium
llm_load_print_meta: model params = 7.24 B
llm_load_print_meta: model size = 4.07 GiB (4.83 BPW)
llm_load_print_meta: general.name = mistralai_mistral-7b-instruct-v0.1
llm_load_print_meta: BOS token = 1 ''
llm_load_print_meta: EOS token = 2 '
'
llm_load_print_meta: UNK token = 0 ''
llm_load_print_meta: LF token = 13 '<0x0A>'
ggml_cuda_init: GGML_CUDA_FORCE_MMQ: no
ggml_cuda_init: CUDA_USE_TENSOR_CORES: yes

Tag summary

Content type

Image

Digest

sha256:18b675a39…

Size

24.5 GB

Last updated

over 1 year ago

docker pull maadsdocker/tml-privategpt-with-gpu-nvidia-amd64