vLLM container ready for usage
Dockerfile
FROM nvidia/cuda:13.0.0-devel-ubuntu22.04
RUN apt-get update && apt-get install -y \
python3.10 python3-pip wget git build-essential cmake ninja-build \
&& rm -rf /var/lib/apt/lists/*
RUN python3 -m pip install --upgrade pip
RUN python3 -m pip install --no-cache-dir \
vllm==0.15.1 \
bitsandbytes==0.49.2
RUN groupadd -r vllm && useradd -r -g vllm -s /sbin/nologin -m vllm
USER vllm
WORKDIR /home/vllm
ENV CUDA_HOME=/usr/local/cuda \
PATH=/usr/local/cuda/bin:$PATH \
LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH
EXPOSE 8000
HEALTHCHECK --interval=10s --timeout=5s --retries=20 \
CMD wget --no-verbose --tries=1 http://localhost:8000/health || exit 1
ENTRYPOINT ["python3", "-m", "vllm.entrypoints.openai.api_server"]
CMD ["--host","0.0.0.0","--port","8000"]
docker compose example
services:
vllm:
image: id69tver/vllm:${vllm_version}
restart: ${restart_policy}
runtime: nvidia
environment:
- HF_HOME=/home/vllm
- HF_TOKEN=${vllm_hf_token}
- VLLM_API_KEY=${vllm_api_key}
volumes:
- vllm:/home/vllm
ports:
- "8000:8000"
ipc: host
command: >
--model ${vllm_model}
--max-model-len ${vllm_max_model_len}
--enable-auto-tool-choice
--exclude-tools-when-tool-choice-none
--enable-offline-docs
--host 0.0.0.0
--port 8000
${vllm_served_model_name:+--served-model-name ${vllm_served_model_name}}
${vllm_cpu_offload_gb:+--cpu-offload-gb ${vllm_cpu_offload_gb}}
${vllm_swap_space:+--swap-space ${vllm_swap_space}}
${vllm_gpu_memory_utilization:+--gpu-memory-utilization ${vllm_gpu_memory_utilization}}
${vllm_tool_call_parser:+--tool-call-parser ${vllm_tool_call_parser}}
${vllm_quantization:+--quantization ${vllm_quantization}}
${vllm_kv_cache_dtype:+--kv-cache-dtype ${vllm_kv_cache_dtype}}
${vllm_dtype:+--dtype ${vllm_dtype}}
${vllm_max_num_seqs:+--max-num-seqs ${vllm_max_num_seqs}}
${vllm_generation_config:+--generation-config ${vllm_generation_config}}
volumes:
vllm:
.env
restart_policy="unless-stopped"
vllm_version="0.15.1-cuda-13"
vllm_hf_token="change_me"
vllm_api_key="change_me"
vllm_model="Qwen/Qwen3-4b-AWQ"
vllm_max_model_len="8192"
swagger available at http://127.0.0.1:8000/docs
No tags have been pushed to this repository yet.