Sign inSign up

id69tver/vllm

By id69tver

Updated 4 months ago

0

341

id69tver/vllm repository overview

vLLM container ready for usage

Dockerfile

FROM nvidia/cuda:13.0.0-devel-ubuntu22.04

RUN apt-get update && apt-get install -y \
    python3.10 python3-pip wget git build-essential cmake ninja-build \
    && rm -rf /var/lib/apt/lists/*

RUN python3 -m pip install --upgrade pip

RUN python3 -m pip install --no-cache-dir \
    vllm==0.15.1 \
    bitsandbytes==0.49.2

RUN groupadd -r vllm && useradd -r -g vllm -s /sbin/nologin -m vllm
USER vllm

WORKDIR /home/vllm

ENV CUDA_HOME=/usr/local/cuda \
    PATH=/usr/local/cuda/bin:$PATH \
    LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH

EXPOSE 8000

HEALTHCHECK --interval=10s --timeout=5s --retries=20 \
  CMD wget --no-verbose --tries=1 http://localhost:8000/health || exit 1

ENTRYPOINT ["python3", "-m", "vllm.entrypoints.openai.api_server"]
CMD ["--host","0.0.0.0","--port","8000"]

docker compose example

services:
  vllm:
    image: id69tver/vllm:${vllm_version}
    restart: ${restart_policy}
    runtime: nvidia
    environment:
      - HF_HOME=/home/vllm
      - HF_TOKEN=${vllm_hf_token}
      - VLLM_API_KEY=${vllm_api_key}
    volumes:
      - vllm:/home/vllm
    ports:
      - "8000:8000"
    ipc: host
    command: >
      --model ${vllm_model}
      --max-model-len ${vllm_max_model_len}
      --enable-auto-tool-choice
      --exclude-tools-when-tool-choice-none
      --enable-offline-docs
      --host 0.0.0.0
      --port 8000
      ${vllm_served_model_name:+--served-model-name ${vllm_served_model_name}}
      ${vllm_cpu_offload_gb:+--cpu-offload-gb ${vllm_cpu_offload_gb}}
      ${vllm_swap_space:+--swap-space ${vllm_swap_space}}
      ${vllm_gpu_memory_utilization:+--gpu-memory-utilization ${vllm_gpu_memory_utilization}}
      ${vllm_tool_call_parser:+--tool-call-parser ${vllm_tool_call_parser}}
      ${vllm_quantization:+--quantization ${vllm_quantization}}
      ${vllm_kv_cache_dtype:+--kv-cache-dtype ${vllm_kv_cache_dtype}}
      ${vllm_dtype:+--dtype ${vllm_dtype}}
      ${vllm_max_num_seqs:+--max-num-seqs ${vllm_max_num_seqs}}
      ${vllm_generation_config:+--generation-config ${vllm_generation_config}}

volumes:
  vllm:

.env

restart_policy="unless-stopped"
vllm_version="0.15.1-cuda-13"
vllm_hf_token="change_me"
vllm_api_key="change_me"
vllm_model="Qwen/Qwen3-4b-AWQ"
vllm_max_model_len="8192"

swagger available at http://127.0.0.1:8000/docs

Tag Summary

No tags have been pushed to this repository yet.