A vLLM extension for GPU + NUMA dual parallel inference
224
Lvllm is a vLLM extension for GPU + NUMA dual parallel inference, optimized for large MoE (Mixture-of-Experts) models on multi-socket CPU/GPU systems.
docker run --gpus all --privileged \
-v /path/to/model:/models \
-p 8000:8000 \
lovedheart/lvllm:latest \
--model /models \
--host 0.0.0.0 \
--port 8000 \
--tensor-parallel-size 1 \
--trust-remote-code
| Variable | Default | Description |
|---|---|---|
| LVLLM_MOE_NUMA_ENABLED | 1 | Enable GPU+NUMA hybrid inference |
| LK_THREAD_BINDING | CPU_CORE | Thread binding policy (CPU_CORE or NUMA_NODE) |
| LK_THREADS | auto | Number of worker threads for CPU experts |
| OMP_NUM_THREADS | auto | OpenMP threads |
| LVLLM_GPU_RESIDENT_MOE_LAYERS | unset | GPU-resident expert layer indices (e.g. 0-5) |
| LVLLM_GPU_PREFETCH_WINDOW | unset | Expert prefetch window size |
| LVLLM_GPU_PREFILL_MIN_BATCH_SIZE | unset | Min batch size for GPU prefill |
| LK_POWER_SAVING | 0 | Enable CPU idle core throttling |
| LVLLM_ENABLE_NUMA_INTERLEAVE | 1 | Interleave memory across NUMA nodes |
| LVLLM_ENABLE_MOE_LAYERWISE_LOAD | 1 | Load MoE experts layer-by-layer |
docker run --gpus all --privileged \
-v /path/to/model:/models \
-p 8000:8000 \
-e LK_THREADS=8 \
-e OMP_NUM_THREADS=8 \
lovedheart/lvllm:latest \
--model /models \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.3 \
--trust-remote-code \
--enable-prefix-caching
docker run --gpus all --privileged \
-v /path/to/model:/models \
-p 8000:8000 \
-e LVLLM_GPU_RESIDENT_MOE_LAYERS=0-5 \
-e LVLLM_GPU_PREFETCH_WINDOW=1 \
-e LVLLM_GPU_PREFILL_MIN_BATCH_SIZE=4096 \
lovedheart/lvllm:latest \
--model /models \
--tensor-parallel-size 2 \
--compilation_config.cudagraph_mode FULL_DECODE_ONLY \
--compilation_config.mode VLLM_COMPILE
Content type
Image
Digest
sha256:62344501e…
Size
8 GB
Last updated
3 months ago
docker pull lovedheart/lvllm