vLLM 是高吞吐量、低延迟的大语言模型推理与服务引擎,支持 PagedAttention、连续批处理、OpenAI 兼容 API 等特性。
docker build -t oc9-vllm:0.18.1 .
# 验证版本
docker run --rm oc9-vllm:0.18.1 \
python3 -c "import importlib.metadata; print(importlib.metadata.version('vllm'))"
# 运行基础测试(在版本目录下执行)
bash test.sh oc9-vllm:0.18.1
# 启动 OpenAI 兼容推理服务(需要 GPU + 模型)
docker run --rm --gpus all -p 8000:8000 oc9-vllm:0.18.1 \
python3 -m vllm.entrypoints.openai.api_server \
--model <model_path_or_hf_id> \
--port 8000
Content type
Image
Digest
sha256:ab6558ff7…
Size
12.7 GB
Last updated
4 months ago
docker pull ocpub/oc9-vllm:0.18.1