Runs Large Language Models on Local Machine by VLLM (Ubuntu amd64)
448
########################################################
# sudo docker build -t ddhmed/vllm:20240603 .
# sudo ufw allow 5000
# sudo docker run --rm -v $PWD/models:/models -p 5000:5000 ddhmed/vllm:20240603
# sudo docker run --gpus all --rm -v $PWD/models:/models -p 5000:5000 ddhmed/vllm:20240603
# sudo docker run -it --gpus all --rm -v $PWD/models:/models -p 5000:5000 ddhmed/vllm:20240603 /bin/bash
########################################################
# 使用NVIDIA提供的CUDA基础镜像
FROM nvidia/cuda:11.8.0-cudnn8-runtime-ubuntu20.04
### 作者和邮箱
MAINTAINER ddhmed [email protected]
USER root
# 设置时区,避免交互式提示
ENV TZ=Asia/Shanghai
RUN ln -snf /usr/share/zoneinfo/$TZ /etc/localtime && echo $TZ > /etc/timezone
# 安装基本工具和Python
RUN apt-get update && apt-get install -y \
python3 \
python3-pip \
&& rm -rf /var/lib/apt/lists/*
# 创建一个符号链接,使 python3 命令可以用 python 调用
RUN ln -s /usr/bin/python3 /usr/bin/python
# 升级pip
RUN pip3 install --upgrade pip
# install base packages
RUN pip install --no-cache-dir \
vllm \
transformers -i https://pypi.tuna.tsinghua.edu.cn/simple
RUN pip install gradio -i https://pypi.tuna.tsinghua.edu.cn/simple
# 清理不必要的文件
RUN apt-get clean && \
rm -rf /var/lib/apt/lists/* /tmp/* /var/tmp/*
### 设置工作目录
WORKDIR /models
# 暴露端口
EXPOSE 8000 7860
# 启动 vllm 模型服务和 Gradio 应用
CMD ["sh", "-c", "CUDA_VISIBLE_DEVICES=0 python -m vllm.entrypoints.openai.api_server --model './model' --served-model-name 'openchat' --port 8000 & python app.py"]
Content type
Image
Digest
sha256:500fa14c0…
Size
5.5 GB
Last updated
6 months ago
docker pull ddhmed/vllm:20240603