name: llm-deploy description: "在 GPU 伺服器上部署 LLM 模型服務(vLLM)。支援多伺服器配置,自動檢查 GPU 和端口占用,一鍵部署流行的開源大語言模型。" homepage: https://github.com/vllm-project/vllm metadata: { "openclaw": { "emoji": "🚀", "requires": { "bins": ["ssh"] } } }
在 GPU 伺服器上快速部署 vLLM 模型服務。
建立 ~/.config/llm-deploy/servers.json:
{
"servers": {
"gpu1": {
"host": "gpu1",
"user": "lnsoft",
"gpu_count": 4,
"model_path": "/data/models/llm"
},
"my-gpu": {
"host": "192.168.1.100",
"user": "ubuntu",
"gpu_count": 2,
"model_path": "/home/ubuntu/models"
}
},
"default_server": "gpu1"
}
# 使用預設伺服器
llm-deploy check
# 指定伺服器
llm-deploy check --server gpu1
# 部署預設模型
llm-deploy deploy deepseek-r1-32b
# 指定埠
llm-deploy deploy deepseek-r1-32b --port 8112
check - 檢查伺服器狀態檢查 GPU 視訊記憶體和端口占用情況。
llm-deploy check [--server NAME] [--port PORT]
輸出示例:
✅ GPU 狀態正常
- 4 × Tesla T4 (15GB)
- 視訊記憶體佔用: 12.6GB/卡
- 溫度: 51-55°C
✅ 埠 8111 可用
deploy - 部署模型啟動 vLLM 模型服務。
llm-deploy deploy <MODEL_NAME> [--server NAME] [--port PORT]
支援的模型:
- deepseek-r1-32b - DeepSeek-R1-Distill-Qwen-32B-AWQ
- llama-3-8b - Llama 3 8B
- qwen-7b - Qwen 7B
- mistral-7b - Mistral 7B
list - 列出可用模型llm-deploy list
ps - 檢視執行中的服務llm-deploy ps [--server NAME]
stop - 停止服務llm-deploy stop [--server NAME] [--port PORT]
如果不想用封裝指令碼,也可以直接用原始命令:
ssh <user>@<host> nvidia-smi
ssh <user>@<host> "lsof -i :<port> 2>/dev/null || echo '埠可用'"
ssh <user>@<host> "tmux new-session -d -s vllm '
source /data/miniconda3/etc/profile.d/conda.sh && \
conda activate vllm && \
cd /data/models/llm && \
vllm serve /data/models/llm/deepseek/DeepSeek-R1-Distill-Qwen-32B-AWQ/ \
--tensor-parallel-size 4 \
--max-model-len 102400 \
--dtype half \
--port 8111 \
--served-model-name gpt-4o-mini
'"
在 ~/.config/llm-deploy/models.json 中新增:
小蔥技能站7w4.net發現了升級外掛。
{
"my-model": {
"name": "My Awesome Model",
"path": "/path/to/model",
"tensor_parallel_size": 2,
"max_model_len": 8192,
"dtype": "half",
"port": 8111,
"served_model_name": "my-model"
}
}
check 確認資源可用由 OpenClaw 社群貢獻 🦞
這個 Skill 的文件質量不錯,功能規劃全面,基本涵蓋了部署管理的各個環節。不過需要注意的是,壓縮包裡只有說明文件,沒有實際可用的指令碼程式,直接安裝是沒法使用的。建議等作者補充完整的程式檔案後再下載,否則需要自己動手寫指令碼才能用。功能設計上倒是挺貼心的,支援多伺服器切換和一鍵部署,省去了不少手動操作的麻煩。