Перейти к содержимому

Несколько GPU

В сервере может быть от 1 до 8 GPU, всегда на одной машине. Они соединены PCIe или NVLink этой машины, и этого достаточно, чтобы работать как один большой ускоритель. GPU разных машин не объединяются: через интернет это было бы слишком медленно.

Шаблоны vllm и sglang запускают модель с --tensor-parallel-size (--tp в SGLang), равным количеству арендованных GPU. Каждый слой модели делится на все GPU, поэтому:

  • память складывается: модель на 80 ГБ работает на 2×48 ГБ или 4×24 ГБ;
  • растёт пропускная способность: больше памяти под KV-кэш — больше параллельных запросов и длиннее контекст.
Размер модели 1 GPU Объединение
до 24 ГБ (Qwen3 8B, gpt-oss 20B) RTX 3090 / 4090, A5000, L4 2×16 ГБ
до 40 ГБ (Qwen3 14B, Phi-4) A100 40GB, любая карта 48 ГБ 2×24 ГБ
до 80 ГБ (Qwen3 32B, gpt-oss 120B) A100 80GB, H100, RTX PRO 6000 2×48 ГБ, 4×24 ГБ
160 ГБ (Llama 3.3 70B) B200 2×80 ГБ, 2×H200
320 ГБ (Qwen3 235B FP8, GLM-4.5 Air) — 4×80 ГБ, 4×H200, 2×B200
640 ГБ (Qwen3 Coder 480B FP8) — 8×80 ГБ, 8×H200, 4×B200
1000 ГБ (DeepSeek-R1 / V3.1) — 8×H200, 8×B200

vLLM лучше всего работает, когда число GPU делит число голов внимания модели, — берите 1, 2, 4 или 8 GPU.

При большой нагрузке на небольшую модель часто дешевле запустить несколько серверов по 1 GPU и распределять запросы между ними, чем один сервер с многими GPU. Серверов можно запускать сколько угодно параллельно — в кабинете или через API.

Шаблоны с пометкой distributed (pytorch, jupyter, cuda, custom, llamafactory, axolotl, unsloth, tensorflow) видят все арендованные GPU. Используйте привычные инструменты:

Окно терминала
# PyTorch DDP / FSDP на всех GPU сервера
torchrun --nproc_per_node=$(nvidia-smi -L | wc -l) train.py
# Axolotl
accelerate launch -m axolotl.cli.train config.yml
# DeepSpeed
deepspeed --num_gpus=4 train.py --deepspeed ds_config.json

LLaMA-Factory использует все GPU автоматически при запуске обучения из интерфейса.

ComfyUI, Ollama, Open WebUI, Text Generation WebUI и аудио-шаблоны используют одну GPU на процесс. С несколькими GPU можно запустить по процессу на карту (например, второй ComfyUI с --cuda-device 1 на другом порту), но в простых случаях достаточно одной GPU.