Несколько GPU
В сервере может быть от 1 до 8 GPU, всегда на одной машине. Они соединены PCIe или NVLink этой машины, и этого достаточно, чтобы работать как один большой ускоритель. GPU разных машин не объединяются: через интернет это было бы слишком медленно.
Большие модели: тензорный параллелизм
Заголовок раздела «Большие модели: тензорный параллелизм»Шаблоны vllm и sglang запускают модель с --tensor-parallel-size (--tp в SGLang), равным количеству арендованных GPU. Каждый слой модели делится на все GPU, поэтому:
- память складывается: модель на 80 ГБ работает на 2×48 ГБ или 4×24 ГБ;
- растёт пропускная способность: больше памяти под KV-кэш — больше параллельных запросов и длиннее контекст.
| Размер модели | 1 GPU | Объединение |
|---|---|---|
| до 24 ГБ (Qwen3 8B, gpt-oss 20B) | RTX 3090 / 4090, A5000, L4 | 2×16 ГБ |
| до 40 ГБ (Qwen3 14B, Phi-4) | A100 40GB, любая карта 48 ГБ | 2×24 ГБ |
| до 80 ГБ (Qwen3 32B, gpt-oss 120B) | A100 80GB, H100, RTX PRO 6000 | 2×48 ГБ, 4×24 ГБ |
| 160 ГБ (Llama 3.3 70B) | B200 | 2×80 ГБ, 2×H200 |
| 320 ГБ (Qwen3 235B FP8, GLM-4.5 Air) | — | 4×80 ГБ, 4×H200, 2×B200 |
| 640 ГБ (Qwen3 Coder 480B FP8) | — | 8×80 ГБ, 8×H200, 4×B200 |
| 1000 ГБ (DeepSeek-R1 / V3.1) | — | 8×H200, 8×B200 |
vLLM лучше всего работает, когда число GPU делит число голов внимания модели, — берите 1, 2, 4 или 8 GPU.
Много маленьких вместо одного большого
Заголовок раздела «Много маленьких вместо одного большого»При большой нагрузке на небольшую модель часто дешевле запустить несколько серверов по 1 GPU и распределять запросы между ними, чем один сервер с многими GPU. Серверов можно запускать сколько угодно параллельно — в кабинете или через API.
Обучение на нескольких GPU
Заголовок раздела «Обучение на нескольких GPU»Шаблоны с пометкой distributed (pytorch, jupyter, cuda, custom, llamafactory, axolotl, unsloth, tensorflow) видят все арендованные GPU. Используйте привычные инструменты:
# PyTorch DDP / FSDP на всех GPU сервераtorchrun --nproc_per_node=$(nvidia-smi -L | wc -l) train.py
# Axolotlaccelerate launch -m axolotl.cli.train config.yml
# DeepSpeeddeepspeed --num_gpus=4 train.py --deepspeed ds_config.jsonLLaMA-Factory использует все GPU автоматически при запуске обучения из интерфейса.
Приложения на одной GPU
Заголовок раздела «Приложения на одной GPU»ComfyUI, Ollama, Open WebUI, Text Generation WebUI и аудио-шаблоны используют одну GPU на процесс. С несколькими GPU можно запустить по процессу на карту (например, второй ComfyUI с --cuda-device 1 на другом порту), но в простых случаях достаточно одной GPU.