Шаблон — это Docker-образ с нужной командой, портами и настройками. Выберите его при аренде GPU или передайте его id в поле template в API.
- Мин. VRAM — сколько видеопамяти нужно шаблону всего (выбранной модели может понадобиться больше).
- Мин. CUDA — драйвер NVIDIA у хоста должен поддерживать как минимум эту версию CUDA; остальные машины пропускаются автоматически.
- Несколько GPU —
tensor-parallel: модель автоматически делится на все GPU; distributed: все GPU видны, используйте torchrun/DeepSpeed/FSDP; —: приложение использует одну GPU. См. Несколько GPU.
- Веб-интерфейсы открываются через проброс портов по SSH; к API можно обращаться и через прокси.
| id |
Название |
Образ |
Порты |
Мин. VRAM |
Мин. CUDA |
Несколько GPU |
pytorch |
PyTorch 2.8 |
pytorch/pytorch:2.8.0-cuda12.8-cudnn9-devel |
— |
8 GB |
12.8 |
distributed |
jupyter |
Jupyter Lab + PyTorch |
pytorch/pytorch:2.8.0-cuda12.8-cudnn9-devel |
8888 Jupyter Lab |
8 GB |
12.8 |
distributed |
tensorflow |
TensorFlow + Jupyter |
tensorflow/tensorflow:latest-gpu-jupyter |
8888 Jupyter |
8 GB |
12.3 |
distributed |
cuda |
Ubuntu 24.04 + CUDA 12.8 |
nvidia/cuda:12.8.1-cudnn-devel-ubuntu24.04 |
— |
8 GB |
12.8 |
distributed |
custom |
Свой Docker-образ |
ваш образ |
— |
8 GB |
— |
distributed |
- pytorch, cuda — контейнеры для работы по SSH в
/workspace.
- jupyter, tensorflow — Jupyter открывается в
/workspace; токен входа — GYSGA_TOKEN.
- custom — любой публичный образ; его собственные entrypoint и команда запускаются как есть.
| id |
Название |
Образ |
Порты |
Мин. VRAM |
Мин. CUDA |
Несколько GPU |
Модель |
vllm |
vLLM · OpenAI API |
vllm/vllm-openai:v0.30.0-cu129 |
8000 OpenAI API |
16 GB |
12.9 |
tensor-parallel |
обязательна (LLM) |
sglang |
SGLang · OpenAI API |
lmsysorg/sglang:latest |
30000 OpenAI API |
16 GB |
12.8 |
tensor-parallel |
обязательна (LLM) |
open-webui |
Open WebUI + Ollama |
ghcr.io/open-webui/open-webui:ollama |
8080 Open WebUI, 11434 Ollama API |
8 GB |
12.0 |
— |
скачивается в интерфейсе |
ollama |
Ollama API |
ollama/ollama:0.34.4 |
11434 Ollama API |
8 GB |
12.0 |
— |
ollama pull |
text-generation-webui |
Text Generation WebUI |
atinoda/text-generation-webui:default-nvidia |
7860 Web UI, 5000 API |
8 GB |
12.1 |
— |
скачивается в интерфейсе |
- vllm — высокопроизводительный OpenAI-совместимый сервер. Имя модели в запросах — её id на Hugging Face (например
Qwen/Qwen3-8B). Использует 92% видеопамяти под веса и KV-кэш.
- sglang — быстрый сервер с RadixAttention, OpenAI-совместимый, порт 30000.
- open-webui — интерфейс в стиле ChatGPT со встроенной Ollama; первый созданный в нём аккаунт становится администратором. Модели Ollama хранятся в
/workspace/ollama.
- ollama — сервер Ollama; модели в
/workspace/ollama. OpenAI-совместимый API — по пути /v1.
- text-generation-webui — интерфейс oobabooga для моделей GGUF, EXL2 и Transformers, API на порту 5000.
| id |
Название |
Образ |
Порты |
Мин. VRAM |
Мин. CUDA |
Модель |
comfyui |
ComfyUI |
yanwk/comfyui-boot:cu128-slim |
8188 ComfyUI |
12 GB |
12.8 |
по желанию (изображения / видео) |
Генерация изображений и видео на нодах (SDXL, FLUX, HiDream, Qwen-Image, Wan, Mochi). В комплекте ComfyUI-Manager для кастомных нод и дополнительных моделей. Если выбрать модель, её файлы монтируются в /models/<id-модели>, а ComfyUI настраивается автоматически — они сразу появляются в загрузчиках.
| id |
Название |
Образ |
Порты |
Мин. VRAM |
Мин. CUDA |
speaches |
Speech-to-text & TTS · OpenAI API |
ghcr.io/speaches-ai/speaches:latest-cuda |
8000 Audio API |
6 GB |
12.4 |
whisper |
Whisper large-v3 API |
onerahmet/openai-whisper-asr-webservice:latest-gpu |
9000 ASR API (Swagger по пути /docs) |
8 GB |
12.0 |
kokoro |
Kokoro TTS · OpenAI API |
ghcr.io/remsky/kokoro-fastapi-gpu:latest |
8880 TTS API (интерфейс по пути /web) |
4 GB |
12.4 |
- speaches — распознавание речи faster-whisper и синтез речи через OpenAI-совместимые
/v1/audio/transcriptions и /v1/audio/speech.
- whisper — распознавание речи faster-whisper large-v3.
- kokoro — быстрый естественный синтез речи (82M) через
/v1/audio/speech.
| id |
Название |
Образ |
Порты |
Мин. VRAM |
Мин. CUDA |
Несколько GPU |
llamafactory |
LLaMA-Factory |
hiyouga/llamafactory:latest |
7860 LLaMA Board |
16 GB |
12.1 |
distributed |
axolotl |
Axolotl |
axolotlai/axolotl:main-latest |
— |
16 GB |
12.4 |
distributed |
unsloth |
Unsloth |
unsloth/unsloth:latest |
— |
12 GB |
12.4 |
distributed |
- llamafactory — дообучение 100+ LLM через LoRA/QLoRA или полное обучение из веб-интерфейса. Кэш Hugging Face в
/workspace/hf.
- axolotl — дообучение по YAML-конфигу (LoRA, QLoRA, full, DPO). Подключитесь по SSH и выполните
axolotl train config.yml.
- unsloth — быстрое дообучение с экономией памяти; запускайте свои скрипты Unsloth по SSH.
| id |
Название |
Образ |
Порты |
Мин. VRAM |
Мин. CUDA |
Модель |
embeddings |
Embeddings · OpenAI API |
vllm/vllm-openai:v0.30.0-cu129 |
8000 OpenAI API |
8 GB |
12.9 |
обязательна (embed) |
Модели эмбеддингов через /v1/embeddings и реранкеры через /v1/rerank — для поиска и RAG.