Перейти к содержимому

Шаблоны

Шаблон — это Docker-образ с нужной командой, портами и настройками. Выберите его при аренде GPU или передайте его id в поле template в API.

  • Мин. VRAM — сколько видеопамяти нужно шаблону всего (выбранной модели может понадобиться больше).
  • Мин. CUDA — драйвер NVIDIA у хоста должен поддерживать как минимум эту версию CUDA; остальные машины пропускаются автоматически.
  • Несколько GPU — tensor-parallel: модель автоматически делится на все GPU; distributed: все GPU видны, используйте torchrun/DeepSpeed/FSDP; —: приложение использует одну GPU. См. Несколько GPU.
  • Веб-интерфейсы открываются через проброс портов по SSH; к API можно обращаться и через прокси.
id Название Образ Порты Мин. VRAM Мин. CUDA Несколько GPU
pytorch PyTorch 2.8 pytorch/pytorch:2.8.0-cuda12.8-cudnn9-devel — 8 GB 12.8 distributed
jupyter Jupyter Lab + PyTorch pytorch/pytorch:2.8.0-cuda12.8-cudnn9-devel 8888 Jupyter Lab 8 GB 12.8 distributed
tensorflow TensorFlow + Jupyter tensorflow/tensorflow:latest-gpu-jupyter 8888 Jupyter 8 GB 12.3 distributed
cuda Ubuntu 24.04 + CUDA 12.8 nvidia/cuda:12.8.1-cudnn-devel-ubuntu24.04 — 8 GB 12.8 distributed
custom Свой Docker-образ ваш образ — 8 GB — distributed
  • pytorch, cuda — контейнеры для работы по SSH в /workspace.
  • jupyter, tensorflow — Jupyter открывается в /workspace; токен входа — GYSGA_TOKEN.
  • custom — любой публичный образ; его собственные entrypoint и команда запускаются как есть.
id Название Образ Порты Мин. VRAM Мин. CUDA Несколько GPU Модель
vllm vLLM · OpenAI API vllm/vllm-openai:v0.30.0-cu129 8000 OpenAI API 16 GB 12.9 tensor-parallel обязательна (LLM)
sglang SGLang · OpenAI API lmsysorg/sglang:latest 30000 OpenAI API 16 GB 12.8 tensor-parallel обязательна (LLM)
open-webui Open WebUI + Ollama ghcr.io/open-webui/open-webui:ollama 8080 Open WebUI, 11434 Ollama API 8 GB 12.0 — скачивается в интерфейсе
ollama Ollama API ollama/ollama:0.34.4 11434 Ollama API 8 GB 12.0 — ollama pull
text-generation-webui Text Generation WebUI atinoda/text-generation-webui:default-nvidia 7860 Web UI, 5000 API 8 GB 12.1 — скачивается в интерфейсе
  • vllm — высокопроизводительный OpenAI-совместимый сервер. Имя модели в запросах — её id на Hugging Face (например Qwen/Qwen3-8B). Использует 92% видеопамяти под веса и KV-кэш.
  • sglang — быстрый сервер с RadixAttention, OpenAI-совместимый, порт 30000.
  • open-webui — интерфейс в стиле ChatGPT со встроенной Ollama; первый созданный в нём аккаунт становится администратором. Модели Ollama хранятся в /workspace/ollama.
  • ollama — сервер Ollama; модели в /workspace/ollama. OpenAI-совместимый API — по пути /v1.
  • text-generation-webui — интерфейс oobabooga для моделей GGUF, EXL2 и Transformers, API на порту 5000.
id Название Образ Порты Мин. VRAM Мин. CUDA Модель
comfyui ComfyUI yanwk/comfyui-boot:cu128-slim 8188 ComfyUI 12 GB 12.8 по желанию (изображения / видео)

Генерация изображений и видео на нодах (SDXL, FLUX, HiDream, Qwen-Image, Wan, Mochi). В комплекте ComfyUI-Manager для кастомных нод и дополнительных моделей. Если выбрать модель, её файлы монтируются в /models/<id-модели>, а ComfyUI настраивается автоматически — они сразу появляются в загрузчиках.

id Название Образ Порты Мин. VRAM Мин. CUDA
speaches Speech-to-text & TTS · OpenAI API ghcr.io/speaches-ai/speaches:latest-cuda 8000 Audio API 6 GB 12.4
whisper Whisper large-v3 API onerahmet/openai-whisper-asr-webservice:latest-gpu 9000 ASR API (Swagger по пути /docs) 8 GB 12.0
kokoro Kokoro TTS · OpenAI API ghcr.io/remsky/kokoro-fastapi-gpu:latest 8880 TTS API (интерфейс по пути /web) 4 GB 12.4
  • speaches — распознавание речи faster-whisper и синтез речи через OpenAI-совместимые /v1/audio/transcriptions и /v1/audio/speech.
  • whisper — распознавание речи faster-whisper large-v3.
  • kokoro — быстрый естественный синтез речи (82M) через /v1/audio/speech.
id Название Образ Порты Мин. VRAM Мин. CUDA Несколько GPU
llamafactory LLaMA-Factory hiyouga/llamafactory:latest 7860 LLaMA Board 16 GB 12.1 distributed
axolotl Axolotl axolotlai/axolotl:main-latest — 16 GB 12.4 distributed
unsloth Unsloth unsloth/unsloth:latest — 12 GB 12.4 distributed
  • llamafactory — дообучение 100+ LLM через LoRA/QLoRA или полное обучение из веб-интерфейса. Кэш Hugging Face в /workspace/hf.
  • axolotl — дообучение по YAML-конфигу (LoRA, QLoRA, full, DPO). Подключитесь по SSH и выполните axolotl train config.yml.
  • unsloth — быстрое дообучение с экономией памяти; запускайте свои скрипты Unsloth по SSH.
id Название Образ Порты Мин. VRAM Мин. CUDA Модель
embeddings Embeddings · OpenAI API vllm/vllm-openai:v0.30.0-cu129 8000 OpenAI API 8 GB 12.9 обязательна (embed)

Модели эмбеддингов через /v1/embeddings и реранкеры через /v1/rerank — для поиска и RAG.