Перейти к содержимому

Модели

Модели запускаются через шаблоны: LLM — через vLLM или SGLang, эмбеддинги и реранкеры — через Embeddings, изображения и видео — через ComfyUI. Всё остальное (библиотека Ollama, свои веса с Hugging Face) можно запустить самостоятельно в других шаблонах.

  • Веса модели скачивает машина хоста, они монтируются только для чтения в /models/<id-модели> и не занимают ваш диск.
  • Кэш по требованию. Первый запуск модели на платформе скачивает её с Hugging Face, а мы параллельно копируем её в своё хранилище. Все следующие запуски — у любых пользователей — скачивают её из нашего кэша, это намного быстрее. Хосты тоже хранят модели на своих дисках, поэтому повторный запуск на той же машине почти мгновенный. В каталоге такие модели отмечены ⚡.
  • Модели, которые никто не запускал 30 дней, удаляются из кэша и при следующем запуске скачиваются заново.
  • Закрытые (gated) модели (Llama, Gemma) не кэшируются: добавьте свой токен Hugging Face в переменную HF_TOKEN (аккаунт токена должен принять лицензию модели). Сервер модели скачает веса сам.
  • ComfyUI настраивается автоматически (extra_model_paths): файлы выбранной модели появляются в загрузчиках checkpoint / diffusion model / text encoder / VAE / LoRA.
Уровень Всего VRAM Типичные GPU
light до 12 ГБ RTX 3060, 3080 Ti, 4060 Ti, любая карта мощнее
standard до 24 ГБ RTX 3090, 4090, A5000, A10, L4 или 2×16 ГБ
pro до 80 ГБ A100, H100, RTX PRO 6000, 1–2×48 ГБ, 2–4×24 ГБ
cluster больше 80 ГБ несколько GPU по 80+ ГБ в одном сервере (H100, H200, B200)

Требование — это суммарная видеопамять GPU одного сервера: модели на 40 ГБ хватит одной A100 40GB, одной карты на 48 ГБ или двух по 24 ГБ (vLLM разделит её тензорным параллелизмом). Кабинет предлагает только подходящие модели.

Запускаются с vllm или sglang. Имя модели в запросах к API — её id на Hugging Face.

id Модель Параметры Мин. VRAM Лицензия Заметки
qwen3-0.6b Qwen3 0.6B 0.6B 6 ГБ Apache-2.0 Классификация, маршрутизация, тесты
qwen3-1.7b Qwen3 1.7B 1.7B 8 ГБ Apache-2.0 Простой чат и извлечение данных
smollm3-3b SmolLM3 3B 3B 10 ГБ Apache-2.0 Длинный контекст, режим рассуждений
qwen3-4b-instruct Qwen3 4B Instruct 2507 4B 12 ГБ Apache-2.0 Лучшее качество на ГБ для недорогих GPU
phi-4-mini Phi-4 mini 3.8B 12 ГБ MIT Математика и логика
llama-3.2-3b Llama 3.2 3B 3B 12 ГБ Llama 3.2 Закрытая, нужен HF_TOKEN
gemma-3-4b Gemma 3 4B 4B 12 ГБ Gemma Зрение; закрытая
qwen3-8b Qwen3 8B 8B 24 ГБ Apache-2.0 Универсальная, режим рассуждений, 100+ языков
gpt-oss-20b gpt-oss 20B 21B MoE 24 ГБ Apache-2.0 Открытые веса OpenAI, рассуждения, инструменты
qwen2.5-7b-instruct Qwen2.5 7B Instruct 7B 24 ГБ Apache-2.0 Ассистенты и RAG
qwen2.5-coder-7b Qwen2.5 Coder 7B 7B 24 ГБ Apache-2.0 Автодополнение кода
qwen2.5-vl-7b Qwen2.5 VL 7B 7B 24 ГБ Apache-2.0 Изображения, документы, OCR
deepseek-r1-qwen-7b DeepSeek-R1 Distill Qwen 7B 7B 24 ГБ MIT Пошаговые рассуждения
deepseek-r1-llama-8b DeepSeek-R1 Distill Llama 8B 8B 24 ГБ MIT Рассуждения
mistral-7b-instruct Mistral 7B Instruct v0.3 7B 24 ГБ Apache-2.0 Вызов функций
llama-3.1-8b Llama 3.1 8B 8B 24 ГБ Llama 3.1 Закрытая
qwen3-14b Qwen3 14B 14B 40 ГБ Apache-2.0 Умнее 8B
phi-4 Phi-4 14B 14B 40 ГБ MIT Математика, код, структурные ответы
deepseek-r1-qwen-14b DeepSeek-R1 Distill Qwen 14B 14B 40 ГБ MIT Более глубокие рассуждения
mistral-nemo-12b Mistral NeMo 12B 12B 40 ГБ Apache-2.0 Контекст 128k, многоязычная
gemma-3-12b Gemma 3 12B 12B 40 ГБ Gemma Зрение; закрытая
qwen3-32b Qwen3 32B 32B 80 ГБ Apache-2.0 Флагманская плотная Qwen3
qwen3-30b-a3b-instruct Qwen3 30B-A3B Instruct 2507 30B MoE 80 ГБ Apache-2.0 Качество большой модели, высокая скорость
qwen3-coder-30b Qwen3 Coder 30B-A3B 30B MoE 80 ГБ Apache-2.0 Агентное программирование (Cline, Roo, Continue)
qwen2.5-coder-32b Qwen2.5 Coder 32B 32B 80 ГБ Apache-2.0 Лучшая плотная модель для кода
qwen2.5-vl-32b Qwen2.5 VL 32B 32B 80 ГБ Apache-2.0 Документы и графики
deepseek-r1-qwen-32b DeepSeek-R1 Distill Qwen 32B 32B 80 ГБ MIT Самая сильная дистилляция R1
mistral-small-24b Mistral Small 3.2 24B 24B 80 ГБ Apache-2.0 Зрение и вызов функций
gpt-oss-120b gpt-oss 120B 117B MoE 80 ГБ Apache-2.0 Крупнейшая открытая модель OpenAI на одной GPU 80 ГБ
gemma-3-27b Gemma 3 27B 27B 80 ГБ Gemma Зрение; закрытая
llama-3.3-70b Llama 3.3 70B 70B 160 ГБ Llama 3.3 2×80 ГБ; закрытая
glm-4.5-air GLM-4.5 Air 106B MoE 320 ГБ MIT Агенты и код; 4×80 ГБ
qwen3-235b-fp8 Qwen3 235B-A22B FP8 235B MoE 320 ГБ Apache-2.0 Передовой уровень; 4×80 ГБ Hopper
qwen3-coder-480b-fp8 Qwen3 Coder 480B FP8 480B MoE 640 ГБ Apache-2.0 Лучший открытый агентный кодер; 8×80 ГБ Hopper
deepseek-r1-0528 DeepSeek-R1 0528 671B MoE 1000 ГБ MIT Полная R1; 8×H200
deepseek-v3.1 DeepSeek-V3.1 671B MoE 1000 ГБ MIT Гибридное мышление; 8×H200

FP8-моделям для полной скорости нужны GPU Hopper (H100/H200) или новее.

Запускаются с шаблоном embeddings: /v1/embeddings для эмбеддингов, /v1/rerank для реранкеров.

id Модель Параметры Мин. VRAM Лицензия
qwen3-embedding-0.6b Qwen3 Embedding 0.6B 0.6B 6 ГБ Apache-2.0
qwen3-embedding-8b Qwen3 Embedding 8B 8B 24 ГБ Apache-2.0
bge-m3 BGE-M3 568M 6 ГБ MIT
multilingual-e5-large Multilingual E5 Large 560M 6 ГБ MIT
bge-reranker-v2-m3 BGE Reranker v2 M3 568M 6 ГБ Apache-2.0

Use with the comfyui template.

id Модель Параметры Мин. VRAM Лицензия Заметки
sdxl-base Stable Diffusion XL 1.0 3.5B 8 ГБ OpenRAIL++ Огромная экосистема LoRA
juggernaut-xl-v9 Juggernaut XL v9 3.5B 8 ГБ CreativeML OpenRAIL-M Фотореализм, портреты
lumina-2 Lumina Image 2.0 2.6B 12 ГБ Apache-2.0 Точное следование промпту
flux1-schnell FLUX.1 schnell (FP8) 12B 16 ГБ Apache-2.0 Топ-качество за 4 шага, коммерческое использование
hidream-i1-fast HiDream-I1 Fast (FP8) 17B 24 ГБ MIT Передовая открытая модель изображений
qwen-image Qwen-Image (FP8) 20B 40 ГБ Apache-2.0 Лучший рендер текста (постеры, интерфейсы)

Use with the comfyui template.

id Модель Параметры Мин. VRAM Лицензия Заметки
wan2.1-t2v-1.3b Wan 2.1 Text-to-Video 1.3B 1.3B 12 ГБ Apache-2.0 Видео даже на картах 12 ГБ (480p)
wan2.2-ti2v-5b Wan 2.2 TI2V 5B 5B 24 ГБ Apache-2.0 Видео 720p из текста/изображения на одной GPU 24 ГБ
mochi-preview Mochi 1 Preview (FP8) 10B 24 ГБ Apache-2.0 Плавное движение
wan2.2-t2v-14b Wan 2.2 Text-to-Video 14B (FP8) 14B MoE 40 ГБ Apache-2.0 Кинематографичное 720p, LoRA на 4 шага в комплекте
wan2.2-i2v-14b Wan 2.2 Image-to-Video 14B (FP8) 14B MoE 40 ГБ Apache-2.0 Оживление любого изображения

Речевые модели встроены в аудио-шаблоны: speaches (faster-whisper + TTS), whisper (large-v3), kokoro (TTS). См. Шаблоны → Аудио.

  • Любая модель с Hugging Face через vLLM: арендуйте pytorch или cuda, затем pip install vllm и vllm serve <repo>; или используйте шаблон custom с образом vLLM.
  • Библиотека Ollama (сотни GGUF-моделей): шаблоны open-webui или ollama.
  • LoRA и дополнительные чекпоинты для ComfyUI: ComfyUI-Manager или скачивание в /workspace.