Модели
Модели запускаются через шаблоны: LLM — через vLLM или SGLang, эмбеддинги и реранкеры — через Embeddings, изображения и видео — через ComfyUI. Всё остальное (библиотека Ollama, свои веса с Hugging Face) можно запустить самостоятельно в других шаблонах.
Как файлы модели попадают на сервер
Заголовок раздела «Как файлы модели попадают на сервер»- Веса модели скачивает машина хоста, они монтируются только для чтения в
/models/<id-модели>и не занимают ваш диск. - Кэш по требованию. Первый запуск модели на платформе скачивает её с Hugging Face, а мы параллельно копируем её в своё хранилище. Все следующие запуски — у любых пользователей — скачивают её из нашего кэша, это намного быстрее. Хосты тоже хранят модели на своих дисках, поэтому повторный запуск на той же машине почти мгновенный. В каталоге такие модели отмечены ⚡.
- Модели, которые никто не запускал 30 дней, удаляются из кэша и при следующем запуске скачиваются заново.
- Закрытые (gated) модели (Llama, Gemma) не кэшируются: добавьте свой токен Hugging Face в переменную
HF_TOKEN(аккаунт токена должен принять лицензию модели). Сервер модели скачает веса сам. - ComfyUI настраивается автоматически (
extra_model_paths): файлы выбранной модели появляются в загрузчиках checkpoint / diffusion model / text encoder / VAE / LoRA.
| Уровень | Всего VRAM | Типичные GPU |
|---|---|---|
| light | до 12 ГБ | RTX 3060, 3080 Ti, 4060 Ti, любая карта мощнее |
| standard | до 24 ГБ | RTX 3090, 4090, A5000, A10, L4 или 2×16 ГБ |
| pro | до 80 ГБ | A100, H100, RTX PRO 6000, 1–2×48 ГБ, 2–4×24 ГБ |
| cluster | больше 80 ГБ | несколько GPU по 80+ ГБ в одном сервере (H100, H200, B200) |
Требование — это суммарная видеопамять GPU одного сервера: модели на 40 ГБ хватит одной A100 40GB, одной карты на 48 ГБ или двух по 24 ГБ (vLLM разделит её тензорным параллелизмом). Кабинет предлагает только подходящие модели.
Текст и код (LLM)
Заголовок раздела «Текст и код (LLM)»Запускаются с vllm или sglang. Имя модели в запросах к API — её id на Hugging Face.
| id | Модель | Параметры | Мин. VRAM | Лицензия | Заметки |
|---|---|---|---|---|---|
qwen3-0.6b |
Qwen3 0.6B | 0.6B | 6 ГБ | Apache-2.0 | Классификация, маршрутизация, тесты |
qwen3-1.7b |
Qwen3 1.7B | 1.7B | 8 ГБ | Apache-2.0 | Простой чат и извлечение данных |
smollm3-3b |
SmolLM3 3B | 3B | 10 ГБ | Apache-2.0 | Длинный контекст, режим рассуждений |
qwen3-4b-instruct |
Qwen3 4B Instruct 2507 | 4B | 12 ГБ | Apache-2.0 | Лучшее качество на ГБ для недорогих GPU |
phi-4-mini |
Phi-4 mini | 3.8B | 12 ГБ | MIT | Математика и логика |
llama-3.2-3b |
Llama 3.2 3B | 3B | 12 ГБ | Llama 3.2 | Закрытая, нужен HF_TOKEN |
gemma-3-4b |
Gemma 3 4B | 4B | 12 ГБ | Gemma | Зрение; закрытая |
qwen3-8b |
Qwen3 8B | 8B | 24 ГБ | Apache-2.0 | Универсальная, режим рассуждений, 100+ языков |
gpt-oss-20b |
gpt-oss 20B | 21B MoE | 24 ГБ | Apache-2.0 | Открытые веса OpenAI, рассуждения, инструменты |
qwen2.5-7b-instruct |
Qwen2.5 7B Instruct | 7B | 24 ГБ | Apache-2.0 | Ассистенты и RAG |
qwen2.5-coder-7b |
Qwen2.5 Coder 7B | 7B | 24 ГБ | Apache-2.0 | Автодополнение кода |
qwen2.5-vl-7b |
Qwen2.5 VL 7B | 7B | 24 ГБ | Apache-2.0 | Изображения, документы, OCR |
deepseek-r1-qwen-7b |
DeepSeek-R1 Distill Qwen 7B | 7B | 24 ГБ | MIT | Пошаговые рассуждения |
deepseek-r1-llama-8b |
DeepSeek-R1 Distill Llama 8B | 8B | 24 ГБ | MIT | Рассуждения |
mistral-7b-instruct |
Mistral 7B Instruct v0.3 | 7B | 24 ГБ | Apache-2.0 | Вызов функций |
llama-3.1-8b |
Llama 3.1 8B | 8B | 24 ГБ | Llama 3.1 | Закрытая |
qwen3-14b |
Qwen3 14B | 14B | 40 ГБ | Apache-2.0 | Умнее 8B |
phi-4 |
Phi-4 14B | 14B | 40 ГБ | MIT | Математика, код, структурные ответы |
deepseek-r1-qwen-14b |
DeepSeek-R1 Distill Qwen 14B | 14B | 40 ГБ | MIT | Более глубокие рассуждения |
mistral-nemo-12b |
Mistral NeMo 12B | 12B | 40 ГБ | Apache-2.0 | Контекст 128k, многоязычная |
gemma-3-12b |
Gemma 3 12B | 12B | 40 ГБ | Gemma | Зрение; закрытая |
qwen3-32b |
Qwen3 32B | 32B | 80 ГБ | Apache-2.0 | Флагманская плотная Qwen3 |
qwen3-30b-a3b-instruct |
Qwen3 30B-A3B Instruct 2507 | 30B MoE | 80 ГБ | Apache-2.0 | Качество большой модели, высокая скорость |
qwen3-coder-30b |
Qwen3 Coder 30B-A3B | 30B MoE | 80 ГБ | Apache-2.0 | Агентное программирование (Cline, Roo, Continue) |
qwen2.5-coder-32b |
Qwen2.5 Coder 32B | 32B | 80 ГБ | Apache-2.0 | Лучшая плотная модель для кода |
qwen2.5-vl-32b |
Qwen2.5 VL 32B | 32B | 80 ГБ | Apache-2.0 | Документы и графики |
deepseek-r1-qwen-32b |
DeepSeek-R1 Distill Qwen 32B | 32B | 80 ГБ | MIT | Самая сильная дистилляция R1 |
mistral-small-24b |
Mistral Small 3.2 24B | 24B | 80 ГБ | Apache-2.0 | Зрение и вызов функций |
gpt-oss-120b |
gpt-oss 120B | 117B MoE | 80 ГБ | Apache-2.0 | Крупнейшая открытая модель OpenAI на одной GPU 80 ГБ |
gemma-3-27b |
Gemma 3 27B | 27B | 80 ГБ | Gemma | Зрение; закрытая |
llama-3.3-70b |
Llama 3.3 70B | 70B | 160 ГБ | Llama 3.3 | 2×80 ГБ; закрытая |
glm-4.5-air |
GLM-4.5 Air | 106B MoE | 320 ГБ | MIT | Агенты и код; 4×80 ГБ |
qwen3-235b-fp8 |
Qwen3 235B-A22B FP8 | 235B MoE | 320 ГБ | Apache-2.0 | Передовой уровень; 4×80 ГБ Hopper |
qwen3-coder-480b-fp8 |
Qwen3 Coder 480B FP8 | 480B MoE | 640 ГБ | Apache-2.0 | Лучший открытый агентный кодер; 8×80 ГБ Hopper |
deepseek-r1-0528 |
DeepSeek-R1 0528 | 671B MoE | 1000 ГБ | MIT | Полная R1; 8×H200 |
deepseek-v3.1 |
DeepSeek-V3.1 | 671B MoE | 1000 ГБ | MIT | Гибридное мышление; 8×H200 |
FP8-моделям для полной скорости нужны GPU Hopper (H100/H200) или новее.
Эмбеддинги и реранкеры
Заголовок раздела «Эмбеддинги и реранкеры»Запускаются с шаблоном embeddings: /v1/embeddings для эмбеддингов, /v1/rerank для реранкеров.
| id | Модель | Параметры | Мин. VRAM | Лицензия |
|---|---|---|---|---|
qwen3-embedding-0.6b |
Qwen3 Embedding 0.6B | 0.6B | 6 ГБ | Apache-2.0 |
qwen3-embedding-8b |
Qwen3 Embedding 8B | 8B | 24 ГБ | Apache-2.0 |
bge-m3 |
BGE-M3 | 568M | 6 ГБ | MIT |
multilingual-e5-large |
Multilingual E5 Large | 560M | 6 ГБ | MIT |
bge-reranker-v2-m3 |
BGE Reranker v2 M3 | 568M | 6 ГБ | Apache-2.0 |
Изображения
Заголовок раздела «Изображения»Use with the comfyui template.
| id | Модель | Параметры | Мин. VRAM | Лицензия | Заметки |
|---|---|---|---|---|---|
sdxl-base |
Stable Diffusion XL 1.0 | 3.5B | 8 ГБ | OpenRAIL++ | Огромная экосистема LoRA |
juggernaut-xl-v9 |
Juggernaut XL v9 | 3.5B | 8 ГБ | CreativeML OpenRAIL-M | Фотореализм, портреты |
lumina-2 |
Lumina Image 2.0 | 2.6B | 12 ГБ | Apache-2.0 | Точное следование промпту |
flux1-schnell |
FLUX.1 schnell (FP8) | 12B | 16 ГБ | Apache-2.0 | Топ-качество за 4 шага, коммерческое использование |
hidream-i1-fast |
HiDream-I1 Fast (FP8) | 17B | 24 ГБ | MIT | Передовая открытая модель изображений |
qwen-image |
Qwen-Image (FP8) | 20B | 40 ГБ | Apache-2.0 | Лучший рендер текста (постеры, интерфейсы) |
Use with the comfyui template.
| id | Модель | Параметры | Мин. VRAM | Лицензия | Заметки |
|---|---|---|---|---|---|
wan2.1-t2v-1.3b |
Wan 2.1 Text-to-Video 1.3B | 1.3B | 12 ГБ | Apache-2.0 | Видео даже на картах 12 ГБ (480p) |
wan2.2-ti2v-5b |
Wan 2.2 TI2V 5B | 5B | 24 ГБ | Apache-2.0 | Видео 720p из текста/изображения на одной GPU 24 ГБ |
mochi-preview |
Mochi 1 Preview (FP8) | 10B | 24 ГБ | Apache-2.0 | Плавное движение |
wan2.2-t2v-14b |
Wan 2.2 Text-to-Video 14B (FP8) | 14B MoE | 40 ГБ | Apache-2.0 | Кинематографичное 720p, LoRA на 4 шага в комплекте |
wan2.2-i2v-14b |
Wan 2.2 Image-to-Video 14B (FP8) | 14B MoE | 40 ГБ | Apache-2.0 | Оживление любого изображения |
Речевые модели встроены в аудио-шаблоны: speaches (faster-whisper + TTS), whisper (large-v3), kokoro (TTS). См. Шаблоны → Аудио.
Свои модели
Заголовок раздела «Свои модели»- Любая модель с Hugging Face через vLLM: арендуйте
pytorchилиcuda, затемpip install vllmиvllm serve <repo>; или используйте шаблонcustomс образом vLLM. - Библиотека Ollama (сотни GGUF-моделей): шаблоны
open-webuiилиollama. - LoRA и дополнительные чекпоинты для ComfyUI: ComfyUI-Manager или скачивание в
/workspace.