GPU для AI-моделей
Каталог AI-инструментов: LLM, генерация изображений, обучение и инференс. Для каждого - требования к VRAM, рекомендуемые видеокарты и цены аренды GPU.
Llama 4, Llama 70B, Qwen 72B, DeepSeek-V3, Gemma 3, T-pro.
Смотреть →FLUX, Kontext, Qwen-Image, SD, ComfyUI.
Смотреть →Wan 2.5, HunyuanVideo — генерация видео на GPU.
Смотреть →CosyVoice, F5-TTS — озвучка и клон голоса.
Смотреть →Файнтюнинг LLM: Unsloth, LoRA/QLoRA без лишних затрат VRAM.
Смотреть →vLLM, SGLang, TGI, Triton, TEI, YOLO, Whisper.
Смотреть →LLM
VRAM и цена аренды GPU под LLM — от 6 ГБ до кластера 640+ ГБ.
Kimi K3
Open 2.8T MoE от Moonshot: vision + 1M контекст
DeepSeek-V3
DeepSeek-V3 / R1 671B MoE: зачем берут 8×H100
Llama 405B
Llama 3.1 405B: плотная frontier на 4–8 картах
Llama 4 Maverick
Llama 4 Maverick: MoE ~400B на 2–4×H100
Qwen 235B
Qwen3 235B-A22B: MoE на 2–4×H100
DeepSeek R1 70B
R1-Distill-Llama-70B: reasoning на одной карте 80 ГБ
Llama 4 Scout
Llama 4 Scout: MoE 109B, одна карта 80 ГБ
Llama 70B
Llama 3.3 70B: чат, код, RAG на одной H100
Qwen 72B
Qwen2.5 72B: открытая 72B, сильный русский и код
GLM-4
GLM-4 32B / Air: открытая модель Zhipu
T-pro
RU LLM 32B, T-Bank (t-tech)
Qwen-Coder
Qwen2.5 / Qwen3 Coder: код на своей карте
Gemma 3 27B
Gemma 3 27B: Google, как раз на 24 ГБ
ruGPT-3.5
RU 13B, SberDevices / AI Forever
DeepSeek R1
Открытая reasoning-модель класса o1
Qwen
Открытая семья LLM от Alibaba: от 0.5B до 671B
T-lite
RU LLM 7B, T-Bank (t-tech)
Vikhr-7B
Открытая русскоязычная LLM 7B от Vikhrmodels
llama.cpp
Квантизованный инференс LLM на CPU и GPU
Ollama
Локальный запуск LLM одной командой
Open WebUI
Веб-чат к Ollama и vLLM, как у ChatGPT
Изображения
Какой GPU нужен для SDXL, FLUX, Qwen-Image и ComfyUI - минимальные цены аренды.
FLUX Kontext
Редактирование картинок по тексту, не txt2img с нуля
FLUX.1
Передовая модель генерации изображений от Black Forest Labs
Qwen-Image
Генерация и редактирование картинок от Qwen
Stable Diffusion
Генерация изображений из текста и фото
ComfyUI
Нодовый редактор для AI-генерации изображений
Automatic1111
WebUI для Stable Diffusion: txt2img, img2img, LoRA
Видео
Видеокарты под генерацию и обработку видео: VRAM и цена аренды.
Голос
GPU под синтез речи и клон голоса: CosyVoice, F5-TTS.
Обучение
Файнтюнинг моделей на арендованном GPU: сколько VRAM и сколько стоит час.
Инференс
GPU под vLLM, SGLang, TGI, Triton, CV и ASR.
SGLang
LLM serving: RadixAttention, силён на DeepSeek и MoE
TGI
HF Text Generation Inference
vLLM
LLM serving: PagedAttention, OpenAI API
Triton
NVIDIA Triton Inference Server
TEI (bge-m3)
Эмбеддинги и RAG: векторизация документов для поиска
Whisper
Распознавание речи на 99 языках
YOLO
Детекция объектов в реальном времени