Калькулятор облачных нагрузок

Подбор GPU-конфигурации для open-weight моделей в облаках РФ

Калькулятор GPU H100, H200, B300 для self-host LLM и инференса

Подберите конфигурацию под open-weight модель (квант INT4 / FP8 / BF16 / INT8) и сравните аренду NVIDIA H100, H200, A100, L4 и выделенного B300 у Яндекс.Облако (Yandex Cloud), VK Cloud, Selectel, Cloud.ru, MWS Cloud, T1 Cloud. Калькулятор оценивает VRAM и число карт, показывает Best offer по публичным тарифам — рядом ориентир Hosted API ₽/1M токенов, где модель есть в каталоге.

Ключевые сценарии

Карты в расчёте self-host

Модели в базе self-host

GLM 5.2, GLM 4.6 357B, Qwen3 32B, Qwen3 8B, Qwen3.6 35B-A3B, Qwen3 235B, Qwen3-Coder-Next, Qwen3 Coder 480B, Kimi K2.6, Kimi K3, Qwen3.8, Qwen3.7 Max и ещё 22. Рецепты — инженерные оценки VRAM (weights + запас), не лабораторные бенчмарки.

Как считается конфигурация

Частые вопросы · Self-host LLM

Как рассчитать GPU под инференс LLM (self-host)?
Выберите open-weight модель и квант. Калькулятор оценит VRAM, предложит конфигурации (1×H100, 1×H200, multi-GPU) и сравнит цены аренды у облаков России по публичным тарифам.
Сколько стоит аренда H100 или H200 для self-host в России?
Зависит от flavor vs unit GPU + host. Для 1×H100 80GB и 1×H200 141GB смотрите актуальный Best offer на странице (Selectel / Cloud.ru / T1 и др.); месяц = 720 часов. 8× узлы считаются отдельными пресетами.
Нужен ли B300 для self-host LLM?
B300 — топовый dedicated-узел (Selectel). Для многих open-weight моделей достаточно 1×H100/H200; B300 имеет смысл для максимальной плотности и спец. нагрузок. Цену B300 удобнее смотреть на /calculator/vm во вкладке GPU.
Чем INT4 отличается от FP8 и BF16 в калькуляторе?
Квант уменьшает VRAM под веса: INT4 — максимум экономии карт (часто 1×H100 вместо multi-GPU), FP8 — частый баланс на H100/H200, BF16 — ближе к полному качеству и требует больше памяти.
Какие модели поддерживаются для self-host расчёта?
В базе: GLM 5.2, GLM 4.6 357B, Qwen3 32B, Qwen3 8B, Qwen3.6 35B-A3B, Qwen3 235B, Qwen3-Coder-Next, Qwen3 Coder 480B, Kimi K2.6, Kimi K3, Qwen3.8, Qwen3.7 Max, DeepSeek V3, DeepSeek R1, DeepSeek R1 Distill 32B, gpt-oss-120b, gpt-oss-20b, Gemma 3 27B, Llama 4 Scout, Llama 4 Maverick, Llama 3.3 70B, Mixtral 8x22B, Mistral Small 24B, Devstral Small 24B, Devstral 2 123B, Phi-4 14B, GigaAM-v3, GigaAM Multilingual, Whisper large-v3-turbo, GigaChat3.1-Audio-10B, T-Search, Qwen3-Embedding-8B, Qwen3-Reranker-0.6B, Qwen3-Reranker-4B. Часть моделей API-only — для них показывается только Hosted API.
Self-host дешевле Hosted API?
Только при высокой утилизации GPU. Калькулятор показывает фиксированную стоимость узла и ориентир ₽/1M токенов API — точку безубыточности считайте по своему tok/s и смеси input/output.