Калькулятор GPU H100, H200, B300 для self-host LLM и инференса
Подберите конфигурацию под open-weight модель (квант INT4 / FP8 / BF16 / INT8) и сравните аренду NVIDIA H100, H200, A100, L4 и выделенного B300 у Яндекс.Облако (Yandex Cloud), VK Cloud, Selectel, Cloud.ru, MWS Cloud, T1 Cloud. Калькулятор оценивает VRAM и число карт, показывает Best offer по публичным тарифам — рядом ориентир Hosted API ₽/1M токенов, где модель есть в каталоге.
Ключевые сценарии
- Сколько GPU нужно для модели — ориентир по параметрам и кванту (например Qwen3-Coder-Next 80B/3B active → 1×H100 INT4).
- Аренда H100 / H200 / B300 под инференс — сравнение Selectel, Cloud.ru, T1, MWS, VK, Yandex по публичным SKU.
- Self-host vs API — фиксированная цена GPU-узла против ₽/1M input/output у hosted API того же семейства моделей.
- Для сырого сравнения flavor без модели (включая B300 dedicated) откройте калькулятор ВМ и GPU.
Карты в расчёте self-host
- NVIDIA B300 — Выделенный 8×B300 288GB (Selectel) — калькулятор показывает bundle dedicated-узла, не облачную GPU-ВМ.
- NVIDIA H100 80GB — 1× и 8× H100 PCIe/NVLink: сравнение Cloud.ru flavor и сборки GPU + host у Selectel / T1 / других.
- NVIDIA H200 141GB — 1× и 8× H200 под крупные MoE и длинный контекст — Best offer по публичным тарифам РФ.
- NVIDIA A100 80GB — Классика датацентрового инференса и обучения; flavor и unit-цены в одном сравнении.
- NVIDIA L4 24GB — Экономичный inference / embedding; часто дешевле H100 при подходящем размере модели.
- NVIDIA V100 32GB — Legacy-карта в каталоге — полезно для оценки миграции со старых кластеров.
Модели в базе self-host
GLM 5.2, GLM 4.6 357B, Qwen3 32B, Qwen3 8B, Qwen3.6 35B-A3B, Qwen3 235B, Qwen3-Coder-Next, Qwen3 Coder 480B, Kimi K2.6, Kimi K3, Qwen3.8, Qwen3.7 Max и ещё 22. Рецепты — инженерные оценки VRAM (weights + запас), не лабораторные бенчмарки.
Как считается конфигурация
- Выбираете модель и квант (Auto подставляет рекомендуемый).
- Сервис отдаёт минимум / рекомендуемую / запасные GPU-сборки с оценкой VRAM.
- Цена узла — quote GPU из каталога (bundle flavor или GPU + host). Месяц = 720 часов.
- API-only модели (без публичных весов) показывают только Hosted API.
Частые вопросы · Self-host LLM
- Как рассчитать GPU под инференс LLM (self-host)?
- Выберите open-weight модель и квант. Калькулятор оценит VRAM, предложит конфигурации (1×H100, 1×H200, multi-GPU) и сравнит цены аренды у облаков России по публичным тарифам.
- Сколько стоит аренда H100 или H200 для self-host в России?
- Зависит от flavor vs unit GPU + host. Для 1×H100 80GB и 1×H200 141GB смотрите актуальный Best offer на странице (Selectel / Cloud.ru / T1 и др.); месяц = 720 часов. 8× узлы считаются отдельными пресетами.
- Нужен ли B300 для self-host LLM?
- B300 — топовый dedicated-узел (Selectel). Для многих open-weight моделей достаточно 1×H100/H200; B300 имеет смысл для максимальной плотности и спец. нагрузок. Цену B300 удобнее смотреть на /calculator/vm во вкладке GPU.
- Чем INT4 отличается от FP8 и BF16 в калькуляторе?
- Квант уменьшает VRAM под веса: INT4 — максимум экономии карт (часто 1×H100 вместо multi-GPU), FP8 — частый баланс на H100/H200, BF16 — ближе к полному качеству и требует больше памяти.
- Какие модели поддерживаются для self-host расчёта?
- В базе: GLM 5.2, GLM 4.6 357B, Qwen3 32B, Qwen3 8B, Qwen3.6 35B-A3B, Qwen3 235B, Qwen3-Coder-Next, Qwen3 Coder 480B, Kimi K2.6, Kimi K3, Qwen3.8, Qwen3.7 Max, DeepSeek V3, DeepSeek R1, DeepSeek R1 Distill 32B, gpt-oss-120b, gpt-oss-20b, Gemma 3 27B, Llama 4 Scout, Llama 4 Maverick, Llama 3.3 70B, Mixtral 8x22B, Mistral Small 24B, Devstral Small 24B, Devstral 2 123B, Phi-4 14B, GigaAM-v3, GigaAM Multilingual, Whisper large-v3-turbo, GigaChat3.1-Audio-10B, T-Search, Qwen3-Embedding-8B, Qwen3-Reranker-0.6B, Qwen3-Reranker-4B. Часть моделей API-only — для них показывается только Hosted API.
- Self-host дешевле Hosted API?
- Только при высокой утилизации GPU. Калькулятор показывает фиксированную стоимость узла и ориентир ₽/1M токенов API — точку безубыточности считайте по своему tok/s и смеси input/output.