Новые возможности облаков и FinOps · 66 материалов · 1–10 на странице MWS Cloud добавила в Object Storage новый класс Cold для данных, которые нужно хранить долго, но читать редко: бэкапов, архивов, сырых логов и датасетов после обучения моделей. Сравниваем два open/near-frontier претендента для coding agents: где Kimi K3 сильнее GLM 5.2, как читать бенчмарки с разными harness и где тут Claude Opus 4.8 с Fable 5. Инженерное сравнение стеков для distributed training и inference: gang scheduling, Kueue vs Volcano, JobSet/Trainer, Slinky и где в GPU-кластере теряется полезная работа карт. Вышла статья серии Cloud FinOps Focus: почему с биллинговой выгрузкой всё равно нельзя сказать, сколько стоил продукт вчера. Разбираем cost & usage, нужные поля данных, стандарт FOCUS (FinOps Open Cost and Usage Specification) и чек-лист зрелости выгрузки — для chargeback и оптимизации расходов. В геораспределённом регионе ru-6 (три независимых AZ на 10–15 км, связность до 10 Гбит/с) доступны отказоустойчивые кластеры облачных БД: PostgreSQL, MySQL, Redis, TimescaleDB и ClickHouse. При репликах ноды гарантированно разносятся по дата-центрам — по модели AWS Multi-AZ. Вместе с уже анонсированными S3 и Managed Kubernetes в ru-6 это закрывает типичный DR-контур «хранилище + K8s + БД» без самостоятельной репликации между площадками; имеет смысл закладывать в TCO разницу single-AZ vs multi-AZ. NVIDIA сообщает, что производство Vera Rubin NVL72 выходит на полный ход: стойки уже работают у CoreWeave, Google Cloud, Microsoft Azure и Oracle Cloud. CoreWeave на живом железе показал ~10× больше tokens/s на мегаватт, чем Grace Blackwell NVL72 (бенчмарк DeepSeek-R1) — метрика, по которой сейчас считают экономику AI-фабрик. У Google Cloud запущен первый bare-metal инстанс A5X на Rubin + Virgo; параллельно в AI-фабрики идут коммутаторы Spectrum-6. Для рынка это сигнал: поколение после Blackwell уже не слайд, а ранний деплой — ждать сдвига $/token и $/MW. Команда Qwen (Alibaba) представила третье поколение модели генерации изображений. Фокус — на «полезных» картинках для работы: плотные layouts, инфографика, UI-макеты, мелкий текст и мультиязычный рендер. Доступ пока через Qwen Chat / Studio; открытых весов в анонсе нет. Google выпустил три модели Flash-линейки для production-агентов: 3.6 Flash — workhorse с лучшим coding/multimodal и ~17% меньшей выдачей токенов при более низкой цене ($1.50 / $7.50 за 1M); 3.5 Flash-Lite — самый быстрый и дешёвый в классе 3.5 (~350 tok/s, $0.30 / $2.50 за 1M); 3.5 Flash Cyber — узкая модель под поиск и патчи уязвимостей в CodeMender, пока только governments и trusted partners. 3.5 Pro всё ещё в тестах с партнёрами; параллельно стартовал pre-training Gemini 4. 3.6 Flash и Flash-Lite доступны в Gemini API, AI Studio и Gemini Enterprise. В Cloud FinOps появился калькулятор хостинга LLM: можно подобрать GPU-инфраструктуру под open-weight модели (Qwen, Llama 4, DeepSeek R1, GLM, gpt-oss, Devstral и др.) и сразу сравнить аренду узлов в облаках РФ — H100, H200, A100, L40S, L4, B300. Для каждой модели есть ориентир по VRAM, кванту и числу карт, плюс рядом — Hosted API в ₽/1M токенов, если он есть в каталоге. Считать инфраструктуру под инференс можно в разделе «Калькулятор → Self-host LLM». Cloud.ru открыл исходный код Guardrails Filter — прокси между приложением и языковой моделью, который маскирует PII, API-ключи и пароли до инференса и восстанавливает их в ответе. Версии Standalone и ExtProc (Envoy) можно развернуть в своём контуре с моделями любых провайдеров; уже используется в AI Factory / Foundation Models. На pii-bench заявлены F1 93,1 и точность срабатываний 99,9%.