Новые возможности облаков и FinOps · 59 материалов · 1–10 на странице Команда Qwen (Alibaba) представила третье поколение модели генерации изображений. Фокус — на «полезных» картинках для работы: плотные layouts, инфографика, UI-макеты, мелкий текст и мультиязычный рендер. Доступ пока через Qwen Chat / Studio; открытых весов в анонсе нет. Google выпустил три модели Flash-линейки для production-агентов: 3.6 Flash — workhorse с лучшим coding/multimodal и ~17% меньшей выдачей токенов при более низкой цене ($1.50 / $7.50 за 1M); 3.5 Flash-Lite — самый быстрый и дешёвый в классе 3.5 (~350 tok/s, $0.30 / $2.50 за 1M); 3.5 Flash Cyber — узкая модель под поиск и патчи уязвимостей в CodeMender, пока только governments и trusted partners. 3.5 Pro всё ещё в тестах с партнёрами; параллельно стартовал pre-training Gemini 4. 3.6 Flash и Flash-Lite доступны в Gemini API, AI Studio и Gemini Enterprise. В Cloud FinOps появился калькулятор хостинга LLM: можно подобрать GPU-инфраструктуру под open-weight модели (Qwen, Llama 4, DeepSeek R1, GLM, gpt-oss, Devstral и др.) и сразу сравнить аренду узлов в облаках РФ — H100, H200, A100, L40S, L4, B300. Для каждой модели есть ориентир по VRAM, кванту и числу карт, плюс рядом — Hosted API в ₽/1M токенов, если он есть в каталоге. Считать инфраструктуру под инференс можно в разделе «Калькулятор → Self-host LLM». Cloud.ru открыл исходный код Guardrails Filter — прокси между приложением и языковой моделью, который маскирует PII, API-ключи и пароли до инференса и восстанавливает их в ответе. Версии Standalone и ExtProc (Envoy) можно развернуть в своём контуре с моделями любых провайдеров; уже используется в AI Factory / Foundation Models. На pii-bench заявлены F1 93,1 и точность срабатываний 99,9%. После релиза Kimi K3 спрос за ~48 часов приблизил GPU Moonshot к пределу мощности: новые подписки временно приостановлены, приоритет вычислений — у действующих участников (их доступ не режут). Мощности наращивают и обещают открывать места партиями. Параллельно членство разделят на Kimi Membership (Web/App/Work) и Kimi Code Membership — чтобы точнее распределять compute. Для рынка это сигнал: даже сильный frontier упирается в ёмкость инференса; в РФ уже хостят предыдущее поколение (Kimi K2.6) у MWS и Cloud.ru. 19 июля команда Qwen (Alibaba) сообщила о выходе Qwen3.8: ~2,4 трлн параметров, формальный релиз и open-weight — «в ближайшее время». Preview Qwen3.8-Max уже в Token Plan, Qoder и QoderWork (есть промо на credits; планы Individual/Team, совместимость с OpenAI/Anthropic-тулами). Вендор позиционирует модель как frontier, «вторую после Fable 5» — без опубликованных независимых бенчмарков. Сравнивать логично с Claude Fable 5, GPT-5.6 Sol, Kimi K3 (2,8T, веса к 27.07) и GLM 5.2; в РФ уже есть инференс предыдущего поколения Qwen (MWS и др.). MWS Cloud первой в России развернула GLM 5.2 (Z.AI) на собственных GPU: запросы обрабатываются внутри MWS Cloud Platform и не уходят разработчику модели. Вместе с обновлением каталога доступны Kimi K2.6, Qwen 3.6, Gemma 4 и другие LLM через OpenAI-совместимый API — удобно сравнивать TCO инференса без своей GPU-фермы. Kimi K3: multimodal MoE ~2,8 трлн параметров, контекст до 1M токенов, доступ через kimi.com и API (`kimi-k3`). Полные веса обещают к 27 июля 2026. Для облачного рынка это сигнал к гонке инференса крупных open-моделей — в РФ уже есть хостинг предыдущего поколения (Kimi K2.6) у MWS и Cloud.ru. Self-managed code storage: Lambda ссылается на пакет в вашем S3 bucket (режим REFERENCE), не копируя его в свой лимит хранилища. Дефолтный лимит Lambda-managed storage подняли до 300 ГБ/регион — меньше квот-тикетов и проще единый source of truth для деплоев. В AI Studio усилили Web Search: бизнес может собирать агентов, которые сами ищут источники, анализируют материалы и готовят структурированный ответ — от быстрого мониторинга до глубокого разбора. Полезно для внутренних research-пайплайнов рядом с остальным стеком Yandex B2B Tech.