gram news
Аватар канала Вокруг Kubernetes в VK

Вокруг Kubernetes в VK

@k8s_vk

Делимся новостями из мира Kubernetes и DevOps. А еще рассказываем про кластеры K8s в облаке VK Cloud https://cloud.vk.com/containers Мы в MAX: https://max.ru/k8s_vk

4,331подписчиков

Открыть канал

Последние посты

  • Вокруг Kubernetes в VK

    22 сент., 15:24

    ⚡️Автоскейлер Netflix сокращал потребление ресурсов на 25–45%. Для сложных Flink-задач этого оказалось недостаточно. Перевели для вас этот кейс.Изначально Netflix использовал собственный автоскейлер. Он смотрел на CPU, сеть, Kafka lag и другие внешние метрики и менял общее число TaskManager, поэтому все операторы задачи масштабировались вместе. С ростом числа stateful-задач Netflix перешел на Apache Flink Autoscaler: он оценивает пропускную способность отдельных операторов и меняет параллелизм для конкретных вершин графа.📃 В статье разобрали оба подхода, доработки Flink Autoscaler для масштаба Netflix и результаты перехода.Полную версию читайте по ссылке 👈📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    282222Открыть в Telegram
  • Вокруг Kubernetes в VK

    21 сент., 14:23

    В Managed Containers второго поколения PV можно перенести из сервисного проекта в пользовательский. После этого диск станет обычным ресурсом проекта: его можно подключить к виртуальной машине, создать снимок или использовать для дальнейшей работы с данными.Такой перенос пригодится в четырех случаях:🔵пересоздание кластера 🔵миграция между кластерами второго поколения 🔵разбор инцидента в изоляции 🔵хранение архива по требованию регулятора.Разобрали сам перенос, подключение диска к новому кластеру и ограничения, которые стоит учесть заранее.📃 Читать статью →📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    18 сент., 10:06

    Во втором поколении Managed Containers меняется граница ответственности между пользователем и платформой.Системный слой размещается в сервисном проекте и обслуживается VK Cloud. Пользователь управляет приложениями и данными, обновляет версию Kubernetes и аддоны.➡️ Подготовили разбор архитектуры второго поколения, встроенных сервисов, доступных инструментов и порядка миграции с первого поколения на второе.Главное собрали на карточках. Подробнее — в статье VK Cloud.📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    17 сент., 14:44

    ⚡️ Высокая загрузка CPU сама по себе — еще не сигнал для Cluster Autoscaler.Автоскейлер реагирует на ситуацию, когда планировщик Kubernetes не может разместить поды и они остаются в Pending. Тогда Cluster Autoscaler проверяет, поможет ли добавление нового узла в одну из групп.🧮 При расчете он смотрит на resources.requests: сколько CPU и памяти запросили поды, а не сколько ресурсов они потребляют прямо сейчас. Поэтому поды без корректно заданных requests могут не создать повода для масштабирования, даже если нагрузка на существующие узлы высокая.⤵️ В обратную сторону работает похожая логика. Если нагрузка снизилась и поды можно разместить на меньшем числе узлов, автоскейлер расселяет недозагруженный узел и после периода простоя удаляет его. В Managed Containers от VK Cloud пустой узел должен оставаться таким пять
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    14 сент., 13:29

    GPU в Kubernetes становятся гибчеОбычный device plugin работает с GPU как со счетчиком целых устройств: под запрашивает карту и получает ее целиком. DRA делает модель гибче: можно указать модель, поколение и объем видеопамяти, а планировщик подберет подходящее устройство.Несколько подов можно привязать к одному ResourceClaim. Более гибкое деление GPU между независимыми нагрузками пока остается в beta, а отбор устройств по атрибутам стабилен с Kubernetes 1.34.Подробнее о DRA и работе с GPU в Kubernetes — в статье.📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    11 сент., 13:28

    🤖 Для ИИ-задач часто нужны значительные ресурсы, но постоянно держать их занятыми не получается. Во время обучения модели мощностей требуется больше, между запусками — меньше. Поэтому важно уметь быстро перераспределять ресурсы между задачами и командами.Kubernetes решает сразу две задачи: помогает эффективнее использовать GPU и упрощает управление инфраструктурой.➡️ Подробнее о том, как Kubernetes используют для ИИ-задач и какую роль здесь играет Managed Kubernetes, читайте на Хабре.📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    11 сент., 10:44

    переслано из @vk_cloud_news

    ⚡️У АОТ появился первый экспертный советВ него вошли девять ведущих практиков в области облачно-ориентированных технологий и Kubernetes. От VK Cloud в совете Алексей Волков, руководитель продуктовой команды Developer Productivity.🤓 Эксперты будут определять технологическую стратегию ассоциации и подключаться к ее отраслевым инициативам.Одна из первых задач — работа в программном комитете Kuber Conf 2026. Совет примет участие в отборе докладов для конференции и представит свой взгляд на развитие облачно-ориентиованных технологий.Что именно будет делать совет и какие направления эксперты он объединяет — в карточках. Подробности — по ссылке.📬 Мы в МАХ
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    8193321Открыть в Telegram
  • Вокруг Kubernetes в VK

    8 сент., 08:04

  • Вокруг Kubernetes в VK

    3 сент., 10:18

    💙 Ingress в Kubernetes: выбор контроллера, маршрутизация и TLSIngress кажется простой точкой входа в Kubernetes, пока не появляются дополнительные маршруты, TLS и настройки конкретного контроллера.Разобрали три важных аспекта: 🔵как этот ресурс обрабатывает трафик 🔵что учитывать при маршрутизации и TLS 🔵откуда берется зависимость от контроллера.👉 Подробнее — в нашем блоге📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    1,030544Открыть в Telegram
  • Вокруг Kubernetes в VK

    31 авг., 14:19

    В Managed Kubernetes доступна новая версия Kubernetes 1.35.Обновление приносит актуальные исправления безопасности и стабильности, улучшает работу платформы и снижает риски эксплуатации, а также упрощает дальнейшие обновления и использование новых возможностей экосистемы Kubernetes.Почему стоит обновиться🔹Работая на актуальной версии, вы снижаете риски, связанные с уязвимостями и нестабильностью устаревших версий оркестратора.🔹Упрощается переход на будущие обновления и новую функциональность экосистемы Kubernetes.❗️Важно: на старте новая версия доступна кластерам, которые уже работают на новой версии оркестратора. Для кластеров на старой версии обновление выйдет позже.Подробности — по ссылке.📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    1,4803331Открыть в Telegram
  • Вокруг Kubernetes в VK

    28 авг., 13:21

    🤔 Как защитить Kubernetes-кластер от сбоев и ошибок конфигурации?Для production-кластеров, состояние которых важно быстро восстановить, в Managed Kubernetes доступен аддон Velero. Он настраивает резервное копирование workloads, namespace и Kubernetes-объектов, а копии хранит в VK Object Storage.С какими задачами поможет Velero?🔹Резервное копирование: сохраняйте состояние workloads, namespace и других Kubernetes-объектов.🔹Быстрое восстановление: возвращайте кластер в рабочее состояние после сбоев, ошибок конфигурации, неудачных релизов или инцидентов с данными.🔹Надежное хранение: бэкапы лежат в отдельном объектном хранилище VK Object Storage независимо от жизненного цикла кластера.🪄 Как активировать?Установите аддон velero во вкладке «Аддоны» кластера в панели управления VK Cloud, указав бакет и ключи доступа к VK Object Storage.👉 Подробности — по ссылке.
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    27 авг., 07:03

    Уже сегодня в 19:00 встречаемся на Cloud Sessions!С нетерпением ждем начала и готовимся обсуждать кейсы вместе с инженерами из VK Cloud и Dodo Engineering.Спикеры: 🔹 Владимир Вдовин, Principal Engineer VK Cloud — о steal time и планировщике ядра на eBPF 🔹 Юлия Санжаровская, инфраструктурный архитектор VK Cloud — о том, как масштабировать облако в условиях дефицита серверного железа 🔹 Павел Притчин, CTO Dodo Engineering — о том, как удалось ускорить разработку в 1,5 раза с помощью агентов💻 Подключайтесь к онлайн-трансляции по ссылке.💬 Вопросы спикерам оставляйте в комментариях под этим постом. Будем собирать их по ходу встречи и передавать экспертам.Если не успеем озвучить ваш вопрос во время митапа, спикеры ответят на него в чате после мероприятия 💙📲 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    1,460422Открыть в Telegram
  • Вокруг Kubernetes в VK

    26 авг., 13:43изменён

    1,280543Открыть в Telegram
  • Вокруг Kubernetes в VK

    21 авг., 11:56изменён

    На демо LLM-инференс может работать быстро, а под реальной нагрузкой — получить растущий p99, очередь запросов и внезапный OOM.Причем проблемы проявляются не сразу: когда p99 уже начинает расти, средняя задержка еще может быть нормальной.В статье разбираем четыре механизма такой деградации:🌟фрагментация KV-cache 🌟нехватка памяти на длинном контексте 🌟блокировка очереди при батчинге 🌟разрыв между p50 и p99.👀 Главное — этот процесс можно заметить заранее. Средней задержки для этого мало. Нужны gpu_cache_usage, p99 задержки между токенами, глубина очереди, счетчик вытеснений и preemption.Отдельно показываем, как подобрать параметры батчинга под свой трафик и почему оптимизации вроде PagedAttention не отменяют наблюдения за памятью и хвостовыми
    1,120видео4321Открыть в Telegram
  • Вокруг Kubernetes в VK

    18 авг., 14:23изменён

    Просто напоминаем, что в следующий четверг проведем технический митап про облака, платформы и инфраструктуру — Cloud Sessions.Поделимся реальными инженерными кейсами. Об одном из них расскажет Юлия Санжаровская, инфраструктурный архитектор VK Cloud.🗓️ 27 августа 📍 Ленинградский проспект, 39, бизнес-центр Skylight, Б1 🕰 Начало в 18:00👉Регистрируйтесь по ссылке.
    1,080видео333Открыть в Telegram
  • Вокруг Kubernetes в VK

    17 авг., 14:08

    Kuber Conf от АОТ — первая в России некоммерческая комьюнити‑конференция по Kubernetes.💙Обсудим все самое актуальное: AI и облачную инфраструктуру, экономику платформ и безопасность в эпоху LLM, эксплуатацию Kubernetes и наблюдаемость, сети и Service Mesh, а также железо, ЦОДы и bare metal‑инфраструктуру. Особый акцент в этом году будет на экономике платформ.Зоны для нетворкинга и неформального общения, а также стенды и активности от партнеров тоже будут.🤩 Кому будет полезно?Инфраструктурным инженерам и администраторам / DevOps, архитекторам платформ и сервисов, разработчикам платформ на базе k8s, а также специалистам по ИБ (DevSecOps).😎 А выступить можно?Да. Рассмотрим доклады по теме конференции: AI и облачная инфраструктура, экономика платформ, безопасность в эпоху LLM, Platform Engineering, эксплуатация Kubernetes, наблюдаемость и другим. Подробный список — на сайте.
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    1,010433Открыть в Telegram
  • Вокруг Kubernetes в VK

    14 авг., 12:24

    переслано из @vk_cloud_news

    📣 27 августа в Москве проведем Cloud Sessions — технический митап про облака, платформы и инфраструктуру.В программе — доклады с реальными инженерными кейсами, с которыми сталкиваются разработчики и архитекторы при развитии облачной инфраструктуры. Например, вы узнаете, как команда VK Cloud написала свой планировщик ядра на eBPF и победила steal time в облаке.После докладов вас ждет афтепати с пиццей и нетворкингом: в кулуарах можно обсудить то, что не уместилось на слайдах, и задать вопросы спикерам напрямую.Кому будет полезно:🔹 Инженерам разработки облачных и сетевых сервисов, платформенным разработчикам🔹 DevOps- и SRE-инженерам, SysOps, системным администраторам и архитекторам🔹 Руководителям отделов разработки облачных, сетевых и инфраструктурных сервисов.Когда и где🗓️ 27 августа с 18:00 до 00:00 📍 Ленинградский проспект, 39, бизнес-центр Skylight, Б1Митап бесп
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    13 авг., 12:49

    🧩 Три мастер-ноды и несколько реплик еще не делают Kubernetes-кластер отказоустойчивым. Сервис может пережить отказ одной ноды или потерять данные из томов.В статье разбираем, как распределять реплики между зонами с topologySpreadConstraints, зачем нужен PodDisruptionBudget и почему снапшот etcd не заменяет бэкап данных приложений.Отдельно показываем, что берет на себя Managed Kubernetes, а что остается зоной ответственности команды.👉 Читайте в блоге →📬 Мы в MAX
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    8815321Открыть в Telegram
  • Вокруг Kubernetes в VK

    11 авг., 14:13

    ❓ Почему оператора недостаточно для on-prem DBaaSИнструменты Kubernetes умеют создавать базы данных, настраивать репликацию, масштабирование и переключение на резервную реплику. Но для DBaaS этого мало: разным командам нужны единые правила обновлений, восстановления из бэкапов и соблюдения политик.Когда каждая команда самостоятельно выстраивает эти процессы, решения начинают дублироваться: у команд появляются свои API, правила обновлений, восстановления и эксплуатации.🤝 Что должно быть между командой и инфраструктуройЧтобы не собирать отдельное DBaaS-решение для каждой команды, нужен слой абстракции между запросом разработчика и конкретным способом создания базы. Он отделит запрос на базу от способа ее создания.Разработчик описывает нужный сервис через привычные ресурсы Kubernetes. Платформенная команда выбирает, какой бэкенд выполнит этот запрос: оператор, собственная
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
  • Вокруг Kubernetes в VK

    7 авг., 11:37изменён

    Когда Kubeflow не хватит для диагностики🧠 Когда notebook зависает или задача обучения завершается с ошибкой, оператору важно увидеть, что происходит с ресурсами Kubernetes. Интерфейс Kubeflow не всегда показывает эти детали, поэтому приходится переходить к kubectl и отдельно проверять Pod.Упростить диагностику помогает плагин Headlamp Kubeflow. Он показывает ресурсы Kubeflow и связанные данные Kubernetes в одном интерфейсе: причины ошибок, лимиты, состояния Pod и связи между объектами.Например, в Headlamp можно проверить Pod notebook-сервера, посмотреть лучший Trial в Katib или сравнить версии пайплайна через YAML-дифф. Плагин сам определяет установленные компоненты Kubeflow и добавляет только нужные разделы.➜ Как установить плагин и разбирать AI/ML-нагрузки без переключения между дашбордами и kubectl, читайте в блоге VK Cloud.📬 Мы в MAXЧаст
    Иллюстрация к посту канала Вокруг Kubernetes в VKИллюстрация к посту канала Вокруг Kubernetes в VK
    1,060433Открыть в Telegram