Последние посты

Пятничный деплой
22 сент., 14:03
Планы на 3 октября — прийти на RWB Infra x Security MeetupМы направим прожекторы на инфраструктуру и информационную безопасность — туда, где за привычными решениями скрываются сложные инженерные задачи, компромиссы и неочевидные риски.Будем разбирать реальные кейсы, искать узкие места, обсуждать и показывать решения, которые помогают инфраструктуре и безопасности выдерживать рост.Когда: суббота, 3 октября, старт в 13:00 Где: Москва + онлайнВ программе 8 докладов, разделенных по двум тематическим трекамТрек Infra:• Тюнинг Gitlab CE как реакция на быстрый рост нагрузки • Путь баланса и компромиссов в DCIM • Единая инфраструктура доверия: PKI на базе Vault • Kubernetes vs Bare Metal: что может пойти не такТрек Security:


Пятничный деплой
21 сент., 14:40
переслано из @monitorim_it
Все проверки зелёные, а данных нет: как мониторить gRPC server‑side стримыСтандартная (для многих) история. Отдаём какие‑то данные в реальном времени через server‑side web‑gRPC стримы. Цепочка: балансировщик, дальше Envoy с grpc‑web, дальше бэкенд.Все проверки зелёные: TCP поднят, хендшейк проходит, /healthz отвечает 200, в графане/slack'e тишина. А фронтенд у клиентов замёрз. И узнали мы об этом от клиентов, а не от мониторинга.В статье описание механизма работы демона, который по расписанию подгружает.proto на лету через proto‑loader, открывает server‑side RPC как обычный клиент, ждёт кадров (например 3) в бюджет времени и валидирует каждый кадр.Статья на ХабреРепыч на Гитхаб📱 Telegram | 📲 MAX
Пятничный деплой
19 сент., 16:35
переслано из @devopslibrary
archifyAgent skill for beautiful, verifiable architecture, workflow, sequence, data-flow, and lifecycle diagrams—self-contained HTML with motion and crisp export.https://github.com/tt-a1i/archify
Пятничный деплой
18 сент., 09:03
переслано из @monitorim_it
От firing до postmortem: рабочее место дежурного поверх Grafana и MattermostАлертинг у нас построен на правилах Grafana. Сами правила описаны в Terraform, хранятся в Git и применяются через CI/CD-пайплайн. Такой подход даёт review, историю изменений и воспроизводимую конфигурацию вместо ручного редактирования правил в интерфейсе.Дальше Grafana Alertmanager маршрутизирует уведомления по labels в несколько каналов внутреннего Mattermost. За этими каналами следит дежурная смена. В Grafana также есть отдельная доска, которая выводит активные алерты списком. Она помогла видеть общую картину, но не решила вопрос, что происходит с каждым алертом после доставки.Во время всплеска нужное сообщение иногда теряется среди десятков похожих. Некоторые алерты горят неделю, а обновления по ним появляются раз в несколько дней и каждый раз начинаются почти с нуля, как будто сигнал пришёл только что.


Пятничный деплой
18 сент., 06:09
переслано из @k8security
Я долгое время считал, что подход/термин “Shift Down Security” появился в материале SIG Security Kubernetes в 2025 году. Но на самом деле корректнее считать 2023 год и статью ребят из Google Cloud под названием "The Modernization Imperative: Shifting left is for suckers. Shift down instead"!Автор статьи критикует чрезмерное «shift left» — перенос на разработчиков всё большего числа задач: тестирования, безопасности, эксплуатации, релизов и т. п. Хотя раннее подключение QA и security полезно, но на практике это нередко превращает инженеров в перегруженных «универсалов».Вместо этого он предлагает «shift down» подход : передавать сложность вниз, на управляемые платформы и абстракции.Telegramk8s (in)security25 февраля 2025 года рабочая группа SIG Security Kubernetes опубликовала документ под названием “Shift Down Security”. Цель этого документа — помочь организациям использовать лучшие практики безопасности в облачных средах для снижения бизнес-рисков и повышения…
Пятничный деплой
17 сент., 18:28
переслано из @devopsitsec
⚡️ Поды здоровы, а запросы в Kubernetes случайно отваливаются? Проверьте conntrack.Linux хранит состояния отслеживаемых соединений в таблице conntrack. Она используется в том числе при NAT для Kubernetes Services. Если таблица переполняется, новые соединения могут терять пакеты.Симптомы: периодические тайм-ауты, сбои DNS и ошибки API при нормальных показателях приложений.Как проверить на проблемном узле:# Текущее число записей и лимит sysctl net.netfilter.nf_conntrack_count sysctl net.netfilter.nf_conntrack_max# Сообщения ядра sudo journalctl -k | grep -i conntrackХарактерная запись:nf_conntrack: table full, dropping packetЧто делать:


Пятничный деплой
16 сент., 13:37
переслано из @letitkit
Toil в работе SRE. Измерять, или "мы и так знаем что работы дофига“?Привет, киты 🐳. Поразмышляем.Коротко про базу, чтобы синхронизировать понятия.Что такое Toil? По определению Google SRE, toil - это операционная работа, которая: - ручная и повторяющаяся - автоматизируемая - реактивная, а не стратегическая - не создает долгосрочной ценности - масштабируется линейно с ростом сервисаToil и технический долг - одно и то же? Нет. Технический долг - это компромиссы в архитектуре/коде, которые усложняют будущие изменения. Toil - это операционные затраты на поддержку системы. Часто техдолг генерирует toil, но это разные категории. Погашение долга - engineering work, ручное обслуживание последствий - toil.Плановые задачи vs задачи дежурства. Что из этого toil? Не инструмент и не источник задачи определяют суть, а её характер: - "Раз в неделю вручную чистить логи на 50 нодах" из
Пятничный деплой
15 сент., 12:13
переслано из @kubertat
Ваши разрабы не хотят разгребать легаси и рефакторить кронтаски в отдельный scheduler с очередью? У вас есть сотни кронтасок в проде, которые вы хотите таки контролировать в контейнерах? У вас айсикью выше 70, раз вы все еще не описали каждую строку crontab в отдельном Kubernetes ресурсе (Job/Cronjob)?тут уже говорили про недостатки крона Supercronic пытается решить некоторые из них: кронтаски наследуют переменные окружения, выводит логи в stderr, логирует запуски результат выполнения и ошибки, посылает SIGTERM/SIGINT и что-то там еще.Supercronic is a crontab-compatible job runner, designed specifically to run in containers.Legacy не убить!
Пятничный деплой
15 сент., 10:57
https://github.com/mezmo/aura смотрите какая штуковинаGitHubGitHub - mezmo/aura: AURA is a production-tested SRE agent platform you can deploy in minutes. AURA handles the guardrails, APIs…AURA is a production-tested SRE agent platform you can deploy in minutes. AURA handles the guardrails, APIs, state management, streaming, and failure handling required to put AI to work safely on ...
Пятничный деплой
14 сент., 13:46
переслано из @devopsitsec
OWASP выпустили Agent Memory Guard, защиту от одной из самых неприятных атак на AI-агентов: отравления памяти.Проблема в том, что агент может сохранить вредоносную инструкцию в долгосрочную память, а потом продолжить выполнять её даже после очистки контекста. Обычные prompt injection-фильтры здесь уже не особо помогают.Agent Memory Guard ставится между агентом и хранилищем памяти и проверяет каждую запись. Он умеет ловить prompt injection, утечки секретов и PII, попытки изменить защищённые ключи, аномально большие записи и циклы, когда агент начинает сам усиливать уже записанную вредоносную инструкцию.Политики задаются через YAML, а подозрительную запись можно пропустить, замаскировать, отправить в карантин или полностью заблокировать. Есть снапшоты и rollback для восстановления памяти после атаки.В опубликованном бенчмарке на 55 вредоносных payload'ах проект показывает 92,5%
Пятничный деплой
14 сент., 11:45
переслано из @youngmaxnotes
Агенту разрешают расследовать, но не разрешают чинить. Почему граница именно здесь????В ноябре я писал про SRE Agent от PagerDuty: начинайте с read-only. Прошло десять месяцев, и спор сместился: уже не «заменит ли AI дежурного», а «где проходит граница». 24 августа в r/sre инженер после полугода on-call заметил одно и то же во всех обзорах AI SRE-инструментов: расследовать агенту дают одному, чинить - никто. Это навсегда?Что говорят цифры ORCA-bench, 30 июля, Cornell Tech, Columbia и Traversal (последние продают AI SRE-агента, держите в уме). Стенд: 19 микросервисов на OpenTelemetry, шесть дней телеметрии в Prometheus, Jaeger и OpenSearch, доступ к коду, 1 079 задач на root cause, пять фронтирных моделей. Лучшая точность RCA на задачах средней сложности (реалистичный ввод) - 25,3%, на сложных - 10,0%, разрыв сохраняется даже с Claude Fable 5. Слабейшая модель выдумываетRedditFrom the sre community on RedditExplore this post and more from the sre community
Пятничный деплой
13 сент., 16:42
Забираем локальную память для ИИ-агентов - myc не даст Claude Code забыть, что вы с ним решили, даже когда контекст уже сжали.Работает без сети и без ключей, в одном файле рядом с проектом: • пакет контекста собирается за 0,6 мс; • поиск по 100 000 записей - за 8 мс; • решения из переписки не считаются фактами, пока вы их не подтвердите.Подхватывает Claude Code, Codex, opencode и Kimi одной командой, а между машинами переезжает через обычный git. Только Bun, автор из Питера, проекту неделя.Забираем - лежит тут.


Пятничный деплой
13 сент., 16:42
Спасибо подписчикам за то что приносите интересные проекты!1,070Открыть в Telegram
Пятничный деплой
13 сент., 11:45
🐳 Docker выпустила Sandboxes - изолированные среды специально для AI coding agents.Идея простая: дать агентам вроде Claude Code, Codex, Gemini CLI, Copilot CLI, OpenCode и Kiro больше свободы, но не давать им свободно ломать хост-систему.Каждый агент запускается в отдельной microVM и получает только рабочую директорию проекта. Внутри он может:- устанавливать пакеты; - менять конфиги; - запускать сервисы; - поднимать собственные Docker-контейнеры; - выполнять долгие задачи без постоянного подтверждения действий.При этом Docker позволяет отдельно контролировать filesystem, network и credentials, а сам sandbox после работы можно просто удалить.Это инфраструктурный слой для эпохи автономных coding agents: агенту дают почти полный контроль внутри песочницы, но хост остаётся изолированным.https://www.docker.com/products/docker-sandboxes/#Docker #AI #AIAgents #DevOps #Programming


Пятничный деплой
12 сент., 14:45
переслано из @opensource_findings
Как AWS у опенсорсера пакеты отжималНерегулярная рубрика "посмотрите, что творится!". Данная история была в оригинале рассказана Кареном в нашем чате (там регулярно происходит интересное), публикую в своем канале с его разрешения.Новый SDK для AWS от Карена (автора zapros, автора httpx-aiohttp, топ-3 контрибьютора httpx): https://github.com/kap-sh/capoКак-то я решил написать нормальный SDK для AWS. Их текущий SDK — boto3 — это суперлегаси с кучей костылей: без нормальной типизации, без поддержки асинхронности, почему-то с PascalCase и ещё кучей странных решений.У меня уже был хороший опыт работы с SDK: до этого я работал над SDK для OpenAI и Anthropic на Python и TypeScript, так что успел накопить некоторое понимание того, как делать SDK хорошо.С AWS всё немного сложнее: у них около 450 сервисов и примерно 17 миллионов строк сгенерированного кода. Конечно, я не собиралсяTelegramНаходки в опенсорсеНерегулярная рубрика "посмотрите, что творится!". Как вы знаете, рынок найма http клиентов полностью сломан! Сегодня мы постараемся решить данную проблему. zapros - modern and extensible python http client Звезды ставить сюда: https://github.com/kap-sh/zapros…1,110Открыть в Telegram
Пятничный деплой
12 сент., 14:45
Вот страшилка на выходных1,080Открыть в Telegram
Пятничный деплой
12 сент., 07:42
переслано из @monitorim_it
OpsKnightЦентр управления инцидентами с открытым исходным кодом. Весь жизненный цикл инцидента, графики дежурств и страницы состояния — на одной мощной платформе.OpsKnight — это альтернатива с открытым исходным кодом PagerDuty и OpsGenie, разработанная для команд, которые хотят получить полный контроль над своей системой управления инцидентами без затрат на SaaS-сервисы.Репыч на ГитхабСтраница проекта📱 Telegram | 📲 MAX


Пятничный деплой
9 сент., 08:15
переслано из @devopslibrary
argo9sA K9s-inspired terminal UI for monitoring Argo CD resources in real-timehttps://github.com/vvrnv/argo9s
Пятничный деплой
5 сент., 11:04
переслано из @devopsitsec
Сколько незаконченных Git-репозиториев лежит у вас на диске?drydock показывает их все в одном терминальном интерфейсе:- где остались незакоммиченные изменения; - какие коммиты ещё не отправлены; - где забыты stash, конфликт или незавершённый rebase; - какие проекты изменились после последнего тега и готовы к новому релизу.Инструмент проверяет не только текущую ветку, поэтому забытая работа в локальной feature-ветке тоже попадёт в список.brew install yetidevworks/drydock/drydock# или cargo install drydockПосле установки достаточно запустить:drydock


Пятничный деплой
4 сент., 18:55
переслано из @devops_fm
🎙️ На волне DevOps FM!Пятница — отличный повод немного отвлечься от рабочих задач и послушать что-нибудь интересное.В прошлых подборках нас просили больше русскоязычного контента, поэтому собрали три выпуска, которые стоит добавить в список для прослушивания.🗣 DevOps в 2026: Platform Engineering, AI-агенты и будущее джунов от DevOps Kitchen Talks. Что происходит, когда у вас уже 600 сервисов и 3600 пайплайнов? Обсуждают internal platform, её архитектуру и self-service-возможности для разработчиков, а также границы ответственности platform team. Отдельный фокус — AI-агенты и multi-agent workflows: что происходит, когда автоматизация начинает работать уже не только с инфраструктурой, но и непосредственно с engineering-процессами.🗣 Kubernetes 2035: кто будет управлять инфраструктурой? от «В SREду на кухне» /
1,400Открыть в Telegram
