Latest posts

Мониторим ИТ
21 Sept, 12:48
🚨 Prometheus Alertmanager или Grafana Alerting — что выбрать?Поговаривают, что существуют окружения, в которых алерты летят одновременно из Alertmanager и Grafana. При таком раскладе правила, маршрутизация и глушилки оказываются разбросаны по двум системам, а команда не всегда понимает, какая из них главная.По ссылке вы найдете перевод статьи, в которой подробно сравниваются оба подхода: архитектура, группировка и дедупликация алертов, правила подавления, интеграции, высокая доступность и управление через UI или конфигурацию.Также говорят про гибридный вариант: создавать и визуализировать правила в Grafana, а сложную маршрутизацию и доставку уведомлений оставлять Alertmanager.👉 Читать перевод статьи👉 Расскажите в комментариях какой подход выбрали у себя в окружении.📱 Telegram |TeletypePrometheus Alertmanager против Grafana Alerting (2026): архитектура, возможности и когда использовать каждый из нихЭто перевод оригинальной статьи Prometheus Alertmanager vs Grafana Alerting (2026): Architecture, Features, and When to Use Each.
Мониторим ИТ
21 Sept, 10:00
🎤 SIP Dump Analyzer: как мы разработали open source-анализатор SIP и RTCP дамповОписание доклада С ростом количества пользователей и звонков система на базе Homer перестала обеспечивать необходимую скорость работы. В докладе разберём новую архитектуру обработки SIP-трафика: децентрализованный захват, PCAP как единицу обработки, ClickHouse для хранения и аналитики, а также использование S3, Redis и курсорной пагинации. На практическом примере покажем, как новая система помогает в несколько раз ускорить работу технической поддержки.Тезисы - Децентрализованный захват VoIP-трафика с sip_dumps. - PCAP как единица пакетной обработки. - ClickHouse для быстрого хранения и анализа больших объёмов данных. - Курсорная пагинация без лишней нагрузки на API и СУБД. - S3 и Redis-очередь для хранения, асинхронной обработки и горизонтального масштабирования. - Практи


Мониторим ИТ
21 Sept, 05:45edited
Дедупликация строк на доставщике логов: сравниваем OpenTelemetry, Vector, vlagent, Fluent Bit Grafana Alloy и FilebeatДописал вторую статью из той же серии. Идеи, которые копились достаточно давно, наконец начали выходить в свет.Вы узнаете про варианты дедупликации на уровне агентов. В одной из следующих статей поговорим о том какой бэкэнд лучше жмет, а дальше как снизить объем телеметрии.Плюсы к статье и в карму на Хабре неистово приветствуются❤️Читать на Хабре📱 Telegram | 📲 MAX
Мониторим ИТ
19 Sept, 14:34
Exemplars: как перейти от всплеска на графике сразу к проблемному запросу(удобная штука, как оказалось, но полноценно работает только в Mimir и Prometheus)По метрикам легко определить, что вырос p95 задержки запросов, увеличилась доля ошибок или просела пропускная способность. График, к сожалению, сообщит только факт произошедшей проблемы, но не детали по ней.Дальше идешь и ковыряешь трейсы, ищешь нужный временной интервал и нужные трейсы. Exemplars сокращают эту цепочку до одного клика.Что это такоеExemplar — ссылка на конкретный трейс, сохранённая рядом с метрикой. Кроме значения и времени оно обычно содержит trace_id или span_id и быть может еще какие-то дополнительные атрибуты.Например, в гистограмме мы увидели в бакете запросы с плохим статусом. Exemplar говорит: смотри, вот пример конкретного трейса, он занял 1,82 секунды, а его trace_id — 7f3a…91c2.При этом trace_id




Мониторим ИТ
19 Sept, 10:04
Микросервисная архитектура ускоряет разработку, но усложняет эксплуатацию. Один сбой в распределённой системе может вызвать лавину из сотен алертов, информационного шума и ложных следов. Инженерам приходится часами вручную сопоставлять логи, метрики и трейсы, чтобы понять, что именно стало первопричиной инцидента.Покажем, как машинное обучение помогает превратить поток уведомлений в единую картину инцидента. Вы увидите, как алгоритмы помогают находить корневую причину, отсекать шум и оценивать возможное развитие аварии до того, как она повлияет на критичные бизнес-сервисы.24 сентября в 11.00 команда Artimate и федерального системного интегратора «Аметист» проведут вебинар “От алерта до первопричины: как ML помогает расследовать каскадные инциденты“.Для кого:⚡️SRE- и DevOps-инженеры, которые хотят сократить время расследования инцидентов и снизить уровень информационного шума. ⚡️


Мониторим ИТ
19 Sept, 07:40
Как создать собственный экспортер метрик для KubernetesЭто статья о том, как написать свой Prometheus-экспортер на Go. В ней разобран весь путь: Counter, Gauge и Histogram, эндпоинты /metrics и /healthz, сборка безопасного образа, развёртывание в Kubernetes и подключение через ServiceMonitor. В конце небольшой бонус: подготовка метрики для использования в HorizontalPodAutoscaler.Kubernetes из коробки умеет отслеживать загрузку CPU и потребление памяти. Но на практике решения о масштабировании чаще зависят от показателей, которые выходят за эти узкие рамки: сколько сообщений ждет в очереди, сколько времени заняла последняя пакетная задача, сколько активных WebSocket-соединений поддерживает под. Когда встроенных метрик недостаточно, этот пробел помогает восполнить экспортер метрик.Читать на Хабре →📱 Telegram | 📲 MA
Мониторим ИТ
18 Sept, 13:33edited
Ко вчерашней статье мне написали совершенно справедливый комментарий.Комментарий касался механизмов, которые могут зарезать поток отправляемых данных на период когда бэкэнд только только очухался. Исправляюсь, статью дополнил.Если кратко, то vmagent, vlagent, vtagent имеют параметр remoteWrite.rateLimit, который позволяет ограничить поток отправляемых данных.В плане плавной заливки данных в бэкэнд после его падения наиболее функционален Vector. HTTP-ориентированные синки Vector имеют ограничение количества запросов за интервал: есть возможность реализации сценариев "не более 5 запросов в секунду" (rate_limit_num: 5), "не более 2 одновременных запросов" (concurrency: 2) и "до 1 MiB несжатых данных в одном полном batch" (max_bytes: 1048576).Vector также поддерживает Adaptive Request Concurrency (ARC). ARC начинает с небольшой конкурентности и меняет её в зависимости от задержки


Мониторим ИТ
18 Sept, 07:18
What's new in ClickStack - Aug ’26Пока кто-то с трудом выпускает одну версию за месяц, команда ClickStack выпустила аж сразу пять — с v2.34 по v2.38.Среди главных обновлений:🚀 переменные и связанные фильтры в дашбордах🚀 формулы для расчёта процентов, коэффициентов и других производных метрик🚀 навигатор по метрикам и метки релизов на графиках🚀 экспериментальная поддержка TimeSeries и PromQL🚀 отдельный дашборд для наблюдаемости LLM-приложений🚀 история выполнения алертов, несколько каналов уведомлений и расширенные webhook-поля🚀 новые инструменты MCP для расследования инцидентов с помощью AI-агентов.


Мониторим ИТ
17 Sept, 13:27edited
Что будет с телеметрией, если хранилище исчезнет: сравниваем очереди и батчинг семи агентовНаписал статью для своих любимых подписчиков. Наслаждайтесь❤️Читать на Хабре📱 Telegram | 📲 MAX
Мониторим ИТ
17 Sept, 07:32edited
NetAlertXЭто опенсорсная система для автоматического обнаружения и учёта сетевых устройств. Она постоянно сканирует сеть, собирает список активов и сообщает, когда появляется новое устройство, меняется IP-адрес или кто-то внезапно пропадает.Вместо периодического nmap и таблички, которую никто не обновлял с прошлого года, получите веб-интерфейс с историей изменений.Что умеет:🚀 обнаруживать устройства через ARP, DHCP, Pi-hole, UniFi, SNMP и плагины🚀 находить неизвестное железо и теневые устройства🚀 следить за статусом, IP-, MAC-адресами и производителями🚀 отправлять уведомления в Telegram и ещё 80+ сервисов через Apprise🚀 интегрироваться с Home Assistant, API и вебхуками🚀 экспортировать метрики в Prometheus


Мониторим ИТ
16 Sept, 13:05
logporter — легковесная альтернатива cAdvisor и сборщик логов для отправки в LokiЗанятная штуковина для мониторинга Docker для тех, кому хочется знать, кто жрёт память, кто отвалился и что перед этим написал в логах.Автор logporter в статье на Хабре говорит, что ему надоел аппетит cAdvisor, и он запилил свой инструмент на Go.Что внутри:🚀 Метрики для Prometheus: CPU, память, сеть, дисковый ввод-вывод, состояние контейнеров и размеры томов. Всё, чтобы выяснить, куда испарились ресурсы.🚀 Логи в Loki. Чтобы после алерта не бегать по серверам с дежурным «щас, я только docker logs гляну».🚀 Проверка обновлений образов. Сравнивает версии в тегах, а для latest и прочих несемантических тегов — digest. Потому что надпись latest сама по себе свежести не гарантирует.🚀 Встроенная веб-панель: контейнеры, образы, тома и просмотр логов в реальном времени. Есть поиск по словам,


Мониторим ИТ
16 Sept, 06:35edited
Сегодня у меня в канале вышел пост про открытую платформу для создания SRE-агентов, под которой появился вот такой комментарий. Это уровень, я считаю.Машенька пришла похвалить пост, но принесла с собой техзадание.Приятно, когда когда тебя хвалят от чистого промпта. Такая открытость в интернете сейчас редкость.


Мониторим ИТ
16 Sept, 06:02
auraOpen-source платформа для создания SRE-агентов, рассчитанная на работу с реальной инфраструктурой. Она берёт на себя оркестрацию, хранение состояния, обработку ошибок, стриминг, аудит действий и защитные ограничения.Что умеет:— объединять специализированных агентов в команду;— подключать инструменты через MCP— работать с OpenAI, Anthropic, Gemini, Bedrock, Ollama и другими моделями— запрашивать подтверждение человека перед опасными действиями— экспортировать все решения и вызовы инструментов в OpenTelemetry— работать внутри собственного контура, включая изолированные средыКонфигурация агентов, промпты, модели, инструменты и политики доступа описываются в TOML, их можно хранить в Git и проводить через обычный code review.
Мониторим ИТ
15 Sept, 08:28
grpc-streams-checkerИнструмент синтетического мониторинга, который ведёт себя как настоящий клиент: открывает стрим, ждёт нужное количество сообщений, проверяет содержимое и измеряет задержки.Умеет выявлять:— таймауты и зависшие потоки;— недостаточное количество сообщений;— некорректные или пустые поля;— растущую задержку первого сообщения;— слишком большие интервалы между сообщениями.Результаты экспортируются в Prometheus с разбивкой по методам и типам ошибок. В комплекте есть правила алертинга, Kubernetes-манифесты и демонстрационный сервер с разными сценариями поломок.Статья с описание на Хабре


Мониторим ИТ
14 Sept, 10:03
ИТ-мониторинг сети 24/7 - миф или реальность?Штатные средства создают лишние хосты, неточно классифицируют оборудование и перегружают сервер при сканировании крупных сетей. Итог: значительная часть работы по проверке и настройке узлов остается ручной.На вебинаре 22 сентября в 11:00 (МСК) команда wiSLA покажет, как выстроить полный цикл мониторинга сети — от автоматического обнаружения устройств до быстрой локализации сбоев и снизить количество ручного труда.Коллеги разберут такие проблемы: • как исключить «слепые зоны» в мониторинге сетевого оборудования; • как контролировать доступность сетевого оборудования, используя проверки по SNMP, ICMP и HTTP; • как собирать метрики, отслеживать события и анализировать состояние устройств в единой карточке; • как быстро настроить мониторинг в едином контуре наблюдаемости; • как снизить количество повторных сбоев с помощью ускорения


Мониторим ИТ
14 Sept, 07:20
Приглашаю на тренинги по новой версии — Zabbix 8.0 (+ специальные условия до конца сентября)Релиз восьмёрки ожидается в ближайшие недели. А обучение по новой версии уже можно запланировать: в ноябре и декабре у нас в Gals Software пройдут Zabbix Certified Specialist 8.0 и Zabbix Certified Professional 8.0.Почему стоит присмотреться к восьмёрке? В официальном списке изменений есть интересные вещи:— Экспорт и импорт дашбордов. Настроенную панель можно будет сохранить в файл и перенести в другую установку Zabbix. Если собирали дашборды руками, пользу объяснять, думаю, не надо.— ClickHouse для хранения истории значений. Появляется ещё один вариант хранения собранных метрик — повод пересмотреть, как организована история в вашей системе мониторинга.— Отдельный тип данных JSON. В документации заявлена нативная поддержка JSON со значениями до 128 МБ. Это заметное изменение для тех,
Мониторим ИТ
4 Sept, 13:55
The Life of a MetricКогда в коде разраб пишет counter.Inc(), кажется, что метрика по этому счетчику просто каким-то волшебным образом появляется на графике в Grafana.Однако, между этими событиями происходит дофига всего.Сначала число живет в памяти приложения, потом передается по сети, получает идентификатор, попадает в хранилище, сжимается, записывается на диск, участвует в запросах, постепенно теряет детализацию — а в конце удаляется по ретеншену.В статье в блоге VictoriaMetrics разобрали весь путь: от первого +1 в счетчике до последнего удаленного байта. Ну, и заодно становится понятно, почему миллион значений одной метрики — это норм, а миллион метрик с разными лейблами — уже совсем другая история (хай кардиналити).Читать статью📱 Telegram | 📲 MAX


Мониторим ИТ
4 Sept, 06:02
Весь стек мониторинга внутри одноплатника. Telegraf, InfluxDB и Grafana на процессоре RK3568Частый кейс в промышленной инженерии — предположим, понадобилось снимать телеметрию с управляемых iPDU в стойке. Стандартный маршрут включает виртуалку под Zabbix, рядом SQL-база, сверху веб-интерфейс, дальше по вкусу облако и оплата за хранение данных. В этом кейсе другой стек — Telegraf, InfluxDB и Grafana — целиком внутри промышленного одноплатника, который сидит в той же стойке, что и опрашиваемое оборудование, потребляет несколько ватт и настраивается из браузера с рабочего места.Читать дальше на Хабре📱 Telegram | 📲 MAX


Мониторим ИТ
3 Sept, 11:32
trippyУтилита объединяет функциональность traceroute и ping и предназначена для помощи в анализе сетевых проблем, работает на Linux, BSD, macOS и Windows, её можно установить из большинства менеджеров пакетов, предварительно скомпилированных бинарных файлов или исходного кода.Репыч на Гитхаб📱 Telegram | 📲 MAX
Мониторим ИТ
2 Sept, 13:37
Victoria stack активно развивается и становится все популярнее. Мне их решения очень нравятся своей логичностью, эффективностью работы и хорошей документацией.Если вы планировали присмотреться к этим решениям, то вот три страницы документации с Key Concepts, где понятно рассказывают как устроена каждая система. Хорошая стартовая точка, как по мне.VictoriaMetricsVictoriaLogsVictoriaTraces📱 Telegram | 📲 MAX
Related Channels
Other channels in the same section of the catalogue.
