Latest posts

Data Analysis / Big Data
10 Sept, 15:31
SQL от ассистента выполнился без ошибок, но число в отчёте завышеноЗапрос пишется за десять секунд и сразу отрабатывает, а база проверила в нём только грамматику. Опечатку в имени таблицы она поймает; сумму не по тому столбцу, задвоение строк после join и фильтр, поставленный после группировки, пропустит. Это валидный SQL с неверным числом.Типовой случай: выручка за вычетом возвратов как SUM(o.amount) - SUM(COALESCE(r.refund_amount, 0)) с LEFT JOIN из orders в refunds. Если возврат по заказу оформлен двумя платежами, заказ превращается в две строки, и его amount уходит в сумму дважды.Самая дешёвая проверка: до SUM выполнить COUNT() с тем же join и сверить с числом строк до соединения. Не совпало, значит join размножает строки, и возвраты надо свернуть подзапросом, а присоединять уже готовую сумму.Ещё четыре проверки, от фильтров до знаменателя, разобраны в статье на dev.to.


Data Analysis / Big Data
9 Sept, 20:37
Подзапрос в списке колонок пересчитывается для каждой строки витриныВитрина собирается минутами, а в плане Postgres висит узел SubPlan. Внутри max(amount) из payments по payments.user_id = users.id, и он выполняется отдельно для каждой строки внешнего запроса: на 10 млн пользователей это 10 млн обращений к payments.В WHERE так почти не бывает: IN и EXISTS планировщик обычно разворачивает в semi join и проходит payments один раз. Цену задаёт место, где стоит подзапрос, а сами виды подзапросов разбирают на freeCodeCamp.Лечится агрегатом в CTE: сгруппировать payments по user_id один раз и приджойнить LEFT JOIN, тогда вместо SubPlan появится HashAggregate. В Spark план смотреть отдельно: там коррелированные подзапросы допускаются не везде.Прогоните EXPLAIN по медленным витринам и поищите SubPlan: в списке колонок его стоит переписывать, под фильтром он обычно уже развёрнут в join.


Data Analysis / Big Data
9 Sept, 15:25
SQL-запрос доезжает до хранилища набором ключей, и от их формата зависит, будет чтение по ключу или сканКогда план запроса в TiDB или CockroachDB показывает скан, на уровне SQL это уже не объяснить: раскладывает таблицы и строки по парам «ключ-значение» слой ниже, и обычно его не видно.В шестой части серии про учебную базу SaarDB автор пишет этот слой руками: движок хранения у него умеет только ключи и строковые значения, про таблицы и типы колонок он не знает. По шагам: • почему CREATE TABLE и INSERT сводятся к одной операции PUT; • зачем схема таблицы уезжает под служебный ключ с префиксом _schema:; • как уложить структуру со списком колонок и их типами в значение, которое всегда строка; • как из строки собрать ключ, по которому её потом найдут.Свою базу писать не обязательно: понимание, во что превращается таблица в хранилище, объясняет цену предиката не по ключевой колонке.


Data Analysis / Big Data
9 Sept, 11:02
Сильные аналитики 🧠 давно делают для бизнеса больше, чем отчеты и дашборды.Они помогают понять, что происходит, находят причины проблем, проверяют гипотезы и дают руководителям основу для решений. Именно для таких специалистов мы сделали Cortex Challenge — соревнование, где можно показать весь масштаб своих навыков, подход к аналитике и умение превращать данные в бизнес-решения.Вам достанется виртуальная компания с реальной бизнес-проблемой. Данные будут неполными и противоречивыми, важная информация — у занятых сотрудников, а очевидная причина может оказаться лишь симптомом.✅ Ваша задача — разобраться в ситуации, найти настоящую проблему, сформировать решение и защитить его перед экспертами.Для работы у вас будут Cortex и ИИ — инструменты, которые помогут исследовать данные, проверять гипотезы и быстрее двигаться от вопроса к ответу.


Data Analysis / Big Data
9 Sept, 10:13
Q4 не сходится, а человек, который писал пайплайн, уволился два года назадЗнакомый маршрут: grep по ETL-скриптам, обход внешних ключей, вью, которая ссылается на другую вью, а та на таблицу, которую когда-то переименовали. Через час вопросов больше, чем ответов.Задача называется происхождением данных: откуда пришло значение, что от него зависит, через какие преобразования оно прошло и что сломается, если тронуть источник. dbt и Airflow отвечают на это в границах своего графа, а то, что собирается внутри базы, остаётся серым пятном.Отвечать приходится не только финансистам. SOX требует разбирать квартальный отчёт по шагам, GDPR — объяснять логику обработки данных, а BCBS 239 появился, когда регуляторы устали слышать от банков, что источник цифр риска не установить.В блоге Cybertec разбирают, что на этот вопрос отвечает PostgreSQL 19.


Data Analysis / Big Data
8 Sept, 18:21
Трассировки OpenTelemetry можно свернуть в метрику, которая показывает, какой SQL чинить первымЗапрос, вчера укладывавшийся в десятки миллисекунд, сегодня держит витрину минуту, а в трассировках десятки тысяч спанов, и по ним не видно, что просело.Разбор на блоге CNCF предлагает не копить телеметрию, а сворачивать спаны БД в метрики: у спана есть длительность и текст запроса, по нормализованному тексту считается агрегат, и вместо потока событий выходит ряд для дашборда и алерта.Метрика закрывает два вопроса. Оптимизация: ускорение какого запроса даст больше всего, если взвесить длительность на частоту вызовов. Инцидент: какой запрос отклонился от собственной нормы прямо сейчас.SELECT по orders без индекса на customer_id отдаёт 20 мс на 10 тыс. строк и минуты на 10 млн: запрос не менялся, вырос объём. В статье это собрано в лабораторию, повторяемую на своём стеке.


Data Analysis / Big Data
8 Sept, 11:04
Офсетный лаг не скажет, насколько старые данные лежат в вашем озереОн показывает, на сколько сообщений консьюмер отстал от топика, а не возраст данных. При неровном потоке один и тот же лаг означает то минуты, то часы, а SLA на свежесть написан во времени.В Twilio для пайплайнов на Apache Hudi Delta Streamer лаг считают во времени, не трогая продюсеров и консьюмеров: берут последний коммит Hudi в S3, достают из него чекпоинт Kafka, перематывают топик на этот офсет и вычитают время сообщения из текущего.Грабли: в последнем коммите чекпоинта может не быть, если его сделал параллельный легаси-пайплайн. Тогда алгоритм идёт по истории коммитов назад, до ближайшего с метаданными.Офсетный мониторинг это не отменяет: он ловит зависшего консьюмера, а time in queue даёт возраст данных и порог свежести с алертами на каждый пайплайн. Разбор на 5 трлн записей в месяц у InfoQ.


Data Analysis / Big Data
8 Sept, 09:27
Обновление PostgreSQL остановит ваш CDC-пайплайн на wal2json, если не поправить конфиг13 августа вышли PostgreSQL 18.6, 17.11, 16.15, 15.19 и 14.24: они закрывают CVE-2026-6471 (7,2 балла из 10 по шкале опасности). Аккаунт с атрибутом REPLICATION мог передать в CREATE_REPLICATION_SLOT любой путь к библиотеке, а сервер загружал её и выполнял код от имени пользователя ОС. Ошибке 12 лет: она с самого появления логического декодирования в 9.4.Закрыли белым списком: параметр output_plugin_libraries, по умолчанию pgoutput и test_decoding. Любой другой плагин вывода, включая wal2json и decoderbufs, после обновления получает отказ, и декодирование не стартует, пока библиотеку не впишут в список и не перечитают конфиг.Атрибут REPLICATION висит на бэкапах, standby, мониторинге и CDC. Проверьте plugin в pg_replication_slots до апдейта и допишите его в параметр тем же окном обслуживания.


Data Analysis / Big Data
3 May, 22:41
Таблицы для аналитиков в 2026-м: Яндекс 360, Р7 и Google SheetsВопрос инструмента для совместной работы с данными стал сложнее: рынок офисных редакторов за последние год-два заметно перестроился. Появились новые ИИ-возможности прямо в интерфейсе таблиц, изменились условия по on-prem развёртыванию, а доступность облачных сервисов для российских команд остаётся нестабильной.В полном разборе сравниваются три актуальных варианта по форматам, совместной работе, ИИ-ассистентам и интеграциям с аналитическим стеком (BigQuery, gspread, API). Удобно, что авторы свели всё в одну таблицу сравнения.Читать полный разбор.


Data Analysis / Big Data
31 Mar, 13:33
Чем занимается аналитик данных — открытый урок по Python и SQLПриглашаем вас на открытый онлайн-урок Нового технологического университета, где вы увидите, как аналитики работают с данными в реальных задачах.На занятии вы:➡️ поймете, кто такой аналитик данных и чем он занимается ➡️ выполните две практические задачи на Python и SQL, даже если ни разу этого не делали ➡️ разберетесь, стоит ли идти в профессию сейчас, и что будет с рынком IT через 1-3-5 лет ➡️ поймете, как стать аналитиком данных в 2026, даже если вы еще учитесь в ВУЗеУрок подойдет, даже если у вас нет опыта в программировании или аналитике.Спикер — Ева Панкратова, руководитель продуктовой аналитики в М2, ex-Райффайзенбанк.Занятие пройдет онлайн, участие бесплатное. Сразу после


Data Analysis / Big Data
31 Mar, 12:13
Как структура данных диктует стиль кода в SQL и pandasВ аналитике часто кажется, что выбор между оконной функцией и GROUP BY — дело случая. Но исследование решений реальных задач показывает чёткую закономерность: тип данных предопределяет преобладающие конструкции.Временные ряды и задачи типа «самый высокий результат за день» почти всегда приводят к оконным функциям (RANK, LAG). Когда метрика собирается из нескольких таблиц (факты и измерения) — доминируют JOIN + GROUP BY. Задачи на исключения («кто никогда не совершал действие») — это анти-джойны (NOT EXISTS или ~isin). В pandas аналогично: .merge() появляется там, где нужно скомбинировать данные, а .groupby() — на следующем шаге.Понимание этих паттернов позволяет не гадать, а сразу выбирать нужный инструмент, ускоряя написание и отладку кода. Подробности в статье:


Data Analysis / Big Data
5 Mar, 11:16
Победителями премии Тпрогер 🐀становятся...Здесь играет барабанная дробь и интригующая музыка... Вам нужно только выждать драматическую паузу перед объявлением победителей — в каждой номинации он один, и определяется большинством голосов. Готовы?В номинации «Продукт года» золотая мышь достается компании: 🐀NetVision за платформу интеллектуального мониторинга СИМ.В номинации «Облачный продукт года» побеждает компания: 🐀Гравитон с паком виртуализации «Гелиус»Звание «IT-ивент года» вручается компании: 🐀Островок! за О!ХакатонИ в категории «Дизайн года» первое место занимает компания: 🐀AcademiaDev за интерактивную инсталляцию.Каждый ваш лайк, голос влияли на исход премии. Давайте поддержим всех — ставьте




Data Analysis / Big Data
5 Mar, 10:01
Победителями премии Тпрогер 🐀становятся...Здесь играет барабанная дробь и интригующая музыка... Вам нужно только выждать драматическую паузу перед объявлением победителей — в каждой номинации он один, и определяется большинством голосов. Готовы?В номинации «Продукт года» золотая мышь достается компании: 🐀NetVision за платформу интеллектуального мониторинга СИМ.В номинации «Облачный продукт года» побеждает компания: 🐀Гравитон с паком виртуализации «Гелиус»Звание «IT-ивент года» вручается компании: 🐀Островок! за О!ХакатонИ в категории «Дизайн года» первое место занимает компания: 🐀AcademiaDev за интерактивную инсталляцию.Каждый ваш лайк, голос влияли на исход премии. Давайте поддержим всех — ставьте




Data Analysis / Big Data
10 Feb, 10:22
Ну и еще немного про ИИ! 😁Одни компании недолюбливают нейросети за риск утечки конфиденциальной информации. Судя по комменту к предыдущему посту вы тоже от него устали 🤪 Но каким-то образом у разных компаний получается приручить эту химеру и выуживать из нее пользу.Как, например, у этих ребят. Команда хотела облегчить работу коллег и создала то, что стало ключом к корпоративному ИИ. Они хотели доступ к мощным нейросетям, но так, чтобы ни байта данных не вышло за порог компании. И чтобы запускал это не только технарь, но и обычный менеджер.Главный стоппер был предсказуем: как заставить прожорливые модели стабильно работать в облаке под нагрузкой? Решение оказалось элегантным.Это девятый артефакт — для тех, кто побаивается нейросетей, но явно на них облизывается. Покажите вашему начальнику, скажите, что все не так
Data Analysis / Big Data
29 Jan, 13:02
⚪️ Артефакт №2. Категория «Дизайн» ⚪️Дашборд — это скучно до того момента, пока к его визуализации не подключат гигантский экран.Сегодняшняя история о команде, которая превратила обычную статистику посещения фестиваля в генеративное шоу. Их задача звучала как вызов: сделать так, чтобы было невозможно оторвать глаз от дашбордов.Так они создали интерактивную инсталляцию, где посетители, сами того не зная, становились частью цифрового арт-объекта.🤩 Что скрывает этот артефакт? 🤩 🤩 Способ связки 40 потоков с YOLO v8, PostgreSQL и движок визуализации без лагов в один конвейер. 🤩 Задачу дедубликации тысяч JSON-записей от нейросетей. 🤩 Борьбу с «сырыми»
2,370Open in Telegram
Data Analysis / Big Data
28 Jan, 14:16
🔄 Артефакт №1. Категория: «Город» 🔄От кого только не прилетает самокатчикам. Иногда за дело, иногда нет. Не нам судить, но мы обсудим, что делать, например, с явными нарушителями? Как их контролировать, если операторы кикшеринга не пускают в свои данные? Закрывать глаза на хаос на тротуарах или тотально запрещать?Мы получили кейс, где за 4 месяца команда из 7 человек создала платформу мониторинга, которая фиксирует самокатовские нарушения. Их задачей было сделать инструмент для структурирования данных, чтобы чиновники и операторы нашли общий язык.🤩 Что скрывает этот артефакт? 🤩 🤩 Смекалистый метод охоты за данными, когда реальные видео с камер недоступны. 🤩 Принципы, которые


Data Analysis / Big Data
27 Jan, 13:34
Сравнительный обзор механизмов polling в Kafka и Pub/Sub в RabbitMQ: особенности и области примененияДрузья, привет! Меня зовут Андрей Комягин, я CTO компании STM Labs. Мы занимаемся разработкой очень больших распределённых высоконагруженных систем для различных отраслей, включая налоговое администрирование, телеком, track & trace и многие другие. В своих проектах и архитектурах мы широко применяем open-source-решения, включая брокеры сообщений, такие как Kafka и RabbitMQ.Совсем недавно я выступил на конференции HighLoad++ Genesis 2025: рассказал про анатомию каждого из этих брокеров, сравнил их по набору критериев и оценил результаты их нагрузочного тестирования. А теперь решил выпустить этот материал в виде статьи в блоге, чтобы читатели Хабра тоже смогли изучить нюансы и понять, на какие задачи заточен каждый из брокеров. Итак, поехали!О брокере Apache Kafka я очень подробно
Data Analysis / Big Data
27 Jan, 13:27
Устраиваем свой Data QA с PyTest и фикстурамиРабочий подход к тестированию трансформации данных в ETL-процессах. На примере Python-проекта с pytest, allure и psycopg2 демонстрируется, как автоматизировать создание и наполнение таблиц, хранить схемы и данные, а затем сравнивать результат.Читать: «Устраиваем свой Data QA с PyTest и фикстурами»#ru@big_data_analysis | Другие наши каналы
Data Analysis / Big Data
27 Jan, 13:27
10 библиотек Python, которые меняют карьеру10 библиотек Python, которые помогут прокачаться в аналитике, ML и разработке. Как они работают и почему меняют карьеру.Читать: «10 библиотек Python, которые меняют карьеру»#ru@big_data_analysis | Другие наши каналы
Data Analysis / Big Data
27 Jan, 13:26
Язык Julia: что это и почему он популярен в научных вычисленияхЧто такое язык Julia. Показываем сравнение языка Джулия с другими. Рассматриваем преимущества и основные нюансы ✔ TprogerЧитать: «Язык Julia: что это и почему он популярен в научных вычислениях»#ru@big_data_analysis | Другие наши каналы
Related Channels
Other channels in the same section of the catalogue.
