Последние посты

Дата Инженер Лаб | Артём Подвальный
20 сент., 15:32
Как вкатиться в Data Engineering с нуля? 🗺Самая частая ошибка новичков- пытаться сразу выучить весь стекPython, SQL, Spark, Kafka, Airflow, Docker, Kubernetes… Через несколько месяцев человек знает десятки названий, но не может самостоятельно собрать даже простой пайплайн 🥸Поэтому идти лучше поэтапно⬇️1️⃣Сначала базаНа старте нужны:📍Python: функции, структуры данных, файлы, исключения и основы ООП 📍SQL: SELECT, JOIN, группировки и агрегатные функции 📍базы данных: таблицы, ключи, индексы и транзакции2️⃣Затем пайплайныЗдесь уже появляются оконные функции, Docker, Airflow, хранилища данных, моделирование,


Дата Инженер Лаб | Артём Подвальный
17 сент., 09:20
CDC и Debezium: как передавать изменения, а не выгружать всю таблицу заново?Допустим, заказы интернет-магазина 🟧 хранятся в MySQL, а отчёты строятся в ClickHouse🏠. Данные между ними нужно регулярно обновлять.Можно каждый раз копировать всю таблицу. Но с ростом данных это занимает больше времени и нагружает источник.Здесь пригодится Debezium — инструмент, который отслеживает изменения в базе и передаёт их дальше. Такой подход называется CDC — Change Data CaptureКак он понимает, что изменилось? 🤔В MySQL есть binlog — журнал🗂, в котором фиксируются изменения. При соответствующей настройке Debezium читает его и формирует события:📍появился заказ — добавлена запись; 📍статус поменял


Дата Инженер Лаб | Артём Подвальный
13 сент., 14:24
Тебе тоже кажется, что забываешь быстрее, чем учишь?Недавно менти поделился проблемой: пока учит тему, всё понятно. Через месяц возвращается, многое уже забыл.Думаю всем знакомо…☹️Полез почитать на эту тему. Много полезного нашёл в книге «Запомнить всё» Питера Брауна и соавторов. Некоторые приёмы знакомы ещё со школы и универа🤔 . Сам так делал, особо не задумываясь, почему помогает)Простое перечитывание часто даёт обманчивое ощущение, что ты всё знаешь. 🤥Открываешь статью третий раз, узнаёшь формулировки. Но закрываешь её и своими словами объяснить уже сложно.🥺Припоминание работает иначе: ты пытаешься самостоятельно восстановить изученное. Эти попытки помогают закреплять знания и находить пробелы.Вот как это можно понемногу добавлять в


Дата Инженер Лаб | Артём Подвальный
10 сент., 12:25
Мини гайд по ИИ-агентамАгент снова забыл условия задачи, полез менять лишнее или написал готово, хотя код не работает? 😓Начать стоит с того, как организована работа.Вот несколько вещей, которые полезно использовать👇1️⃣Давай конкретные вводныеБаза, но многие этим пренебрегают… Для разбора ошибки пригодятся код задачи, нужный фрагмент логов и описание ожидаемого результата.Переписку по пяти разным проектам лучше не смешивать. Для новой, несвязанной задачи открывай отдельный чат 🤝2️⃣Сохрани правила проектаГде лежат исходники, как запускать проверки, какие файлы нельзя менять. Это можно записать в инструкции проекта 📩, которые поддерживает твой инструмент.


Дата Инженер Лаб | Артём Подвальный
3 сент., 17:41
До конца года 4 месяца. Что можно успеть? 📖Лето закончили с сильными результатами: 13 менти получили офферы, а суммарно ребятам поступило 20 предложений о работе 🔥Многие ребята получили сразу несколько предложений, а рекорды лета: 5 финальных офферов у одного менти и 7 предофферов у другого 🏆В итоге ребята могли выбирать между компаниями, условиями и зарплатой. Дата инженеры сейчас нарасхват!Осень хороший момент, чтобы наконец заняться подготовкой, которую многие откладывали всё лето😶За последние месяцы программа менторства сильно улучшилась! ⚙️В закрытой базе появилось много новых видео по Spark, Kafka, Iceberg, Greenplum и другим инструментам. В них не только теория, но и разборы на примерах из реальных


Дата Инженер Лаб | Артём Подвальный
30 авг., 12:22
Что такое векторные базы данных?Представим, что пользователь пишет📝:«Не проходит оплата»А нужная инструкция называется:«Ошибка при проведении платежа»Слова разные, поэтому обычный поиск может ничего не найти. Но смысл у запросов похожий - именно это учитывает векторный поиск.Как он работает🤔Специальная модель превращает каждый текст в набор чисел - вектор. Чем ближе смысл двух текстов, тем больше похожи их векторы.Эти векторы сохраняются в специальной базе. Примеры таких баз: Qdrant, Milvus, Weaviate, pgvector — дополнение для PostgreSQL.В базе обычно хранятся: ❗️вектор текста


Дата Инженер Лаб | Артём Подвальный
23 авг., 18:34
Как рассказывать о своём опыте на собеседовании 🎙Просто перечислить Kafka, Spark и ClickHouse недостаточно. Интервьюеру важно понять, какую задачу ты решал, что сделал лично и почему выбрал такой подход.Хороший рассказ выглядит так:1️⃣Какая была проблема 2️⃣За что отвечал лично ты 3️⃣Почему выбрали этот стек 4️⃣С какими сложностями столкнулись 5️⃣Какой получили результатНо мало просто подготовить красивый текст. Нужно понимать каждую его часть.Если говоришь, что работал с Kafka, будь готов объяснить:⏺как выбирали количество партиций ⏺что происходило при падении consumer ⏺как контроли


Дата Инженер Лаб | Артём Подвальный
18 авг., 18:08
ИИ в проде: что агенты уже могут делать в Data EngineeringПро ИИ-агентов сейчас много шума. Иногда агентом называют обычный чат с LLM 😺, хотя разница довольно простая.Чат отвечает. Агент может сам сходить за информацией и что-то сделать 🤖Например, ночью упал DAG. Агент открывает логи, смотрит прошлые запуски, проверяет схему и пытается понять, где всё сломалось. После этого может предложить retry, backfill или завести инцидент.То есть это уже не просто скинь ошибку в ChatGPT. Агент получает доступ к Airflow, мониторингу, каталогу данных и другим инструментам.🧐Звучит удобно, но сразу появляется вопрос: а стоит ли давать ему самому что-то менять в проде?Прочитать логи и найти подозрительное место — нормально. Удалить данные, изменить схему или запустить большой backfill без


Дата Инженер Лаб | Артём Подвальный
16 авг., 17:07
С нуля в Data Engineering: Путь до оффера в BigTech 🚀Записал интервью со своим учеником. Это честный разговор о том, как реально сменить профессию и устроиться дата инженером в 2026 году.Важно: Личность и голос Антона изменены для сохранения его анонимности на текущем месте работы. Все результаты — подлинные, верифицированные отзывы есть в канале.О чем видео: ⏺Сколько времени занял переход с нуля до оффера ⏺Как мы прорабатывали легенду для резюме ⏺Страхи на первых собесах ⏺Совет тем, кто думает вкатываться📺Смотреть:YOUTUBERUTUBE


Дата Инженер Лаб | Артём Подвальный
14 авг., 09:52
❗️Вопрос с собеса в BigTech:«Мы удвоили количество executor ов, но Spark джоба не ускорилась. Почему?»Это классическая ловушка для тех, кто пытается лечить любую проблему масштабированием 🥸У тебя есть медленный pipeline. Ты увеличиваешь количество executor ов в 2 раза, перезапускаешь job, а время выполнения остаётся прежним или даже растёт.Что происходит?1️⃣Data skew 🥴Если один ключ содержит 90% данных, все связанные с ним записи могут попасть в одну shuffle-partition. Один task будет работать 20 минут, пока остальные завершатся за секунды.В таком случае дополнительные executor’ы не помогут: job ждёт самую медленную task 🐌В Spark UI сравни Max и Median по длительности tasks и объёму Shuffle Read .Большой


Дата Инженер Лаб | Артём Подвальный
8 авг., 16:54
Как я стал дата-инженером?Хочу поделиться своей историей перехода в мир дата-инженерии. Возможно, кого-то это вдохновит и поможет сделать первые шаги 🤝💡Изначально меня привлекал Data Science с точки зрения ML - обучение моделей, участие в хакатонах по компьютерному зрению, ранжированию и NLP 🤖. Я активно изучал ML, экспериментировал и набирался опыта.Но всё изменилось, когда я устроился в геномный центр 🧬Именно там я впервые столкнулся с инженерной стороной данных. Вокруг были свои форматы, специфичные инструменты и оркестраторы, разработанные специально для работы с геномными данными. Объёмы данных были по-настоящему впечатляющими: более 10 000 человеческих геномов (каждый весом около 100 ГБ), хранившихся на ленточных хранилищахТам я начал писать свои первые пайплайны,LeetCodeLeetCode - The World's Leading Online Programming Learning PlatformLevel up your coding skills and quickly land a job. This is the best place to expand your knowledge and get prepared for your next interview.
Дата Инженер Лаб | Артём Подвальный
5 авг., 15:10
Собес в бигтех: когда теория уже не спасаетНа собесах в классные компании на интервью редко спрашивают только «что такое ETL?». Чаще дают кейс с прода и смотрят, как ты думаешь🧐: где риск дублей, что сломается при ретрае, как найти узкое место и чем лечить проблему.💡Собрал 5 интересных и реальных вопросов, на которых проверяют реальный опыт:1️⃣Airflow: задача упала на середине загрузки — что делать?Не просто Clear . Сначала проверь идемпотентность: staging, UPSERT , перезапись партиции, атомарный commit. Повторный запуск не должен портить данные.🔗 Статья про идемпотентность в Airflow2️⃣Spark тормозит, хотя ресурсов в кластере много — с чего начнёшь?С Spark UI. Ищи shuffle , data skew , лишние мелкие файлы и


Дата Инженер Лаб | Артём Подвальный
1 авг., 09:58
🎉Июль стал рекордным месяцем по количеству офферов!За этот месяц 9 офферов: 🔥 5 - с нуля в Data Engineering 🚀 4 - с коммерческим опытомПричем компании самые разные: от крупных бигтехов до иностранных компаний и стартапов.Это еще раз подтверждает: рынок Data Engineer жив 🎥📊Среднее время до оффера: 🤩С нуля - 5,5 месяцев 🤩С опытом - 3 месяцаОчень рад видеть такие результаты. Для меня это показатель того, что правильная стратегия подготовки работает🔝По вопросам менторства пишите: @ampodvalniy 👊




Дата Инженер Лаб | Артём Подвальный
28 июл., 15:40
Flink vs Spark Streaming: что выбрать для Data LakehouseЕсли совсем просто, Flink и Spark Streaming - это инструменты, которые обрабатывают данные на лету➡️То есть не ждут конца дня, чтобы всё пересчитать, а работают с событиями почти сразу, как только они появляются🌟🐿Что делает Flink:Flink нужен там, где данные идут непрерывным потоком: из Kafka, из логов, из CDC, из событий приложения. Он умеет сразу принимать эти события, обрабатывать их и писать результат дальше, например, в Iceberg, Hudi или Delta Lake.Проще говоря, Flink - это потоковый двигатель. Он хорошо подходит для задач, где важна свежесть данных: почти мгновенные обновления, подсчёты по окнам времени, дедупликация, обработка изменений из баз.Что делает Spark Streaming⭐Spark Strea


Дата Инженер Лаб | Артём Подвальный
23 июл., 14:02
Зачем нужен dbt, если есть Spark и ClickHouse?Многие до сих пор путают dbt (Data Build Tool) с вычислительными движками. Давайте сразу: dbt сам ничего не считает🚨Он не заменяет Spark, Trino или ClickHouse. dbt — это инструмент для организации трансформаций внутри вашего хранилища🖥Он превращает разрозненные SQL-скрипты в полноценный инженерный проект с тестами, документацией и зависимостями.В чем суть?Без dbt вы сами следите за тем, в каком порядке запускать скрипты. С dbt вы просто описываете модели, а инструмент сам строит DAG.Например:stg_users → stg_orders → mart_salesЗачем нужен dbt 🤔dbt сам поймет, что витринаpark и ClickHoне соберется, пока не готовы стейджинги, и запустит всё в правильной последовательности.Что он дает на практике:


Дата Инженер Лаб | Артём Подвальный
18 июл., 15:50
Что спрашивают в Бигтехе: вопросы по Iceberg и Trino из закрытого каналаВ вакансиях всё чаще мелькает связка Iceberg + Trino + S3. Тренд понятный: многие компании сейчас мигрируют с классических СУБД на объектные хранилища и ищут инженеров под эти задачи🚨Если планируете выходить на рынок, к вопросам по этому стеку нужно быть готовыми. Собрал список того, что реально спрашивают на собесах — инсайды от ребят из нашего закрытого канала.Некоторые вопросы требуют понимания того, как это работает в бою, поэтому если опыта нет — придется включать фантазию и строить гипотезы 😅 Попробуйте ответить на них, чтобы подсветить свои пробелы.Для тех, кто совсем не в теме, сначала прочитайте базу: 🗻 Iceberg 🚀 Trino 📁 S3Список


Дата Инженер Лаб | Артём Подвальный
15 июл., 18:05
13 параметров Spark, которые стоит знать перед собеседованиемНадеюсь все правильно ответили в предыдущем опросе, но в любом случае советую освежить память или узнать что-то новое🔥Перечислил самые популярные параметры Spark, которые реально встречается в конфигах и на проде💦 Ресурсыspark.executor.instances — сколько executors поднимется для приложения.spark.executor.cores — сколько ядер выделяем на один executor.spark.executor.memory — heap-память executor’а.spark.executor.memoryOverhead — память вне heap: Python worker’ы, native memory, shuffle buffers и другие внехиповые расходы.spark.driver.memory / spark.driver.cores — ресурсы драйвера.


Дата Инженер Лаб | Артём Подвальный
15 июл., 10:04

Дата Инженер Лаб | Артём Подвальный
15 июл., 10:04
⭐️Вспомним параметры Spark?1,160Открыть в Telegram
Дата Инженер Лаб | Артём Подвальный
9 июл., 13:35изменён
Рынок в Data Engineering, лето 2026??⚙️Рынок изменился, и это факт. Но важно понимать: он не умер. За последние две недели 5 моих учеников уже получили офферы 👊, поэтому вакансии есть, но конкуренция стала заметно выше.Если раньше для оффера на Junior/Middle позицию достаточно было знать теорию и пару инструментов, то в 2026 году требования взлетели. Сейчас на собеседованиях мало просто понимать технологии. От тебя ждут глубоких деталей и умения рассказать, как ты решал настоящие проблемы в продакшене.Мое менторство — это не курс с лекциями, а полноценный цикл подготовки, где я делюсь своим опытом и ресурсами, чтобы сделать из тебя инженера, который не развалится под давлением на интервью.Как мы будем идти к результату🥇🥇Мы не просто учим

