Latest posts

дата инженеретта
10 Sept, 12:22
26 сентября иду на Data Driven от Яндекса — конференции в этом году исполняется 10 лет, и это чувствуется по размаху программы.Тема — AI-first-аналитика: как AI меняет саму профессию, а не просто добавляет ещё один инструмент в стек. Два трека докладов: про AI-инструменты, которые реально экономят время, про генеративный AI в работе с данными и про то, какой будет роль аналитика через пару лет.Из спикеров особенно интересны — Роман Халкечев (CDO Поисковых сервисов и ИИ Яндекса) — про то, как AI переписывает правила игры при работе с данными, Александр Самусенко (CDO Alice AI и Умных устройств) — про построение аналитики под эффективное использование AI-инструментов и Максим Стаценко с супер-темой, как собрать агента-аналитика, которому можно доверять.Ещё будет Random Coffee с топовыми аналитиками, разбор резюме и карьерные консультации, а вечером — афтерпати в честь дня рождения
дата инженеретта
2 Sept, 13:34
Iceberg — это внезапный бум или планомерная подготовка?Заметили, как с определенного момента стало много айсберга в DE? Хотя я сейчас зашла чекнуть вакансии на hh, и iceberg упоминается в 68 из 455 дата инженерских вакансий - что около 15%. Но у меня есть стойкое ощущение, что все про него говорят, всем он нужен и везде его используют🐱 Последний раз я обращала на это внимание в марте. Тогда мне казалось, что компании только-только переходят на лейкхаус и начали строить его 1 или 2 года назад. Но на самом деле это было гораздо раньшеНедавно я узнала, что в Т-банке развитие в сторону лейкхауса началось еще тогда, когда меня не было в де🥺 Да и MWS не смогли бы выкатить свою лейкхаус-платформу в середине 2025 года, если бы не стартовали еще тогда☕️ Мы в Сбере тоже обсуждали табличные
дата инженеретта
25 Aug, 12:17
Как забытый ON CLUSTER поставил меня в тупикЯ создала таблицу ReplicatedReplacingMergeTree, потом переделала на обычный ReplicatedMergeTree. Дропнула таблицы, но тупо забыла ON CLUSTER, и вот что из этого вышло🫤 Запускаю загрузку, она падает, я чищу табличку и гружу заново. Казалось бы, проблемы больше нет? Сверяюсь по каунтам - сильно отличается. Снова перезагружаю - вообще другие каунты стали. Что происходит? Смотрю инфу по репликам:SELECT hostName(), pid, count() FROM clusterAllReplicas('default', schema.table) GROUP BY hostName(), pid ORDER BY pid, hostName();На двух хостах сходится, на третьем сильно меньше данных и вообще нет большого куска, при этом все цифры разъезжаются с источником…Я делаю truncate - а с третьего хоста данные вообще не удаляются. Делаю truncate sync - снова ничего не происходит. SYSTEM SYNC REPLICA schema.table - то
дата инженеретта
20 Aug, 12:21
В начале лета я рассказывала, как начала проходить курс по алгосам, сейчас делюсь с вами промежуточными впечатлениями🙂👩💻 Первый месяц я активно садилась за задачи раз или два в неделю - этого было вполне достаточно. Сам смысл курса подается не как "пока самостоятельно не решите 100 задач на литкоде, из-за компа не выходите", а как "сначала смотрим объяснение и решение, потом идем кодить, если не запомнили - смотрим еще раз и повторяем"В рамках одного 10-минутного видоса разбирается одна задача, иногда с несколькими вариантами решения, в конце анализируется сложность по времени и памяти. Что я заметила - когда мне голосом объясняют суть задачи, мне становится в разы понятнее. Поэтому мой типичный флоу занятий такой: я смотрю 1-2 минутки с объяснением условия, иду решать сама, потом досматриваюС какого-то моментаTelegramдата инженереттаНа пути к гуру алгосов 01.06 стартует новый поток курса от Глеба Михайлова, и я на него иду! Алгосы — это точно мое слабое место, и я прямо в превкушении почувствовать «азарт охотника, а не ужас жертвы»🐆 Я уже зарегалась на платформе, добавилась в чатик…
дата инженеретта
18 Aug, 12:23
Походу салон нанял себе дата аналитика🤭Или можно подключить аналитику у самого сервиса по записи?В любом случае я теперь переживаю, что, если не запишусь сейчас, кому-то на дейли придется объяснять просадку retention rate😕@data_engineerette


дата инженеретта
12 Aug, 07:02
Анти чек-лист работы в DEПо ходу жизни собрала список того, что мне не очень нравится в работе. И вот что в него вошло:1️⃣КанбанУ вас нет пула задач на ближайшее время. К вам могут приходить аналитики и менеджеры с адхоками, которым нужны отчеты еще вчера. Вы не можете спокойно распределить время на свои задачи. В канбане будут всегда прилетать новые задачи, которые нужно взять, как только закончите предыдущую. И вместе с этим постоянное ощущение напряга2️⃣ Проектная работаПроекты заканчиваются. Допустим, он длится год, потом вам обещают найти другой. А если проект свернут раньше года? А если другой проект не найдется?3️⃣ Срочный трудовой договорОн может быть короче даже самого проекта. А если договор не продлят? Не проще ли сразу найти нормальное место и не жить в страхе от


дата инженеретта
6 Aug, 04:43
Ребят, а тут есть такие, кто идет на дата конфу в Лондоне?https://www.bigdataldn.comОна бесплатная, нужно просто прилететь🙂 По темам очень похоже: лейкхаус, AI агенты, data fabric, data governance. И сессии от топовых компаний: Databricks, Microsoft, Google, JetBrains, dbt Labs, Snowflake…Я вот зарегалась и даже на некоторое время задумалась над подачей визы🤭 Но потом как вспомнила, что ИМЕННО В ЭТИ ДАТЫ у меня конфа в МосквеТак что ищу шпиониро😎Полную программу конференции можно хотя бы полистать тут@data_engineerette


дата инженеретта
30 Jul, 11:23
пупупу у меня всего 9 с половиной😚


дата инженеретта
24 Jul, 06:55
Отгадайте с первой попытки, за какой это было период и что случилось😁😁@data_engineerette


дата инженеретта
14 Jul, 14:46
Сеньорские вопросы🤵 Чем круче вы становитесь, чем в более highload сторону вы идете, чем быстрее развиваются ллмки, тем вопросики к вам становятся все серьезнееСобрала для вас подборку таких вопросов по технологиям:✨ SparkИз чего состоит executor memory? Что такое spark.memory.storageFraction? В чем разница между Sort-Merge Join и Broadcast на маленькой таблице? Каким образом уменьшить количество шафла? Зачем нужен data spill? Как работает AQE? Какие проблемы спарка в кубере?🧊IcebergКак айсберг работает с параллельным изменением одного файла и нескольких? Почему при записи из старой таблицы в новую в айсберге джоба бежит очень долго?
дата инженеретта
9 Jul, 06:16
Всем привет! Возвращаюсь на связь, на прошлой неделе была в отпуске😌А пока на нашем рынке я такого не видела, но на зарубежном после HR-интервью присылается очень подробное и информативное саммари: о чем говорили, что нужно спросить в следующий раз, ваши плюсы/минусы, соответствие вакансии@data_engineerette


дата инженеретта
24 Jun, 16:42
Кажется, я уработалась😕Это моя первая мысль, как только я села в такси



дата инженеретта
23 Jun, 07:05
Раскрываю тайнуНаверняка у многих был такой момент, что вы заходите в YARN, находите Hive-запрос, хотите в него провалиться, но Tez UI недоступен?Теперь вы знаете, как он выглядит@data_engineerette


дата инженеретта
17 Jun, 06:50
Data + AI🍿 Вчера-сегодня проходит Data + AI Summit от Databricks. Основная суть — как работать с данными в эру AI, реклама собственных разработок, интервью с партнерами и крупными пользователями, кейсы применения сервисовМеня больше всего поразило — как они красиво говорят, у них такая чистая четкая речь и акцент, как на аудировании😍 И больше 30к людей в офлайне!!Есть очень много интересных моментов, которые я пометила себе:🤩Аннонсировали Lakehouse//RT на собственном движке Reyden, который возвращает результат на огромном объеме данных за мс и не требует перекладки данных в отдельную бд под дэши (красивые графички тут) ✨✨🤩Обсуждали Lakebase — это постгря как движок над s3. Чтобы




дата инженеретта
16 Jun, 11:08
Hive vs HMSHMS - Hive MetastoreЯ долгое время вообще не знала про существование HMS. Для меня HMS и Hive шли неразрывно, и я не отличала одно от другого. Я же такая не одна, да?🌸Но в один момент до меня дошло, что:🤩Hive - это движок, который через синтаксис SQL (HiveQL) умеет ходить к данным. Мы пишем запросы как будто в обычной бд, но они становятся MapReduce/Tez/Spark задачами и ходят в файлики🤩HMS - это каталог метаданных: схема таблиц, пути к файлам, типы данных, партиции и т.д. Ему для работы нужна бд. Чаще всего это PostgreSQL, MySQLДля работы Hive обязательно нужен HMS А вот сам HMS может использоваться и отдельно - с тем же Spark, Trino, Impala🧊В контексте Iceberg мы используем HMS как технический каталог. Например, чтобы понимать, что таблице db.ordersTelegramдата инженереттаРазбираемся в каталогах Начинаем понедельник с распутывания клубочка🧶 Концепций каталога развелось столько, что я сама уже запуталась, что есть что) Давайте вместе разложим по полочкам Трино Каталог - это конфиги для подключения к разным источникам данных…
дата инженеретта
11 Jun, 07:05
AI-эра тех собесов💻 Теперь вместе с sql/python-задачками на тех собесе могут дать создание мини-проекта за 20 минутРазрешается использовать все, что угодно, любые ллм. (Только подумайте над тем, что будет работать, когда вы на созвоне на внутренней платформе.) Есть только одно условие — шерить экранПримеры заданий➡️Для де: написать ddl таблиц, sql-запросы по сборке витрин, несколько дагов➡️Для разраба: придумать архитектуру микросервиса и реализовать его➡️Разобраться в коде и найти багиСгенерили, а дальше?🙂 Интервьюеры могут сами пока не до конца понимать, что делать после генерации кода) Они просто сидят и смотрят, как ты будешь разбираться, что происходит, просят внести правки или объяснить кусок кодаПок
дата инженеретта
8 Jun, 12:40
ClickOpsМне тут пришло в голову покопаться в сервисах AWS и поделать какие-нибудь лабы. На ютубе довольно много видосов от индусов (и не только) на эту тему, я в итоге решила посмотреть вот этот 4х-часовой туториал с пет-проектом🎙 Там парень очень понятно рассказывает про теорию и сервисы, показывает, как что делать. К акценту надо привыкнуть, но вроде норм) Говорит он супер быстро, как будто на x1.5 смотришь. Одна из фраз, которая красной линией проходит по видосу:Сейчас никто не пишет код сам. Если вы хотите что-то реализовать или столкнулись с проблемой — идите к ChatGPTЕще сайтец у него есть полезный, там очень много инфы собрано💻 В чем суть проекта? Взять данные из файлов и API, залить в S3, переложить по слоям, добавить dq, настроить алерты, собрать витрину и поставить на расписание. Используя тех стек


дата инженеретта
4 Jun, 15:40
Когда никто не понимает, как делать задачу😂


дата инженеретта
1 Jun, 15:52
Случайно замедлили все загрузкиНебольшая история о том, как можно ухудшить состояние кластера, не добавив и строчки кода😁ПредысторияУ нас в airflow есть много дагов, которые качают данные из бд. Чтобы не положить базу, мы используем пулы, которые ограничивают количество подключенийКак-то мы реализовали новый тип загрузки и, как порядочные разрабы, про пулы тоже не забыли. Долгое время данные грузились, все работало — с этой стороны не было проблем. Но однажды к нам пришел аналитик и спросил, почему таски висят в статусе scheduled по несколько часов. И вот тогда мы поняли 😁ПроблемаТаска-загрузчик находилась в одной таск-группе вместе с другими легковесными тасочками. И они все наследовали одни и те же значения! Получается, что таске передавалось 100500 слотов, даже если она вообще не ходила в базу
дата инженеретта
28 May, 12:00
На пути к гуру алгосов01.06 стартует новый поток курса от Глеба Михайлова, и я на него иду! Алгосы — это точно мое слабое место, и я прямо в превкушении почувствовать «азарт охотника, а не ужас жертвы»🐆Я уже зарегалась на платформе, добавилась в чатик и посмотрела орг материалы — какой должен быть подход к обучению, нужно ли быть перфекционистом и как трекать свой прогрессКурс разбит на 10 спринтов вплоть до 11.10. И ожидается, что мы должны уделять время на задачи 5 дней в неделю целое лето 😭 😭Скоро я эволюционирую до всезнающего леопарда, ну, а пока я — маленькая птичка, которая полетела разведывать остров алгоритмов🐦@data_engineeretteleopard.schoolКурс по алгоритмам с Глебом Михайловым50 часов видео, 241 задача с LeetCode, 500+ студентов.
Related Channels
Other channels in the same section of the catalogue.
