gram news
DataEng channel avatar

DataEng

@dataeng

Data Engineering & Distributed Systems Contact @adilkhash

ProjectsRUProgramming

4,390subscribers

Open the Channel

Latest posts

  • DataEng

    23 Aug, 16:45

    Официальная документация по Python теперь доступна на русском языке: https://blog.python.org/2026/08/the-python-documentation-is-now-available-in-russian/
    Python InsiderThe Python documentation is now available in Russian! | Python InsiderThe official blog of the Python core development team.
    1,230204Open in Telegram
  • DataEng

    20 Jul, 07:04

    PostgreSQL 18 изнутриPostgres Pro выпустили новую версию книги про устройство PostgreSQL: PostgreSQL 18 изнутри В настоящем издании учтены замечания читателей и исправлены опечатки, а также отражены такие новинки версии PostgreSQL 18, как поддержка асинхронного ввода-вывода, изменения в настройке автоочистки и появление оптимизации пропуска. Скачать по ссылке.
    2,350104Open in Telegram
  • DataEng

    16 Jul, 12:11

    На канале Елизаветы Осетинской вышло интересное интервью с создателем ClickHouse Алексеем Миловидовым: https://www.youtube.com/watch?v=FSGhaMmqWTA
    YouTube$15 млрд после «Яндекса»: как Алексей Миловидов построил ClickHouseНАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ ЕЛИЗАВЕТОЙ НИКОЛАЕВНОЙ ОСЕТИНСКОЙ ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА ЕЛИЗАВЕТЫ НИКОЛАЕВНЫ ОСЕТИНСКОЙ 18+ IT-Регата — парусные гонки, нетворкинг и перезагрузка для…
    2,60021Open in Telegram
  • DataEng

    30 Apr, 06:46

    PostgreSQL 16: Оптимизация запросов 🖥Вчера случайно заметил, что на Postgres Pro появилась новая книга PostgreSQL 16: Оптимизация запросов.Книга основана на курсе лекций про оптимизацию, который, к слову, также доступен бесплатно.Понравилось, что книга небольшая и без лишней воды, сразу приступает к делу без длительных прелюдий и философских размышлений.Рекомендую 🍻
    4,510file317Open in Telegram
  • DataEng

    29 Apr, 09:53

    Эффективно управлять сложностью можно через абстракции. Например, через практики внедрения дизайн-паттернов, DDD, выбор более высокоуровневых технологий.Расширяемость Требования к работе приложений меняются, а значит и оно само должно меняться. Чтобы внесение изменений не превратились в страшный сон необходимо постоянно пересматривать организацию кода, закрывать технический долг, внедрять непрерывное тестирование через практики TDD, XP. Чем проще вносить изменения в систему тем выше её расширяемость и тем ниже связность между её частями.
    3,28082Open in Telegram
  • DataEng

    29 Apr, 09:53

    Отказоустойчивость железа достигается через добавление избыточных компонентов, например, в системе может быть несколько жестких дисков, подключенных в режиме RAID-массива. В случае распределённых систем, запросы могут был равномерно распределены между несколькими независимыми машинами внутри дата-центра. Случается и так, что требуется отказоустойчивость на уровне дата-центра, тогда машины распределяют по нескольким физически независимым точкам (например, разные регионы AWS). Важно придерживаться здравого смысла и понимать какого уровня отказоустойчивости вам будет достаточно.Отказоустойчивость кода чуть сложнее. В первую очередь потому что один и тот же код может исполняться на большом пуле физически независимых друг от друга машин. Одна и та же ошибка в коде может автоматически попадать на все узлы сразу. Универсальных рецептов как избавиться от таких проблем нет, необходимо повышать
    2,45082Open in Telegram
  • DataEng

    29 Apr, 09:53

    Designing Data-Intensive ApplicationsГлава 2. Defining Nonfunctional RequirementsВторая глава книги посвящена нефункциональным требованиям к разрабатываемым нами системам. Под нефункциональными требованиями автор подразумевает:- Производительность (Performance) - Надёжность (Reliability) и отказоустойчивость (Fault Tolerance) - Масштабирование (Scalability) - Поддержка (Maintainability)Система может быть полностью корректна с точки зрения функциональных (т.н. бизнес) требований, но неудобна в использования из-за проблем с надёжностью (потеря данных), производительностью (частые “зависания” из-за нагрузки). Поэтому нефункциональным требованиям также необходимо уделять внимание.Мартин во второй главе книги разбирает пример ленты из соцсети. Как корректная с т.з. функционала фича может быть абсолютно неюзабельна с точки зрения производительности при росте числа пользователей и
    1,50094Open in Telegram
  • DataEng

    22 Apr, 16:51

    Ребят, всем привет!Я не забыл про книгу, скоро будет конспект по второй главе (был перерыв). А пока я пишу конспект, то предлагаю вам насладиться подкастом с автором книги Designing Data-Intensive Applications Martin Kleppmann у Gergely Orosz — Designing Data-intensive Applications with Martin Kleppmann
    YouTubeDesigning Data-intensive Applications with Martin KleppmannMartin Kleppmann is a researcher and the author of Designing Data-Intensive Applications, one of the most influential books on modern distributed systems. As of this month, the second, heavily updated edition of the book is out. In this episode of Pragmatic…
    2,480144Open in Telegram
  • DataEng

    16 Mar, 04:52

    2,840poll1Open in Telegram
  • DataEng

    6 Mar, 07:04

    Mastering PostgreSQLSupabase и Manning Publications выпустили бесплатную книгу про PostgreSQL.107 страниц концентрированной информации про самые популярные темы этой замечательной базы данных. Например, я не знал про существование отдельного типа данных для хранения денег — MONEY. Как то так получилось, что не попадался он мне на глаза.Книга поделена на 4 части:— Modern SQL — Postgres for Full-Text Search (FTS) — Improper Data Type Usage — Table & Index MistakesСкачать книгу можно в комментариях к посту.
    Image from a post by DataEngImage from a post by DataEng
    3,5601911Open in Telegram
  • DataEng

    5 Mar, 07:01

    Cloud vs Self-HostedВечная дилемма что выбрать: использовать облачные сервисы или всё развернуть на своих серверах. Это снова вопрос компромиссов. У каждого подхода есть свои плюсы и минусы. Можно комбинировать два подхода и не уходить в крайности. Например, использовать виртуальную машину на AWS на которой хостить базу данных вместо использования managed-решения. Например, self-hosted PostgreSQL вместо Amazon RDS.Облачные сервисы избавляют команду от операционного управления, например, не нужно самостоятельно следить за обновлениями, патчами безопасности или высокой доступностью тех или иных сервисов. Порой вам даже не нужно думать о масштабировании, за вас это делает облачный провайдер. Взамен вы платите более высокую цену, получаете менее гибкий сервис и возможный vendor lock. Например, управляемый Apache Airflow от AWS это черный ящик и если что-то идёт не так, то сложно понять
    2,5501444Open in Telegram
  • DataEng

    5 Mar, 07:01

    Данные и законодательствоС развитием GDPR, CCPA, ,EU AI Act и прочих законодательных норм и правил по персональным данным появилась необходимость учитывать риск хранения и обработки этих данных. В какой-то момент хранимые на серверах данные превратились не в актив компании, а в обязательства. Штрафы за утечку и раскрытие персональных данных или несоблюдение законодательных норм огромные, и компании должны учитывать риск. Порой безопаснее не хранить данные, которые могут понадобиться когда-нибудь в будущем, а сразу их удалять.
    1,710103Open in Telegram
  • DataEng

    3 Mar, 07:01

    Аналитические базы выступают в роли общего хранилища, куда стекаются данные из различных подсистем. Это могут быть OLTP базы, а также внешние сервисы (данные из которых можно тянуть по API, например). Процесс насыщения данными обозначают аббревиатурой ETL - Extract Transform Load. Но существует и другая аббревиатура ELT - Extract Load Transform. В первом случае трансформация данных происходит до загрузки в главное хранилище, а во втором уже на стороне хранилища (хранение в “сыром” виде).Также есть процесс reverse ETL, это обратный процесс, когда данные из аналитической базы попадают в транзакционное хранилище. Например, такое практикуется при построении моделей машинного обучения и деплоя их в продакшн.HTAPСуществуют и гибридные базы данных HTAP - Hybrid Transactional/Analytical Processing. Они сочетают в себе сразу 2 типа системы: транзакционное и аналитическое хранилище. Мотив
    2,510262Open in Telegram
  • DataEng

    3 Mar, 07:01

    Designing Data-Intensive ApplicationsГлава 1. Trade-Offs in Data Systems ArchitectureВведениеПервая глава книги получилась объёмной как по количеству страниц так и по количеству информации. По сравнению с первым изданием появилось упоминание Single-Node Data Warehouse решений на примере DuckDB, SQLite, но без деталей. Детали будут раскрываться уже в более поздних главах.Основная мысль первой главы дать читателю понимание, что нет “серебряной пули”, и в каждом решении существуют как свои плюсы так и минусы (trade offs). Посыл авторов благородный, помочь читателю разобраться в море различных технологических решений. Дать фундамент, который будет помогать принимать правильные решения при проектировании архитектуры будущих приложений.Что изменилось по сравнению с первым изданием? Первое издание книги вышло в 2017 году, с тех пор прошло 9 лет. Мир не стоит на месте, технологии
    2,360224Open in Telegram
  • DataEng

    23 Feb, 10:56edited

    Второе издание "кабанчика"На днях увидел в сети анонс, что вышло новое издание легендарной книги Designing Data-Intensive Applications.Впервые я познакомился с этой книгой где-то весной или летом 2018 года. Помню как случайно нашел её в архивах какого-то репозитория на Гитхабе. И сказать, что она мне понравилась это ничего не сказать. Я был в восторге от неё, она стала для меня учебником которого мне не хватало. Помню, что до середины я прочитал её на стареньком планшете. Глаза мои уставали, и я решил заказать её в бумажном вариант.“Кабанчик” до сих пор у меня, пережил несколько переездов и выглядит непрезентабельно. Но к чему этот пост? Я хочу немного изменить формат этого канала и сделать фокус на авторском контенте: больше личного опыта, мыслей и заметок. И первым таким экспериментом будет серия постов по новому изданию книги Designing Data-Intensive Applications. По мере
    Image from a post by DataEngImage from a post by DataEng
    2,960121246Open in Telegram
  • DataEng

    17 Feb, 11:00

    🔥 Девушка без навыков разработки запустила AI-бота и вышла на первые продажи за месяцАня из комьюнити @its_capitan заметила: люди учат английский годами, но говорить не могут. И тогда она сделала Telegram-бота, который общается с тобой голосовыми на английском и исправляет ошибки как живой собеседник.Что в итоге: — ~700 пользователей за первый месяц — первые 16 оплат — первая выручка: ~$200 — подписка: $8/мес — сделано на n8n + OpenAI без разработчиковНе было ни команды, ни инвестиций, ни кода.Главное — не технология. Главное — простая понятная ценность.Таких запусков в канале уже десятки. Показываем честно: цифры, провалы, рост и продвижение. Без теорий. Только реальные метрики и запуск в реальном времени.👉 @its_capitan
    TelegramКороче, капитан – Запускаем мини-приложенияВеду проекты на 6млн+ юзеров. Устроил челлендж по запуску 12 маленьких IT-проектов за 12 месяцев. Показываю как разрабатываем, где продвигаем, что зашло и что не очень. Делюсь метриками, которые обычно скрывают. Связь с автором: @ig_zuev
    2,75021Open in Telegram
  • DataEng

    4 Feb, 10:56

    Data Pipelines with Apache Airflow, 2-е изданиеРебята из Astronomer совершенно бесплатно раздают электронную книгу Data Pipelines with Apache Airflow®, Second Edition, by Manning. Это обновлённое издание с учётом новой 3-й ветки Airflow, в книге используется версия Apache Airflow 3.1.0. Ну и конечно же ИИ не обделили, в книге появился контент про RAG, AI Orchestration и т.д.Приятного чтения, господа! 🤓
    3,500file148Open in Telegram
  • DataEng

    30 Jan, 11:30

    📣 📢 13 ИИ агентов для дата инженераРебята из Astronomer выложили 13 полезных ИИ агентов для дата инженера. В списке есть имба-агент, помогающий мигрировать Airflow 2 на Airflow 3 — migrating-airflow-2-to-3 Преимущественно агенты сконцентрированы вокруг написания и тестирования Airflow DAGs, проектирования таблиц БД, data lineage. Боевой комплект дата инженера.Из БД они умеют в Snowflake, Postgres, BigQuery. Также есть навык для работы с SQLAlchemy ORM.Установка агентов:npx skills add astronomer/agentsДля Claude Code можно установить прямо их маркетплейсаclaude plugin marketplace add astronomer/agents claude plugin install data@astronomerВ комплекте есть Airflow MCP сервер.Ссылка на репозиторий: astronomer/agents
    GitHubGitHub - astronomer/agents: AI agent tooling for data engineering workflows.AI agent tooling for data engineering workflows. Contribute to astronomer/agents development by creating an account on GitHub.
    4,080198Open in Telegram
  • DataEng

    22 Jan, 16:33

    pandas 3.0Вышла мажорная версия самой, пожалуй, популярной библиотеки для работы с данными в Python - pandas 3.0. В новом релизе появилось два значительных изменения: новый dtype для строк str вместо привычного numpy object. По словам разработчиков это значительно улучшает производительность кода. Также теперь Copy-on-Write это единственный режим для изменения значения колонок у датафрейма, более подробно здесь. Перед миграцией на новую версия pandas необходимо прошерстить легаси код и внести изменения, если вдруг в коде есть проверки на object или неоднозначные изменения датафрейма (вездесущий SettingWithCopyWarning в логах).Ссылка на полный release notes.
    3,720236Open in Telegram
  • DataEng

    20 Jan, 12:05

    fastjsondiff - High-performance JSON comparison with a Zig-powered coreНаписал небольшую библиотеку для сравнения двух JSON-текстов/файлов. В Python есть популярная либа jsondiff, но её основная проблема это сильные тормоза, если на вход подать более менее крупный JSON-текст. Давно вынашивал идею реализации чего-то такого, но на Zig/Rust, т.к. чистая реализация на Python будет всё равно медленнее. По итогу получилось реализовать на Zig основную либу и Python-интерфейс к ней.pip install fastjsondiff-zigGithub: https://github.com/adilkhash/fastjsondiff PyPI: https://pypi.org/project/fastjsondiff-zig/Буду признателен за ⭐ на репе в гитхабе, это поможет её распространить дальше.
    GitHubGitHub - adilkhash/fastjsondiff: Fast JSON Diff powered by Zig & PythonFast JSON Diff powered by Zig & Python. Contribute to adilkhash/fastjsondiff development by creating an account on GitHub.
    4,8601711Open in Telegram