Data Engineering / Инженерия данных / Data Engineer / DWH
Kanalga Telegram’da o‘tish
Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru
Ko'proq ko'rsatish2 689
Obunachilar
Ma'lumot yo'q24 soatlar
+27 kunlar
+2130 kunlar
Postlar arxiv
SmartData 2024: Валентин Пановский - Как кролик съел зелёную сливу и не умер: сказ о миграции на Iceberg
Процесс миграции DWH из состояния AS IS (Greenplum) в целевое состояние TO BE (Trino, Iceberg REST Catalog, Object Storage).
https://youtu.be/YWD7WcfFfk8?si=Meqb8QIAsCQa4D8X
Smart Data 2024: Максим Гудзикевич, Кирилл Осинцев (Yandex) — "Как навести порядок в двух эксабайтах данных?"
Интро: "В компании с быстрорастущим объемом данных ориентироваться в них становится сложнее с каждым днем. В этой ситуации помогают каталоги данных, однако информация в них, как правило, заполняется пользователями собственноручно или берется из ERM-связей небольших БД. Мы же во внутреннем DataCatalog научились автоматически на основе логов ETL-операций и ad hoc-расчетов собирать Data Lineage системы YTsaurus."
https://youtu.be/dhDU-xA_qVQ?si=3RheeeRL-Xx6Yh4w
Введение в Apache Iceberg. Основы, архитектура, как работает?
Накидал базовую статейку по айсбергу. Часть материала - конспект из книги "Apache Iceberg Полное руководство" - всем, кто планирует работать с этой технологией, советую прочитать.
https://ivan-shamaev.ru/apache-iceberg-tutorial-architecture-how-to-work/
#iceberg #trino #parquet #lakehouse
SmartData 2024: Инструменты Data Quality (Дмитрий Руднев, Т-Банк)
https://youtu.be/cWHW4RgBibw?si=oUgwRVVuN6J6lOy1
3 ресурса для освоения GIT с интерактивными заданиями
https://learngitbranching.js.org/?locale=ru_RU - Learn Git Branching
Интерактивный тренажер, позволяющий визуализировать и отрабатывать команды Git в режиме реального времени. Подходит как для новичков, так и для опытных пользователей.
https://git-school.github.io/visualizing-git/ - Visualizing Git
Веб-приложение, которое наглядно демонстрирует, как различные команды Git влияют на структуру коммитов, помогая лучше понять внутренние процессы системы контроля версий.
https://ohmygit.org/ - Открытая игра, обучающая Git с помощью визуализации внутренних структур репозиториев в реальном времени. Имеет интерфейс в виде игровых карт для запоминания команд и интегрированный терминал для выполнения произвольных команд Git.
Тренировки по алгоритмам от Яндекса
https://yandex.ru/yaintern/training/algorithm-training
После регистрации приходит письмо с подготовительными лекциями на YT https://youtube.com/playlist?list=PL6Wui14DvQPz_vzmNVOYBRqML6l51lP0G&si=FdTT_WhXPNZnOx46
SmartData 2024 "dbt в деле: реальные кейсы и лайфхаки (Антон Александров)"
https://youtu.be/RV5ZSMcwm9w?si=BDSx3q8h0gb_ZQTX
Презентация
Перевод 4 Главы - Моделирование Data Vault 2.0
В этой главе рассматриваются сущности, используемые в моделировании Data Vault, включая хабы (Hubs), линки/связи (Links) и сателлиты (Satellites). Показано, как идентифицировать бизнес-ключи в исходных данных и связывать их с другими бизнес-ключами в Data Vault с помощью линк-сущностей. Также рассмотрено, как выделять дополнительные атрибуты из исходных данных и моделировать их в виде сателлитных сущностей.
https://datatalks.ru/chapter-4-data-vault-2-0-modeling/Обзор 5 главы "Replication in System Design"
Из книги "Высоконагруженные приложения"
https://youtu.be/KWIUkbcDhHc?si=Bahv3m8zf8z4qLMm
Обработка событий в Snowplow: от сбора до аналитики
https://youtu.be/539ypLtSIbY?si=acSMEx0uhnCyy8RY
SoftwareMill Kafka Visualization
Визуально можно увидеть, как работает кафка.
https://softwaremill.com/kafka-visualisation/
И дополнительно статья, описывающая инструмент
https://habr.com/ru/articles/865120/
#kafka
3 и 4 главы книги "Высоконагруженные приложения"
B-tree, OLAP OLTP, Hash Index. Kleppman 3 chapter
JSON, ProtoBuf, Data formats. Kleppman 4 chapter
Smart Data 2024: Использование вероятностных структур данных для оптимизации ETL-процессов
https://youtu.be/qZ8ud40wDPU?si=RDtVMEc8vq3FGeyT
Перевод 3 Главы - Методология Data Vault 2.0
Подробное описание методологии Data Vault 2.0, больше с точки зрения управления проектами.
https://datatalks.ru/chapter-3-data-vault-2-0-methodology/
System Design. База. Разбор книги "Высоконагруженные приложения". Глава 2
▫️Relational vs Document models
▫️One-to-Many, Many-to-One, Many-to-Many
▫️Schema On-Write vs Schema On-Read
▫️Диффузия моделей данных
▫️Imperative vs Declarative models
▫️MapReduce
▫️Graph Model, Свойства, Triple-Store
▫️System Design Interview: Data Models
https://youtu.be/H88-S0bHvJQ?si=5Nycizku0FeSVhxQ
SmartData 2024: От хайпа до продакшена: data mesh на Airflow + dbt
https://youtu.be/OT-Sx-bd-6k?si=MG0kbWWjZIXwR2nm
Пример создания DWH по Kimball с применением dbt
Build a Data Warehouse with dbt using Kimball’s dimensional modeling | by Haq Nawaz | Dev Genius
https://blog.devgenius.io/build-a-data-warehouse-with-dbt-using-kimballs-dimensional-modeling-59ea9bfae59f
GitHub: dbt build a datawarehouse using dimensional modeling
https://github.com/hnawaz007/dbt-dw
Как быстро запустить процесс ведения каталога данных в компании. Пример DataHub - доклад Журавлевой Натальи на SmartData 2024
https://youtu.be/nCt4gYVQdqc?si=YUpGIqHB5SqCddrH
Перевод 2 Главы - Масштабируемая архитектура хранилища данных
Введение в архитектуру Data Vault 2.0 без детальных подробностей.
https://datatalks.ru/data-vault-2-0-chapter-2-scalable-data-warehouse-architecture/
