ch
Feedback
Data Engineering / Инженерия данных / Data Engineer / DWH

Data Engineering / Инженерия данных / Data Engineer / DWH

前往频道在 Telegram

Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru

显示更多
2 689
订阅者
无数据24 小时
+27
+2130
帖子存档
SmartData 2024: Валентин Пановский - Как кролик съел зелёную сливу и не умер: сказ о миграции на Iceberg Процесс миграции DWH из состояния AS IS (Greenplum) в целевое состояние TO BE (Trino, Iceberg REST Catalog, Object Storage). https://youtu.be/YWD7WcfFfk8?si=Meqb8QIAsCQa4D8X

Smart Data 2024: Максим Гудзикевич, Кирилл Осинцев (Yandex) — "Как навести порядок в двух эксабайтах данных?" Интро: "В компании с быстрорастущим объемом данных ориентироваться в них становится сложнее с каждым днем. В этой ситуации помогают каталоги данных, однако информация в них, как правило, заполняется пользователями собственноручно или берется из ERM-связей небольших БД. Мы же во внутреннем DataCatalog научились автоматически на основе логов ETL-операций и ad hoc-расчетов собирать Data Lineage системы YTsaurus." https://youtu.be/dhDU-xA_qVQ?si=3RheeeRL-Xx6Yh4w

Введение в Apache Iceberg. Основы, архитектура, как работает? Накидал базовую статейку по айсбергу. Часть материала - конспект из книги "Apache Iceberg Полное руководство" - всем, кто планирует работать с этой технологией, советую прочитать. https://ivan-shamaev.ru/apache-iceberg-tutorial-architecture-how-to-work/ #iceberg #trino #parquet #lakehouse

SmartData 2024: Инструменты Data Quality (Дмитрий Руднев, Т-Банк) https://youtu.be/cWHW4RgBibw?si=oUgwRVVuN6J6lOy1

3 ресурса для освоения GIT с интерактивными заданиями https://learngitbranching.js.org/?locale=ru_RU - Learn Git Branching Интерактивный тренажер, позволяющий визуализировать и отрабатывать команды Git в режиме реального времени. Подходит как для новичков, так и для опытных пользователей. ​ https://git-school.github.io/visualizing-git/ - Visualizing Git Веб-приложение, которое наглядно демонстрирует, как различные команды Git влияют на структуру коммитов, помогая лучше понять внутренние процессы системы контроля версий. https://ohmygit.org/ - Открытая игра, обучающая Git с помощью визуализации внутренних структур репозиториев в реальном времени. Имеет интерфейс в виде игровых карт для запоминания команд и интегрированный терминал для выполнения произвольных команд Git.

Тренировки по алгоритмам от Яндекса https://yandex.ru/yaintern/training/algorithm-training После регистрации приходит письмо с подготовительными лекциями на YT https://youtube.com/playlist?list=PL6Wui14DvQPz_vzmNVOYBRqML6l51lP0G&si=FdTT_WhXPNZnOx46

SmartData 2024 "dbt в деле: реальные кейсы и лайфхаки (Антон Александров)" https://youtu.be/RV5ZSMcwm9w?si=BDSx3q8h0gb_ZQTX Презентация

Перевод 4 Главы - Моделирование Data Vault 2.0 В этой главе рассматриваются сущности, используемые в моделировании Data Vault, включая хабы (Hubs), линки/связи (Links) и сателлиты (Satellites). Показано, как идентифицировать бизнес-ключи в исходных данных и связывать их с другими бизнес-ключами в Data Vault с помощью линк-сущностей. Также рассмотрено, как выделять дополнительные атрибуты из исходных данных и моделировать их в виде сателлитных сущностей. https://datatalks.ru/chapter-4-data-vault-2-0-modeling/

Обзор 5 главы "Replication in System Design" Из книги "Высоконагруженные приложения" https://youtu.be/KWIUkbcDhHc?si=Bahv3m8zf8z4qLMm

Обработка событий в Snowplow: от сбора до аналитики https://youtu.be/539ypLtSIbY?si=acSMEx0uhnCyy8RY

SoftwareMill Kafka Visualization Визуально можно увидеть, как работает кафка. https://softwaremill.com/kafka-visualisation/ И дополнительно статья, описывающая инструмент https://habr.com/ru/articles/865120/ #kafka

Smart Data 2024: Использование вероятностных структур данных для оптимизации ETL-процессов https://youtu.be/qZ8ud40wDPU?si=RDtVMEc8vq3FGeyT

Перевод 3 Главы - Методология Data Vault 2.0 Подробное описание методологии Data Vault 2.0, больше с точки зрения управления проектами. https://datatalks.ru/chapter-3-data-vault-2-0-methodology/

System Design. База. Разбор книги "Высоконагруженные приложения". Глава 2 ▫️Relational vs Document models ▫️One-to-Many, Many-to-One, Many-to-Many ▫️Schema On-Write vs Schema On-Read ▫️Диффузия моделей данных ▫️Imperative vs Declarative models ▫️MapReduce ▫️Graph Model, Свойства, Triple-Store ▫️System Design Interview: Data Models https://youtu.be/H88-S0bHvJQ?si=5Nycizku0FeSVhxQ

SmartData 2024: От хайпа до продакшена: data mesh на Airflow + dbt https://youtu.be/OT-Sx-bd-6k?si=MG0kbWWjZIXwR2nm

Пример создания DWH по Kimball с применением dbt Build a Data Warehouse with dbt using Kimball’s dimensional modeling | by Haq Nawaz | Dev Genius https://blog.devgenius.io/build-a-data-warehouse-with-dbt-using-kimballs-dimensional-modeling-59ea9bfae59f GitHub: dbt build a datawarehouse using dimensional modeling https://github.com/hnawaz007/dbt-dw

Как быстро запустить процесс ведения каталога данных в компании. Пример DataHub - доклад Журавлевой Натальи на SmartData 2024 https://youtu.be/nCt4gYVQdqc?si=YUpGIqHB5SqCddrH

Перевод 2 Главы - Масштабируемая архитектура хранилища данных Введение в архитектуру Data Vault 2.0 без детальных подробностей. https://datatalks.ru/data-vault-2-0-chapter-2-scalable-data-warehouse-architecture/