ru
Feedback
Data Engineering / Инженерия данных / Data Engineer / DWH

Data Engineering / Инженерия данных / Data Engineer / DWH

Открыть в Telegram

Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru

Больше
2 689
Подписчики
Нет данных24 часа
+27 дней
+2130 день
Архив постов
Глава 1 «Big Data» — Data Architectures Перевод первой главы из книги Deciphering Data Architectures https://datatalks.ru/big-data-data-architectures/ #big_data #bigdata

Database Sharding — PlanetScale Интересный сайт про шардированию, понравились интерактивные схемы. https://planetscale.com/blog/database-sharding

Создание архитектуры Medallion с помощью ClickHouse https://datatalks.ru/medallion-architecture-with-clickhouse/ #ClickHouse #Medallion

Data Engineering Handbook Сайт: https://karlchris.github.io/data-engineering/ GitHub: https://github.com/karlchris/data-engineering/tree/master Разделы: ▫️Projects ▫️Data Engineering ▫️Data Modeling ▫️Data Ingestion ▫️Data Architecture ▫️Data Orchestration ▫️Data Processing ▫️Data Quality ▫️Python

Проектирование DWH. Data Modeling. Kimball, Data Vault 2.0, Anchor Modeling https://ivan-shamaev.ru/data-modeling-dwh-kimball-scd-types-data-vault-2-anchor-modeling/

data load tool (dlt) is an open source Python library that makes data loading easy 🛠️ 🔹Автоматическая схема: проверка структуры данных и создание схемы для места назначения. 🔹 Нормализация данных: согласованные и проверенные данные перед загрузкой. 🔹Полная интеграция: Colab, AWS Lambda, Airflow и локальные среды. 🔹Масштабируемость: адаптируется к растущим потребностям в данных в производстве. 🔹Простота обслуживания: понятная структура конвейера данных для обновлений. 🔹Быстрое исследование: быстрое исследование и получение информации из новых источников данных. 🔹Универсальное использование: подходит для несистематических исследований и создания сложных погрузочных инфраструктур. 🔹Начните работу за считанные секунды с помощью CLI: Мощный CLI для управления, развертывания и проверки локальных pipelines. 🔹Поэтапная загрузка: загружайте только новые или измененные данные и избегайте повторной загрузки старых записей. 🔹Открытый исходный код: бесплатно и под лицензией Apache 2.0. https://github.com/dlt-hub/dlt

Чеклист для разработчиков по подготовке к техническому собеседованию — bool.dev https://bool.dev/blog/detail/checklist-dlya-deva-po-podgotovke-tech-interview

Перевод 2 главы "Моделирование данных для аналитики (dbt)" https://datatalks.ru/dbt-data-modeling-for-analytics/ #dbt

Понимание инкрементальных стратегий dbt, часть 1 Вторую часть не буду переводить, этот перевод сделал больше с целью ознакомить с вариантами обновления данных в таблицах. По технической реализации лучше доку смотреть и анализировать, как каждая стратегия работает на уровне макросов (или сгенерированного sql). https://datatalks.ru/understanding-dbt-incremental-strategies-part-1/ #dbt

Перевод Analytics Engineering with SQL and dbt. Глава 1 Немного о концепции Analytics Engineering и терминологии. https://datatalks.ru/analytics-engineering-with-sql-and-dbt-chapter-1/ #dbt

Apache Iceberg + StarRocks YouTube Playlist StarRocks as LakeHouse Query Engine 24 видосика. https://youtu.be/8Q5Vev4O1lQ?si=7DIuO3IuIOmf6aHi === PS === В доке пишут, что StarRocks превосходит по производительности ClickHouse и Trino https://docs.starrocks.io/docs/benchmarking/ Понятно, что надо смотреть на типы задач, настройки и структуры данных, но интересный инструмент в любом случае. Еще 1 статья Сравнение трино и старрокс https://gavrilov.info/all/sravnenie-query-dvizhkov-trino-i-starrocks/ #Iceberg #StarRocks

Как устроена база данных? Схемы, ограничения, индексы, кластеры Для начинающих будет полезно https://youtu.be/8L51FUsjMxA?si=z8uPvZjbnphQC3cx

Перевод главы "Введение в dbt" из книги Unlocking dbt https://datatalks.ru/unlocking-dbt-data-build-tool-part-1/ #dbt

Awesome Data Engineering Learning Sources Подборка ресурсов для изучения направления Data Engineering с минимальным бюджетом (большая часть бесплатно на YT). https://datatalks.ru/awesome-data-engineering-learning-sources/

Оптимизация SQL запросов на примере ClickHouse Бесплатно Научимся писать SQL запросы так, чтобы не убить базу данных. Изучим основные методы оптимизации SQL запросов, актуальные для любой СУБД https://stepik.org/course/Оптимизация-SQL-запросов-на-примере-ClickHouse-215412/ #ClickHouse

В твиттере вышел Grok 2. Неплохие ответы выдает, при этом вроде нет столько воды, сколько есть у бесплатного chatgpt. Причем
В твиттере вышел Grok 2. Неплохие ответы выдает, при этом вроде нет столько воды, сколько есть у бесплатного chatgpt. Причем даже на политические вопросы дает ответы/рассуждает. Ну и по data engineering можно поспрашивать, может найдутся какие-нибудь инсайты) Гоу тестить🤪

В видео по Spark есть ссылка на роадмап по DE с кучей полезных инструкций по инструментам. GitHub - halltape/HalltapeRoadmapDE: Roadmap для Data Engineer. https://github.com/halltape/HalltapeRoadmapDE

Что такое Spark и как он работает? https://youtu.be/Gj0oSVmv7k4?si=XK0gur6IcnXSQBNd #spark

PySpark Playground & Tutorial https://www.sparkplayground.com/tutorials - здесь можно изучить работу со спарком (на английском) https://www.sparkplayground.com/playground - здесь можно потренироваться онлайн #spark #pyspark