uz
Feedback
Data Engineering / Инженерия данных / Data Engineer / DWH

Data Engineering / Инженерия данных / Data Engineer / DWH

Kanalga Telegram’da o‘tish

Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru

Ko'proq ko'rsatish
2 694
Obunachilar
+124 soatlar
+57 kunlar
+2130 kunlar
Postlar arxiv
Микросервисы. Паттерны разработки и рефакторинга (Крис Ричардсон).pdf Если вам давно кажется, что вся разработка и развертывание в вашей компании донельзя замедлились – переходите на микросервисную архитектуру. Она обеспечивает непрерывную разработку, доставку и развертывание приложений любой сложности. Книга, предназначенная для разработчиков и архитекторов из больших корпораций, рассказывает, как проектировать и писать приложения в духе микросервисной архитектуры. Также в ней описано, как делается рефакторинг крупного приложения – и монолит превращается в набор микросервисов. В этой книге • Как (и зачем!) использовать микросервисную архитектуру. • Стратегии декомпозиции сервисов. • Управление транзакциями и шаблоны запросов. • Эффективные стратегии тестирования. • Шаблоны развертывания, включая контейнеры и бессерверные платформы.

Осваиваем Kubernetes. Оркестрация контейнерных архитектур (Джиджи Сайфан).pdf В книге рассмотрена новейшая версия Kubernetes 1.10. Kubernetes – это система с открытым кодом, предназначенная для работы с контейнерными приложениями, их развертывания, масштабирования, управления ими. Если вы хотите запустить дополнительные контейнеры или автоматизировать управление, то вам не обойтись без Kubernetes. Книга начинается с изучения основ Kubernetes, архитектуры и компоновки этой системы. Вы научитесь создавать микросервисы с сохранением состояния, ознакомитесь с такими продвинутыми возможностями, как горизонтальное автомасштабирование подов, выкатывание обновлений, квотирование ресурсов, обустроите долговременное хранилище на бэкенде. На реальных примерах вы исследуете возможности сетевой конфигурации, подключение и настройку плагинов. Эта книга поможет вам стать искусным дирижером и обращаться с контейнерными системами любой сложности.

Apache Nifi Expression Language Cheat Sheet

Apache NiFi User Guide Apache NiFi is a dataflow system based on the concepts of flow-based programming. It supports powerful and scalable directed graphs of data routing, transformation, and system mediation logic. NiFi has a web-based user interface for design, control, feedback, and monitoring of dataflows. It is highly configurable along several dimensions of quality of service, such as loss-tolerant versus guaranteed delivery, low latency versus high throughput, and priority-based queuing. NiFi provides fine-grained data provenance for all data received, forked, joined cloned, modified, sent, and ultimately dropped upon reaching its configured end-state. https://nifi.apache.org/docs/nifi-docs/html/user-guide.html

Apache Nifi for Dummies Apache NiFi is an integrated data logistics and simple event processing platform. It provides an end-to-end platform that can collect, curate, analyze and act on data in real-time, on-premise, or in the cloud with a drag-and-drop visual interface. 💡 NiFi fundamentals 💡 NiFi use cases 💡 How to get started, debug and manage your own dataflows

Dynamic Tasks in Airflow With the release of Airflow 2.3, users can write DAGs that dynamically generate parallel tasks at runtime. This feature, known as dynamic task mapping, is a paradigm shift for DAG design in Airflow. https://www.astronomer.io/guides/dynamic-tasks

Repost from karpov.courses
Мы уже записывали видео с разбором полезных функций для работы с массивами в ClickHouse, и теперь пришло время практики. В этот раз преподавательница «Симулятора аналитика» Мария Сомова покажет, как применять массивы для решения реальной прикладной задачи. Представьте, что вы работаете в отделе аналитики онлайн-магазина, и перед вами стоит задача оценить эффект от запуска маркетинговой кампании. Рассказываем, как сворачивать данные в массивы и применять функции из предыдущего видео для их обработки.

+2
1.Introduction to Airflow 2.Airflow DAGs 3.Airflow web interface

10+ Apache Airflow Courses [2022] | Learn Online for Free | Class Central https://www.classcentral.com/subject/apache-airflow

awesome-apache-airflow: Curated list of resources about Apache Airflow https://github.com/jghoman/awesome-apache-airflow

Краткое описание Airflow с инструкцией по установке через docker-compose https://ivan-shamaev.ru/apache-airflow-docker-python-dag-data-pipeline/

Зачем вам Dagster, если есть AirFlow: сравнение ETL-оркестраторов https://www.bigdataschool.ru/blog/dagster-vs-airflow-dag-or
Зачем вам Dagster, если есть AirFlow: сравнение ETL-оркестраторов https://www.bigdataschool.ru/blog/dagster-vs-airflow-dag-orchestration-in-big-data.html

Создание современной платформы для работы с данными с помощью Open-Source-решений https://habr.com/en/company/vk/blog/671642/

Принципы организации распределенных баз данных (М. Тамер Ёcy, Патрик Вальдуриес).pdf В книге представлено подробное описание распределенных и параллельных баз данных с учетом новейших технологий. Авторы затрагивают такие темы, как проектирование распределенных и параллельных БД, контроль распределенных данных, распределенная обработка запросов и транзакций, интеграция баз данных. Отдельная глава посвящена обработке больших данных (в частности, обсуждаются распределенные системы хранения, потоковая обработка данных, платформы MapReduce и Spark, анализ графов и озера данных). Обработка веб-данных рассматривается с акцентом на технологию RDF, получившую широкое распространение. В конце глав 2–12 приводятся упражнения, позволяющие закрепить теоретический материал. На сопроводительном сайте читатели найдут информацию об основах реляционных баз данных, обработке запросов, управлении транзакциями и компьютерных сетях.

Потоковая обработка данных с Apache Flink (Фабиан Уэске, Василики Калаври).pdf Начните работу с Apache Flink, фреймворком с открытым исходным кодом, на котором основаны многие крупнейшие в мире системы обработки потоковых данных. В данной книге вы изучите фундаментальные понятия параллельной потоковой обработки и узнаете, чем эта технология отличается от традиционной пакетной обработки данных. Ф. Уэске и В. Калаври, занятые в проекте Apache Flink с первых дней, покажут вам, как создавать масштабируемые потоковые приложения с помощью API Flink DataStream, а также непрерывно выполнять и поддерживать эти приложения в операционных средах. Потоковая обработка идеально подходит для многих задач: подготовки данных с малой задержкой, потоковой аналитики и информационных панелей в реальном времени, раннего оповещения и обнаружения мошенничества. Вы можете обрабатывать потоковые данные любого типа, включая взаимодействия с пользователем, финансовые транзакции и данные интернета вещей, немедленно после получения.