Data Engineering / Инженерия данных / Data Engineer / DWH
Открыть в Telegram
Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru
Больше2 690
Подписчики
+124 часа
+57 дней
+2130 день
Архив постов
Просто о CI/CD (Непрерывная интеграция и доставка)
https://youtu.be/7S1ndRRht6M
Docker и Docker-Compose Tutorial (Контейнеры, install, run, image, daemon, etc.)
Внутри статьи по разделам довольно много полезных видео прикреплено с YouTube.
https://ivan-shamaev.ru/docker-compose-tutorial-container-image-install/
Data Engineering with Apache Spark. A Hands-On Guide for Building Mission-Critical Streaming Applications.pdf
Data Governance Framework — Implementation Guide
https://jelvix.medium.com/data-governance-framework-implementation-guide-e5161afa454f
Tarantool is an in-memory computing platform consisting of a database and an application server.
Key features of the database:
- MessagePack data format and MessagePack based client-server protocol.
- Two data engines: 100% in-memory with complete WAL-based persistence and an own implementation of LSM-tree, to use with large data sets.
- Multiple index types: HASH, TREE, RTREE, BITSET.
- Document oriented JSON path indexes.
- Asynchronous master-master replication.
- Synchronous quorum-based replication.
- RAFT-based automatic leader election for the single-leader configuration.
- Authentication and access control.
- ANSI SQL, including views, joins, referential and check constraints.
- Connectors for many programming languages.
- The database is a C extension of the application server and can be turned off.
Полный разбор SQL задач из Кремниевой долины (FAANG)
https://www.youtube.com/watch?v=kIRR7M8Ryp0
GitHub - charlax/professional-programming
A collection of full-stack resources for programmers.
https://github.com/charlax/professional-programming
gRPC: Запуск и эксплуатация облачных приложений - Go и Java для Docker и Kubernetes
Год от года обретая новых сторонников, облачно-ориентированные и микросервисные архитектуры стали основой современного IT. Такой переход значительно повлиял и на структуру коммуникаций. Теперь приложения часто подключаются друг к другу по сети, и это происходит с помощью технологий межпроцессной коммуникации. Одной из наиболее популярных и эффективных технологий такого рода является gRPC.
В книге разбирается, как технология gRPC устроена «под капотом».
Как вытащить из данных максимум Навыки аналитики для неспециалистов (Джордан Морроу)
Ansible: Up and Running - Automating Configuration Management and Deployment the Easy Way, 3rd Edition
🔹 Explore Ansible configuration management and deployment
🔹 Manage Linux, Windows, and network devices
🔹 Learn how to apply Ansible best practices
🔹 Understand how to use the new collections format
🔹 Create custom modules and plug-ins
🔹 Generate reusable Ansible content for open source middleware
🔹 Build container images, images for cloud instances, and cloud infrastructure
🔹 Automate CI/CD development environments
Про Kafka (основы)
Apache Kafka - популярный распределенный отказоустойчивый брокер сообщений, используемый в высоконагруженных системах и BigData проектах.
https://www.youtube.com/watch?v=-AZOi3kP9Js
Data Analysis with Python and PySpark (Final Release) (Jonathan Rioux)
👉 @devops_dataops
In Data Analysis with Python and PySpark you will learn how to:
• Manage your data as it scales across multiple machines
• Scale up your data programs with full confidence
• Read and write data to and from a variety of sources and formats
• Deal with messy data with PySpark’s data manipulation functionality
• Discover new data sets and perform exploratory data analysis
• Build automated data pipelines that transform, summarize, and get insights from data
• Troubleshoot common PySpark errors
• Creating reliable long-running jobs
Перевод книги Problem Solving with Algorithms and Data Structures
https://aliev.me/runestone/index.html
How to Design and Build a Data Platform
https://productcoalition.com/how-to-design-and-build-a-data-platform-as-a-product-d22329ff5a3f
Обработка больших данных с
Apache Spark– СПб: Университет ИТМО, 2019г.
Учебно-методическое пособие содержит теоретический материал и примеры выполнения задач для курса «Введение в технологии обработки больших данных». Пособие составлено с учётом проведения лабораторных работ с помощью фреймворка Apache Spark. Содержание дисциплины охватывает круг вопросов, связанных с организацией построения ETLконвейеров на основе Spark SQL и DataFrame API для распределенного выполнения на кластерных вычислительных система, включая использование итеративных вычислений, важных для машинного обучения, рассмотрения shuffle механизмов и принципов организации управлением памятью в Spark.
В результате освоения дисциплины студенты приобретают способности разработки программ и построения конвейеров обработки различных данных, навыки по работе с распределенными кластерными системами, а также способности к применению машинного обучения на распределенных наборах данных.
Odoo. Open Source Apps To Grow Your Business
https://github.com/odoo/odoo
10 Best Open Source ERP Software Systems For 2022
https://dynamics.folio3.com/blog/open-source-enterprise-resource-planning-software/
Инженерия машинного обучения
Содержит множество рекомендаций и паттернов проектирования надежных и масштабируемых решений в области машинного обучения.
