ch
Feedback
Data Engineering / Инженерия данных / Data Engineer / DWH

Data Engineering / Инженерия данных / Data Engineer / DWH

前往频道在 Telegram

Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru

显示更多
2 690
订阅者
+124 小时
+57
+2130
帖子存档
Просто о CI/CD (Непрерывная интеграция и доставка) https://youtu.be/7S1ndRRht6M

Docker и Docker-Compose Tutorial (Контейнеры, install, run, image, daemon, etc.) Внутри статьи по разделам довольно много полезных видео прикреплено с YouTube. https://ivan-shamaev.ru/docker-compose-tutorial-container-image-install/

Data Engineering with Apache Spark. A Hands-On Guide for Building Mission-Critical Streaming Applications.pdf

Tarantool is an in-memory computing platform consisting of a database and an application server. Key features of the database: - MessagePack data format and MessagePack based client-server protocol. - Two data engines: 100% in-memory with complete WAL-based persistence and an own implementation of LSM-tree, to use with large data sets. - Multiple index types: HASH, TREE, RTREE, BITSET. - Document oriented JSON path indexes. - Asynchronous master-master replication. - Synchronous quorum-based replication. - RAFT-based automatic leader election for the single-leader configuration. - Authentication and access control. - ANSI SQL, including views, joins, referential and check constraints. - Connectors for many programming languages. - The database is a C extension of the application server and can be turned off.

Полный разбор SQL задач из Кремниевой долины (FAANG) https://www.youtube.com/watch?v=kIRR7M8Ryp0

GitHub - charlax/professional-programming A collection of full-stack resources for programmers. https://github.com/charlax/professional-programming

gRPC: Запуск и эксплуатация облачных приложений - Go и Java для Docker и Kubernetes Год от года обретая новых сторонников, облачно-ориентированные и микросервисные архитектуры стали основой современного IT. Такой переход значительно повлиял и на структуру коммуникаций. Теперь приложения часто подключаются друг к другу по сети, и это происходит с помощью технологий межпроцессной коммуникации. Одной из наиболее популярных и эффективных технологий такого рода является gRPC. В книге разбирается, как технология gRPC устроена «под капотом».

+1
Как вытащить из данных максимум Навыки аналитики для неспециалистов (Джордан Морроу)

Ansible: Up and Running - Automating Configuration Management and Deployment the Easy Way, 3rd Edition 🔹 Explore Ansible configuration management and deployment 🔹 Manage Linux, Windows, and network devices 🔹 Learn how to apply Ansible best practices 🔹 Understand how to use the new collections format 🔹 Create custom modules and plug-ins 🔹 Generate reusable Ansible content for open source middleware 🔹 Build container images, images for cloud instances, and cloud infrastructure 🔹 Automate CI/CD development environments

Про Kafka (основы) Apache Kafka - популярный распределенный отказоустойчивый брокер сообщений, используемый в высоконагруженных системах и BigData проектах. https://www.youtube.com/watch?v=-AZOi3kP9Js

Data Analysis with Python and PySpark (Final Release) (Jonathan Rioux) 👉 @devops_dataops In Data Analysis with Python and PySpark you will learn how to: • Manage your data as it scales across multiple machines • Scale up your data programs with full confidence • Read and write data to and from a variety of sources and formats • Deal with messy data with PySpark’s data manipulation functionality • Discover new data sets and perform exploratory data analysis • Build automated data pipelines that transform, summarize, and get insights from data • Troubleshoot common PySpark errors • Creating reliable long-running jobs

Перевод книги Problem Solving with Algorithms and Data Structures https://aliev.me/runestone/index.html

Обработка больших данных с Apache Spark– СПб: Университет ИТМО, 2019г. Учебно-методическое пособие содержит теоретический материал и примеры выполнения задач для курса «Введение в технологии обработки больших данных». Пособие составлено с учётом проведения лабораторных работ с помощью фреймворка Apache Spark. Содержание дисциплины охватывает круг вопросов, связанных с организацией построения ETLконвейеров на основе Spark SQL и DataFrame API для распределенного выполнения на кластерных вычислительных система, включая использование итеративных вычислений, важных для машинного обучения, рассмотрения shuffle механизмов и принципов организации управлением памятью в Spark. В результате освоения дисциплины студенты приобретают способности разработки программ и построения конвейеров обработки различных данных, навыки по работе с распределенными кластерными системами, а также способности к применению машинного обучения на распределенных наборах данных.

Инженерия машинного обучения Содержит множество рекомендаций и паттернов проектирования надежных и масштабируемых решений в области машинного обучения.