rzv Data Engineering
Open in Telegram
Авторский канал о том, как я понимаю инжиниринг данных. Объясняю термины, best practice, делюсь описанием рабочих задачек. См закрепы Рассчитан на новичков в DE и инженеров до Senior. Чат: t.me/+jtQ1tjvNUtwzN2My По вопросам: @razvodov_de_mentor
Show more2 997
Subscribers
+224 hours
-27 days
+2830 days
Posts Archive
2 997
О чём интересно почитать? Что волнует, о чём не хватает информации или интересно послушать моё мнение?
Пиши в комменты
2 997
Clickhouse для программистов, аналитиков и инженеров данных
Перестаньте ждать, пока считается аналитика. Научитесь использовать ClickHouse — СУБД, которая превращает минутные аналитические запросы в ответы за доли секунды. С первого дня — доступ к инфраструктуре для практики.
🌐 Чему вы научитесь:
🤩 Архитектура одиночных и кластерных инсталляций ClickHouse: как устроена система изнутри и как масштабировать её под реальные нагрузки
🤩 Хранение данных: движки MergeTree, партиционирование и сжатие — как держать терабайты аналитических данных при минимальных затратах на инфраструктуру.
🤩 Обработка миллиардов строк за секунды: построение эффективных запросов, агрегаций и материализованных представлений.
🤩 ClickHouse в продакшене: использование в приложениях, продуктовой аналитике и типичные грабли, на которые наступают почти все
🤩 Живая практика без отрыва от работы: не более 2-3 часов в неделю, разбор задач с экспертом в групповом чате.
🥸 Кто мы: R&D-центр Devhands. Автор курса — Алексей Белозерский, Chief Data Officer в inSales (СБЕР 2В), ex: VK Tech, М.Видео, Эльдорадо
🗓 Старт курса: 11 июня, 6 недель обучения.
Изучить программу и записаться можно здесь.
Ждем вас!
Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzqxNnFKA
2 997
#термин_дня
Термины в DE, которые легко перепутать
🔸 Часть слов в инжиниринге данных значат совсем разное в зависимости от контекста. Подобрал семь таких — на которых сам спотыкался.
миграция — либо изменение структуры таблицы (Alembic, Flyway, Liquibase), либо переезд с одного инструмента на другой (с Oracle в Greenplum). Мне в контексте DE чаще встречался второй смысл, но с бэкендерами часто говорили о разном.
схема — либо структура колонок и типов внутри таблицы, либо namespace в базе (public.users vs raw.users). Во фразе «у нас в схеме dwh поменялась схема таблицы orders» оба значения встречаются подряд.
база данных — либо объект внутри СУБД (CREATE DATABASE foo), либо сама СУБД (Postgres, Greenplum, Clickhouse). Отсюда вопросы вроде «у нас одна база или несколько» — и непонятно, про что вообще речь.
транзакция — либо транзакция БД (BEGIN/COMMIT, ACID), либо бизнес-транзакция (платёж, перевод денег) в обсуждении требований. Иногда так ещё называют отдельную запись в логе операций — третий смысл, который всплывает в разговоре с аналитиками.
ключ — primary key (уникальный идентификатор строки), business key (уникальный с точки зрения бизнеса, типа email), surrogate key (искусственный, auto-increment или hash), partition key в Kafka (определяет, в какую партицию записать сообщение), hash key в Data Vault. Все «ключи», но решают разные задачи.
снэпшот — либо backup БД на момент времени, либо dbt snapshot для отслеживания SCD type 2, либо filesystem-снэпшот (ZFS, LVM, Btrfs), либо Iceberg/Delta Lake snapshot (версия таблицы для time travel).
partition — в Kafka это шард топика, по которому раскладываются сообщения для параллельного чтения консьюмерами; в Greenplum — секция таблицы, физически отдельный кусок данных, который можно дропнуть или подменить через EXCHANGE PARTITION; в Spark — кусок DataFrame, который обрабатывает один task внутри executor'а.2 997
Ты узнаешь его из тысячи….
по юморным постам/ по леопарду/ по таблиське
Человек, который познал и зимовки на райских островах (не без происшествий🏍), и собесы в Яндекс, и суровую офисную жизу, и теперь с юмором обо всём этом рассказывает нам!
⭐️ Да-да, встречайте, тот самый Глеб Михайлов!
Надо сказать, что его тг-канал особенный: один раз увидишь — не забудешь никогда.
Вот самые сочные посты, которые достойны вашего внимания:
⚡️ главная ошибка в обучении Data Science
⚡️ топ-8 примеров как НЕПРАВИЛЬНО обучают алгоритмам
⚡️ редфлаги офисного кореша😀🚩
⚫️Подпишись для хорошего настроения и рабочих лайфхаков: @mikhaylovgleb
Реклама: ИП Михайлов Глеб Михайлович, ИНН 500125076224, erid: 2VtzqvMx4sh
2 997
Не пытайся изучить все новые сверкающие инструменты
Не сможешь.
Успокаивающая FOMO карта технологий (на 2024 год, с тех пор ещё больше):
https://api.mattturck.com/landscape/mad2024.pdf
p.s. да, полезно со временем выучить по одному инструменту из каждой категории, но это не значит что до тех пор нельзя работать работу
p.p.s. да, инструменты в основном зарубежные и редко встречаются на РУ рынке. но тут и там встречаются "убийцы гринпламов" и "вам срочно нужно узнать о технологии Х"
Не нужно. Lakehouse (Iceberg + Trino) всё чаще встречается в вакансиях, его можно. Остальное не нужно
2 997
Lakehouse для аналитиков и инженеров данных
Изучи набирающий популярность подход к построению хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino.
🌐 В программе курса:
▪️Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino.
▪️Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой.
▪️Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/Python-запросов.
▪️Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем.
▪️Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия.
🥸 Кто мы: R&D-центр Devhands.io, наш канал. Автор курса — Алексей Белозерский, руководитель направления Big Data Services в компании VK Tech.
🗓 Старт курса: 16 апреля, 6 недель обучения.
Изучить программу и записаться можно здесь.
Подписчикам канала 10% скидка по промокоду rzv.
Ждем вас!
Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzqvEBcVN
2 997
Призываю пользоваться реферальной системой в компании
🔸 Многие любят кэшбеки, скидки, промо-коды и прочие плюшки. Но при этом не все знают, что в IT компаниях часто дают бонусы за помощь в найме подходящих разработчиков.
🔸 Так называемая "реферальная система" работает примерно так:
• в компании есть открытая вакансия (не обязательно по твоей специальности)
• ты можешь порекомендовать специалиста на эту вакансию во внутреннем портале, заполнив форму с резюме и контактами
• ты не участвуешь в процессе собеседований этого конкретного кандидата
• если человека нанимают и испыталка успешно пройдена, выплачивают бонус
Бонусы бывают от 50 до 150 тыс рублей, в зависимости от сеньорности кандидата, размера компании и проблемности вакансии.
🔸 Почему за это платят?
• ускоряется найм, т.к. по рекомендациям обычно приходят более подготовленные спецы
• сокращаются затраты на найм, т.к. нужно платить за ATS, рекрутёрам, тратить время разработчиков и лидов на собесы
Т.е. если ты работаешь в компании, можешь небольшим вложением времени (5-10 мин на человека) добавить к ЗП неплохую премию.
А если ты ищешь работу, это хороший способ обойти первичные барьеры и поговорить с живыми людьми, повысить шанс трудоустройства.
Гарантий никаких, но и санкций каких-то я за это не вижу)
Давайте поможем друг другу!
📡 Оставляй в комментариях свой тг-никнейм и роли, на которые открыты реферальные позиции
Кто в поиске - присылайте им в личку резюме, сопроводительное, контакты и короткую мотивацию, почему вас можно рекомендовать.
p.s. Слышал, что есть мнение: "По рефералке нужно рекомендовать только тех, кого я лично знаю и за кого готов поручиться". Я его не понимаю, давай обсудим в комментах, если для тебя это важно
2 997
#реклама
Если ты идёшь в Data Engineering и хочешь больше практики, вот хороший канал.
Рекомендую канал Дмитрия. Он действующий дата-инженер и пишет про SQL и DE так, чтобы это можно было повторить руками.
Что там полезного:
🎯разборы рабочих кейсов и типовых ошибок
🎯объяснения для junior/middle
🎯практические штуки: пайплайны, Spark/Airflow, data quality
Канал: https://t.me/kuzmin_dmitry91
Профиль: https://t.me/dim4eg91
📌 Ещё у Дмитрия есть практикум по DE: где прокачка идёт через задания и понятную структуру.
2 997
+2
Ещё немного о Trino, который становится всё более популярным :)
🔸 У него много готовых коннекторов "из коробки". Для обращения в запросе к разным источникам достаточно сконфигурировать их как разные "каталоги".
🔸 Из интересных, помимо поддержки основных СУБД:
• Black hole (аналог /dev/null)
• Elasticsearch/Opensearch/Prometheus (агрегируем инфу по логам напрямую)
• Faker (ура, генератор данных для тестов)
• TPC-DS/TPC-H (ура, встроенные бенчмарки)
• Google sheets
• JMX/System (обращение к системным данным по всему кластеру Трино)
• Memory
• Thrift (вместо ODBC/JDBC)
🔸 Также есть плагины:
• exchange-filesystem
• exchange-hdfs
• functions-python
• geospatial
• kafka
• loki
• ml
• openlineage
• ranger
• teradata-functions
🔸 Так что если взять связку dbt + Trino, вы можете управлять практически чем угодно из одного места. Конечно, у каждого коннектора есть свои ограничения, маппинг типов данных не всегда удобен именно для текущего проекта с существующим легаси. Но мне нравится движение в эту сторону)
2 997
Как я стал дата инженером с ЗП 800к
Без удачи и связей
5 лет назад я работал в техподдержке с графиком 2/2 и жестко бухал💀💀💀 После очередной пьянки я понял, что надо что-то менять. Я решил стать дата инженером Составил резюме на коленке. Чудом получил свою первую работу с зп 50к в месяц 😎 Отработал 4 месяца и захотел больше. Ну и погнал дальше: собесы, отказы, новые офферы В прошлом году я пробил 800к рублей за один месяц Я выгорал, увольнялся, снова загорался и опять шел на собесы Задумался над своими ошибками... Как можно избежать их? Снял на эту тему видео, в котором рассказал:
- мой путь из техподдержки до техлида с зп 800к - какие ошибки я совершил и как их обойти - как выглядит типичный день ДЕЭто разбор реального пути: как с нуля дойти до первой работы дата инженером с хорошей зарплатой. Без булшита по типу "вкатись в ДЕ за месяц" 😏 👉 Смотри видео в закрепе моего канала Реклама. Богатырев А.Е. ИНН: 631204104044 Erid: 2Vtzqv12WR6
2 997
Мне не нравятся существующие курсы по Python:
• абстрактные задачи из алгебры или геометрии
• перегружены историей языка и мнением автора в текстовых описаниях
• задачи не столько прививают навык и закрепляют материал, сколько дают дофамин от решения
• рассчитаны на 3 месяца или полгода
А ещё я не нашёл ни одного курса Python для дата инженеров!
Есть для дата саентистов, для аналитиков, для бэкендеров. Не порядок, надо исправлять.
Поэтому я написал свой курс по python.
Заходи смотреть пробный урок
Ссылка на курс с промокодом 10% до 23 марта
RZVDE_10Оставил в курсе только то, что сам использовал на позициях middle и senior DE. Нет разделения на "начинающих" и "продолжающих". Дойдёшь до конца — хватит для работы в роли DE.
2 997
Ищу ассистента(ку)
Привет! Меня зовут Алексей, основатель сообщества @rzv_de для дата инженеров. Я помогаю улучшать карьерные условия — переходить в IT или повышать ЗП, переходить на удалёнку и более актуальный стэк и тд.
Если интересно развиваться в мире данных, изучать то как работает менторство изнутри и получить доступ к моей инфраструктуре и материалам — пиши в личку, почему стоит выбрать тебя. Я рассчитываю, что однажды ты "перерастёшь" роль ассистента и двинешься дальше.
Задачи в основном организационные:
• добавить нового менти в группу и выдать доступы
• доработать дашборды для внутренней статистики (datalens, sql, python)
• сделать минимальную обработку видео на youtube (пример)
• отсматривать предложку постов в "паровозике собеседований" на соответствие требований
• собрать информацию "в кучу" и оформить текст в Confluence
Многое можно автоматизировать — приветствую пайтон скрипты и прочее, вайбкодить разрешаю) Доступы уже выдаются по нажатию пары кнопок, в паровозик интегрирована AI транскрипция
Какие качества мне важны:
• желание расти и развиваться в одной из сфер: (Data Engineer, Data Analyst, Project Manager, Product Owner или менторство, онлайн-образование)
• силы и время, которые можешь уделять задачам (около 10ч в неделю)
• ценишь прозрачность, сможешь держать в курсе, какой статус по задачкам
• есть устойчивость к относительной рутине
Что предлагаю:
• 25к рублей в месяц
• свободный график без срочности ответа в чатах
• свободное общение со мной в чате и на звонках
• окружение, в котором можно быстрее развиваться по софтам и хардам
Основной проект: https://rzvde.pro
Youtube: https://youtube.com/@rzv_de
Telegram: https://t.me/rzv_de
2 997
Мой PR в образ andruche/greenplum приняли 🐘!
Забавно, что именно после ухода из найма я начал "контрибьютить в open source")
🔸 В чём вклад?
Раньше было захардкожено 2 сегмента. Теперь можно сбилдить любое число от 1 до 16.
Или пользуйтесь предварительно собранными версиями
$ docker run --name gp7 -p 5432:5432 -d andruche/greenplum:7
$ docker run --name gp7 -p 5432:5432 -d andruche/greenplum:7-4seg
$ docker run --name gp7 -p 5432:5432 -d andruche/greenplum:7-8seg
$ docker run --name gp6 -p 5432:5432 -d andruche/greenplum:6
$ docker run --name gp6 -p 5432:5432 -d andruche/greenplum:6-4seg
$ docker run --name gp6 -p 5432:5432 -d andruche/greenplum:6-8seg
https://github.com/andruche/docker-greenplum/pull/62 997
Очная программа «Дата-инженерия» от ФКН НИУ ВШЭ
Программа подготовит к профессии дата-инженера — архитектора конвейеров обработки данных и инфраструктуры работы с данными, востребованного в любой современной ИТ-компании. Обучение подойдет аналитикам, разработчикам и другим техническим специалистам, которые хотят систематизировать знания, освоить промышленные инструменты и собирать масштабируемые, отказоустойчивые системы.
Курс рассчитан на слушателей, которые уже уверенно владеют Python и SQL.
В ходе обучения вы:
🟣научитесь проектировать, собирать и оптимизировать конвейеры обработки данных (ETL)
🟣освоите хранилища данных и подходы к построению инфраструктуры работы с данными
🟣разберете обработку больших объемов данных и потоковую обработку
🟣научитесь формировать витрины данных и применять инструменты бизнес-аналитики
🟣получите базовые навыки администрирования баз данных и работы с аналитическими СУБД
🟣познакомитесь с NoSQL-системами и принципами управления данными (Data Governance)
🟣освоите применение машинного обучения на практике и работу с Apache Spark
🟣реализуете итоговый индивидуальный проект — полноценный пайплайн обработки данных для портфолио
📁Старт курса: 4 февраля, очный формат. Присоединиться можно до 11 февраля.
Узнать подробнее о программе 📍
Реклама. НИУ "ВШЭ". ИНН 7714030726. erid: 2SDnjcVSx4Q
2 997
Продолжаю помогать растущим DE каналам, потому что в своё время так же помогли мне)
От автора:
"""
Если вы только входите в data engineering или уже «крутитесь» в рабочих процессах заходите t.me/marat_notes
Разбираю в ютубе моменты работы дата-инженера и какие паттерны помогут пройти алгособесы без зубрёжки. Всё это в циклах #КакРаботаютДанные (ETL, Airflow, Spark) и #ГрокаемАлгособесы с диаграммами, кодом и пояснениями (материалы на гитхаб).
Плюс честная рефлексия: как не выгорать в IT и жить свою счастливую жизнь.
Подписывайтесь — будет полезно и технически, и по жизни.
"""
2 997
Перезагружай цепочку дагов в Airflow с лёгкостью
Много лет работаю с Airflow, только недавно узнал о ``ExternalTaskMarker``. Допустим, нужно перезагружать несколько дагов "по цепочке". Для этого после загрузки DAG1 хотелось бы автоматически очищать соответствующий запуск в DAG2.
Оказывается, если в DAG2 создать сенсор на такой маркер в DAG1, то "Clear marker task" с опцией Recursive будет делать ровно это. По крайней мере для дагов с аналогичным расписанием в start_date + schedule.
Осталось только добавить идемпотентность вида "overwrite partition", "replace s3 object", "delete + insert" и тд - и задача решена)
p.s. Добавлен, вроде, ещё аж в 2.0.0. И, судя по недавнему issues, сломан в 3.1.6 :D
2 997
Lakehouse для аналитиков и инженеров данных
Изучи набирающий популярность подход к построению хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino.
🌐 В программе курса:
▪️Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino.
▪️Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой.
▪️Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/Python-запросов.
▪️Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем.
▪️Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия.
🥸 Кто мы: R&D-центр Devhands.io, наш канал. Автор курса — Алексей Белозерский, руководитель направления Big Data Services в компании VK Tech.
🗓 Старт курса: 5 февраля, 18:00, 6 недель обучения.
Изучить программу и записаться можно здесь.
Ждем вас!
Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzqwJcqpo
