en
Feedback
rzv Data Engineering

rzv Data Engineering

Open in Telegram

Авторский канал о том, как я понимаю инжиниринг данных. Объясняю термины, best practice, делюсь описанием рабочих задачек. См закрепы Рассчитан на новичков в DE и инженеров до Senior. Чат: t.me/+jtQ1tjvNUtwzN2My По вопросам: @razvodov_de_mentor

Show more
2 997
Subscribers
+224 hours
-27 days
+2830 days
Posts Archive
О чём интересно почитать? Что волнует, о чём не хватает информации или интересно послушать моё мнение? Пиши в комменты

Clickhouse для программистов, аналитиков и инженеров данных Перестаньте ждать, пока считается аналитика. Научитесь использова
Clickhouse для программистов, аналитиков и инженеров данных Перестаньте ждать, пока считается аналитика. Научитесь использовать ClickHouse — СУБД, которая превращает минутные аналитические запросы в ответы за доли секунды. С первого дня — доступ к инфраструктуре для практики. 🌐 Чему вы научитесь: 🤩 Архитектура одиночных и кластерных инсталляций ClickHouse: как устроена система изнутри и как масштабировать её под реальные нагрузки 🤩 Хранение данных: движки MergeTree, партиционирование и сжатие — как держать терабайты аналитических данных при минимальных затратах на инфраструктуру. 🤩 Обработка миллиардов строк за секунды: построение эффективных запросов, агрегаций и материализованных представлений. 🤩 ClickHouse в продакшене: использование в приложениях, продуктовой аналитике и типичные грабли, на которые наступают почти все 🤩 Живая практика без отрыва от работы: не более 2-3 часов в неделю, разбор задач с экспертом в групповом чате. 🥸 Кто мы: R&D-центр Devhands. Автор курса — Алексей Белозерский, Chief Data Officer в inSales (СБЕР 2В), ex: VK Tech, М.Видео, Эльдорадо 🗓 Старт курса: 11 июня, 6 недель обучения. Изучить программу и записаться можно здесь. Ждем вас! Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzqxNnFKA

#термин_дня Термины в DE, которые легко перепутать 🔸 Часть слов в инжиниринге данных значат совсем разное в зависимости от контекста. Подобрал семь таких — на которых сам спотыкался. миграция — либо изменение структуры таблицы (Alembic, Flyway, Liquibase), либо переезд с одного инструмента на другой (с Oracle в Greenplum). Мне в контексте DE чаще встречался второй смысл, но с бэкендерами часто говорили о разном. схема — либо структура колонок и типов внутри таблицы, либо namespace в базе (public.users vs raw.users). Во фразе «у нас в схеме dwh поменялась схема таблицы orders» оба значения встречаются подряд. база данных — либо объект внутри СУБД (CREATE DATABASE foo), либо сама СУБД (Postgres, Greenplum, Clickhouse). Отсюда вопросы вроде «у нас одна база или несколько» — и непонятно, про что вообще речь. транзакция — либо транзакция БД (BEGIN/COMMIT, ACID), либо бизнес-транзакция (платёж, перевод денег) в обсуждении требований. Иногда так ещё называют отдельную запись в логе операций — третий смысл, который всплывает в разговоре с аналитиками. ключ — primary key (уникальный идентификатор строки), business key (уникальный с точки зрения бизнеса, типа email), surrogate key (искусственный, auto-increment или hash), partition key в Kafka (определяет, в какую партицию записать сообщение), hash key в Data Vault. Все «ключи», но решают разные задачи. снэпшот — либо backup БД на момент времени, либо dbt snapshot для отслеживания SCD type 2, либо filesystem-снэпшот (ZFS, LVM, Btrfs), либо Iceberg/Delta Lake snapshot (версия таблицы для time travel). partition — в Kafka это шард топика, по которому раскладываются сообщения для параллельного чтения консьюмерами; в Greenplum — секция таблицы, физически отдельный кусок данных, который можно дропнуть или подменить через EXCHANGE PARTITION; в Spark — кусок DataFrame, который обрабатывает один task внутри executor'а.

photo content

Ты узнаешь его из тысячи…. по юморным постам/ по леопарду/ по таблиське Человек, который познал и зимовки на райских островах (не без происшествий🏍), и собесы в Яндекс, и суровую офисную жизу, и теперь с юмором обо всём этом рассказывает нам! ⭐️ Да-да, встречайте, тот самый Глеб Михайлов! Надо сказать, что его тг-канал особенный: один раз увидишь — не забудешь никогда. Вот самые сочные посты, которые достойны вашего внимания: ⚡️ главная ошибка в обучении Data Science ⚡️ топ-8 примеров как НЕПРАВИЛЬНО обучают алгоритмам ⚡️ редфлаги офисного кореша😀🚩 ⚫️Подпишись для хорошего настроения и рабочих лайфхаков: @mikhaylovgleb Реклама: ИП Михайлов Глеб Михайлович, ИНН 500125076224, erid: 2VtzqvMx4sh

Докиньте маленько бустов, спамить сторисами не буду) https://t.me/boost/rzv_de

Не пытайся изучить все новые сверкающие инструменты Не сможешь. Успокаивающая FOMO карта технологий (на 2024 год, с тех пор е
Не пытайся изучить все новые сверкающие инструменты Не сможешь. Успокаивающая FOMO карта технологий (на 2024 год, с тех пор ещё больше): https://api.mattturck.com/landscape/mad2024.pdf p.s. да, полезно со временем выучить по одному инструменту из каждой категории, но это не значит что до тех пор нельзя работать работу p.p.s. да, инструменты в основном зарубежные и редко встречаются на РУ рынке. но тут и там встречаются "убийцы гринпламов" и "вам срочно нужно узнать о технологии Х" Не нужно. Lakehouse (Iceberg + Trino) всё чаще встречается в вакансиях, его можно. Остальное не нужно

Lakehouse для аналитиков и инженеров данных Изучи набирающий популярность подход к построению хранилищ данных Data Lakehouse
Lakehouse для аналитиков и инженеров данных Изучи набирающий популярность подход к построению хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. 🌐 В программе курса: ▪️Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino. ▪️Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. ▪️Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/​Python-запросов. ▪️Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. ▪️Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. 🥸 Кто мы: R&D-центр Devhands.io, наш канал. Автор курса — Алексей Белозерский, руководитель направления Big Data Services в компании VK Tech. 🗓 Старт курса: 16 апреля, 6 недель обучения. Изучить программу и записаться можно здесь. Подписчикам канала 10% скидка по промокоду rzv. Ждем вас! Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzqvEBcVN

Призываю пользоваться реферальной системой в компании 🔸 Многие любят кэшбеки, скидки, промо-коды и прочие плюшки. Но при это
Призываю пользоваться реферальной системой в компании 🔸 Многие любят кэшбеки, скидки, промо-коды и прочие плюшки. Но при этом не все знают, что в IT компаниях часто дают бонусы за помощь в найме подходящих разработчиков. 🔸 Так называемая "реферальная система" работает примерно так: • в компании есть открытая вакансия (не обязательно по твоей специальности) • ты можешь порекомендовать специалиста на эту вакансию во внутреннем портале, заполнив форму с резюме и контактами • ты не участвуешь в процессе собеседований этого конкретного кандидата • если человека нанимают и испыталка успешно пройдена, выплачивают бонус Бонусы бывают от 50 до 150 тыс рублей, в зависимости от сеньорности кандидата, размера компании и проблемности вакансии. 🔸 Почему за это платят? • ускоряется найм, т.к. по рекомендациям обычно приходят более подготовленные спецы • сокращаются затраты на найм, т.к. нужно платить за ATS, рекрутёрам, тратить время разработчиков и лидов на собесы Т.е. если ты работаешь в компании, можешь небольшим вложением времени (5-10 мин на человека) добавить к ЗП неплохую премию. А если ты ищешь работу, это хороший способ обойти первичные барьеры и поговорить с живыми людьми, повысить шанс трудоустройства. Гарантий никаких, но и санкций каких-то я за это не вижу) Давайте поможем друг другу! 📡 Оставляй в комментариях свой тг-никнейм и роли, на которые открыты реферальные позиции Кто в поиске - присылайте им в личку резюме, сопроводительное, контакты и короткую мотивацию, почему вас можно рекомендовать. p.s. Слышал, что есть мнение: "По рефералке нужно рекомендовать только тех, кого я лично знаю и за кого готов поручиться". Я его не понимаю, давай обсудим в комментах, если для тебя это важно

#реклама Если ты идёшь в Data Engineering и хочешь больше практики, вот хороший канал. Рекомендую канал Дмитрия. Он действующий дата-инженер и пишет про SQL и DE так, чтобы это можно было повторить руками. Что там полезного: 🎯разборы рабочих кейсов и типовых ошибок 🎯объяснения для junior/middle 🎯практические штуки: пайплайны, Spark/Airflow, data quality Канал: https://t.me/kuzmin_dmitry91 Профиль: https://t.me/dim4eg91 📌 Ещё у Дмитрия есть практикум по DE: где прокачка идёт через задания и понятную структуру.

Ещё немного о Trino, который становится всё более популярным :) 🔸 У него много готовых коннекторов "из коробки". Для обращен
+2
Ещё немного о Trino, который становится всё более популярным :) 🔸 У него много готовых коннекторов "из коробки". Для обращения в запросе к разным источникам достаточно сконфигурировать их как разные "каталоги". 🔸 Из интересных, помимо поддержки основных СУБД: • Black hole (аналог /dev/null) • Elasticsearch/Opensearch/Prometheus (агрегируем инфу по логам напрямую) • Faker (ура, генератор данных для тестов) • TPC-DS/TPC-H (ура, встроенные бенчмарки) • Google sheets • JMX/System (обращение к системным данным по всему кластеру Трино) • Memory • Thrift (вместо ODBC/JDBC) 🔸 Также есть плагины: • exchange-filesystem • exchange-hdfs • functions-python • geospatial • kafka • loki • ml • openlineage • ranger • teradata-functions 🔸 Так что если взять связку dbt + Trino, вы можете управлять практически чем угодно из одного места. Конечно, у каждого коннектора есть свои ограничения, маппинг типов данных не всегда удобен именно для текущего проекта с существующим легаси. Но мне нравится движение в эту сторону)

Как я стал дата инженером с ЗП 800к Без удачи и связей 5 лет назад я работал в техподдержке с графиком 2/2 и жестко бухал 💀�
Как я стал дата инженером с ЗП 800к Без удачи и связей
5 лет назад я работал в техподдержке с графиком 2/2 и жестко бухал
💀💀💀 После очередной пьянки я понял, что надо что-то менять. Я решил стать дата инженером Составил резюме на коленке. Чудом получил свою первую работу с зп 50к в месяц 😎 Отработал 4 месяца и захотел больше. Ну и погнал дальше: собесы, отказы, новые офферы В прошлом году я пробил 800к рублей за один месяц Я выгорал, увольнялся, снова загорался и опять шел на собесы Задумался над своими ошибками... Как можно избежать их? Снял на эту тему видео, в котором рассказал:
- мой путь из техподдержки до техлида с зп 800к - какие ошибки я совершил и как их обойти - как выглядит типичный день ДЕ
Это разбор реального пути: как с нуля дойти до первой работы дата инженером с хорошей зарплатой. Без булшита по типу "вкатись в ДЕ за месяц" 😏 👉 Смотри видео в закрепе моего канала Реклама. Богатырев А.Е. ИНН: 631204104044 Erid: 2Vtzqv12WR6

Мне в своё время таких историй не хватало, делюсь с вами

Мне не нравятся существующие курсы по Python: • абстрактные задачи из алгебры или геометрии • перегружены историей языка и мн
Мне не нравятся существующие курсы по Python: • абстрактные задачи из алгебры или геометрии • перегружены историей языка и мнением автора в текстовых описаниях • задачи не столько прививают навык и закрепляют материал, сколько дают дофамин от решения • рассчитаны на 3 месяца или полгода А ещё я не нашёл ни одного курса Python для дата инженеров! Есть для дата саентистов, для аналитиков, для бэкендеров. Не порядок, надо исправлять. Поэтому я написал свой курс по python. Заходи смотреть пробный урок Ссылка на курс с промокодом 10% до 23 марта
RZVDE_10
Оставил в курсе только то, что сам использовал на позициях middle и senior DE. Нет разделения на "начинающих" и "продолжающих". Дойдёшь до конца — хватит для работы в роли DE.

Ищу ассистента(ку) Привет! Меня зовут Алексей, основатель сообщества @rzv_de для дата инженеров. Я помогаю улучшать карьерные условия — переходить в IT или повышать ЗП, переходить на удалёнку и более актуальный стэк и тд. Если интересно развиваться в мире данных, изучать то как работает менторство изнутри и получить доступ к моей инфраструктуре и материалам — пиши в личку, почему стоит выбрать тебя. Я рассчитываю, что однажды ты "перерастёшь" роль ассистента и двинешься дальше. Задачи в основном организационные: • добавить нового менти в группу и выдать доступы • доработать дашборды для внутренней статистики (datalens, sql, python) • сделать минимальную обработку видео на youtube (пример) • отсматривать предложку постов в "паровозике собеседований" на соответствие требований • собрать информацию "в кучу" и оформить текст в Confluence Многое можно автоматизировать — приветствую пайтон скрипты и прочее, вайбкодить разрешаю) Доступы уже выдаются по нажатию пары кнопок, в паровозик интегрирована AI транскрипция Какие качества мне важны: • желание расти и развиваться в одной из сфер: (Data Engineer, Data Analyst, Project Manager, Product Owner или менторство, онлайн-образование) • силы и время, которые можешь уделять задачам (около 10ч в неделю) • ценишь прозрачность, сможешь держать в курсе, какой статус по задачкам • есть устойчивость к относительной рутине Что предлагаю: • 25к рублей в месяц • свободный график без срочности ответа в чатах • свободное общение со мной в чате и на звонках • окружение, в котором можно быстрее развиваться по софтам и хардам Основной проект: https://rzvde.pro Youtube: https://youtube.com/@rzv_de Telegram: https://t.me/rzv_de

Мой PR в образ andruche/greenplum приняли 🐘! Забавно, что именно после ухода из найма я начал "контрибьютить в open source")
Мой PR в образ andruche/greenplum приняли 🐘! Забавно, что именно после ухода из найма я начал "контрибьютить в open source") 🔸 В чём вклад? Раньше было захардкожено 2 сегмента. Теперь можно сбилдить любое число от 1 до 16. Или пользуйтесь предварительно собранными версиями

$ docker run --name gp7 -p 5432:5432 -d andruche/greenplum:7
$ docker run --name gp7 -p 5432:5432 -d andruche/greenplum:7-4seg
$ docker run --name gp7 -p 5432:5432 -d andruche/greenplum:7-8seg
$ docker run --name gp6 -p 5432:5432 -d andruche/greenplum:6
$ docker run --name gp6 -p 5432:5432 -d andruche/greenplum:6-4seg
$ docker run --name gp6 -p 5432:5432 -d andruche/greenplum:6-8seg
https://github.com/andruche/docker-greenplum/pull/6

Очная программа «Дата-инженерия» от ФКН НИУ ВШЭ Программа подготовит к профессии дата-инженера — архитектора конвейеров обраб
Очная программа «Дата-инженерия» от ФКН НИУ ВШЭ Программа подготовит к профессии дата-инженера — архитектора конвейеров обработки данных и инфраструктуры работы с данными, востребованного в любой современной ИТ-компании. Обучение подойдет аналитикам, разработчикам и другим техническим специалистам, которые хотят систематизировать знания, освоить промышленные инструменты и собирать масштабируемые, отказоустойчивые системы. Курс рассчитан на слушателей, которые уже уверенно владеют Python и SQL. В ходе обучения вы: 🟣научитесь проектировать, собирать и оптимизировать конвейеры обработки данных (ETL) 🟣освоите хранилища данных и подходы к построению инфраструктуры работы с данными 🟣разберете обработку больших объемов данных и потоковую обработку 🟣научитесь формировать витрины данных и применять инструменты бизнес-аналитики 🟣получите базовые навыки администрирования баз данных и работы с аналитическими СУБД 🟣познакомитесь с NoSQL-системами и принципами управления данными (Data Governance) 🟣освоите применение машинного обучения на практике и работу с Apache Spark 🟣реализуете итоговый индивидуальный проект — полноценный пайплайн обработки данных для портфолио 📁Старт курса: 4 февраля, очный формат. Присоединиться можно до 11 февраля. Узнать подробнее о программе 📍 Реклама. НИУ "ВШЭ". ИНН 7714030726. erid: 2SDnjcVSx4Q

Продолжаю помогать растущим DE каналам, потому что в своё время так же помогли мне) От автора: """ Если вы только входите в data engineering или уже «крутитесь» в рабочих процессах заходите t.me/marat_notes Разбираю в ютубе моменты работы дата-инженера и какие паттерны помогут пройти алгособесы без зубрёжки. Всё это в циклах #КакРаботаютДанные (ETL, Airflow, Spark) и #ГрокаемАлгособесы с диаграммами, кодом и пояснениями (материалы на гитхаб). Плюс честная рефлексия: как не выгорать в IT и жить свою счастливую жизнь. Подписывайтесь — будет полезно и технически, и по жизни. """

Перезагружай цепочку дагов в Airflow с лёгкостью Много лет работаю с Airflow, только недавно узнал о ``ExternalTaskMarker``.
Перезагружай цепочку дагов в Airflow с лёгкостью Много лет работаю с Airflow, только недавно узнал о ``ExternalTaskMarker``. Допустим, нужно перезагружать несколько дагов "по цепочке". Для этого после загрузки DAG1 хотелось бы автоматически очищать соответствующий запуск в DAG2. Оказывается, если в DAG2 создать сенсор на такой маркер в DAG1, то "Clear marker task" с опцией Recursive будет делать ровно это. По крайней мере для дагов с аналогичным расписанием в start_date + schedule. Осталось только добавить идемпотентность вида "overwrite partition", "replace s3 object", "delete + insert" и тд - и задача решена) p.s. Добавлен, вроде, ещё аж в 2.0.0. И, судя по недавнему issues, сломан в 3.1.6 :D

Lakehouse для аналитиков и инженеров данных Изучи набирающий популярность подход к построению хранилищ данных Data Lakehouse
Lakehouse для аналитиков и инженеров данных Изучи набирающий популярность подход к построению хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. 🌐 В программе курса: ▪️Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino. ▪️Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. ▪️Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/​Python-запросов. ▪️Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. ▪️Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. 🥸 Кто мы: R&D-центр Devhands.io, наш канал. Автор курса — Алексей Белозерский, руководитель направления Big Data Services в компании VK Tech. 🗓 Старт курса: 5 февраля, 18:00, 6 недель обучения. Изучить программу и записаться можно здесь. Ждем вас! Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzqwJcqpo