ar
Feedback
Я – Дата Инженер | Евгений Виндюков

Я – Дата Инженер | Евгений Виндюков

الذهاب إلى القناة على Telegram

💵 Как стать Data Engineer 🗄 Смотри Roadmap в закрепе! _____________________________ Автор @halltape Все вопросы по рекламе @k_shredinger

إظهار المزيد
5 949
المشتركون
+424 ساعات
+467 أيام
+16030 أيام
أرشيف المشاركات
ИИ всех уже заменил. Просто вы ещё не заметили Каждую неделю выходит новый ИИ. Естественно, читаешь новости об этом в разных
ИИ всех уже заменил. Просто вы ещё не заметили Каждую неделю выходит новый ИИ. Естественно, читаешь новости об этом в разных пабликах ИЛИ особено в тредс - там ощущение, будто люди уже полностью перешли на искусственный интеллект. Со стороны кажется, что ВСЁ! Нейронки заменили ВСЕХ! НА ЗАВОД! А потом смотришь на реальность. Человеки все еще ведут дела в Excel, используют гугл таблицы, продают вручную через менеджеров по продажам.. И где эти все АГЕНТЫ ИИ я не понимаю. Вот я ОСАГО например купил и там коэфициент неверный стоит у водителя.. Я пишу в поддержку, что поменяйте. Мне естественно отвечают люди. Т.е. сто процентов появится рано или поздно мощный джарвис, который будет работать, не как АЛИСА! Хотя Алису я вообще не воспринимаю, как конкурент OpenAI.. Мне кажется ChatGPT просто улетел в космос вместе с Гроком. Иногда можно просто букву написать, условно, и тебя уже понимают, что ты хочешь. Но пока я вижу, что реально пользуются всеми этим агентами либо погромисты, либо гики, которые любят все новое и современное. Обычные люди либо бояться до этого докасаться, либо просто не хотят ничего менять в своей жизни. Оно и так работает! Получку получил, пивка тяпнул, футбольчик глянул, да на боковую.. Эти ваши все технологии, как и Интернет.. он нам нах НЕ НУЖОН (цитируя классиков). Что по поводу компаний? Если раньше ты делал одну задачу неделю, а теперь с помощью ИИ закрываешь её за два дня, бизнес не всегда говорит: "Супер, ну отдыхай оставшиеся три дня" Он говорит: "Раз ты теперь быстрее, вот тебе ещё пять задач" И в итоге ты не стал работать меньше. Ты просто стал закрывать гораздо больший объём. Типа повышается планка того, сколько работы от тебя теперь ожидают. ИИ действительно помогает нам работать меньше? Или он просто позволяет бизнесу загрузить нас ещё сильнее? У вас в компаниях уже разрешают использовать ИИ? Стали работать быстрее? Или просто задач стало больше? @bootcampych_bot Кстати, 1 ноября стартует новый поток нашего BootCamp. Если давно думаете вкатиться в Data Engineering — переходите в нашего бота и записывайтесь. До старта ещё есть время, но набор уже активно идёт.

Заглянем внутрь современных инженерных платформ 14 октября Т-Банк приглашает на Platform Engineering Night — вечер для инжене
Заглянем внутрь современных инженерных платформ 14 октября Т-Банк приглашает на Platform Engineering Night — вечер для инженеров, которые создают платформы и помогают командам справляться с растущей сложностью разработки. Что будем делать: 🔴Обсудим внутренние платформы, которые помогают быстрее разрабатывать, запускать и сопровождать сервисы. Разберем, как масштабировать платформы, когда растет количество пользователей, сервисов и связей между ними. 🔴Расскажем про новые Т-ЦОДы — обсудим, как платформы помогают согласовать работу между дата-центрами в разных регионах. 🔴Покажем, как AI встроен в платформы и весь SDLC — от разработки до эксплуатации. 🔴Обсудим реальные инженерные кейсы с командами Т-Банка и других технологических компаний. ➡️Когда: 14 октября, начало в 18:00 📍Где: Онлайн и офлайн в ИТ-хабе Т-Банка в Санкт-Петербурге Мероприятие бесплатное, торопитесь занять место по ссылке на регистрацию.

Чем отличается DROP DELETE и TRUNCATE? Ролик сделал с помощью нейронки. Не знаю, может стоит пока свой голос ставить или записывать. Но графику рисует он прикольно! ▶️ Подписывайтесь на Youtube кстати Кстати P.S. Залетай на Ноябрьский BootCamp! - @bootcampych_bot

Вышла лаба от @rzv_de про CDC конвейер из PostgreSQL через Debezium и Kafka Connect в S3! Как и на других его стендах, доступ
+5
Вышла лаба от @rzv_de про CDC конвейер из PostgreSQL через Debezium и Kafka Connect в S3! Как и на других его стендах, доступ к инфраструктуре, UI и материалам в одном окне браузера. Алексей построил лабу по сценарию "что может сломаться в интеграции и как это чинить". После тренировки сможете более уверенно внедрять и обслуживать change data capture интеграции на работе. Какой опыт получите в процессе - Составите конфиг коннекторов, в которых на опыте поймёте, зачем нужна каждая строчка - Зарегистрируете source- и sink-коннекторы через REST API Kafka Connect - Пройдёте первичную загрузку 20 000 заказов и перейдёте к живому потоку данных с операциями I/U/D - В процессе несколько раз обновите конфиг коннектора, проследите за результатом изменений "на живую" - Научитесь ориентироваться в формате сообщений внутри топика - Попереключаете живой поток на разные форматы выгрузки в S3, JSONL и Parquet - Научитесь управлять объёмом и количеством файлов на выходе - Проследите, что и как сломается при остановке и удалении различных частей интеграции - Научитесь чинить эти поломки У каждого участника своя выделенная инфраструктура, экспериментируйте свободно! В конце вас ждёт сводная таблица с рекомендациями по диагностике и решению частых проблем. Кому подойдёт Нужен базовый SQL и опыт с СУБД, например Postgres. Опыт с Kafka не обязателен, есть необходимый минимум теории. Лаба пригодится, если на работе предстоит внедрять CDC, собираетесь переходить на проект с такой интеграцией. Или интересно разобраться, что за зверь этот CDC такой 😁 Прохождение займёт от 4 до 6 часов, доступ открыт 30 дней, материалы останутся в PDF. Забирайте лабу со скидкой 10% p.s. Ещё там есть лабы по Lakehouse (Iceberg, Trino, S3) и разбор ошибок при переходе на шардированный ClickHouse. Рекомендую для подготовки к работе с современным стеком!

10 вопросов по SQL для дата инженера https://www.threads.com/share/_vojZtIpk/ Этот пост набрал больше всего лайков или репост
10 вопросов по SQL для дата инженера https://www.threads.com/share/_vojZtIpk/ Этот пост набрал больше всего лайков или репостов в тредс Как думаете почему? И вообще есть какие-то вопросы, которые хотели бы знать, но боялись спросить?

Собес на 320к на руки на Дата Инженера! ▶️ https://youtu.be/lZKqJ978e1I Выложил собес. Все голоса я изменил. Никаких перс дан
Собес на 320к на руки на Дата Инженера! ▶️ https://youtu.be/lZKqJ978e1I Выложил собес. Все голоса я изменил. Никаких перс данных. Только вопросы с собеса. В целом вопросы базовые, но я не на все ответил прямо так, как надо. Например вопрос по Avro или по S3 комиттеру и не осилил. Этот собес был кажется в начале года. Там я вставил слева карточки с пояснениями во время вопросов. Но на те, что я ответил, ничего не добавлял. Задачи с собеса доступны в нашем @bootcampych_bot по команде /livecoding320 Просто отправь ему это и он скинет задачки. Там задача по SQL и Python

Накрутчики! Написал в Threads пост о том, как расти в ЗП в ДЕ. В комменты пришел человек, который не верит в то, что можно ос
+1
Накрутчики! Написал в Threads пост о том, как расти в ЗП в ДЕ. В комменты пришел человек, который не верит в то, что можно освоить Дата Инжиниринг с нуля и без коммерческого опыта зайти в профессию. Хотя буквально вот свежие есть оферы у наших выпускников, но все равно человек отказывается верить. Кто хочет поговорить - подписывайтесь на мой Threads. Туда каждый день выкладываю вопросы с собесов и в целом полезные вещи. https://www.threads.com/share/BAASwuJoVV/

Это последний поток BootCamp. ВСЁ. После Нового года мы будем поднимать цену. Поэтому ноябрьский поток — последняя возможность залететь на BootCamp по текущей стоимости. Если давно собирались, лучше не затягивать. Потом будет поздно 😁 ➡️ @bootcampych_bot Что вообще будет на BootCamp? За 2 месяца мы проходим весь основной стек Data Engineer: SQL, Python, Airflow, Spark, ClickHouse, Iceberg, Trino, DWH и собираем всё это не как набор отдельных технологий, а в нормальные рабочие пайплайны. Разбираемся, как технологии работают внутри, зачем нужен каждый инструмент и как они связываются между собой. Плюс у нас есть отдельные материалы по технологиям, практика, домашки и мок-собеседования. И отдельно мы докрутили систему по легенде и резюме: как нормально описать опыт и подготовиться к выходу на рынок, даже если коммерческого опыта в Data Engineering пока нет. Кому нужен BootCamp? Если SQL и Python уже знаете, а дальше смотрите на Spark, Airflow, ClickHouse, Trino и Iceberg и думаете: «А как всё это вообще между собой связано?» вам к нам. Если уже работаете Data Engineer / Data Analyst или в смежном IT и хотите закрыть пробелы, расширить стек и структурировать знания, тоже вам к нам. Короче. Ноябрьский поток — последний по старой цене. После Нового года будет дороже. ➡️ @bootcampych_bot

Если тебе до 25 и ты уже в IT В промежутке между 17 и 23 годами я учился на инженера в универе. У меня не было работы с высокой зп, бизнеса или даже идей, куда двигаться дальше и кем стать. Смотря сейчас на молодых ребят, кто вкатывается или уже работают в IT, сидя на удаленке и зарабатывая триллион, я конечно завидую. Это оч круто. Даже с той стороны, что вы раньше меня по возрасту включили мозг и направили в нужное русло. А те, кто нафармил себе еще квартиры, машины и вертолеты — вообще капитальные красавчики. К сожалению, когда я был таким же, как вы, у меня в окружении не было крутых ребят, кто фармил бабки или хотя бы двигался в этом направлении. Точнее были, но я не то тупил и не спрашивал, не то это были не совсем законные схемы-темки. Хотя я не тратил время зря и пробовал себя в разных направлениях: писал музыку, снимал видео, даже работал по специальности. Но где-то не хватило просто настойчивости, где-то смелости, а где-то просто ниша отстой. Поэтому кто вкатился или вкатывается в айтишку, я считаю вы сделали правильный выбор. Смотрите, хоть и кризис на дворе, но работа все еще есть и людей активно ищут. Не забывайте, мы с вами уже имеем багаж скилов и нам ничего не стоит поменять направление или апнуться по знаниям и запрыгнуть еще выше. Главное это.. не ленитесь. Кто постарше 30-40-50. Вы вообще молодцы. У кого семьи, дети, релокации. Если вы сейчас вкатываетесь в IT, то вам огромное уважение. Уровень сложности у вас в 10 раз выше, чем у молодых, которые только от мамкиной сиськи отцепились. Че я хочу сказать? Никого не слушаем, кто вам че говорит, что поздно или нереально. Особенно тех, кто пробовал и у него не получилось. Эти люди особенно не хотят видеть, что у вас получилось. Ну я их тоже понимаю. Очень обидно признавать, что ты проиграл. Такой пост мотивации. А я тем временем готовлю материал по спарку. Хочу сделать видео по ресурсам и оптимизации.

Собес на Дата Инженера + Лайвкодинг! (Middle) ▶️ https://youtu.be/fypWIMVBKxg На самом деле большинство собесов на ДЕшника ко
Собес на Дата Инженера + Лайвкодинг! (Middle) ▶️ https://youtu.be/fypWIMVBKxg На самом деле большинство собесов на ДЕшника конечно похожи друг на друга за исключением тех, где собеседующие реально готовятся по резюме и спрашивают архитектурные моменты или кейсы. Можете послушать (лица там не показаны) собес и оценить насколько вы готовы выходить на рынок. На нашем BootCamp мы проводим такие мок собеседования каждый поток, поэтому каждый из вас может протестировать себя перед выходом на рынок. Это очень полезная вещь. Даже если ты не готов.. можно проверить свои навыки презентации, особенно в стрессовом режиме. Это сильно бустит вас. Потом реальные собесы будут казаться проще по прохождению! Это запись мок собеса с нашего BootCamp Кстати, мы уже набираем Ноябрьский поток! Не пропусти! @bootcampych_bot

300к в наносекунду от нашего ученика! Я хз как это работает, но это уже второй рекордсмен, который залетает в IT после нашего
300к в наносекунду от нашего ученика! Я хз как это работает, но это уже второй рекордсмен, который залетает в IT после нашего буткемпа так быстро. Дальше отзыв от него. Запись на ноябрьский BootCamp ➡️@bootcampych_bot Прошёл буткэмп на Data Engineer у roadmappers и хочу поделиться своим опытом. Я пришёл в феврале с полного нуля. Начал учиться по Roadmap, сразу пошёл в SQL — около месяца занимался на курсе карпова, затем примерно три месяца учил Python на Stepik. К середине июня закончил с базой и связался с Женей, после чего с 1 июля попал на буткэмп. Сам буткэмп мне в целом зашел. Особенно крутая штука — инфраструктура, на которой можно самостоятельно всё потрогать и попробовать. При этом честно скажу: я использовал её далеко не на максимум. По сути, мой основной проект был достаточно простой — пайплайн, который забирал данные из API, складывал их в S3, а затем загружал в ClickHouse. Глубже в инфраструктуру я особо не погружался. Но самое большое значение для меня в итоге имел именно Roadmap. Я прошёлся по всем основным вопросам, подробно разбирал их с ИИ, дополнительно изучал материалы и банк собеседований. В результате этого материала мне оказалось более чем достаточно для подготовки к реальным интервью. Я вышел на рынок 1 сентября, а уже сегодня получил оффер. В начале октября выхожу на работу с зарплатой 300 000 ₽ на руки. Конечно, мне, возможно, немного повезло с тем, насколько быстро всё получилось, и у каждого этот путь может занимать разное время. Но для меня Roadmap + буткэмп действительно сработали. Главный совет начинающим: не надо пытаться выучить каждый инструмент от и до. Не нужно месяцами зубрить ClickHouse или пытаться запомнить весь Airflow вместе со всеми видами Executor’ов, это никому не нужно, с литкодом та же история. На собеседованиях гораздо важнее понимать основную теорию, уметь объяснить, как устроены процессы, и уверенно отвечать на вопросы. И ещё очень важно — не бояться собеседований. Я бы вообще советовал ходить на каждое интервью, даже если кажется, что пока не готов. Единственное - шлите нахуй сразу тех, кто просит проходить собеседование с двумя камерами, чтобы вы якобы не использовали ИИ, это сразу ред флаг того, что собеседующие беспросветные долбоебы. Каждое собеседование — это практика. С каждым новым интервью вы начинаете лучше понимать, что спрашивают, учитесь вести диалог и постепенно становитесь увереннее. На самом собеседовании тоже не стоит просто механически отвечать на вопросы. Нужно стараться поддерживать диалог с интервьюером, добавлять что-то от себя и показывать, что ты понимаешь не только техническую сторону, но и то, зачем бизнесу всё это нужно: сколько стоит решение, какие у него плюсы и минусы, почему выбрать одну технологию, а не другую и т.д. В общем, если вы готовы самостоятельно учиться, не боитесь разбираться в материале и быть волчарой, то Roadmap и буткэмп — действительно очень крутая связка для входа влета в ИТ с двух ног. Запись на ноябрьский BootCamp ➡️@bootcampych_bot

Упаковка опыта Друзья, если кому надо упаковать свой опыт для резюме, то рекомендую наш сервис https://roadmappers.ru/resume-
Упаковка опыта Друзья, если кому надо упаковать свой опыт для резюме, то рекомендую наш сервис https://roadmappers.ru/resume-studio Я специально его сделал. Под капотом LLM. Она берет ваш опыт (буквально любой) и переписывает под Дата Инженера. На скрине я показал, как это работает. При добавлении в HH у вас также может добавиться плашка "Конкретные достижения", что лучше влияет на внешний вид РЕЗЮМЕ. из этого:
написал пет проект, где брал данные из PG и грузил их в Greenplum. Также сделал проект по загрузке из API в S3 а потом в Clickhouse. Все развернул в докер compose. Понимаю Airflow, могу написать на Spark. Также немного пробовал dbt модели для учебного проекта
Получилось:
- Спроектировал и развернул контейнеризованную инфраструктуру на Docker Compose, объединив PostgreSQL, Apache Airflow, Greenplum и ClickHouse в единый изолированный контур для разработки и тестирования ETL-процессов. - Реализовал batch-пайплайн на Python и SQL для извлечения данных из PostgreSQL и загрузки в Greenplum, настроив оптимизированные дистрибутивные ключи и партиционирование таблиц для ускорения агрегационных запросов. - Построил интеграционный модуль для получения данных из внешнего REST API, сериализации в Parquet и загрузки в S3, обеспечив идемпотентность и дедупликацию записей при повторных запусках процесса. - Организационно настроил загрузку данных из S3 в ClickHouse с использованием columnar-формата, что позволило снизить время отклика на аналитические запросы примерно на 40% по сравнению с реляционным хранилищем. - Разработал DAG в Apache Airflow для оркестрации сквозного процесса обработки, добавив механизмы retry, SLA и алертинга о сбоях, что повысило надежность пайплайнов до 98%. - Провел черновой эксперимент с использованием Apache Spark (PySpark) для трансформации больших объемов данных, сравнив производительность с нативным SQL и подтвердив эффективность распределенной обработки. - Спроектировал набор dbt-моделей для учебного проекта, внедрив тесты качества данных и документацию зависимостей, что позволило автоматизировать валидацию схем и снизить количество ошибок нагрузки на 25%. - Настроил мониторинг состояния контейнеров и метрик выполнения задач через Prometheus и Grafana, обеспечивая прозрачность работы микросервисов данных и быстрое выявление узких мест. - Оптимизировал SQL-запросы в Greenplum и ClickHouse, внедрив индексы и переработав планы выполнения, что сократило среднее время вычисления отчётов с 120 до 45 секунд. - Подготовил финальные витрины данных для визуализации, интегрировав их с BI-инструментом, и обеспечил аналитиков актуальными данными с задержкой обновления менее 5 минут. Технологический стек: Python, SQL, PySpark, Apache Spark, Apache Airflow, dbt, PostgreSQL, Greenplum, ClickHouse, S3, Parquet, Docker, Docker Compose, Prometheus, Grafana

☁️☁️☁️☁️☁️☁️☁️ Дата-инженерия — это не только про ETL и пайплайны, это ещё и про то, куда движется вся экосистема данных. 24 сентября Yandex Cloud проведёт Yandex Scale 2026 — и в Data-треке будет ровно то, что стоит смотреть, если хотите понимать рынок, а не только свой стек.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 Расскажут, как Yandex Cloud собирает аналитику в единую бесшовную среду — от загрузки данных до готовых инсайтов, с ИИ на каждом шаге. Покажут, как YDB используют для рекомендательных и поисковых систем и ИИ-ассистентов. Отдельно — кейс «Додо Пиццы»: как компания перенесла десятки терабайт в Yandex Cloud и сравнивала опыт с западным облаком. Хороший пример для тех, кто когда-нибудь будет защищать миграцию перед своим CTO.
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
Ещё разберут путь Yandex Cloud к самоуправляемым базам данных — на опыте эксплуатации тысяч баз в Яндексе, и
миграцию Oracle Exadata на Lakehouse
без единого аврала («Азбука вкуса» поделится). На воркшопах — практика: разберём сценарии
Нейроаналитика в DataLens
, посмотрим, как
PGHouse даёт PostgreSQL
выполнять
OLAP-запросы в ClickHouse без переписывания SQL
, и соберём поисковую систему на Serverless YDB с полнотекстовыми и векторными индексами.
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
🎨
Офлайн
будет 2000+ человек
— есть с кем обсудить свой roadmap вживую, а не только в комментариях. Знакомиться удобно через
бот-мэтчер
— работает по принципу Tinder, сам подбирает собеседников.
Участие бесплатное, регистрация на сайте — заносите в календарь.

Что происходит с рынком DE? его нет. все кончено. только на завод. надо было раньше. раньше было лучше. ОТСТАВИТЬ ПАНИКУ! У нас есть чат выпускников BootCamp, и я сгрузил оттуда сообщения и пропустил через ChatGPT. Вот, что вышло: Рынок живой, но неоднородный: - вакансий достаточно, особенно в крупных банках, ритейле и интеграторах - работодатели стали заметно строже проверять реальный опыт - основной фильтр — SQL, Python, Spark и понимание DWH - удалёнка по РФ встречается часто, но хорошие предложения конкурируют за сильных специалистов - зарплаты для middle/senior в сильных командах находятся примерно в диапазоне 250–350 тыс. ₽ на руки - одновременно сохраняется большой слой вакансий на 150–200 тыс. ₽, часто с более тяжёлыми требованиями; - работодатели нередко ищут сразу нескольких инженеров, но вакансии могут долго висеть и пересматривать требования. Зарплаты 150–170 тыс. ₽ - junior/middle, небольшие компании, локальные требования около 200 тыс. ₽ - middle, аутсорсинг и банковские проекты 230–260 тыс. ₽ - middle с хорошим SQL/Python/Spark 300–350 тыс. ₽ - senior, streaming, ML-инфраструктура, крупные команды 350 тыс. ₽ и выше - сильный senior, удалёнка по миру, сложные data-платформы Примеры из чатов: Райффайзенбанк — от 300 тыс. ₽ на руки; X5 — 320–350 тыс. ₽ на руки; Selecty — 320–350 тыс. ₽ на руки; Kostylworks — около 350 тыс. ₽ на руки; Петрович Tech — 320–350 тыс. ₽ на руки; Альфа-проекты — примерно 200–320 тыс. ₽; отдельные вакансии — 150–170 тыс. ₽. Самый востребованный стек - SQL (Особенно CTE, оконные функции, JOIN, индексы, уровни изоляции, оптимизация запросов) - Python (Часто проверяют структуры данных, ООП, итераторы, декораторы, асинхронность и простые алгоритмические задачи) - Spark / PySpark (Партиционирование, shuffle, форматы Parquet/Avro, оптимизация, обработка больших объёмов данных) - Airflow (Построение и сопровождение DAG, расписания, пайплайны, отказоустойчивость) - Хранилища и DWH (ClickHouse, Greenplum, PostgreSQL, Hadoop, S3/MinIO, Trino, Iceberg) - Streaming (Kafka, Flink, Debezium и real-time-пайплайны появляются в более дорогих вакансиях) - Прочее (Мониторинг загрузок, поддержка продуктивных процессов, разбор инцидентов и качество данных становятся частью обычной работы DE) Как проходят собеседования HR-скрининг; техническое интервью; кейс или live coding; интервью с заказчиком или командой; иногда финальный этап непосредственно с банком; в отдельных компаниях — проверка документов, полиграф или дополнительные анкеты Типичные вопросы: как обработать 100 ГБ данных в Spark; почему Spark медленный; как устроены партиции и shuffle; отличие DWH от обычной БД; индексы, JOIN и уровни изоляции; проектирование схемы данных; решение SQL-задач; небольшие Python-задачи; опыт с реальными объёмами и архитектурой. При этом часть собеседований проходит без алгоритмов и live coding — только разговор по опыту и кейсам. Продолжение в комментах...

Как же мне было влом решать задачу! Собес на деньги: 320к - 350к на руки Скажу честно, когда вижу задачу на собесе с лайвкоди
Как же мне было влом решать задачу! Собес на деньги: 320к - 350к на руки Скажу честно, когда вижу задачу на собесе с лайвкодингом, сразу хочется просто скопировать в LLM и выдать ответ. Потому что оно реально так и решается. Я просто потерял смысл попыток решений таких задач. Кто пишет код вручную.. ну скорее всего сын маминой подруги. И тот самый айтишник, который в ОЙТИ еще со времен Рюрика. Кстати, выражаю огромный респект всем трушным программистам. Сейчас ОЙТИ уже не то... Я в этот раз решил честно все пройти, попробовать. Но, как же мне было влом... Ну буквально надо вырыть яму лопатой, когда рядом стоит эксаватор) Я написал где-то четверть и полностью забил на все нюансы из условий задачи. Задача на мой взгляд непростая. В плане надо сразу несколько условий держать в голове. Плюс это CLICKHOUSE. Какая компания, говорить не буду. Ну либо за 1млн долларов.
Есть таблица ClickHouse:

CREATE TABLE default.migration_report
(
    RunId UUID,
    CollectionName String,
    DocumentName String,
    StartedAt Nullable(DateTime),
    CompletedAt Nullable(DateTime),
    LastError String
)
ENGINE = ReplacingMergeTree
ORDER BY RunId
SETTINGS index_granularity = 8192;

Необходимо посчитать количество успешных и неуспешных загрузок за последний календарный месяц.

Результат должен содержать два столбца:

| succeeded | failed |

Условия:

1. Расчёт выполняется отдельно для каждого источника (`CollectionName`) и каждого календарного дня.
2. В течение одного дня у одного источника может быть несколько загрузок.
3. Если у источника произошла неуспешная загрузка (`LastError != ''`), то эта загрузка учитывается как failed, а все последующие загрузки этого источника в этот же день не учитываются.
4. Успешной считается загрузка, у которой `LastError = ''`.
5. Для преобразования даты и времени можно использовать функцию `toDate()`.

Напишите SQL-запрос для ClickHouse.
Решение задачи
WITH
    toStartOfMonth(addMonths(today(), -1)) AS month_start,
    toStartOfMonth(today()) AS month_end
SELECT
    countIf(LastError = '' AND previous_failed = 0) AS succeeded,
    countIf(LastError != '' AND previous_failed = 0) AS failed
FROM
(
    SELECT
        CollectionName,
        toDate(StartedAt) AS upload_date,
        LastError,

        sum(LastError != '') OVER
        (
            PARTITION BY CollectionName, toDate(StartedAt)
            ORDER BY StartedAt, RunId
            ROWS BETWEEN UNBOUNDED PRECEDING AND 1 PRECEDING
        ) AS previous_failed
    FROM default.migration_report
    WHERE StartedAt >= month_start
      AND StartedAt < month_end
)

🚀 8-й поток стартует уже ЗАВТРА! Ребят, кто хотел залететь на BootCamp по Data Engineering, но всё откладывал — вот он, тот
🚀 8-й поток стартует уже ЗАВТРА! Ребят, кто хотел залететь на BootCamp по Data Engineering, но всё откладывал — вот он, тот самый последний момент 😁 Сегодня и завтра — последняя возможность присоединиться к 8-му потоку. Дальше закрываем набор и начинаем учиться: SQL, Python, DE-стек, много практики, домашки, pet-проекты и живые занятия. Кто с нами — погнали в Буткемпыч бот 🚀

Хочу написать отзыв про буткемп. Меня зовут Тимур, я проходил курс буткемпа и разделил бы свой отзыв о курсе на несколько направлений: 1) Преподаватели Женя и Володя — классные ребята, которые очень хорошо подают материал, объясняют всё максимально понятно. Даже если возникают какие-то тупые вопросы, они подробно на них ответят и помогут донести информацию максимально понятно. Почти всегда находятся на связи вне уроков в чате в Telegram и всегда готовы помочь. 2) Формат и структура курса Очень классная идея, что курс максимально похож на рабочий процесс: есть Jira, Wiki, общий репозиторий и т. д. Благодаря этому те, кто с нуля приходит в профессию, будут гораздо увереннее чувствовать себя при устройстве на работу и в целом на собеседованиях. Отдельно хочется отметить идею с крупным пет-проектом. Это очень классный опыт, который позволяет поработать со всеми возможными задачами, которые могут встретиться в работе Дата инженера. Конечно, глубина погружения зависит от самого ученика — захочет ли он усложнять проект или глубже разбираться в каких-то темах. Но за счёт того, что пайплайн строится с нуля и от начала до конца, можно хорошо понять, что и как происходит на каждом этапе работы деешника. 3) Инфраструктура Очень круто настроена инфраструктура. За время обучения я вообще не сталкивался с проблемами, когда что-то падает или не работает, ресурсов более чем хватает. Также есть довольно широкий спектр инструментов на выбор, поэтому можно попробовать поработать практически со всеми актуальными «игрушками» дата-инженера в песочнице. Исходя из моего опыта, далеко не на каждой работе DevOps так хорошо настраивали инструменты. 4) Учебные материалы Мне нравится, что в видео даётся базовая, понятная и, наверное, самая необходимая информация по каждому из инструментов. А уже более глубокие темы можно изучить в Wiki — там довольно подробно и хорошо описаны различные детали. Если этого недостаточно, всегда можно обратиться к официальной документации. Но на первых этапах Wiki обычно вполне хватает. При этом важно понимать, что желательно иметь хорошую базу по SQL и Python — это обязательно. Также желательно иметь хотя бы общее представление о базах данных и принципах работы с данными, чтобы было проще усваивать и понимать информацию. Но это не является обязательным условием: если что-то непонятно, всё объяснят и помогут разобраться. В целом моя общая оценка крайне положительная. Мне всё понравилось, ставлю 10 из 10, всем советую)

У нас украли Буткемп. Но есть один нюанс — походу, люди сами не поняли, что именно они украли💩 Сегодня нашли наш Roadmappers
У нас украли Буткемп. Но есть один нюанс — походу, люди сами не поняли, что именно они украли💩 Сегодня нашли наш Roadmappers BootCamp на одном сайте со слитыми курсами. Стоит 500 рублей. Ну думаем, ладно. Дожили. Буткемп слили! Захожу посмотреть описание. И тут выясняется, что мы, оказывается, всё это время преподавали... СИСТЕМНОЕ АДМИНИСТРИРОВАНИЕ 😂 Цитирую описание нашего Буткемпа: «Востребованный курс по администрированию. Осваивайте системное администрирование, сетевые технологии и управление серверами». Блять! 7 потоков. Больше года: Spark. Kafka. Airflow. ClickHouse. PostgreSQL. GreenPlum. Iceberg. Trino. Строили ETL-пайплайны. Поднимали инфраструктуру. Работали с хранилищами. Разбирали архитектуру. А оказывается, готовили – сисадминов. Спасибо пиратам, хоть объяснили, чем мы занимаемся 😂 Но если серьёзно, эта ситуация очень хорошо показывает одну вещь. Слить Буткемп невозможно! Можно слить видеозаписи лекций. И если вам нужны именно они — ребят, ну вот они, оказывается, стоят 500 рублей.(покупка на свой страх и риск, мы не знаем чем на самом делел они там торгуют) Только сам Буткемп никогда не был набором видео. Ты можешь посмотреть 50 часов про Spark, GreenPlum и ClickHouse и остаться ровно на том же месте. Потому что самое важное начинается после лекции. Когда тебе нужно самому: 1. Написать пайплайн. 2. Сломать его. 3. Получить ошибку. 4. Не понять, почему оно не работает. 5. Разобраться. 6. Прийти к нам с вопросом. 7. Переделать. 8. Сделать домашку. 9. Собрать pet-проект. А потом соединить всё это в одну из работающих систем: 📍 API → S3 → ClickHouse 📍API → S3 → GreenPlum → DBT → ClickHouse 📍API → Spark → Iceberg → Trino → ClickHouse Вот это уже Буткемп!💪 Плюс менторы, обратная связь, разборы, инфраструктура, дополнительные блокноты, комьюнити, проекты и работа над тем, как потом весь полученный опыт нормально упаковать и выйти с ним на рынок. Этого в папку на торренте не положишь! Так что если хотите купить «курс системного администратора»(за ваш переход по сторонним ссылкам администраторы каналов, где находится пост отвественности не несут) за 500 рублей — велком ⚪️ А мы пока продолжим работать в направлении Data Engineer. Видео можно скачать. Опыт придётся получить самому. __________ И, кстати, раз уж пираты бесплатно подогнали нам рекламную интеграцию 😂 1 сентября стартует 8-й поток Буткемпа. Осталось — 7 мест. Записаться можно через нашего бота Буткемпыч.

На 8-й поток Буткемпа осталось 10 мест. Уже через неделю — 1 сентября. И вместе с новым учебным годом стартует новый поток Бу
На 8-й поток Буткемпа осталось 10 мест. Уже через неделю — 1 сентября. И вместе с новым учебным годом стартует новый поток Буткемпа 🚀 За время 7-го потока мы успели очень сильно докрутить программу. Доработали материал по Iceberg и Trino и выстроили полноценный рабочий пайплайн: API → Spark → Iceberg → Trino → ClickHouse Плюс мы подготовили систему для формирования легенды и описания опыта в резюме. Причём сделали её так, что она подойдёт даже охраннику, который вчера сидел на шлагбауме, а сегодня решил залететь в IT.💪 Кому вообще нужен Буткемп? Если ты уже знаешь SQL и Python, но дальше смотришь на Spark, Airflow, ClickHouse, Trino, Iceberg и думаешь: «Так... а как всё это изучать и как вообще между собой связано?» — тебе к нам. Если ты уже работающий Data Engineer / Data Analyst или на смежных IT вакансиях и хочешь расширить стек, закрыть пробелы и структурировать знания — тебе тоже к нам! На онлайн-занятиях мы подробно разбираем технологии, механизмы их работы и, самое главное, учимся структурно мыслить и понимать, зачем мы вообще используем тот или иной инструмент. А материала уже стало настолько много, что физически запихнуть всё в лекции невозможно. Поэтому по технологиям мы дополнительно подготовили отдельные блокноты: можно открыть нужную тему, пройти её самостоятельно, посмотреть примеры и разобраться глубже. Короче. 1 сентября — старт 8-го потока. Осталось 10 мест. Для записи переходи в бот Буткемпыч 👈