en
Feedback
5 minutes of data

5 minutes of data

Open in Telegram

I’m making my life less dull by spending time learning and researching “how it works“ in the data engineering field. Интерактивный учебник SQL https://querynomic.one/#/ по всем вопросам @just_vanich

Show more
1 951
Subscribers
No data24 hours
+137 days
+4230 days
Posts Archive
Moonlink 🥮 Новый движок загрузки для Apache Iceberg, который сразу умеет работать со стримингом, insert’ами и upsert’ами. Он подключается к Postgres CDC, Kafka или OTEL и пишет данные в Iceberg без лишней возни с компакшеном. Главная фишка Moonlink — он буферизует и индексирует данные на NVMe, а в Iceberg сбрасывает уже оптимизированные Parquet и deletion vectors. В отличие от привычных инструментов, которые плодят тысячи мелких файлов и тормозят чтение, здесь таблицы остаются лёгкими и быстрыми. Поддерживаются DuckDB, Spark и Postgres, а для задач с «живыми» данными — расширения вроде pg_mooncake и duckb_mooncake. Сейчас Moonlink в превью, так что детали ещё будут меняться. @data_whisperer

BlaBlaCar: Scaling Success - The dbt Ecosystem at BlaBlaCar Представьте себе управление 4000 таблиц и 300 отчётами в различных бизнес-сферах. Это повседневная реальность BlaBlaCar, и именно поэтому экосистема DBT — не просто преимущество, а жизненная необходимость. В блоге рассказывается о том, как была создана комплексная экосистема dbt, основанная на dbt Core, Airflow, dbtDagGenerator, Dev Containers, изолированных dev окружениях в BigQuery и проверках CI/CD. @data_whisperer

Fivetran покупает DBT? Не так давно Fivetran купил SQLMesh, а теперь присматривается к DBT. Обсуждение новости можно почитать
Fivetran покупает DBT? Не так давно Fivetran купил SQLMesh, а теперь присматривается к DBT. Обсуждение новости можно почитать на Reddit. @data_whisperer

Bytewax: Python Stateful Stream Processing Framework Bytewax — это stateful stream processing framework, написанный на Python и основанный на движке Rust, предназначенный для создания пайплайнов и приложений в режиме реального времени. Он поддерживает масштабируемые развёртывания, автоматически управляет состоянием и предлагает гибкий API для таких операций, как map, filter, join. Бесшовная интеграция с библиотеками Python и источниками данных, такими как: Kafka и Filesystem. @data_whisperer

Cloudflare Data Platform Cloudflare анонсировали свою data platform, которая включает: - Cloudflare Pipelines Для извлечения данных и преобразования данных. - R2 Data Catalog Каталог для управления метаданными iceberg. - R2 SQL Распределенный SQL движок. Все вместе это предоставляет платформу данных полного цикла. Появился еще один игрок в мире данных, который использует решения для modern data stack. Платформа построена на открытых стандартах, что значит вы можете выбрать любой query engine для Iceberg, а так же интегрироваться с Databricks или Snowflake. @data_whisperer

В телеграм не так много авторских каналов, чьи посты ждешь с нетерпением. Один из таких каналов — Я (Лена) и моя (не)работа. Лена — ex-Gooler, работала в Confluent и Redpanda, а это значит, что она «шарит» за распределенные системы. Сейчас Лена ведет курс по system designe для студентов бакалавриату Cunstructor University Bremen! Посты разбавлены юмором и особым авторским слогом. Это не только сухая выжимка технических терминов, но и истории из жизни, выбор преподавания и о том, как появился книжный клуб, где каждую неделю проходят онлайн встречи.

PG_DUCKDB DuckDB анонсировали расширение pg_duckdb для PostgreSQL с открытым исходным кодом, которое позволяет использовать векторизованный аналитический движок DuckDB непосредственно в PostgreSQL. Это можно рассматривать как добавление турбо-движка к вашей базе данных, готового к выполнению эффективных запросов, в то время как PostgreSQL продолжает выполнять то, что у него получается лучше всего: транзакционные рабочие нагрузки для вашего приложения. @data_whisperer

Future Data Systems Seminar Series — Fall 2025 Университет CARNEGIE MELLON проводит обучающие курсы по система управления баз
Future Data Systems Seminar Series — Fall 2025 Университет CARNEGIE MELLON проводит обучающие курсы по система управления базами данных. На канале уже были посты про эти курсы 1, 2 , 3 В рамках этой серии выступлений будут представлены идеи современных архитектур систем и технологий для хранения, управления и доступа к базам данных. Все выступления проходят онлайн и открыты для широкой аудитории через Zoom. Для участия не обязательно быть текущим студентом CMU. Программа семинаров тут А я пока что пошел смотреть первое видео An Extremely Technical Overview of How Apache Iceberg Planning Actually Works Ну вы только посмотрите на программу семинаров, это определенно стоит смотреть! @just_vanich

Future Data Systems Seminar Series — Fall 2025 Университет CARNEGIE MELLON проводит обучающие курсы по система управления базами данных. На канале уже были посты про эти курсы 1, 2 , 3 В рамках этой серии выступлений будут представлены идеи современных архитектур систем и технологий для хранения, управления и доступа к базам данных. Все выступления проходят онлайн и открыты для широкой аудитории через Zoom. Для участия не обязательно быть текущим студентом CMU. Программа семинаров тут А я пока что пошел смотреть первое видео An Extremely Technical Overview of How Apache Iceberg Planning Actually Works Ну вы только посмотрите на программу семинаров, это определенно стоит смотреть! @just_vanich

Data Engineering Design Patterns: Глава 3 - Error Management Design Patterns Продолжаю читать Data Engineering Design Patterns, краткое summary по паттерну Dead-Letter. В работе с потоковыми данными часто встречается проблема: одна битая запись может уронить весь пайплайн. Особенно обидно, когда речь о долгоживущих стриминговых задачах — остановка ломает SLA и требует ручного вмешательства. Один из классических способов справиться с этим — паттерн Dead-Letter. Его идея проста: валидные данные продолжают обрабатываться, а ошибочные сохраняются отдельно, для последующего разбора. Как это устроено на практике: — в уязвимых местах кода (например, парсинг, кастомные функции) добавляются защитные блоки; — плохая запись сохраняется вместе с метаданными — исходный payload, причина ошибки, время, offset, версия job; — данные уходят в отдельное хранилище dead-letter. Кандидаты для такого хранилища: объектные стораджи (S3, GCS), Kafka. Главное — надёжность, возможность мониторинга и при необходимости повторного воспроизведения. Зачем это нужно: Пайплайн не падает из-за единичных ошибок. Остаётся контекст для расследования. Можно при необходимости настроить replay и повторно «догнать» данные. Но у подхода есть и подводные камни: — Если включить повторную загрузку (replay), можно запустить лавину пересчётов downstream-систем — так называемый snowball backfilling. — Порядок событий может нарушиться: например, для пользовательских сессий это критично. — Dead-Letter может скрыть настоящие фатальные сбои, поэтому важно настроить алерты и пороговые значения: при массовых ошибках джоб лучше останавливать. В итоге организация должна выбрать приоритет: — либо стабильность и своевременность (но часть данных может потеряться), — либо полнота данных (но появляется риск несогласованности и роста нагрузки на системы). Dead-Letter делает пайплайны устойчивыми: они продолжают работать, даже если отдельные события битые. Но использовать его стоит осознанно — с мониторингом, метаданными и пониманием того, как downstream будет жить с частичными или переигранными данными. примеры кода @data_whisperer

🔥 Data Forge — Data Engineering Playground Современный учебный стенд для работы с данными. Запускайте основные компоненты реальной платформы данных и отрабатывайте сквозные рабочие процессы локально. Вместо того чтобы просто читать о «Datalake или Lakehouse, вы действительно можете их запускать. Представьте это как тренажёрный зал для дата-инженеров без облачных расходов и рисков в продакшене. Хорошая альтернатива платным буткемпам! Качественно проработаная структура проекта с примерами, документацией и заметками. The battlefield of data engineering isn’t won by one playbook, it’s forged in shared practice. @data_whisperer

Is It Worth the Time? Недавно наткнулся на комикс xkcd, который отлично иллюстрирует наш вечный порыв автоматизировать всё. В
Is It Worth the Time? Недавно наткнулся на комикс xkcd, который отлично иллюстрирует наш вечный порыв автоматизировать всё. В нём есть таблица: сколько времени можно потратить на оптимизацию задачи, чтобы она действительно окупилась за несколько лет. Например, если задача повторяется раз в неделю и занимает минуту, то за пять лет вы сэкономите всего около четырёх часов. Значит, если вы потратили неделю на написание идеального скрипта — никакой экономии уже нет. Комикс смешной, но в нём много правды. Иногда автоматизация оправдана — особенно если ею будут пользоваться многие. А иногда быстрее просто сделать по-старому, чем строить умное решение. Ирония в том, что, пока мы думаем, стоит ли оптимизировать задачу, мы уже тратим время — и это тоже попадает в таблицу. @data_whisperer

PondPilot - Get your data 🦆 in a row PondPilot — это очень быстрый, легковесный, полностью клиентский инструмент для исследования данных с поддержкой ИИ, который помогает вам анализировать локальные и удалённые данные без необходимости настройки. Основан на DuckDB-Wasm и интегрированной поддержке AI, он полностью работает в вашем браузере — без установки, серверов и загрузки данных в облако, с полным сохранением конфиденциальности. @data_whisperer

Data Platform Fundamentals Небольшая брошюра от Dagster про архитектуру и дизайн modern data platform. файл в комментариях
Data Platform Fundamentals Небольшая брошюра от Dagster про архитектуру и дизайн modern data platform. файл в комментариях

Polars at Decathlon: Ready to Play? Компания Decathlon снизила сложность инфраструктуры и затраты, перейдя на Polars для обработки данных объемом до 50 GB, заменив pandas и дополнив Spark. Новый стриминговый движок Polars позволил обрабатывать потоковые пайплайны с объемом данных до 1 TB, используя всего 10 GB оперативной памяти GB RAM. Этот переход обеспечил почти нулевые вычислительные затраты, значительно ускорил выполнение задач и упростил разработку пайплайнов для соответствующих нагрузок.

Iceberg Support in DuckDB DuckDB Iceberg позиционируется как простой способ работы с таблицами Apache Iceberg без зависимостей, в отличие от сложностей настройки Spark/Java. В предстоящем выпуске версии 1.4 DuckDB добавит поддержку чтения и записи таблиц версии 2, чтения таблиц версии 3, каталогов S3/GCS/R2, а также лёгкий клиент на базе браузера, не требующий установки.

Workshop: Productizing data platforms - Infrastructure for orchestrating dlt pipelines by The Scalable Way Пайплайны работают... но платформы нет? Практический семинар, который поможет превратить ваши начальные данные и рабочие процессы в структурированную масштабируемую платформу. Научитесь создавать продакшен-версию вашей платформы данных и управлять dlt пайплайнами. Этот практический семинар охватывает легковесную инфраструктуру, CI/CD и автоматизацию процессов, предоставляя вам конкретные шаги для построения масштабируемой и поддерживаемой среды для реальных рабочих процессов с данными. Location: Online Date: September 24th, 2025 Time: 16:00 (CET | Berlin) ссылка на регистрацию

Data Engineering Acquisitions Консолидация на рынке Data Engineering происходит очень быстро. Инструменты из Modern Data Stack объединяются в более крупные Data Platform. Раньше говорили Software is eating the world, теперь кажется, маятник качнулся в сторону более единой и интегрированной платформы данных. В этом году много крупных компаниий, купили небольшие open-source решение. Последней из таких покупок было приобретение SQLMesh компанией Fivetran. Более подробно про все приобретения можно почитать в этом посте. @data_whisperer

Debezium Management Platform Debezium Platform позволяет пользователям создавать и управлять потоковыми пайплайнами данных через интуитивно понятный графический интерфейс, обеспечивая бесшовную интеграцию данных с ориентированным на данные представлением компонентов Debezium. Платформа предоставляет высокоуровневую абстракцию для развертывания потоковых пайплайнов данных в различных средах, используя Debezium Server и Debezium Operator. Инженеры по данным могут сосредоточиться исключительно на проектировании пайплайна: подключиться к источнику данных, применить легкие преобразования и начать потоковую передачу данных в нужное место. Платформа позволяет пользователям мониторить ключевые метрики (в будущем) пайплайна, а также запускать действия с пайплайнами, например, запускать инкрементальный снимок для дополнительного заполнения исторических данных. Важно, что это не очередной vibe продукт, а инструмент сделаный разработчиками Debezium. Репозиторий с кодом, документация @data_whisperer

The Data Stack Report 2025 Очередной отчет о состоянии индустрии, в этот раз от Metabase. Metabase - это open-source BI инструмент написаный на Clojure. Что интересного? Data culture Большинство дата команд включают в себя до 3 разработчиков, больших команд по 10+ человек практический нет. Data stack Большинство разработчиков удовлетворены техническим стеком на проекте. Use of AI Большинство респондентов на всех должностях, на всех этапах развития компании и (почти) во всех отраслях хотя бы изредка используют ИИ для генерации запросов. Среди инженеров доверие к AI меньше, чем среди не технических специалистов. Storage Удивительно, что Postgres лидирует как для OLTP так и для OLAP. ETL and ingestion tools Здесь лидируют low-code решения. Airbyte и Fivetran. Modeling Ожидаемо DBT с большим отрывом, за ним чистый SQL. BI Здесь лидер, составитель отпроса Metabase, за ним PowerBI. Полный отчет тут @data_whisperer