5 minutes of data
Open in Telegram
I’m making my life less dull by spending time learning and researching “how it works“ in the data engineering field. Интерактивный учебник SQL https://querynomic.one/#/ по всем вопросам @just_vanich
Show more1 951
Subscribers
No data24 hours
+137 days
+4230 days
Posts Archive
1 951
Moonlink 🥮
Новый движок загрузки для Apache Iceberg, который сразу умеет работать со стримингом, insert’ами и upsert’ами. Он подключается к Postgres CDC, Kafka или OTEL и пишет данные в Iceberg без лишней возни с компакшеном.
Главная фишка Moonlink — он буферизует и индексирует данные на NVMe, а в Iceberg сбрасывает уже оптимизированные Parquet и deletion vectors.
В отличие от привычных инструментов, которые плодят тысячи мелких файлов и тормозят чтение, здесь таблицы остаются лёгкими и быстрыми.
Поддерживаются DuckDB, Spark и Postgres, а для задач с «живыми» данными — расширения вроде pg_mooncake и duckb_mooncake.
Сейчас Moonlink в превью, так что детали ещё будут меняться.
@data_whisperer
1 951
BlaBlaCar: Scaling Success - The dbt Ecosystem at BlaBlaCar
Представьте себе управление 4000 таблиц и 300 отчётами в различных бизнес-сферах. Это повседневная реальность BlaBlaCar, и именно поэтому экосистема DBT — не просто преимущество, а жизненная необходимость.
В блоге рассказывается о том, как была создана комплексная экосистема dbt, основанная на dbt Core, Airflow, dbtDagGenerator, Dev Containers, изолированных dev окружениях в BigQuery и проверках CI/CD.
@data_whisperer
1 951
Fivetran покупает DBT?
Не так давно Fivetran купил SQLMesh, а теперь присматривается к DBT.
Обсуждение новости можно почитать на Reddit.
@data_whisperer
1 951
Bytewax: Python Stateful Stream Processing Framework
Bytewax — это stateful stream processing framework, написанный на Python и основанный на движке Rust, предназначенный для создания пайплайнов и приложений в режиме реального времени.
Он поддерживает масштабируемые развёртывания, автоматически управляет состоянием и предлагает гибкий API для таких операций, как map, filter, join.
Бесшовная интеграция с библиотеками Python и источниками данных, такими как: Kafka и Filesystem.
@data_whisperer
1 951
Cloudflare Data Platform
Cloudflare анонсировали свою data platform, которая включает:
- Cloudflare Pipelines
Для извлечения данных и преобразования данных.
- R2 Data Catalog
Каталог для управления метаданными iceberg.
- R2 SQL
Распределенный SQL движок.
Все вместе это предоставляет платформу данных полного цикла.
Появился еще один игрок в мире данных, который использует решения для modern data stack.
Платформа построена на открытых стандартах, что значит вы можете выбрать любой query engine для Iceberg, а так же интегрироваться с Databricks или Snowflake.
@data_whisperer
1 951
В телеграм не так много авторских каналов, чьи посты ждешь с нетерпением.
Один из таких каналов — Я (Лена) и моя (не)работа.
Лена — ex-Gooler, работала в Confluent и Redpanda, а это значит, что она «шарит» за распределенные системы.
Сейчас Лена ведет курс по system designe для студентов бакалавриату Cunstructor University Bremen!
Посты разбавлены юмором и особым авторским слогом.
Это не только сухая выжимка технических терминов, но и истории из жизни, выбор преподавания и о том, как появился книжный клуб, где каждую неделю проходят онлайн встречи.
1 951
PG_DUCKDB
DuckDB анонсировали расширение pg_duckdb для PostgreSQL с открытым исходным кодом, которое позволяет использовать векторизованный аналитический движок DuckDB непосредственно в PostgreSQL.
Это можно рассматривать как добавление турбо-движка к вашей базе данных, готового к выполнению эффективных запросов, в то время как PostgreSQL продолжает выполнять то, что у него получается лучше всего:
транзакционные рабочие нагрузки для вашего приложения.
@data_whisperer
1 951
Future Data Systems Seminar Series — Fall 2025
Университет CARNEGIE MELLON проводит обучающие курсы по система управления базами данных.
На канале уже были посты про эти курсы 1, 2 , 3
В рамках этой серии выступлений будут представлены идеи современных архитектур систем и технологий для хранения, управления и доступа к базам данных.
Все выступления проходят онлайн и открыты для широкой аудитории через Zoom.
Для участия не обязательно быть текущим студентом CMU.
Программа семинаров тут
А я пока что пошел смотреть первое видео An Extremely Technical Overview of How Apache Iceberg Planning Actually Works
Ну вы только посмотрите на программу семинаров, это определенно стоит смотреть!
@just_vanich
1 951
Future Data Systems Seminar Series — Fall 2025
Университет CARNEGIE MELLON проводит обучающие курсы по система управления базами данных.
На канале уже были посты про эти курсы 1, 2 , 3
В рамках этой серии выступлений будут представлены идеи современных архитектур систем и технологий для хранения, управления и доступа к базам данных.
Все выступления проходят онлайн и открыты для широкой аудитории через Zoom.
Для участия не обязательно быть текущим студентом CMU.
Программа семинаров тут
А я пока что пошел смотреть первое видео An Extremely Technical Overview of How Apache Iceberg Planning Actually Works
Ну вы только посмотрите на программу семинаров, это определенно стоит смотреть!
@just_vanich
1 951
Data Engineering Design Patterns: Глава 3 - Error Management
Design Patterns
Продолжаю читать Data Engineering Design Patterns, краткое summary по паттерну Dead-Letter.
В работе с потоковыми данными часто встречается проблема: одна битая запись может уронить весь пайплайн.
Особенно обидно, когда речь о долгоживущих стриминговых задачах — остановка ломает SLA и требует ручного вмешательства.
Один из классических способов справиться с этим — паттерн Dead-Letter.
Его идея проста:
валидные данные продолжают обрабатываться, а ошибочные сохраняются отдельно, для последующего разбора.
Как это устроено на практике:
— в уязвимых местах кода (например, парсинг, кастомные функции) добавляются защитные блоки;
— плохая запись сохраняется вместе с метаданными — исходный payload, причина ошибки, время, offset, версия job;
— данные уходят в отдельное хранилище dead-letter.
Кандидаты для такого хранилища: объектные стораджи (S3, GCS), Kafka.
Главное — надёжность, возможность мониторинга и при необходимости повторного воспроизведения.
Зачем это нужно:
Пайплайн не падает из-за единичных ошибок.
Остаётся контекст для расследования.
Можно при необходимости настроить replay и повторно «догнать» данные.
Но у подхода есть и подводные камни:
— Если включить повторную загрузку (replay), можно запустить лавину пересчётов downstream-систем — так называемый snowball backfilling.
— Порядок событий может нарушиться: например, для пользовательских сессий это критично.
— Dead-Letter может скрыть настоящие фатальные сбои, поэтому важно настроить алерты и пороговые значения: при массовых ошибках джоб лучше останавливать.
В итоге организация должна выбрать приоритет:
— либо стабильность и своевременность (но часть данных может потеряться),
— либо полнота данных (но появляется риск несогласованности и роста нагрузки на системы).
Dead-Letter делает пайплайны устойчивыми: они продолжают работать, даже если отдельные события битые.
Но использовать его стоит осознанно — с мониторингом, метаданными и пониманием того, как downstream будет жить с частичными или переигранными данными.
примеры кода
@data_whisperer
1 951
🔥 Data Forge — Data Engineering Playground
Современный учебный стенд для работы с данными.
Запускайте основные компоненты реальной платформы данных и отрабатывайте сквозные рабочие процессы локально.
Вместо того чтобы просто читать о «Datalake или Lakehouse, вы действительно можете их запускать.
Представьте это как тренажёрный зал для дата-инженеров без облачных расходов и рисков в продакшене.
Хорошая альтернатива платным буткемпам!
Качественно проработаная структура проекта с примерами, документацией и заметками.
The battlefield of data engineering isn’t won by one playbook, it’s forged in shared practice.
@data_whisperer
1 951
Is It Worth the Time?
Недавно наткнулся на комикс xkcd, который отлично иллюстрирует наш вечный порыв автоматизировать всё.
В нём есть таблица: сколько времени можно потратить на оптимизацию задачи, чтобы она действительно окупилась за несколько лет.
Например, если задача повторяется раз в неделю и занимает минуту, то за пять лет вы сэкономите всего около четырёх часов.
Значит, если вы потратили неделю на написание идеального скрипта — никакой экономии уже нет.
Комикс смешной, но в нём много правды.
Иногда автоматизация оправдана — особенно если ею будут пользоваться многие.
А иногда быстрее просто сделать по-старому, чем строить умное решение.
Ирония в том, что, пока мы думаем, стоит ли оптимизировать задачу, мы уже тратим время — и это тоже попадает в таблицу.
@data_whisperer
1 951
PondPilot - Get your data 🦆 in a row
PondPilot — это очень быстрый, легковесный, полностью клиентский инструмент для исследования данных с поддержкой ИИ, который помогает вам анализировать локальные и удалённые данные без необходимости настройки.
Основан на DuckDB-Wasm и интегрированной поддержке AI, он полностью работает в вашем браузере — без установки, серверов и загрузки данных в облако, с полным сохранением конфиденциальности.
@data_whisperer
1 951
Data Platform Fundamentals
Небольшая брошюра от Dagster про архитектуру и дизайн modern data platform.
файл в комментариях
1 951
Polars at Decathlon: Ready to Play?
Компания Decathlon снизила сложность инфраструктуры и затраты, перейдя на Polars для обработки данных объемом до 50 GB, заменив pandas и дополнив Spark.
Новый стриминговый движок Polars позволил обрабатывать потоковые пайплайны с объемом данных до 1 TB, используя всего 10 GB оперативной памяти GB RAM.
Этот переход обеспечил почти нулевые вычислительные затраты, значительно ускорил выполнение задач и упростил разработку пайплайнов для соответствующих нагрузок.
1 951
Iceberg Support in DuckDB
DuckDB Iceberg позиционируется как простой способ работы с таблицами Apache Iceberg без зависимостей, в отличие от сложностей настройки Spark/Java.
В предстоящем выпуске версии 1.4 DuckDB добавит поддержку чтения и записи таблиц версии 2, чтения таблиц версии 3, каталогов S3/GCS/R2, а также лёгкий клиент на базе браузера, не требующий установки.
1 951
Workshop: Productizing data platforms - Infrastructure for orchestrating dlt pipelines by The Scalable Way
Пайплайны работают... но платформы нет?
Практический семинар, который поможет превратить ваши начальные данные и рабочие процессы в структурированную масштабируемую платформу.
Научитесь создавать продакшен-версию вашей платформы данных и управлять dlt пайплайнами. Этот практический семинар охватывает легковесную инфраструктуру, CI/CD и автоматизацию процессов, предоставляя вам конкретные шаги для построения масштабируемой и поддерживаемой среды для реальных рабочих процессов с данными.
Location: Online
Date: September 24th, 2025
Time: 16:00 (CET | Berlin)
ссылка на регистрацию
1 951
Data Engineering Acquisitions
Консолидация на рынке Data Engineering происходит очень быстро.
Инструменты из Modern Data Stack объединяются в более крупные Data Platform.
Раньше говорили Software is eating the world, теперь кажется, маятник качнулся в сторону более единой и интегрированной платформы данных.
В этом году много крупных компаниий, купили небольшие open-source решение.
Последней из таких покупок было приобретение SQLMesh компанией Fivetran.
Более подробно про все приобретения можно почитать в этом посте.
@data_whisperer
1 951
Debezium Management Platform
Debezium Platform позволяет пользователям создавать и управлять потоковыми пайплайнами данных через интуитивно понятный графический интерфейс, обеспечивая бесшовную интеграцию данных с ориентированным на данные представлением компонентов Debezium.
Платформа предоставляет высокоуровневую абстракцию для развертывания потоковых пайплайнов данных в различных средах, используя Debezium Server и Debezium Operator.
Инженеры по данным могут сосредоточиться исключительно на проектировании пайплайна: подключиться к источнику данных, применить легкие преобразования и начать потоковую передачу данных в нужное место.
Платформа позволяет пользователям мониторить ключевые метрики (в будущем) пайплайна, а также запускать действия с пайплайнами, например, запускать инкрементальный снимок для дополнительного заполнения исторических данных.
Важно, что это не очередной vibe продукт, а инструмент сделаный разработчиками Debezium.
Репозиторий с кодом, документация
@data_whisperer
1 951
The Data Stack
Report 2025
Очередной отчет о состоянии индустрии, в этот раз от Metabase.
Metabase - это open-source BI инструмент написаный на Clojure.
Что интересного?
Data culture
Большинство дата команд включают в себя до 3 разработчиков, больших команд по 10+ человек практический нет.
Data stack
Большинство разработчиков удовлетворены техническим стеком на проекте.
Use of AI
Большинство респондентов на всех должностях, на всех этапах развития компании и (почти) во всех отраслях хотя бы изредка используют ИИ для генерации запросов.
Среди инженеров доверие к AI меньше, чем среди не технических специалистов.
Storage
Удивительно, что Postgres лидирует как для OLTP так и для OLAP.
ETL and ingestion tools
Здесь лидируют low-code решения.
Airbyte и Fivetran.
Modeling
Ожидаемо DBT с большим отрывом, за ним чистый SQL.
BI
Здесь лидер, составитель отпроса Metabase, за ним PowerBI.
Полный отчет тут
@data_whisperer