5 minutes of data
Open in Telegram
I’m making my life less dull by spending time learning and researching “how it works“ in the data engineering field. Интерактивный учебник SQL https://querynomic.one/#/ по всем вопросам @just_vanich
Show more1 951
Subscribers
No data24 hours
+137 days
+4230 days
Posts Archive
1 951
Kafka 2025 Wrapped: что произошло со стримингом за год
Годовой обзор экосистемы стриминга: громкие сделки, резкие повороты и медленное, но уверенное движение в сторону табличных форматов.
В 2025 году в игру зашёл IBM, а diskless-архитектуры окончательно вышли из экспериментов в open source.
------------------------------
Snowflake почти купил Redpanda (январь 2025)
Это вскрыло неприятную деталь: у Redpanda всего около $20 млн ARR.
Уже осенью компания резко развернулась в сторону AI и agent-подходов.
Aiven анонсировал Diskless Topics KIP (май 2025)
Diskless Kafka перестал быть экзотикой и начал оформляться в стандарт.
IBM покупает Confluent за $11 млрд (декабрь 2025)
Самая громкая сделка года, после которой стало ясно: Kafka - это уже не просто open-source проект, а стратегический актив.
------------------------------
Databricks активно зашёл в стриминг:
Zerobus - Kafka-подобная шина для ingestion прямо в Lakehouse в формате Unity Tables
Spark Real-Time Structured Streaming — новая фича Structured Streaming с задержками в десятки миллисекунд.
Snowflake не стал ждать и запустил Snowpipe - real-time ingestion, позволяющий приложениям писать строки напрямую в таблицы Snowflake.
Cloudflare представил Pipelines и Cloudflare Data Platform:
приём событий по HTTP → SQL-трансформации → загрузка в R2 (object storage) в формате Iceberg.
S2 официально вышел в релиз.
В целом выглядит так, будто каждый крупный вендор аккуратно пробует real-time стриминг с разных сторон.
------------------------------
Kafka Ecosystem
В самом Kafka-мире год тоже был насыщенным:
Вышел Kafka 4.0
- KIP-848 (новый consumer group protocol) — GA
- KIP-932 (Queues) — EA
- ZooKeeper официально полностью удалён
- Вышел Kafka 4.1
------------------------------
Iceberg и Lakehouse - повсюду
- Confluent Cloud Tableflow вышел в GA (Iceberg)
- WarpStream выпустил свой Tableflow
- Aiven выложил open-source Iceberg Topics
Iceberg всё активнее претендует на часть use-case’ов Kafka как single source of truth, и индустрия явно ускоряется в этом направлении.
------------------------------
S3 съедает Kafka
- S3 Express снизил цены на 30–85%, сделав diskless Kafka на object storage заметно дешевле
- Предложены два KIP’а для эффективного чтения холодных данных из object storage:
- KIP-1255 (Remote Read Replicas)
- KIP-1248 (Consumers reading from Object Storage)
На текущий момент существует 10 diskless Kafka-реализаций с прямой записью в S3, включая:
Confluent Freight, WarpStream, AutoMQ, Bufstream, Tansu, Aiven Inkless, Kafka Diskless Topics, StreamNative Ursa, Kafscale, Redpanda Cloud Topics.
------------------------------
Все строят AI Agent infra
- Confluent выпустил Streaming Agents и Confluent Intelligence
- StreamNative - Orca Agent Engine
- Redpanda полностью развернулась в сторону Agentic Data Plane
При этом звучит и скепсис:
Последнее, что нужно AI-агентам - это Kafka.2025 год показал, что стриминг больше не живёт в вакууме. Kafka остаётся ядром экосистемы, но вокруг него быстро растёт мир: Iceberg, object storage, diskless-архитектуры, AI-агенты и альтернативные пути ingestion. Экосистема явно входит в следующую фазу - менее монолитную и гораздо более гибридную. @five_minutes_of_data
1 951
GizmoSQL — High-Performance SQL Server for the Cloud
GizmoSQL — это open-source SQL database engine, работающий на базе DuckDB и Apache Arrow Flight SQL.
По бенчмаркам Gizmo опережает Trino и DataFusion.
Есть адаптеры к DBT и PySpark DataFrame API.
Есть как open-source вариант так и платная версия в облаке.
Выполняйте запросы к терабайтам данных за секунды при затратах на 90% ниже, чем у традиционных платформ.
@five_minutes_of_data
1 951
Apache DevLake(Incubating)
Apache DevLake - это open-source платформа для работы с данными из DevOps-инструментов.
DevLake собирает разрозненные данные из Git, CI/CD, трекеров задач и других DevOps-систем, приводит их в нормальный вид, анализирует и визуализирует.
В итоге вместо кучи несвязанных метрик получается цельная картина того, как реально работает разработка.
По сути, DevLake - это способ начать задавать правильные вопросы про свой дев-процесс и наконец получать на них внятные ответы.
@five_minutes_of_data
1 951
Walrus: A Distributed Message Streaming Engine
Walrus - это распределённая платформа потоковой обработки сообщений, построенная на высокопроизводительном движке журнального хранения. Она обеспечивает отказоустойчивый стриминг с автоматической ротацией лидера, сегментным разбиением разделов и консенсусом Raft для координации метаданных
@five_minutes_of_data
1 951
Rosetta DBT Studio
The Open Source IDE for dbt Core
Создавайте, тестируйте и управляйте проектами dbt Core с лёгкостью.
Rosetta DBT Studio предлагает мощный графический интерфейс для запуска трансформаций, интеграции с Git и поддержки нескольких баз данных — всё в одном месте.
@five_minutes_of_data
1 951
Интересные Python библиотеки
🕵️ Skylos - ещё один инструмент статического анализа на Python, но с ИИ‑поддержкой.
Находит мёртвый код и типовые уязвимости безопасности.
Быстрее и умнее аналогов.
🧠 complexipy - измеряет когнитивную сложность кода - то, сколько усилий нужно, чтобы его понять.
Помогает находить реально запутанные участки для рефакторинга и держать кодовую базу чистой.
⚡ ty - сверхбыстрый type checker и language server для Python, написанный на Rust.
Альтернатива mypy, Pyright и Pylance, уже готовая к продакшену.
На когнитивной сложности можно остановится отдельно, есть хорошая статья, которую я рекомендую прочитать.
Круто, когда появляются такие инструменты как complexipy, чтобы снижать когнитивную нагрузку вашего кода.
Cognitive load is how much a developer needs to think in order to complete a task.@five_minutes_of_data
1 951
Apache Iceberg V3
Apache Iceberg V3 приносит значительные улучшения, такие как векторы удаления, lineage строк, лучшая поддержка полуструктурированных данных и основы шифрования.
На практике он готов к продакшену в основном, если вы используете Spark или Flink, с частичной поддержкой в других местах и заметными пробелами в движках вроде Athena, Trino и Snowflake.
V3 явно будущее, но для большинства команд это пока ждём и наблюдаем в плане adoption, а не безопасный дефолт на сегодня.
@five_minutes_of_data
1 951
Data Ingestion Patterns: When to Use Push, Pull, and Poll (With Real Examples)
Полезный пост в блоге Dagster о трёх фундаментальных паттернах ingest, которые должен знать каждый data engineer:
Push: Когда source-системы сами присылают данные тебе
Pull: Когда ты контролируешь извлечение
Poll: Когда нужно near real-time без полноценного стриминга
У каждого свои trade-offs по контролю, сложности и операционным нагрузкам.
В посте разбирают, когда какой использовать, с рабочими примерами кода на Dagster.
Также есть проект, где все три паттерна работают вживую.
Даже если вы работаете с Airflow, то будет полезно посмотреть примеры кода и адаптировать его под Airflow.
@five_minutes_of_data
1 951
Data Engineering Zoomcamp: A Free 9-Week Course on Data Engineering Fundamentals
12 января стартует новый поток Data Engineering Zoomcamp.
Первые 2 недели по описанию не отличаются от прошлого года.
Так же все начинается с Docker и Terraform, потом оркестрация с Kestra.
Для ingest используют DLT.
В модуль Analytics Engineering добавил Streamlit и Looker.
Модуль про стриминг так же Kafka Streams и KSQL.
А хотелось бы посмотреть что нибудь новое, типа Pathway или RisingWaves.
@five_minutes_of_data
1 951
Wrappers — это фреймворк для разработки Foreign Data Wrappers (FDW) для Postgres, написанный на Rust.
Его цель — упростить разработку FDW, сохраняя при этом современные возможности языка Rust, такие как высокая производительность, строгая типизация и безопасность.
Wrappers также представляет собой коллекцию FDW, созданных Supabase.
Так же есть готовый wrapper для Clickhouse
@five_minutes_of_data
1 951
Introducing pg_clickhouse: A Postgres extension for querying ClickHouse
Интересная тенденция от ClickHouse: за год большинство миграций аналитики в Cloud идут именно с PostgreSQL (после self-hosted CH).
ClickPipes упрощает репликацию данных, но запросы и код — это отдельная головная боль.
Команда решила: давайте упростим перенос SQL с Postgres на ClickHouse! Несколько месяцев назад начали работать над этим — результат: расширение pg_clickhouse, где таблицы CH выглядят как родные Postgres.
Меняешь схему — и запросы летают на CH без переписывания.
Пример: TPC-H Query 4 — 650ms в Postgres vs 67ms с pg_clickhouse!
@five_minutes_of_data
1 951
Глеб Михайлов запустил розыгрыш на бесплатное участие в своём авторском курсе по алгоритмам.
Я сам проходил его курсы на Stepik и могу точно сказать: Глеб умеет объяснять сложные вещи простым, очень понятным языком.
Это уже не первый запуск, курс отполирован и с каждым разом становится только лучше.
Если хотите действительно разобраться с алгоритмами, рекомендую не упускать возможность. Возможно, именно вы станете тем самым счастливчиком, который получит грант на обучение.
@five_minutes_of_data
1 951
parqeye позволяет заглянуть внутрь ваших файлов Parquet.
Мгновенно просматривайте их содержимое, схему и метаданные — прямо из терминала.
Интерактивная визуализация данных — Просматривайте данные Parquet в табличном виде с навигацией по клавиатуре.
Исследователь схемы — Анализируйте типы колонок, вложенные структуры и определения полей.
Метаданные файла — Просматривайте метаданные на уровне файла, включая версию, создателя, статистику кодирования и многое другое.
Статистика групп строк — Изучайте метаданные и статистику на уровне групп строк, а также распределение данных по группам.
Интерфейс с вкладками — Быстро переключайтесь между видами Visualize, Schema, Metadata и Row Groups.
Нативно для терминала — Работает прямо в вашем терминале.
@five_minutes_of_data
1 951
DataKit — это платформа для анализа данных прямо в браузере, которая обрабатывает многогигабайтные файлы (Parquet, CSV, JSON и др.) локально с помощью duckdb-wasm.
Вся обработка происходит внутри браузера — данные никуда не отправляются. Также можно подключаться к удалённым источникам, таким как Motherduck и Postgres, через сервер DataKit.
@five_minutes_of_data
1 951
Advent of Agents
🎄 Декабрь — это всегда адвент-календари, и в этом году к Advent of Code добавляется новый вариант: Advent of Agents.
25 дней заданий про агентов и LLM от Google.
Если давно хотел покопаться в языковых моделях и агентном кодинге — самое время.
@five_minutes_of_data
1 951
MinIO is now Maintenance Mode
Похоже, что марш смерти для MinIO продолжается.
Последний коммит отмечает, что проект в Maintenance Mode, а исправления безопасности будут случай за случаем.
Если ищите альтернативу, то можно посмотреть на Garage
@five_minutes_of_data
1 951
Airflow Extension for Visual Studio Code
Расширение для Visual Studio Code, которое позволяет взаимодействовать с Apache Airflow (v2.x и v3.x) прямо из вашего редактора.
Запускайте DAG, ставьте на паузу/снимайте, исследуйте запуски DAG, просматривайте логи, просматривайте код и многое другое — без браузера.
@five_minutes_of_data
1 951
🎄 Сегодня стартовал Advent of Code 2025
Если вдруг не слышали — это цифровой адвент-календарь для разработчиков.
Каждый день до Рождества выходит новый пазл, который можно решить на любом языке программирования.
Mногие используют AOC как повод наконец-то потрогать язык, который давно хотел попробовать.
Кто-то вообще решает задачи на SQL.
Для многих Advent of Code — зимний ритуал: кофе, уют и ежедневная задачка, от которой иногда приятно плавится мозг.
Если искали причину попробовать новый язык — она появилась.
А если просто хочется немного игровой мотивации в декабре — тоже отлично подходит.
А вот тут можно посмотреть, как решают первый день на bash
Happy coding! 🎁
1 951
DBHub
DBHub — это универсальный сервер баз данных MCP, реализующий интерфейс сервера Model Context Protocol (MCP).
Этот шлюз позволяет клиентам, совместимым с MCP, подключаться и исследовать различные базы данных:
Универсальный шлюз: Единый интерфейс для PostgreSQL, MySQL, MariaDB, SQL Server и SQLite
Безопасный доступ: Режим только для чтения, туннелирование SSH и поддержка шифрования SSL/TLS
Мультибазы данных: Подключение к нескольким базам данных одновременно с конфигурацией TOML
Готов к продакшену: Ограничение строк, контроль таймаута блокировок и пул соединений
Нативный MCP: Полная реализация Model Context Protocol с ресурсами, инструментами и промптами
Теперь можно не костылить Text-to-SQL а использовать готовый MCP.
Но как и всегда с AI инструментами, нужно быть осторожным, так как DBHub может
Execute SQL queries directly from AI tools: - Run SELECT queries for data analysis - Execute DDL/DML in read-write mode - Support for parameterized queries - Multi-statement execution with transaction support@five_minutes_of_data
