en
Feedback
5 minutes of data

5 minutes of data

Open in Telegram

I’m making my life less dull by spending time learning and researching “how it works“ in the data engineering field. Интерактивный учебник SQL https://querynomic.one/#/ по всем вопросам @just_vanich

Show more
1 951
Subscribers
No data24 hours
+137 days
+4230 days
Posts Archive
Kafka 2025 Wrapped: что произошло со стримингом за год Годовой обзор экосистемы стриминга: громкие сделки, резкие повороты и медленное, но уверенное движение в сторону табличных форматов. В 2025 году в игру зашёл IBM, а diskless-архитектуры окончательно вышли из экспериментов в open source. ------------------------------ Snowflake почти купил Redpanda (январь 2025) Это вскрыло неприятную деталь: у Redpanda всего около $20 млн ARR. Уже осенью компания резко развернулась в сторону AI и agent-подходов. Aiven анонсировал Diskless Topics KIP (май 2025) Diskless Kafka перестал быть экзотикой и начал оформляться в стандарт. IBM покупает Confluent за $11 млрд (декабрь 2025) Самая громкая сделка года, после которой стало ясно: Kafka - это уже не просто open-source проект, а стратегический актив. ------------------------------ Databricks активно зашёл в стриминг: Zerobus - Kafka-подобная шина для ingestion прямо в Lakehouse в формате Unity Tables Spark Real-Time Structured Streaming — новая фича Structured Streaming с задержками в десятки миллисекунд. Snowflake не стал ждать и запустил Snowpipe - real-time ingestion, позволяющий приложениям писать строки напрямую в таблицы Snowflake. Cloudflare представил Pipelines и Cloudflare Data Platform: приём событий по HTTP → SQL-трансформации → загрузка в R2 (object storage) в формате Iceberg. S2 официально вышел в релиз. В целом выглядит так, будто каждый крупный вендор аккуратно пробует real-time стриминг с разных сторон. ------------------------------ Kafka Ecosystem В самом Kafka-мире год тоже был насыщенным: Вышел Kafka 4.0 - KIP-848 (новый consumer group protocol) — GA - KIP-932 (Queues) — EA - ZooKeeper официально полностью удалён - Вышел Kafka 4.1 ------------------------------ Iceberg и Lakehouse - повсюду - Confluent Cloud Tableflow вышел в GA (Iceberg) - WarpStream выпустил свой Tableflow - Aiven выложил open-source Iceberg Topics Iceberg всё активнее претендует на часть use-case’ов Kafka как single source of truth, и индустрия явно ускоряется в этом направлении. ------------------------------ S3 съедает Kafka - S3 Express снизил цены на 30–85%, сделав diskless Kafka на object storage заметно дешевле - Предложены два KIP’а для эффективного чтения холодных данных из object storage: - KIP-1255 (Remote Read Replicas) - KIP-1248 (Consumers reading from Object Storage) На текущий момент существует 10 diskless Kafka-реализаций с прямой записью в S3, включая: Confluent Freight, WarpStream, AutoMQ, Bufstream, Tansu, Aiven Inkless, Kafka Diskless Topics, StreamNative Ursa, Kafscale, Redpanda Cloud Topics. ------------------------------ Все строят AI Agent infra - Confluent выпустил Streaming Agents и Confluent Intelligence - StreamNative - Orca Agent Engine - Redpanda полностью развернулась в сторону Agentic Data Plane При этом звучит и скепсис:
Последнее, что нужно AI-агентам - это Kafka.
2025 год показал, что стриминг больше не живёт в вакууме. Kafka остаётся ядром экосистемы, но вокруг него быстро растёт мир: Iceberg, object storage, diskless-архитектуры, AI-агенты и альтернативные пути ingestion. Экосистема явно входит в следующую фазу - менее монолитную и гораздо более гибридную. @five_minutes_of_data

GizmoSQL — High-Performance SQL Server for the Cloud GizmoSQL — это open-source SQL database engine, работающий на базе DuckDB и Apache Arrow Flight SQL. По бенчмаркам Gizmo опережает Trino и DataFusion. Есть адаптеры к DBT и PySpark DataFrame API. Есть как open-source вариант так и платная версия в облаке. Выполняйте запросы к терабайтам данных за секунды при затратах на 90% ниже, чем у традиционных платформ. @five_minutes_of_data

Apache DevLake(Incubating) Apache DevLake - это open-source платформа для работы с данными из DevOps-инструментов. DevLake собирает разрозненные данные из Git, CI/CD, трекеров задач и других DevOps-систем, приводит их в нормальный вид, анализирует и визуализирует. В итоге вместо кучи несвязанных метрик получается цельная картина того, как реально работает разработка. По сути, DevLake - это способ начать задавать правильные вопросы про свой дев-процесс и наконец получать на них внятные ответы. @five_minutes_of_data

Walrus: A Distributed Message Streaming Engine Walrus - это распределённая платформа потоковой обработки сообщений, построенная на высокопроизводительном движке журнального хранения. Она обеспечивает отказоустойчивый стриминг с автоматической ротацией лидера, сегментным разбиением разделов и консенсусом Raft для координации метаданных @five_minutes_of_data

Rosetta DBT Studio The Open Source IDE for dbt Core Создавайте, тестируйте и управляйте проектами dbt Core с лёгкостью. Rosetta DBT Studio предлагает мощный графический интерфейс для запуска трансформаций, интеграции с Git и поддержки нескольких баз данных — всё в одном месте. @five_minutes_of_data

Интересные Python библиотеки 🕵️ Skylos - ещё один инструмент статического анализа на Python, но с ИИ‑поддержкой. Находит мёртвый код и типовые уязвимости безопасности. Быстрее и умнее аналогов. 🧠 complexipy - измеряет когнитивную сложность кода - то, сколько усилий нужно, чтобы его понять. Помогает находить реально запутанные участки для рефакторинга и держать кодовую базу чистой. ⚡ ty - сверхбыстрый type checker и language server для Python, написанный на Rust. Альтернатива mypy, Pyright и Pylance, уже готовая к продакшену. На когнитивной сложности можно остановится отдельно, есть хорошая статья, которую я рекомендую прочитать. Круто, когда появляются такие инструменты как complexipy, чтобы снижать когнитивную нагрузку вашего кода.
Cognitive load is how much a developer needs to think in order to complete a task.
@five_minutes_of_data

Apache Iceberg V3 Apache Iceberg V3 приносит значительные улучшения, такие как векторы удаления, lineage строк, лучшая поддержка полуструктурированных данных и основы шифрования. На практике он готов к продакшену в основном, если вы используете Spark или Flink, с частичной поддержкой в других местах и заметными пробелами в движках вроде Athena, Trino и Snowflake. V3 явно будущее, но для большинства команд это пока ждём и наблюдаем в плане adoption, а не безопасный дефолт на сегодня. @five_minutes_of_data

Data Ingestion Patterns: When to Use Push, Pull, and Poll (With Real Examples) Полезный пост в блоге Dagster о трёх фундаментальных паттернах ingest, которые должен знать каждый data engineer: Push: Когда source-системы сами присылают данные тебе Pull: Когда ты контролируешь извлечение Poll: Когда нужно near real-time без полноценного стриминга У каждого свои trade-offs по контролю, сложности и операционным нагрузкам. В посте разбирают, когда какой использовать, с рабочими примерами кода на Dagster. Также есть проект, где все три паттерна работают вживую. Даже если вы работаете с Airflow, то будет полезно посмотреть примеры кода и адаптировать его под Airflow. @five_minutes_of_data

Data Engineering Zoomcamp: A Free 9-Week Course on Data Engineering Fundamentals 12 января стартует новый поток Data Engineer
Data Engineering Zoomcamp: A Free 9-Week Course on Data Engineering Fundamentals 12 января стартует новый поток Data Engineering Zoomcamp. Первые 2 недели по описанию не отличаются от прошлого года. Так же все начинается с Docker и Terraform, потом оркестрация с Kestra. Для ingest используют DLT. В модуль Analytics Engineering добавил Streamlit и Looker. Модуль про стриминг так же Kafka Streams и KSQL. А хотелось бы посмотреть что нибудь новое, типа Pathway или RisingWaves. @five_minutes_of_data

Wrappers — это фреймворк для разработки Foreign Data Wrappers (FDW) для Postgres, написанный на Rust. Его цель — упростить разработку FDW, сохраняя при этом современные возможности языка Rust, такие как высокая производительность, строгая типизация и безопасность. Wrappers также представляет собой коллекцию FDW, созданных Supabase. Так же есть готовый wrapper для Clickhouse @five_minutes_of_data

Introducing pg_clickhouse: A Postgres extension for querying ClickHouse Интересная тенденция от ClickHouse: за год большинство миграций аналитики в Cloud идут именно с PostgreSQL (после self-hosted CH). ClickPipes упрощает репликацию данных, но запросы и код — это отдельная головная боль. Команда решила: давайте упростим перенос SQL с Postgres на ClickHouse! Несколько месяцев назад начали работать над этим — результат: расширение pg_clickhouse, где таблицы CH выглядят как родные Postgres. Меняешь схему — и запросы летают на CH без переписывания. Пример: TPC-H Query 4 — 650ms в Postgres vs 67ms с pg_clickhouse! @five_minutes_of_data

Глеб Михайлов запустил розыгрыш на бесплатное участие в своём авторском курсе по алгоритмам. Я сам проходил его курсы на Stepik и могу точно сказать: Глеб умеет объяснять сложные вещи простым, очень понятным языком. Это уже не первый запуск, курс отполирован и с каждым разом становится только лучше. Если хотите действительно разобраться с алгоритмами, рекомендую не упускать возможность. Возможно, именно вы станете тем самым счастливчиком, который получит грант на обучение. @five_minutes_of_data

parqeye позволяет заглянуть внутрь ваших файлов Parquet. Мгновенно просматривайте их содержимое, схему и метаданные — прямо из терминала. Интерактивная визуализация данных — Просматривайте данные Parquet в табличном виде с навигацией по клавиатуре. Исследователь схемы — Анализируйте типы колонок, вложенные структуры и определения полей. Метаданные файла — Просматривайте метаданные на уровне файла, включая версию, создателя, статистику кодирования и многое другое. Статистика групп строк — Изучайте метаданные и статистику на уровне групп строк, а также распределение данных по группам. Интерфейс с вкладками — Быстро переключайтесь между видами Visualize, Schema, Metadata и Row Groups. Нативно для терминала — Работает прямо в вашем терминале. @five_minutes_of_data

DataKit — это платформа для анализа данных прямо в браузере, которая обрабатывает многогигабайтные файлы (Parquet, CSV, JSON и др.) локально с помощью duckdb-wasm. Вся обработка происходит внутри браузера — данные никуда не отправляются. Также можно подключаться к удалённым источникам, таким как Motherduck и Postgres, через сервер DataKit. @five_minutes_of_data

Advent of Agents 🎄 Декабрь — это всегда адвент-календари, и в этом году к Advent of Code добавляется новый вариант: Advent of Agents. 25 дней заданий про агентов и LLM от Google. Если давно хотел покопаться в языковых моделях и агентном кодинге — самое время. @five_minutes_of_data

Приходите к нам в DE @five_minutes_of_data
Приходите к нам в DE @five_minutes_of_data

MinIO is now Maintenance Mode Похоже, что марш смерти для MinIO продолжается. Последний коммит отмечает, что проект в Maintenance Mode, а исправления безопасности будут случай за случаем. Если ищите альтернативу, то можно посмотреть на Garage @five_minutes_of_data

Airflow Extension for Visual Studio Code Расширение для Visual Studio Code, которое позволяет взаимодействовать с Apache Airflow (v2.x и v3.x) прямо из вашего редактора. Запускайте DAG, ставьте на паузу/снимайте, исследуйте запуски DAG, просматривайте логи, просматривайте код и многое другое — без браузера. @five_minutes_of_data

🎄 Сегодня стартовал Advent of Code 2025 Если вдруг не слышали — это цифровой адвент-календарь для разработчиков. Каждый день до Рождества выходит новый пазл, который можно решить на любом языке программирования. Mногие используют AOC как повод наконец-то потрогать язык, который давно хотел попробовать. Кто-то вообще решает задачи на SQL. Для многих Advent of Code — зимний ритуал: кофе, уют и ежедневная задачка, от которой иногда приятно плавится мозг. Если искали причину попробовать новый язык — она появилась. А если просто хочется немного игровой мотивации в декабре — тоже отлично подходит. А вот тут можно посмотреть, как решают первый день на bash Happy coding! 🎁

DBHub DBHub — это универсальный сервер баз данных MCP, реализующий интерфейс сервера Model Context Protocol (MCP). Этот шлюз позволяет клиентам, совместимым с MCP, подключаться и исследовать различные базы данных: Универсальный шлюз: Единый интерфейс для PostgreSQL, MySQL, MariaDB, SQL Server и SQLite Безопасный доступ: Режим только для чтения, туннелирование SSH и поддержка шифрования SSL/TLS Мультибазы данных: Подключение к нескольким базам данных одновременно с конфигурацией TOML Готов к продакшену: Ограничение строк, контроль таймаута блокировок и пул соединений Нативный MCP: Полная реализация Model Context Protocol с ресурсами, инструментами и промптами Теперь можно не костылить Text-to-SQL а использовать готовый MCP. Но как и всегда с AI инструментами, нужно быть осторожным, так как DBHub может
Execute SQL queries directly from AI tools: - Run SELECT queries for data analysis - Execute DDL/DML in read-write mode - Support for parameterized queries - Multi-statement execution with transaction support
@five_minutes_of_data