5 minutes of data
Открыть в Telegram
I’m making my life less dull by spending time learning and researching “how it works“ in the data engineering field. Интерактивный учебник SQL https://querynomic.one/#/ по всем вопросам @just_vanich
Больше1 951
Подписчики
Нет данных24 часа
+137 дней
+4230 дней
Архив постов
1 951
Data Engineering Design Patterns
O’REILLY выпустили свежую книгу с очень многообещающим названием:
"Data Engineering Design Patterns" (Шаблоны проектирования в инженерии данных).
Автор: Bartosz Konieczny - опытный фриланс Data Engineer, энтузиаст Apache Spark, работает со Scala & Python.
Делится знаниями в блоге waitingforcode.com.
В чем суть и почему это важно?
Проекты в области данных - основа технической экосистемы любой компании.
Но сколько раз вы сталкивались с тем, что решаете проблемы, которые уже давно решили другие?
Эта книга - практическое руководство, которое учит поставлять реально ценные данные, фокусируясь на ключевых аспектах:
• Сбор данных
• Качество данных
• Идемпотентность
Главная ценность:
Перестаньте изобретать велосипед!
Узнайте проверенные шаблоны проектирования, которые экономят время, снижают ошибки и повышают эффективность ваших data-проектов.
1 951
DuckLake: SQL as Lakehouse Format
DuckDB запустил новый открытый табличный формат!
Чтобы устранить фундаментальные проблемы существующей архитектуры Lakehouse, DuckDB создали новый открытый табличный формат под названием DuckLake.
Основной принцип DuckLake - перенос всех метаданных в SQL-базу данных, как для каталога, так и для табличных данных.
Таким образом, больше нет разделения на каталог + метаданные + данные.
Только DuckLake + данные.
@data_whisperer
1 951
Reducing Peak Memory Usage in Trino: A SQL-First Approach
Trino - это распределенный SQL-движок, оптимизированный для скорости, в основном благодаря тому, что данные хранятся в памяти во время выполнения запросов. Это делает его отличным выбором для аналитических и исследовательских задач. Однако эта сильная сторона может стать ограничением при использовании Trino в крупномасштабных конвейерах обработки данных, особенно при строгих ограничениях по памяти.
В этой статье автор сосредотачивается на том, как снизить пиковое использование памяти в Trino путем последовательной переработки SQL-запросов по одному изменению за раз.
1 951
Daft - это библиотека распределенных датафреймов, которая знакома разработчикам, уже использующим pandas или polars.
Однако Daft превосходит возможности традиционных библиотек датафреймов, предлагая дополнительные преимущества:
- Распределенность: Daft без проблем работает как на ноутбуке, так и на огромном облачном кластере, обеспечивая обработку данных на разных масштабах с использованием фреймворка Ray.
- Сложные типы данных: Встроенная поддержка сложных типов и форматов памяти, таких как изображения, для эффективной обработки.
- Вычислительный движок на Rust: Использование Rust позволяет Daft максимально раскрывать потенциал современного оборудования, включая оптимизации SIMD.
- Умное управление памятью: Daft оптимизирует использование памяти, позволяя небольшим кластерам эффективно обрабатывать большие наборы данных.
- Обработка вне памяти: Возможность Daft обрабатывать данные, превышающие объем доступной памяти, позволяет работать с наборами данных любого размера.
По бенчмаркам Daft очень хорош, обгоняет Spark и Dask.
1 951
LLM SQL Generation Benchmark Results
Оценка способность больших языковых моделей генерировать точный и эффективный SQL-код на основе запросов на естественном языке. Используя набор данных из 200 миллионов записей из GitHub Archive, загруженный в Tinybird, разработчики попросили модели сгенерировать SQL по 50 запросам. Результаты представлены по ссылке и могут быть сравнены с человеческим базовым уровнем.
1 951
Repost from LLM Zoomcamp
👉🏼 LLM Zoomcamp 2025 Cohort Navigation
We're excited to welcome you to the 2025 edition of the LLM Zoomcamp!
Start date: June 2, 2025
Week 0 сhecklist
1. Watch live Q&A about the course
2. Register for live course launch
3. Save 2025 course playlist on YouTube
4. Check course content by navigating to the right module
5. Share this course with a friend!
Announcements
We’ll update this post to collect all necessary announcements for 2025 cohort.
Stay tuned!
1 951
SQL Pipelines
Ploomber - это sql оркестратор, который имеет встроенную поддержку SQL. Вы предоставляете SQL-скрипты, а Ploomber управляет подключениями к базе данных и организует выполнение кода за вас.
1 951
MCP (Model Context Protocol) — это открытый стандарт, упрощающий взаимодействие ИИ-моделей, особенно LLM, с внешними источниками данных, инструментами и сервисами. MCP-сервер выступает мостом между ИИ-моделями и внешними инструментами.
Вот список лучших MCP-серверов:
- File System MCP Server
Позволяет LLM напрямую работать с локальной файловой системой: читать, записывать и создавать директории.
- GitHub MCP Server
Подключает Claude к репозиториям GitHub, позволяя обновлять файлы и искать код.
- Slack MCP Server
MCP-сервер для API Slack, позволяющий Claude взаимодействовать с рабочими пространствами Slack.
- Google Maps MCP Server
MCP-сервер для API Google Maps.
- Docker MCP Server
Интеграция с Docker для управления контейнерами, образами, томами и сетями.
- Brave MCP Server
Веб- и локальный поиск через API поиска Brave.
- PostgreSQL MCP Server
MCP-сервер, позволяющий LLM изучать схемы баз данных и выполнять запросы только для чтения.
- Google Drive MCP Server
MCP-сервер для интеграции с Google Drive, позволяющий читать и искать файлы.
- Redis MCP Server
MCP-сервер, предоставляющий доступ к базам данных Redis.
- Notion MCP Server
Проект, реализующий MCP-сервер для API Notion.
- Stripe MCP Server
MCP-сервер для взаимодействия с API Stripe.
- Perplexity MCP Server
MCP-сервер, подключающийся к API Sonar от Perplexity для поиска в реальном времени.
1 951
Неужели знание Python больше не обязательно, чтобы называть себя инженером данных?
Я работаю инженером данных уже чуть больше 4 лет и считаю себя уверенным в Python. На прошлой неделе я помогал проводить собеседования на ещё одну позицию инженера данных в нашей компании — и, поверите или нет, ни один кандидат не умел писать на Python, хотя это явно указано в описании вакансии. Кроме Python, большинство из них (за исключением одного совсем слабого кандидата) могли говорить о технологиях, ELT против ETL, инструментах вроде dbt, Glue, SQL Server и т. д., но ни один не смог написать код на Python.
Ещё более безумно то, что ВСЕ они оценили свои навыки Python от 5 до 8 (да, последний даже сказал, что он на 8). А потом, когда мы дошли до части с лайвкодинг, они буквально не могли написать ни одной строки. Я понимаю, что кодирование вживую может пугать, но, боже мой, неужели нельзя написать хотя бы ОДНУ связную строку кода при уровне 8/10? Я просто не понимаю, зачем они это делают — неужели они думают, что мы не попросим их доказать это, когда они так высоко себя оценивают?
Что здесь происходит??
Взято с Reddit
Upd: Тоже иногда присутствую на собеседованиях и ситуация аналогична той, что описывает автор.
А как вы думаете на каком уровне нужно знать Python для Data engineer?
@data_whisperer
1 951
Motion
ранее использовала CockroachDB из-за её масштабируемости, но недавно перешла на Postgres из-за растущих затрат и проблем с производительностью. Конфигурация с одним регионом не позволяла полностью использовать распределённые возможности CockroachDB. Миграция решила проблемы с таймаутами миграций Prisma, медленными процессами ETL и нестабильной скоростью запросов, где планировщик запросов CockroachDB часто показывал более низкую производительность, чем Postgres. Для миграции данных была разработана кастомная ETL-система с использованием Bun.
1 951
Просто замечательный пост
CyberArk делится опытом создания внутренних инструментов для более чем 1000 разработчиков, подчеркивая важность подхода к внутренним инструментам как к продуктам с настоящими пользователями.
1 951
HelixDB - это высокопроизводительная графо-векторная база данных с открытым исходным кодом, написанная на Rust, разработанная для приложений RAG и ИИ. Она объединяет хранение графовых и векторных данных, используя LMDB для обеспечения персистентности данных и соответствия ACID.
Код на GitHub
1 951
Еще одна замечательная книга, которую будем разыгрывать.
The Missing Readmi.
Это книга не про технику(хотя и она в ней есть совсем чуть-чуть).
В этой книги опытный наставник проведут вас по всем подводным камням АйТи мира и расскажет, как нужно.
Читается за пару, тройку вечеров, думаю опытные тоже найдут в ней что нибудь интересное.
А если при слове ретро в вашем календаре,вы не знаете куда бежать.
То книга точно для вас
1 951
Void - альтернатива Cursor
Void - это open-source альтернатива Cursor. Поддерживает использование ИИ-агентов, создание контрольных точек и локальное размещение моделей. Void является форком репозитория VS Code.
1 951
📚 Хочешь прокачать скиллы в программировании?
Мечтаешь разобрать «Кабанчика» или покорить LeetCode?
Присоединяйся к @neLenkin_bot!
В группе:
- Совместное обучение и разбор задач
- Живые встречи и обсуждения
- Чтение книг и многое другое
Не откладывай -стань частью комьюнити и начни учиться уже сегодня!
1 951
MLOps Zoomcamp 2025
Сегодня начался MLOps Zoomcamp.
Вводное видео уже на YouTube.
Успевайте присоединиться к новому запуска курса!
Обновленный материал, живите онлайн встречи и сертификат по завершению курса!
Репозиторий курса.
@data_whisperer
