🔋 Труба данных
Open in Telegram
Авторский канал обо всем, что происходит в мире работы с данными: хранение, обработка, визуализация, как мы принимаем решения и как мы становимся профессионалами в работе с данными. Автора канала - @SimonOsipov
Show more4 057
Subscribers
No data24 hours
+257 days
+930 days
Posts Archive
4 057
https://www.pracdata.io/p/open-source-data-engineering-landscape-2025
Все вы помните огромные картинки, на которых 17 миллионов логотипов сервисов для данных. Вот эта статья - одна из таких, но тут главная особенность - здесь ТОЛЬКО open source решения, и причем в адекватном количестве. С понятными пояснениями, почему тот или иной инструмент попал в список.
Как всегда, читать эту картинку нужно следующим образом "А что еще есть на рынке в этой сфере кроме X?"
@ohmydataengineer - канал "🕯Труба Данных" и ставшие уже классическими landscapes картинки!
4 057
https://www.latent.space/p/2025-papers
Если вы угораете по white-papers и хорошим техническим статьям и публикациям (а не постам в блогах), вот отличный список из 50 статей пол AI Engineering.
Читать не перечитать!
@ohmydataengineer - канал "🕯Труба Данных" набрал себе чтива на недели вперед!
4 057
https://vutr.substack.com/p/8-minutes-to-understand-presto
Большая пояснительная статья про работу Presto (ну и в целом Trino работает похожим образом). Все еще сильно советую подписаться на этого парня, он хорошие статьи пишет
@ohmydataengineer - канал "🕯Труба Данных", который ничего умного в этот раз не придумал.
4 057
https://www.gable.ai/data-contracts-book
ГигаЧад и O'Reilly выкатывают в открытый доступ (правда надо оставить емейл) первую версию книжки про дата контракты.
Как по мне, хайп на эту штуку прошел и чет даже не сильно зудит это применять. Но, возможно, вы что-то подчерпнете для себя!
@ohmydataengineer - канал "🕯Труба Данных" в сомнения про дата контракты
4 057
Нам тут обещают, что скоро AI agents нас всех заменят.
Так вроде бы уже такие системы работают....
@ohmydataengineer - канал "🕯Труба Данных" и пятничный юмор!
4 057
Нам тут обещают, что скоро AI agents нас всех заменят.
Так вроде бы уже такие системы работают....
@ohmydataengineer - канал "🕯Труба Данных" и пятничный юмор!
4 057
https://clickhouse.com/blog/json-bench-clickhouse-vs-mongodb-elasticsearch-duckdb-postgresql
Вы будете кидать 💩, но я опять про Clickhouse
Огромная статья с технической мяготкой про 1 Billion JSON Challenge и насколько новый нативный тип JSON в клике работает быстрей и эффективней по памяти и стораджу по сравнению с другими базами данных.
@ohmydataengineer - канал "🕯Труба Данных" в очередной раз про одно и то же!
4 057
https://clickhouse.com/blog/json-bench-clickhouse-vs-mongodb-elasticsearch-duckdb-postgresql
Вы будете кидать 💩, но я опять про Clickhouse
Огромная статья с технической мяготкой про 1 Billion JSON Challenge и насколько новый нативный тип JSON в клике работает быстрей и эффективней по памяти и стораджу по сравнению с другими базами данных.
@ohmydataengineer - канал "🕯Труба Данных" в очередной раз про одно и то же!
4 057
https://medium.com/strava-engineering/rain-a-key-value-store-for-stravas-scale-7f580f5b4848
У меня love / hate relationships с бегом: когда-то я его любил, бегал марафоны, потом ненавидел, потом снова любил, потом снова ненавидел, ну вы поняли =)
И каждый раз я продолжал загружать свои пробежки в Strava.
Наткнулся тут на их инженерный блог и прикольную статью о том, что они там изобрели в качестве хранилищ для определенного типа данных и вообще как там у них устроено.
@ohmydataengineer - канал "🕯Труба Данных" про технологии в продуктах, которыми пользуемся ежедневно!
4 057
https://www.warpstream.com
Warpstream
Кстати, забыл рассказать, что я наткнулся на прикольный продукт от Confluent: Kafka, только вместо памяти на машинах - датка лежит в бакетах.
Да, скорость будет поменьше, но и ценник сильно меньше 😏
@ohmydataengineer - канал "🕯Труба Данных" радуется прикольным незнакомым инструментам!
4 057
https://www.astronomer.io/ebooks/apache-airflow-best-practices-etl-elt-pipelines/
Астрономер (главный контрибьютор Airflow) раздает книжку по best practices в Airflow. Ничего сверхестественного, но кажется вполне себе годным чтивом, обновить знания.
@ohmydataengineer - канал "🕯Труба Данных" любит Airflow, как бы его не хейтили
4 057
Рекрутеры используют AI, чтобы отсеивать нерелевантные отклики.
А можно просто фильтровать по словам и сразу всех "автоматизаторов откликов" выявить 😂
@ohmydataengineer - канал "🕯Труба Данных" и пятничный юмор!
4 057
Рекрутеры используют AI, чтобы отсеивать нерелевантные отклики.
А можно просто фильтровать по словам и сразу всех "автоматизаторов откликов" выявить 😂
@ohmydataengineer - канал "🕯Труба Данных" и пятничный юмор!
4 057
https://www.answer.ai/posts/2025-01-08-devin.html
Помните, какое-то время назад, в интернете появился Devin, AI программист, который должен был нас всех заменить? Тогда в демо этого AI Agent компания показывала, что он от и до смог решить какую-то задачу с Upwork без какого-либо вмешательства.
Так вот пока это все пустые обещания, все очень так себе.
@ohmydataengineer - канал "🕯Труба Данных" говорит что нас заменят, но не скоро
4 057
https://www.answer.ai/posts/2025-01-08-devin.html
Помните, какое-то время назад, в интернете появился Devin, AI программист, который должен был нас всех заменить? Тогда в демо этого AI Agent компания показывала, что он от и до смог решить какую-то задачу с Upwork без какого-либо вмешательства.
Так вот пока это все пустые обещания, все очень так себе.
@ohmydataengineer - канал "🕯Труба Данных" говорит что нас заменят, но не скоро
4 057
https://github.com/databrickslabs/dqx
Databricks выложили в опенсорс DQX - фреймворк для DQ поверх pyspark датафреймов.
Больше фреймворков богу фреймворков.
Даже мотивация для этого фреймворка какая-то хлюпкая
Current data quality frameworks often fall short in providing detailed explanations for specific row or column data quality issues and are primarily designed for complete datasets, making integration into streaming workloads difficult.
@ohmydataengineer - канал "🕯Труба Данных" не верит в очередной фреймворк
4 057
https://github.com/databrickslabs/dqx
Databricks выложили в опенсорс DQX - фреймворк для DQ поверх pyspark датафреймов.
Больше фреймворков богу фреймворков.
Даже мотивация для этого фреймворка какая-то хлюпкая
Current data quality frameworks often fall short in providing detailed explanations for specific row or column data quality issues and are primarily designed for complete datasets, making integration into streaming workloads difficult.
@ohmydataengineer - канал "🕯Труба Данных" не верит в очередной фреймворк
