en
Feedback
🔋 Труба данных

🔋 Труба данных

Open in Telegram

Авторский канал обо всем, что происходит в мире работы с данными: хранение, обработка, визуализация, как мы принимаем решения и как мы становимся профессионалами в работе с данными. Автора канала - @SimonOsipov

Show more
4 057
Subscribers
No data24 hours
+257 days
+930 days
Posts Archive
https://www.checklyhq.com/blog/300ms-from-every-pod-startup-with-a-single-grafana-query Статья не про data engineering, но удивительная борьба за 300ms и savings в $5.5к. Напомнило историю про бекдор через ssh, когда один из инженеров заметил, что команда выполняется на 0.1 сек дольше @ohmydataengineer

https://discord.com/blog/how-discord-uses-open-source-tools-for-scalable-data-orchestration-transformation А тут о том, как Discord съезжал с своего собственного оркестратора на Dagster @ohmydataengineer

https://www.canva.dev/blog/engineering/product-analytics-event-collection/ Небольшая статья с поверхностным описанием того, как у Canva (ага, той самой которая жила с одним большим кликом) ведется работа с эвентами. @ohmydataengineer

Пятничный юмор!☺️
Пятничный юмор!☺️

https://www.notion.so/blog/building-and-scaling-notions-data-lake О том как Notion стоил свой data lake. Спойлер: начинали также, как Figma, с одного большого Postgres. Потом много шардов Postgres, и только потом Snowflake. А потом их он заколебал 💩 @ohmydataengineer

Пятничный юмор 😄 @ohmydataengineer
Пятничный юмор 😄 @ohmydataengineer

https://medium.com/@fengruohang/database-in-kubernetes-is-that-a-good-idea-daf5775b5c1f Оч большое внятное чтиво про то, хорошо ли пихать базы данных в кубирнетис (с) или нет. @ohmydataengineer

Журнал "Зарплатник" @zarplatnik_media Вот это название, конечно 😄 Ко мне пришел Тагир с канала @tagir_analyzes, попросил рас
Журнал "Зарплатник" @zarplatnik_media Вот это название, конечно 😄 Ко мне пришел Тагир с канала @tagir_analyzes, попросил рассказать про его канал "Зарплатник" @zarplatnik_media И раз уж у меня канал на русскоговорящую аудиторию, знания про рынок РФ (условия работы, зарплаты и так далее) - штука актуальная. В канале описываются анонимно позиции в компаниях, бенефиты, условия работы и так далее. Какое-то представление о текущем рынке можно составить. НО помните, что любая смена работы - штука индивидуальная и ваша компенсация может сильно отличаться (в обе стороны). @ohmydataengineer

Сколько их уже было: Pandas, Dask, Ray, Polars. Вот еще прибыло - Daft https://www.getdaft.io/ @ohmydataengineer
Сколько их уже было: Pandas, Dask, Ray, Polars. Вот еще прибыло - Daft https://www.getdaft.io/ @ohmydataengineer

https://medium.com/walmartglobaltech/reliably-processing-trillions-of-kafka-messages-per-day-23494f553ef9 Неплохая статья из инженерного блога Wallmart о том, как они процессят over9000 сообщений в Kafka. @ohmydataengineer

https://www.wired.com/story/epam-snowflake-ticketmaster-breach-shinyhunters/ Тут подкинули деталей про утечку у Snowflake. Все просто и банально, установил малварь себе на компуктер. @ohmydataengineer

https://medium.com/@kywe665/unity-catalog-oss-with-hudi-delta-iceberg-and-emr-duckdb-710ab8f8a7dc Databricks выложил свой Unity Catalog в open-source (https://www.databricks.com/blog/open-sourcing-unity-catalog) и народ уже начал к нему всякое подключать. @ohmydataengineer

Пятничный юмор или самый частый вопрос в DE😄 @ohmydataengineer
Пятничный юмор или самый частый вопрос в DE😄 @ohmydataengineer

Что там по Apache Iceberg? Несколько новостей, связанных с этим популярным форматом: - Dremio и REST Catalog - https://www.youtube.com/watch?v=Bkpj7M6yVdQ&list=PL-gIUf9e9CCtmCcXDWkZJob7SLdgEm3ia&index=5 - Snowflake и Polaris Catalog - https://www.snowflake.com/blog/introducing-polaris-catalog/ - Databrics купили Tabular - https://tabular.io/blog/tabular-is-joining-databricks (писал про это ранее) - Microsoft Fabric добавят Iceberg Support в рамках партнерства с Snowflake - https://www.microsoft.com/en-us/microsoft-fabric/blog/2024/05/22/snowflake-and-microsoft-announce-expansion-of-their-partnership Собственно, если вы все пропустили и не поняли, а что этот Iceberg такое, то вот прекрасная книжка от O'Reilly, еще и бесплатно - https://hello.dremio.com/wp-apache-iceberg-the-definitive-guide-reg.html @ohmydataengineer

https://www.definite.app/blog/duckdb-datawarehouse А какой был заголовок! Я уже приготовился ко всякой вкусняшке внутри, про плюсы и минусы, ну и DuckDB, распиаренный не меньше Snowflake... Но ларчик просто открывался, достаточно смотреть детали: Size of data: 1TB Ну и, конечно же, DuckDB is designed for single-user workloads and becomes locked and un-queryable during data writes or table edits. To work around this issue, we set up two DuckDB instances, a write-to database and a read-only database... Как сказали у меня в ленте в твитторе, "Это не Warehouse, это кладовка какая-то" @ohmydataengineer

Пятничный юмор! @ohmydataengineer
Пятничный юмор! @ohmydataengineer

https://www.youtube.com/watch?v=Ik0voaZmf5A&t=30316s (видео с PyCon Italia 2024) и расшифровка https://vickiboykis.com/2024/05/20/dont-worry-about-llms/ Don't Worry About LLM. Одновременно смешной и технически фундаментальный доклад про то, что происходит с LLM и стоит ли сильно переживать и испытывать FOMO из-за происходящего @ohmydataengineer

https://www.databricks.com/blog/databricks-tabular Databricks to acquire Tabulario, a data platform from the original creators of Apache Iceberg. Какой вывод из этой новости сделать - я не знаю, честно, чего ожидать от Бриксов. Но, кажется, в связи с последними событиями у Snowflake, их позиция на рынке стала посильней. @ohmydataengineer

https://www.cnews.ru/news/line/2024-05-31_situatsiya_s_greenplum_ne_okazhet Ну и вот еще из новостей - Broadcom сделала все репозитории с Greenplum архивными и, кажется, что развитие GP теперь будет происходить за пределами Open Source. Например, у Arenadata остался свой форк. @ohmydataengineer

https://www.wsj.com/articles/sorry-ai-old-school-spreadsheets-are-still-king-cbb99936 WSJ повторяет примерно тоже самое, о чем я думал последние N-месяцев: Excel никуда не исчезнет и если вы думаете, что натравив LLM на эксельки и вы получите супермозг, вы ошибаетесь. Вы же помните, сколько экселек было нагенерированно, как они меняются, как они поддерживаются и так далее? @ohmydataengineer