🔋 Труба данных
Open in Telegram
Авторский канал обо всем, что происходит в мире работы с данными: хранение, обработка, визуализация, как мы принимаем решения и как мы становимся профессионалами в работе с данными. Автора канала - @SimonOsipov
Show more4 057
Subscribers
No data24 hours
+257 days
+930 days
Posts Archive
4 057
In most businesses, data producers have no idea who their consumers are or why they need the data in the first place. They are unaware of which data is important for AI/BI, nor do they understand what it should look like. Platform teams are rarely informed about how their infrastructure is being leveraged and have little knowledge of the business context surrounding data, while consumers have business context but don't know where the data is coming from or whether or not it's quality. Is it any wonder that data management programs are a complete, disjointed mess?Читаешь иногда статьи, а там режут как по живому...
4 057
https://x-x.codes/posts/100-tips-on-how-to-use-me/
Если вам удалось попробовать заниматься разработкой с агентами, то вот прекрасный набор советов о том, как этот процесс ускорить и улучшить.
По себе могу заметить, как изменился flow разработки, в очень интересном мире мы живем 🤪
@ohmydataengineer - канал "🕯Труба Данных"
4 057
https://blog.2minutestreaming.com/p/apache-kafka-4-0-release
Что касается изменений в 4.0 у Кафки (релиз состоялся), уход на покой Zookeeper не самый горячий пирожочек.
А вот это - да.
KIP-932: Queues (EA) 🚇
Perhaps the hottest new feature, Queues introduces a new type of consumer group - the Share Consumer - that gives you queue-like semantics:
1. per-message acknowledgement/retries
2. ability to have many consumers collaboratively share progress reading from the same partition (previously, only one consumer per consumer group could read a partition at any time)
@ohmydataengineer - канал "🕯Труба Данных"
4 057
ZooKeeper Deprecation
With the release of Apache Kafka 3.5, Zookeeper is now marked deprecated. Removal of ZooKeeper is planned in the next major release of Apache Kafka (version 4.0), which is scheduled to happen no sooner than April 2024. During the deprecation phase, ZooKeeper is still supported for metadata management of Kafka clusters, but it is not recommended for new deployments.
Пересаживаемся на KRaft. И слава богу. https://kafka.apache.org/documentation/#kraft
P.S. Зукипер был главнюком 14(!!) лет в деплойментах Кафки.
@ohmydataengineer - канал "🕯Труба Данных" никогда не любил зукипер!
4 057
https://arrow.apache.org/blog/2025/01/10/arrow-result-transfer/. и https://arrow.apache.org/blog/2025/02/28/data-wants-to-be-free/
Хорошая парочка технических статей (и будет потом еще несколько) про Apache Arrow и вообще как оно там под капотом.
@ohmydataengineer - канал "🕯Труба Данных" про Apache, но не Airflow!
4 057
https://github.com/deepseek-ai/smallpond
Там из каждого утюга уже написали про новый фреймворк который использовал DeepSeek для себя, где они сделали мультинодовый DuckDB и какие-то фантастические цифры якобы показали по обработке (https://github.com/deepseek-ai/3FS?tab=readme-ov-file#2-graysort)
Ну и я тоже напишу об этом 😁
@ohmydataengineer - канал "🕯Труба Данных" почти вовремя пишет новости!
4 057
Это что за новый зверь?
Были Data Engineers, потом MDS популяризировал лычку Analytics Engineer. А это что за зверь?
https://efds.fa.em5.oraclecloud.com/hcmUI/CandidateExperience/en/sites/CX_1/job/42523
@ohmydataengineer - канал "🕯Труба Данных" говорит об Data Software Developers!
4 057
Мы выяснили много классных инсайтов, например:
👉 Главные выводы
👉 Какие задачи решают аналитики
👉 Что с релокацией у аналитиков
👉 Где работают и как работают (удалёнка/офис)
👉 ЗАРПЛАТЫ: как менялись за год и сколько получают аналитики + мы дополнили исследование нашей экспертизой: что повышает или снижает стоимость аналитиков
👉 Откуда пришли в профессию и куда идут дальше
👉 Как ищут работу
👉 ТОП и Анти-ТОП компаний для аналитиков
👉 Что ценят в аналитической культуре
👉 Каких экспертов котируют и за кем следят
Вот такое вот большое исследование у NewHR вышло по аналитикам данных, которое я когда-то вас давно просил помочь заполнить.
▶️ Ссылка на сайт с полными результатами
https://newhr.org/data/research-analysts-2024
С удовольствием делюсь всеми результатами (и безбожно скопировав текст, который мне ребята прислали с важными фактами) 😁
@ohmydataengineer - канал "🕯Труба Данных" сегодня про аналитиков!
4 057
https://newsletter.pragmaticengineer.com/p/trimodal
Обновленная версия той самой известной статьи про три-модальную категоризацию компаний и зарплат в них.
Теперь дополнена данными из levels.fyi
Огромное и наглядное чтиво!
@ohmydataengineer - канал "🕯Труба Данных" подсказывает про зарплаты!
4 057
https://stackoverflow.blog/2025/02/27/our-next-phase-q-and-a-was-just-the-beginning/
SO, хоть и был источником ответов на вопросы (я прекрасно помню что буквально 3 года назад мы первым делом делали поиск в нем, когда пытались исправить баг), но медленно помирал из-за токсичности, gate-keeping и налета элитизма местных бородачей.
А с появлением LLM траффик туда вообще упал до минимума.
Так вот ребята затеяли изменение своей модели и вообще смысла в своем проекте:
The new Stack Overflow will be one built to feel like a personalized homepage—your own technical aggregator. It might collect videos, blogs, Q&A, war stories, jokes, educational materials, jobs, all these formats (or maybe others, we would love to hear your ideas!), and fold them together into one personalized destination. We want this place to be your “third screen”—your entry point to your own neighborhood on the internet.Что из этого получится? @ohmydataengineer - канал "🕯Труба Данных", который чуть не забанили за первый вопрос на SO!
4 057
https://debezium.io/blog/2025/02/01/real-time-data-replication-with-debezium-and-python/
Говорим Debezium, подразумеваем Kafka как точка, в которую у нас льются эвенты CDC. Казалось бы, самое стандартное и классическое решение, проверенное сотнями разных сетапов.
А вот нет, оказывается можно и без Kafka.
Debezium + CDC + Python + dlt → Real-time PostgreSQL replication
@ohmydataengineer - канал "🕯Труба Данных" удивлен новым подходам!
4 057
Жаба, гадюка, литкод...
Следите за руками:
- Челик сделал тулзу, чтобы хакать литкод интервью (на самом деле таких много уже, отличаются подходами, где-то опираются на голос и распознавание речи, где-то на видео-поток или скриншоты)
- Прошел с ее помощью в Амазон, снял всё на видео и выложил в Ютуб.
- Амазон обиделся и требует отчисления чувака из универа
Ссылку на конкретно эту тулзу увидите на скриншоте.
Еще пара похожих: ParakeetAI и Final Round AI
Что с этим делать - решать вам =)
А еще…
https://x.com/im_roy_lee/status/1895726775185129555
Правда чел говорит, что получил еще кучку офферов, но не планирует ни один принимать и вообще планировал это все давно и литкод интервью это зло. И так как история взорвала твиттур, тут же начали отзывать свои офферы все остальные компании.
@ohmydataengineer - канал "🕯Труба Данных" верил, что время литкода пройдет!
4 057
https://www.sqlnoir.com
Прикольный интерактив по изучению SQL - вы детектив и расследуете криминальные дела.
У вас есть датасет и возможность делать к нему запросы.
4 057
+1
https://github.com/sinaptik-ai/pandas-ai
Удивительная вещь, которая прошла мимо меня (а существует аж с апреля 2023 года)
Pandas + LLM + BI в одной опенсорс коробке, главное датасет отдай нормальный!🙂
@ohmydataengineer - канал "🕯Труба Данных" немного меньше недолюбливает Pandas
4 057
А помните нашумевшую историю, в которой Klarna сократила на 80% штат customer support, потому что заменила всех своим AI?
Все инфлюенсеры предрекали смерть customer support позиций, каждый сервис на своем сайте чат-ботов повнедрял, вся фигня.
Так вот Klarna откатывает это решение и снова набирает персонал🐻❄️
(скриншот и новость подсмотрел у сами знаете кого)
@ohmydataengineer - канал "🕯Труба Данных" все еще не заменен на AI
4 057
Всегда рад помочь хорошим и интересным проектам, чтобы про них узнала аудитория. Сегодня - один из таких случаев!
Привет, это Артемий @onepx, я создатель rushdb.com - передовой базы данных, построенной на базе Neo4j, не требующей конфигурации, моделирования данных и какой-либо нормализации данных.
Это позволяет использовать ее для быстрого прототипирования и разработки agentic решений и приложений без привлечения дорогостоящей backend экспертизы. Вы просто отправляете любые JSON / CSV данные, а RushDB берет на себя всю рутину по нормализации, лэйблингу, установке связей между сущностями и типизации входных данных.
Сегодня у нас случился публичный запуск и мы опубликовали краткий анонс всех возможностей и преимуществ нашего решения.
https://rushdb.com/blog/rushdb-the-zero-config-database-for-modern-apps-and-ai-solutions
RushDB доступен в open-source и в cloud managed варианте.
@ohmydataengineer - канал "🕯Труба Данных" рассказывает про новые базы данных!
4 057
Когда я отправлял в календарь этот пост, DeepSeek и Mistral еще не взрывали пуканы обычных обывателей интернета.
@ohmydataengineer - канал "🕯Труба Данных" и пятничный юмор!
