Инжиниринг Данных
Делюсь новостями из мира аналитики и карьерными советами. 15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG 🛠️ dataengineer.ru | 🏄♂️ Surfalytics.com №5017813306 Реклама: https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
نمایش بیشتر📈 تحلیل کانال تلگرام Инжиниринг Данных
کانال Инжиниринг Данных (@rockyourdata) در بخش زبانی روسی بازیگری فعال است. در حال حاضر جامعه شامل 23 760 مشترک است و جایگاه 5 432 را در دسته فناوری و برنامهها و رتبه 27 448 را در منطقه روسيا دارد.
📊 شاخصهای مخاطب و پویایی
از زمان ایجاد در невідомо، پروژه رشد سریعی داشته و 23 760 مشترک جذب کرده است.
بر اساس آخرین دادهها در تاریخ 15 سپتامبر, 2026، کانال فعالیت پایداری دارد. در ۳۰ روز گذشته تغییر اعضا برابر -34 و در ۲۴ ساعت گذشته برابر -8 بوده و همچنان دسترسی گستردهای حفظ شده است.
- وضعیت تأیید: تأیید نشده
- نرخ تعامل (ER): میانگین تعامل مخاطب 23.17% است و در ۲۴ ساعت نخست پس از انتشار، محتوا معمولاً 11.14% واکنش نسبت به کل مشترکان کسب میکند.
- دسترسی پستها: هر پست به طور میانگین 5 505 بازدید دریافت میکند. در اولین روز معمولاً 2 648 بازدید جمعآوری میشود.
- واکنشها و تعامل: مخاطبان بهطور فعال حمایت میکنند؛ میانگین واکنش به هر پست 40 است.
- علایق موضوعی: محتوا بر موضوعات کلیدی مانند claude, postgres, databricks, aws, sql تمرکز دارد.
📝 توضیح و سیاست محتوایی
نویسنده این فضا را محل بیان دیدگاههای شخصی توصیف میکند:
“Делюсь новостями из мира аналитики и карьерными советами.
15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG
🛠️ dataengineer.ru | 🏄♂️ Surfalytics.com
№5017813306
Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9...”
به لطف بهروزرسانیهای پرتکرار (آخرین داده در تاریخ 16 سپتامبر, 2026)، کانال همواره بهروز و دارای دسترسی بالاست. تحلیلها نشان میدهد مخاطبان بهطور فعال با محتوا تعامل دارند و آن را به نقطه اثرگذاری مهم در دسته فناوری و برنامهها تبدیل کردهاند.
در حال بارگیری داده...
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 16 سپتامبر | +3 | |||
| 15 سپتامبر | +1 | |||
| 14 سپتامبر | +1 | |||
| 13 سپتامبر | +5 | |||
| 12 سپتامبر | +2 | |||
| 11 سپتامبر | +10 | |||
| 10 سپتامبر | +7 | |||
| 09 سپتامبر | +8 | |||
| 08 سپتامبر | +5 | |||
| 07 سپتامبر | +5 | |||
| 06 سپتامبر | +2 | |||
| 05 سپتامبر | +6 | |||
| 04 سپتامبر | +1 | |||
| 03 سپتامبر | +4 | |||
| 02 سپتامبر | +3 | |||
| 01 سپتامبر | +3 |
| 2 | Как-то незаметно прошла новость, что SAP купил Dremio.
Зачем купили: SAP строит платформу AI-агентов, которым нужен доступ к данным из любых источников — как SAP, так и сторонних систем. Dremio решает именно это: позволяет запрашивать данные где угодно без ETL и копирования. Плюс
Dremio вписывается в более широкую стратегию — вместе с Reltio (очистка данных) и Prior Labs (AI-модели) SAP собирает полный data+AI стек.
Что такое Dremio: Высокопроизводительная lakehouse-платформа. Главные фишки — федеративные запросы к любым источникам без перемещения данных, нативная поддержка Apache Iceberg и автоматическое ускорение запросов (Reflections). Известна ещё тем, что co-создала Apache Arrow и Apache Polaris — оба стали индустриальными стандартами.
Не уверен, что Dremio ждет хорошее будущее. Когда-то BusinessObjects был лучшим BI инструментом, пока в 2007 году его не купил SAP.
Из других покупок:
• Sybase в 2010 году - одно из первых поколоночных хранилищ
• Altiscale в 2016 году - решения для Hadoop/BigData
В Ванкувере есть офис SAP, я даже видел вакансии раньше по data к ним.
Вообще к SAP у меня теплые воспоминания:
1. Я учил английский и SQL используя SAP BO и тренинги
2. В 2011 году я почти получил офер в Ирландию, но в целом понял, что западные технологии дают возможность работать по всему миру
3. Еще работая на первой работе в банке я провернул концепт fake it till you make it и несколько человек зашли в ИТ на позицию BI разработчик по SAP BO без ИТ опыта.
4. В ламоде наверно до сих пор есть видео про SAP BO, первая BI академия. Даже есть на YouTube - Lesson 1 Introduction into SAP BO Web Intelligence
5. Я почти перешел в офис SAP в Москве на позицию pre-sale/sale engineer. Главный мотиватор был, что они давали Audi A4 своим консультантам + поездки в Европу на тренинги.
6. Мне казалось, что SAP BW консультанты получали какие космические деньги на проектах - от 25т рублей в день через ИП, и это было в 2012 году!
У вас есть теплые воспоминания? | 1 726 |
| 3 | 19 сентября в 2:30 pm в Ванкувере решили собраться на Jericho beach, приходите кто хочет. С меня самовар:) | 2 393 |
| 4 | Как знакомо, когда организации хотят заставить всех vibe кодить свои приложения, чтобы выпилить вендора, и рассказать как они урезают косты.
Получается такая гремучая смесь tech debt и черной дыры для сжигания токенов.
Особенно, когда финансы, продажи, маркетинг сами себе создают приложения.
Я уже испытал такой подход в одной большой компании. Не проникся.
А как у вас? | 2 681 |
| 5 | Главная ошибка в разговоре об ИИ-агентах — оценивать их по демо. Демо почти всегда выглядит круто, но в проде все упирается в границы ответственности, данных и безопасности.
Коллеги из Cloud․ru поделились популярными мифами об ИИ-агентах и обозначили реальные границы их возможностей — читайте в карточках.
📌 Еще больше интересного контента про ИИ и технологии ребята из Cloud․ru публикуют в своем канале — подписаться | 2 705 |
| 6 | Хакатон на космических данных. Санкт-Петербург, Красноярск или онлайн из любой точки страны.
Стартуем 18 сентября.
За выходные участники доводят одну из задач до рабочего решения.
Санкт-Петербург. К 2035 году над Землёй должен работать топливный узел, у которого заправляются корабли, и откуда он будет получать топливо - с Земли, с Луны или из резерва - пока не решил никто. Команде предстоит собрать схему поставок, посчитать резервы и решить, во что вкладываться сразу. Призовой фонд 1,2 млн ₽.
Красноярск. Спутник видит горящий лес раньше любого наземного поста, но вместе с пожаром ловит нагретые крыши, факелы на месторождениях и блики на воде. Команде предстоит научить сервис отличать настоящий очаг от шума, обвести гарь и выдать площадь в гектарах. Призовой фонд 600 тыс. ₽.
Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.
Команда 3–5 человек, недостающих можно найти на платформе.
Регистрация по ссылке космохакатон.рф | 2 933 |
| 7 | Мощнее — не значит дороже
Главные расходы при расширении 1С и баз данных — это не само железо, а лицензии ПО за каждое ядро.
Оптимизировать затраты можно с помощью высокочастотных процессоров. Selectel запустил кластер AMD HiFreq в публичном облаке на базе VMware. Частота процессоров до 4.8 ГГц позволяет получить нужную производительность на меньшем количестве ядер.
Высокая частота процессоров сглаживает разницу в производительности при переходе с Oracle и MS SQL на российские СУБД: Postgres Pro, Tantor и другие. Быстрые диски снимают ограничения при обработке тяжелых нагрузок в 1С и аналитике.
Рассчитайте стоимость в удобном калькуляторе и разверните кластер для ваших задач: https://slc.tl/zegs8
Реклама. АО "Селектел". erid:2W5zFHGtVhT | 3 111 |
| 8 | Привет! Я хотел бы в Surfalytics добавить информация про возможность фриланса и открытия счетов а банках и ИП в странах СНГ. У вас есть информация или примеры? Может быть есть ТГ каналы такие. Если хотите ссылкой поделиться добавляете ссылку как код или цитату. | 3 431 |
| 9 | Воскресная мотивация от Бритни Спирс
Хочешь жить на широкую ногу? Жить в огромном особняке?
Тусоваться во Франции?
Тогда работай, детка, работай, детка,
Работай, детка, работай, детка.
А ну, за работу, детка! (а-а)
А ну, за работу, детка! (а-а)
Давай, бей в набат,
Не останавливайся — будь чемпионом.
Вкалывай так, будто это твоя профессия,
Берегись — вот оно идёт. | 3 750 |
| 10 | КосмоХакатоны задачи на реальных спутниковых данных 🚀
Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие.
Ближайшие два этапа идут одновременно 11–13 сентября, очные площадки в Нижнем Новгороде и Благовещенске.
Всего 12+ задач: технологические, управленческие и на ИИ, на каждом этапе свой набор.
В Нижнем Новгороде - проектирование устойчивой спутниковой группировки: как удержать связь и работоспособность системы, когда часть аппаратов выходит из строя. Плюс управленческий кейс про сервисную модель космических услуг: что сделать общественным сервисом, что отдать рынку и как всё это финансировать при жёстких бюджетах.
В Благовещенске - автономное управление группировкой, где спутники сами распределяют ресурсы по приоритетам задач. И мониторинг гидрологической обстановки по спутниковым снимкам: паводки, обмеление, разливы.
Дальше Санкт-Петербург и Красноярск 18–20 сентября.
🏆 Общий призовой фонд - 7,2 млн ₽, денежные призы на каждом этапе
💻 Очный и онлайн-форматы на всех этапах
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября
Все города, задачи и регистрация: космохакатон.рф | 5 231 |
| 11 | Отличная идея.
Буквально на прошлой неделе я спросил, какие акции мне купить.
Критерий был, чтобы стабильный сток продавался с дисконтом.
AI мне сказал про акции макдональдс, ну я их и купил, с iPhonа.
Мне кажется это спланированная акция от ИИ. | 5 118 |
| 12 | Будет все больше и больше AI Data Engineers вакансий.
А ваше резюме готово?
Pet проекты уже лежат в GitHub?
Книжки по основам AI engineering прочитаны? | 4 941 |
| 13 | В посте From Data Engineer To ?? Engineer автор затронул тему изменений в дата инжиниринге, связанных с развитием AI.
Автор является практикующим инженером, поэтому ему есть, что рассказать.
1. От Data Engineer → Landing Engineer
Что изменилось:
• Раньше пользователи хотели готовые дашборды, витрины данных (data marts) и полностью смоделированный BI-слой
• Теперь запрос стал проще: «просто дай мне сырые данные»
Почему: Пользователи сами «вайб-кодят» последнюю милю с помощью Claude, Codex и подобных инструментов
Следствие для стека:
• Дорогие Snowflake/Databricks нужны лишь для хранения и контроля доступа
• Альтернатива: партиционированные Parquet/Iceberg/DuckLake + несколько DuckDB-трансформаций
• Документация схемы в Markdown — и пользователи готовы к работе
Тут я бы добавил, что просто так вряд ли всё заработает без хорошего семантического слоя. Хороший семантический слой — это модель данных (например, по Кимбалу) и описание каждой таблицы, каждого поля, каждого соединения между таблицами. По моему опыту, это самое сложное. Возможно, когда у вас 1–2 датасета, ИИ сможет понять, что и как, но такой подход не масштабируется. А главное — ИИ может легко накосячить.
Важно понимать, что желание использовать ИИ в аналитике для поиска инсайтов и реальные возможности компании не совпадают. Купить подписку на Claude или Codex не решит накопившиеся проблемы, а только усугубит их. Чем больше legacy и tech debt, тем сложнее проверить такой «фокус».
Но если у вас заведётся, то, как я писал раньше, С-уровень будет в восторге, и у вас появятся бюджеты на новые инструменты, а вас будут ценить как никогда. Можно смело сказать, что ИИ-аналитика сейчас является одним из самых впечатляющих достижений, поэтому я всех прошу добавлять такой кейс в резюме и делать подобные пет-проекты — hiring manager оценит такой бонус.
2. От Data Engineer → DevOps Engineer
Что изменилось:
• Data engineering децентрализуется: инженер создаёт центральные артефакты, а команды сами строят свои пайплайны
• Пользователи хотят запускать агентов для построения дашбордов
Новая инфраструктура, которую нужно поднимать:
• Cloud sandboxes — среда для агентов
• Data storage (bucket) — хранение данных
• LLM governance — контроль затрат и безопасности
• Best practices — стандарты для агентного кода
Вывод: ~90% этой работы — чистый DevOps
Всё, что касается инфраструктуры, для меня всегда было приоритетом, поэтому тут ничего нового — просто стало проще и удобнее. ИИ может писать скрипты для Terraform, и они достаточно простые и надёжные. А вот про LLM governance и sandboxes для агентов я не подскажу — как-то не доводилось.
Обычно в дата-инжиниринге инфраструктура и среды (dev/test/prod) — не проблема. Проблема — иметь свежие данные в среде разработки. Ведь не хочется дублировать все data pipelines на все среды.
Главный бонус DevOps — менеджеры с Claude туда не полезут. Поэтому у вас остаётся хоть немного задач, где вы сами себе хозяин: сами придумываете сроки и сами решаете, как лучше сделать.
3. От Data Engineer → Software Engineer
Что изменилось:
• Пользователи с доступом к данным, агенту и sandbox-у неизбежно строят прототипы приложений
• И затем просят «просто поднять это в прод» — что, конечно, совсем не просто
Два пути для инженера:
• Go Deep — стать специалистом (Streaming, Iceberg и т.д.), скорее всего в software vendor
• Go Wide — стать DevOps-data-software инженером, владеющим всем циклом внутри компании
Безусловно, для пет-проектов я теперь Software Engineer. Для компании — я не хочу быть SDE, но с помощью агентов я могу найти исходный код и использовать его в решениях дата-инжиниринга. Или попробовать докопаться до бага в данных.
Есть и примеры, когда продуктовые менеджеры не хотят ждать дата-команду и сами создают аналитические решения. Они решают задачи, но не в долгосрочной перспективе — скорее как поделка. Зато возможности у всех стали безграничными. | 4 824 |
| 14 | Цены на составляющие улетели в космос. Заказал NX Jetson, за 2600, хотя думал он будет стоить долларов 500.
Так же смотрим AI сервер для обучение алгоритмов компьютерного зрения, в планах было взять:
Threadripper 7960X (24 ядра), 256 GB DDR5 ECC, 2× RTX 5090 32 GB, 10 TB NVMe, 1600 W
Задача:
Обучение с учителем на синтетике: дистилляция учитель–ученик для детекции, transfer learning от предобученного ViT для позы, доменная адаптация против sim-to-real разрыва. RL не в критическом пути.
Цена за сервер получается тысяч 30-40, да еще нужна промышленная розетка и охлаждение.
Кто-нибудь, что нибудь собирал в последнее время? | 5 385 |
| 15 | Azure DP 750 или типа того.
Для работы нужно было сдать экзамен, пришлось попросить «крышевать», как результат 942 из 1000🤴.
Все вопросы были про Azure Databricks.
Хотите сдать также хорошо экзамен? Есть варианты -> дорого, быстро, надежно😎 | 5 604 |
| 16 | Diversity для LLMs
В одном стартапе, про который я недавно писал, все используют Claude Code.
Claude Code подключён к MCPs:
• dbt Cloud
• Snowflake
• Omni BI
С помощью Claude Desktop и Claude Code любой желающий (с доступом) может писать код, открывать PR. Как правило, всё это происходит в dbt или Omni.
То есть все поголовно стали Analytics Engineers. Даже если вы с компьютером на «вы», теперь даже с iPad'а можно заменить BI- и Analytics Engineer. Ведь основным языком программирования, как говорят, стал English. Даже если вы не согласны с этим (как и я), то ваш руководитель может считать по другому, а его мнение имеет бОльший вес, поэтому по факту будет так, как начальство скажет.
В отдельном посте я расскажу, как мы перешли к data model-oriented development (именно бизнес-модель данных, ER-диаграмма по Кимбаллу).
Так вот, суть проблемы такова: у всех Claude Code (не путать с Claude Котом из поста выше), и все работают не покладая рук. Коммит за коммитом, комментарий за комментарием и т. п. Агент пишет код, создаёт документацию, формирует описание PR, тестирует код. Другой человек с таким же агентом пытается код проверить, оставляет комментарии.
В последнее время у Claude прямо беда с написанием английского текста — он пишет размашисто и непонятно, оставляет большие и бесполезные комментарии в коде, вообще стал чудить. Также появилась новая фича — Watermark, которая осознанно заменяет слова на синонимы.
Поэтому работать всей командой, используя одни и те же модели, стало сложно. Я провёл эксперимент: стал использовать Cursor для проверки кода и текста. Оказалось, что Cursor понимает мою проблему и с удовольствием почистил PR, подсказал, где урезать код и текст, где не применились best practices и т. п. В целом могу сказать, что Cursor достаточно хорошо прокачался за последнее время — теперь у них есть Grok.
Таким образом, с одной моделью далеко не уедешь, если создаёшь серьёзный продукт. Всегда полезно добавить второе мнение от другой модели. Насколько я понимаю, в AI4SDLC это уже закладывается на входе, поэтому можно смело планировать использование нескольких моделей и агентов для повышения качества кода и документации и снижения когнитивной нагрузки на оператора AI. Мы же теперь операторы, а не инженеры?🎮 | 5 725 |
| 17 | Никогда не думал, что заведем кота. Я себя больше относил к собакам. Но семья решила по другому. Возможно у кота есть немного собачих привычек, бегать-прыгать, а возможно еще молодой.
Назвал я его Claude Кот. Когда никого нет дома, он лежит рядом, дает добро на сжигание сотни тысяч токенов. | 5 869 |
| 18 | Как построить управляемый Data Lakehouse за неделю на Evolution Data Platform ⤵️
На вебинаре 8 сентября эксперты Cloud.ru покажут, как за неделю с нуля построить архитектуру Data Lakehouse на Evolution Data Platform — от загрузки сырых данных до курированных витрин — с помощью управляемых сервисов, без эксплуатационной нагрузки и с фокусом на бизнес-результат.
В программе:
▶️принципы построения Lakehouse-архитектуры с единым слоем хранения в S3 в формате Apache Iceberg с поддержкой ACID-гарантий и версионирования;
▶️подходы к централизованному управлению метаданными и происхождением данных через Managed Metastore;
▶️способы реализации контроля качества данных в Managed Spark без остановки пайплайнов;
▶️методы организации хранения данных с разным уровнем доверия: партиционирование по качеству, time travel и разделение слоев хранения;
▶️принципы настройки единого SQL-слоя через Managed Trino с разграничением доступа;
▶️инструменты автоматизации оркестрации и мониторинга пайплайнов в Managed Airflow;
▶️возможности визуализации качества и происхождения данных в Managed BI.
➡️ Регистрация — по ссылке | 5 498 |
| 19 | На SmallSat нашел единственную компания, которая создает дата платформа as a service для телеметрии. То есть ничего принципиально нового, но есть конкретный фокус на AeroSpace и у них уже есть серьезные клиенты.
Они объединили хранения и “бизнес” метрики + красивый UI.
То есть вместо того, чтобы самому строить в Elastic Search, Prometheus - предлагают готовый продукт.
Компания называется Sift. Claude Design добавил карточку с описанием.
https://www.siftstack.com/ | 5 964 |
| 20 | Давно мечтал добавить сайт про музей прадеда, наконец старший сын подрос и научился пользоваться Claude Code (14 лет) и создал сайт, я по смыслу поправил и показал как подключить домен.
Сентябрь 1812 года. Москва оставлена, армия отступает, война выглядит проигранной. Через полтора месяца Наполеон побежит из России — и первый толчок к этому был дан здесь, на поле у Тарутина.
https://tarutino-museum.ru/
Фотограф Екатерина Советкина, она же снимала дата-завтрак в Т-Банк, где я рассказывал про дата инжиниринг.
PS сайт на Github Pages, и если они не работают в РФ, значит нужно поискать альтернативу.
Если кому-то нужно простой сайт для некоммерческой организации, пишите. | 5 599 |
