fa
Feedback
Инжиниринг Данных

Инжиниринг Данных

رفتن به کانال در Telegram

Делюсь новостями из мира аналитики и карьерными советами. 15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG 🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com №5017813306 Реклама: https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce

نمایش بیشتر

📈 تحلیل کانال تلگرام Инжиниринг Данных

کانال Инжиниринг Данных (@rockyourdata) در بخش زبانی روسی بازیگری فعال است. در حال حاضر جامعه شامل 23 760 مشترک است و جایگاه 5 432 را در دسته فناوری و برنامه‌ها و رتبه 27 448 را در منطقه روسيا دارد.

📊 شاخص‌های مخاطب و پویایی

از زمان ایجاد در невідомо، پروژه رشد سریعی داشته و 23 760 مشترک جذب کرده است.

بر اساس آخرین داده‌ها در تاریخ 15 سپتامبر, 2026، کانال فعالیت پایداری دارد. در ۳۰ روز گذشته تغییر اعضا برابر -34 و در ۲۴ ساعت گذشته برابر -8 بوده و همچنان دسترسی گسترده‌ای حفظ شده است.

  • وضعیت تأیید: تأیید نشده
  • نرخ تعامل (ER): میانگین تعامل مخاطب 23.17% است و در ۲۴ ساعت نخست پس از انتشار، محتوا معمولاً 11.14% واکنش نسبت به کل مشترکان کسب می‌کند.
  • دسترسی پست‌ها: هر پست به طور میانگین 5 505 بازدید دریافت می‌کند. در اولین روز معمولاً 2 648 بازدید جمع‌آوری می‌شود.
  • واکنش‌ها و تعامل: مخاطبان به‌طور فعال حمایت می‌کنند؛ میانگین واکنش به هر پست 40 است.
  • علایق موضوعی: محتوا بر موضوعات کلیدی مانند claude, postgres, databricks, aws, sql تمرکز دارد.

📝 توضیح و سیاست محتوایی

نویسنده این فضا را محل بیان دیدگاه‌های شخصی توصیف می‌کند:
Делюсь новостями из мира аналитики и карьерными советами. 15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG 🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com №5017813306 Реклама: https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9...

به لطف به‌روزرسانی‌های پرتکرار (آخرین داده در تاریخ 16 سپتامبر, 2026)، کانال همواره به‌روز و دارای دسترسی بالاست. تحلیل‌ها نشان می‌دهد مخاطبان به‌طور فعال با محتوا تعامل دارند و آن را به نقطه اثرگذاری مهم در دسته فناوری و برنامه‌ها تبدیل کرده‌اند.

23 760
مشترکین
-824 ساعت
-67 روز
-3430 روز
آرشیو پست ها
19 сентября в 2:30 pm в Ванкувере решили собраться на Jericho beach, приходите кто хочет. С меня самовар:)
19 сентября в 2:30 pm в Ванкувере решили собраться на Jericho beach, приходите кто хочет. С меня самовар:)

Как знакомо, когда организации хотят заставить всех vibe кодить свои приложения, чтобы выпилить вендора, и рассказать как они
Как знакомо, когда организации хотят заставить всех vibe кодить свои приложения, чтобы выпилить вендора, и рассказать как они урезают косты. Получается такая гремучая смесь tech debt и черной дыры для сжигания токенов. Особенно, когда финансы, продажи, маркетинг сами себе создают приложения. Я уже испытал такой подход в одной большой компании. Не проникся. А как у вас?

Главная ошибка в разговоре об ИИ-агентах — оценивать их по демо. Демо почти всегда выглядит круто, но в проде все упирается в
+8
Главная ошибка в разговоре об ИИ-агентах — оценивать их по демо. Демо почти всегда выглядит круто, но в проде все упирается в границы ответственности, данных и безопасности.
Коллеги из Cloud․ru поделились популярными мифами об ИИ-агентах и обозначили реальные границы их возможностей — читайте в карточках. 📌 Еще больше интересного контента про ИИ и технологии ребята из Cloud․ru публикуют в своем канале — подписаться

Хакатон на космических данных. Санкт-Петербург, Красноярск или онлайн из любой точки страны. Стартуем 18 сентября. За выходны
Хакатон на космических данных. Санкт-Петербург, Красноярск или онлайн из любой точки страны. Стартуем 18 сентября. За выходные участники доводят одну из задач до рабочего решения. Санкт-Петербург. К 2035 году над Землёй должен работать топливный узел, у которого заправляются корабли, и откуда он будет получать топливо - с Земли, с Луны или из резерва - пока не решил никто. Команде предстоит собрать схему поставок, посчитать резервы и решить, во что вкладываться сразу. Призовой фонд 1,2 млн ₽. Красноярск. Спутник видит горящий лес раньше любого наземного поста, но вместе с пожаром ловит нагретые крыши, факелы на месторождениях и блики на воде. Команде предстоит научить сервис отличать настоящий очаг от шума, обвести гарь и выдать площадь в гектарах. Призовой фонд 600 тыс. ₽. Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей. Команда 3–5 человек, недостающих можно найти на платформе. Регистрация по ссылке космохакатон.рф

Мощнее — не значит дороже Главные расходы при расширении 1С и баз данных — это не само железо, а лицензии ПО за каждое ядро.
Мощнее — не значит дороже Главные расходы при расширении 1С и баз данных — это не само железо, а лицензии ПО за каждое ядро. Оптимизировать затраты можно с помощью высокочастотных процессоров. Selectel запустил кластер AMD HiFreq в публичном облаке на базе VMware. Частота процессоров до 4.8 ГГц позволяет получить нужную производительность на меньшем количестве ядер. Высокая частота процессоров сглаживает разницу в производительности при переходе с Oracle и MS SQL на российские СУБД: Postgres Pro, Tantor и другие. Быстрые диски снимают ограничения при обработке тяжелых нагрузок в 1С и аналитике. Рассчитайте стоимость в удобном калькуляторе и разверните кластер для ваших задач: https://slc.tl/zegs8 Реклама. АО "Селектел". erid:2W5zFHGtVhT

Привет! Я хотел бы в Surfalytics добавить информация про возможность фриланса и открытия счетов а банках и ИП в странах СНГ. У вас есть информация или примеры? Может быть есть ТГ каналы такие. Если хотите ссылкой поделиться добавляете ссылку как код или цитату.

Воскресная мотивация от Бритни Спирс
Хочешь жить на широкую ногу? Жить в огромном особняке? Тусоваться во Франции? Тогда работай, детка, работай, детка, Работай, детка, работай, детка. А ну, за работу, детка! (а-а) А ну, за работу, детка! (а-а) Давай, бей в набат, Не останавливайся — будь чемпионом. Вкалывай так, будто это твоя профессия, Берегись — вот оно идёт.

КосмоХакатоны задачи на реальных спутниковых данных 🚀 Участвовать можно очно на площадке или онлайн из любой точки России —
КосмоХакатоны задачи на реальных спутниковых данных 🚀 Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие. Ближайшие два этапа идут одновременно 11–13 сентября, очные площадки в Нижнем Новгороде и Благовещенске. Всего 12+ задач: технологические, управленческие и на ИИ, на каждом этапе свой набор. В Нижнем Новгороде - проектирование устойчивой спутниковой группировки: как удержать связь и работоспособность системы, когда часть аппаратов выходит из строя. Плюс управленческий кейс про сервисную модель космических услуг: что сделать общественным сервисом, что отдать рынку и как всё это финансировать при жёстких бюджетах. В Благовещенске - автономное управление группировкой, где спутники сами распределяют ресурсы по приоритетам задач. И мониторинг гидрологической обстановки по спутниковым снимкам: паводки, обмеление, разливы. Дальше Санкт-Петербург и Красноярск 18–20 сентября. 🏆 Общий призовой фонд - 7,2 млн ₽, денежные призы на каждом этапе 💻 Очный и онлайн-форматы на всех этапах 🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе 🚀 Лучшие команды выходят в финал в Москве 25–27 сентября Все города, задачи и регистрация: космохакатон.рф

Отличная идея. Буквально на прошлой неделе я спросил, какие акции мне купить. Критерий был, чтобы стабильный сток продавался с дисконтом. AI мне сказал про акции макдональдс, ну я их и купил, с iPhonа. Мне кажется это спланированная акция от ИИ.

Будет все больше и больше AI Data Engineers вакансий. А ваше резюме готово? Pet проекты уже лежат в GitHub? Книжки по основам
Будет все больше и больше AI Data Engineers вакансий. А ваше резюме готово? Pet проекты уже лежат в GitHub? Книжки по основам AI engineering прочитаны?

В посте From Data Engineer To ?? Engineer автор затронул тему изменений в дата инжиниринге, связанных с развитием AI. Автор является практикующим инженером, поэтому ему есть, что рассказать.
1. От Data Engineer → Landing Engineer Что изменилось: • Раньше пользователи хотели готовые дашборды, витрины данных (data marts) и полностью смоделированный BI-слой • Теперь запрос стал проще: «просто дай мне сырые данные» Почему: Пользователи сами «вайб-кодят» последнюю милю с помощью Claude, Codex и подобных инструментов Следствие для стека: • Дорогие Snowflake/Databricks нужны лишь для хранения и контроля доступа • Альтернатива: партиционированные Parquet/Iceberg/DuckLake + несколько DuckDB-трансформаций • Документация схемы в Markdown — и пользователи готовы к работе Тут я бы добавил, что просто так вряд ли всё заработает без хорошего семантического слоя. Хороший семантический слой — это модель данных (например, по Кимбалу) и описание каждой таблицы, каждого поля, каждого соединения между таблицами. По моему опыту, это самое сложное. Возможно, когда у вас 1–2 датасета, ИИ сможет понять, что и как, но такой подход не масштабируется. А главное — ИИ может легко накосячить. Важно понимать, что желание использовать ИИ в аналитике для поиска инсайтов и реальные возможности компании не совпадают. Купить подписку на Claude или Codex не решит накопившиеся проблемы, а только усугубит их. Чем больше legacy и tech debt, тем сложнее проверить такой «фокус». Но если у вас заведётся, то, как я писал раньше, С-уровень будет в восторге, и у вас появятся бюджеты на новые инструменты, а вас будут ценить как никогда. Можно смело сказать, что ИИ-аналитика сейчас является одним из самых впечатляющих достижений, поэтому я всех прошу добавлять такой кейс в резюме и делать подобные пет-проекты — hiring manager оценит такой бонус. 2. От Data Engineer → DevOps Engineer Что изменилось: • Data engineering децентрализуется: инженер создаёт центральные артефакты, а команды сами строят свои пайплайны • Пользователи хотят запускать агентов для построения дашбордов Новая инфраструктура, которую нужно поднимать: • Cloud sandboxes — среда для агентов • Data storage (bucket) — хранение данных • LLM governance — контроль затрат и безопасности • Best practices — стандарты для агентного кода Вывод: ~90% этой работы — чистый DevOps
Всё, что касается инфраструктуры, для меня всегда было приоритетом, поэтому тут ничего нового — просто стало проще и удобнее. ИИ может писать скрипты для Terraform, и они достаточно простые и надёжные. А вот про LLM governance и sandboxes для агентов я не подскажу — как-то не доводилось. Обычно в дата-инжиниринге инфраструктура и среды (dev/test/prod) — не проблема. Проблема — иметь свежие данные в среде разработки. Ведь не хочется дублировать все data pipelines на все среды. Главный бонус DevOps — менеджеры с Claude туда не полезут. Поэтому у вас остаётся хоть немного задач, где вы сами себе хозяин: сами придумываете сроки и сами решаете, как лучше сделать.
3. От Data Engineer → Software Engineer Что изменилось: Пользователи с доступом к данным, агенту и sandbox-у неизбежно строят прототипы приложений И затем просят «просто поднять это в прод» — что, конечно, совсем не просто Два пути для инженера: Go Deep — стать специалистом (Streaming, Iceberg и т.д.), скорее всего в software vendor Go Wide — стать DevOps-data-software инженером, владеющим всем циклом внутри компании
Безусловно, для пет-проектов я теперь Software Engineer. Для компании — я не хочу быть SDE, но с помощью агентов я могу найти исходный код и использовать его в решениях дата-инжиниринга. Или попробовать докопаться до бага в данных. Есть и примеры, когда продуктовые менеджеры не хотят ждать дата-команду и сами создают аналитические решения. Они решают задачи, но не в долгосрочной перспективе — скорее как поделка. Зато возможности у всех стали безграничными.

Цены на составляющие улетели в космос. Заказал NX Jetson, за 2600, хотя думал он будет стоить долларов 500. Так же смотрим AI
Цены на составляющие улетели в космос. Заказал NX Jetson, за 2600, хотя думал он будет стоить долларов 500. Так же смотрим AI сервер для обучение алгоритмов компьютерного зрения, в планах было взять:
Threadripper 7960X (24 ядра), 256 GB DDR5 ECC, 2× RTX 5090 32 GB, 10 TB NVMe, 1600 W
Задача:
Обучение с учителем на синтетике: дистилляция учитель–ученик для детекции, transfer learning от предобученного ViT для позы, доменная адаптация против sim-to-real разрыва. RL не в критическом пути.
Цена за сервер получается тысяч 30-40, да еще нужна промышленная розетка и охлаждение. Кто-нибудь, что нибудь собирал в последнее время?

Azure DP 750 или типа того. Для работы нужно было сдать экзамен, пришлось попросить «крышевать», как результат 942 из 1000🤴.
Azure DP 750 или типа того. Для работы нужно было сдать экзамен, пришлось попросить «крышевать», как результат 942 из 1000🤴. Все вопросы были про Azure Databricks. Хотите сдать также хорошо экзамен? Есть варианты -> дорого, быстро, надежно😎

Diversity для LLMs В одном стартапе, про который я недавно писал, все используют Claude Code. Claude Code подключён к MCPs: •
Diversity для LLMs В одном стартапе, про который я недавно писал, все используют Claude Code. Claude Code подключён к MCPs: • dbt Cloud • Snowflake • Omni BI С помощью Claude Desktop и Claude Code любой желающий (с доступом) может писать код, открывать PR. Как правило, всё это происходит в dbt или Omni. То есть все поголовно стали Analytics Engineers. Даже если вы с компьютером на «вы», теперь даже с iPad'а можно заменить BI- и Analytics Engineer. Ведь основным языком программирования, как говорят, стал English. Даже если вы не согласны с этим (как и я), то ваш руководитель может считать по другому, а его мнение имеет бОльший вес, поэтому по факту будет так, как начальство скажет. В отдельном посте я расскажу, как мы перешли к data model-oriented development (именно бизнес-модель данных, ER-диаграмма по Кимбаллу). Так вот, суть проблемы такова: у всех Claude Code (не путать с Claude Котом из поста выше), и все работают не покладая рук. Коммит за коммитом, комментарий за комментарием и т. п. Агент пишет код, создаёт документацию, формирует описание PR, тестирует код. Другой человек с таким же агентом пытается код проверить, оставляет комментарии. В последнее время у Claude прямо беда с написанием английского текста — он пишет размашисто и непонятно, оставляет большие и бесполезные комментарии в коде, вообще стал чудить. Также появилась новая фича — Watermark, которая осознанно заменяет слова на синонимы. Поэтому работать всей командой, используя одни и те же модели, стало сложно. Я провёл эксперимент: стал использовать Cursor для проверки кода и текста. Оказалось, что Cursor понимает мою проблему и с удовольствием почистил PR, подсказал, где урезать код и текст, где не применились best practices и т. п. В целом могу сказать, что Cursor достаточно хорошо прокачался за последнее время — теперь у них есть Grok. Таким образом, с одной моделью далеко не уедешь, если создаёшь серьёзный продукт. Всегда полезно добавить второе мнение от другой модели. Насколько я понимаю, в AI4SDLC это уже закладывается на входе, поэтому можно смело планировать использование нескольких моделей и агентов для повышения качества кода и документации и снижения когнитивной нагрузки на оператора AI. Мы же теперь операторы, а не инженеры?🎮

Никогда не думал, что заведем кота. Я себя больше относил к собакам. Но семья решила по другому. Возможно у кота есть немного
Никогда не думал, что заведем кота. Я себя больше относил к собакам. Но семья решила по другому. Возможно у кота есть немного собачих привычек, бегать-прыгать, а возможно еще молодой. Назвал я его Claude Кот. Когда никого нет дома, он лежит рядом, дает добро на сжигание сотни тысяч токенов.

Как построить управляемый Data Lakehouse за неделю на Evolution Data Platform ⤵️ На вебинаре 8 сентября эксперты Cloud.​ru по
Как построить управляемый Data Lakehouse за неделю на Evolution Data Platform ⤵️ На вебинаре 8 сентября эксперты Cloud.​ru покажут, как за неделю с нуля построить архитектуру Data Lakehouse на Evolution Data Platform — от загрузки сырых данных до курированных витрин — с помощью управляемых сервисов, без эксплуатационной нагрузки и с фокусом на бизнес-результат. В программе: ▶️принципы построения Lakehouse-архитектуры с единым слоем хранения в S3 в формате Apache Iceberg с поддержкой ACID-гарантий и версионирования; ▶️подходы к централизованному управлению метаданными и происхождением данных через Managed Metastore; ▶️способы реализации контроля качества данных в Managed Spark без остановки пайплайнов; ▶️методы организации хранения данных с разным уровнем доверия: партиционирование по качеству, time travel и разделение слоев хранения; ▶️принципы настройки единого SQL-слоя через Managed Trino с разграничением доступа; ▶️инструменты автоматизации оркестрации и мониторинга пайплайнов в Managed Airflow; ▶️возможности визуализации качества и происхождения данных в Managed BI. ➡️ Регистрация — по ссылке

На SmallSat нашел единственную компания, которая создает дата платформа as a service для телеметрии. То есть ничего принципиа
+1
На SmallSat нашел единственную компания, которая создает дата платформа as a service для телеметрии. То есть ничего принципиально нового, но есть конкретный фокус на AeroSpace и у них уже есть серьезные клиенты. Они объединили хранения и “бизнес” метрики + красивый UI. То есть вместо того, чтобы самому строить в Elastic Search, Prometheus - предлагают готовый продукт. Компания называется Sift. Claude Design добавил карточку с описанием. https://www.siftstack.com/

Давно мечтал добавить сайт про музей прадеда, наконец старший сын подрос и научился пользоваться Claude Code (14 лет) и созда
Давно мечтал добавить сайт про музей прадеда, наконец старший сын подрос и научился пользоваться Claude Code (14 лет) и создал сайт, я по смыслу поправил и показал как подключить домен.
Сентябрь 1812 года. Москва оставлена, армия отступает, война выглядит проигранной. Через полтора месяца Наполеон побежит из России — и первый толчок к этому был дан здесь, на поле у Тарутина.
https://tarutino-museum.ru/ Фотограф Екатерина Советкина, она же снимала дата-завтрак в Т-Банк, где я рассказывал про дата инжиниринг. PS сайт на Github Pages, и если они не работают в РФ, значит нужно поискать альтернативу. Если кому-то нужно простой сайт для некоммерческой организации, пишите.

Так как тильда у нас умерла для Data Learn, я скопировал сайт на Github pages и почистил его. https://datalearn.ru/ Чат в телеграмм теперь должен иметь нового админа с правами на добавление спам ботов. PS 1) хотите быть активном в чате и помогать другим? Welcome. 2) хотите добавить бесплатный курс? Welcome. 3) хотите провести вебинар на всю аудиторию (20к в YouTube, 23k в tg)? Welcome.

From Vibe Coding to the AI Software Factory - статья Seattle Data Guy, в которой он описывает как инженерные команды эволюционируют в использовании AI и больших языковых моделей для разработки.
Автор описывает 5 уровней зрелости использования ИИ в командах — от хаотичных экспериментов до выстроенной «фабрики по производству ПО». Уровень 1 — Гараж. Личные эксперименты и хобби-проекты, которые никогда не доходят до продакшена. Уровень 2 — Верстак с макросами. Небольшие скрипты и мини-приложения, решающие конкретные задачи, но всё ещё далёкие от полноценного производства. Уровень 3 — Мастерская. Команды начинают стандартизировать промпты, шаблоны и агентов, но это всё ещё лишь точечные улучшения. Уровень 4 — Конвейер. Появляются повторяемые системы, стейт-машины, отслеживание метрик и токеномики. Можно реально измерять эффективность. Уровень 5 — Фабрика ценности. Всё вышеперечисленное связывается с реальной бизнес-ценностью — иначе это просто «производство виджетов ради виджетов».
Максимум, что мне доводилось видеть для инжиниринга данных это между уровнем 2 и 3. Для разработки ПО, конечно же, это все двигается в сторону уровня 4, 5. Паттерны AI разработки уже вырисовываются и есть свои best practices - бери и делай, по ходу адаптируй. Думаю об уровнях и адаптации ИИ в компаниях, мне вспоминается мем “можно, а зачем?

Инжиниринг Данных - آمار و تحلیل کانال تلگرام @rockyourdata