Yandex Cloud: Data Platform
Open in Telegram
Show more
The country is not specifiedThe category is not specified
497
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Добрый день!
Организатор может подсказать? Получил письмо что нужно сдать тест чтобы получить сертификат, все сдал - а дальше ничего, ни сертификата, ни письма.
Всем привет. Вопрос:
при указании архивов в задании для Data Proc кластера, этот архив потом скопируется к той среде, где будет выполняться задание, или же spark'a python-скрипт будет как-то обращаться к s3?
А то у либу что-то кластер найти не может, хотя в задании указана
File "/tmp/spark-0000-0000-0000-0000-0000/script.py", line 7, in <module>
2022-08-02T14:20:44.657289Z from etllib.module.module import SomeClass # noqa: E402
2022-08-02T14:20:44.657290Z ModuleNotFoundError: No module named 'etllib'Ну вот пример - продуктовые челики известные в узком кругу, рассуждают о менторинге для бедных) откуда короны?))
Поделитесь, пожалуйста, примерами архитектуры для переезда на DataLens + ClickHouse + DWH (Postgres or GreenPlum) + dbt + GreatExpectations и какими-нибудь подводными камнями, которые важно учесть при таком переезде
Идея с кафкой напрямую и хранения роу слоя там - мне нравится. Но в случае если стримить из разных источников и дата-марты строить на основе нескольких - возникает режим гонки. Для этого роу в гринплане или кассандре и предполагается, чтобы корректно несколько источников в режиме стриминга подружить
добрый день, проходили обучение вот тут https://cloud.yandex.ru/training/corpplatform? курс хорошо дает понимание сценария создания архитектуры дата-продукта и какой сервис yandex cloud какую задачу закрывает.
Коллеги, после прошлогоднего DataOps Community Meetup к нам регулярно поступают вопросы, а как всё-таки правильно работать с Apache Airflow в облаке. Поэтому мы решили провести 21 июля на эту тему отдельный вебинар с живыми демо "Обработка данных на Apache Airflow в Yandex Cloud".
О чем планируем рассказать (и показать):
🔸какие задачи решает Apache Airflow;
🔸как с помощью него и сервиса Yandex Data Proc собрать и обогатить данные в облаке;
🔸как упростить преобразование данных в Greenplum и подготовку витрин для ClickHouse, собрав конвейер на Apache Airflow.
Всё это поможет более эффективно использовать ресурсы хранения и вычислений, фокусируясь на создании аналитических продуктов для бизнеса.
Участие бесплатное. Нужно только зарегистрироваться, заварить чаю (или кофе) и вовремя подключиться 🙂 Встречаемся 21 июля в 12:00 (МСК)!
➡️ Регистрация
настроил по инструкции выше SSL и больше ошибки не возникало с PublicKey
