Yandex Cloud: Data Platform
Open in Telegram
Show more
The country is not specifiedThe category is not specified
497
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Сегодня в 12:00 (GMT+3) расскажем про возможности и применение легковесных кластеров Apache Spark в Yandex Data Proc.
Приходите смотреть трансляцию: https://cloud.yandex.ru/events/682
Всем привет!
Коллеги, подскажите, верно ли я понимаю, что в DataProc и нет из коробки возможность использовать KMS для шифрования (как в s3) и надо что-то самостоятельно прикручивать?
Тут еще момент - маленькие и частые чанки на запись в гринплан (постгрю) плохо, как мне видится
Если Data lens в контексте вашей задачи/конторы - то да это хороший штатный кейс. Однако например до уровня Tableau, Data lens ещё не скоро догонить по возможностям. КХ нет ansi sql. Соот- но если использовать КХ как источник для BI уровня Табло в live - то это сильно ограничивает пользователей табло. Сами используем в on premice связку КХ + Табло, чем сильно урезали функционалом конечной отчётности.
https://cloud.yandex.ru/docs/data-proc/concepts/settings-list
dataproc:max-concurrent-jobs — количество одновременно запускаемых заданий. Значение по умолчанию — auto (рассчитывается исходя из свойств min-free-memory-to-enqueue-new-job и job-memory-footprint).
Максим, приветствую и тут 🙂 получилось тикет в поддержку завести по проблеме?
Подскажите, пожалуйста, есть где-то пример подключения parquet из object storage в качестве внешней таблицы для managed greenplum? В каком формате там задавать сервер?
Добрый день. Жизнеспособна. Причем на практике PXF GP используются даже шире, чем просто для работы с S3 и PG. На уровне CH, конечно, требуется дополнительная материализация - скорость чтения из S3 для визуальной аналитики будет недостаточна.
У меня ограничение по железу. РАМ более чем достаточно, а вот СПУ нет. При этом упираемся именно в РАМ при выполнении запросов
Коллеги, у кого был опыт миграции с PostgreSQL на GreenPlum ? У нас 70% аналитическая нагрузка и 30% транзакционная, но CH Не хотим, тк модель данных и структура таблиц часто меняется. Может быть есть гайды или какая-то информация по особенностям настройки для моего кейса
У меня ранее был опыт PostgreSQL + Citus для аналитических таблиц. Citus использовал для конвератции таблиц в колонку (не для шардирования). Неплохо получалось на одной базе держать 2 типа нагрузки. Но в облаке citus не внедрен...
Всем привет! Подскажите, пжт, что делать если неправильно указал почту при регистрации на Ispring?
и да, если у вас в bucket_key используется wildcard - надо выставить
wildcard_match=TrueНа этот вопрос сложно однозначно ответить. Исполнение запросов в greenplum требует какой-то мощности. Если вы запускаете запрос, эта мощность забирается у каких-то других запросов и их замедляет. Если эта свободная мощность у вас есть на такой случай - выполнение запросов в greenplum условно бесплатно. Почему условно - потому что вы оплачиваете это в стоимости самого greenplum. Если таких запросов много - запас большой, а это очевидно стоит каких-то денег
В этом плане исполнение запросов через yandex query это способ не платить за постоянно выделенные мощности, а оплачивать только фактическое потребление. Ну и плюс запросы в yandex query исполняются на отдельных мощностях и не нагружают ваш кластер
Поэтому тут нужно смотреть на каждый отдельный профиль работы и смотреть, что выгоднее, а что - нет
