en
Feedback
Yandex Cloud: Data Platform

Yandex Cloud: Data Platform

Open in Telegram

Show more
The country is not specifiedThe category is not specified
497
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
/start@combot

Нужна помощь с ревью по курсу "Построение корпоративной аналитической платформы". https://datalens.yandex.ru/xayg9c3pnv7sm-inventory-dashboard

Здравствуйте! Уточните, пожалуйста, кого именно необходимо подключить и куда?

Еще вопрос по GreenPlum У вас в документации к ГП указаны 3 формата для pxf CREATE [WRITABLE] EXTERNAL TABLE ( [, ...]) LOCATION('pxf://?PROFILE=&JDBC_DRIVER=&DB_URL=&USER=&PASS=') FORMAT '[TEXT|CSV|CUSTOM]'; что такое CUSTOM?

1к qps можно хоть в Excel.

В эфире вебинар про обработку данных с помощью Apache Airflow в Yandex Cloud: https://www.youtube.com/watch?v=jF3YemOVofQ

Коллеги, добрый день. Пытаемся использовать Data proc. В Airflow DAG создает легковесный кластер, запускает PySpark задачу (берет файлы на s3 бакетах YC и пишет их как delta таблицы), а затем удаляет кластер. Для обеспечения сохранности метаданных хотим использовать Yandex Managed Hive Metastore. Все наши сервисы созданы в одной подсети и используют одну группу безопастности. Сервисному аккаунты выданы следующие права: managed-airflow.viewer, mdb.dataproc.agent, dataproc.agent, dataproc.editor, storage.viewer, storage.uploader, editor, lockbox.payloadViewer, ymq.reader. Группа безопасности: входящий: 0-65535, Любой (Any), Self; 30000-32767, Любой (Any), CIDR, 0.0.0.0/0; 10256, Any, Проверки состояния балансировщика. исходящий: 0-65535, Any, Self; 443, TCP, CIRD, 0.0.0.0/0; 9083, Any, CIRD, 0.0.0.0/0. Проблема. Без использования Метастора, все отрабатывает как ожидаемо. Появляются паркетки там где мы их ожидаем. DAG https://gist.github.com/Fisherus/3c6a608c3d113262f44b91dbad042f21 JOB https://gist.github.com/Fisherus/488b7039377ecb8ca8ad9b0ca117734c При подключении Метастора появляются ошибки, при выполнении PySpark задания, кластеры зависают и падают. DAG https://gist.github.com/Fisherus/8823881a3ee67348912651d6adbaa695 JOB https://gist.github.com/Fisherus/ae3080978fa931649d8706c83ae9a1cc Заметили что ошибки появляются не всегда. Вчера ДАГ отработал 3 раза подряд, а затем спустя некоторое время начал постоянно падать со следующей ошибкой:
23/12/11 10:09:09 INFO HiveConf: Found configuration file file:/etc/hive/conf.dist/hive-site.xml
23/12/11 10:09:09 INFO HiveUtils: Initializing HiveMetastoreConnection version 2.3.9 using Spark classes.
ivysettings.xml file not found in HIVE_HOME or HIVE_CONF_DIR,/etc/hive/conf.dist/ivysettings.xml will be used
23/12/11 10:09:09 INFO HiveClientImpl: Warehouse location for Hive client (version 2.3.9) is s3a:/dataproc-metastore/
23/12/11 10:15:44 WARN HiveClientImpl: HiveClient got thrift exception, destroying client and retrying (0 tries remaining)
org.apache.hadoop.hive.ql.metadata.HiveException: java.lang.RuntimeException: Unable to instantiate org.apache.hadoop.hive.ql.metadata.SessionHiveMetaStoreClient
Будем благодарны за любую помощь, если кто то из участников чата разворачивал такую систему и готов оказать консультацию напишите пожалуйста в личку с указанием своей почасовой ставки.

Здравствуйте! Записи докладов вышлем на почту всем зарегистрированным участникам, а также выложим их на нашем YouTube-канале, но позже.

спасибо!

Да, на простых запросах скорость примерно одинакова, так как все ограничивается скоростью чтения из object storage. Если смотреть на сложные вычисления, то yq быстрее, так как мы можем выделить прямо много мощности на каждый отдельный запрос. Прямо ядро-в-ядро мы не сравнивались, если вы об этом. Просто не видели причин

да, я на вашем скрине увидела

Всем привет. Коллеги, мы настроили Lightweight Cluster DataProc, указали там настройку spark:spark.submit.deployMode : cluster, но задания из Airflow все равно отправляются с spark:spark.submit.deployMode : client и задания падают. Не уверен, что это можно изменить с помощью Airflow, если только не указывать эту настройку прямо в DAG'ах. в логах также указано это:
2022-08-03T11:54:17.441248Z  Invalid maximum heap size: -Xmx0m
2022-08-03T11:54:17.441250Z  Error: Could not create the Java Virtual Machine.
2022-08-03T11:54:17.441250Z  Error: A fatal exception has occurred. Program will exit.
Подскажите, возможно ли исправить deployMode : client на deployMode : cluster?

Кстати про Кассандру - рекомендую Scylla, та же Кассандра, тока быстрей

Ну хотя бы что-то похожее может?

Всем привет! У меня managed postgreSQL взбунтовался: archiving write-ahead log file "00000001000004A7000000CD" failed too many times, will try again later" "autovacuum worker took too long to start; canceled" Archive command failed with exit code 1 Медленные HDD-диски. Похоже WAL И автовакум кладут базу. Не подскажете статьи по эффективным настройкам бэкграунд-процессов

вы на сервисный аккаунт заводите ключ, и этому сервисному аккаунту даете доступ в бакет

Привет. Отдельного сервиса Data Catalog пока нет, но мы исследуем это направление и хотим предоставить что-то для этой задачи. Скажите, с какой сценарий вас интересует? Вы хотите что-то вроде Apache Atlas, или вам нужен Hive Metastore для описания таблиц?

Доброе утро. возвращаюсь ко вчерашнему ) возникла ошибка создания таблицы (

сори

Спасибо!