en
Feedback
Big Data Science [RU]

Big Data Science [RU]

Open in Telegram

Big Data Science [RU] — канал о жизни Data Science. Для сотрудничества: a.chernobrovov@gmail.com 🌏 — https://t.me/bdscience — Big Data Science channel (english version) 💼 — https://t.me/bds_job — channel about Data Science jobs and career

Show more
1 712
Subscribers
No data24 hours
-17 days
-1830 days
Posts Archive
💡😎Основы работы с Data-Mining: процесс, инструменты и методики Дата-майнинг (data mining) — это процесс обработки данных для выявления паттернов, корреляций и аномалий в крупных датасетах. В нём применяются разнообразные методики статистического анализа и машинного обучения для извлечения из данных значимой информации и выводов. Компании могут использовать эти выводы для принятия обоснованных решений, прогнозирования трендов и совершенствования бизнес-стратегий. Можно выделить такие методики дата-майнинга, как: Деревья решений - в конце каждой ветви находится прогноз или решение. В задачах классификации эти конечные точки разделяют данные на категории Выявление аномалий - аномалии могут возникать из-за колебаний измерений или быть показателями ошибки экспериментов; в некоторых случаях они могут указывать на важное открытие или на новый тренд ПО для работы с дата-майнингом делится на: 1. Инструменты визуализации: Grafana - подходит для аналитики и мониторинга в реальном времени Google Charts — это веб-решение для создания интерактивных графиков 2. Платформы дата-майнинга: KNIME - это аналитическая платформа, позволяющая выгружать данные из различных источников, трансформировать данные и загружать их в различные базы данных RapidMiner - это программная многопользовательская платформа, которая представляет собой интегрированную среду для обработки данных в больших информационных массивах, машинного обучения, текстовой аналитики и построения прогностических моделей, а также для решения иных задач Data Mining.

💡😎Подборка векторных баз данных Векторные базы данных — это особый тип баз данных, предназначенный для организации данных на основе сходства. Для этого они преобразуют исходные данные — такие как изображения, текст, видео или аудио — в математические представления, известные как многомерные векторы. Каждый вектор может иметь от десятков до тысяч измерений, в зависимости от сложности исходных данных. на данный момент существуют такие векторные БД, как: Chroma - Это векторная база данных с открытым исходным кодом, созданная для обеспечения разработчиков и организаций любого размера ресурсами, необходимыми для создания приложений на основе больших языковых моделей (LLM). Она предоставляет разработчикам высокомасштабируемое и эффективное решение для хранения, поиска и извлечения многомерных векторов. Одной из причин популярности Chroma является ее гибкость Pinecone - Это облачная управляемая векторная база данных. Широкая поддержка многомерных векторов делает Pinecone подходящей для различных сценариев использования, включая поиск по сходству, рекомендательные системы, персонализацию и семантический поиск. Она также поддерживает возможность одноступенчатой фильтрации. А способность анализировать данные в реальном времени делает ее отличным выбором для обнаружения угроз и мониторинга кибератак в сфере кибербезопасности. Weviate - Примечательной особенностью этой БД является то, что ее можно использовать для хранения как векторов, так и объектов. Это делает ее подходящей для приложений, сочетающих несколько методов поиска, таких как векторный поиск и поиск по ключевым словам. Milvus - использует самые современные алгоритмы для ускорения процесса поиска, что позволяет быстро находить похожие векторы даже при работе с большими массивами данных.

⚖️Apache Superset: преимущества и недостатки Apache Superset - это инструмент визуализации данных с открытым исходным кодом, который обеспечивает богатый набор возможностей для анализа данных и создания интерактивных дашбордов. Преимущества Apache Superset: 1. Открытый исходный код: Apache Superset разрабатывается и поддерживается сообществом, что обеспечивает высокую степень гибкости и возможность расширения под различные потребности. 2. Мощная визуализация данных: Superset предлагает широкий выбор графиков, диаграмм и визуальных элементов, позволяя пользователям создавать красочные и информативные дашборды для анализа данных. 3. Интерактивные возможности: Пользователи могут легко взаимодействовать с дашбордами, применять фильтры, изменять параметры и проводить свертывание/развертывание данных для получения более глубокого понимания информации. 4. Интеграция с различными источниками данных: Superset поддерживает множество источников данных, включая базы данных, хранилища данных, Apache Druid и многие другие, что делает его универсальным инструментом для работы с данными из различных источников. 5. Масштабируемость и производительность: Благодаря своей архитектуре и использованию технологий, таких как Apache Druid, Superset способен эффективно обрабатывать большие объемы данных и обеспечивать высокую производительность при работе с дашбордами. Недостатки Apache Superset: 1. Сложность настройки: Несмотря на то, что Superset предоставляет обширные возможности, его настройка и конфигурация могут быть сложными, особенно для новичков, требуя определенного уровня технической образованности. 2. Недостаточная документация: Некоторые пользователи отмечают, что документация по Superset не всегда достаточно подробна или актуальна, что может затруднить процесс изучения и работы с инструментом. В целом, Apache Superset представляет собой мощный инструмент для визуализации данных с открытым исходным кодом, который обладает рядом преимуществ, таких как гибкость, масштабируемость и мощные визуальные возможности. Однако, перед использованием следует учитывать и недостатки, такие как сложность настройки и некоторые ограничения по ее доступности.

🔎Извлечение данных с Quivr Quivr — это open-source сервис, который позволяет извлекать информацию из локальных файлов (PDF, CSV, Excel, Word, аудио, видео и т.д) Quivr может работать в автономном режиме, поэтому всегда существует возможность получить доступ к своим данным в любое время и в любом месте. Quivr также совместим с ОС Ubuntu 22 или новее Открытый исходный код можно получить по данной ссылке

💡📊Сервис для быстрой передачи Big Data Redpanda — это платформа для потоковой передачи данных. Она отлично совместима с API Kafka. В 10 раз быстрее. Не требует никакого ZooKeeper и никаких JVM. Redpanda спроектирована для полной загрузки быстрых накопителей больших данных, таких как SSD или NVMe-устройства, а также на использование преимуществ многоядерных процессоров и компьютеров с большим объемом оперативной памяти. Это позволяет достичь максимальной производительности при обработке значительных объемов данных и запросов. Документация доступна по этой ссылке

☁️💡Датасет для исследования прямого захвата воздуха Исследователи из GeorgiaTech опубликовали крупнейший датасет и новую SOTA модель для исследования прямого захвата воздуха, это — ключевой процесс для борьбы с изменением климата Данный набор данных содержит тестовый набор внутри домена и 4 тестовых набора вне домена (ood-large, ood-linker, ood-topology и ood-linker & topology). Все LMD-базы сжаты в один файл .tar.gz.

💡😎Отличный ресурс в коллекцию: датасеты для LLM На многих примерах (в том числе на LLama-3 и Phi-3) можно заметить, что развитие LLM = создание качественных корпусов данных. Разработчик из Лондона взял и описал в этом репозитории огоромное множество датасетов для предобучения или файнтюнинга LLM в формате таблицы: ссылка, размер, авторы, дата и личные пометки. Кроме того, там есть указания, как собрать свой собственный качественный датасет, и что вообще значит слово «качественный» в контексте датасета.

🌎ТОП майских ивентов в Data Science 15-16 мая - The Trends 2.0 - Москва, Россия - https://thetrends.tech/ 17 мая - True Tech Day 2.0 - Москва, Россия - https://truetechday.ru/ 21-22 мая - I’ML 2024 - Онлайн - https://imlconf.com/ 23 мая - SUPPLY&DEMAND PLANNING CONFERENCE - Москва, Россия - https://planning-conference.ru/ 24-25 мая - ANALYST DAYS / 18 - Санкт-Петербург, Россия - https://analystdays.ru/en/index 25 мая - Data Fest 2024 - Москва, Россия - https://ods.ai/events/datafest2024 31 мая - TechRec 2024. AI & HR - Москва, Россия - https://techrec.pro/techrec2024

💡Подбоорка ETL-сервисов для Big Data Renta Marketing ETL - Облачное решение, которое позволяет интегрировать 28 корпоративных источников данных с популярными хранилищами данных вроде Snowflake и BigQuery, ервис позволяет команде инженеров и аналитиков интегрировать сторонние инструменты и за пару минут создавать конвейеры данных без кода. Например, настроить интеграцию Facebook Ads с BigQuery можно в четыре клика. Для работы в Renta Marketing ETL не нужно привлекать разработчиков. Fivertran - Облачное ПО, которое позволяет пользователям быстро и просто создавать конвейеры. Платформа поддерживает более 90 источников. Fivertran предоставляет набор готовых интеграций, так что даже начинающие разработчики разберутся в сервисе. Hevo Data - cервис предоставляет пользователям более 150 готовых интеграций. Настроить интеграции можно за три простых шага. В итоге получается конвейер, который копирует данные в хранилище и не требует обслуживания. Matillion - низкокодовое приложение для создания конвейеров. С помощью Matillion команды могут создавать конвейеры и автоматизировать обработку данных. У сервиса простой интерфейс, так что создавать и изменять данные сможет пользователь, далёкий от программирования. Marillion поддерживает обработку в реальном времени. Инструмент поддерживает популярные источники данных и позволяет легко выявлять и устранять проблемы с данными. Supermetrics - ETL-решение, предназначенное для малого бизнеса и маркетологов, которые в основном используют сервисы Facebook Ads, Google Ads и Google Analytics. В инструменте есть встроенное приложение на облачной платформе Google, которое позволяет экспортировать данные непосредственно в Google BigQuery.

📉📊Подборочка инструментов для работы с Big Data Drill - акладывается поверх множества источников данных, позволяя пользователям запрашивать широкий спектр информации в различных форматах, от Hadoop-файлов последовательностей и журналов сервера до баз данных NoSQL и облачных хранилищ объектов. Druid - это аналитическая база данных реального времени, обеспечивающая низкую задержку запросов, высокий параллелизм, многопользовательские возможности и мгновенную видимость потоковых данных. По словам ее сторонников, несколько конечных пользователей могут одновременно запрашивать данные, хранящиеся в Druid, без какого-либо воздействия на производительность. HPCC Systems — это платформа обработки больших данных, разработанная компанией LexisNexis и получившая открытый исходный код в 2011 году. В соответствии со своим полным названием — High-Performance Computing Cluster — технология по своей сути представляет собой кластер компьютеров, созданный на основе стандартного аппаратного обеспечения для обработки, управления и доставки больших данных. Iceberg - это открытый формат таблицы, используемой для управления данными в озерах, что частично достигается путем отслеживания отдельных файлов с информацией в таблицах, а не в каталогах. Созданная компанией Netflix для использования со своими таблицами петабайтного размера, Iceberg теперь является проектом Apache. Iceberg обычно "используется в продакшне, где одна таблица может содержать десятки петабайт данных". Kylin — это распределенное хранилище информации и аналитическая платформа для больших данных. Она предоставляет механизм аналитической обработки информации (OLAP), предназначенный для работы с очень большими массивами данных. Поскольку Kylin построена на базе других технологий Apache, включая Hadoop, Hive, Parquet и Spark, то она, по словам ее сторонников, может легко масштабироваться для обработки больших объемов данных. Samza — это система распределенной обработки потоков, созданная компанией LinkedIn и являющаяся в настоящее время проектом с открытым исходным кодом под управлением Apache. Система может запускаться поверх Hadoop YARN или Kubernetes, также предлагается вариант автономного развертывания. Согласно информации от разработчиков, Samza может обрабатывать "несколько терабайт" информации о состоянии данных с низкой задержкой и высокой пропускной способностью для быстрого анализа.

📊😎💡🤖Каталог датасетов для обнаружения и сегментации объектов SAM + Optical Flow = FlowSAM FlowSAM - новый инструмент для обнаружения и сегментации движущихся объектов на видео, который значительно превосходит все предыдущие модели, как для одного объекта, так и для множества объектов Для обучения модели было использовано множество датасетов, которые стали доступны для загрузки по этой ссылке

💡Датасет для обнаружения проблем в коде SWE-bench - датасет, который был разработан для того, чтобы предоставить разнообразный набор проблем кодовой базы, которые можно было бы проверить с помощью юнит-тестов в репозитории. Полный тестовый сплит SWE-bench включает в себя 2 294 пары issue-commit в 12 репозиториях python. Таким образом, датасет предлагает новую задачу: решение проблем при наличии полного репозитория и проблемы на GitHub. Для загрузки датасет с помощью Python-скрипта можно возпользоваться следующей командой: from datasets import load_dataset dataset = load_dataset("princeton-nlp/SWE-bench")

💡SQL vs NoSQL: преимущества и недостатки SQL и NoSQL - это два основных подхода к хранению и обработке данных. Каждый из них имеет свои преимущества и недостатки, и выбор между ними зависит от конкретных потребностей проекта. Давайте рассмотрим основные различия между ними. SQL (Structured Query Language) базы данных представляют собой реляционные базы данных, а также СУБД экосистемы Hadoop, использующие структурированные таблицы для хранения данных. Преимущества SQL: 1. Структурированность данных: Таблицы, связи и схемы делают данные легко понятными и легко управляемыми. 2. ACID-согласованность: SQL базы данных гарантируют соблюдение принципов ACID (атомарность, согласованность, изолированность, долговечность), обеспечивая надежность транзакций. 3. Универсальный язык запросов: SQL предоставляет богатый и универсальный набор инструментов для выполнения сложных запросов и аналитики. В отдельных СУБД могут быть лишь небольшие отклонения в виде SQL-диалектов Недостатки SQL: 1. Горизонтальное масштабирование: Традиционные SQL базы данных часто сталкиваются с ограничениями масштабирования при большом объеме данных. 2. Сложность схемы: Изменение схемы данных может быть сложным и затратным процессом. 3. Ограниченная гибкость: Некоторые SQL базы данных могут иметь ограничения на типы данных или структуры, что может быть неподходящим для некоторых видов данных. NoSQL базы данных, с другой стороны, не используют традиционные таблицы, а вместо этого предлагают гибкие модели данных. Преимущества NoSQL: 1. Гибкость структуры данных: NoSQL базы данных могут легко масштабироваться и изменяться без необходимости перестраивать схему. 2. Горизонтальное масштабирование: Многие NoSQL базы данных легко масштабируются горизонтально, обеспечивая высокую производительность при больших объемах данных. 3. Поддержка неструктурированных данных: NoSQL базы данных хорошо подходят для хранения и обработки неструктурированных данных, таких как текст, изображения и видео. Недостатки NoSQL: 1. Недостаточная поддержка ACID: Многие NoSQL базы данных жертвуют ACID-согласованностью ради производительности или гибкости. 2. Сложность консистентности: При масштабировании и распределении данных NoSQL базы данных могут сталкиваться с проблемами поддержания консистентности данных. Таким образом, в зависимости от требований проекта и приоритетов по производительности, масштабируемости и гибкости, выбор между SQL и NoSQL базами данных может быть разным.

😎💡Где взять данные? Несколько открытых репозиториев Awesome Data - Github репозиторий. Список открытых наборов данных с прямыми ссылками на скачивание. Есть данные с видео, картинками, аудио, и вообще со всем. Open ML - источник, который включает в себя 20k+ датасетов. Есть также библиотеки для Python и R. Open Data Registry - хранилище данных от AWS. Тут есть некоторые датасеты, которых больше нигде не найти. Papers with Code. - подборки датасетов, которые использовались в реальных исследованиях Dagshub - хранилище, в котором Датасеты удобно поделены по областям применения (NLP, CV, пр.)

💡Опубликован большой датасет для детекции речи размером более 150 тысяч часов на 6000+ языках Датасет содержит порядка 150 тысяч часов аудио более чем на 6,000 языках. Количество уникальных ISO-кодов данного датасета не совпадает с фактическим количеством языков, так как близкие языки могут кодироваться одним и тем же кодом. Данные были размечены для задачи детекции голоса при временной дискретизации примерно в 30 миллисекунд (или 512 семплов при частоте дискретизации 16 килогерц).

😎📊Данные, используемые при обучении MA-LMM-модели MA-LMM (Memory-Augmented Large Multimodal Model) - это большая мультимодальная модель с расширенной памятью для понимания контекста длинных видео. Модель позволяет использовать длинный контекст за счет существенного сокращения использования памяти графического процессора. Вместо того, чтобы пытаться обрабатывать больше кадров одновременно, как в большинстве существующих моделей, MA-LMM обрабатывает видео онлайн с сохранением прошлой информации в банк памяти. В открытый доступ выложили данные, на которых обучалась модель. Эти данные представляют собой 2 весьма больших датасета, которые можно загрузить по этой ссылке

💡😎📊Синтетический набор данных Text-to-SQL с открытым исходным кодом Gretel выпустила крупнейший набор данных Text-to-SQL с открытым исходным кодом для ускорения обучения моделей ИИ Как утверждают разработчики, по состоянию на апрель 2024 года набор данных считается самым большим и разнообразным синтетическим набором данных преобразования текста в SQL, доступным на сегодняшний день. Датасет содержит около 23 млн. токенов, включая около 12 млн токенов SQL, а также широкий диапазон уровней сложности SQL, включая подзапросы, одиночные соединения, множественные соединения, агрегации, оконные функции и операции над множествами. Для загрузки датасета через Python API, необходимо прописать следующи скрипт: from datasets import load_dataset dataset = load_dataset("gretelai/synthetic_text_to_sql")

📊📉Подборка Python-библиотек для работы с пространственными данными Earth Engine API - позволяет получить доступ к обширной коллекции геопространственных данных Google Earth Engine и выполнять задачи анализа с помощью Python. TorchGeo (PyTorch) - предоставляет инструменты и утилиты для работы с геопространственными данными в PyTorch. Arcpy (Esri) - это библиотека Python, предоставляемая Esri для работы с геопространственными данными на платформе ArcGIS. Она позволяет автоматизировать задачи геообработки и выполнять пространственный анализ. Rasterio - это библиотека для чтения и записи геопространственных растровых наборов данных. Она обеспечивает эффективный доступ к растровым данным и позволяет выполнять различные операции с геоданными. GDAL (Open-Source Geospatial Foundation) - это мощная библиотека для чтения, записи и манипулирования геопространственными растровыми и векторными форматами данных. Shapely - это библиотека для геометрических операций в Python. Она позволяет создавать, манипулировать и анализировать геометрические объекты. RSGISLib - имеет функции для обработки тепловых изображений, включая радиометрическую коррекцию, оценку температуры поверхности земли. WhiteboxTools - это библиотека для геопространственного анализа и обработки данных. Она предлагает полный набор инструментов для таких задач, как анализ рельефа, гидрологическое моделирование и обработка данных LiDAR.

📊😎💡Выпущены два самых огромных открытых датасета для распознавания текста Наборы данных содержат миллионы реальных документов, изображений и текстов для задач распознавания текста, анализа и разбора документов VQA - датасет, который используется для разработки и оценки моделей машинного обучения, способных отвечать на вопросы, связанные с изображениями. В датасете каждому изображению приписаны вопросы, а также правильные ответы на эти вопросы. Этот датасет дополнен аннотациями из проекта idl_data Бриттена. Дополненный датасет можно загрузить с помощью Python-скрипта: from datasets import load_dataset dataset = load_dataset("pixparse/idl-wds") PDFA - это набор документов, отфильтрованный из корпуса SafeDocs, он же CC-MAIN-2021-31-PDF-UNTRUNCATED. Этот корпус предназнается для всестороннего анализа pdf-документов. Дополненный датасет можно загрузить с помощью Python-скрипта: from datasets import load_dataset dataset = load_dataset("pixparse/pdfa-eng-wds")

⚔️Реляционные СУБД vs NOSQL СУБД: преимущества и недостатки Реализация баз данных – это фундаментальный элемент современных информационных технологии.В мире баз данных существует две основные парадигмы: реляционные СУБД и NoSQL СУБД. Каждая из них имеет свои преимущества и недостатки, которые стоит учитывать при выборе подходящей для конкретной задачи. Реляционные базы данных основаны на модели данных, известной как реляционная модель. В таких базах данных данные хранятся в виде таблиц, которые состоят из строк (записей) и столбцов (полей). Структура данных определяется заранее заданной схемой, которая описывает типы данных каждого столбца. Преимущества реляционных СУБД: 1. Структурированность данных: Реляционные СУБД хранят данные в виде таблиц, что делает их легко понятными и организованными. 2. ACID-свойства: Гарантирует атомарность, согласованность, изолированность и долговечность транзакций, что делает их надежными для приложений, требующих высокой степени целостности данных. 3. SQL-язык: Мощный и широко используемый язык запросов, обеспечивающий стандартизацию и удобство в работе с данными. Недостатки: 1. Вертикальное масштабирование: Реляционные СУБД могут столкнуться с ограничениями вертикального масштабирования, что означает, что при достижении предела производительности их придется переносить на более мощные, и, часто, более дорогие серверы. 2. Сложность схемы: Изменение схемы данных может быть затруднительным и требовать дополнительных усилий и времени. 3. Сложность горизонтального масштабирования: Даже при использовании техник разделения данных, горизонтальное масштабирование реляционных СУБД может быть сложным и требовать дополнительной работы по конфигурации и оптимизации. NoSQL базы данных разработаны для работы с неструктурированными и полуструктурированными данными. Они предлагают гибкую схему данных, что позволяет хранить данные без явного определения схемы заранее. Преимущества NOSQL: 1. Гибкость структуры данных: NoSQL СУБД позволяют хранить неструктурированные данные, что делает их идеальным выбором для приложений с изменяющимися требованиями к данным. 2. Горизонтальная масштабируемость: Многие NoSQL базы данных спроектированы с учетом горизонтального масштабирования, что делает их подходящими для работы с большими объемами данных и высокими нагрузками. Недостатки: 1. Отсутствие ACID-свойств: В отличие от реляционных СУБД, NoSQL базы данных могут жертвовать некоторыми ACID-свойствами в пользу производительности и масштабируемости. 2. Ограниченная поддержка SQL-языка запросов: В некоторых NoSQL СУБД функциональность языка запросов может быть ограничена, что может привести к затруднениям в выполнении сложных запросов или аналитических операций. Выбор между реляционными и NoSQL СУБД зависит от конкретных требований и характеристик проекта. Реляционные СУБД обеспечивают высокую целостность данных, в то время как NoSQL СУБД позволяют работать с большими объемами неструктурированных данных и обеспечивают гибкость и масштабируемость.