Big Data Science [RU]
Open in Telegram
Big Data Science [RU] — канал о жизни Data Science. Для сотрудничества: a.chernobrovov@gmail.com 🌏 — https://t.me/bdscience — Big Data Science channel (english version) 💼 — https://t.me/bds_job — channel about Data Science jobs and career
Show more1 712
Subscribers
No data24 hours
-17 days
-1830 days
Posts Archive
💡😎Основы работы с Data-Mining: процесс, инструменты и методики
Дата-майнинг (data mining) — это процесс обработки данных для выявления паттернов, корреляций и аномалий в крупных датасетах. В нём применяются разнообразные методики статистического анализа и машинного обучения для извлечения из данных значимой информации и выводов. Компании могут использовать эти выводы для принятия обоснованных решений, прогнозирования трендов и совершенствования бизнес-стратегий.
Можно выделить такие методики дата-майнинга, как:
Деревья решений - в конце каждой ветви находится прогноз или решение. В задачах классификации эти конечные точки разделяют данные на категории
Выявление аномалий - аномалии могут возникать из-за колебаний измерений или быть показателями ошибки экспериментов; в некоторых случаях они могут указывать на важное открытие или на новый тренд
ПО для работы с дата-майнингом делится на:
1. Инструменты визуализации:
Grafana - подходит для аналитики и мониторинга в реальном времени
Google Charts — это веб-решение для создания интерактивных графиков
2. Платформы дата-майнинга:
KNIME - это аналитическая платформа, позволяющая выгружать данные из различных источников, трансформировать данные и загружать их в различные базы данных
RapidMiner - это программная многопользовательская платформа, которая представляет собой интегрированную среду для обработки данных в больших информационных массивах, машинного обучения, текстовой аналитики и построения прогностических моделей, а также для решения иных задач Data Mining.
💡😎Подборка векторных баз данных
Векторные базы данных — это особый тип баз данных, предназначенный для организации данных на основе сходства. Для этого они преобразуют исходные данные — такие как изображения, текст, видео или аудио — в математические представления, известные как многомерные векторы. Каждый вектор может иметь от десятков до тысяч измерений, в зависимости от сложности исходных данных. на данный момент существуют такие векторные БД, как:
Chroma - Это векторная база данных с открытым исходным кодом, созданная для обеспечения разработчиков и организаций любого размера ресурсами, необходимыми для создания приложений на основе больших языковых моделей (LLM). Она предоставляет разработчикам высокомасштабируемое и эффективное решение для хранения, поиска и извлечения многомерных векторов.
Одной из причин популярности Chroma является ее гибкость
Pinecone - Это облачная управляемая векторная база данных. Широкая поддержка многомерных векторов делает Pinecone подходящей для различных сценариев использования, включая поиск по сходству, рекомендательные системы, персонализацию и семантический поиск. Она также поддерживает возможность одноступенчатой фильтрации. А способность анализировать данные в реальном времени делает ее отличным выбором для обнаружения угроз и мониторинга кибератак в сфере кибербезопасности.
Weviate - Примечательной особенностью этой БД является то, что ее можно использовать для хранения как векторов, так и объектов. Это делает ее подходящей для приложений, сочетающих несколько методов поиска, таких как векторный поиск и поиск по ключевым словам.
Milvus - использует самые современные алгоритмы для ускорения процесса поиска, что позволяет быстро находить похожие векторы даже при работе с большими массивами данных.
⚖️Apache Superset: преимущества и недостатки
Apache Superset - это инструмент визуализации данных с открытым исходным кодом, который обеспечивает богатый набор возможностей для анализа данных и создания интерактивных дашбордов.
Преимущества Apache Superset:
1. Открытый исходный код: Apache Superset разрабатывается и поддерживается сообществом, что обеспечивает высокую степень гибкости и возможность расширения под различные потребности.
2. Мощная визуализация данных: Superset предлагает широкий выбор графиков, диаграмм и визуальных элементов, позволяя пользователям создавать красочные и информативные дашборды для анализа данных.
3. Интерактивные возможности: Пользователи могут легко взаимодействовать с дашбордами, применять фильтры, изменять параметры и проводить свертывание/развертывание данных для получения более глубокого понимания информации.
4. Интеграция с различными источниками данных: Superset поддерживает множество источников данных, включая базы данных, хранилища данных, Apache Druid и многие другие, что делает его универсальным инструментом для работы с данными из различных источников.
5. Масштабируемость и производительность: Благодаря своей архитектуре и использованию технологий, таких как Apache Druid, Superset способен эффективно обрабатывать большие объемы данных и обеспечивать высокую производительность при работе с дашбордами.
Недостатки Apache Superset:
1. Сложность настройки: Несмотря на то, что Superset предоставляет обширные возможности, его настройка и конфигурация могут быть сложными, особенно для новичков, требуя определенного уровня технической образованности.
2. Недостаточная документация: Некоторые пользователи отмечают, что документация по Superset не всегда достаточно подробна или актуальна, что может затруднить процесс изучения и работы с инструментом.
В целом, Apache Superset представляет собой мощный инструмент для визуализации данных с открытым исходным кодом, который обладает рядом преимуществ, таких как гибкость, масштабируемость и мощные визуальные возможности. Однако, перед использованием следует учитывать и недостатки, такие как сложность настройки и некоторые ограничения по ее доступности.
🔎Извлечение данных с Quivr
Quivr — это open-source сервис, который позволяет извлекать информацию из локальных файлов (PDF, CSV, Excel, Word, аудио, видео и т.д)
Quivr может работать в автономном режиме, поэтому всегда существует возможность получить доступ к своим данным в любое время и в любом месте.
Quivr также совместим с ОС Ubuntu 22 или новее
Открытый исходный код можно получить по данной ссылке
💡📊Сервис для быстрой передачи Big Data
Redpanda — это платформа для потоковой передачи данных. Она отлично совместима с API Kafka. В 10 раз быстрее. Не требует никакого ZooKeeper и никаких JVM.
Redpanda спроектирована для полной загрузки быстрых накопителей больших данных, таких как SSD или NVMe-устройства, а также на использование преимуществ многоядерных процессоров и компьютеров с большим объемом оперативной памяти. Это позволяет достичь максимальной производительности при обработке значительных объемов данных и запросов.
Документация доступна по этой ссылке
☁️💡Датасет для исследования прямого захвата воздуха
Исследователи из GeorgiaTech опубликовали крупнейший датасет и новую SOTA модель для исследования прямого захвата воздуха, это — ключевой процесс для борьбы с изменением климата
Данный набор данных содержит тестовый набор внутри домена и 4 тестовых набора вне домена (ood-large, ood-linker, ood-topology и ood-linker & topology). Все LMD-базы сжаты в один файл .tar.gz.
💡😎Отличный ресурс в коллекцию: датасеты для LLM
На многих примерах (в том числе на LLama-3 и Phi-3) можно заметить, что развитие LLM = создание качественных корпусов данных.
Разработчик из Лондона взял и описал в этом репозитории огоромное множество датасетов для предобучения или файнтюнинга LLM в формате таблицы: ссылка, размер, авторы, дата и личные пометки.
Кроме того, там есть указания, как собрать свой собственный качественный датасет, и что вообще значит слово «качественный» в контексте датасета.
🌎ТОП майских ивентов в Data Science
15-16 мая - The Trends 2.0 - Москва, Россия - https://thetrends.tech/
17 мая - True Tech Day 2.0 - Москва, Россия - https://truetechday.ru/
21-22 мая - I’ML 2024 - Онлайн - https://imlconf.com/
23 мая - SUPPLY&DEMAND PLANNING CONFERENCE - Москва, Россия - https://planning-conference.ru/
24-25 мая - ANALYST DAYS / 18 - Санкт-Петербург, Россия - https://analystdays.ru/en/index
25 мая - Data Fest 2024 - Москва, Россия - https://ods.ai/events/datafest2024
31 мая - TechRec 2024. AI & HR - Москва, Россия - https://techrec.pro/techrec2024
💡Подбоорка ETL-сервисов для Big Data
Renta Marketing ETL - Облачное решение, которое позволяет интегрировать 28 корпоративных источников данных с популярными хранилищами данных вроде Snowflake и BigQuery, ервис позволяет команде инженеров и аналитиков интегрировать сторонние инструменты и за пару минут создавать конвейеры данных без кода. Например, настроить интеграцию Facebook Ads с BigQuery можно в четыре клика. Для работы в Renta Marketing ETL не нужно привлекать разработчиков.
Fivertran - Облачное ПО, которое позволяет пользователям быстро и просто создавать конвейеры. Платформа поддерживает более 90 источников. Fivertran предоставляет набор готовых интеграций, так что даже начинающие разработчики разберутся в сервисе.
Hevo Data - cервис предоставляет пользователям более 150 готовых интеграций. Настроить интеграции можно за три простых шага. В итоге получается конвейер, который копирует данные в хранилище и не требует обслуживания.
Matillion - низкокодовое приложение для создания конвейеров. С помощью Matillion команды могут создавать конвейеры и автоматизировать обработку данных. У сервиса простой интерфейс, так что создавать и изменять данные сможет пользователь, далёкий от программирования. Marillion поддерживает обработку в реальном времени. Инструмент поддерживает популярные источники данных и позволяет легко выявлять и устранять проблемы с данными.
Supermetrics - ETL-решение, предназначенное для малого бизнеса и маркетологов, которые в основном используют сервисы Facebook Ads, Google Ads и Google Analytics. В инструменте есть встроенное приложение на облачной платформе Google, которое позволяет экспортировать данные непосредственно в Google BigQuery.
📉📊Подборочка инструментов для работы с Big Data
Drill - акладывается поверх множества источников данных, позволяя пользователям запрашивать широкий спектр информации в различных форматах, от Hadoop-файлов последовательностей и журналов сервера до баз данных NoSQL и облачных хранилищ объектов.
Druid - это аналитическая база данных реального времени, обеспечивающая низкую задержку запросов, высокий параллелизм, многопользовательские возможности и мгновенную видимость потоковых данных. По словам ее сторонников, несколько конечных пользователей могут одновременно запрашивать данные, хранящиеся в Druid, без какого-либо воздействия на производительность.
HPCC Systems — это платформа обработки больших данных, разработанная компанией LexisNexis и получившая открытый исходный код в 2011 году. В соответствии со своим полным названием — High-Performance Computing Cluster — технология по своей сути представляет собой кластер компьютеров, созданный на основе стандартного аппаратного обеспечения для обработки, управления и доставки больших данных.
Iceberg - это открытый формат таблицы, используемой для управления данными в озерах, что частично достигается путем отслеживания отдельных файлов с информацией в таблицах, а не в каталогах. Созданная компанией Netflix для использования со своими таблицами петабайтного размера, Iceberg теперь является проектом Apache. Iceberg обычно "используется в продакшне, где одна таблица может содержать десятки петабайт данных".
Kylin — это распределенное хранилище информации и аналитическая платформа для больших данных. Она предоставляет механизм аналитической обработки информации (OLAP), предназначенный для работы с очень большими массивами данных. Поскольку Kylin построена на базе других технологий Apache, включая Hadoop, Hive, Parquet и Spark, то она, по словам ее сторонников, может легко масштабироваться для обработки больших объемов данных.
Samza — это система распределенной обработки потоков, созданная компанией LinkedIn и являющаяся в настоящее время проектом с открытым исходным кодом под управлением Apache. Система может запускаться поверх Hadoop YARN или Kubernetes, также предлагается вариант автономного развертывания. Согласно информации от разработчиков, Samza может обрабатывать "несколько терабайт" информации о состоянии данных с низкой задержкой и высокой пропускной способностью для быстрого анализа.
📊😎💡🤖Каталог датасетов для обнаружения и сегментации объектов
SAM + Optical Flow = FlowSAM
FlowSAM - новый инструмент для обнаружения и сегментации движущихся объектов на видео, который значительно превосходит все предыдущие модели, как для одного объекта, так и для множества объектов
Для обучения модели было использовано множество датасетов, которые стали доступны для загрузки по этой ссылке
💡Датасет для обнаружения проблем в коде
SWE-bench - датасет, который был разработан для того, чтобы предоставить разнообразный набор проблем кодовой базы, которые можно было бы проверить с помощью юнит-тестов в репозитории. Полный тестовый сплит SWE-bench включает в себя 2 294 пары issue-commit в 12 репозиториях python.
Таким образом, датасет предлагает новую задачу: решение проблем при наличии полного репозитория и проблемы на GitHub.
Для загрузки датасет с помощью Python-скрипта можно возпользоваться следующей командой:
from datasets import load_dataset
dataset = load_dataset("princeton-nlp/SWE-bench")
💡SQL vs NoSQL: преимущества и недостатки
SQL и NoSQL - это два основных подхода к хранению и обработке данных. Каждый из них имеет свои преимущества и недостатки, и выбор между ними зависит от конкретных потребностей проекта. Давайте рассмотрим основные различия между ними.
SQL (Structured Query Language) базы данных представляют собой реляционные базы данных, а также СУБД экосистемы Hadoop, использующие структурированные таблицы для хранения данных.
Преимущества SQL:
1. Структурированность данных: Таблицы, связи и схемы делают данные легко понятными и легко управляемыми.
2. ACID-согласованность: SQL базы данных гарантируют соблюдение принципов ACID (атомарность, согласованность, изолированность, долговечность), обеспечивая надежность транзакций.
3. Универсальный язык запросов: SQL предоставляет богатый и универсальный набор инструментов для выполнения сложных запросов и аналитики. В отдельных СУБД могут быть лишь небольшие отклонения в виде SQL-диалектов
Недостатки SQL:
1. Горизонтальное масштабирование: Традиционные SQL базы данных часто сталкиваются с ограничениями масштабирования при большом объеме данных.
2. Сложность схемы: Изменение схемы данных может быть сложным и затратным процессом.
3. Ограниченная гибкость: Некоторые SQL базы данных могут иметь ограничения на типы данных или структуры, что может быть неподходящим для некоторых видов данных.
NoSQL базы данных, с другой стороны, не используют традиционные таблицы, а вместо этого предлагают гибкие модели данных.
Преимущества NoSQL:
1. Гибкость структуры данных: NoSQL базы данных могут легко масштабироваться и изменяться без необходимости перестраивать схему.
2. Горизонтальное масштабирование: Многие NoSQL базы данных легко масштабируются горизонтально, обеспечивая высокую производительность при больших объемах данных.
3. Поддержка неструктурированных данных: NoSQL базы данных хорошо подходят для хранения и обработки неструктурированных данных, таких как текст, изображения и видео.
Недостатки NoSQL:
1. Недостаточная поддержка ACID: Многие NoSQL базы данных жертвуют ACID-согласованностью ради производительности или гибкости.
2. Сложность консистентности: При масштабировании и распределении данных NoSQL базы данных могут сталкиваться с проблемами поддержания консистентности данных.
Таким образом, в зависимости от требований проекта и приоритетов по производительности, масштабируемости и гибкости, выбор между SQL и NoSQL базами данных может быть разным.
😎💡Где взять данные? Несколько открытых репозиториев
Awesome Data - Github репозиторий. Список открытых наборов данных с прямыми ссылками на скачивание. Есть данные с видео, картинками, аудио, и вообще со всем.
Open ML - источник, который включает в себя 20k+ датасетов. Есть также библиотеки для Python и R.
Open Data Registry - хранилище данных от AWS. Тут есть некоторые датасеты, которых больше нигде не найти.
Papers with Code. - подборки датасетов, которые использовались в реальных исследованиях
Dagshub - хранилище, в котором Датасеты удобно поделены по областям применения (NLP, CV, пр.)
💡Опубликован большой датасет для детекции речи размером более 150 тысяч часов на 6000+ языках
Датасет содержит порядка 150 тысяч часов аудио более чем на 6,000 языках. Количество уникальных ISO-кодов данного датасета не совпадает с фактическим количеством языков, так как близкие языки могут кодироваться одним и тем же кодом.
Данные были размечены для задачи детекции голоса при временной дискретизации примерно в 30 миллисекунд (или 512 семплов при частоте дискретизации 16 килогерц).
😎📊Данные, используемые при обучении MA-LMM-модели
MA-LMM (Memory-Augmented Large Multimodal Model) - это большая мультимодальная модель с расширенной памятью для понимания контекста длинных видео.
Модель позволяет использовать длинный контекст за счет существенного сокращения использования памяти графического процессора. Вместо того, чтобы пытаться обрабатывать больше кадров одновременно, как в большинстве существующих моделей, MA-LMM обрабатывает видео онлайн с сохранением прошлой информации в банк памяти.
В открытый доступ выложили данные, на которых обучалась модель. Эти данные представляют собой 2 весьма больших датасета, которые можно загрузить по этой ссылке
💡😎📊Синтетический набор данных Text-to-SQL с открытым исходным кодом
Gretel выпустила крупнейший набор данных Text-to-SQL с открытым исходным кодом для ускорения обучения моделей ИИ
Как утверждают разработчики, по состоянию на апрель 2024 года набор данных считается самым большим и разнообразным синтетическим набором данных преобразования текста в SQL, доступным на сегодняшний день.
Датасет содержит около 23 млн. токенов, включая около 12 млн токенов SQL, а также широкий диапазон уровней сложности SQL, включая подзапросы, одиночные соединения, множественные соединения, агрегации, оконные функции и операции над множествами.
Для загрузки датасета через Python API, необходимо прописать следующи скрипт:
from datasets import load_dataset
dataset = load_dataset("gretelai/synthetic_text_to_sql")
📊📉Подборка Python-библиотек для работы с пространственными данными
Earth Engine API - позволяет получить доступ к обширной коллекции геопространственных данных Google Earth Engine и выполнять задачи анализа с помощью Python.
TorchGeo (PyTorch) - предоставляет инструменты и утилиты для работы с геопространственными данными в PyTorch.
Arcpy (Esri) - это библиотека Python, предоставляемая Esri для работы с геопространственными данными на платформе ArcGIS. Она позволяет автоматизировать задачи геообработки и выполнять пространственный анализ.
Rasterio - это библиотека для чтения и записи геопространственных растровых наборов данных. Она обеспечивает эффективный доступ к растровым данным и позволяет выполнять различные операции с геоданными.
GDAL (Open-Source Geospatial Foundation) - это мощная библиотека для чтения, записи и манипулирования геопространственными растровыми и векторными форматами данных.
Shapely - это библиотека для геометрических операций в Python. Она позволяет создавать, манипулировать и анализировать геометрические объекты.
RSGISLib - имеет функции для обработки тепловых изображений, включая радиометрическую коррекцию, оценку температуры поверхности земли.
WhiteboxTools - это библиотека для геопространственного анализа и обработки данных. Она предлагает полный набор инструментов для таких задач, как анализ рельефа, гидрологическое моделирование и обработка данных LiDAR.
📊😎💡Выпущены два самых огромных открытых датасета для распознавания текста
Наборы данных содержат миллионы реальных документов, изображений и текстов для задач распознавания текста, анализа и разбора документов
VQA - датасет, который используется для разработки и оценки моделей машинного обучения, способных отвечать на вопросы, связанные с изображениями. В датасете каждому изображению приписаны вопросы, а также правильные ответы на эти вопросы. Этот датасет дополнен аннотациями из проекта idl_data Бриттена. Дополненный датасет можно загрузить с помощью Python-скрипта:
from datasets import load_dataset
dataset = load_dataset("pixparse/idl-wds")
PDFA - это набор документов, отфильтрованный из корпуса SafeDocs, он же CC-MAIN-2021-31-PDF-UNTRUNCATED. Этот корпус предназнается для всестороннего анализа pdf-документов. Дополненный датасет можно загрузить с помощью Python-скрипта:
from datasets import load_dataset
dataset = load_dataset("pixparse/pdfa-eng-wds")
⚔️Реляционные СУБД vs NOSQL СУБД: преимущества и недостатки
Реализация баз данных – это фундаментальный элемент современных информационных технологии.В мире баз данных существует две основные парадигмы: реляционные СУБД и NoSQL СУБД. Каждая из них имеет свои преимущества и недостатки, которые стоит учитывать при выборе подходящей для конкретной задачи.
Реляционные базы данных основаны на модели данных, известной как реляционная модель. В таких базах данных данные хранятся в виде таблиц, которые состоят из строк (записей) и столбцов (полей). Структура данных определяется заранее заданной схемой, которая описывает типы данных каждого столбца.
Преимущества реляционных СУБД:
1. Структурированность данных: Реляционные СУБД хранят данные в виде таблиц, что делает их легко понятными и организованными.
2. ACID-свойства: Гарантирует атомарность, согласованность, изолированность и долговечность транзакций, что делает их надежными для приложений, требующих высокой степени целостности данных.
3. SQL-язык: Мощный и широко используемый язык запросов, обеспечивающий стандартизацию и удобство в работе с данными.
Недостатки:
1. Вертикальное масштабирование: Реляционные СУБД могут столкнуться с ограничениями вертикального масштабирования, что означает, что при достижении предела производительности их придется переносить на более мощные, и, часто, более дорогие серверы.
2. Сложность схемы: Изменение схемы данных может быть затруднительным и требовать дополнительных усилий и времени.
3. Сложность горизонтального масштабирования: Даже при использовании техник разделения данных, горизонтальное масштабирование реляционных СУБД может быть сложным и требовать дополнительной работы по конфигурации и оптимизации.
NoSQL базы данных разработаны для работы с неструктурированными и полуструктурированными данными. Они предлагают гибкую схему данных, что позволяет хранить данные без явного определения схемы заранее.
Преимущества NOSQL:
1. Гибкость структуры данных: NoSQL СУБД позволяют хранить неструктурированные данные, что делает их идеальным выбором для приложений с изменяющимися требованиями к данным.
2. Горизонтальная масштабируемость: Многие NoSQL базы данных спроектированы с учетом горизонтального масштабирования, что делает их подходящими для работы с большими объемами данных и высокими нагрузками.
Недостатки:
1. Отсутствие ACID-свойств: В отличие от реляционных СУБД, NoSQL базы данных могут жертвовать некоторыми ACID-свойствами в пользу производительности и масштабируемости.
2. Ограниченная поддержка SQL-языка запросов: В некоторых NoSQL СУБД функциональность языка запросов может быть ограничена, что может привести к затруднениям в выполнении сложных запросов или аналитических операций.
Выбор между реляционными и NoSQL СУБД зависит от конкретных требований и характеристик проекта. Реляционные СУБД обеспечивают высокую целостность данных, в то время как NoSQL СУБД позволяют работать с большими объемами неструктурированных данных и обеспечивают гибкость и масштабируемость.
