Big Data Science [RU]
Open in Telegram
Big Data Science [RU] — канал о жизни Data Science. Для сотрудничества: a.chernobrovov@gmail.com 🌏 — https://t.me/bdscience — Big Data Science channel (english version) 💼 — https://t.me/bds_job — channel about Data Science jobs and career
Show more1 712
Subscribers
No data24 hours
-17 days
-1830 days
Posts Archive
💥💯💡В сети появилась новая open-source библиотека для работы с данными
Cleanlab - библиотека, которая помогает очищать данные и метки, автоматически обнаруживая проблемы в наборе данных машинного обучения. Чтобы облегчить машинное обучение на беспорядочных реальных данных, этот пакет ИИ, ориентированный на данные, использует существующие модели для оценки проблем в наборах данных, которые можно исправить для обучения еще более лучших моделей.
В итоге, данная ИИ-библиотека выполняет следующие функции:
1. Обнаружение распространенных проблем с данными (неправильное наложение меток, пропуски, дубликаты, дрейф)
2. Настройка и тестирование обучаемой модели
3. Проводить активное обучение моделей
💡🤔Обзор Grouparoo: преимущества и недостатки
Grouparoo - это инструмент управления данными, который обеспечивает автоматизированный процесс сбора, обработки и синхронизации данных между различными приложениями и источниками данных.
Преимущества Grouparoo:
1. Автоматизация процессов синхронизации данных: Grouparoo предоставляет возможность создавать правила для автоматической синхронизации данных между различными источниками. Это сокращает ручной труд и позволяет поддерживать актуальность данных в реальном времени.
2. Гибкость и настраиваемость: Инструмент позволяет пользователю настраивать правила синхронизации в соответствии с уникальными потребностями и структурой данных организации. Гибкая настройка делает Grouparoo мощным инструментом для различных бизнес-сценариев.
3. Улучшенная точность данных:
Автоматизированный процесс синхронизации данных помогает предотвращать ошибки, связанные с ручным вводом данных, и обеспечивает более высокую точность данных в различных системах.
4. Интеграция с различными источниками данных: Grouparoo обеспечивает поддержку интеграции с различными приложениями и источниками данных, что позволяет управлять данными из различных источников в едином формате.
Недостатки Grouparoo:
1. Сложность настройки: Иногда процесс настройки Grouparoo может быть сложным, особенно для пользователей без технического опыта. Это может потребовать времени и усилий для полноценной реализации инструмента.
2. Необходимость технического понимания: Для полноценного использования Grouparoo требуется понимание технических аспектов синхронизации данных и настройки правил, что может быть вызовом для пользователей без соответствующего опыта.
3. Зависимость от сторонних источников данных: Grouparoo зависит от доступности и структуры данных в сторонних приложениях. Проблемы с этими источниками могут повлиять на эффективность работы инструмента.
В целом, Grouparoo представляет собой мощный инструмент для управления данными, который может значительно упростить процессы синхронизации и обработки данных. Однако, перед использованием, важно внимательно взвесить преимущества и недостатки, учитывая специфику и потребности конкретной организации.
🌎ТОП декабрьских ивентов в Data Science
1 декабря - TeamLead Conf ++ 2023 - Москва, Россия - https://free-track.teamleadconf.ru/
1-3 декабря - Phystech GigaChat Challenge - Москва, Россия - https://gigachat-challenge.tech/
2-3 декабря - Yandex Cup - Алматы, Казахстан - https://yandex.ru/cup/
4-15 декабря - Yandex DataLens Festival - Онлайн - https://cloud.yandex.ru/datalens-festival
4-25 декабря - Brand Analytics ML Сontest - Онлайн - https://ba-contest.ru/
5-6 декабря - YaTalks 2023 - Москва, Россия - https://yatalks2023.com/ru
8 декабря - Conversations 2023 - Москва, Россия - https://conversations-ai.com/
😎🔎Подборка полезных OLAP-сервисов для обработки Big Data
Apache Druid - движок OLAP в реальном времени. Он ориентирован на данные временных рядов, но может использоваться для любых данных. Он использует свой собственный столбчатый формат, который может сильно сжимать данные, и он имеет множество встроенных оптимизаций, таких как инвертированные индексы, кодирование текста, автоматическое сворачивание данных и многое другое.
Apache Pinot - предлагает меньшую задержку благодаря индексу Startree, который выполняет частичное предварительное вычисление, поэтому его можно использовать для приложений, ориентированных на пользователя (он использовался для получения лент LinkedIn). Здесь используется отсортированный индекс вместо инвертированного, который работает быстрее.
Apache Tajo - разработан для выполнения специальных запросов с малыми задержкой и масштабируемостью, онлайн-агрегирования и ETL для больших наборов данных, хранящихся в HDFS и других источниках данных. Он поддерживает интеграцию с Hive Metastore для доступа к общим схемам.
Solr - очень быстрая платформа корпоративного поиска с открытым исходным кодом, построенная на Apache Lucene. Solr является надежным, масштабируемым и отказоустойчивым инструментом, обеспечивая распределенное индексирование, репликацию и запросы с балансировкой нагрузки, автоматическое переключение при отказе и восстановление, централизованную настройку и многое другое
Presto - платформа от Facebook с открытым исходным кодом. Это распределенный механизм SQL-запросов для выполнения интерактивных аналитических запросов к источникам данных любого размера. Presto позволяет запрашивать данные там, где они находятся, включая Hive, Cassandra, реляционные базы данных и файловые системы. Она может выполнять запросы к большим наборам данных за секунды. Presto не зависит от Hadoop, но интегрируется с большинством его инструментов, особенно с Hive, для выполнения SQL-запросов.
📝Немного о ClickHouse: преимущества и недостатки
ClickHouse - это колоночная база данных с открытым исходным кодом, предназначенная для обработки аналитических запросов с большим объемом данных.
Преимущества ClickHouse:
1. Высокая производительность: ClickHouse оптимизирована для выполнения аналитических запросов над большими объемами данных. Она обеспечивает высокую скорость выполнения запросов благодаря своей колоночной структуре данных и другим оптимизациям.
2. Масштабируемость: ClickHouse легко масштабируется горизонтально, позволяя добавлять новые узлы кластера для обработки растущего объема данных.
3. Эффективное использование ресурсов: Благодаря колоночной ориентации и сжатию данных, ClickHouse может эффективно использовать ресурсы хранения, что уменьшает потребление дискового пространства.
4. Низкие накладные расходы на операции чтения: Благодаря структуре данных и оптимизациям, ClickHouse обеспечивает высокую производительность при выполнении операций чтения.
Недостатки ClickHouse:
1. Ограниченная поддержка транзакций: ClickHouse ориентирована на аналитические запросы и не обладает полной поддержкой транзакций, что может быть недостатком для приложений, требующих сильной согласованности данных.
2. Ограниченная поддержка операций записи: ClickHouse предназначена прежде всего для чтения данных, и операции записи могут быть менее эффективными по сравнению с другими системами управления базами данных при больших объемах изменений.
3. Недостаточная поддержка индексации: ClickHouse имеет ограниченную поддержку индексации по сравнению с некоторыми другими СУБД, что может повлиять на производительность операций поиска.
4. Сложность в обслуживании и настройке: Настройка ClickHouse может потребовать определенных навыков и понимания ее архитектуры, что может сделать ее менее привлекательной для менее опытных администраторов.
В целом, выбор ClickHouse зависит от конкретных потребностей проекта. Если задачи связаны с аналитикой и обработкой больших объемов данных, ClickHouse может быть отличным вариантом. Однако, если необходимы транзакции и операции записи с высокой степенью согласованности, стоит рассмотреть другие решения.
💥😎Подборка открытых датасетов по различным областям
Данная подборка представляет собой список открытых датасетов высокого качества для машинного обучения, временных рядов, NLP, обработки изображений и т.д., ориентированный на конкретные темы.
Датасеты доступны по данной ссылке.
📝🔎Apache Flink: преимущества и недостатки
Apache Flink - это распределенный система обработки данных в реальном времени, которая предоставляет возможности для потоковой обработки данных и анализа в реальном времени.
Преимущества Apache Flink:
1. Потоковая обработка данных: Flink предназначен для эффективной обработки данных в режиме реального времени, что позволяет быстро реагировать на изменения и события.
2. Высокая производительность: Flink обеспечивает высокую производительность благодаря оптимизированному выполнению запросов и эффективному распределению задач на кластере.
3. Гибкость и масштабируемость: Flink обеспечивает гибкость в определении и изменении потоковых вычислений. Также следует отметить Повышение производительности при увеличении объема обрабатываемых данных.
Недостатки Apache Flink:
1. Сложность настройки: Настройка и управление кластером Apache Flink может потребовать значительных усилий и опыта.
2. Отсутствие широкой популярности: По сравнению с некоторыми другими системами обработки данных в реальном времени, Apache Flink не так широко используется, что может сказаться на доступности ресурсов и сообществе поддержки.
3. Сложности в интеграции: Интеграция Apache Flink с существующими системами и инструментами может быть сложной задачей, требующей переработку данных для совместимости с форматами и структурами других систем.
В целом, Apache Flink предоставляет мощные возможности для обработки данных в реальном времени, но требует внимательного внедрения и управления для достижения максимальной производительности и надежности.
🤖⚡️🔎Подборка сервисов на базе AI для анализа Big Data
AskEdith - Упрощает анализ данных, позволяя пользователям задавать вопросы и получать мгновенную информацию. Расширяет возможности "аналитики самообслуживания", обеспечивая безопасный и надежный доступ к данным. Совместим со всеми база данных и CRM (Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery и Redshift и тд)
Tomat.AI - Инструмент на базе искусственного интеллекта, который позволяет специалистам по данным легко исследовать и анализировать большие файлы CSV без необходимости кодирования или написания формул. Вы можете открывать и просматривать огромные файлы CSV всего несколькими щелчками мыши
Coginiti - Позволяет пользователям генерировать SQL запросы, используя подсказки на естественном языке, оптимизировать существующие SQL-запросы, объяснять общий SQL в интегрированном каталоге, давать подробные объяснения и решения ошибок, а также объяснять планы выполнения запросов для лучшей оптимизации. ИИ помощник постоянно развивается на основе каждого взаимодействия, адаптируя рекомендации и предложения в соответствии с индивидуальными потребностями
Speak Ai - Платформа для анализа и исследования языковых данных, которая предлагает возможности транскрипции, анализа данных и анализа настроений для различных типов медиа. Он позволяет выполнять автоматическую транскрипцию, массовый анализ, визуализацию и сбор данных для использования в исследованиях, анализе рынка и конкурентном анализе. Инструмент также предлагает общий медиа-репозиторий, систему текстовых подсказок на базе искусственного интеллекта и решение для SWOT-анализа, а также другие функции
Formula God - Инструмент искусственного интеллекта встроен в Google Таблицы. Он использует искусственный интеллект, чтобы помочь пользователям манипулировать и вычислять данные во всем диапазоне ячеек
Simple ML for Sheets - полезен для экспертов по машинному обучению, которые хотят быстро выполнить итерацию или создать прототип на небольших (например, <1 миллиона примеров) наборах табличных данных. Simple ML for Sheets — это надстройка для Google Sheets от команды TensorFlow Decision Forests.
📝📚Подборка книг по Data Mining
Data Mining: Practical Machine Learning Tools and Techniques - книга предоставляет введение в основы Data Mining и использует популярный инструмент Weka для обучения алгоритмов машинного обучении
Introduction to Data Mining - классическая книга, которая охватывает основные концепции и методы Data Mining
Principles of Data Mining - эта книга предоставляет обширное обсуждение принципов и методов Data Mining
Data Mining Techniques: For Marketing, Sales, and Customer Relationship Management - книга ориентирована на использование Data Mining в маркетинге и управлении клиентскими отношениями
Data Science for Dummies - хороший вариант для начинающих, книга охватывает множество тем, включая Data Mining, машинное обучение и анализ данных
📝🔎💥Управлять качеством данных теперь еще проще
Great Expectations (GX) - это open-source инструмент, созданный на базе языка Python, который служит для контроля качества данных. Он предоставляет командам дата-саентистов возможность проводить анализ и проверку данных, а также создавать с ними отчеты. Этот инструмент обладает удобным интерфейсом командной строки (CLI), что упрощает создание новых тестов и редактирование уже существующих отчетов. Важно отметить, что Great Expectations может быть интегрирован с разнообразными инструментами для извлечения, преобразования и загрузки данных (ETL), такими как Airflow и различные системы управления базами данных. Найти полный список поддерживаемых интеграций и официальную документацию можно на веб-сайте Great Expectations.
🌎ТОП ноябрьских ивентов в Data Science
2 ноября - DataStart 2023 - Москва, Россия - https://datastart.ru/
4-5 ноября - BreakPoint 2023: Insert New. Element - Москва, Россия - https://breakpoint23.ru/
9-10 ноября - МАТЕМАРКЕТИНГ - Москва, Россия - https://matemarketing.ru/
16 ноября - TechRec 2023 - Москва, Россия - https://techrec.pro/
22-24 ноября - AI Journey 2023 - Онлайн - https://aij.ru/
28-30 ноября - DATA & ANALYTICS - Москва, Россия - https://techweek.moscow/data_day/
📝🤔Разметка данных: преимущества и обратная сторона
Разметка данных - это процесс присвоения меток или аннотаций определенным элементам в наборе данных, чтобы обучать машины понимать и извлекать информацию из этих данных. Разметка данных играет важную роль в машинном обучении, глубоком обучении и анализе данных, так как она позволяет алгоритмам понимать, какие объекты или факторы в данных являются важными, а какие несущественными.
Преимущества разметки данных:
1. Улучшение точности моделей: Разметка данных способствует созданию более точных и надежных моделей, так как алгоритмы могут учиться на основе правильных меток и избегать ошибок.
2. Обучение алгоритмов: Размеченные данные позволяют более эффективно обучать алгоритмы машинного обучения, что делает их способными к решению сложных задач, таких как распознавание образов, классификация текстов, прогнозирование и другие.
3. Расширение функциональности приложений: Размеченные данные позволяют разрабатывать более интеллектуальные приложения и сервисы, такие как виртуальные помощники, автоматизированные системы и многое другое.
Недостатки разметки данных:
1. Ресурсозатратность: Разметка данных требует значительных усилий и ресурсов, особенно если речь идет о больших наборах данных или сложных задачах.
2. Субъективность: Разметка данных может зависеть от субъективных оценок разметчиков, что может привести к ошибкам и неточностям.
3. Ограниченность задачи: Разметка данных ограничивается конкретной задачей обучения, и изменение этой задачи может потребовать переразметки данных.
4. Обновление данных: Размеченные данные могут устаревать с течением времени, и для поддержания актуальности моделей необходимо периодически обновлять разметку.
В целом, разметка данных является неотъемлемой частью многих проектов в области машинного обучения, и ее преимущества часто превосходят недостатки, особенно при правильной организации и управлении процессом разметки.
Repost from Алексей Чернобровов
Benerator - программное средство для создания тестовых данных, которые можно использовать при тестировании и обучении моделей машинного обучения.
DataFactory - облегчает процесс создания тестовых данных для наполнения баз данных и тестирования искусственных интеллектуальных моделей.
MockNeat - это инструмент, который предоставляет удобный интерфейс программирования (API), позволяющий разработчикам создавать данные в различных форматах, таких как json, xml, csv и sql, без особых усилий.
Spawner - это инструмент для генерации данных, который предназначен для использования с разными базами данных и искусственными интеллектуальными моделями. Он предоставляет множество типов полей, включая возможность настраивать их по усмотрению пользователя.
⚔️📊LDA vs t-SNE: преимущества и недостатки
Два популярных метода для анализа данных данных, LDA (Linear Discriminant Analysis) и t-SNE (t-Distributed Stochastic Neighbor Embedding), используются для решения различных задач. Оба они имеют свои уникальные преимущества и недостатки. Давайте рассмотрим их подробнее.
Преимущества LDA:
1. Классификация: LDA предназначен для задач классификации и разделения данных. Он стремится максимизировать расстояние между классами, что делает его отличным выбором для задач, связанных с классификацией и распознаванием образов.
2. Интерпретируемость: LDA создает новые признаки (линейные комбинации исходных), которые могут быть интерпретированы как "дискриминантные оси". Это упрощает объяснение того, как и почему данные разделяются.
3. Эффективность при больших данных: LDA обычно более эффективен при работе с большими объемами данных, чем t-SNE. Он может быть быстрее и требовать меньше памяти.
Недостатки LDA:
1. Линейная природа: LDA предполагает, что данные линейно разделимы, что может ограничивать его применимость в задачах, где классы не могут быть разделены линейно.
2. Недостаток визуальной информации: LDA создает новое пространство признаков, но не обязательно сохраняет сходство между данными точками. Это делает его менее подходящим для визуализации данных.
Преимущества t-SNE:
1. Устойчивость к нелинейным отношениям: t-SNE может обнаруживать нелинейные зависимости в данных, делая его хорошим выбором для визуализации данных в случаях, когда линейное разделение недостаточно.
2. Отображение высокоразмерных данных: t-SNE может справляться с высокоразмерными данными, сохраняя их структуру при уменьшении размерности.
3. Лучшая визуализация: t-SNE обеспечивает более наглядную визуализацию данных, группируя похожие точки в плотные кластеры.
Недостатки t-SNE:
1. Чувствительность к параметрам: Выбор параметров, таких как perplexity, может сильно повлиять на результаты t-SNE. Необходимо проводить тщательный анализ параметров.
2. Вычислительная сложность: t-SNE может быть вычислительно затратным и медленным при работе с большими наборами данных.
3. Отсутствие интерпретируемости: Поскольку t-SNE стремится к визуальной группировке точек, он не создает интерпретируемых новых признаков.
Таким образом, выбор между LDA и t-SNE зависит от конкретных целей анализа. LDA лучше подходит для задач классификации и интерпретируемости, в то время как t-SNE обычно предпочтителен для визуализации и выявления нелинейных зависимостей.
📊📝В открытом доступе сельхозданные Евросоюза
EuroCrops представляет собой обширный сборник датасетов, объединяющий все публично доступные данные о сельском хозяйстве в странах Европейского Союза.
Данный проект финансируется Немецким космическим агентством DLR от имени Федерального министерства экономики и борьбы с изменением климата.
😎⚡️Визуализация астрономии теперь еще проще в Python
APLpy (the Astronomical Plotting Library in Python) - это модуль Python, предназначенный для создания графиков публикации астрономических изображений в формате FITS.
Хотели ли вы когда-нибудь попробовать визуализцию астрономических данных? Теперь это легко делается на Python с помощью данной библиотеки. Для установки этой библиотеки необходимо всего лишь выполнить следующую команду:
pip install aplpy
⚔️⚡️Altair vs. Matplotlib: преимущества и недостатки визуализаций Big Data
Matplotlib - это старожил в мире визуализации данных, и он широко используется в сообществе Python.
Преимущества Matplotlib:
1. Максимальная гибкость: Matplotlib позволяет вам создавать почти любой вид графиков и настраивать каждую деталь. Вы можете создавать статические и анимированные графики, подходящие для различных целей.
2. Большое сообщество и документация: Благодаря своей популярности, Matplotlib имеет огромное сообщество пользователей и обширную документацию. Это делает его отличным выбором для начинающих и опытных пользователей.
3. Широкий выбор графических элементов: Matplotlib предоставляет богатый выбор графических элементов, таких как линии, точки, столбцы, и многое другое, что позволяет вам создавать разнообразные графики.
Недостатки Matplotlib:
1. Сложность: Создание сложных графиков с Matplotlib может быть нетривиальным и требовать значительных усилий и кода.
2. Внешний вид по умолчанию: Графики, созданные с помощью Matplotlib, могут выглядеть не слишком привлекательно по умолчанию, и для их улучшения часто требуется дополнительная и достаточно трудоемкая работа.
Altair - это более новая библиотека, которая стремится упростить создание декларативных графиков.
Преимущества Altair:
1. Декларативный подход: Altair предлагает декларативный подход к созданию графиков, что означает, что вы описываете, какие данные вы хотите визуализировать и как, а библиотека заботится о деталях.
2. Простота использования: Altair позволяет создавать красивые графики с минимальным объемом кода. Это делает его отличным выбором для быстрого прототипирования и начинающих.
3. Интеграция с Pandas: Altair хорошо интегрируется с библиотекой Pandas, что упрощает работу с данными.
Недостатки Altair:
1. Ограниченные возможности настройки: В сравнении с Matplotlib, Altair предоставляет меньше возможностей для настройки графиков. Если вам нужны сложные и нестандартные графики, это может быть ограничивающим фактором.
2. Меньшее сообщество и документация: Altair, будучи новым проектом, имеет меньшее сообщество пользователей и менее обширную документацию.
Выбор между Altair и Matplotlib зависит от конкретных потребностей и уровня опыта. Matplotlib подходит для тех, кто нуждается в полной гибкости и контроле над графиками, в то время как Altair предоставляет простой и декларативный способ создания красивых графиков с минимальными усилиями.
📋💡🔎Подборка датасетов для NLP
КартаСловСент — слова и выражения, снабжённые тональной меткой («положительное», «отрицательное», «нейтральное») и скалярным значением силы эмоционально-оценочного заряда из непрерывного диапазона [-1, 1].
WikiQA - представляет собой набор пар вопросов и предложений. Они были собраны и аннотированы для исследования ответов на вопросы в открытых доменах
Amazon Reviews dataset - этот набор данных состоит из нескольких миллионов отзывов покупателей Amazon и их оценок. Датасет используется для возможности обучения fastText, анализируя настроения покупателей. Идея состоит в том, что несмотря на огромный объем данных – это реальная бизнес-задача. Модель обучается за считанные минуты. Именно это отличает Amazon Reviews от аналогов.
Yelp dataset – это множество предприятий, отзывов и пользовательских данных, которые можно применить в Pet-проекте и научной работе. Также можно использовать Yelp для обучения студентов во время работы с базами данных, при изучении NLP и в качестве образца производственных данных. Датасет доступен в виде файлов JSON и является «классикой» в обработке естественного языка.
📊📉📈Анализ пользователей с помощью датасета от Яндекса
Яндекс выкладывает в открытый доступ крупнейший русскоязычный датасет отзывов об организациях, опубликованных на Яндекс Картах. Он содержит порядка полумиллиона отзывов пользователей на различные организации, собранных в январе-июне 2023 года.
Особенности датасета:
500 000 уникальных отзывов
Тексты очищены от персональных данных (номеров телефонов, адресов почты)
Датасет не содержит коротких односложных отзывов
Достаточно свежие отзывы: с января по июль 2023 года
📖📚Подборка книг для аналитиков данных
Анализ данных с помощью Python - Полное руководство по науке о данных, аналитике и метрикам с Python.
Математика для машинного обучения - в книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Интерпретируемое машинное обучение - руководство по созданию объяснимых моделей черного ящика
Понимание статистики и экспериментального дизайна - данный учебник предоставляет основы, необходимые для правильного понимания, интерпретации статистики.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Использование науки о данных в здравоохранении - в книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
