Big Data Science [RU]
Open in Telegram
Big Data Science [RU] — канал о жизни Data Science. Для сотрудничества: a.chernobrovov@gmail.com 🌏 — https://t.me/bdscience — Big Data Science channel (english version) 💼 — https://t.me/bds_job — channel about Data Science jobs and career
Show more1 712
Subscribers
No data24 hours
-17 days
-1830 days
Posts Archive
🌎ТОП апрельских ивентов в Data Science
2 апреля - CUP IT 2024. Финал - Онлайн - https://changellenge.com/championships/changellenge-cup-it-2024/
5 апреля - Youth RIGF 2024 - Москва, Россия - https://youth.rigf.ru/
17-18 апреля - Data Fusion 2024 - Москва, Россия - https://data-fusion.ru/conference
20-21 апреля - Merge 2024. Иннополис - Казань, Россия - https://innopolis2024.mergeconf.ru/
23 апреля - CLOUD DAY 2024 - Москва, Россия
26 апреля - Dump - Екатеринбург, Россия - https://dump-ekb.ru/
27 апреля - BIG DATA & ARTIFICIAL INTELLIGENCE DAY - Москва, Россия - https://www.tadviser.ru/a/775734
💡😎💊Google опубликовали новый датасет изображений состояния кожи
SCIN - датасет с открытым доступом, который содержит данные о состоянии кожи. Этот датасет был собран у пользователей-добровольцев Google Search в Соединенных Штатах с помощью специального приложения.
SCIN содержит 10 000+ изображений по распространенным дерматологическим заболеваниям. Материалы включают изображения, историю болезни и информацию о симптомах, а также самостоятельно предоставленный тип кожи по шкале Фитцпатрика.
📄Документация
☁️Ссылка для загрузки
💡📊Данные для обучения, которые использовались в ComCLIP
CLIP (Contrastive Language-Image Pre-Training) — это нейросеть, разработанная OpenAI для выполнения задач визуального, а также языкового понимания. Алгоритмы нацелены на понимание связи между текстом и изображениями.
ComCLIP - улучшенная версия CLIP для сопоставления текстового и графического представления. ComCLIP может смягчать ложные корреляции, вносимые предварительно обученными моделями CLIP, и динамически оценивать важность каждого компонента. Эксперименты проводились на четырех наборах данных для композиционного сопоставления изображений и текстов.
В сети в открытом доступе лежат эти датасеты и найти их можно по этой ссылке
💡😎Датасеты для задачи преобразования текста в звук
FAIR выложили в открытый доступ проект системы для преобразования текста в звук.
Помимо основного проекта также имеются датасеты в JSON-формате.
Подробную инструкцию по использованию датасетов можно найти здесь
📚💡Подборка книг по различным технологиям обработки Big Data
Spark: The Definitive Guide - книга рассказывает о том, как использовать, развертывать и поддерживать Apache Spark с помощью этого всеобъемлющего руководства, написанного создателями фреймворка кластерных вычислений с открытым исходным кодом.
Hadoop. Подробное руководство - книга, в которой досконально и доступно описаны все возможности Apache Hadoop.
Apache Kafka. Потоковая обработка и анализ данных - в книге описаны принципы проектирования Big Data брокера Kafka, гарантии надежности, ключевые API и детали архитектуры
Kubernetes в действии - книга детально рассказывает о Kubernetes – открытом программном обеспечении Google для автоматизации развёртывания, масштабирования и управления приложениями масштабирования и управления Big Data приложениями
Cassandra: The Definitive Guide: Distributed Data at Web Scale - это руководство рассказывает, система управления базами данных Cassandra обрабатывает сотни терабайт данных, сохраняя высокую доступность в нескольких центрах обработки данных
MongoDB: полное руководство - в этой книге детально рассматривается MongoDB – мощная система управления базами данных. Здесь также можно узнать о том, как эта безопасная, высокопроизводительная система обеспечивает гибкие модели данных, высокую их доступность и горизонтальную масштабируемость.
⚔️😎💡ClickHouse vs Greenplum
Clickhouse и GreenPlum - это известные СУБД для анализа больших данных , которые пользуются большой популярностью. Однако существуют критерии, по которым необходимо однозначно выбрать, какую из данных СУБД использовать в той или ино ситуации. Для этого рассмотрим их основные преимущества и недостатки.
Преимущества ClickHouse:
1. Высокая производительность: ClickHouse спроектирован для аналитических задач и обладает высокой скоростью выполнения запросов на чтение больших объемов данных. Это делает его идеальным выбором для аналитики данных и OLAP (аналитической обработки онлайн)
2. Эффективное сжатие данных: ClickHouse использует различные методы сжатия данных, что позволяет значительно сократить объем хранимой информации без потери производительности.
3. Горизонтальное масштабирование: ClickHouse легко масштабируется горизонтально, что позволяет увеличивать производительность системы путем добавления новых узлов.
Недостатки ClickHouse:
1. Ограниченная поддержка транзакций: ClickHouse в основном ориентирован на аналитические задачи и не обладает полноценной поддержкой транзакций, что может быть проблемой для некоторых приложений.
2. Ограниченный набор функций: несмотря на свою производительность, ClickHouse может оказаться недостаточным для некоторых сложных аналитических задач из-за ограниченного набора встроенных функций.
Преимущества Greenplum:
1. Поддержка транзакций: Greenplum предоставляет полноценную поддержку транзакций и ACID (атомарность, согласованность, изолированность, долговечность), что делает его идеальным выбором для OLTP (онлайн-транзакционной обработки) и OLAP приложений.
2. Широкий набор функций: Greenplum предлагает богатый набор встроенных функций и возможностей аналитической обработки, что делает его подходящим для различных типов аналитических задач.
3. Поддержка распределенных транзакций: Greenplum обеспечивает поддержку распределенных транзакций и масштабируется горизонтально, что позволяет обрабатывать большие объемы данных.
Недостатки Greenplum:
1. Сложность управления: Greenplum может потребовать больше усилий и опыта для управления и настройки, особенно при работе с крупными кластерами.
2. Менее эффективное сжатие данных: По сравнению с ClickHouse, Greenplum может не обеспечивать такое же высокое уровень сжатия данных, что может привести к более высокому использованию дискового пространства и меньшей производительности
В конечном итоге, выбор между ClickHouse и Greenplum зависит от конкретных потребностей задачи. ClickHouse лучше подходит для аналитических задач с высокими требованиями к производительности, в то время как Greenplum может быть предпочтительным выбором для приложений, где важна поддержка транзакций и широкий набор функций.
📊😎💡Подборка сервисов для работы с Big Data и интеграции с различными СУБД
DBeaver - сервис, который подходит для интеграции с различными БД, такими как MySQL или Oracle. Данное приложение предназначено ля управления базами данных. Взаимодействовать с реляционными базами данных ему помогает интерфейс JDBC. Редактор DBeaver позволяет применять большое количество дополнительных плагинов и дает подсказки по заполнению кода, подсвечивая синтаксис. Менеджер приложения поддерживает свыше 80 баз данных.
Mixpanel — это система для аналитики и анализа поведения пользователей. Она включает в себя такие функции, как:
1. Сегментирование пользователей
2. Отправка своим пользователям уведомлений внутри приложений
3. A/B тестирование для различных уведомлений
4. Интеграция пользовательских опросов в приложения через Mixpanel Surveys
App Annie — это сервис для аналитики и получения достоверных данных, чтобы принимать важные решения на всех этапах бизнеса мобильных приложений. App Annie поможет изучить конкурентов, состояние рынка, отследить загрузки приложений, доходы, использование, вовлеченность и рекламу. Сервис также позволяет оптимизировать продукты для магазинов приложений и повысить эффективность методов продвижения, показатель удержания и эффективно поддерживать целевую аудиторию. App Annie включает в себя рыночную аналитику, аналитику приложений по нескольким магазинам и аналитику конкурентов.
Adjust — оптимизатор всех процессов продвижения продукта. Собирает сведения о том, откуда пользователи перешли на страницу вашего приложения. Он представляет собой набор инструментов для измерений и аналитики, с помощью которых маркетологи могут наблюдать за развитием своих приложений и направлять его в течение всего жизненного цикла продукта
💡⚔️Sensei подскажет
Sensei - это сравнительно новый Python-инструмент генерации синтетических данных с использованием таких систем, как OpenAI, MistralAI or AnthropicAII.
Для запуска необходимо произвести следующую предустановку:
pip install openai mistralai numpy
Разработчики также написали подробную инструкцию по настройке.
😎📊Готовый набор аннотированных изображений
Набор данных ImageNet включает в себя 14 197 122 аннотированных изображений, структурированных в соответствии с иерархией WordNet.
С начала 2010 года этот набор данных используется в конкурсе ImageNet Large Scale Visual Recognition Challenge (ILSVRC) и служит стандартом для задач классификации изображений и обнаружения объектов.
Этот обширный публичный набор данных содержит изображения, которые были вручную аннотированы для целей обучения.
🌲💡Новый датасет о лесах
FinnWoodlands - это датасет, который включает в себя 4226 объектов, аннотированных вручную, из которых 2562 объекта (60,6%) соответствуют стволам деревьев, классифицированным в три различные категории экземпляров, а именно "Ель", "Береза" и "Сосна".
Помимо стволов деревьев, существуют аннотации объектов "Препятствия", а также семантические классы "Озеро", "Земля" и "Дорожка".
Этот датасет может быть использован в различных приложениях, где важно целостное представление окружающей среды. В нем предоставлен начальный бенчмарк, используя три модели для сегментации экземпляров, паноптической сегментации и заполнения глубины.
В целом, FinnWoodlands состоит из стереоизображений RGB, облаков точек и карт разреженной глубины, а также справочных аннотаций для семантической сегментации.
📊💡OAC: преимущества и недостатки
Oracle Analytics Cloud (OAC) представляет собой мощный инструмент для анализа данных, предоставляющий возможности бизнес-аналитики в облаке.
Преимущества Oracle Analytics Cloud:
1. Обширные возможности анализа данных: OAC предоставляет широкий спектр инструментов для визуализации данных, создания отчетов и анализа трендов. Он объединяет данные из различных источников, обеспечивая всесторонний взгляд на бизнес-процессы.
2. Использование облачных технологий: Oracle Analytics Cloud строится на облачных технологиях, что обеспечивает масштабируемость и гибкость в обработке больших объемов данных. Это также уменьшает нагрузку на внутренние ИТ-ресурсы компании.
3. Интеграция с другими продуктами Oracle: OAC хорошо интегрируется с другими продуктами Oracle, такими как Oracle Database, Oracle Cloud Infrastructure и другие. Это обеспечивает единое рабочее пространство для данных и обеспечивает совместимость с существующими системами.
4. Безопасность данных: Oracle Analytics Cloud обеспечивает высокий уровень безопасности данных, включая механизмы шифрования и управление доступом.
5. Автоматизированный анализ и машинное обучение: OAC предоставляет возможности автоматизированного анализа данных и интеграции машинного обучения, что позволяет компаниям выявлять скрытые тренды и прогнозировать будущие события.
Недостатки Oracle Analytics Cloud:
1. Сложность внедрения: Развертывание Oracle Analytics Cloud может быть сложным процессом, требующим определенных технических навыков. Это может вызвать трудности для небольших компаний или организаций с ограниченными ресурсами.
2. Стоимость использования: Платные лицензии и обслуживание OAC могут оказаться дорогими для малых предприятий. Необходимо тщательно оценить бюджетные возможности перед принятием решения об использовании данной платформы.
3. Ограниченная гибкость пользовательского интерфейса: Несмотря на обширные возможности, пользовательский интерфейс OAC может быть менее гибким по сравнению с некоторыми конкурентами, что может усложнить адаптацию для определенных бизнес-потребностей.
В целом, Oracle Analytics Cloud представляет собой мощное аналитическое решение, но компании должны внимательно взвесить его преимущества и недостатки, учитывая свои бизнес-цели и технические возможности.
📊💡DeltaLake: преимущества и недостатки
Delta Lake - это уровень абстракции для работы с данными в хранилищах данных. Delta Lake предоставляет дополнительные возможности и гарантии целостности данных для хранения и обработки больших объемов данных.
Преимущества Delta Lake:
1. Транзакционная согласованность: Delta Lake предоставляет ACID-транзакции, обеспечивая транзакционную согласованность данных. Это гарантирует надежность операций и управление целостностью данных.
2. Партиционирование: Delta Lake поддерживает партиционирование данных, что улучшает производительность запросов и управление данными. Партицирование позволяет эффективно фильтровать данные на основе определенных критериев.
3. Улучшенная производительность: Delta Lake оптимизирует выполнение запросов и операций на данных, что ведет к улучшенной производительности в сравнении с обычными хранилищами данных.
4. Обработка потоковых данных: Delta Lake поддерживает потоковую обработку данных, что позволяет мгновенно обновлять и анализировать данные в реальном времени.
Недостатки Delta Lake:
1. Сложность настройки: Некоторые пользователи могут столкнуться с трудностями при настройке и использовании Delta Lake из-за его расширенных функциональных возможностей.
2. Совместимость: Вопросы совместимости могут возникнуть при интеграции Delta Lake с другими инструментами и системами хранения данных.
В целом, Delta Lake предоставляет мощные инструменты для управления и обработки данных, но использование его следует рассматривать с учетом конкретных требований проекта и опыта команды.
💡😎ТОП мартовских ивентов в Data Science
5 марта - AI 360: Вебинар по машинному обучению - Новосибирск, Россия - https://my.mts-link.ru/rdtex/ml1
6 марта - VK JT - Москва, Россия - https://vkjt.ru/
6-7 марта - OpenTalks.AI 2024 - Тбилиси, Грузия - https://opentalks.ai/
12 марта - Flow 2024 Spring - Онлайн - https://flowconf.ru/#media
14 марта - CX Tech Day 2024 - Москва, Россия - https://www.naumen.ru/products/phone/cx-day-2024/
12-14 марта - Epic AI Conference - Онлайн - https://epicgrowth.io/ai-conference
18-22 марта - Podlodka Product Crew - Онлайн - https://podlodka.io/productcrew
28 марта - DATA&AI 2024 - Москва, Россия - https://www.osp.ru/lp/data-ai2024
💡📊😎Датасет для виртуальной реальности
Мета объявила о новых проектах в области искусственного интеллекта (ИИ) и обновлении своей инициативы Ego-Exo, направленной на решение проблем, связанных с технологиями, ориентированными на предоставление перспективы от первого лица.
Компания выпустила датасет под названием Ego-Exo4D. Как отмечают, разработчики, проект помочь качественному обучению моделей ИИ сложными человеческими навыками и подойдет для создания приложений систем виртуальной реальности, робототехники, и многого другого.
Ego-Exo4D содержит три, тщательно синхронизированных датасета естественного языка в сочетании с видео и комментариями экспертов, включают в себя более 1400 часов видео, а также аннотации для бенчмарков.
📊💡Датасет для настройки математических моделей
OpenMathInstruct-1 представляет собой свежий синтетический датасет от компании NVIDIA, созданный для обучения математических моделей. Данный датасет включает в себя 1,8 миллиона пар "задача-решение", предназначенных для обучения.
Как отмечают разработчики, данный набор данных создан путем синтеза решений для интерпретатора кода для GSM8K и MATH, двух популярных тестов математического анализа, с использованием недавно выпущенной и имеющей разрешительную лицензию модели Mixtral.
📉📊💡Recommendations for working with data from Yandex
A new section has been launched on the Yandex Cloud website -Data Platform Solution Library. There you can find examples and recommendations for working with data, broken down by analytical scenarios.
For each scenario, practical examples and tutorials are collected in one place, freely available on GitHub, as well as all useful materials: articles, cases, webinars and documentation.
The library continues to be updated with solutions and scenarios.
📉📊💡Рекомендации по работе данными от Яндекс
На сайте Yandex Cloud запустился новый раздел — Data Platform Solution Library. Там можно найти примеры и рекомендации по работе с данными с разбивкой по аналитическим сценариям.
Для каждого сценария в одном месте собраны практические примеры и руководства в свободном доступе на GitHub, а также все полезные материалы: статьи, кейсы, вебинары и документацию.
Библиотека продолжает пополняться решениями и сценариями.
💡📊Стартап для общение с базами данных
Команда стартапа groql из Новосибирска, победителя осенней сессии А:СТАРТ 2023 года разработала приложение, которое позволяет пользователю общаться с базами данных на естественном (русском) языке без опыта в области программирования и получать визуализации в виде графиков, диаграмм и графов. Еще одно преимущество программы — в работе на основе ИИ. Groql помогает перевести запрос с естественного языка на SQL. Пользователь может описать особенности баз данных и ИИ учтет их при работе.
Главное преимущество этого стартапа — в визуальном представлении данных. После обработки запроса пользователь увидит графическое представление данных, которое поможет лучше понять связи между различными данными. Как отмечают разработчики, это может помочь работодателю сократить издержки — за счет сокращения времени и упрощения работы с данными.
Подробнее: https://habr.com/ru/articles/791358/
Hiring days от VK для ML и Backend-разработчиков
Современный стек, интересные проекты и смелые эксперименты — стать частью Департамента AI или Дзена можно всего за два дня.
Узнайте подробности и отправляйте отклик до 15 февраля.
💡Хранилище данных vs. Data Lake: преимущества и недостатки
Хранилища данных и Data Lake представляют собой два различных подхода к управлению и хранению данных в организации. Рассмотрим основные аспекты каждого из них.
Хранилище данных:
Преимущества:
1. Структурированные данные: Хранилища данных обычно предназначены для хранения структурированных данных, что облегчает их анализ и обработку.
2. Производительность: В хранилищах данных используются оптимизированные структуры для быстрого доступа к данным, что обеспечивает высокую производительность запросов.
3. Готовность к использованию: Данные в хранилище предварительно обрабатываются и организованы, что делает их готовыми к использованию для бизнес-аналитики и отчетности.
Недостатки:
1. Ограниченность типов данных: Хранилища данных могут быть менее гибкими при работе с разнообразными типами данных, такими как неструктурированные или полуструктурированные данные.
2. Сложность масштабирования: При увеличении объема данных их хранение и обработка в хранилище может стать более сложной задачей, требующей дополнительных ресурсов.
Data Lake:
Преимущества:
1. Гибкость в типах данных: Data Lake предоставляет возможность хранения неструктурированных и полуструктурированных данных, что делает его подходящим для разнообразных данных.
2. Масштабируемость: Data Lake легко масштабируется с ростом объема данных, обеспечивая увеличение производительности и хранение больших объемов информации.
3. Обработка данных на лету: Возможность проводить анализ данных в реальном времени позволяет оперативно использовать информацию для принятия решений.
Недостатки:
1. Сложность управления: Управление Data Lake может потребовать более сложных процессов и стратегий, чтобы избежать беспорядка и поддерживать качество данных.
2. Неоптимизированный доступ: Поскольку данные в Data Lake хранятся в их первоначальной форме, доступ к ним может потребовать дополнительных усилий для оптимизации запросов.
Таким образом, выбор между хранилищем данных и Data Lake зависит от уникальных потребностей бизнеса и характера данных. В некоторых случаях оптимальным решением может быть комбинация обоих подходов, что обеспечит комплексный подход к управлению данными в организации.
