es
Feedback
Data Analysis / Big Data

Data Analysis / Big Data

Ir al canal en Telegram

Лучшие посты по анализу данных и работе с Big Data на русском и английском языке Разместить рекламу: @tproger_sales_bot Правила общения: https://tprg.ru/rules Другие каналы: @tproger_channels

Mostrar más
2 747
Suscriptores
-424 horas
-27 días
+1230 días
Archivo de publicaciones
Матрица ошибок confusion_matrix() в scikit-learn Одним из самых наиболее развёрнутых способов оценки качества классификации является применение матрицы ошибок. Матрица ошибок представляет собой квадратную таблицу, в которой отображается количество предсказанных и фактических классов для классификационной модели. В этой матрице строки представляют истинные классы (реальные метки), а столбцы представляют предсказанные классы (метки, которые предсказала модель). Размер матрицы соответствует количеству классов. Обычно для бинарной классификации она выглядит так: Читать: https://habr.com/ru/articles/868636/ #ru @big_data_analysis | Другие наши каналы

Инновационные инструменты для безопасности данных Oracle FDI представляет новую функцию — настраиваемый контекст безопасности. Эта уникальная возможность обеспечивает точный контроль доступа к финансовым данным, учитывая сегменты баланса и затрат. Узнайте, как улучшить управление данными в вашей организации. Читать подробнее #en @big_data_analysis | Другие наши каналы

Как мультифакторные релейшены упростили нашу модель данных в Tableau Сегодня BI-аналитика немыслима без ETL-процессов. Просто физических джоинов уже не хватает — чаще нужны логические модели данных. С ними можно создавать сложные структуры без запросов вручную. Как self-service инструмент, Tableau дал такую возможность в 2020 году, представив релейшены (relationships). Читать: https://habr.com/ru/articles/868480/ #ru @big_data_analysis | Другие наши каналы

Какой тип разметки данных требуется для вашего проекта? Полный гид по аннотированию изображений Ограничивающие рамки, полигоны, ключевые точки или 3D-кубоиды? Каждый из этих методов разметки подходит для совершенно разных задач машинного обучения. Хотите узнать, как правильно выбрать инструмент для своего проекта? Мы сравним преимущества и недостатки каждого инструмента и покажем, как аннотирование помогает создать передовые технологии — от беспилотных авто до диагностики в медицине. Читать: https://habr.com/ru/companies/data_light/articles/868464/ #ru @big_data_analysis | Другие наши каналы

Сравниваем форматы сериализации на Go: скорость и удобство Дмитрий Королёв, бэкенд-разработчик в Авито, разобрал на примерах, чем отличаются друг от друга форматы сериализации данных и как выбрать самый удобный. Читать: «Сравниваем форматы сериализации на Go: скорость и удобство» #ru @big_data_analysis | Другие наши каналы

Переход на новую архитектуру проекта: как это влияет на надежность стриминга web-данных Предположим, что перед вашей командой стоит задача по поиску надежного стриминга web и app данных, который бы соответствовал требованиям службы безопасности, ожиданиям отделов маркетинга и аналитики, а также был бы полезен для управляющей команды. Не менее важно удобство и прозрачность работы стриминга, а внесение изменений в ожидаемый результат, желательно, без привлечения дополнительного ресурса аналитиков и разработчиков. Читать: https://habr.com/ru/articles/868358/ #ru @big_data_analysis | Другие наши каналы

Машинное обучение на Spark Существует множество подходов к машинному обучению. Со стороны может показаться, что генеративные модели на архитектуре под названием «трансформер» заняли передовые позиции и ближайшее обозримое будущее именно за ними. Но существуют и другие подходы к машинному обучению, которые тиражируются в медийном поле не так широко. В этой статье вы познакомитесь с таким классом алгоритмов, как ансамблевые методы машинного обучения. А именно — градиентный бустинг на решающих деревьях. В основе они представляют из себя деревья решений, которые являются очень простой структурой, позволяющей получить ответ на основе входных данных. А еще мы разберемся, при чем тут Spark, и посмотрим на эти алгоритмы на практике. Читать: https://habr.com/ru/companies/vk/articles/868114/ #ru @big_data_analysis | Другие наши каналы

Анализ фильмов с интернет-портала Кинопоиск Данное исследование посвящено анализу данных о фильмах, собранных с крупнейшей российской платформы КиноПоиск. Основная цель работы — выявить факторы, влияющие на популярность фильмов, их рейтинги и финансовую успешность. В ходе исследования были проанализированы жанровые предпочтения аудитории, проведено сравнение оценок фильмов на Кинопоиске и IMDb, а также исследована взаимосвязь между бюджетами фильмов и их кассовыми сборами. Разработка включала этапы сбора, обработки, анализа и визуализации данных. Для обработки данных применялись методы очистки от пропусков и ошибок, фильтрации по ключевым показателям и трансформации структур данных. Были реализованы функции для конвертации валют, извлечения данных о жанрах и персоналиях фильмов (актёрах и режиссёрах), а также вычисления статистических показателей полноты и однородности выборки. Для эффективной работы системы был использован современный технологический стек. Обработка данных осуществлялась с помощью MongoDB, что обеспечило хранение и управление большими объёмами неструктурированной информации. RabbitMQ организовал асинхронный обмен сообщениями между компонентами системы, а серверная часть приложения разрабатывалась на базе Spring Boot, что ускорило процесс разработки и упростило развертывание приложения. Контейнеризация с использованием Docker обеспечила удобное развертывание и масштабирование системы. Основными языками программирования стали Java 17 и Python: Java использовалась для серверной части и микросервисов, а Python — для анализа данных и построения алгоритмов обработки информации. Для анализа данных применялись библиотеки Pandas, Seaborn и SciPy, которые обеспечили эффективную обработку данных и визуализацию результатов. В рамках анализа строились графики, отображающие популярность жанров, исследовалась корреляция оценок на Кинопоиске и IMDb, а также визуализировалась связь между бюджетами и кассовыми сборами. Для представления результатов применялись такие инструменты, как matplotlib и seaborn, позволяя визуализировать ключевые закономерности в виде графиков и диаграмм. Анализ выявил ключевые закономерности: популярность определённых жанров, зависимость коммерческого успеха фильма от его бюджета и значительное влияние известных актёров и режиссёров на успех фильма. Полученные результаты могут быть полезны для киностудий и продюсеров при планировании новых проектов, прогнозировании кассовых сборов и выборе жанров. Результаты также могут применяться для оптимизации маркетинговых стратегий при продвижении фильмов. В будущем планируется углубить исследование, проанализировать долгосрочные тренды в изменении популярности жанров и исследовать влияние пользовательских рецензий на успех фильмов. Читать: https://habr.com/ru/articles/868238/ #ru @big_data_analysis | Другие наши каналы

Рынок дата-инженеров и прогноз на 2025 В этой статье вы сможете узнать в каком состоянии находится рынок дата-инженеров в 2024-ом и что с ним будет в 2025-ом. Читать: https://habr.com/ru/articles/864780/ #ru @big_data_analysis | Другие наши каналы

Возможности LLM и RAG на примере реализации бота для поддержки клиентов Одной из ключевых точек контакта компании с клиентами является техподдержка, которая позволяет оперативно решать вопросы и отрабатывать обратную связь. Но клиенты, которые хотят консультацию и информацию по конкретному вопросу, часто создают нагрузку, которую небольшие отделы поддержки обработать не могут. В итоге бизнесу нужно либо расширять штат, либо автоматизировать часть процессов. В этом помогают чат-боты и нейросети. Меня зовут Александр Волынский. Я технический менеджер продукта в подразделении Applied ML. В этой статье я хочу рассказать об LLM и RAG, вариантах их использования на примере нашего бота для поддержки клиентов, а также о сценариях применения полученной реализации. Читать: https://habr.com/ru/companies/vk/articles/866906/ #ru @big_data_analysis | Другие наши каналы

Повышение качества данных с использованием Zero Bug Policy Олег Харатов, Technical Unit Lead в Авито, рассказывает, как навес
Повышение качества данных с использованием Zero Bug Policy Олег Харатов, Technical Unit Lead в Авито, рассказывает, как навести порядок в огромном хранилище и не сойти с ума. Читать: «Повышение качества данных с использованием Zero Bug Policy» #ru @big_data_analysis | Другие наши каналы

Повышение качества данных с использованием Zero Bug Policy Олег Харатов, Technical Unit Lead в Авито, рассказывает, как навес
Повышение качества данных с использованием Zero Bug Policy Олег Харатов, Technical Unit Lead в Авито, рассказывает, как навести порядок в огромном хранилище и не сойти с ума. Читать: «Повышение качества данных с использованием Zero Bug Policy» #ru @big_data_analysis | Другие наши каналы

Data driven на практике: с чего начать, как избежать ошибок и эффективно применять Привет, меня зовут Александр Окороков, я основатель и генеральный директор ИТ-компании и автор медиа вАЙТИ. Мы помогаем заказчикам выстроить оптимальную стратегию принятия управленческих решений, чтобы эффективно использовать ресурсы и не терять деньги. Именно эту задачу решает data-driven-подход к принятию решений и управлению продуктом с опорой на данные. Читать: https://habr.com/ru/companies/beeline_cloud/articles/867292/ #ru @big_data_analysis | Другие наши каналы

Генерация дашборда по DAX мере через AI DAX движок Привет, Хабр! AI инструменты широко используются в разработке и других сферах, казалось бы, что ещё можно в них улучшить или добавить? Всё зависит от предметной области, в области Business Intelligence при работе с языком запросов DAX актуальным может быть работа с мерами и создание новых мер. Рутинной задачей при этом является создание схемы данных и заполнение её данными для каждой меры, или можно использовать уже имеющуюся схему, однако при этом при переходе с одной схемы (где выполняются запросы) на другую приходится переименовывать таблицы и столбцы, сопоставлять типы данных и т.д. В связи с этим актуальным может быть инструмент для создания схемы данных для меры "на лету" и выполнения запроса с мерой, т.е. построение запроса и дашборда (концептуально, без форматрования) по мере "на лету". В dax.do можно строить DAX запрос только для существующих схем, т.е. приходится тратить время на переименование полей и таблиц в DAX запросе при переносе написанного DAX-запроса из dax.do. В этой статье рассматривается решение такой проблемы — генерация схемы, связей, запроса и дашборда "на лету" (концептуально, по аналогии с отображением дашборда на основе DAX в dax.do), но только сугубо средствами AI, без реальных DAX движков. Надеюсь, такие инструменты или идеи могут быть полезны аналитикам и разработчикам для повседневной работы, если Вам интересен AI в DAX — добро пожаловать под кат :) Читать: https://habr.com/ru/articles/866534/ #ru @big_data_analysis | Другие наши каналы

Отход от Airflow: почему Dagster — это оркестратор данных следующего поколения Мы запустили Dagster, потому что в мире данных наблюдается кризис инструментов и инженерии. Существует драматическое несоответствие между сложностью и критичностью данных и инструментами и процессами, которые существуют для их поддержки. Читать: https://habr.com/ru/articles/867132/ #ru @big_data_analysis | Другие наши каналы

Плюсы и минусы Luxms BI: честный взгляд на платформу от вендора Я - Алексей Розанов, руководитель отдела пресейл и работы с партнерами Luxms, хочу с вами честно поговорить о том, что собой представляет Luxms BI. Поскольку полагаться только на рейтинги нельзя, а опыт других компаний сильно зависит от их задач, требований и условий, то хочу предложить вам еще один взгляд - взгляд вендора. Это будет объективный, насколько это вообще возможно, обзор плюсов и минусов платформы Luxms BI, основанный на общении с нашими партнерами, действующими и потенциальными заказчиками. Я не буду голословным и предоставлю максимальное количество подтверждений тому, о чем буду говорить. Читать: https://habr.com/ru/companies/luxms_bi/articles/867262/ #ru @big_data_analysis | Другие наши каналы

Как посчитать биологические данные и не уронить сервер и ноутбук? Привет, Хабр Наверняка вы слышали о биоинформатике. Звучит перспективно, приятно и полезно. Часто, ввиду всеобщих рассказов о перспективности и возможностях направления, некоторые люди из IT или из «мокрой» биологии (так называют область биологии, где работают в лаборатории с бактериями и прочими возможными объектами живой и не очень природы и реагентами) хотят перейти в биоинформатику. Однако далеко не все понимают, что же это за область такая и почему с ней сложно работать. Читать: https://habr.com/ru/companies/first/articles/866618/ #ru @big_data_analysis | Другие наши каналы

Как честно распределить вычислительные ресурсы? Показываем на примере YTsaurus YTsaurus — платформа для распределённого хранения и обработки данных. С помощью неё пользователи могут производить вычисления с данными, которые хранятся на кластере. За запуск этих вычислений отвечает один из центральных компонентов системы — планировщик. Зачастую ресурсов кластера не хватает, чтобы одновременно запустить все желаемые вычислительные задачи. Поэтому одна из важных задач планировщика — умение грамотно распределять вычислительные ресурсы между пользователями. Меня зовут Егор Щербин, я работаю в Yandex Infrastructure, в команде планировщика YTsaurus. О нём и расскажу в этой статье. А также о запуске вычислений в кластере YTsaurus, распределении ресурсов между вычислениями и о том, как управлять распределением, чтобы все операции получали ровно столько, сколько требуется. Читать: https://habr.com/ru/companies/yandex/articles/860562/ #ru @big_data_analysis | Другие наши каналы

Как перейти от ручной проверки данных к автоматической: решение ИЦ «Безопасный транспорт» Об Инновационном центре Инновационный центр «Безопасный Транспорт» создан в 2017 году на базе ЦОДД для работы с Big data и решения задач Транспортного комплекса Москвы. Команда экспертов изучает и анализирует потребности жителей столицы, а также разрабатывает и внедряет инновационные цифровые сервисы и решения для транспорта и дорог города. На данный момент на базе Инновационного центра построено хранилище данных Транспортного комплекса столицы, которые используются во многих проектах и продуктах, направленных на оказание поддержки в принятии управленческих решений Правительству Москвы, а также на улучшение транспортной инфраструктуры города в целом. Хранилище данных - сердце Транспортного комплекса С 2013 года Москва стремительно росла, улучшалась и расширяла свои границы. Логично, что  это влекло за собой бурное развитие Транспортного комплекса, а вместе с ним увеличивалось и количество обслуживающих его IT-систем и данных, которые эти системы генерируют. Для реализации концепции data driven нужно было собрать все эти данные в одном месте, а для этого была нужна отдельная команда и отдельное подразделение. С этого в 2017 году и началась история ИЦ, сердцем которого является хранилище данных. На данный момент данные хранилища Инновационного Центра используются во множестве информационно-аналитических продуктов.  В их числе — интерактивная аналитическая отчётность, цифровое мастер планирование города, Экологическая карта, Коммуникационная платформа, Карта аварийности, Справка загруженности и другие решения, направленные на улучшение и развитие Транспортного комплекса Москвы. Читать: https://habr.com/ru/articles/867082/ #ru @big_data_analysis | Другие наши каналы

Горящие таски — в сторону. Мы нашли вам занятие поинтереснее! Tproger вместе с друзьями приготовил для вас Виммельбух. Первые три главы уже на сайте — переходите по ссылке и узнавайте, чем живёт технологичный город в новогоднюю пору: https://tprg.ru/sTfj А ещё на улицах города мы спрятали предметы… Сможете найти все? Реклама, ИП Михайлишина Гузель Фаниловна, erid: LjN8KJDZd