en
Feedback
Data Mining | Анализ данных🚀

Data Mining | Анализ данных🚀

Open in Telegram

• Купить рекламу: t.me/sahib_space Админ: sahib_space • Стоимость: https://www.notion.so/sahibspace/69ece414a4af49f2bdbdfe455e553e58?pvs=3&qid= • Группа в ВК: vk.com/datamining.team

Show more
3 366
Subscribers
No data24 hours
-87 days
-3530 days
Posts Archive
Автор делится примером, когда нужно оставить только имена длиннее пяти букв, и примером, когда нужно заменить короткие имена
Автор делится примером, когда нужно оставить только имена длиннее пяти букв, и примером, когда нужно заменить короткие имена на символ-заполнитель. Объясняется, почему порядок частей в этих включениях различается и как это соотносится с документацией Python. Статья также кратко рассматривает разницу между выражениями и операторами, помогая понять, почему тернарный оператор является выражением и как его использовать в списковых включениях.

Статья рассматривает применение моделей глубокого обучения, включая архитектуры на основе трансформеров, для задачи ранжирова
Статья рассматривает применение моделей глубокого обучения, включая архитектуры на основе трансформеров, для задачи ранжирования в системах информационного поиска. Обсуждаются модели типа MonoBERT и DuoBERT для переранжировки запросов, а также использование моделей типа T5 для ранжирования документов на основе последовательностей.

Статья обсуждает контроверсию вокруг фторирования воды, подчеркивая его эффективность и безопасность на основе мета-анализов
Статья обсуждает контроверсию вокруг фторирования воды, подчеркивая его эффективность и безопасность на основе мета-анализов и исследований. Автор рассматривает аргументы противников, подчеркивая необходимость осмысленного подхода к научным данных в общественном здравоохранении.

Pассматривается создание инструмента для извлечения, анализа и визуализации данных статистики статей на Medium, включая постр
Pассматривается создание инструмента для извлечения, анализа и визуализации данных статистики статей на Medium, включая построение интерактивных графиков, применение ML методов для анализа зависимостей и прогнозирования будущих показателей. Автор демонстрирует не только техническую реализацию инструмента, но и применяет его для получения интересных инсайтов из своих собственных данных статистики Medium.

Статья касается различных аспектов развития языковых моделей, начиная от Transformer и BERT, до более новых моделей типа GPT
Статья касается различных аспектов развития языковых моделей, начиная от Transformer и BERT, до более новых моделей типа GPT и RETRO. Обсуждаются методы предварительного обучения, контекстуализированные эмбеддинги, и использование баз данных для улучшения работы моделей при генерации текста.

Статья освещает методы оптимизации гиперпараметров для ML, начиная от ручного подбора и заканчивая байесовской модельно-основ
Статья освещает методы оптимизации гиперпараметров для ML, начиная от ручного подбора и заканчивая байесовской модельно-основанной оптимизацией. Она подробно объясняет принципы построения вероятностной модели целевой функции и использования её для эффективного выбора оптимальных гиперпараметров, а также обсуждает преимущества этого подхода по сравнению с традиционными методами.

Парни создали объединённое ядро CUDA, которое деквантовывает значения fp6 до fp16 перед выполнением обычного умножения матриц
Парни создали объединённое ядро CUDA, которое деквантовывает значения fp6 до fp16 перед выполнением обычного умножения матриц fp16 с накопителями fp32. Это аналогично существующим ядрам для низкобитового вывода 4 бит и 8 бит, но с новым сложным форматом. FP6-LLM позволяет выполнять вывод моделей быстрее в режиме, ограниченном пропускной способностью памяти (малые размеры пакетов), используя меньшие веса. link

Исследуются методы визуализации скрытых состояний языковых моделей Transformer с целью понять, как модели генерируют текст. С
Исследуются методы визуализации скрытых состояний языковых моделей Transformer с целью понять, как модели генерируют текст. Статья демонстрирует визуализации ранжирования токенов, логитов и вероятностей softmax на разных слоях моделей, таких как GPT-2 XL. Цель этих визуализаций - раскрыть принципы принятия решений моделью и процесс её работы от входных данных к выходным токенам через каждый слой модели.

Обзор применения Dropout регуляризации для борьбы с переобучением в моделях машинного обучения. В статье рассматривается поня
Обзор применения Dropout регуляризации для борьбы с переобучением в моделях машинного обучения. В статье рассматривается понятие переобучения и его важность, а также объясняется, как работает Dropout в нейронных сетях и как его можно применить к моделям машинного обучения на примере MLP, включая выбор оптимального коэффициента Dropout.

Исследование рассматривает MoE-основанные большие языковые модели и их оптимальную настройку для инференции. Авторы изучают з
Исследование рассматривает MoE-основанные большие языковые модели и их оптимальную настройку для инференции. Авторы изучают зависимость производительности модели от её размера, объёма данных и числа экспертов в MoE, предлагая улучшенные методы настройки для достижения эффективности на этапе инференции при сохранении высокой производительности.

Статья охватывает основы Retrieval Augmented Generation, её применение для улучшения LLM, и решения проблем, связанных с гене
Статья охватывает основы Retrieval Augmented Generation, её применение для улучшения LLM, и решения проблем, связанных с генерацией некорректной информации. Автор обсуждает, как интеграция методов извлечения информации может повысить точность и эффективность ИИ-ассистентов.

Станьте профессионалом в области Data Science и машинного обучения в магистратуре от Центрального университета! Центральный у
Станьте профессионалом в области Data Science и машинного обучения в магистратуре от Центрального университета! Центральный университет — современный вуз, созданный при поддержке ведущих компаний России: Т-Банка, Авито и других. Получите диплом магистра в области математики и компьютерных наук и обучайтесь на основе реальных кейсов ведущих ИТ-компаний у профессоров из МГУ, МФТИ, РЭШ и практиков из индустрии. Хорошая новость для тех, кто уже имеет опыт в Data Science и машинном обучении — вы можете пропустить базовое обучение и закончить магистратуру за 3 семестра. У каждого студента будет: — личный ментор по траектории обучения; — доступ к карьерному центру с коучами и консультантами; — опыт работы в проектах партнеров уже во время обучения. Участвуйте в онлайн-отборе, чтобы выиграть грант на обучение до 1,2 млн рублей. Больше подробностей про университет и конкурс грантов по ссылке! erid:2VtzqwEUHtX Реклама, АНО ВО «Центральный университет», ИНН 7743418023

В статье обсуждаются проблемы концептуального дрейфа, который возникает, когда изменяется распределение данных, на основе кот
В статье обсуждаются проблемы концептуального дрейфа, который возникает, когда изменяется распределение данных, на основе которых обучена модель. Представлены методы мониторинга и предотвращения дрейфа, такие как онлайн-обучение, периодическое переобучение моделей, использование ансамблевых методов и отбрасывание признаков. Также описаны лучшие практики, включающие сбор и предобработку данных, их разметку, обнаружение дрейфа и его устранение.

⏩В статье рассматриваются ограничения векторного поиска для LLM и утверждается, что он не всегда является лучшим решением. Пр
⏩В статье рассматриваются ограничения векторного поиска для LLM и утверждается, что он не всегда является лучшим решением. Приводятся примеры инфраструктурных стэков от известных венчурных компаний, критикуется доминирование векторного поиска и предлагаются альтернативные методы поиска.

Исследование анализирует, как внедрение синтетических данных влияет на масштабирование нейронных моделей. Авторы разрабатываю
Исследование анализирует, как внедрение синтетических данных влияет на масштабирование нейронных моделей. Авторы разрабатывают теоретическую модель для предсказания возможного деградирования моделей при изменении масштабных законов, что подтверждается экспериментами с использованием трансформера и Llama2.

➡️ Исследование проверяет эффективность стратегии обрезки слоев для предварительно обученных LLM, показывая минимальное сниже
➡️ Исследование проверяет эффективность стратегии обрезки слоев для предварительно обученных LLM, показывая минимальное снижение производительности до удаления значительной части слоев. Авторы предлагают оптимальный блок слоев для обрезки на основе их сходства и применяют квантизаци и адаптеры низкого ранга, что позволяет значительно экономить вычислительные ресурсы и улучшать задержки при выводе.

Подробное введение в LSTM сети, охватывая их уникальную архитектуру, роль ворот и важность функций активации tanh и sigmoid.
Подробное введение в LSTM сети, охватывая их уникальную архитектуру, роль ворот и важность функций активации tanh и sigmoid. Книга также содержит практические примеры использования LSTM сетей в Python с использованием TensorFlow для различных задач, включая обработку естественного языка и прогнозирование временных рядов. https://medium.com/@palashm0002/understanding-and-implementing-lstm-networks-41ca52495108

Рассматриваются основные метрики оценки для NLP моделей, включая BLEU, NIST, METEOR, ROUGE, CIDEr, SPICE и BERTscore. Каждая
Рассматриваются основные метрики оценки для NLP моделей, включая BLEU, NIST, METEOR, ROUGE, CIDEr, SPICE и BERTscore. Каждая метрика направлена на оценку качества перевода, суммаризации или других задач обработки естественного языка, используя различные подходы к сравнению гипотезы с эталоном, включая учет precision, recall, семантической аналогии и contextual embedding.

Любопытный подкаст с Francois Chollet (создатель Keros). Парни обсудили ARC Prize на $1🍋, а именно: Предпосылки и значимость соревнования ARC. Сравнение ARC с другими тестами ИИ. Проблема закрытости передовых исследований. Возможные подходы к решению задач ARC. Роль масштабирования моделей и "базовых знаний" в ИИ. Влияние подобных конкурсов на развитие общего ИИ. https://youtu.be/UakqL6Pj9xo?si=J9eiX4Z8ph46gwD_