en
Feedback
Data Mining | Анализ данных🚀

Data Mining | Анализ данных🚀

Open in Telegram

• Купить рекламу: t.me/sahib_space Админ: sahib_space • Стоимость: https://www.notion.so/sahibspace/69ece414a4af49f2bdbdfe455e553e58?pvs=3&qid= • Группа в ВК: vk.com/datamining.team

Show more
3 366
Subscribers
No data24 hours
-87 days
-3530 days
Posts Archive
Cравнительный анализ стратегий обучения, которые используют как выбор признаков для работы с высокой размерностью, так и мето
Cравнительный анализ стратегий обучения, которые используют как выбор признаков для работы с высокой размерностью, так и методы обучения с учетом стоимости для справления с дисбалансом классов. Эксперименты проводились на трех бенчмарках из геномной области, что позволило оценить влияние комбинации выбора признаков и обучения с учетом стоимости на несбалансированных данных. https://peerj.com/articles/cs-832/

https://vpnand.com/?ref=92 Наши друзья создали VPN. Рекомендуем. Скачивайте. Мем для привлечения внимания 🌝❤️
https://vpnand.com/?ref=92 Наши друзья создали VPN. Рекомендуем. Скачивайте. Мем для привлечения внимания 🌝❤️

Рассматриваются основные аспекты Information Retrieval включая классические алгоритмы типа инвертированного индекса и модели
Рассматриваются основные аспекты Information Retrieval включая классические алгоритмы типа инвертированного индекса и модели мешка слов (BoW), применение современных методов глубокого обучения, таких как трансформерные модели, вроде BERT.

Статья охватывает несколько ключевых тем в области дообучения языковых моделей, включая текущее состояние RLHF и его влияние
Статья охватывает несколько ключевых тем в области дообучения языковых моделей, включая текущее состояние RLHF и его влияние по сравнению с предобучением. Автор обсуждает разработку и оценку моделей оптимизации проксимальной политики и прямой оптимизации предпочтений, важность наборов данных для дообучения, производительность моделей вознаграждения через RewardBench. https://substack.com/home/post/p-146002205

Исследование представляет обзор выбранных методов и их реализаций. Предложен двухэтапный подход к классификации данных высоко
Исследование представляет обзор выбранных методов и их реализаций. Предложен двухэтапный подход к классификации данных высокой размерности, а также методы робастной регрессии и обработки выбросов для изображений.

В статье рассматривается парадигма обработки естественного языка, включающая крупномасштабное предварительное обучение на дан
В статье рассматривается парадигма обработки естественного языка, включающая крупномасштабное предварительное обучение на данных общего домена и адаптацию к конкретным задачам или доменам. https://arxiv.org/pdf/2106.09685

Статья охватывает следующие темы: архитектура трансформеров с декодером и их важность для генеративных языковых моделей (LLM)
Статья охватывает следующие темы: архитектура трансформеров с декодером и их важность для генеративных языковых моделей (LLM), механизм самовнимания (self-attention), включая скалированное точечное произведение внимания и многоголовое внимание (multi-head attention), а также реализация каскадного самовнимания на PyTorch с примерами кода.

Aвторы исследуют линейные характеристики трансформеров GPT, LLaMA, OPT, BLOOM и другие. Они обнаружили почти идеальную линейн
Aвторы исследуют линейные характеристики трансформеров GPT, LLaMA, OPT, BLOOM и другие. Они обнаружили почти идеальную линейную связь между преобразованиями эмбеддингов между последовательными слоями. Эксперименты показали, что удаление или линейная аппроксимация некоторых наиболее линейных блоков незначительно влияет на потерю или производительность модели. Введение регуляризации на основе косинусного сходства при предварительном обучении улучшило метрики производительности и уменьшило линейность моделей, что ставит под сомнение существующее понимание архитектур трансформеров. https://arxiv.org/pdf/2405.12250

В статье изучаются методы ускорения предобучения больших языковых моделей (LLM). Авторы предлагают оператор глубинного стэкин
В статье изучаются методы ускорения предобучения больших языковых моделей (LLM). Авторы предлагают оператор глубинного стэкинга Gstack, который ускоряет обучение, снижая потери и улучшая производительность на восьми стандартных NLP-бенчмарках. Gstack показывает высокую масштабируемость и эффективность, достигая тех же результатов, что и традиционные модели, но с меньшими затратами токенов. Авторы также формулируют рекомендации по применению Gstack, делая его практичным для предобучения LLM.

Статья освещает основы векторного поиска, его компоненты (извлечение и ранжирование), и применение алгоритмов машинного обуче
Статья освещает основы векторного поиска, его компоненты (извлечение и ранжирование), и применение алгоритмов машинного обучения, таких как BM25, в современных поисковых системах, улучшенных за счет использования моделей глубокого обучения, включая BERT.

В статье рассматриваются проблемы крупных языковых моделей (галлюцинации, устаревшие данные, непрозрачные процессы рассуждени
В статье рассматриваются проблемы крупных языковых моделей (галлюцинации, устаревшие данные, непрозрачные процессы рассуждения) и как Retrieval-Augmented Generation (RAG) решает эти проблемы, интегрируя внешние базы данных. Описываются различные парадигмы RAG (Naive RAG, Advanced RAG, Modular RAG) и их ключевые компоненты (извлечение, генерация, дополнение). https://arxiv.org/pdf/2312.10997

Эта статья рассматривает популярное мнение о том, что увеличение размера языковых моделей (LLM) неизбежно приведёт к созданию
Эта статья рассматривает популярное мнение о том, что увеличение размера языковых моделей (LLM) неизбежно приведёт к созданию искусственного общего интеллекта (AGI). Авторы оспаривают это мнение. Авторы предлагают рассматривать развитие AI как "лестницу общности", где LLM — лишь очередная ступень. Они подчеркивают, что исторически AI-сообщество плохо предсказывало будущие прорывы и их последствия. В целом, статья призывает к более скептическому и реалистичному взгляду на перспективы масштабирования языковых моделей и их потенциал в достижении AGI.

В статье рассматриваются основы позиционного кодирования в трансформерах, объясняя, как синусоидальные функции вводят информа
В статье рассматриваются основы позиционного кодирования в трансформерах, объясняя, как синусоидальные функции вводят информацию о позициях токенов, что помогает моделям распознавать порядок элементов в последовательности. Обсуждаются различные методы позиционного кодирования, включая обучаемые векторы и роторные кодировки, которые улучшают обработку длинных контекстов.

Aвторы представляют аксиоматическую систему для точного определения и количественной оценки эффектов запоминания и контекстно
Aвторы представляют аксиоматическую систему для точного определения и количественной оценки эффектов запоминания и контекстного рассуждения в больших языковых моделях (LLM). Они разделяют эффекты запоминания на базовые и хаотические, а эффекты контекстного рассуждения - на усиленные, устраненные и обращенные. Эта система позволяет точно разложить доверительные оценки модели на эффекты запоминания и рассуждения. https://arxiv.org/pdf/2405.11880

Фреймворк TextGrad обеспечивает автоматическое дифференцирование через обратное распространение на текстовой обратной связи,
Фреймворк TextGrad обеспечивает автоматическое дифференцирование через обратное распространение на текстовой обратной связи, предоставляемой LLM. Этот подход улучшает отдельные компоненты и помогает оптимизировать вычислительный граф с использованием естественного языка без настройки подсказок или компонентов. TextGrad утверждает, что в сочетании с GPT4o достигает лучших результатов на задачах LeetCodeHard и демонстрирует SOTA-производительность на GPQA. https://arxiv.org/abs/2406.07496v1

Статья охватывает темы создания 3D модели солнечной системы на Python с использованием Matplotlib, включая представление точе
Статья охватывает темы создания 3D модели солнечной системы на Python с использованием Matplotlib, включая представление точек и векторов в 3D, создание классoв, а также добавление визуализации и эффектов гравитации.

В статье представлен новый оптимизатор Adam-mini, который значительно сокращает использование памяти за счет уменьшения числа
В статье представлен новый оптимизатор Adam-mini, который значительно сокращает использование памяти за счет уменьшения числа скоростей обучения и превосходит AdamW, эффективно работая на моделях размером от 125M до 7B параметров для предварительного обучения, самонастройки и обучения с подкреплением. https://arxiv.org/abs/2406.16793

В статье исследуют методы эффективного обучения больших языковых моделей, акцентируя внимание на Ask-LLM и сэмплирование по п
В статье исследуют методы эффективного обучения больших языковых моделей, акцентируя внимание на Ask-LLM и сэмплирование по плотности. Исследование показывает, что эти подходы позволяют достичь высокой точности модели при сокращении до 90% данных и ускорении сходимости до 70%. https://arxiv.org/pdf/2402.09668

Geometric Algebra Transformer (GATr) - универсальная архитектура для работы с различными формами геометрических данных с учет
Geometric Algebra Transformer (GATr) - универсальная архитектура для работы с различными формами геометрических данных с учетом их симметрий, использующая проективную геометрическую алгебру для эффективного представления. GATr демонстрирует превосходство над другими базовыми моделями в задачах моделирования взаимодействия тел, оценки сдвига стенок артерий и планирования движений роботов, улучшая точность, эффективность работы с данными и масштабируемость. https://arxiv.org/pdf/2305.18415

https://vpnand.com/?ref=92 Наши друзья создали VPN. Рекомендуем. Скачивайте.