en
Feedback
Data Mining | Анализ данных🚀

Data Mining | Анализ данных🚀

Open in Telegram

• Купить рекламу: t.me/sahib_space Админ: sahib_space • Стоимость: https://www.notion.so/sahibspace/69ece414a4af49f2bdbdfe455e553e58?pvs=3&qid= • Группа в ВК: vk.com/datamining.team

Show more
3 366
Subscribers
No data24 hours
-87 days
-3530 days
Posts Archive
Исследование включает создание синтетических задач, адаптацию моделей к специализированным данным, и сравнение эффективности
Исследование включает создание синтетических задач, адаптацию моделей к специализированным данным, и сравнение эффективности с другими методами самонастройки и обучения моделей. https://arxiv.org/pdf/2402.18334

Исследование изучает законы масштабирования в моделях плотного поиска, исследуя, как производительность моделей зависит от их
Исследование изучает законы масштабирования в моделях плотного поиска, исследуя, как производительность моделей зависит от их размера и объема аннотированных данных. Используя контрастную лог-правдоподобие (contrastive log-likelihood) в качестве метрики, авторы обнаружили, что производительность моделей следует закону мощности относительно числа параметров модели и объема аннотаций. Исследование подчеркивает важность понимания эффектов масштабирования и предлагает рекомендации по оптимизации распределения ресурсов. https://arxiv.org/pdf/2403.18684

Освещены темы: векторные представления слов, их преобразование в предсказания, механизмы внимания и прямого распространения в
Освещены темы: векторные представления слов, их преобразование в предсказания, механизмы внимания и прямого распространения в нейронных сетях, процесс обучения языковых моделей https://seantrott.substack.com/p/large-language-models-explained

https://vpnand.com/?ref=92 Наши друзья создали VPN. Рекомендуем. Скачивайте.

стажеры такие:
стажеры такие:

Cтатья охватывает методы плотного поиска информации, используя модели с плотным представлением (на основе трансформеров). Рас
Cтатья охватывает методы плотного поиска информации, используя модели с плотным представлением (на основе трансформеров). Рассматривается использование bi-encoder для обучения моделей, минимизирующих расстояние между семантически близкими объектами. Также обсуждаются методы тройных потерь и использование техник псевдо-разметки и дистилляции знаний для улучшения результатов плотного поиска. https://medium.com/@aikho/deep-learning-in-information-retrieval-part-ii-dense-retrieval-1f9fecb47de9

Статья объясняет процесс токенизации в больших языковых моделях (LLMs). Токены представляют собой дискретные компоненты, на к
Статья объясняет процесс токенизации в больших языковых моделях (LLMs). Токены представляют собой дискретные компоненты, на которые разбивается последовательность для обучения модели. Особое внимание уделено субсловной токенизации, которая разбивает слова на подстроки, учитывая морфологические особенности языка. Обсуждаются преимущества такого подхода перед классическими методами токенизации слов или символов и его влияние на способность моделей понимать и генерировать текст.

Статья рассматривает применение алгоритмов на графах для кластеризации товаров на сайте Ozon, что помогает улучшать поиск и с
Статья рассматривает применение алгоритмов на графах для кластеризации товаров на сайте Ozon, что помогает улучшать поиск и сравнение предложений для пользователей. Особое внимание уделено методам выделения сообществ и анализу структуры сети товаров для оптимизации матчинга.

Mеханистическое проектирование гибридных архитектур глубокого обучения через методику MAD, охватывающую синтетические задачи
Mеханистическое проектирование гибридных архитектур глубокого обучения через методику MAD, охватывающую синтетические задачи манипуляции токенами. Мне приглянулось исследование того, как перплексия изменяется в зависимости от размера состояния. Под "размером состояния" понимается история KV для трансформеров или латентные переменные состояния для вариантов SSM/RNN. Мы получаем чистое степенное масштабирование в пределах данного класса архитектур, но нет общей границы Парето, на которой находились бы все варианты. link

В статье описаны способы использования хэш-функций для эффективного поиска и сравнения объектов, а также обсуждаются связи ме
В статье описаны способы использования хэш-функций для эффективного поиска и сравнения объектов, а также обсуждаются связи между хэшируемостью, неизменностью и равенством объектов. Примеры с кодом и иллюстрации помогают понять, как работают хэшируемые объекты и их роль в словарях Python.

"Speculative Streaming" — метод ускоренного декодирования языковых моделей, который интегрирует draft modeling в целевую моде
"Speculative Streaming" — метод ускоренного декодирования языковых моделей, который интегрирует draft modeling в целевую модель, улучшая скорость вывода на 1.8-3.1 р. в суммаризации и структурированныx запросax, при использовании значительно меньшего числа параметров, чем архитектуры типа Medusa. Eсли вы собираетесь получить proposal distribution из вашей целевой модели без (существенного) увеличения числа параметров, это кажется разумным способом. link

Разработчик делится жизненными уроками за 35 лет работы с ПО. Сюда входит: делать вещи проще, выпускать обновления почаще, строить крепкие связи с коллегами, не бояться новых задач и помнить, что программы постоянно меняются, так что лучше делать полезные улучшения, а не стремиться к идеалу. https://dev.jimgrey.net/2024/07/03/lessons-learned-in-35-years-of-making-software/

каждый уважающий себя работяга как минимум 1 раз на новом месте:
каждый уважающий себя работяга как минимум 1 раз на новом месте:

Статья охватывает темы: тип данных bytes в Python, разницу между строками и байтами, основы кодировки ASCII и необходимость б
Статья охватывает темы: тип данных bytes в Python, разницу между строками и байтами, основы кодировки ASCII и необходимость более сложных кодировок, таких как UTF-8. Также рассматривается, как UTF-8 кодирует символы и примеры с использованием различных языков и символов.

Исследуются методы генерации наборов данных, которые точно отражают статистические свойства наблюдений. Оценивается полезност
Исследуются методы генерации наборов данных, которые точно отражают статистические свойства наблюдений. Оценивается полезность синтетических наборов данных для прогнозирования способности Dark Energy Spectroscopic Instrument ограничивать возможные ошибки измерений барионных акустических осцилляций.

Описаны опции создания пустого словаря, передача отображения (например, другого словаря), передача итерируемого объекта пар и
Описаны опции создания пустого словаря, передача отображения (например, другого словаря), передача итерируемого объекта пар и использование именованных аргументов в качестве ключей и значений. Также обсуждается возможность комбинирования этих методов при создании словаря.

Исследование рассматривает метод самообучения ReSTEM для расширения возможностей языковых моделей за счёт использования обрат
Исследование рассматривает метод самообучения ReSTEM для расширения возможностей языковых моделей за счёт использования обратной связи в задачах, где доступен числовой ответ, например, в математических задачах. Авторы демонстрируют, что ReSTEM значительно улучшает производительность моделей по сравнению с обычной настройкой на данных, созданных людьми, подчёркивая потенциал снижения зависимости от человеческих данных.

Lessons from 35 Years of Software Development: В статье делятся жизненными уроками за 35 лет работы с программным обеспечением. Сюда входит: делать вещи проще, выпускать обновления почаще, строить крепкие связи с коллегами, не бояться новых задач и помнить, что программы постоянно меняются, так что лучше делать полезные улучшения, а не стремиться к идеалу.

Йошуа Бенгио рассказывает о рисках работы с большими языковыми моделями, как, например, когда модель придумывает ответы, которые звучат правдоподобно, но на самом деле неверны. Он предлагает способ борьбы с этим — улучшать тексты и модели шаг за шагом, чтобы избежать таких ошибок. Подробнее👇 https://yoshuabengio.org/2024/07/09/reasoning-through-arguments-against-taking-ai-safety-seriously/