fa
Feedback
Data Mining | Анализ данных🚀

Data Mining | Анализ данных🚀

رفتن به کانال در Telegram

• Купить рекламу: t.me/sahib_space Админ: sahib_space • Стоимость: https://www.notion.so/sahibspace/69ece414a4af49f2bdbdfe455e553e58?pvs=3&qid= • Группа в ВК: vk.com/datamining.team

نمایش بیشتر
3 366
مشترکین
اطلاعاتی وجود ندارد24 ساعت
-87 روز
-3530 روز
آرشیو پست ها
Три трека по AI на хакатоне от МТС и 500 000 рублей за первое место. Для тех, кто готов воплотить идею в прототип Приглашаем
Три трека по AI на хакатоне от МТС и 500 000 рублей за первое место. Для тех, кто готов воплотить идею в прототип Приглашаем на хакатон МТС True Tech Hack 2025. Протестируй свои идеи и внеси вклад в продукты, которые приносят пользу разработчикам по всей России. На хакатоне ты сможешь: — Выбрать один из пяти треков и создать решение на базе ИТ-платформ МТС. — Побороться за призовой фонд — 1 500 000 рублей. — Расширить свои профессиональные связи через нетворкинг с участниками хакатона и экспертами МТС. — Повысить шансы на прохождение стажировки в МТС. — Узнать больше о продуктах и технологиях МТС от экспертов компании. Хакатон будет проходить с 17 по 25 апреля. Регистрация открыта до 16 апреля. https://truetechhack.ru/

Для балансировки нагрузки используется Nginx upstream, который проксирует WebSocket-соединения на различные реплики и разрыва
Для балансировки нагрузки используется Nginx upstream, который проксирует WebSocket-соединения на различные реплики и разрывает соединение через 15 минут неактивности. Реплики сохраняют историю переписки в Redis, обеспечивая восстановление контекста, а управление репликами осуществляется через PM2. https://habr.com/ru/articles/896222/

ODS — это открытый поисковый агент, интегрирующийся с большими языковыми моделями для выполнения поисковых и аналитических за
ODS — это открытый поисковый агент, интегрирующийся с большими языковыми моделями для выполнения поисковых и аналитических задач. ODS с DeepSeek-R1 демонстрирует на 9,7% большую точность по сравнению с GPT-4o-Search. https://arxiv.org/abs/2503.20201

В версии 0.30.0 библиотеки huggingface_hub добавлена поддержка Xet — нового протокола для хранения крупных моделей и датасето
В версии 0.30.0 библиотеки huggingface_hub добавлена поддержка Xet — нового протокола для хранения крупных моделей и датасетов, который заменяет Git LFS. Также улучшены инструменты инференса, добавлена поддержка новых провайдеров и асинхронных вызовов для задач, таких как text-to-video. https://github.com/huggingface/huggingface_hub/releases/tag/v0.30.0

Auto Deep Research — это доступный и эффективный AI-ассистент для исследователей, предлагающий высокую производительность и о
Auto Deep Research — это доступный и эффективный AI-ассистент для исследователей, предлагающий высокую производительность и открытый исходный код. Система легко интегрируется с различными моделями и предоставляет простоту использования без сложных настроек. https://github.com/HKUDS/AutoAgent

Cache-Augmented Generation улучшает генерацию текста, заранее загружая все необходимые данные в контекст модели и используя к
Cache-Augmented Generation улучшает генерацию текста, заранее загружая все необходимые данные в контекст модели и используя кеширование параметров, что снижает задержки и ошибки извлечения. Этот подход упрощает архитектуру и ускоряет процесс, но ограничен длиной контекстного окна и объемом загружаемых данных. https://github.com/hhhuang/CAG

Автор делится опытом создания Telegram-бота на Python с использованием webhook, объясняя преимущества этого метода по сравнен
Автор делится опытом создания Telegram-бота на Python с использованием webhook, объясняя преимущества этого метода по сравнению с polling, так как webhook обеспечивает мгновенную реакцию на действия пользователей. Он также подчеркивает важность минимального использования внешних библиотек, чтобы код оставался простым и понятным, особенно в процессе изучения языка. https://habr.com/ru/companies/digitalleague/articles/716760/

EasyR1 — фреймворк для обучения с подкреплением, поддерживающий мультимодальные данные. Он улучшает производительность на 5%
EasyR1 — фреймворк для обучения с подкреплением, поддерживающий мультимодальные данные. Он улучшает производительность на 5% за 30 шагов и предлагает масштабируемость и интеграцию с различными RL-алгоритмами. https://github.com/hiyouga/EasyR1

Методика SWE-RL использует reinforcement learning (RL) на данных об эволюции ПО из репозиториев GitHub для улучшения логическ
Методика SWE-RL использует reinforcement learning (RL) на данных об эволюции ПО из репозиториев GitHub для улучшения логического мышления языковых моделей. Это позволяет моделям, как Llama3-SWE-RL, не только решать задачи программирования, но и показывать улучшенные результаты в функциональном программировании и NLP. https://arxiv.org/pdf/2502.18449

LADDER — фреймворк от Tufa Labs, который помогает языковым моделям решать сложные задачи, разбивая их на простые шаги. Модели
LADDER — фреймворк от Tufa Labs, который помогает языковым моделям решать сложные задачи, разбивая их на простые шаги. Модели, такие как Qwen2.5, с помощью LADDER достигли рекордных результатов, например, 90% точности на тесте MIT Integration Bee. https://arxiv.org/pdf/2503.00735

EuroBERT — это семейство мультиязычных энкодеров, обученных на 5 трлн токенов из 15 языков, включая русский, с поддержкой кон
EuroBERT — это семейство мультиязычных энкодеров, обученных на 5 трлн токенов из 15 языков, включая русский, с поддержкой контекста до 8192 токенов. Модель демонстрирует выдающуюся эффективность в задачах анализа документов, поиска информации, работы с кодом и математическими задачами, превосходя аналоги по точности на 10-15%. https://huggingface.co/blog/EuroBERT/release

Napkin AI — это сервис, который автоматически преобразует текст в визуальные схемы, диаграммы и инфографику, упрощая представ
Napkin AI — это сервис, который автоматически преобразует текст в визуальные схемы, диаграммы и инфографику, упрощая представление информации. Он находится в стадии бета-тестирования и доступен бесплатно, что дает отличную возможность опробовать сервис и интегрировать его в свой рабочий процесс. http://app.napkin.ai/

Mistral выпустили многоязычный, мультимодальный 24B LLM с производительностью SOTA с контекстом 128K и лицензией Apache 2.0 О
Mistral выпустили многоязычный, мультимодальный 24B LLM с производительностью SOTA с контекстом 128K и лицензией Apache 2.0 Она поддерживает инференс 150 токенов в секунду и подходит для устройств с ограниченными ресурсами, таких как RTX 4090 или Mac с 32 ГБ ОЗУ, идеально подходя для задач NLP, включая чат-ботов и анализ текста. https://huggingface.co/mistralai/Mistral-Small-3.1-24B-Instruct-2503

Llama-3_3-Nemotron-Super-49B-v1 — мощная языковая модель от NVIDIA с 49 миллиардами параметров, оптимизированная для сложных
Llama-3_3-Nemotron-Super-49B-v1 — мощная языковая модель от NVIDIA с 49 миллиардами параметров, оптимизированная для сложных задач NLP. Она использует фреймворки NeMo и TensorRT для ускорения вычислений на GPU, обеспечивая высокую производительность и масштабируемость для корпоративных приложений. https://huggingface.co/nvidia/Llama-3_3-Nemotron-Super-49B-v1

Статья объясняет, как создать Mini-App-приложение для Telegram, охватывая как фронтенд, так и бэкенд части. Рассматриваются п
Статья объясняет, как создать Mini-App-приложение для Telegram, охватывая как фронтенд, так и бэкенд части. Рассматриваются примеры простых приложений и решений для бизнеса, а также процесс разработки и развертывания приложения на сервере. https://habr.com/ru/companies/timeweb/articles/887974/

Парсинг — это процесс автоматического извлечения информации из текстовых источников, особенно с веб-ресурсов, с использование
Парсинг — это процесс автоматического извлечения информации из текстовых источников, особенно с веб-ресурсов, с использованием HTTP-запросов и внешних библиотек для обработки HTML. В Python можно создавать парсеры для различных типов данных, включая HTML, XML и текст, а также разрабатывать библиотеки вручную, используя низкоуровневые методы. https://habr.com/ru/companies/timeweb/articles/877596/

ИИ для кодинга ускоряет разработку, автоматизируя рутинную работу, что позволяет сосредоточиться на архитектуре и логике. Одн
ИИ для кодинга ускоряет разработку, автоматизируя рутинную работу, что позволяет сосредоточиться на архитектуре и логике. Однако из-за множества существующих проектов разобраться, какая нейросеть лучше, становится сложной задачей, требующей анализа разных ИИ-инструментов. https://habr.com/ru/companies/timeweb/articles/893798/

UPFT улучшает рассуждения LLM, обучая модель на минимальных префиксах (8 токенов) без меток данных или сэмплинга, достигая эф
UPFT улучшает рассуждения LLM, обучая модель на минимальных префиксах (8 токенов) без меток данных или сэмплинга, достигая эффективности supervised методов при снижении затрат на 75% по времени и 99% по стоимости. Этот подход сохраняет знания модели и значительно ускоряет процесс обучения. https://arxiv.org/pdf/2503.02875

Мультимодальные языковые модели объединяют текст, изображения, аудио и видео в единое векторное пространство, что позволяет э
Мультимодальные языковые модели объединяют текст, изображения, аудио и видео в единое векторное пространство, что позволяет эффективно обрабатывать различные виды данных одновременно. Эти модели могут решать задачи, недоступные традиционным текстовым системам, такие как ответы на вопросы по изображениям или преобразование аудио в текст с учетом контекста. https://habr.com/ru/articles/892172/

Исследование предлагает новую постобработочную рамочную структуру LoGoFair для достижения как локальной, так и глобальной спр
Исследование предлагает новую постобработочную рамочную структуру LoGoFair для достижения как локальной, так и глобальной справедливости в федерированном обучении, решая ключевые проблемы статистической гетерогенности и достижения справедливости при модели, не зависящей от конкретных характеристик. https://arxiv.org/pdf/2503.17231