Data Mining | Анализ данных🚀
Open in Telegram
• Купить рекламу: t.me/sahib_space Админ: sahib_space • Стоимость: https://www.notion.so/sahibspace/69ece414a4af49f2bdbdfe455e553e58?pvs=3&qid= • Группа в ВК: vk.com/datamining.team
Show more3 366
Subscribers
No data24 hours
-87 days
-3530 days
Posts Archive
Статья предлагает использование трансформеров (T) в контексте RL с механизмами внимания (A), что улучшает эффективность ГМ, минимизируя вычислительные расходы через оптимизацию векторных представлений (e).
Такой подход усиливает обучение на малых выборках, балансируя сложность архитектуры и ресурсные затраты.
https://arxiv.org/abs/2411.09591
Статья представляет метод SG-Mixed применяет техники машинного обучения для повышения эффективности ГМ, комбинируя различные стратегии обучения с ограничениями на векторные представления.
Этот подход улучшает точность генерации при ограниченных данных, снижая вычислительные затраты.
https://arxiv.org/abs/2411.09678
Прокачивайте скилы на релевантных бизнес-задачах с помощью Яндекс Практикума. Наставники из Яндекса и других крупных компаний помогут со сложными темами, а ревьюеры дадут обратную связь.
Как всё устроено:
1️⃣ Учитесь где и когда удобно
Обучение разбито на спринты по несколько недель, а график позволяет совмещать учёбу с другими делами.
2️⃣ Практика с первого дня
Учимся на примерах из работы и используем популярные рабочие инструменты.
3️⃣ Задачи из реальных сфер
На курсе будут проекты из разных сфер бизнеса, чтобы вы набрались опыта и сразу же применяли новые знания.
Прежде чем платить, любой курс можно попробовать и убедиться, что он вам подходит.
Вот несколько наших курсов:
✅ Инженер данных
✅ Инженер машинного обучения
✅ SQL для работы с данными и аналитики
✅ SQL для разработки
Получите скидку 20% после прохождения первой темы любого курса. Она бесплатная🔥
Статья раскрывает оптимизацию RAG через интеграцию ГБД, улучшая семантическое извлечение и контекстуализацию для LLM, что снижает галлюцинации.
Архитектурные подходы, включая кластеризацию и схемы, усиливают точность и осведомленность моделей в специфических доменах.
https://arxiv.org/abs/2411.09702
Статья объясняет архитектуру энкодер-декодер и как она разделяет процесс кодирования, декодирования информации для улучшения производительности в задачах с последовательными данными.
https://medium.com/@vipra_singh/llm-architectures-explained-encoder-decoder-architecture-part-4-b96ace71394c
В статье описываются ключевые принципы создания устойчивых ETL пайплайнов для обработки данных, акцентируя внимание на автоматизации, масштабируемости и обработке ошибок.
Также рассматриваются лучшие практики для интеграции различных инструментов и обеспечения качества данных в процессе анализа и ML.
https://www.kdnuggets.com/developing-robust-etl-pipelines-for-data-science-projects
Статья знакомит с новым Python-менеджером пакетов, который призван улучшить работу с зависимостями и ускорить процесс разработки за счет оптимизированной архитектуры.
Инструмент предлагает решение для быстрого обновления пакетов и эффективного управления проектами, снижая сложность интеграции сторонних библиотек.
https://www.kdnuggets.com/new-python-package-manager
Пять шпаргалок в DS, которые обобщают ключевые концепции и инструменты в области DS, ML статистики.
Эти ресурсы помогают быстро освоить основные методы и алгоритмы, необходимые для успешного старта в сфере данных.
https://www.kdnuggets.com/5-cheat-sheets-getting-started-data-science
Статья рассказывает о том, как DS используется в социальных проектах для решения глобальных проблем, таких как экология, здравоохранение и образование.
Приводятся примеры реальных инициатив, где аналитика данных помогает организациям повысить свою эффективность и достичь позитивных изменений в обществе.
https://www.kdnuggets.com/data-science-for-social-good-real-world-projects-making-a-difference
Статья о том, как GraphRAG улучшает традиционный метод RAG, интегрируя графы знаний с большими языковыми моделями, что позволяет более точно и контекстуализированно извлекать информацию для генерации ответов.
Автор описывает различные архитектуры GraphRAG, а также трудности, связанные с построением и поддержанием графов знаний.
https://gradientflow.substack.com/p/graphrag-design-patterns-challenges
Статья описывает концепцию GraphRAG, объединяющая графы знаний с методами RAG для улучшения поиска и генерации ответов на основе структурированных данных.
Это позволяет моделям, таким как LLM, эффективно обрабатывать сложные и специализированные запросы, улучшая точность ответов.
https://www.kdnuggets.com/an-introduction-to-graph-rag
Статья охватывает методы обучения машинных моделей без использования меток данных, включая обучение без учителя, самообучение и генеративные модели.
Эти подходы минимизируют зависимость от размеченных наборов данных и находят применение в задачах кластеризации, обработки изображений и текстов.
https://habr.com/ru/amp/publications/842444/
Статья описывает методы обучения с использованием SVM, включая классификацию и регрессию.
Она объясняет основные параметры моделей SVM, их применение для линейных и нелинейных данных, а также методы оптимизации и выбора гиперпараметров для улучшения точности модели.
https://scikit-learn.ru/stable/modules/svm.html
📌 Статья представляет основные библиотеки Python для машинного обучения, включая NumPy, Pandas, Scikit-learn, XGBoost, LightGBM и CatBoost.
Также упоминаются библиотеки для нейросетей (PyTorch, TensorFlow) и обработки данных (NLTK, OpenCV).
От экспертов даны рекомендации для начинающих по последовательности шагов в изучении машинного обучения.
⚡️Статья описывает процесс создания датасета для ML, начиная с сбора данных через краудсорсинг и заканчивая их очисткой и аннотированием.
Особое внимание уделяется рекомендациям по увеличению объема данных, балансировке классов и соблюдению этических норм.
🤩Разбор регуляризации в глубоком обучении, подробно рассматривая компромисс между bias и variance для предотвращения переобучения и недообучения.
🩶Авторы охватывают различные методы регуляризации, включая L1, L2, Elastic Net, а также техники, такие как отсев, нормализация по батчам и аугментация данных, предоставляя обширный обзор для эффективного построения устойчивых моделей глубокого обучения.
https://theaisummer.com/regularization/
🖇 Статья вводит в N-shot и zero-shot learning с использованием Python, обсуждая вызовы обучения сложных моделей на больших наборах данных и то, как трансферное обучение может
🫧 Предоставляет примеры применения zero-shot learning для задач классификации текста и распознавания именованных сущностей (NER) с использованием модели TARS. Также рассматривается one-shot learning с использованием Siamese Networks и набора данных MNIST в Keras.
🔖Акцент делается на демонстрации того, как эти техники предоставляют решения в сценариях с ограниченным или отсутствующим размеченным объемом данных.
🔵В статье рассматриваются потенциальные области применения, процессы прогнозирования и валидации, шаги по построению и обучению forest-based forecast, выявление выбросов во временных рядах, результаты работы инструмента, оптимальные методы и ограничения.
😑В статье рассматриваются темы, такие как исследование шаблонов пропущенных данных, выбор вспомогательных переменных, определение количества восполнений.
😠 Статья отвечает на вопросы о видах механизмов пропущенных данных, шагах множественного восполнения, значимости вспомогательных переменных и соображениях при выборе количества восполнений.
✅Статья представляет обзор описательной статистики для распределений производительности. В ней рассматриваются такие аспекты, как центральная тенденция, квантильные оценки, скользящие квантильные оценки, вариация, плотность распределения, мультимодальность, теория экстремальных значений.
https://habr.com/ru/companies/jugru/articles/722342/
