Ссылки для дрессировщиков нейронных сетей
Open in Telegram
Сюда выкладываем полезные ссылки и информацию по нейросетям
Show more1 157
Subscribers
No data24 hours
-57 days
-630 days
Posts Archive
Repost from Machinelearning
📂 An Open-source Framework for Autonomous Language Agents
Agents is carefully engineered to support important features including planning, memory, tool usage, multi-agent communication, and fine-grained symbolic control.
Agents - это библиотека/фреймворк с открытым исходным кодом для создания автономных языковых агентов.
Библиотека тщательно продумана и поддерживает такие важные функции, как долгую краткосрочную память , использование продвинутых ии-инструментов, веб-навигацию, мультиагентное взаимодействие, а также совершенно новые возможности, включая взаимодействие человека и агента и символьное управление.
pip install ai-agents
🖥 Github: https://github.com/aiwaves-cn/agents
📕 Paper: https://arxiv.org/pdf/2309.07870.pdf
⏩ Demo: https://github.com/aiwaves-cn/agents#web-demos
⭐️ Project: http://www.aiwaves-agents.com/
ai_machinelearning_big_dataRepost from Анализ данных (Data analysis)
🔥 Дайджест полезных материалов из мира : Data Science за неделю
Почитать:
— Руководство по масштабированию MLOps
— Data больше не Big: как данные перестали быть большими и почему это полезно для бизнеса
— Что нового в Pandas 2.1
— Готовые скрипты Python
— Machine Learning: хорошая подборка книг для начинающего специалиста
— Как понять, что клиента пора реактивировать?
— Data Vendor Lock-In and Web3
— Mastering Data Preparation for Your Dream Data Job: Using Job Postings Data
— Matplotlib Tutorial #7: Plot Color Customization
— 10 NoSQL databases available as alternatives to MongoDB
— Data Science in Human Resources: Talent Acquisition and Retention
— Explain the Central Limit Theorem in Data Science with Python?
— Ultimate Guide: Best Books for Data Science with Ratings for All Levels
— Professional literature as a way to improve your analytics skills
— Top 10 Online Courses to Learn ChatGPT in 2023
— Matplotlib Tutorial #6: Plot Line Customization
Посмотреть:
🌐 Streamlit LLM Hackathon (⏱ 03:27)
🌐 Полный курс по библиотеке Numpy. Матрицы (⏱ 11:24)
🌐 Python+SQL работа с базами данных. (⏱ 11:10)
🌐 Полный курс по библиотеке Numpy. Полезные функции (⏱ 11:05)
🌐 Полный курс по библиотеке Numpy. Применение Numpy (⏱ 11:52)
🌐 Полный курс по библиотеке Numpy. Создание матриц из файла (⏱ 15:55)
🌐 Python Атоматизация отправки email с selenium (⏱ 04:59)
🌐 Полный курс по библиотеке Numpy. Продвинутые методы работы с матрицами (⏱ 07:28)
🌐 Python анализ данных с Pandas. (⏱ 17:04)
🌐 Lightning Interview “Beyond the Code: How AI Is Disrupting the Programmer's Role” (⏱ 58:40)
🌐 Уроки Golang с нуля /#26 - Обработка ошибок (⏱ 08:14)
🌐 Introduction to Generative Art with Stable Diffusion, presented by HP Inc - Hunter Kempf (⏱ 43:48)
🌐 Emerging Approaches to AI Governance: Tech-Led vs Policy-Led - Ilana Golbin (⏱ 44:36)
🌐 Wow, NVIDIA’s Rendering, But 10X Faster! (⏱ 06:58)
Хорошего дня!
@data_analysis_ml
Repost from Machinelearning
🔥Master Data Science for free
Вторая большая подборка бесплатных курсов для получения степени в области Data Science.
📂 Computer Science 101
https://online.stanford.edu/courses/soe-ycscs101-computer-science-101
📂 Machine Learning Specialization
https://coursera.org/specializations/machine-learning-introduction
📂 Artificial Intelligence for Robotics
https://udacity.com/course/artificial-intelligence-for-robotics--cs373
📂 Designing Your Career
https://online.stanford.edu/courses/tds-y0003-designing-your-career
📂 Stanford: Теория игр
https://online.stanford.edu/courses/soe-ycs0002-game-theory
📂 Machine Learning with Python
https://www.freecodecamp.org/learn/machine-learning-with-python/
📂 Probability and Statistics: To P or Not To P? (Coursera)
https://www.coursera.org/learn/probability-statistics
📂 Numpy полный бесплатный курс
https://www.youtube.com/playlist?list=PLysMDSbb9Hcz3Gdi9oV-btohZ9zhths-r
📂Углубленное машинное обучение
https://www.kaggle.com/learn/intro-to-machine-learning
📂 Stat 110: Harvard University (YouTube)
https://www.youtube.com/watch?v=KbB0FjPg0mw&list=PL2SOU6wwxB0uwwH80KTQ6ht66KWxbzTIo&index=1
📂 The Open Source Data Science Masters
https://github.com/datasciencemasters/go
📂 Google - искусственный интеллект для всех
https://edx.org/learn/artificial-intelligence/google-google-ai-for-anyone
📂Microsoft - ИИ для начинающих
https://microsoft.github.io/AI-For-Beginners
📂 IBM - AI for Everyone: Освоить основы
https://edx.org/learn/artificial-intelligence/ibm-ai-for-everyone-master-the-basics
📂 Гарвард - Введение в искусственный интеллект с помощью Python
https://cs50.harvard.edu/ai/2023
📂 Введение в генеративный ИИ
https://cloudskillsboost.google/journeys/118
📂 Deep Learning - Finetuning Large Language Models
https://deeplearning.ai/short-courses/finetuning-large-language-models/
📂Microsoft - Основы ИИ в Azure
https://learn.microsoft.com/en-us/training/paths/create-no-code-predictive-models-azure-machine-learning/
📂Linux Foundation - Основы работы с данными и искусственным интеллектом
https://edx.org/learn/computer-programming/the-linux-foundation-data-and-ai-fundamentals
📂12 linux курсов:
https://t.me/linuxkalii/538
📂 Alison - 13 бесплатных курсов по ИИ
https://alison.com/tag/artificial-intelligence
📂 Проекты по искусственному интеллекту
https://mygreatlearning.com/academy/learn-for-free/courses/artificial-intelligence-projects
📂 Introduction to Internet of Things:
https://online.stanford.edu/courses/xee100-introduction-internet-things
📂 Graph Search, Shortest Paths, and Data Structures
https://coursera.org/learn/algorithms-graphs-data-structures
📂 Python:
http://cs50.harvard.edu/python/2022/
📂 Machine Learning:
http://developers.google.com/machine-learning/crash-course
📂 Deep Learning
http://introtodeeplearning.com
📂 Data Analysis
http://pll.harvard.edu/course/data-analysis-life-sciences-4-high-dimensional-data-analysis
📂 Линейная Алгебра
http://pll.harvard.edu/course/data-analysis-life-sciences-2-introduction-linear-models-and-matrix-algebra
📂 Algebra basics
https://www.khanacademy.org/math/algebra-basics
📂 Excel и PowerBI
http://learn.microsoft.com/training/paths/modern-analytics/
📂 Визуализация данных:
http://pll.harvard.edu/course/data-science-visualization
📂 PowerBI
http://learn.microsoft.com/users/collinschedler-0717/collections/m14nt4rdwnwp04
📂 Tableau:
http://tableau.com/learn/training
📂 Statistics:
http://cognitiveclass.ai/courses/statistics-101…
📂 SQL:
http://online.stanford.edu/courses/soe-ydatabases0005-databases-relational-databases-and-sql
ai_machinelearning_big_data
Repost from [PYTHON:TODAY]
🔥 Полезные библиотеки Python
Emotion-recognition — Python модуль позволяющий распознавать лица и классифицировать эмоции на видео.
Установка:
$ git clone https://github.com/omar-aymen/Emotion-recognition.git $ cd Emotion-recognition/ $ pip install -r requirements.txtЗапуск:
$ python real_time_video.py⚙️ GitHub/Инструкция #soft #code #python #github
Repost from Анализ данных (Data analysis)
🚀 Список лучших Data Science шпаргалок
🔸Статистика - https://res.cloudinary.com/dyd911kmh/image/upload/v1662111933/Marketing/Blog/Descriptive_Statistics_Cheat_Sheet.pdf
🔸Теория вероятностей - https://res.cloudinary.com/dyd911kmh/image/upload/v1674822557/Marketing/Blog/Probability_Cheat_Sheet.pdf
🔸Data storytelling - https://res.cloudinary.com/dyd911kmh/image/upload/v1662633286/Marketing/Blog/Data_Storytelling_Cheat_Sheet.pdf
🔸Data Visualization - https://s3.amazonaws.com/assets.datacamp.com/email/other/Data+Visualizations+-+DataCamp.pdf
🔸Machine Learning - https://s3.amazonaws.com/assets.datacamp.com/email/other/ML+Cheat+Sheet_2.pdf
🔸Deep Learning - https://github.com/afshinea/stanford-cs-229-machine-learning/blob/master/en/cheatsheet-deep-learning.pdf
🔸Big Data - https://github.com/Ritik2703/Data-Science-Cheat-Notes-/blob/master/Big%20Data/Hadoop-and-mapreduce-cheat-sheet.pdf
🔸NLP - https://cheatography.com/sree017/cheat-sheets/nlp/
🔸SQL - https://s3.amazonaws.com/assets.datacamp.com/email/other/SQL+for+Data+Science.pdf
🔸Python - https://res.cloudinary.com/dyd911kmh/image/upload/v1673614153/Marketing/Blog/Python_Cheat_Sheet_for_Beginners.pdf
🔸R Programming - https://res.cloudinary.com/dyd911kmh/image/upload/v1654763044/Marketing/Blog/R_Cheat_Sheet.pdf
🔸Plotly Express - https://res.cloudinary.com/dyd911kmh/image/upload/v1668605954/Marketing/Blog/Plotly_Cheat_Sheet.pdf
🔸Git - https://res.cloudinary.com/dyd911kmh/image/upload/v1656573882/Marketing/Blog/git_cheat_sheet.pdf
🔸Excel - https://res.cloudinary.com/dyd911kmh/image/upload/v1674225421/Marketing/Blog/Excel_Cheat_Sheet.pdf
🔸Tableau - https://s3.amazonaws.com/assets.datacamp.com/email/other/Tableau+Cheat+Sheet.pdf
🔸Power BI - https://s3.amazonaws.com/assets.datacamp.com/email/other/Power+BI_Cheat+Sheet.pdf
@data_analysis_ml
Repost from Анализ данных (Data analysis)
🔝Лучшие GitHub репозитории для изучения MLOps.
#️⃣ MLOps-Basics
#️⃣ MLOps-Guide
#️⃣ Awesome MLOps
#️⃣ Awesome MLOps - Tools
#️⃣ DTU MLOps
#️⃣ MLOps Course
@data_analysis_ml
Repost from Data Secrets
Свершилось! Завезли Code Llama
Meta вчера представила Code Llama – модель для работы с кодом. Есть три версии: основная, для Python и с акцентом на исполнение инструкций. Заявляется как SOTA среди опенсорс-моделей.
Ах да, самое вкусное: модель полностью открытая и бесплатная. Ну разве не новое слово в индустрии программирования?
🖥 Код
🖥 Веса
📖 Статья
🌿 Блог-пост
😻 #news
Repost from Анализ данных (Data analysis)
☝️Низкое качество #данных может привести к неверным выводам и плохой работе модели.
pandera предоставляет гибкий и удобный API для выполнения проверки данных на объектах типа
dataframe, чтобы сделать конвейеры обработки данных более читаемыми и надежными.
▪Github
▪Документация
@data_analysis_mlПопробовал ГигаЧат от Сбера. Пишет простенький код нормально с комментариями. https://developers.sber.ru/gigachat
MusicGen: простое и управляемое создание музыки
Мы решаем задачу условной генерации музыки. Мы представляем MusicGen, единую языковую модель (LM), которая оперирует несколькими потоками сжатого дискретного представления музыки, то есть токенами. В отличие от предыдущих разработок, MusicGen состоит из одноступенчатого преобразователя LM вместе с эффективными шаблонами чередования токенов, что устраняет необходимость каскадирования нескольких моделей, например, иерархически или с повышением дискретизации. Следуя этому подходу, мы демонстрируем, как MusicGen может генерировать высококачественные сэмплы, опираясь при этом на текстовое описание или мелодические особенности, что позволяет лучше контролировать генерируемый результат. Мы проводим обширную эмпирическую оценку, рассматривая как автоматические, так и человеческие исследования, показывающие, что предлагаемый подход превосходит оцененные исходные показатели стандартного теста преобразования текста в музыку. Благодаря исследованиям абляции мы пролили свет на важность каждого из компонентов, входящих в состав MusicGen. Образцы музыки можно найти в дополнительных материалах. Код и модели доступны в нашем репозитории github.com/facebookresearch/audiocraft.
https://ai.honu.io/papers/musicgen/
Repost from Анализ данных (Data analysis)
🚀Petals
Petals — это фреймворк, который позволяет дата сайентистам совместно запускать большие языковые модели.
Вы загружаете небольшую часть модели, а затем объединяетесь с людьми, обслуживающими другие части, для проведения вычислений или файнтюнига.
Инструмент позволяет генерировать текст с помощью LLaMA-65B или BLOOM-176B, и настраивать их для своих собственных задач.
Работает под GNU/Linux, macOS и Windows с WSL2.
Возможность подключить свой графический процессор, для увеличение мощности Petals.
▪Github
▪Colab
▪Статья
@data_analysis_ml
Repost from Анализ данных (Data analysis)
🤖 Список полезных нейросетей для датасаентита:
• Amazon CodeWhisperer -сервиc, который помогает создавать приложения с помощью ии-помошника по написанию кода с поддержкой ML.
• Stenography - Автоматическое документирование кода.
• tabnine -Крутой сервис для автозаполнение кода.
Помогает автоматически дописывать функции на
Генерирует блоки кода на основе комментариев на естественном языке.
• GPT Engineer - генерация кода с помощью ИИ.
• Code Mentor - оптимизирует и рефакторит код.
• Polycoder - Генерирует код на 12 языках программирования.
• Cogram - переводит текстовый запрос на язык баз данных и интегрируется со средой разработки Jupyter.
• Copilot by GitHub - облегчает написание кода через автодополнение.
• CodeT5 - преобразовывает запрос в код и дописывает начатые функции.
• Ghostwriter - ИИ- программист с искусственным интеллектом для генерации кода.
• Agent GPT - устанавливает в вашем браузере ИИ-агента, который помогает в выполнении поставленной задачи.
• Mintlify - ИИ, который пишет документацию и комментарии.
• ExplainDev - инструмент, который обучает в процессе и помогает разобраться в коде.
@data_analysis_ml
Repost from Анализ данных (Data analysis)
📌 7 пакетов Python для анализа и форматирования вашего кода.
PEP 8 - это набор рекомендаций по написанию чистого, читабельного и последовательного кода на языке Python.
• isort — Python-библиотека и плагины для различных редакторов, позволяющие быстро сортировать все импортируемые файлы.
• black — это библиотека для автоматического форматирования вашего Python кода, в соответствии с требованиями PEP8.
• flake8 — это инструмент линтинга для Python, который проверяет код Python на наличие ошибок, проблем со стилем и сложностью. Библиотека Flake8 построена на базе трех инструментов: PyFlakes - проверяет код Python на наличие ошибок. McCabe - проверяет код Python на сложность. pycodestyle - проверяет кодовую базу Python на проблемы со стилем в соответствии с PEP8..
• interrogate — interrogate проверяет ваш код на наличие отсутствующих строк документации (docstrings).
• Whispers — это инструмент анализа кода, предназначенный для разбора различных распространенных форматов данных в поисках жестко закодированных учетных данных и опасных функций. Whispers может работать в CLI или интегрироваться в конвейер CI/CD.
• hardcodes — это утилита поиска и редактирования кода.
• pylint — Pylint анализирует ваш код без его запуска. Инструмент проверяет наличие ошибок и выдает рекомендации по его рефакторингу.
@data_analysis_ml
Repost from Анализ данных (Data analysis)
📌 10 лучших пакетов AutoML Python для автоматизации задач машинного обучения
1. Pandas Profiling
(изображение 1.)
2. Snorkel
(изображение 2.)
3. MLBox
(изображение 3.)
4. H20
5. TPOT
(изображение 4.)
6. Autokeras
7. Ludwig
(изображение 5.)
8. AutoGluon
9. Neural Network Intelligence
10. AutoGL
@data_analysis_ml
Repost from Анализ данных (Data analysis)
📎 Открытые датасеты 📎
🔵 Labelled Faces in the Wild. 13 тысяч размеченных изображений лиц.
🔵 IMF Data. Датасеты о финансах и ценах на товары.
🔵 Google Trends. Данные о поисковой статистике и трендовых запросах.
🔵 xView. Большой набор воздушных снимков Земли с аннотациями.
🔵 World Bank Open Data. Наборы данных о демографии и экономических показателях.
🔵 Labelme. Большой датасет с уже размеченными изображениями.
🔵 HotspotQA Dataset . Датасет с вопросами-ответами для генерации ответов на часто задаваемые простые вопросы.
🔵 Berkeley DeepDrive BDD100k. Тысячи часов вождения для обучения автопилотов.
🔵 MIMIC-III. Обезличенные медицинские данные пациентов.
🔵 CREMA-D — датасет для распознавания эмоций по записи голоса.
@data_analysis_ml
Repost from Анализ данных (Data analysis)
🗂 10 библиотек Python для автоматического разведочного анализа данных
• Разведочный анализ данных (EDA) является важнейшим шагом в разработке модели Data science и исследовании наборов данных. EDA включает в себя изучение, анализ и обобщение фундаментальных характеристик наборов данных для получения представления о внутренней информации, содержащейся в них.
• Известные библиотеки Python для автоматизированного EDA:
1. D-Tale
D-Tale – это библиотека Python, которая предоставляет интерактивный и удобный интерфейс для визуализации и анализа данных.
2. Pandas-profiling
Pandas-Profiling – позволяет автоматизировать первичный анализ данных и, тем самым, значительно его упростить и ускорить.
3. Sweetviz
Sweetviz – это библиотека Python с открытым исходным кодом, которая генерирует отчеты с удобной визуализацией для выполнения EDA с помощью всего двух строк кода. Библиотека позволяет быстро создать подробный отчет по всем характеристикам набора данных без особых усилий. В возможности Sweetviz также входит целевой анализ, сравнение двух датасетов, сравнение двух частей датасета, выделенных по определенному признаку, выявление корреляций и ассоциаций, также sweetviz создает позволяет создавать и сохранять отчет как HTML файл.
4. Autoviz
AutoViz – это библиотека Python, предоставляющая возможности автоматической визуализации данных, позволяющая визуализировать наборы данных любого размера всего одной строкой кода.
5. dataprep
DataPrep – это библиотека Python с открытым исходным кодом, которая предоставляет функциональные возможности для анализа, подготовки и обработки данных. Она построена поверх Pandas и Dask DataFrame, что делает её легко интегрируемым интсрументом с другими библиотеками Python.
6. KLib
KLib – это библиотека Python, которая предоставляет возможности автоматического разведочного анализа данных (EDA) и профилирования данных. Она предлагает различные функции и визуализации для быстрого изучения и анализа наборов данных. KLib помогает упростить процесс EDA и сделать его более удобным.
7. dabl
Dabl Dabl - поможет визуализировать данные за одну строчу кода. Обычно ML-специалисты используют matplotlib для визуализации, строя нужны графики один за другим. В Dabl вызов одного метода построит целый набор диаграмм.
8. speedML
SpeedML – это библиотека Python, целью которой является ускорение процесса разработки конвейера машинного обучения.
9. Sketch
Sketch— это новая библиотека, которая использует возможности ИИ, чтобы помочь вам понять ваши dataframes pandas, используя вопросы на естественном языке непосредственно в Jupyter.
10. Bamboolib
Bamboolib - это библиотека Python, которая предоставляет компонент пользовательского интерфейса для анализа данных без кода в Jupyter. Одним из вариантов её использования является написание кода для функций, создание которых занимает много времени. Bamboolib предназначена для упрощения обычных задач обработки данных, исследования и визуализации и может использоваться как начинающими, так и опытными аналитиками данны
▪ Подробнее
@data_analysis_ml
Repost from Анализ данных (Data analysis)
Модель нейросети Kandinsky 2.2 стала частью самого крупного и авторитетного в сфере ИИ фреймворка Diffusers на ресурсе Huggingface.
Diffusers - это агрегатор открытых генеративных моделей, работающих на принципе диффузии. Сегодня этот фреймворк используют многие популярные ИИ-сервисы, инструменты и библиотеки: DreamFusion, Segment Anything, ML Stable Diffusion (by Apple), Invoke AI ( всего более 3000 решений).
Также Kandinsky 2.2 вошел в список популярных моделей в основном репозитории Diffusers на GitHub.
@data_analysis_ml
Repost from Анализ данных (Data analysis)
🖥 balance: a python package for balancing biased data samples
Пакет balance python - это удобный инструмент для работы со смещенными выборками данных.
Обеспечивает полный рабочий процесс: анализа смещений в данных, получения весов для балансировки данных, оценки качества весов и получения взвешенных оценок.
python -m pip install git+https://github.com/bbalasub1/glmnet_python.git@1.0
Мы начинаем с загрузки данных и их корректировки:
from balance import load_data, Sample
# load simulated example data
target_df, sample_df = load_data()
# Import sample and target data into a Sample object
sample = Sample.from_frame(sample_df, outcome_columns=["happiness"])
target = Sample.from_frame(target_df)
# Set the target to be the target of sample
sample_with_target = sample.set_target(target)
# Check basic diagnostics of sample vs target before adjusting:
# sample_with_target.covars().plot()
# Using ipw to fit survey weights
adjusted = sample_with_target.adjust()
print(adjusted.summary())
# Covar ASMD reduction: 62.3%, design effect: 2.249
# Covar ASMD (7 variables):0.335 -> 0.126
# Model performance: Model proportion deviance explained: 0.174
adjusted.covars().plot(library = "seaborn", dist_type = "kde")
▪Github
▪Примеры с кодом
▪Статья
▪Проект
@data_analysis_ml