DataSciencePRO
Open in Telegram
Все нужное и полезное из мира дата сатанистов)
Show more754
Subscribers
No data24 hours
-17 days
-330 days
Posts Archive
Дата сайентисты vs аналитики
Работаю я аналитиком данных, а училась на data scientist. Почему же я не пошла сразу в дата сайнтисты? Ответ прост – туда очень сложно пробиться и нужно много знать, а еще иметь уже готовый опыт какого-нибудь проекта для компании. А где его взять? У меня были учебные проекты и они не плохи, но для оффера – “хотелось бы хоть один реальный проект”, как сказала мне одна эйчар. Есть варианты стажировок, но я не могу позволить себе терять в з/пл, да и берут туда в основном выпускников вузов. Кстати, если вы один из них – стажировки – это вообще бомба для вас и реальный шанс.
Так вот, для себя я выбрала путь – через аналитику. Сейчас я практикую Питон, SQL, возможно позже придумаю какой-нибудь DS проект для компании, и тогда буду дальше пробиваться на позиции data scientist. Есть еще вариант, что мне захочется углубиться в анализ (есть разные направления) и я отложу науку о данных. Все возможно. Заходи и узнаешь
https://t.me/analysts_world
Repost from Программирование | книги
#DataScience 2021
Руководство по подготовке к Data Science интервью
Автор: Р. Алимбеков
Наука о данных (data science) — раздел информатики, изучающий проблемы анализа, обработки и представления данных в цифровой форме. Объединяет методы по обработке данных в условиях больших объёмов и высокого уровня параллелизма, статистические методы, методы интеллектуального анализа данных и приложения искусственного интеллекта для работы с данными, а также методы проектирования и разработки баз данных.
Это практическое руководство, которое поможет вам успешно пройти собеседование по классическому машинному обучению. Книга содержит образцы теоретических вопросов, задаваемых на собеседовании по позиции Data Science.
Что вы получите:
-️ 6 глав, охватывающих самые разные темы: статистика и теория вероятности, машинное обучение с учителем, алгоритм градиентного спуска и лосс функция.
-️ 77 вопросов для подготовки к собеседованию
-️ Полезные ссылки и репозитории для подготовки
СКАЧАТЬ 🗂Repost from Полка Разработчика
📖 SQL for Data Analysis: Advanced Techniques for Transforming Data into Insights
Автор: Cathy Tanimura, 2021
Описание: Вы узнаете, как использовать основной функционал SQL, такой как: соединения, оконные функции, подзапросы и регулярные выражения новыми, способами. Также, Вы узнаете как комбинировать методы SQL для более быстрого достижения ваших целей с помощью простых запросов. Если вы работаете с базами данных этот справочник поможет Вам в выполнении Ваших задач.
• Скачать книгу из архива
• Стоимость в магазине
📚 Полка Разработчика | #ENG #SQL
Repost from Топор+
Второй и третий мониторы больше не нужны.
Техноблогер показал технологию Passthrough очков Meta Quest Pro, которая позволяет создать виртуальные рабочие столы, полностью синхронизированные с компьютером.
Цена шайтан-приблуды — 1500 долларов (94 тысячи рублей), продажи начнутся 25 октября.
👉 Топор +18. Подписаться
Repost from Машинное обучение. Книги по программированию
Hands-On Data Analysis with Pandas
Автор: Stefanie Molin
Год издания: 2019
Рецензия на книгу:
Книга научит вас анализировать данные и извлекать из них ценные сведения, а также познакомит с основами машинного обучения.
Плюсы:
1. Читателям предлагается использовать реальные наборы данных
2. Вы научитесь пользоваться библиотками Python для data science, такими как pandas, NumPy, matplotlib, seaborn и scikit-learn.
Минусы: не замечено.
#data_science #python #pandas #english
Скачать книгу
Repost from Книжный клад | IT
📕 Python. Визуализация данных. Matplotlib. Seaborn. Mayavi
Автор: Абдрахманов М. И, 2020
Описание: В этой книге будут рассмотрены вопросы визуализации данных, а именно построение линейных и ступенчатых графиков, диаграмм рассеяния, столбчатых и круговых диаграмм, гистограмм и 3D графиков. Большое внимание уделено настройке внешнего вида графиков, их элементам и компоновке.
• Скачать книгу из архива
• Стоимость в магазине
📚 Книжный клад | #Python
Repost from Анализ данных (Data analysis)
🧹 Как почистить данные, не удаляя лишние знаки
➡️ Читать дальше
@data_analysis_ml
Repost from Анализ данных (Data analysis)
✔️ Продвинутая работа с большими объемами данных
Как часто вы сталкиваетесь с необходимостью выгрузить в MS Excel более миллиона строк? Все фильтры на выгрузку уже были наложены ранее, но, увы, она до сих пор «не проходит по габаритам». Перед нами встает дилемма – делить, или … воспользоваться готовыми решениями для python, не изучая python!
Речь сегодня пойдет о трех библиотеках, которые позволяют писать код и при этом не писать его, а также оперировать внушительными объемами данных с минимальными знаниями английского языка или синтаксиса пресловутых «панд» (здесь и далее «панды»: pandas – open-source библиотека для python для работы с табличными данными – прим. автора). Для примера будем использовать объявления о продаже автомобилей Toyota с известного сайта.
Первая библиотека, с которой хотелось бы Вас познакомить – Bamboolib. Не секрет, что панды питаются бамбуком, и, как за всякое пропитание, за него нужно платить. Да, у Bamboolib есть платная версия, в которой реализована поддержка Apache Spark, а также есть возможность использовать свои внутренние библиотеки и нет ограничения по плагинам, в остальном же достаточно бесплатной версии.
➡️ Читать дальше
@data_analysis_ml
Repost from Data Science | Machinelearning [ru]
Подготовка датасета для машинного обучения: 10 базовых способов совершенствования данных
У Колумбийского университета есть хорошая история о плохих данных. Проект в сфере здравоохранения был нацелен на снижение затрат на лечение пациентов с пневмонией. В нём использовалось машинное обучение (machine learning, ML) для автоматической сортировки записей пациентов, чтобы выбрать тех, у кого опасность смертельного исхода минимальна (они могут принимать антибиотики дома), и тех, у кого опасность смертельного исхода высока (их нужно лечить в больнице). Команда разработчиков использовала исторические данные из клиник, а алгоритм был точным.
Читать...
Repost from C.M.Book | Программирование
📚 Книга "Регулярные выражения"
Автор книги: Фридл Дж.
Год издания: 2018
Описание: Международный бестселлер знакомит с фундаментальными основами регулярных выражений, функциональными возможностями языков программирования и позволяет оптимизировать работу с информацией. Вы научитесь самостоятельно конструировать регулярные выражения и использовать приведенные в книге примеры для быстрого решения самых актуальных задач.
Скачать книгу
Repost from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
15 нейросетей в один Telegram-бот: история успеха и реализация помощника для создателей контента.
https://habr.com/ru/post/690922/
Repost from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Даункастинг в Pandas для эффективного использования памяти.
https://itnext.io/storing-pandas-data-frames-efficiently-in-python-cff669953485
Repost from Анализ данных (Data analysis)
✔️ PANDAS VS SQL для работы с данными.
Еще порядка 10 лет назад для работы по исследованию данных было достаточно SQL как инструмента для выборки данных и формирования отчетов по ним. Но время не стоит на месте, и примерно в 2012 году стала стремительно набирать популярность Python-библиотека Pandas. И вот сегодня уже сложно представить работу Data Scientist’а без данного модуля.
Не буду подробно углубляться в то, что предоставляют из себя оба инструмента ввиду их популярности среди аналитиков и исследователей данных, но небольшую справку все-таки оставим:
Итак, SQL (язык структурированных запросов — от англ. Structed Query Language) — это декларативный язык программирования, применяемый для получения и обработки данных с помощью создания запросов внешне похожих по синтаксису на предложения, написанные на английском языке.
Pandas — это модуль для обработки и анализа данных в табличном формате и формате временн́ых рядов на языке Python. Библиотека работает поверх математического модуля более низкого уровня NumPy. Название модуля происходит от эконометрического понятия «панельные данные» (или как его еще называют «лонгитюдные данные» — это данные, которые состоят из повторяющихся наблюдений одних и тех же выбранных единиц, при этом наблюдения производятся в последовательные периоды времени).
➡️ Читать дальше
@data_analysis_ml
Repost from Python Expert | Программирование
Курс по NumPy для начинающих // #Видео
NumPy - один из самых фундаментальных пакетов в Python - универсальный пакет для обработки массивов. Он предоставляет высокопроизводительные объекты многомерных массивов и инструменты для работы с массивами. NumPy - это эффективный контейнер универсальных многомерных данных.
▪️Перейти к просмотру [13 уроков]
Python Expert | Программирование
Repost from DATApedia | Data science
🤖 Numpy, Pandas, matplotlib – необходимый минимум для старта в Machine Learning
Источник
