DataFrog: Data Science
Open in Telegram
Журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks Мы отбираем самые лучшие посты на тему DS и ML из других телеграм каналов и сайтов и публикуем у себя. @viktorreh
Show more2 379
Subscribers
No data24 hours
-97 days
-5330 days
Posts Archive
В OpenAI заявили, что больше не поддерживают принцип открытого кода
Разбираемся, что с этим решением не так и почему компания изменила своим первоначальным принципам.
😻 #read
Про Nested Cross-Validation
Это самая дорогая из "классических" схем валидации. Состоит из двух вложенных кросс-валидаций: внешней и внутренней. Внутренняя используется для подбора гипер-параметров/выбора модели, а внешняя - для оценки модели.
😻 #read
ChatGPT запустили на старом компьютере IBM, работающем из-под MS-DOS
Энтузиаст и фанат ретро-компьютеров Йо Кхэн Мэ запустил ChatGPT на старом IBM 5155, который вышел аж в 1984 году. Это оказалось проще, чем зайти в ChatGPT из России.
😻 #read
(НЕ) парадокс Дней Рождения
Факт: если дана группа из 23 или более человек, то вероятность того, что хотя бы у двух из них дни рождения совпадут, превышает 50%. Доказываем вместе.
😻 #read
Python и анализ данных
Автор: Уэс Маккинни
Год издания: 2020
#python #ds #ru #книга
Скачать книгу
Как настроить pandas под себя
Pandas идет в комплекте с набором настраиваемых опций и параметров. Они могут отлично повысить продуктивность. Вот полезная ссылка на документацию.
Как настроить pandas под себя
😻 #pandas
t-тест
1) Объясняем что это
2) Разбираем общую идею
3) Показываем пример
😍 #test
Китайские исследовали сделали систему, которая помогает читателю с незнакомыми словами
Даже те, кто хорошо знает английский, спотыкаются при чтении: не хватает словарного запаса. Для решения проблемы резерчеры из Университета Цинхуа придумали систему, которая наблюдает за тем, как пользователь читает текст, и подсказывает значение незнакомых слов.
Для оценки системы участников попросили прочитать слова из теста на определение уровня словарного запаса, и система определила незнакомые для них слова с точностью 98,09%. Общая эффективность системы, конечно, зависела от контекста и качества веб-камеры, но результаты, тем не менее, радуют.
😻 #read
Python для сложных задач
Автор: Дж. Уандер Плас
Год издания: 2018
#python #ds #ru #книга
Скачать книгу
Один многорукий бандит против всех А/Б-тестов
Благодаря тестам, продукт можно улучшить, избежать боли пользователей и сделать почти идеально. Мы уже немного говорили про А/Б-тестирование. А теперь ныряем глубже и посмотрим, чем умные аналитики могут заменить обычный АВ.
😻 #read
Модели экспоненциального сглаживания, и какие они бывают
Пройдемся во верхам, не углубляясь в математику. Поможет освежить в памяти тем, кто знал, и познакомиться с темой тем, кто только начинает изучение.
😻 #time_series
Большой гайд по optuna
Optuna — это фреймворк для для автоматизированного поиска оптимальных гиперпараметров. Знакомимся с ней ближе.
😻 #train
tqdm в pandas
Если применить apply к большому датафрейму, на это может уйти много времени, но сложно сказать, сколько именно. В таких ситуациях хочется научиться как-то отслеживать прогресс. Чтобы это сделать, можно использовать tqdm.
Для этого сначала установим/обновим бибилиотеку:
pip install tqdm
pip install tqdm -U
Затем испортируем tqdm и применяем вместо обычного apply функцию progressapply. Работает она точно так же, только еще показывает прогресс-бар:
`df = pd.DataFrame(np.random.randint(0, 100, (1000000, 100)))
tqdm.pandas(desc="power DataFrame 1M x 100 of random int!")
df.progressapply(lambda x: x2)
df.groupby(0)1.count().progressapply(lambda x: x**2)
`
Кстати, еще можно менять формат бара через опцию barformat. Например:
tqdm.pandas(desc="MyBar", bar_format='{desc:<5.5}{percentage:3.0f}%|{bar:50}{r_bar}')
😻 #numpy_pandas #pandas