Градиентное погружение
Open in Telegram
Обсуждаем новости, рассказываем про ML с кодом и колабом, выигрываем соревы 🏆 Контакты: @Cucu_LaPraline, @Cene655
Show moreThe country is not specifiedTechnologies & Applications21 231
4 492
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
PIP - за ним история
Эта утилита сыгравшая одну из ключевых ролей в популяризации питона - представьте себе, когда-то для установки пакета необходимо было скачать zip (который находился не в PYPI), распаковать и запустить setup.. бр..
При этом были такие проблемы как глобальная установка пакета, т.е. если вы писали два разных приложения на одной машине, то явно испытывали неудобства.
С эволюцией питона как такого произошли изменения и в pip, появился удобный PYPI, pipenv, requirements.txt.
Хотя в целом остались некоторые проблемы: версионирование кода(1) и неоднозначность инсталла(2)
(1) Недостаточно сделать lib==2.0.1, за ним будут тянутся куча других либ с не всегда теме же версиями (lib2 >= 1.67.1)
(2) На первый взгляд может показаться, что либа весит пару мегабайт, но может внутри себя инсталлить что-то значительное большее (10мб, 100мб, etc)
Хотя и это частично решается - Pipfile/Pipfile.lock (json, учитывает зависимости и хеши), а pipenv гарантирует повторяемость сборок(под конкретную версию питона)
@gradientdip
Это было краткое содержание, полное видео тут
Repost from DLStories
Мнение компаний о том, какие бизнес-задачи выполняет ИИ, и что в реальности сегодня он делает — сильно отличаются.
ИТ-компания Naumen опросила свыше 1,5 тыс. представителей российского бизнеса из различных отраслей и написала этот пост — ожидания от роботов 🤖 в бизнесе VS реальность.
1️⃣ Рутина и однообразие
Ожидание:
80% опрошенных компаний считают, что самые подходящие задачи для робота — простые и рутинные. Например, фиксация нарушений.
Реальность:
На самом деле искусственный интеллект не так часто используют для подобных процессов. Технологии компьютерного зрения фиксируют нарушения требований пожарной безопасности или охраны труда в 14% российских компаний. В 10% — эти технологии выполняют функцию контроля качества выпускаемой продукции. Ещё в 7% организаций ИИ помогает составлять и проверять документацию.
2️⃣ Опасный труд
Ожидание:
54% компаний считает, что роботы активно помогают людям на опасных или труднодоступных объектах.
Реальность:
Это мнение близко к истине. Свыше 20% организаций используют беспилотный транспорт для разведки новых месторождений и добычи полезных ископаемых. В 15% компаний беспилотники диагностируют поломку оборудования в труднодоступных местах. Например, отыскивают повреждения трубопровода. Ещё у 11% технология помогает контролировать состояние промышленных объектов.
3️⃣ Человеческий капитал
Ожидание:
24% компаний уверены — искусственный интеллект легко справится с отбором и предварительным собеседованием кандидатов на массовые вакансии. Ещё 22% считают, что роботы могут оценить эффективность персонала. Например, по анализу взаимодействия сотрудников на корпоративных порталах.
Реальность:
Мимо 🙈. Ни одна из опрошенных компаний не рассказала об использовании искусственного интеллекта в подборе персонала или управлении им. В этой области есть лишь единичные кейсы.
4️⃣ Клиентское обслуживание
Ожидание:
17% компаний думают, что роботы отлично справятся с консультированием клиентов.
Реальность:
Это действительно так. Если брать по всем отраслям в целом, голосовые и чат-боты есть у 8% компаний. Но если смотреть на отрасли, где, как правило, технологически продвинутые контакт-центры — ритейл, страховые и банки, ситуация меняется. В этих сегментах ИИ обслуживает клиентов каждой пятой компании.
На своём канале «Охотники за цифровизацией» эксперты Naumen продолжают рассуждения на тему использования технологий в бизнесе: читайте, какие цели российские компании ставят перед цифровой трансформацией и чего фактически добились.
Чтобы не пропустить новые исследования и кейсы по использованию ИИ в бизнесе, подписывайтесь на канал компании:
@naumen_channel
#промо
Coursera - всё
4 июня окончательно закрывается доступ к контенту от российских вузов, ведущих индустриальных компаний.
ВК и ВШЭ в скором времени представит платформу которая должна стать заменой. Естественно с плюшками (по их словам, это все не реклама и не призыв): возможность переноса специальностей и прогресса, возобновление обучения и 3К на обучение в 2022.
@gradientdip
В целом неплохо, подробнее тут
🔥 IMAGEN получил обновление
👉 Добавил динамический порог, кеширование (ускорил генерацию) и T5 на 3B параметров (как часть архитектуры)
💪 Прикрепил немного примеров IMAGEN:
1. A photo of funny cat
2. A red cube on top of blue cube
3. A face
4. A teddy bear in times square
5. A photo of teddy bear
Потыкать код
Сгенерировать
@gradientdip
Repost from AI для Всех
Посмотрите какая интереснейшая находка! Оказывается Dall-E 2 придумала свой собственный язык.
Мы можем сгенерировать картинку "Два кита разговаривают о еде, с субтитрами". получаем изображение с текстом "Wa ch zod rea". Используем полученный текст ("Wa ch zod rea") в качестве промпта и получаем изображения всякой морской еды. По-видимому, киты действительно говорят о еде на языке DALLE-2.
Ещё больше примеров тут. За наводку спасибо Just Links.
Repost from Derp Learning
"Художники смотрят на генерации в нейросетках, 2020, 2021, 2022"
@monkeyinlaw, DALL-E 2, 2022.
Repost from Dan Okhlopkov - канал
А вот и awesome-parsing: набор полезных ссылок на тулы, сайты, best practices. #парсинг
🔗 https://github.com/reanalytics-databoutique/webscraping-open-project
🔥 Победили в хаке "Цифровой прорыв"
За два дня нашли аномалии в базах вылова и переработки продуктов, было больно, но мы справились.
🤞 Что сделали? Статистики, руберт, катбуст и lstm + streamlit.
Что было наиболее неудобным? Время мск + 7(Хабаровск), при этом вся тима из разных городов.
В итоге заняли с командой 2 место и залутали 200к на 5-ых 😋. Через неделю собираемся еще в один хак залететь, теперь уже по NLP ⚡️
Ну а вот ещё пост сокомандника
Repost from shonenkov AI
"картина маслом - портрет красивой девушки" / "The painting with oil is a portrait of a beautiful girl."
боты с генерациями: https://discord.gg/xV7dNbT9NU
@shonenkovAI
Вот несколько примеров того, что я сегодня сгенерировал с помощью imagen. Сейчас ещё тренирую.
@gradientdip
Repost from Love. Death. Transformers.
#чтивонаночь
Очень крутая штука от huggingface - accelerate, позволяет встраивать multi gpu tensor parallel training в обычные torch скрипты и не думать.
Blogpost
I Don't Like Notebooks
Прошло 4 года с момента выступления Джоэла Граса на JupyterCon 2018, но несмотря на это, его преза до сир пор ощущается живой и актуальной за счет веселых мемов и приятной подачи.
Просто выделите немного времени, расслабьтесь и пролистайте слайды, вам понравится.
Преза
Выступление
🔥 IMAGEN уже в коде
— Пока все мусолят тему крутости новой модельки над DALLE 2, а разрабы создают чатики для реализации архитектуры, один из админов за ночь справился с задачей.
📎 Прикрепили генерации модельки, обученной с нуля за пару часов на P100 и небольшом сете.
Градиентное погружение
👉 Лайк, Шер, Звёздочка
Гитхаб
Попробовать ❤️
Про IMAGEN
Бесплатно и в облаке - ʎzy 💥
👉 ʎzy(лизи) - это система для запуска произвольного python кода в облаке, которая в ближайшее время станет open-source.
Зачем❔
1️⃣ Для контроля и оптимизации доставки данных
2️⃣ Масштабирование - ускорение существующего кода с использованием облачных ресурсов
3️⃣ Хранения результатов экспериментов
Отдельно заинтересовала возможность запуска вычислений катбуста. Как? Да очень просто
model.fit(data, labels, provisioning=Provisioning(gpu=Gpu.any()))⚡️ После публикации в open-source можно будет взять terraform скрипты и поднять лизи у себя в приватном облаке, при необходимости. Ну и также: автоматический перенос зависимостей и минимальное изменение кода. ↘️ Сейчас идет Бетка, в private preview бесплатно доступны NVidia Tesla V100 GPU, скоро будет добавлен доступ к A100. Попробовать Послушать доклад Взглянуть на презу Обратная связь(Чатик)
Repost from Love. Death. Transformers.
Никто не просил, никто не ждал, но я наконец доделал и выложил самый(вероятно) быстрый captioning на русском языке.
Модель основанная на работе CLIP prefix caption, обучена на ruCOCO на 2*1080ti и выложена
Алсо моделька умеет в ZS и при должном promt может решать простенькие VQA задачки
github
hf 🤗
HFspaces🤗
collab 🔮
Лайк шер звездочка ✨
🔥 Мы сделали DALLE2
Ну или почти.
👉 Месяц работы, море потраченных нервов и арендованный сервер - совместно с автором Love. Death. Transformers. у нас получилось сделать dalle2-decoder, способный декодировать эмбеддинги клипа.
Как обычно, всё опен сурс на гитхабе.
Лайк, репост, звездочка ⚡️
Repost from Борис опять
https://github.com/connorferster/handcalcs
Python --> Latex
Выглядит бомбически
Repost from Градиент обреченный
DIY. Делаем книги
🌗 Продолжаю экспериментировать с созданием параллельных книг на иностранных языках. Повозился на майских праздниках с библиотекой weasyprint, чтобы сверстать выровненную при помощи моего хобби-проекта книгу в PDF.
Очень кропотливое занятие, которое, однако можно автоматизировать. На выходе получается вот такая замечательная книга.
🌗 Выравнивание идет при помощи LaBSE, которая обучалась на 100+ языках, можно дообучать и на другие, более редкие языки (про это можно почитать тут). Пока что можно сделать себе книжку в html.
Github
Визуализация аудитории
Сделал небольшой парсер участников канала в телеге.
Беру все доступные описания и закидываю в модель, подаю в PCA и сжимаю до вектора из 2-х элементов, ручками выбираю кол-во кластеров и строю график.
Теперь про график:
Красные - всякие ссылки каналы
Темные - DS/ML/универы
Зеленые - словосочетания и предложения
Ну и те, что в центре - что-то между всеми остальными.
Пока делал всё это, задумался о том, сколько данных мы теряем - начиная от сжатия и заканчивая кластеризацией.
Ведь действительно, для сжатия мы подаем N-мерные вектора, которые схлопываются в 2-мерные и именно по 2-мерным мы делаем кластеризацию.
Ок, давай подавать N-мерные, в чем проблема?
Проблема в том, что тогда у кластеров не будет четкой границы и понимать график станет куда сложнее.
Этим постом я хотел вернуть нас к пониманию того, что объяснять ML довольно сложно. Почему? Потому что мы не всегда имеем полное представление о данных.
Код для визуализации
