Бигдатый маркетинг
Open in Telegram
Канал о том, на что способны большие данные в маркетинге. Кейсы, разборы, новости, инструкции — красиво и человеческим языком 💙 Рубрикатор: #какэтоделать #инструкции #чеклист #новости #кейс #разбор #исследование #ворлдвайд
Show moreThe country is not specifiedThe category is not specified
2 190
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
2 190
😱Каждый день генерируется 2,5 квинтиллиона байт данных (это очень много), а многие компании даже не знают, как вычленить из этих данных инсайты! Ситуацию, когда компании не успевают обработать данные, тогда как новые продолжают поступать, называют усталостью от данных (data fatigue).
Например, это часто случается в компаниях, которые не заморачиваются с качеством сбора данных. Данные собираются беспорядочно и не стандартизируются. Например, по оценкам Forbes, только 46% специалистов используют инструменты для очистки своих данных, прежде чем они попадут в их базу!
🤔У проблемы усталости от данных пока нет решения, но один из рабочих советов — хотя бы тщательно фильтровать и очищать данные, прежде чем пытаться с ними работать.
2 190
🚲Изобретать велосипеды никто не любит, в том числе и специалисты по машинному обучению. Чтобы не обучать модели много раз на похожих данных, исследователи используют так называемое трансферное обучение (transfer learning).
💡 Идея простая: есть несколько больших открытых наборов данных, на которых ученые обучают и тестируют алгоритмы. Эти датасеты обычно очень разношерстные: в известном Imagenet 1000 классов, куда одновременно входят фотографии мартышек, линеек и чашек с кофе. Если обучить алгоритм на таком наборе данных, то он, скорее всего, неплохо справится и с задачей попроще (например, если надо отличить фото кошки от фото собаки).
Обычно делают так: берут предобученную модель, немного ее поднастраивают и дообучают на нужном наборе данных (этот процесс называется fine-tune). Таких предобученных моделей в свободном доступе полно, в том числе и для разных задач. Так, дообучение занимает сильно меньше времени, а точность модели обычно получается выше, чем при обучении с нуля и «влоб»
2 190
🕺🏻Сегодня пятница, и по традиции предлагаю вспомнить, что интересного произошло на этой неделе:
🚝Ученые из Центра компетенций НТИ «Искусственный интеллект» на базе МФТИ создали систему на основе ИИ для оптимизации движения железнодорожного транспорта. В ее основе нейросеть, которая учитывает в режиме реального времени местоположение каждого поезда и около 30 дополнительных параметров.
👮♂️В России собираются ввести уголовную ответственность за продажу украденных персональных данных. В разработке соответствующего законопроекта активно участвует Роскомнадзор (РКН). Минцифры также предлагает наказывать и компании, из которых произошли утечки — штрафы могут достигать 1% от оборота компании.
🚘В автомобилях Honda появится ИИ для оценки когнитивных способностей водителя. Система будет анализировать мозговую деятельность, движения глаз и другие параметры водителя с помощью различных датчиков и технологий МРТ. Например, если ИИ заметит, что в поле зрения водителя не попал пешеход, водителя предупредят.
⚖️В России появится специальная Комиссия по этике в сфере ИИ. В Национальную комиссию по этике в сфере ИИ были избраны руководители ИТ-компаний, профессоры институтов и научно-исследовательских организаций.
🛑В Роскомнадзоре признали факт ограничений VPN-сервисов. Председатель комитета Госдумы по информационной политике Александр Хинштейн сообщил, что в России уже заблокировано около 20 популярных сервисов VPN, и РКН намерен продолжить эту работу.
🚫Облачная среда Google Colab для работы с кодом запретит использовать платформу для генерации дипфейков. Google Colab предоставляет доступ к графическим процессорам (GPU), необходимых для обучения нейронных сетей. Многие открытые алгоритмы для генерации дипфейков были как раз выложены в Google Colab.
🤖73% HR менеджеров используют ИИ в своей работе. Большинство опрошенных также заявили, что планируют увеличить использование ИИ в течение 12-18 месяцев. Из проблем HR работники отмечают сложности с интеграцией в существующие системы, убеждении в том, что ИИ не может принимать лучшие решения, чем люди и отсутствие конфиденциальности данных.
2 190
👤В Московской области внедряют систему распознавания силуэтов
Московская область и два других региона (какие именно, не сообщается) вводят в эксплуатацию платформу видеоаналитики NtechLab, которая умеет распознавать силуэты. Цель проекта — отследить загруженность и обеспечить безопасность объектов. К данным будут иметь доступ оперативные службы и адвокаты.
Сейчас система используется уже в 200 локациях: парках, медицинских учреждениях, на автобусных остановках. Так система поймёт, какие объекты перегружены и, например, сможет предложить оптимизировать транспортные маршруты. Из возможных проблем — дефицит вычислительных ресурсов.
2 190
☺️Добрая новость: ученые факультета компьютерных наук ВШЭ разработали модель для прогнозирования успешности реабилитации бездомных.
Благотворительная организация «Ночлежка» поделилась данными с учеными: в организации уже несколько лет пользуются электронной системой МКС (Многофункциональный кабинет соцработника), и на этих данных исследователи обучили ИИ.
Первая задача, которую стремились решить ученые, было предсказание успешности реабилитации. Эта информация даст соцработникам больше возможностей помочь реальному человеку, попавшему в тяжелую жизненную ситуацию. Но, несмотря на высокую точность алгоритма, интерпретировать показатели все равно необходимо социальному работнику, так как речь идет о жизни людей.
Пожелаем удачи исследователям и соцработникам!
2 190
Классная новость из Израиля: в местном кибуце (сельскохозяйственная коммуна) используют умные ульи на основе ИИ для пчёл🐝
Новые ульи помогут увеличить популяцию пчёлок и спасти их от смерти. В улье есть даже система компьютерного зрения (для поиска угроз в виде вредителей), климат-контроль и автоматическая кормушка, а в качестве источника энергии используются солнечные батареи.
Улей назвали Beewise, и в нем могут поместиться аж 2 миллиона насекомых; всего сейчас используется 24 таких улья. Создатели утверждают, что они помогут уменьшить смертность пчёл на 80% и увеличить урожай мёда на 50%🍯
2 190
Прогресс дошёл и до анализов крови! Современные системы подсчёта количества клеток на основе физико-химических характеристик устарели, а создавать новые модели на основе машинного обучения сложно, долго и дорого — нужно очень много ручного труда для разметки данных. Точность нынешних систем оставляет желать лучшего: она не выше 90%, а для постановки многих диагнозов крайне важно иметь точное представление о составе крови.
Чтобы не размечать большие объемы данных вручную, ученые из Бэйханского университета решили пойти другим путем: вместо сегментации клеток при помощи сетей, исследователи смотрят на разницу цветов в пикселях (в черно-белом изображении их легко различить). Делается это для изображений с разными типами клеток. Потом данные объединяют и на полученных метках выучивают сеть. В итоге разницы с полноценной разметкой практически нет, а точность предсказаний достигает почти 95%🔥
2 190
💳Mastercard запустила новые биометрические способы оплаты на основе распознавания лиц и сканирования отпечатков пальцев
Клиент сам может выбрать, как именно он хочет оплатить товар: стандартной оплатой пластиковой картой или биометрическим способом. Программу уже запустили в пяти продуктовых магазинах в Бразилии, а до конца года компания надеется развернуть технологию во всем мире.
Директор по безопасности в компании говорит, что, согласно их опросам, клиентам нравится пользоваться биометрическими технологиями. Разработчики надеятся, что их технология скоро пригодится и в метавселенных.
📷Кстати, система на основе распознавания лиц уже давно используется для оплаты проезда в метро Москвы!
2 190
🪙У развития нейронных сетей и искусственного интеллекта есть и обратная сторона: современные методы требуют огромного количества электричества, а это очень неэкологично
Авторы статьи о растущей опасности больших моделей приводят в пример цифры. За год каждый человек ответственен примерно за 5 тонн выбросов CO2, в то время как создатели популярной модели Transformer для анализа текстовых данных ответственны за 284 тонны выбросов! В конце концов, ученые соревнуются друг с другом, и, чтобы улучшить показатель метрики на пару процентов, может потребоваться аж $150,000😬
Несмотря на развитие возобновляемых источников энергии, большинство облачных провайдеров ими не пользуются (отчасти, из-за высокой цены внедрения более экологичных альтернатив).
Тренд очень пугающий, и я надеюсь, что ученые сменят тренд с соревнования «чья модель больше» на поиск понятных интерпретируемых моделей поменьше.
2 190
Очередная рабочая неделя подходит к концу, самое время вспомнить, что было интересного:
⁉️ Законопроект Министерства транспорта «О высокоавтоматизированных и полностью автоматизированных транспортных средствах» отправили на доработку. Эксперты совета по кодификации при президенте РФ отметили, что текущая стадия законопроекта не признает ответственность за ВТС в случае причиненного вреда.
⚡️Ученые Университета науки и технологий в Китае разработали новую батарею, которая заряжается на 10% всего за минуту. Чтобы добиться такой скорости зарядки, ученые нанесли на оболочку анода аккумулятора частицы графита с медной нанопроволокой. Массовое производство таких аккумуляторов поможет ускорить переход к экологически чистым источникам энергии.
➕Минцифры России продолжает упрощать IT-компаниям доступ к налоговым льготам. Министерство предложило новые правила для компаний: теперь не требуется иметь более семи сотрудников, а долю профильной выручки снизили с 90% до 70%.
🏪На днях компания VK запустила независимый магазин приложений RuStore. Сейчас пользователям доступна бета-версия, где уже можно скачать приложения компаний VK, «Яндекса», «Сбера», сервис «Госуслуги», приложения мобильных операторов и многое другое.
🦆Пугающая новость о защите данных пользователей: мобильные версии браузера DuckDuckGo, прежде считавшимся самым безопасным и защищенным, сливают данные пользователей компании Microsoft и не блокируют ее трекеры. Как оказалось, разработчики браузера втайне заключили сделку с компанией.
2 190
🎓Вы знали, что ошибки ИИ бывают двух типов?
➕ Первый тип ошибки — ложноположительное предсказание или, как его еще называют, ложная тревога. Такие ошибки случаются, когда система принятия решений ложно срабатывает. Например, постановка неверного диагноза, классификация надежного заемщика некредитоспособным и т.д.
➖Ошибки второго рода вызваны, наоборот, ложноотрицательными предсказаниями. Например, не поставленный вовремя диагноз или решение выдать кредит некредитоспособному заемщику.
Обычно, специалисты замеряют доли ложноположительных и ложноотрицательных предсказаний модели, также часто используются метрики на основе этих двух показателей. Они дают более широкую картину работы модели, чем одна только точность.
2 190
📲Помните, в последнее время стал активно обновляться реестр российского ПО? Так вот, Минцифры перезапустит его в виде маркетплейса приложений и сервисов
Вчера глава Минцифры Максут Шадаев сообщил о перезапуске реестра. В маркетплейс войдут проверенные временем решения, «которые уже состоялись на рынке». Пока точная дата релиза неизвестна, ориентируемся на середину лета (надеятся, сделать все в срок)
Это будет уже третий маркетплейс: в середине мая 2022 г. в России начал свою работу магазин NashStore, который был создан для замены GooglePlay для устройств на платформе Android. Вторым стал RuStore, созданный при участии Минцифры и компании VK (сейчас доступна бета-версия сервиса).
2 190
👾На днях компания DeepMind выпустила модель Gato. Авторы говорят, что научили алгоритм выполнять 604 задачи! Более того, в 450 из них модель работает лучше, чем человек
Модель умеет чатиться, подписывать картинки, играть в игры и многое другое. На удивление, модель не такая уж и большая: популярная нейросеть для обработки языка GPT-3 в 10 раз больше Gato по числу параметров. Авторы утверждают, что ее специально сделали небольшой и, если модель увеличить и дообучить, то она сможет справиться с любой задачей.
Но не обошлось и без критики: специалисты изучили модель и отметили, что во многих задачах алгоритм не так хорош. Но главное то, что модель умеет всё понемногу.
Теперь мы еще на шаг ближе к общему искусственному интеллекту. Точного определения у термина нет, но в общих словах — это система, которая сама сможет обучаться, делать выводы и даже осознавать себя. Короче, именно так ИИ представляют в постапокаллиптических фильмах. Если интересно почитать про это подробнее, обратите внимание на эту книжку.
2 190
🎵Помимо уже привычных нам применений машинного обучения — в медицине, рекомендательных системах, классификации изображений, ИИ научился петь оды и городам. На этот раз Москве.
На основе больших данных: фотографий горизонта и геоданных, нейросеть написала трек. Так, линии горизонта отвечали за тембр, а ритм зависел от плотности городских районов. Делал такое произведение искусства российский проект Platforma, который работает с большими данными.
Цель проекта — развитие сервисов для анализа туристической привлекательности городов. Послушать, как звучат города, уже можно на Яндекс.Музыке.
2 190
🤯У DALL-E 2 от OpenAI появился прямой конкурент! Сегодня компания Google анонсировала Imagen. Модель работает похожим образом: по текстовому запросу нейросеть генерирует картинку.
Imagen состоит из 3 частей: сначала генерируется небольшое изображение размером в 64х64 пикселей, потом изображение увеличивают до 256х256 пикселей и, в конце концов, до размера 1024х1024 пикселей с максимальным количеством деталей.
Конечно, авторы сравнились и с работой алгоритма DALL-E 2: например, с запросом «панда делает арт-латте», модель Imagen справилась лучше (на первой картинке Imagen слева, а результат DALL-E 2 справа).
Еще больше примеров тут, листайте!
2 190
😱Запросы в гугле и твиты помогут предсказать следующий всплеск заболеваемости
Так, отзывы на ароматические свечи Yankee Candles в интернет магазинах были дополнительным индикатором распространения нового штамма. В конце 2021 года как раз посыпались жалобы от покупателей на отсутствие аромата и неприятный запах у свечей. Исследователи построили график роста отрицательных отзывов, и он очень смахивал на всплеск заболеваемости омикроном (на картинке как раз он).
Несчастным свечкам досталось еще и в начале пандемии: оценка ранее любимых покупателями свечей за год потеряла целую звезду. Помимо отзывов на свечи, ученые заметили связь с ростом поиска доставок сиропов от кашля и куриного супа с лапшой
Исследователи предлагают ориентироваться не только на число подтвержденных случаев, а еще и на такие специфические цифровые следы: авторы их назвают «хлебными крошками». Ученые считают, что эти маркеры помогут предсказать следующие волны заболеваемости, и тогда мы сможем как следует к ним подготовиться🌊
2 190
✍️Предлагаю сегодня обсудить анализ тональности текста. Задача простая: по тексту надо определить его настроение. Если там сплошная ругань, то оценка будет негативной, а если хвалебный отзыв, то наоборот.
Способов использовать эту информацию — море. Полученную разметку применяют для прогнозирования рынка акций, результатов выборов, восприятия новостей, реакцию на услуги бренда и т.д.
Кстати, неплохо работают даже эвристические подходы: например, можно заранее отметить, какие слова негативные, а какие положительные, и смотреть, каких слов больше в тексте. Минусы у этого подхода тоже есть: сначала нужно такой словарь создать, а это трудоемкая задача. Помимо этого, метод сложно обобщать (если вдруг понадобится разметить тексты из другой области).
Получше работают методы машинного обучения, где побеждают нейронки. А еще лучше объединить их с первыми, эвристическими, подходами.
Вот тут можно посмотреть, как это работает. Выбираете русский язык, пишете в окошко текст и жмете на синюю кнопку✅
2 190
На мой взгляд, использовать ИИ в задачах, где встречаются чувствительные данные (гендер, возраст, раса и т.д.) пока рановато. Ученые сейчас обращают внимание на проблемы этики, интерпретируемости и честности предсказаний модели.
Например, многие медицинские задачи сейчас решаются при помощи ИИ. Иногда это здорово помогает врачу (можно увидеть незаметные проблемы с зубами, предсказать рак поджелудочной железы и т.д.) Но есть закономерный вопрос: как мы можем быть уверены, что модель непредвзята? Чтобы это проверить, ученые обучили сеть, которая по рентгену определяет расу. Удивительно, точность предсказаний достигла 90%, несмотря на то, что человек по снимкам никогда это не определит.
Модель обучали на КТ и рентгенах грудной клетки и маммографиях. Данные разметили сами пациенты: их попросили указать расу, к которой они себя причисляют. Видимо, в снимки могут просачиваться следы меланина, которые люди не видят, а ИИ подмечает.
В общем, исследователи призывают не торопиться с применением таких моделей🤔
2 190
Если вам было интересно представить, как жилось в древнем Риме или Греции, то вам сюда🔥
Помимо 3D макетов городов, создатели сервиса смоделировали, как могли бы выглядеть известные римские императоры, когда с них срисовывали скульптуры.
Но этого им было мало: с помощью ИИ, любители истории «оживили» политических деятелей — на этом видео они моргают и шевелятся👀
