en
Feedback
Katser

Katser

Open in Telegram

Авторский канал @ykatser по data science, машинному обучению и искусственному интеллекту в основном в задачах промышленности, но не только

Show more
2 276
Subscribers
No data24 hours
-57 days
+1530 days
Posts Archive
Katser
2 276
🗣Анонс выступления Что? Доклад "ИИ для диагностики АЭС: обзор мирового опыта" Когда? 15 сентября 2023 в 11.25 по мск Где? Ко
🗣Анонс выступления Что? Доклад "ИИ для диагностики АЭС: обзор мирового опыта" Когда? 15 сентября 2023 в 11.25 по мск Где? Конференция CrossConf. Москва, Красный Октябрь, пространство Старт Хаб О чем? Целью доклада является изучение и обобщение мирового и Российского опыта использования алгоритмов искусственного интеллекта для улучшения диагностики оборудования АЭС, а также демонстрация реальных практических кейсов применения машинного обучения на АЭС. В этом докладе хочется агрегировать собственный (ранее не опубликованный) опыт в области диагностики из атомного прошлого

Katser
2 276
🔬Я уже упоминал, что у меня есть академический/ресерч бэкграунд, даже профиль на scholar.google, но сейчас я почти не занимаюсь исследованиями. Зато выработалась очень полезная привычка и навык чтения научных статей. Помогает при необходимости разбираться в технологиях, последних достижениях и держать руку на пульсе происходящего в отрасли даже несмотря на то, что не читаю по 10+ статей в день, как в аспирантуре (теперь не больше 1-2 в неделю). Не думаю, что это обязательная рутина для датасайентиста, но для себя пользу вижу. 📰Из последнего, что прочитал, рекомендую вполне сносный, хоть и неглубокий обзор последних трендов в области поиска аномалий во временных рядах (приложил файл). Там и про трансформеры есть. Кстати, ищу научные статьи на следующих ресурсах: • Упомянутый scholar.googleResearchgate • Если полного текста статьи нет в открытом доступе, но у вас есть название или doi, то скорее всего вам поможет sci-hub (есть бот в тг) И еще лайфхак: на scholar.google и Researchgate пользуюсь рекомендательными движками статей по области интересов, обычно именно оттуда и достаю новые работы

Katser
2 276
🎛 Обзор открытых промышленных данных Наверно, ни для кого не секрет, что промышленные данные часто являются закрытыми и не публикуются в открытых источниках. Владельцы настолько ценят свои данные, что даже до сих пор нет рынка промышленных данных. А область анализа данных и машинного обучения ну очень сильно опирается на открытые разработки, библиотеки, исследования и датасеты. 🌍В рамках популяризации DS/ML в промышленности я продолжаю делиться накопленными знаниями и предлагаю подборку отобранных датасетов для основных задач (по одному датасету на задачу): • Tool wear detection - NASA Milling Dataset • Process monitoring (changepoint detection) - SKAB • Process monitoring (outlier detection) - NASA Shuttle Valve Data • Product quality prediction - Bosch Production Line Performance • RUL determining - NPP power transformer RUL • Process characteristics forecasting - Ladle-furnace unit • (Бонус) Industrial Cyber Attack detection - репозиторий сразу с 3мя датасетами Но есть и более представительные подборки промышленных датасетов, например, эта и эта. Очень рекомендую! 🔁Наконец, в своем репозитории «ML в промышленности», который раньше содержал только кейсы, тоже начал собирать датасеты для полноты картины, а то в репозиториях выше отличные подборки, но недостаточно полные. Свой репозиторий планирую обновлять регулярно, так что подписывайтесь на гитхаб.

Katser
2 276
📚Пока я нахожусь в процессе написания нескольких технических постов, делюсь с вами списком полезных книг на интересные и важные темы: тайм-менеджмент, личная эффективность, саморазвитие. 💪«Канбан Метод. Улучшение системы управления» — Майк Барроуз; О Канбан Методе и девяти ценностях (в том числе, балансе и клиентоориентированности), о процессе реализации в организационном контексте и просто управлении. 🧮 «Deadline. Роман об управлении проектами» — Том ДеМарко; А тут еще раз убедимся в том, что управление проектами — это всегда работа с людьми. Интересно будет руководителям проектов любого масштаба. 🏃‍♂ «Мама, я тимлид! Практические советы по руководству IT-командой» — Марина Перескокова; О том, как правильно распределять задачи, мотивировать и давать обратную связь. Интересное сравнение: опыт руководства = катание на сноуборде в тумане: ты ничего не видишь, ничего не понимаешь и все время вынужден «щупать склон». Добро пожаловать в дивный новый мир! 🏎 «Пять пороков команды. Бизнес-роман» — Патрик Ленсиони; Почему возникают «пять пороков команды»? Взаимное недоверие, нетребовательность, безответственность, боязнь конфликта и безразличие к результатам. Как их диагностировать и что с ними делать? 📊 «Роман с Data Science. Как монетизировать большие данные» —Роман Зыков; Эта книга предназначена для читателей, которые хотят попробовать свои силы в области анализа данных и создавать сервисы на их основе. 😎 «Путь джедая. Поиск собственной методики продуктивности» — Максим Дорофеев; Книга поможет раскрыть свой секрет успеха и продуктивности. 💪 «7 навыков высокоэффективных людей: Мощные инструменты развития личности» — Стивен Кови. О системном подходе к определению жизненных целей. Советуйте в комментариях, какие еще книги достойны внимания. А если читали что-то из перечисленного — делитесь мнением.

Katser
2 276
🗯Поиск аномалий в работе установок грануляции пресс-порошка двуокиси урана для изготовления топливных таблеток Еще один кейс применения машинного обучения на производстве Погружение в проблематику Одним из важных этапов в производстве топливных таблеток для АЭС является подготовка пресс-порошка. После приготовления пресс-порошок используется в качестве сырья для прессования таблеток, которые в последующем проходят этапы спекания, шлифовки и контроля. Качество работы установок для подготовки пресс-порошка напрямую влияет на качество конечной продукции. В производстве для подготовки пресс-порошка используются установки измельчения и грануляции. Исходные данные Ряд важных параметров для оценки технического состояния установки измельчения и грануляции уже собирается в системе сбора данных, имеющейся на предприятии: • скорость вращения мельницы, • ток мельницы, • температура корпуса мельницы, • температура переднего подшипника, • температура заднего подшипника. Кроме данных телеметрии, был доступен журнал технического обслуживания и ремонта (ТОиР), который использовался для выделения периодов стабильной безаварийной работы установки, внеплановых остановов оборудования и видов неисправностей. Задачи и алгоритм на основе методов машинного обучения Высокий уровень развития инструментов машинного обучения и накопленные за несколько лет массивы данных о работе оборудования дало возможность определить закономерности в работе установки грануляции и открыло возможности прогнозирования состояния и раннего обнаружения аномалий в работе оборудования. Для этого был разработан алгоритм на базе модели машинного обучения — рекуррентной нейронной сети на основе слоев LSTM (long short-term memory). Более подробно об алгоритме поговорим в следующем посте. 💡Выводы Результаты проекта внесли вклад в повышение коэффициента использования оборудования по времени: уменьшение количества внеплановых остановов и простоев установок грануляции, раннее обнаружение аномальных отклонений состояния от нормального за счёт автоматизированного мониторинга датчиков и анализа полученных данных. Доклад об этом кейсе и даже в целом о проекте (решалось несколько кейсов) с AIJourney можете посмотреть по ссылке.

Katser
2 276
В этом канале я еще не публиковал вакансии, но сейчас особенный случай: Мы в Conundrum.ai (я там с недавнего времени DS Lead) активно расширяем DS команду. Ключевые требования: • Уверенный мидл/мидл+ • Опыт в промышленных проектах • Опыт с time series analysis • Локация РФ (возможен ремоут) Что предлагаем: 🤓Сеньорная команда, можно многому научиться 🚀Амбициозный продукт, активно захватывающий рынок промышленного DS 🤹Дух взрослого стартапа, много интересной активности, задач и проектов 🤦‍♂️ЗП согласовывается индивидуально, в зависимости от уровня соискателя Присылайте резюме нам на почту: jobs@conundrum.ai с указанием, что нашли вакансию на моем канале. Будем в одной команде тащить промышленный DS!

Katser
2 276
💼 Диагностика двигателей самолетов Еще один интересный кейс применения машинного обучения Делюсь полезным репозиторием с практическим примером решения двух задач предиктивной аналитики авиадвигателей: • Прогнозирование аномалий — в постановке задачи классификации • Оценка остаточного ресурса (RUL) — в постановке задачи регрессии Решение задач продемонстрировано на одном из немногих доступных публично наборов данных — NASA Turbofan Jet Engine Data Set. Кстати, по ссылке на кэггле можно посмотреть и другие блокноты с решением задачи на этом датасете! 🔍 А вот еще один репозиторий с решением этой же задачи, где больше информации и деталей о кейсе, доменной области и этапах решения задач. Тоже достоин внимания! Хорошее прикладное дополнение с кодом к моей статье о RUL, которую представлял ранее.

Katser
2 276
🚨 Серия постов о качестве и предварительной обработке временных рядов. Часть 2 Обзор методов предварительной обработки данных. В первой части серии я поделился своими обзорными докладами и статьями о проблемах во временных рядах. А недавно на DataFest’е на треке reliable ml я представил обзор методов предварительной обработки временных рядов. Запись доклада доступна по ссылке. Важно заметить, что чаще всего предварительная обработка преследует следующие цели: • Борьба с проблемами в данных • Подготовка данных к требуемому виду и формату для машинного обучения • Снижения вычислительной сложности задачи (снижение размерности) • Повышения качества моделей машинного обучения (например, за счет создания более информативных признаков) Об этом и многом другом идет речь в докладе. Кстати, доклад частично основан на обзорной статье, которая была правда чуть больше сфокусирована на технических системах и АЭС в частности. Но конкретных методов, подходов и ссылок на источники там можно найти гораздо больше, чем в докладе. 📌 Помимо моего доклада на треке была куча классного контента (день 1, день 2), очень рекомендую хотя бы проглядеть все, а лучше внимательно посмотреть! И очередной раз благодарю Иру, Диму и всех причастных за крутой трек!

Katser
2 276
🗣Конференции и секции с кейсами применения ML в промышленности Я уже ранее писал про список кейсов применения машинного обучения в промышленности, который собираю в этом репозитории на гитхабе. Кстати, репозиторий уже разросся обзором статей, датасетов помимо кейсов. Но на какие российские конференции стоит в будущем обращать внимание, если хочется послушать доклады с подобными кейсами? У меня есть список конференций, которые смотрю/посещаю сам, делюсь! А вы можете дополнять список в комментариях. 💬 • DataFest от ODS.ai - секция ИИ в промышленности (названия от года к году меняются). Вот в 2020 году, вот в 2023. Обычно именно на этой конференции наиболее отобранные и ML-ориентированные доклады. • AIJourney от Сбера. Раньше были целые секции ИИ в промышленности, сейчас более хаотично, но регулярно встречаются доклады по теме. Часть интересных докладов с первых конференций убрали с ютуба, материалы начиная с 2020 года доступны на ютуб канале. Качество докладов обычно тоже высокое. • OpenTalks.ai. Каждый год есть интересные доклады как в индустриальном, так и в научном треках, но большинсто материалов доступно только на сайте конференции. • Эффективное производство от Цифры. Многие материалы доступны на сайте конференции, но некоторые есть и на ютубе. Немало маркетинговых материалов без сути, мало ML материалов, потому что все-таки конференция не специализируется на ML. • Канал и сообщество "Индустриальные инновации" периодически проводит конференции, вот пример одной из них. • Интересные материалы могут быть на Иннопроме и ЦИПРе, хотя прикладных историй с техническими деталями все-таки там не так много, но и цель конференций, насколько я понимаю, немного другая. • Конференции отдельных промышленных компаний с высоким уровнем развития цифровых компетенций, вот пример ГПН. • Отраслевые конференции, но их надо знать, довольно специфичная история, не всегда есть публичные материалы. • Совсем для искушенных: можно посещать различные научно-технические конференции, вот пример из нефтегазовой отрасли.

Katser
2 276
🧑🏻‍💻 Диагностика нефтегазовых трубопроводов с помощью машинного обучения Начинаю рассказывать более подробно о докладах на DataFest’е 2023. Начнем с кейса применения ML в нефтегазовой отрасли, по нему, кстати, есть вот такой интересный таймлапс! О докладе Метод дефектоскопии на основе магнитного потока является наиболее распространенным подходом для неразрушающего контроля нефтегазовых трубопроводов. В результате дефектоскопии получаются магнитограммы, зачастую анализируемые полуавтоматизированными методами (есть софт, но большую работу все равно делают люди), что приводит к снижению точности и увеличению времени анализа. А более быстрый и дешевый анализ может позволить запускать дефектоскопы чаще для лучшего понимания текущей ситуации в трубах. В докладе я рассказал о применении машинного обучения для автоматической диагностики нефтепроводов. К сожалению, звук на записи получился не очень хороший, но слушать можно. Немного дополнений Проект начался почти 4 года назад с хакатона Цифровой прорыв, где мы победили в финале самого массового хакатона в истории (даже в книге рекордов Гиннесса побывал хакатон). Инсайты о проведении хакатона есть у нашего сокомандника в статье на хабре. После хакатона по проекту было довольно много работы, результаты которой я и собрал в докладе. Доклад больше про научно-техническую сторону проекта, как наиболее удачную, почти без организационной и бизнесовой частей. И ждем в ближайшее время публикацию научной статьи, где ML часть задачи обнаружения дефектов раскрыта подробнее.

Katser
2 276
👀👀 Обзор метрик обнаружения аномалий Оценить алгоритмы обнаружения аномалий совсем не просто, поскольку существует множество математических задач и различных метрик, подходящих для конкретных проблем и условий. Часто исследователи и практикующие data scientist’ы берут общепринятую метрику, такую как F1, только потому, что ее настоятельно рекомендуют для задач классификации. Часто это работает, но не всегда! Чтобы помочь избежать неправильного выбора метрик, я решил сделать обзор метрик, используемых для оценки качества решения задач обнаружения аномалий. • Статья на хабре. • Статья на медиуме на английском. Даже есть пример кода. ⚡️Пока даже добавить нечего к статьям. В будущем хотелось бы дополнить формулами, реализовать в коде и провести эксперименты для наглядной демонстрации различия и искажения результатов при выборе различных метрик. Кстати, метрики частично уже (и еще будут) реализованы в рамках разрабатываемого фреймворка для решения промышленных задач, который мы представим вот-вот.

Katser
2 276
👁‍🗨Гайд для погружения в поиск аномалий во временных рядах Давно пора собрать накопившиеся материалы в области поиска аномалий в один пост. Пост полезен как гайд для введения в поиск аномалий - есть и теория, и практика, и реальные кейсы для тренировки насмотренности. Конечно, материалы на примере аномалий в технических системах и во временных рядах. • (теория+кейсы) Запись лекции о введении в поиск аномалий: в лекции рассказано о задаче, алгоритмах • (теория+практика) Блокнот на кэгле с практическим воркшопом: в блокноте есть как теория о задаче поиска аномалий, так и практика на примере реализации алгоритма генерации невязки (разладки) с помощью автоэнкодера, а также много ссылок на дополнительные материалы • (практика) Примеры из репозитория со SKAB’ом: в репозитории собрано большое число реализованных в коде алгоритмов обнаружения аномалий с результатами расчетов, ссылками на статьи об алгоритмах и описаниями этих алгоритмов • (кейсы) Репозиторий с реальными кейсами: можно посмотреть, как решается задача поиска аномалий разными компаниями и набраться практического опыта. Кстати, в репозитории теперь появились еще и научные статьи с датасетами 🏌️Еще материалы и посты для более глубокого изучения темы: • Точечные vs коллективные аномалииО задаче changepoint detectionО глубоком обучении для решения задач поиска аномалийОбзор метрик обнаружения аномалийОбзор открытых промышленных данных

Katser
2 276
💼 Кейс с диагностикой трансформаторов. Часть 4. Предыдущие части: часть 1, часть 2, часть 3 Еще одной задачей в диагностике трансформаторов является определение или прогнозирование остаточного ресурса (RUL). Подробно о задаче остаточного ресурса я писал здесь. ✏️Статья-туториал по решению задачи под названием “Решение задачи определения RUL трансформаторов с помощью машинного обучения на python” доступна на хабре. В статье продемонстрирован пайплайн решения задачи в регрессионной постановке. Первым этапом в таком случае является агрегация временных рядов, например, за счет выделения статистических характеристик рядов. Механизм агрегации продемонстрирован был мной в этом посте. Статью стоит воспринимать как туториал по решению задачи, который снижает порог входа и мотивирует попробовать решить задачу самостоятельно, а не демонстрацию создания продакшн-рэди решения.

Katser
2 276
💼Предиктивная аналитика эксгаустеров Этот пост в основном о кейсе, но немного и о самом хакатоне Задача Изначально формулиро
+5
💼Предиктивная аналитика эксгаустеров Этот пост в основном о кейсе, но немного и о самом хакатоне Задача Изначально формулировка задачи была примерно следующая: Разработайте модель, определяющую возможность возникновения нештатной работы оборудования Что такое эксгаустер? И какая там проблема? Простым языком об этом рассказано в видео. А вот цитата из статьи ЕВРАЗа на хабре: А если совсем в двух словах, то эксгаустер — это часть агломерационной машины, он постоянно втягивает горячий воздух и выпускает его в трубу. Внутри него расположен ротор — своего рода вентилятор, который прогоняет раскалённый воздух. Если этот ротор выходит из строя, то перестаёт работать и эксгаустер, и вся агломашина. При чем здесь Евраз, если задачу на Хакатон ставила Северсталь? Просто недавно ЕВРАЗ проводил очень похожий хакатон (супер актуальная проблема?). Мы решили тогда не участвовать, но в этот раз пропустить не могли 📌 В карточках рассказано о: • Проблематике • Задачах с точки зрения DS и технической диагностики • Подходах к решению задач • Архитектуре решения О хакатоне Про особенности хакатонов рассказывал в отдельной большой статье, здесь тезисно перечислю некоторые моменты: • Хакатон шел почти месяц с первого дня до финальной защиты (почти все время можно было работать над решением), что является особенностью (обычно это 2-3 дня), кому-то удобно погрузиться в задачу глубоко, кому-то не хочется тратить столько времени с непрогнозируемым результатом • Не хватало единой точки сбора информации, все было разрозненно (сайт, посты в каналы, ответы на вопросы от экспертов, исходная презентация с задачей), приходилось собирать это все вместе (тренажер реального проекта от организаторов?) • В положении нет критериев, они появились вместе с задачей и не были взвешены: не понятно, какой вес у каждого критерия, как считаются суммарно баллы и тд. В целом не хватало прозрачности • До самого конца хакатона нам так и не ответили эксперты на некоторые вопросы. Это нужно принять

Katser
2 276
🔬 Все, что вы хотели знать о задаче остаточного ресурса оборудования Именно так называется моя большая статья на Хабре. Самый полный гайд (из тех, что я встречал) по постановкам в терминах машинного обучения, вариантам данных и способам решения одной из важнейших задач диагностики — определения остаточного ресурса. Периодически апдейчу статью, поэтому на Хабре всегда актуальная версия. Например, недавно добавил новый кейс с этого хакатона, где определение остаточного ресурса было всего лишь 1ой из нескольких задач (о хакатоне подробнее напишу отдельно). И совсем недавно выпустил уже традиционный перевод статьи на английский язык на медиуме. 🐣А кто не хочет читать — посмотрите мой доклад с ИИшницы. Не такой полный как статьи, но представление о задаче вполне дает.

Katser
2 276
🔍Кейс с диагностикой трансформаторов. Часть 3. Предыдущие части: часть 1, часть 2 Подготовка к обучению Подошли к самой инте
+4
🔍Кейс с диагностикой трансформаторов. Часть 3. Предыдущие части: часть 1, часть 2 Подготовка к обучению Подошли к самой интересной части — обучению моделей машинного обучения. Так как мы подготовили выборку в виде табличных данных, нам остаются последние приготовления: • масштабировать данные при необходимости. • разделить выборку на обучающую и тестовую части. Может быть важно еще обработать данные, например, уравнять пропорции классов, так как выборка несбалансированная. Тогда есть два основных варианта (об этом подробнее в будущих постах про предварительную обработку): • оверсэплинг редкого класса • андерсэплинг частого класса Обучение моделей Теперь с чистой душой можно делать фит и предикт! В рамках работы мы попробовали все основные классы методов: • linear method (Logistic Regression) • tree-based method (Decision Trees) • ensemble-based methods (Random Forest, Gradient Boosting) • neural network (multilayer perceptron) И действительно после такой предварительной обработки особо ничего кроме фит-предикт больше делать не надо было — результат был довольно хороший. Ансамбль моделей В конце концов мы остановились на ансамбле перечисленных выше методов. Ансамбль представляет собой классификатор из XGBoost, построенный на результатах моделей первого уровня: случайного леса, LGBM и многослойного персептрона. Даже не спрашивайте, почему так. Честный ответ — на основе результатов на валидационной выборке. Никакого глубокого смысла в такой конструкции нет. Я мог бы начать рассказывать о том, что ансамблирование моделей разных классов позволяет лучше обобщить данные, добавить робастности, учесть сильные стороны разных подходов, нивелировать слабые и тд. Это все действительно так, но в промышленности лучше использовать более простые модели поэтому городить такие ансамбли надо осторожно. К тому же, даже простые модели типа логистической регрессии в такой постановке задачи уже давали нормальный результат. В общем, для полной картины стоит почитать статью из первого поста.

Katser
2 276
Оффтоп: участвовали тут почти 3 недели в хакатоне ЛЦТ в задаче Северстали по диагностике эксгаустеров (если будете гуглить: н
Оффтоп: участвовали тут почти 3 недели в хакатоне ЛЦТ в задаче Северстали по диагностике эксгаустеров (если будете гуглить: найти нужный эксгаустер непросто, подсказка — этот из металлургии). 🥈До первого места не добрались, но второе тоже хорошо. Возможно, позже подробнее напишу/расскажу об опыте.

Katser
2 276
🔍Кейс с диагностикой трансформаторов. Часть 2. Продолжение этого поста. Немного о данных В данной задаче у нас на входе есть
+5
🔍Кейс с диагностикой трансформаторов. Часть 2. Продолжение этого поста. Немного о данных В данной задаче у нас на входе есть датасеты, представляющие собой многомерные временные ряды. Каждый дотасет содержит 420 точек и 4 признака и является результатами сбора данных каждые 12 часов о содержании газов в трансформаторном масле. При этом, дотасет представляет работу трансформатор в одном из 4х режимов (нормальное состояние и 3 варианта неисправностей). Таким образом, каждой матрице (420 точек х 4 признака) соответствует 1 число - режим работы. Задача Задача может формулироваться как классификация временных рядов, так как каждому временному ряду мы должны поставить в соответствие метку режима. Решать ее можно разными способами, но именно постановка задачи как классическая классификация табличных данных (обучения с учителем) обычно дает наилучшие результаты. Предварительная обработка данных Для того, чтобы перейти к табличным данным и задаче классификации, надо привести многомерные временные ряды к векторам признаков. Схема приведения показана в карточках к посту: • Из временного ряда мы выделяем статистические характеристики, избавляясь от временной компоненты и заменяя временной ряд на небольшой набор его статистических характеристик • Проделываем процедуру для каждого датасета, получая вместо матрицы вектор признаков • Собираем новую матрицу объекты-признаки, где каждый объект - состояние трансформатора в какой-то период времени, а признаки - статистические характеристики концентраций газов за этот период • Теперь у нас каждой строке (объекту) датасета соответствует число - номер режима, и мы можем решать задачу классификации с помощью удобных и привычных методов (лог регрессия, случайный лес, град бустинг и тд). Об этом в следующем посте.

Katser
2 276
🔍Кейс с диагностикой трансформаторов. Часть 1. С помощью машинного обучения можно решать довольно большое число задач в промышленности. Я как раз сейчас готовлю об этом большой пост на Хабр/медиум. И одно из наиболее эффективных применений ML — дополнение существующих методов диагностики оборудования. Например, важным методом контроля и диагностики состояния силовых трансформаторов является «Хроматографический анализ растворенных газов» (XAРГ). Он основан на принципе контроля концентрации газов, растворенных в масле трансформаторов. Появление в оборудовании практически любых видов дефектов сопровождается образованием газов, растворяющихся в масле, при этом специфические виды дефекта генерируют свои газы в разных количествах. Сегодня в таком методе диагностирования в основном используются уставочные (предельные) значения на концентрации растворенных газов в масле. Превысили предел — сигнализируем об аномалии. Конечно, как и везде, для лучшего понимания текущего состояния можно выставить предупредительные, предаварийные и другие пределы, сигнализирующие о переходах в разные состояния, но это по-прежнему не дает достаточного представления о текущем состоянии, не дает диагнозов (надо дополнительно анализировать показания концентраций) и в лучшем случае частично автоматизирует процесс диагностики. В таких процессах часто ML не только применимо, но и показывает хорошее качество, конечно, при наличии приемлимые данных. 📌 В прикрепленной статье мы рассказали про проблему, про данные и про решение задачи автоматизации диагностики с помощью ML. Подробности о решении задачи обнаружения и классификации дефектов трансформаторов в следующем посте.

Katser
2 276
🚨 Серия постов о качестве и предварительной обработке временных рядов. Часть 1 - Введение. Уже давно написал небольшую заметку “О качестве данных для машинного обучения”. Немного тезисов из заметки и в дополнение к ней: • Качество данных всегда называется в числе топ-3 барьеров развития ИИ. Еще одна постоянно фигурирующая проблема - кадры, но об этом в другой раз. • Проблемы в данных могут не только снижать качество работы методов машинного обучения, но и полностью исключать возможность их использования. Есть даже такое выражение: garbage in - garbage out, которое означает, что некачественные данные на входе приводят к плохому результату на выходе. • Работа с данными и их приведение к нужному виду для постановки и решения задач в терминах машинного обучения могут занимать до 70% времени работы дата сайентиста на проекте. • Работа с качеством данных выглядит примерно следующим образом: 1. Сначала надо обнаружить проблему. 2. Потом надо решить проблему (подобрать оптимальный метод предварительной обработки). Кстати, ничего не делать - тоже может быть решением. 3. Финальный способ решения (метод предварительной обработки) надо интегрировать в пайплайн инференса. С качеством данных я сталкивался как в рамках работы на реальных проектах, так и в рамках научных исследований, в итоге весь опыт собрал в доклад и статью (+ англ версия статьи) о проблемах в промышленных данных. Доклад обозревает проблемы, но ведь нужно еще научиться их обнаруживать и устранять. Об этом я, во-первых, поговорю сегодня на треке Reliable ML в 15.15 по мск. Во-вторых, анонсирую серию постов, где я разберу самые популярные проблемы во временных рядах, способы их детектирования и способы их устранения, то есть методы предварительной обработки данных.