Машинное обучение в биологии и биомедицине | OpenBio.Edu
Open in Telegram
Актуальные новости, вакансии и образовательные материалы о машинном обучении в биологии и биомедицине. ❗️3 ноября — старт нового потока единственной программы с кейсами по Computer Vision в биомедицине и ML от OpenBio. Подробнее: https://clck.ru/3Cjbu5
Show more2 775
Subscribers
No data24 hours
-37 days
-2030 days
Posts Archive
🦠 Аугментация: как увеличить датасет почти бесплатно
В одном из предыдущих постов мы обсуждали переобучение. Оно случается, когда данных мало и/или есть дисбаланс классов. Очень частая проблема в биомедицине, где добавить еще одного пациента, десяток мышей или тысячу клеток это дорого.
Многие алгоритмы машинного обучения могут работать с небольшим количеством тренировочных данных, но чем больше тем лучше, не так ли? В этом посте мы обсудим одно из распространенных решений проблемы недостатка данных — аугментацию биомедицинских изображений. С помощью этого приема мы "раздуваем" тренировочный датасет.
➡️Как можно аугментировать изображения?
🔺Можно случайно двигать изображение, вращать его, вырезать и вставлять в него случайные фрагменты, сжимать и разжимать, вносить искажение — это геометрическая аугментация
🔺Мы также можем изменять интенсивности пикселей — инвертировать цвета, менять местами каналы, убирать данные о цвете, вносить случайный шум, замыливать
🔺Не запрещено применять несколько способов аугментации на каждое изображение да так, чтобы мама родная не узнала!
Полученные изображения отличаются от изначальных, но это то, что и нужно.
Наша задача — не давать нашей модели легкой жизни, она должна запоминать не расположение отдельных пикселей и их интенсивности, а понимать более глубокие, абстрактные качества изображений — будь это структура ядра лейкоцитов в клиническом анализе крови или различие паренхимы печени и образований в ней на МРТ.
🔺Есть и более сложные методы аугментации —
например применение генеративных моделей. Такие способы граничат с применением синтетических датасетов, что тоже очень полезно, но требует больше времени и ресурсов.
Вышеуказанная аугментация доступна в таких фреймворках глубокого обучения как Keras и PyTorch.
Есть фреймворки, созданные специально для аугментации биомедицинских изображений, например Augmentor, MediAug,PixMed-Enhancer и другие.
❓ Когда нужна аугментация изображений?
Ответ прост — всегда. Аугментация датасета не повредит обучению и даже может помочь. Начните с двух-трех простых методов аугментации, добавляйте новые и смотрите как модель учится. Главное не забывать — аугментировать надо только тренировочный датасет, тестовый остается нетронуты
На нашем курсе мы разбираем базовые и продвинутые техники работы с изображениями, включая аугментацию. Участники учатся применять PyTorch и специальные библиотеки для биомедицины, чтобы готовить данные к обучению нейросетей.
#openbio_education
📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
Repost from openbio.ru
Как построить deeptech-бизнес в России сегодня?
Приглашаем на прямой эфир рубрики «Лица Биотеха» с командой AppScience — компанией, которая изменила правила игры на рынке лабораторных поставок.
В гостях:
• Андрей Глухов — директор проектного офиса AppScience. Экс-McKinsey, BCG, Яндекс. Принес в биотех стратегии из мира больших технологий.
• Алексей Аникаев — продакт-менеджер AppScience. Экс-QIAGEN, Институт белка РАН. Глубоко понимает "боли" и потребности ученых.
В программе встречи обсудим вопросы:
🔺Как удалось построить систему экспресс-доставки (3-4 недели вместо 3 месяцев)?
🔺Как меняется номенклатура запросов от ученых? Какие технологии и направления сейчас на пике спроса?
🔺 IT-платформа для заказов, собственное производство — как работают их инновации?
🔺 Рынок после санкций: стало легче или тяжелее? Какова реальная доля Китая, Индии и "западных" брендов?
🔺 Личный опыт спикеров: уроки QIAGEN, McKinsey/BCG и Яндекса для науки и поставок
🗓️ Когда: Пятница, 19 сентября, в 9:00 (МСК)
📍Где: Прямая трансляция ВКонтакте. Эфир бесплатный, но нужна регистрация, чтобы мы прислали вам напоминание и запись.
➡️ Зарегистрироваться и получить доступ к записи: https://education.openbio.ru/Appscience
До встречи на открытом диалоге!
📲 Наши друзья из Института биоинформатики продолжают прием заявок на интенсив по эпигенетике (20 сентября – 14 октября):
bioinf.me/ngs_2025
Программа включает 4 модуля:
🔷На первой неделе Ирина Жегалова расскажет о ChIP-seq, контроле качества данных, поиске пиков и построении эпигеномных карт.
🔷Второй модуль посвящён ATAC-seq: вы изучите позиционирование нуклеосом и дифференциальную открытость хроматина.
🔷 А на третьей неделе курс проведёт Никита Ваулин, который был у нас в гостях в качестве спикера — он познакомит участников с методом Hi-C и его применением в 3D-геномике.
🔷Завершит курс Евгений Ефимов с лекцией о метилировании, практикой по анализу профилей и финальным заданием про биологические часы старения.
Можно записаться на один, несколько или все модули, а выпускникам программ Института предоставляется скидка.
bioinf.me/ngs_2025
Вы просили - и мы сделали!
У нас новости: мы запускаем новый модуль «Нейронные сети с нуля» в нашу программу курса "Машинное обучение в биологии и биомедицине" — углубление и гладкий переход к продвинутым модулям по DL. Каждый поток мы стараемся улучшать программу и третий поток обогатится внушительным комплектом лекций и семинаров.
Кто ведёт: Александр Сарачаков, Team Lead AI/ML в BostonGene.
Что внутри:
🔺Математический фундамент для DL: линал, векторный анализ и теория вероятностей для ML
🔺Сборка нейросети на NumPy: от нейрона к слою и батчам
🔺Активации: Sigmoid/ReLU, устойчивый Softmax
🔺Потери и метрики: Cross‑Entropy, MSE
🔺Backprop шаг за шагом и пошаговая реализация градиентного спуска на основе правила цепочки
🔺Тренировочный цикл «как во фреймворке», логирование, валидация
🔺Проект на реальном датасете
🔺Мост к PyTorch и Модулю по Deep Learning.
❕ Условия и обновленные сроки
Чтобы качественно интегрировать новый модуль, мы приняли решение перенести старт обновленного осеннего потока всего курса на 3 ноября.
До 1 октября (включительно) можно записаться на курс по старой цене. С 2 октября - повышение. Все изменения уже на сайте - запишитесь сегодня, чтобы получить максимум от обучения по сниженной стоимости.
➡️ Уже оплатившим — досрочный доступ к материалам с 1 октября.
#openbio_education
📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
В рамках подготовки к курсу «Машинное обучение в биологии и биомедицине» мы проводим открытые беседы с практикующими исследователями и специалистами в области биоинформатики. Недавно нашим гостем стал Антон Чугунов — кандидат физико-математических наук и эксперт в области структурной биоинформатики, а также - наш выпускник!
Мы обсудили роль программирования в биологии, вызовы современной науки и путь молодого исследователя в этой сфере.
Делимся наиболее яркими цитатами из интервью с Антоном:
1️⃣ Что для вас самое интересное в работе?
Многие мои исследования сделаны в сотрудничестве с коллегами-биохимиками, изучающими яды животных (скорпионов, пауков, змей), потому что содержащиеся там нейротоксины — природные вещества с уникальными свойствами. Яды отбирались эволюцией многие миллионы лет, чтобы идеально действовать рецепторы и ионные каналы в мембранах нейронов и других клеток. Это белковый дизайн на максималках, как он есть в природе. Люди уже пытаются делать так же — но получается пока не очень.
2️⃣ Что бы вы посоветовали студентам и начинающим в биоинформатике?
В биоинформатике лучше пораньше учить программирование. Оно очень сильно помогает – даже не для написания больших программ, а чтобы быстро обработать данные и получить результат. Без этого всё превращается в мучительное ковыряние в Excel.
3️⃣ Как вы сами осваивали новые навыки?
Когда я пришёл на курс по машинному обучению в OpenBio, было непросто: лекции, домашки, Kaggle-соревнования. Но в итоге это дало фундамент, которого мне не хватало. Главное – не бояться учиться новому, даже если ты давно в науке.
4️⃣ Как вы определяете, что в науке можно назвать результатом?
В науке результатом работы является гипотеза, которую можно проверить. Если подтвердилась – молодец. Если нет — всё равно молодец, потому что исключил неверный путь. Так наука и движется вперёд — маленькими шагами».
5️⃣ У вас много студентов и стажёров. Что самое сложное в этом?
У меня в группе всегда есть студенты и аспиранты, однако видимо моих организационных способностей не хватает на то, чтобы завелись сильные постдоки — "остепененные" исследователи, которых не надо контролировать на каждом шагу. Ну а путь студентов или аспирантов часто обрывается тем, что либо я не доволен их работой, и тогда мы расстаемся по моей инициативе; либо же я доволен, но сами ребята выбирают двигаться дальше — и тут я грущу, но уважаю их решение.
6️⃣ А что приносит радость в работе с молодёжью?
Самое приятное — видеть, как выпускники наших школ (речь о школах Future Biotech, подробнее в видеоинтервью) многого добиваются. Они были нашими воспитанниками, а теперь сами становятся учёными, инженерами, биоинформатиками. Это очень мотивирует и напоминает, зачем ты вообще этим занимаешься.
Получить запись встречи с Антоном вы можете по ссылке, а найти другие наши интервью можно в канале по тегу #openbio_interview!
📌Курс "Машинное обучение в биологии и биомедицине" | OpenBio.Edu — подписывайтесь! 🔭
📰 Собрали для вас дайджест мероприятий по биотехнологиям, вычислительной биологии, искусственному интеллекту, медицине и смежным областям, которые пройдут в России и за рубежом до конца 2025 года:
1️⃣ 23–26 сентября | Форум OpenBio | Новосибирск, Наукоград Кольцово, очно и онлайн
Крупнейший форум молодых ученых по биотехнологии, молекулярной биологии, вирусологии, биофизике, биоинформатике и фундаментальной медицине.
Регистрация по ссылке
2️⃣ 25 сентября | МедИнфоБез 2025 | Москва
Форум по ИТ и информационной безопасности в здравоохранении — важный контекст для применения ИИ и биоинформатики. Участие медицинских сотрудников - бесплатно.
3️⃣ 1-3 октября | Российский Диагностический Саммит | Москва
Крупнейшее событие в сфере медицинской диагностики в России, которое ежегодно собирает специалистов из разных областей медицины.
4️⃣ 14 октября | Здравоохранение Сибири 2025 | Новосибирск
Выставка и конференция о цифровизации здравоохранения: ИТ в медицине, телемедицина, медицинские технологии.
5️⃣ 20–22 октября | XXXI Symposium on Bioinformatics and Computer-Aided Drug Discovery (BCADD-2025) | Онлайн
Симпозиум для специалистов по компьютерному поиску и разработке лекарств, анализу биологических путей, моделированию молекул, ML и AI для фармацевтики и медицины.
Зарегистрироваться в качестве слушателя или представителя онлайн-постера - до 25 сентября.
6️⃣ 25–26 октября | Геномика метагеномика и молекулярная биология микроорганизмов | Сколково, Институт науки и технологий.
В программе: доклады из области генетики, молекулярной биологии, метагеномики и биохимии микроорганизмов, включая трансляционную микробиологию и геномное редактирование.
Дедлайн регистрации на конференцию - до 15 сентября.
7️⃣ 28–30 октября | XI Всероссийская конференция с международным участием «Физиология и биохимия медиаторных процессов" | Институт биологии развития им. Н.К. Кольцова РАН, г. Москва
Конференция по сравнительной физиологии сигнальных систем, эволюции механизмов сигнализации, генетическим и эпигенетическим механизмам физиологических процессов и поведения, молекулярно-клеточным механизмам функционирования сенсорных и двигательных систем. Можно принять участие в качестве слушателя без подачи тезисов.
8️⃣ 5-7 ноября | Всероссийская научная конференция «Генетика-2025» | Москва, очно и онлайн
Всероссийская научная конференция с участием ведущих российских и зарубежных специалистов, исследователей в области генетики, молекулярных биологов и биотехнологов.
Дедлайн регистрации - 4 ноября.
Приятный бонус: зарубежная конференция!
❤️ 24-28 ноября | ABACBS 2025 | Австралия, Аделаида
Юбилейная конференция Австралийского общества биоинформатики и вычислительной биологии, которая охватывает темы биоинформатики, машинного обучения в биомедицинских исследованиях, геномики и анализа данных, включая практические мастер-классы и сетевые сессии.
Дедлайн регистрации - до 26 сентября, можно подключиться онлайн.
Поделись с друзьями и посещайте мероприятия вместе!
#openbio_events #биотех #openbio_education #конференции
📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
С Днём программиста! 🔭
От лица команды OpenBio сегодня поздравляем всех, кто любит превращать данные в знания - от строк кода до строк генома. Благодаря программистам и биоинформатикам мы можем анализировать RNAseq, строить модели болезней и находить новые закономерности в биомедицине.
Пусть ваш код всегда компилируется, а эксперименты сходятся с моделью!
#openbio_moments
📌Курс "Машинное обучение в биологии и биомедицине" | OpenBio.Edu — подписывайтесь! 🔭
+3
Делимся историями наших выпускников!
Каждый из них пришёл на курс "Машинное обучению в биологии и биомедицине" со своей мотивацией и бэкграундом, а вышел - с новым опытом, проектами и планами на будущее.
Кто-то переехал учиться во Францию, кто-то защитил диссертацию, кто-то готовится к стажировке в Яндекс, а кто-то ищет новые пути, чтобы применить знания в работе и дипломе.
➡️ Листайте карточки, чтобы вдохновиться их историями.
#openbio_graduates
📌Курс "Машинное обучение в биологии и биомедицине" | OpenBio.Edu — подписывайтесь! 🔭
🔭 Когда нейросети выигрывают: TabNet, большие датасеты и глубина
В биомедицине любят и часто работают с табличными данными. Такие данные порой «проблемные» по меркам дата-сайенса: много параметров, мало наблюдений, высокий уровень шума. Чтобы извлечь из них максимум пользы, полезно иметь в арсенале не только классические методы, например ансамбли алгоритмов машинного обучения типа XGBoost, о которых мы говорили в предыдущих постах, но и более мощные инструменты.
Глубокие нейросети, специально разработанные для работы с табличными данными, появились относительно недавно. Одним из таких подходов является TabNet, предложенный исследователями из Google Cloud в 2019 году.
➡️ TabNet – это глубокая нейронная сеть с последовательным вниманием и механизмом выбора признаков, похожим на деревья решений. Она подходит как для классификации (в том числе мультиклассовой), так и для регрессии, а при необходимости может использоваться совместно с другими нейросетями, например с конволюционными, для анализа мультимодальных данных. Работать с ней очень просто: достаточно установить его из репозитория и применять как любой другой метод из арсенала дата-сайентиста.
❓ Когда TabNet выигрывает
TabNet можно применять к любым задачам классификации и регрессии. При правильно подобранных гиперпараметрах он способен превосходить бустинг-алгоритмы. В отличие от многих других методов глубокого обучения, TabNet умеет самостоятельно обрабатывать данные в процессе обучения. Он хорошо работает с «сырыми» или минимально подготовленными данными, что особенно полезно при анализе больших наборов данных с множеством признаков, например RNA-seq. Тем не менее данные всё равно стоит предварительно очистить и проанализировать.
Ещё одно преимущество - интерпретируемость. Он позволяет понять, какие признаки важны для модели, что важно для научных исследований.
❕ Ограничения и сравнение с бустингом
Главный недостаток TabNet - он «тяжелее» и требует больше вычислительных ресурсов по сравнению с ансамблевыми методами. Кроме того, у него много гиперпараметров, и качество работы модели сильно зависит от их грамотного подбора.
Бустинг-алгоритмы проще в использовании «из коробки» и быстрее обучаются, тогда как TabNet более гибкий и мощный инструмент. Какой метод выбрать - зависит от задачи и ресурсов исследователя. При этом вычислительные ресурсы для глубокого обучения становятся всё дешевле, что делает эксперименты с TabNet более доступными.
🔜🔙В программе курса мы последовательно проходим путь от базовых моделей (линейная регрессия, SVM, kNN) к ансамблям вроде XGBoost и случайного леса. Эти методы — фундамент, на котором строится понимание более продвинутых решений для табличных данных, включая современные архитектуры вроде TabNet.
#openbio_education
📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
🔈 Уже через час - встреча с Антоном Чугуновым!
В 19:00 по Мск начинаем открытую встречу про карьеру в биоинформатике, моделирование пространственной структуры и популяризацию науки.
📌 Зарегистрируйтесь, если планируете смотреть встречу в записи. Ссылка на подключение придет в телеграм-бота/
❔ Вопросы можно оставить прямо в комментариях - самые интересные озвучим в эфире!
До встречи!
📩📥📤
Наши выпускники: спустя время 🌱
Мы часто делимся с вами свежими кейсами и разбираем сложные темы. Но сегодня хотим сделать немного иначе и поговорить о самом ценном - о ваших долгосрочных результатах.
Курс "Машинное обучению в биологии и биомедицине" от OpenBio - это не просто повышение квалификации. Наша программа становится точкой старта для больших перемен, и мы с огромным теплом и гордостью продолжаем собирать отзывы от наших выпускников и делимся с вами впечатлением участников спустя время! Речь не только о том, как прошла учеба у нас, а о том, что реализовалось благодаря новым знаниям с нашего курса.
На курсе участники получают не только теорию, но и практические инструменты, реальные кейсы для github, поддержку экспертов и однокурсников, что помогает сразу применять знания на практике и делать первый шаг к новым карьерным достижениям.Кто-то, придя на курс с идеей «просто разобраться», спустя месяц уже вовсю писал главу для диссертации, а сейчас пишет нам о поступлении в аспирантуру. Кто-то смог блестяще защитить диплом, потому что на курсе нашел и идею, и инструмент для его реализации. А кто-то нашел новую работу, где успешно применяет приобретенные знания. Эти истории бесконечно вдохновляют нас и показывают, что самое важное - это не просто дать знания, а помочь вам сделать с ними следующий шаг в своей карьере. Следите за рубрикой #openbio_graduates - в ближайшее время мы начнем делиться с вами этими искренними и такими важными историями. Уверены, они помогут и тем, кто только задумывается о своем пути в Data Science для биологии и медицины! 📍 Курс "Машинное обучение в биологии и биомедицине" | OpenBio.Edu — подписывайтесь! 🔭
🔭 Нейросети или градиентный бустинг - что лучше для табличных биоданных?
В биомеде особенно любят табличные данные - от RNAseq и клинических показателей пациентов до выборок из эпидемиологических исследований. И часто перед исследователем стоит задача классифицировать эти данные. Что применять в первую очередь? Глубокие нейросети - это модно, но стоит ли сразу начинать с них?
Сегодня биоинформатика - это плотно набитый рюкзак с инструментами, и на каждый случай в нем найдется свой ключ. Но если таскать с собой полный рюкзак - есть риск надорвать спину.
Что выбрать в первую очередь? Промышленным стандартом работы с табличными данными в биоинформатике были и остаются бустинги - ансамбли моделей, основанные чаще всего на деревьях решений:
1️⃣ XGBoost - один из первых и до сих пор широко применяемый. Хорошо масштабируется.
2️⃣ LightGBM - очень быстрый, хорошо работает на большом объёме данных.
3️⃣ Catboost - работает из коробки с категориальными данными и пропусками.
Они просты в применении, хорошо масштабируются, легко интерпретируются и устанавливаются -
pip install xgboost и готово.
Долгие годы они считались королями таблиц, но не так давно для работы с табличными данными стали разрабатывать специализированные нейросети, некоторые из которых в ряде задач превосходят методы бустинга:
1️⃣ TabSeq - фреймворк глубокого обучения с модулярным дизайном.
2️⃣ MediTab - MediTab - фреймворк, основанный на LLM, заточенный на медицинские данные.
3️⃣ TabPFN - трансформер, опробованный на табличных данных с небольшими датасетами.
Их преимущество - гибкость архитектур, способность работать с большими и мультимодальными наборами данных. Но пока они остаются скорее экспериментальными: не всегда поддерживаются авторами, трудно найти предобученные модели, особенно в биомедицинских задачах, и еще только входят в рутинную практику.
Что можно рекомендовать на практике? На стандартных биомедицинских табличных данных оптимально начинать именно с бустингов. Если они дают хорошие результаты, а вы располагаете временем и ресурсами - можно попробовать нейронные сети. Если обучение на основе бустинга плохо работает с вашими данными, то нейронные сети скорее всего лучше не сделают. Но сразу нырять глубоко, не попробовав воду в мелководье не стоит - спасатели есть не везде!#openbio_python #openbio_practice #openbio_education 📍 Курс "Машинное обучение в биологии и биомедицине" | OpenBio.Edu — подписывайтесь! 🔭
Мы продолжаем серию встреч с экспертами в сфере биоинформатики, и уже 10 сентября к нам в гости придёт Антон Чугунов — кандидат физико-математических наук, старший научный сотрудник Института биоорганической химии РАН и специалист в области структурной биоинформатики.
Антон занимается моделированием пространственной структуры и динамики белков, уделяя особое внимание мембранным рецепторам и ионным каналам. Он окончил кафедру биофизики биофака МГУ, с 2015 года читает курс по моделированию биомолекул в МФТИ, известен как сооснователь и главный редактор научно-популярного проекта «Биомолекула», а также — выпускник нашего курса!
Трансляции проходят в рамках курса «Машинное обучение в биологии и биомедицине» от OpenBio. Следующее повышение цен уже скоро — успейте присоединиться по минимальной цене ↗️На встрече мы обсудим: 🔺путь Антона в науке и ключевые проекты в структурной биоинформатике 🔺как моделирование помогает раскрывать свойства белков и ионных каналов 🔺перспективы применения структурных методов в биомедицине 🔺опыт популяризации науки и проект «Биомолекула» Встреча состоится 10 сентября в 19:00 по Мск ✔️ Зарегистрируйтесь, чтобы получить ссылку на трансляцию и запись вебинара. ❔ Оставляйте вопросы спикеру в комментариях — мы обязательно их озвучим. Увидимся в эфире! #openbio_career #openbio_webinar #openbio_interview 📍 Курс "Машинное обучение в биологии и биомедицине" | OpenBio.Edu — подписывайтесь! ➡️
Тактика борьбы с переобучением: не бейте студента книжкой по голове, или вторая часть статьи от Дмитрия Хочанского!
1️⃣ Упрощение модели
Гвоздь можно забить и конфокальным микроскопом, но зачем? Начните с более простых моделей (например, логистической регрессии) - им не так страшен шум и нужно меньше данных, их сложнее переобучить. Ваша задача – найти максимально сложную модель, которая на ваших данных не переобучится. Иногда это довольно простая модель. Иногда простота лучше коварства!2️⃣ Регуляризация
Это способ "оштрафовать" модель за излишнюю сложность и количество параметров. Их много и разные классы алгоритмов машинного обучения используют свои методы регуляризации.3️⃣ Ранняя остановка (Early Stopping)
Если мы учим модель эпохами, то прекращаем обучение, когда метрика на тестовой выборке перестает улучшаться. Не даем нашему студенту от скуки начать зазубривать номера страниц в учебнике, особенно если он изначально учился правильно.4️⃣ Подготовка и аугментация данных
Иногда модель переобучается, потому что тренировочные данные плохие или их недостаточно даже для самого умного ученика. Тогда мы обязаны вернуться к тренировочным данным и почистить их и, если возможно, аугментировать или синтезировать дополнительные.Всегда стоит помнить, что вы, как ученый в науке данных, являетесь учителем, а ваша модель - вашим учеником. Ваша задача - хорошо ее подготовить, чтобы не пришлось краснеть, когда она покинет стены учебного заведения в реальный мир, где все не по учебникам, а цена ошибки это не неуд в зачетке. Хотите знать как - приходите к нам, и вы на практике научитесь: 🔺 Работать в условиях "проклятия размерности" и не бояться его. 🔺 Осознанно применять регуляризацию на реальных геномных, транскриптомных данных и в анализе изображений. 🔺 Выстраивать надежные пайплайны с кросс-валидацией, которые дадут честную оценку вашей модели. 🔺 Интерпретировать результаты так, чтобы отличать реальный биологический сигнал от статистического артефакта. Не обманывайтесь идеальными метриками и научитесь строить модели, которые действительно работают с OpenBio - следующий поток курса уже скоро! #openbio_python #openbio_practice #openbio_education 📍Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
В рамках подготовки к курсу «Машинное обучение в биологии и биомедицине» мы регулярно проводим открытые встречи с экспертами в области биоинформатики, биомедицины и инженерии машинного обучения. На последней встрече с Федором Колпаковым мы обсудили текущие тенденции в научной сфере и ключевые навыки для профессионального успеха.
Сегодня делимся выдержками из этого интервью:
1️⃣ Почему вы решили идти до конца и защищать и кандидатскую, и докторскую?
Накопительный эффект - очень важная концепция. Если мы посмотрим на другие профессии, то к 40–50 годам людям тяжело устроиться на рынке. А у учёных есть несгораемые достижения - кандидатская, докторская, профессорская степени - которые остаются на всю жизнь и позволяют быть востребованным даже в преклонном возрасте.2️⃣ Как проходила работа над проектом GenNet и чем она была для вас особенной?
В ходе работы я впервые встретился с эффектом, когда несколько человек, работая вместе, находят решение, которое одному было бы недоступно. Причём это не критика, а использование совместного разума - коллективное высказывание пожеланий и требований, из которых рождается понимание, как реализовать задачу. Иногда даже несколько голов дают результат, который ни один специалист в одиночку не смог бы придумать.3️⃣ Что делать с ошибками в математических моделях и можно ли им доверять?
Есть два взгляда на математические модели. Одни считают, что они нужны, чтобы предсказывать будущее, а я больше придерживаюсь мнения, что модели нужны, чтобы убедиться, что мы правильно понимаем процессы. Когда читаешь статьи, всё выглядит логично, но когда пытаешься описать это математически, сразу видно пробелы и противоречия. И если модель совпадает с экспериментом - значит, мы действительно что-то поняли.4️⃣ Как вам удаётся совмещать академическую науку и коммерческую деятельность?
В совмещении есть свои плюсы и минусы. На гранты учёные создают открытые продукты, и они часто не хуже коммерческих. Но коммерческая составляющая даёт гибкость: можно принять человека за день, решить задачу быстро. Поэтому в нужный момент выступаем как академическая структура, а в другой - как бизнес. Это сочетание позволяет и сохранить глубину исследований, и получить гибкость исследований.Найти другие интервью можно в нашем канале по тегу #openbio_interview, а уже скоро - следующая встреча с экспертом! #openbio_career #openbio_webinar #openbio_expert 📍 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
Переобучение в биомедицине: как не обмануться «идеальной» моделью?
Представьте студента, который готовится к экзамену. Не пытается понять предмет, а зазубривает ответы на 30 билетов из методички. На экзамене блестяще отвечает на эти 30 вопросов и получает "отлично". Но столкнись он с реальной задачей, даже немного отличающейся от билета, - провал.
В машинном обучении это называется переобучение (overfitting). Модель не выявляет общие биологические закономерности, а "запоминает" конкретные образцы из обучающей выборки, включая случайный шум. Результат? Идеальные метрики на тренировочных данных и провал на новых, реальных пациентах или клеточных линиях.
Переобучение встречается везде, но модели для биомедицинских данных ей особенно подвержены.
Основные причины:
1️⃣ Проклятие размерности (P >> N)
У вас может быть 20 000 признаков (генов, белков, метаболитов, клинических параметров) и всего 50 образцов (пациентов). Достаточно сложные модели могут найти тысячи способов идеально "подогнать" данные под ответ, даже если ответа нет вовсе.2️⃣ Батч-эффекты
Всегда есть технические артефакты, связанные с разным оборудованием, реагентами, условиями экспериментов и они часто оказываются более сильным сигналом, чем сама биология. Переобученная модель с радостью "выучит" эти артефакты и будет предсказывать номер секвенатора, комнату в виварии или кабинет МРТ, а не действительно разные группы клеток, животных или пациентов.3️⃣ Биологическая гетерогенность
Каждый пациент и каждый образец уникален, а наши критерии для их разделения в разные группы могут быть неточны или вовсе неправильны. Плюс биологические данные априорно "шумные", ведь природа в своем слепом творчестве работает не по нашим техническим заданиям.Переобучение: как заметить проблему вовремя? Основной признак переобучения - расхождение метрик качества обучения. Модель, как студент, должна хорошо решать и тренировочные задачи, и тестовые. ✔️ Хорошая модель: Метрики сопоставимы. При глубоком обучении кривые качества обучения на тренировочных и тестовых данных растут, а кривые функций потерь падают. Студент учится и хорошо сдает пробные тесты. ➗ Переобученная модель: отличные метрики на тренировочных данных и плохие на тестовых. При глубоком обучении кривая качества обучения на тренировочных данных растет, в то время как на тестовых замирает или начинает падать. Студент идеально выучил билеты, но его способность решать новые задачи ухудшается, так как он уже заучивает ответы, а не думает над ними. Иногда модель почти мгновенно начинает идеально предсказывать тренировочные данные, но плохо предсказывает тестовые – она сразу переобучилась, запомнила тренировочные данные даже не пытаясь их понять.
Смотрите первую часть практической иллюстрации о том, как ловить переобучение в нашем скринкасте от Дмитрия Хочанского - между прочим, выпускника нашего курса по машинному обучению 😎#openbio_python #openbio_practice #openbio_education 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
+2
🔭 В прошлом посте мы обсуждали, что абсолютная функция потерь устойчива к выбросам, а квадратичная функция лучше подходит для оптимизации. Почему бы не попробовать их объединить? Log-Cosh и Huber — альтернативные функции потерь, разработанные для сочетания лучших свойств MSE и MAE.
1️⃣ Huber loss
Функция потерь Хубера, также известная как сглаженная средняя абсолютная ошибка, представляет собой кусочно-квадратичную функцию: квадратичная для малых ошибок и линейная для больших. Она параметризуется пороговым значением δ (дельта), определяющим точку перехода от квадратичной к линейной форме потерь.
Математически определяется как:
Lδ =
⎧ 1/2 (y - ŷ)² ,если |y - ŷ| < δ
⎨
⎩ δ (|y - ŷ| - 1/2 δ) , иначе
Функция Хубера сочетает в себе чувствительность к небольшим ошибкам MSE (обеспечивая плавные градиенты, полезные при оптимизации) с устойчивостью к выбросам, характерной для MAE.
Применяется в задачах регрессии с ожидаемыми выбросами, обеспечивая стабильный и менее чувствительный показатель потерь по сравнению с MAE.
2️⃣ Log-Cosh loss
Функция потерь логарифмического косинуса имеет логарифмическую и гиперболическую косинусную составляющие, что обеспечивает гладкую, выпуклую функцию.
Она определяется как:
Llog-cosh(y, ŷ) = log(cosh(y - ŷ))
Ключевое преимущество Log-Cosh заключается в его дифференцируемости везде, включая нулевое значение, в отличие от MAE, которая не дифференцируема в нуле. Это свойство обеспечивает бесперебойную работу методов градиентного спуска, исключая проблемы недифференцируемости.
Log-Cosh сочетает преимущества MSE (плавные градиенты для оптимизации) и MAE (устойчивость к выбросам), что делает его идеальным для задач регрессии, особенно когда важно правильно прогнозировать тренд, а не устранять каждый выброс.
Когда использовать?
🔺 При наличии выбросов или шума в данных.
🔺 Если имеются тяжелые хвосты.
🔺 Когда важно выявлять мелкие закономерности ошибок, снижая влияние экстремальных значений.
🔺 Для робастной регрессии, прогнозирования временных рядов и обработки изображений.
❕ Биологические данные часто зашумлены, тогда на помощь и приходят эти функции потерь: Huber лучше подходит для данных с умеренными выбросами, а Log-Cosh — для более сложных шумных сценариев. Эти функции потерь повышают качество предсказаний и делают выводы более надежными.
А как именно их применять к реальным биологическим данным и что выбрать в конкретной задаче — мы подробно разбираем на курсе по машинному обучению в биологии и медицине. Всё — с практикой и понятными примерами.
Использовали ли Вы Log-cosh или Huber? Делитесь в комментариях!
#openbio_education
📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!🔈 Уже сегодня - встреча с Федором Колпаковым!
В 19:00 по Мск начинаем открытую встречу про карьеру в биоинформатике, перспективы вычислительной биологии и будущее геномных исследований.
📌 Зарегистрируйтесь, если планируете смотреть встречу в записи. Ссылка на подключение придет в телеграм-бота.
💬 Вопросы можно оставить прямо в комментариях - самые интересные озвучим в эфире.
До встречи!
📩📥📤
+4
Что общего у гвоздей, флуоресцентной мыши и искусственного интеллекта?
На встрече с Юрием Вяткиным, директором по инновациям компании NOVEL, мы говорили о карьерных треках в биоинформатике, трендах развития отрасли и о том, почему главный навык в профессии - энтузиазм.
✨ Кстати, в NOVEL сейчас открыты стажировки для студентов по специальностям "информационные технологии" и "data science", "биоинформатика" и "естественные науки" - отличная возможность попробовать себя в реальных проектах!Мы собрали самые яркие цитаты Юрия из эфира - листайте карточки! А запись встречи можно найти по ссылке ➡️ #openbio_career #openbio_webinar #openbio_interview
+2
🔬 Наши студенты приходят на курс с разным опытом, бэкграундом и уровнем подготовки. У каждого — свои задачи и цели, но всех их объединяет одно — мотивация разобраться в новых методах и желание расти.
Мы счастливы, что такие вдохновлённые и целеустремлённые люди выбирают нас. А мы, в свою очередь, делаем всё, чтобы становиться лучше и дарить новым студентам тот же опыт, который оставит только тёплые воспоминания.
Спасибо, что выбираете нас ❤️
#openbio_review #openbio_education #openbio_ml
📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!
