ru
Feedback
Машинное обучение в биологии и биомедицине | OpenBio.Edu

Машинное обучение в биологии и биомедицине | OpenBio.Edu

Открыть в Telegram

Актуальные новости, вакансии и образовательные материалы о машинном обучении в биологии и биомедицине. ❗️3 ноября — старт нового потока единственной программы с кейсами по Computer Vision в биомедицине и ML от OpenBio. Подробнее: https://clck.ru/3Cjbu5

Больше
2 775
Подписчики
Нет данных24 часа
-37 дней
-2030 дней
Архив постов
💉 Опорные векторы: проводим границу между мирами Иногда задача в машинном обучении звучит очень просто: «разделить объекты на группы». Например, по данным анализов нужно понять, здоров пациент или нет. ➡️ Мы можем отобразить эти данные в виде точек на плоскости: одни принадлежат к классу «Совы», другие - к «Жаворонки». ✔️Метод опорных векторов (Support Vector Machines, SVM) ищет такую границу, которая делит классы, максимизируя расстояние между ними. А ближайшие точки становятся опорными векторами, которые «держат» границу. 🔳В зависимости от того, какие признаки мы берем и как их преобразуем, разделение может выглядеть по-разному. ➕Если признаки простые - например, во сколько вы обычно ложитесь спать, то границу можно провести обычной линией: совы остаются по одну сторону, жаворонки - по другую. ➖Если добавить еще пару факторов, скажем, во сколько вы встаете и сколько кружек кофе выпиваете утром, то модель будет строить уже плоскость, которая делит пространство на «истинных сов» и «истинных жаворонков». ➗А если учесть десятки параметров - например, сотни генов в экспрессионном профиле - то разделение превращается в гиперплоскость в многомерном пространстве. ↗️Увеличение пространства - не предел, здесь открывается главное преимущество SVM: он не ограничивается только «обычной» гиперплоскостью. Можно использовать более сложные ядра - например, полиномиальное ядро, которое строит изогнутые границы, или RBF-ядро (радиально-базисное ядро), которое «раздувает» пространство вокруг точек и позволяет отделять даже очень хитро переплетенные классы. 📍 Ядра SVM — это как антитела в ИФА: чувствительные и не всегда предсказуемые. Но с практикой на нашем курсе их можно приручить. ❕ Ограничения 🔸Не любит огромные наборы данных - на миллионах строк становится очень медленным 🔸Выбросы. Когда мы обучили SVM, модель уже построила границу. Дальше она классифицирует новые точки по принципу: если они оказались по одну сторону от гиперплоскости - относим к классу А, если по другую - к классу Б.То есть если появляется новый пациент с очень необычным значением признаков, модель смотрит только на то, где он находится относительно границы. 🤝 Однако не всегда нужно искать сложные разделяющие поверхности. Иногда решение ближе: скажи мне кто твои соседи и я скажу кто ты. Завтра рассмотрим следующий метод - k Nearest Neighbors #openbio_education #openbio_MLSprint 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

❓ Попробуйте внимательно взглянуть на confusion matrix, ROC-кривую и важность признаков — и ответить на вопросы ниже.
Anonymous voting

🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — од
+2
🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — одной из самых интерпретируемых моделей машинного обучения! Мы предлагаем прямо сейчас проверить интуицию и ещё раз закрепить материал. Каждый правильный ответ даст вам часть кодовой фразы, которая пригодится в финале спринта ❤️ 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

Repost from N/a
🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — од
+2
🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — одной из самых интерпретируемых моделей машинного обучения! Мы предлагаем прямо сейчас проверить интуицию и ещё раз закрепить материал. Каждый правильный ответ даст вам часть кодовой фразы, которая пригодится в финале спринта ❤️ 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

💡 Добро пожаловать в спринт по классическим методам машинного обучения! Начинаем спринт с проверенной классики, а дальше каждый день — новая модель и мини-викторина с частью кодовой фразы. Линейная регрессия Когда говорят «линейная регрессия», у многих сразу всплывают громоздкие формулы. Но на деле это один из самых понятных инструментов, который помогает не только предсказывать значения, но и понимать, какие факторы важнее других. Идея простая: y = β₀ + β₁x₁ + β₂x₂ + ... + βₙxₙ Здесь
y - целевая переменная (например, уровень холестерина), которую мы хотим предсказать, xi​ - признаки (например, возраст или уровень белка) βi​ - коэффициенты. Если βi​>0, то рост признака увеличивает прогноз. Если βi​<0 - уменьшает.
✔️ Применяется, когда нужно предсказать число, например: оценить уровень холестерина по возрасту, индексу массы тела и сопутствующим показателям. Такая модель не просто предсказывает, но и сразу показывает, какой фактор влияет сильнее. Ограничения 🔻Линейность: модель предполагаете, что связь между признаками и целевой переменной линейная. Если зависимость сильно нелинейная, результат может быть искажен. 🔻Выбросы: одиночные аномальные значения могут сильно тянуть прямую и ухудшать прогноз. 🔻Мультиколлинеарность. Если признаки сильно коррелированы друг с другом (например, вес и ИМТ), коэффициенты становятся нестабильными, и интерпретация теряет смысл. 🔻Чувствительность к масштабу: Без нормализации признаки с большими значениями могут “доминировать” над другими данными. Например, если мы решим указывать возраст пациентов в минутах, а остальные признаки в стандартных единицах, то влияние возраста на уровень холестерина будет переоценено. ➗➗➗➗➗➗➗➗➗➗ Логистическая регрессия ➗➗➗➗➗➗➗➗➗➗ ✔️Когда исход бинарный - например «болен или здоров», используется логистическая модель. Она переводит линейную комбинацию признаков в вероятность через S-образную функцию: p = 1 / (1 + e^-(β₀ + β₁x₁ + ... + βₙxₙ)) Здесь результат всегда от 0 до 1 - вероятность наступления события. То есть мы получаем не категоричный ответ «здоров или болен», а вероятность того, что пациент окажется болен (или здоров). Ограничения 🔷Граница - всегда линейная. Если классы в действительности разделяются сложной кривой, модель будет ошибаться. 🔷Дисбаланс классов. Если один класс встречается намного чаще другого, модель может «залипнуть» на предсказании большинства 🔷Выбросы и шум. Как и линейная, чувствительна к необычным наблюдениям, которые могут сдвинуть границу ❔ Но что, если классы нельзя разделить прямой линией? Завтра разберем SVM — метод, который ищет “идеальную” границу Делитесь впечатлениями о первом дне с друзьями и тут, в комментариях. Даешь азы ML в массы!! #openbio_education #openbio_MLSprint 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — од
+2
🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — одной из самых интерпретируемых моделей машинного обучения! Мы предлагаем прямо сейчас проверить интуицию и ещё раз закрепить материал. Каждый правильный ответ даст вам часть кодовой фразы, которая пригодится в финале спринта ❤️ 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — од
+2
🧫 Сегодня посмотрим, как теория превращается в практику. Перед вами графики и результаты работы логистической регрессии — одной из самых интерпретируемых моделей машинного обучения! Мы предлагаем прямо сейчас проверить интуицию и ещё раз закрепить материал. Каждый правильный ответ даст вам часть кодовой фразы, которая пригодится в финале спринта ❤️ 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

❤️‍🔥Classic ML Sprint от OpenBio — старт уже завтра!❤️‍🔥 С 20 по 25 октября мы проведем интенсив по классическим методам ма
❤️‍🔥Classic ML Sprint от OpenBio — старт уже завтра!❤️‍🔥 С 20 по 25 октября мы проведем интенсив по классическим методам машинного обучения - простым, понятным и невероятно полезным для биомедицинских данных. 🚀 20–24 октября — 5 дней, 5 моделей. Каждый день — новый пост, новая идея и мини-тест с несколькими вариантами ответов. В каждом тесте — часть кодовой фразы, которая пригодится в финале. 🎁 Как провести неделю с максимальной пользой: ✔️ Читайте посты ✔️ Выбирайте верные ответы ✔️ Собирайте кодовые слова. В конце недели соберите кодовую фразу, отправьте ее и получите скидку 10 000 ₽ на обучение на курсе «Машинное обучение в биологии и биомедицине»!Это не просто спринт. Это возможность попробовать себя в роли исследователя данных, почувствовать, как из простых идей рождаются мощные модели — и сделать первый шаг к уверенной работе с ML в биомедицине. 📍 Старт уже 20 октября! Подписывайтесь, чтобы не пропустить первый пост. #openbio_education #openbio_MLSprint 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

🧫 Визуальные трансформеры - новый игрок в нашей команде Визуальные трансформеры. Звучит непривычно, правда? Ещё недавно в компьютерном зрении безраздельно властвовали сверточные нейросети, а теперь у них появился серьезный конкурент. ❓ Трансформеры изначально создавались для работы с последовательностями токенов - сначала это был текст. Но довольно быстро оказалось, что токенизировать можно почти все: изображения, сигналы, геномные последовательности. ➡️ Основной принцип трансформеров - механизм внимания (attention). Он позволяет модели видеть контекст и связи даже между далекими фрагментами данных. ❔ Вспомним, как работают сверточные сети: они “шагают” по изображению с перекрывающимися фильтрами, постепенно уменьшая размер, но извлекая все более абстрактные признаки. ✅ Визуальные трансформеры действуют иначе. Они разбивают изображение на непересекающиеся фрагменты (patches), превращают каждый из них в вектор — токен, и добавляют позиционное кодирование, чтобы модель понимала, где находится каждый кусочек. Дальше токены проходят через энкодерные блоки, основанные на механизме внимания. В конце отдельный “токен предсказания” накапливает нужную информацию, и по нему модель выдает результат. ❓ Что умеют визуальные трансформеры? 🔷Все то же, что и CNN — классификация, сегментация, детекция объектов, но делают это с более широким взглядом на картинку. 🔹Они лучше улавливают глобальный контекст, но требуют больше данных и вычислительных ресурсов. Сверточные сети, наоборот, легче, быстрее и понятнее в интерпретации. ✔️ Так что выбор зависит от задачи: CNN — проверенный инструмент, ViT — гибкий и мощный, особенно при большом количестве данных. А впереди — еще интереснее: мультимодальные трансформеры, которые могут работать с изображениями, текстом, звуком и даже биологическими последовательностями одновременно. О них поговорим отдельно 😉 📍 Кстати, в нашем курсе «Машинное обучение в биологии и биомедицине» вы шаг за шагом познакомитесь с архитектурами нейросетей, включая сверточные и трансформеры, и научитесь применять их к реальным биомедицинским данным. #openbio_education 📌 Машинное обучение в биологии и биомедицине| OpenBio.Edu — подписывайтесь!

💡 OpenBio растет не только как проект, но и как сообщество. С каждым выпуском нас становится больше — тех, кто не просто слу
+3
💡 OpenBio растет не только как проект, но и как сообщество. С каждым выпуском нас становится больше — тех, кто не просто слушал лекции, а действительно пробовал, разбирался, спорил с алгоритмами, писал пайплайны, ставил эксперименты. 🔺 Кто-то, как Сергей Туранов применил знания к реальной науке и собрал собственный пайплайн с LLM. Кто-то, как Никита Золкин,увидел, как структурировать опыт и говорить с индустрией на равных. А кто-то, как Иван Валиев, после курса понял, что мультиомика и нейросетевые методы станут его следующим шагом.🔺 Такие истории не про «до и после». Они про жизнь в процессе — когда ты перестаешь быть просто слушателем и становишься участником большой исследовательской истории. Именно так мы видим OpenBio — не как курс, а как пространство, где рождается понимание, любопытство и уверенность. ❤️ #openbio_graduates 📌Курс "Машинное обучение в биологии и биомедицине" | OpenBio.Edu — подписывайтесь!

Давайте потренируемся и найдем первое слово:
Anonymous voting

Даешь по классике? Анонс нового спринта от OpenBio 📌 Часто, когда говорят «машинное обучение», подразумевают нейросети. Каже
Даешь по классике? Анонс нового спринта от OpenBio 📌 Часто, когда говорят «машинное обучение», подразумевают нейросети. Кажется, что это и есть все ML. Но на самом деле нейросети — лишь один из инструментов, пусть один из самых модных сегодня. 🔭 Машинное обучение — это большой чемодан методов. Внутри — десятки подходов, и у каждого свои сильные стороны. Нейросети особенно хороши там, где данные имеют сложную внутреннюю структуру: изображения, речь, последовательности ДНК или белков. Они умеют находить скрытые закономерности без явного задания признаков. Но очень часто в биологии и медицине данные устроены проще: это таблицы с показателями пациентов, результатами анализов, уровнями экспрессии генов. И именно здесь классические методы ML работают лучше, надежнее и проще в интерпретации. Они позволяют быстро получить результат, объяснить его врачу или исследователю и понять, какие факторы действительно значимы. Модуль по классическим методам ML входит в наш большой курс повышения квалификации, но мы хотели бы рассказать об их возможностях подробнее на следующей неделе. Барабанная дробь! 📰 20 октября стартует спринт по классическим методам машинного обучения прямо здесь в телеграм-канале. Это не просто теория из учебника — мы разобрали, переработали и упаковали материал так, чтобы вы могли сразу применять его на практике. Вас ждут: 🔺 Линейная и логистическая регрессии — простота и элегантность 🔺 Методы ближайших соседей — когда похожее предсказывает похожее 🔺Опорные векторы (SVM) — математическая красота классификации 🔺Деревья решений — прозрачная логика для врачей 🔺Наивный байесовский классификатор — быстрый фильтр, который первым замечает закономерности + фрагменты из видео-лекций нашего флагманского курса от Ильи Воронцова. ➡️ Наша цель — показать, что классические методы не только понятны, но и по-прежнему актуальны. После этой серии у вас появится карта: какой инструмент выбрать для задачи, какие у него ограничения и как интерпретировать результат. 🎁 Но это еще не все! Каждый день к постам мы будем выкладывать задания на основе классического датасета Breast Cancer Wisconsin (Diagnostic). В нем собраны измерения клеток опухоли молочной железы — всего 30 признаков для каждого случая, а задача простая и важная: отличить доброкачественные опухоли от злокачественных. ↗️ Мы обучили разные алгоритмы и будем делиться с вами результатами: матрицы ошибок, ROC-кривые, распределения вероятностей и важности признаков. Ваша задача — "следить за руками", пробовать интерпретировать графики и разгадать зашифрованную загадку. 🎁 Победители получат скидку до 10 000 рублей на один из наших продуктов Готовы прокачать свои навыки в классическом ML? Тогда следите за постами — стартуем 20 октября!
➡️ Приглашайте друзей к нам на спринт — OpenBio делает тренды доступными для вас ❤️
#openbio_education #openbio_MLSprint 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

🦠 Как обрабатывать данные переменной длины: ЭКГ, тексты и не только ЭКГ и текст. Казалось бы, что может быть между ними общего? В одном случае — последовательность символов, в другом — временные ряды. Совершенно разные по содержанию. 1️⃣ В старые добрые времена (ну, лет 10 назад ) их анализировали по-разному: тексты обрабатывали например скрытыми марковскими моделями, ЭКГ раскладывали в ряд Фурье или натравливали на них метод опорных векторов. У каждой модальности был свой инструментарий, свои методы, свои причуды. Пересечений было мало. 2️⃣ Все изменилось, когда пришли трансформеры В 2017 году исследователи из Google предложили архитектуру, которая изначально применялась для перевода текстов. Но оказалось, что эта штука — настоящий швейцарский нож! Трансформеры начали решать задачи, о которых их создатели даже не думали. И не только с текстами. ▪️Что происходит сейчас в биомедицине? ➖Архитектуры вроде GPT и BERT давно стали рабочими лошадками для анализа текстов. Появились их специализированные «медицинские» версии: BioBERT, Med-BERT и другие, дообученные под анализ научных статей, историй болезней и клинических данных. ➖На HuggingFace можно найти предобученные модели практически под любую задачу — бери и дообучай под свои нужды! Правда, растет и число коммерческих закрытых сервисов (которые, конечно, не спешат делиться данными для своего обучения и другими хитростями). ❓А вот интересный вопрос: что лучше для анализа биомедицинских текстов — специализированный BioBERT или универсальный гигант типа ChatGPT или Claude? Оказывается, глубина знаний последних иногда не уступает узкоспециализированным моделям. 🔭 Трансформеры и ЭКГ: неожиданный союз Да-да, те самые трансформеры теперь анализируют и ЭКГ! Они классифицируют патологии, предсказывают сердечные приступы, находят аритмии. Иногда это чистые трансформеры (часто визуальные), иногда — гибриды, например трансформер + сверточная сеть. Есть даже специализированные модели вроде HeartGPT — прямо GPT, но для сердца! ➡️ Куда мы движемся? К мультимодальным универсальным трансформерам! Представьте: одна модель, которая принимает все: текст из истории болезни, изображение рентгена, ЭКГ, результаты лабораторных анализов, последовательность генома. И выдает комплексный анализ. Это уже не фантастика — это активно разрабатывается прямо сейчас. Мультимодальность легко достижима для трансформеров. Медицина трансформируется в буквальном смысле слова! Но подробнее про это в будущих постах. #openbio_education 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

Repost from N/a
🦠 Как обрабатывать данные переменной длины: ЭКГ, тексты и не только ЭКГ и текст. Казалось бы, что может быть между ними общего? В одном случае — последовательность символов, в другом — временные ряды. Совершенно разные по содержанию. 1️⃣ В старые добрые времена (ну, лет 10 назад ) их анализировали по-разному: тексты обрабатывали например скрытыми марковскими моделями, ЭКГ раскладывали в ряд Фурье или натравливали на них метод опорных векторов. У каждой модальности был свой инструментарий, свои методы, свои причуды. Пересечений было мало. 2️⃣ Все изменилось, когда пришли трансформеры В 2017 году исследователи из Google предложили архитектуру, которая изначально применялась для перевода текстов. Но оказалось, что эта штука — настоящий швейцарский нож! Трансформеры начали решать задачи, о которых их создатели даже не думали. И не только с текстами. ▪️Что происходит сейчас в биомедицине? ➖Архитектуры вроде GPT и BERT давно стали рабочими лошадками для анализа текстов. Появились их специализированные «медицинские» версии: BioBERT, Med-BERT и другие, дообученные под анализ научных статей, историй болезней и клинических данных. ➖На HuggingFace можно найти предобученные модели практически под любую задачу — бери и дообучай под свои нужды! Правда, растет и число коммерческих закрытых сервисов (которые, конечно, не спешат делиться данными для своего обучения и другими хитростями). ❓А вот интересный вопрос: что лучше для анализа биомедицинских текстов — специализированный BioBERT или универсальный гигант типа ChatGPT или Claude? Оказывается, глубина знаний последних иногда не уступает узкоспециализированным моделям. 🔭 Трансформеры и ЭКГ: неожиданный союз Да-да, те самые трансформеры теперь анализируют и ЭКГ! Они классифицируют патологии, предсказывают сердечные приступы, находят аритмии. Иногда это чистые трансформеры (часто визуальные), иногда — гибриды, например трансформер + сверточная сеть. Есть даже специализированные модели вроде HeartGPT — прямо GPT, но для сердца! ➡️ Куда мы движемся? К мультимодальным универсальным трансформерам! Представьте: одна модель, которая принимает все: текст из истории болезни, изображение рентгена, ЭКГ, результаты лабораторных анализов, последовательность генома. И выдает комплексный анализ. Это уже не фантастика — это активно разрабатывается прямо сейчас. Мультимодальность легко достижима для трансформеров. Медицина трансформируется в буквальном смысле слова! Но подробнее про это в будущих постах. #openbio_education 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

📰 Подготовили для вас свежие вакансии на стыке ML, биоинформатики и вычислительной биологии – от белкового дизайна и анализа
📰 Подготовили для вас свежие вакансии на стыке ML, биоинформатики и вычислительной биологии – от белкового дизайна и анализа геномных данных до разработки AI-моделей для онкологии, фармы и ранней разработки лекарств. 1️⃣ Статистик / Биостатистик / Биоинформатик | НИИ СБМ Роспотребнадзора, Лаборатория эпидемиологии, Москва Основные требования: 🔺Хорошее знание статистики или биостатистики, 🔺Готовность разобраться в нюансах биоинформатики Обязанности: Анализ опубликованных и собственных данных в рамках исследования нормальных показателей здоровья человека, а также при исследовании критических состояний. Написание обзоров и оригинальных статей, участие в проектах лаборатории. Написание скриптов для проведения расчётов и создания научной графики.. 2️⃣ ML-инженер | ГЕРОФАРМ, Москва Основные требования: 🔺Высшее образование в области информатики, биоинформатики, прикладной математики, хим- или биофизики 🔺 3+ лет опыта разработки ML-систем (Python, PyTorch/TF, scikit-learn, NumPy/Pandas) 🔺Опыт работы с Data Engineering-стеком (SQL/NoSQL, Spark/Dask, Airflow/Prefect) и GPU-вычислениями Обязанности: Проектирование и поддержка ETL-пайплайнов; разработка и валидация ML/AI-моделей (GNN, 3D-transformers, diffusion) для задач de-novo-дизайна, ADMET-прогноза и оптимизации процессов; внедрение MLOps (Docker, MLflow, CI/CD, деплой на GPU-кластер/K8s); участие в полном цикле in silico → in vitro совместно с химиками и биологами; ведение документации, обмен знаниями и поддержка подразделений. 3️⃣ Профессор по клинической биоинформатике | НТУ «Сириус», Сочи Основные требования: 🔺 Высшее естественно-научное образование, учёная степень доктора наук 🔺 Индекс Хирша ≥10 (WoS/Scopus, за последние 5 лет) 🔺 Опыт в биоинформатике/клинической генетике, стаж научно-педагогической работы от 5 лет Обязанности: Планирование и ведение учебной работы; руководство курсовыми и ВКР; организация исследований по направлению центра; разработка сценариев анализа генетических данных (WDL/Nextflow) и правил интерпретации; участие в магистратуре 4️⃣ «Клиническая биоинформатика». Специалист по белковому дизайну (ML/Биоинформатик) | МФТИ, Москва Основные требования: 🔺 Уверенное владение Python, базовые навыки анализа данных 🔺 Опыт работы с ML-инструментами белкового дизайна (VAE, protein LLM, inverse folding, diffusion models) 🔺 Научная амбициозность, умение работать в команде; опыт публикаций на английском — плюс Обязанности: Разработка и бенчмарк инструментов белкового дизайна; поиск gain-of-function мутаций для генных терапий; создание новых систем доставки и редактирования генома (AAV, Cas). 5️⃣ Старший биостатистик | Clinsoft, Армения Основные требования: 🔺 Высшее образование в статистике, биостатистике, науке о данных или смежных областях; PhD — преимущество 🔺 5+ лет опыта в статистическом анализе клинических данных, отличное владение R/Python 🔺 Отличный английский, опыт управления командой и проектов Обязанности: Применение продвинутых статистических методов (регрессия, модели со смешанными эффектами, анализ выживаемости, байесовская статистика); поддержка всех этапов анализа и отчётности в клинических исследованиях; разработка и рецензирование SAP, DMC/DSMB документов, TLF и FADS; участие в подготовке клинических отчётов и научных публикаций; оптимизация процессов анализа данных и соблюдение регуляторных требований (FDA, ICH, GDPR). #openbio_вакансии 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

📰 От виртуальных лабораторий с командой LLM-агентов до предсказания 9 миллиардов геномных вариантов: новые публикации показы
📰 От виртуальных лабораторий с командой LLM-агентов до предсказания 9 миллиардов геномных вариантов: новые публикации показывают, как ML решает задачи, которые ещё недавно требовали месяцев ручной работы 1️⃣ «Виртуальная лаборатория»: LLM-команда, которая проектирует нанотела Исследователи представили Virtual Lab - связку «PI-агента» и команды LLM-учёных, которых направляет человек-куратор. Система сама планирует встречи, генерирует гипотезы и собирает пайплайн: ESM для эмбеддингов, AlphaFold-Multimer для комплексов и Rosetta для скоринга. На выходе - 92 новых нанотела против SARS-CoV-2; два из них показали улучшенную связываемость с вариантами JN.1 и KP.3 при сохранении силы к ancestral-спайку. Быстрый, воспроизводимый цикл «идеи→эксперимент». 2️⃣ Где прячутся резервуары орто­поксвирусов Команда объединила эколого-филогенетические признаки хозяев с вирусными геномными фичами и обучила ML-модели, предсказывающие вероятные резервуары OPV. Добавление именно вирусных геномных признаков резко повысило точность. Карта «горячих зон» легла на ЮВ Азию, экваториальную Африку и Амазонию - регионы с низким охватом вакцинацией от оспы, что повышает риск установления зоонозов. Результаты пригодны для таргет-надзора и планирования секвенирования в дикой природе. 3️⃣ Nearl: признаки из молекулярной динамики Nearl решает узкое, но больное место: как превратить многомерные траектории молекулярной динамики в компактные информативные признаки для задач классификации/регрессии. Пайплайн автоматически извлекает временные и структурные дескрипторы, нормирует, снижает размерность и готовит кросс-валидацию - по сути мост между физическими симуляциями и предсказательным моделированием свойств молекул и сайтов. Инструмент опубликован в Bioinformatics (май 2025) и ориентирован на большие ансамбли МД. 4️⃣ «Честный» дисбаланс данных ускоряет поиск противоинфекционных хитов В скрининге PubChem-биоанализов по четырём инфекциям классы крайне несбалансированы. Авторы системно подбирают «правильный» Imbalance Ratio через K-RUS и гоняют 5 классических ML и 6 DL-алгоритмов. Вывод прагматичен: умеренный дисбаланс 1:10 стабильно улучшает обобщение (лучший баланс TPR/FPR у конфигурации 10-RUS) и снижает ложноположительные. Плюс - анализ химического сходства объясняет природу ошибок. Практическая методичка для ИИ-driven drug discovery. 5️⃣ Мультивидовая ДНК-LM для эффектов вариантов по всему геному GPN-MSA - «языковая модель ДНК», которая учится на выравнивании целых геномов многих видов и за часы тренировки даёт state-of-the-art на клинических базах (ClinVar, COSMIC, OMIM), функциональных ассаях (DMS, DepMap) и популяционных данных (gnomAD). Модель предсказывает вредоносность как кодирующих, так и некодирующих SNV и публикует предсчитанные оценки для ~9 млрд возможных замен в геноме человека - мощный ресурс для диагностики редких болезней и burden-тестов.
➡️ P.S. Идут последние часы записи к нам на 174-часовую программу повышения квалификации по машинному обучению по старой цене - оставьте заявку, чтобы зафиксировать текущую стоимость.
#openbio_news 📌Машинное обучение в биологии и биомедицине |OpenBio.Edu — подписывайтесь!

🔬 Как кастомизировать нейросеть под свою задачу? Модульность в действии Модульность - это как конструктор Lego, только для нейросетей! Каждый модуль - отдельный кирпичик со своими входами и выходами, который можно комбинировать с другими как угодно. ➡️ Разберем на примере сверточных сетей Представьте: каждый повторяющийся блок - сэндвич из Convolutional Layer, Pooling Layer и Activation Function. А на самом верху - полносвязный слой, который выносит финальный вердикт. Чем больше таких блоков, тем глубже сеть. В этом кроется отличие ResNet-18 от ResNet-152. Большие сети ловят более абстрактные паттерны, но зато тяжеленькие и медленные. Компромиссы, как всегда ... А если данных много и они разные Допустим, у вас есть и картинки, и звук. Было бы здорово обработать все вместе? Тут на помощь приходят мультимодальные архитектуры! Каждая модальность получает свой энкодер (по сути, отдельную мини-сеть), а потом их выходы сливаются воедино. Можно просто склеить (конкатенация), а можно красиво - через модуль с механизмами внимания. Нужна еще одна модальность? Без проблем - просто добавляете еще один энкодер! Как выбрать нужное количество модулей В PyTorch это вообще легко - просто указываете нужный размер модели, и все. Для мультимодальных задач посложнее есть готовые фреймворки типа TorchMultimodal, в которых конструируете из модулей что душе угодно. Или можете написать свои модули и собрать из них что-то уникальное! ❕ Главное преимущество Работа с модулями - это быстро, удобно и приятно. Нужна огромная сеть? Пожалуйста! Компактная модель? Легко! Точно так же, как из кубиков Lego, из модулей собираются нейросети любой сложности под вашу конкретную задачу. На курсе мы как раз тренируемся подключать новые модальности «как кирпичи»: отдельные энкодеры для изображений и омикс-дат. #openbio_education 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

Новые тарифы на курс «Машинное обучение в биологии и биомедицине»! Главная новость — у нас появились тарифы для друзей ❤️ Есл
Новые тарифы на курс «Машинное обучение в биологии и биомедицине»! Главная новость — у нас появились тарифы для друзей ❤️ Если подать заявку вместе с другом, записаться на курс можно со скидкой 30%, а для друзей-студентов скидка будет ещё больше - аж целых 35%. Учиться в компании у нас теперь не только интереснее, но и выгоднее! 📌 Также остаются и привычные форматы: 🔸Самостоятельный – для тех, кто подается на курс индивидуально 🔸От работодателя – при подаче заявки на обучение с оплатой от работодателя 1 октября у нас поднятие цен и сейчас отличный момент, чтобы выбрать подходящий именно вам тариф и присоединиться на самых выгодных условиях! Подробнее о каждом тарифе — на нашем сайте. 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

База знаний OpenBio: подборка интервью с экспертами Собрали для вас в одном месте ссылки сразу на несколько записей встреч с
База знаний OpenBio: подборка интервью с экспертами Собрали для вас в одном месте ссылки сразу на несколько записей встреч с ведущими учёными и специалистами в биологии, биоинформатике и смежных областях. Смотрите интервью, вдохновляйтесь историями экспертов и расширяйте свои знания! 🔸Антон Чугунов - преподаватель МФТИ, сооснователь «Биомолекулы» 🔸Фёдор Колпаков – Руководитель вычислительной биологии, НТУ «Сириус», ФИЦ ИВТ. 🔸Юрий Вяткин – Директор по инновациям NOVEL, с.н.с. МГУ. 🔸Илья Воронцов – Data-исследователь, ИОГен РАН, МФТИ, преподаватель курса 🔸Артём Касьянов – PhD, биоинформатика, BIOPOLIS, Португалия. 🔸Александр Сарачаков – Team Leader AI&ML, BostonGene, преподаватель МФТИ/СПбШКС и курса OpenBio 🔸Андрей Девяткин – к.б.н., Лаборатория вычислительных методов, МФТИ. 🔸Дмитрий Пензар – Преподаватель ФББ МГУ, со-руководитель группы ML в биологии. 🔸Арсений Зинкевич – Старший преподаватель, менеджер магистратуры ФББ МГУ, соруководитель группы по ML. 🔸Ольга Кардымон – Руководитель группы «Биоинформатика», AIRI. #openbio_edu #openbio_experts 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!

OpenBio-2025: вместе открываем будущее науки Уже завтра стартует форум OpenBio-2025 - главная площадка для диалога учёных, студентов и индустрии в области биотехнологий и медицины. 🔭 Когда: 23 сентября 📌 Начало онлайн-трансляции: 9:00 (МСК) В программе: • НАУЧНАЯ КОНФЕРЕНЦИЯ в 6 секциях (биотехнология, молекулярная биология, фундаментальная медицина, биоинформатика, биофизика, вирусология) • БИЗНЕС-ФОРУМ - экспертные дискуссии, круглые столы, выступления лидеров отрасли, мастер-классы, презентации новых технологий и оборудования. ОТРАСЛЕВАЯ ВЫСТАВКА биотехнологических и биофармацевтических компаний ➖С подробной программой мероприятия можно познакомиться тут Не получится присутствовать? ➡️ Подключайтесь к онлайн-трансляции! Это уникальная возможность услышать экспертов мирового уровня из любой точки мира, поучаствовать в дискуссии и задать вопросы спикерам. 📌 Машинное обучение в биологии и биомедицине | OpenBio.Edu — подписывайтесь!