AI for biology
Open in Telegram
Только то, что мне интересно в применении AI для конкретных биологических задач. Ну и немного личного) Ольга Кардымон -Team Lead группы биоинформатика в AIRI, влюблена в медицинскую генетику и считаю, что мне повезло в чувствах) @Olga_Kardymon
Show more484
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Как же тяжело упрощать информацию в живой беседе. Нет-нет и случайно соврешь. Не потому, что хочешь обмануть, а лишь потому, что неудачно сократил или пример выбрал. И обычному слушателю это непонятно, а сама, когда переслушиваю, ловлю, что вот тут не совсем так, но близко. А вот тут могла бы и удачнее пример использовать. А вот здесь какое-то дурацкое слово: и не русское, и не английское. И отдельно озадачивает, когда после, на мой взгляд, максимально упрощенного и переформулированного материала для широкой публики после лекции подходят слушатели и говорят: «Спасибо, Ольга! Невероятно интересно. Но ничего не понятно)))» Ох, когда-нибудь натренирую навык и просто, и понятно, и не соврав ни разу. А пока делюсь крайним интервью о себе любимой, группе и наших проектах: https://t.me/dl_stories/772
Интервью записывалось по заранее собранным вопросам в анонсе подкаста.
Не могу не поделиться этой новостью. Вообще-то, это невероятный успех победить в таком соревновании. Часто пиарят разработки на основе ИИ, которые выглядят как что-то очень крутое, но если начинать вникать и копать - то находишь решения и получше, и в большом количестве. А тут ребята показали, что могут лучше, чем другие команды в мире решать задачи навигации роботов. Это очень круто! Возвращает к пониманию, что мы способны не догонять в своих разработках, а задавать тренды. Коллеги, поздравляю! https://t.me/airi_research_institute/284
Съездила сегодня на завод Biocad. Теперь я знаю как из 120 мл клеток яичников китайского хомячка с вектором нужного содержания получают 12 кг антител. Очень впечатлило.
Repost from Институт AIRI
Продолжаем рассказывать про выступления исследователей AIRI на ПМЭФ 👀
На сессии «AI Journey: путешествие в мир искусственного интеллекта», которая начнется завтра в 14:00, спикеры обсудят сразу несколько актуальных вопросов:
– Какие новейшие разработки и тренды можно выделить в области AI/ML?
– Какие результаты могут быть достигнуты в направлении AGI?
– Как применяется искусственный интеллект сегодня и как он влияет на нашу жизнь?
Подключайтесь к онлайн-трансляции📼
Друзья, пока мы досчитываем эксперименты с GENA на архитектурах Memup и RMT, быстро подготовили препринт по уже проделанной работе с остальными моделями семейства. Здесь вы найдете и подробное описание как обучали модели, и чем отличаются между собой, и сравнение на 5 задачах: поиск промоторов, аннотация сайтов сплайсинга, профилирование хроматина, полиаденилирование и определение энхансеров и дрозофилы. https://www.biorxiv.org/content/10.1101/2023.06.12.544594v1 .
На этой неделе столкнулась с критикой разработок нашей команды и меня лично. Но что можно сказать лучше, чем говорят цифры. Языковая модель ДНК GENA за последний месяц в 2-х архитектурах суммарно набрала более 1 000 скачиваний. А мы еще не успели статью дописать…https://huggingface.co/AIRI-Institute
Пока мы очень терпеливо отвечаем на вопросы рецензента о нашей модели Prostata для оценки стабильности белков с использованием трансформера, в Тунисе датасайнтисты уже выиграли хакатон, положив в основу наше решение и улучшив его. Хорошо что есть препринты и открытый код. Хорошо, когда результаты используются для решения задач. И вообще с современными темпами развития AI ну нельзя столько времени рецензировать работы… пока статья выйдет - уже состарится. Эх.
Кажется, что интересная возможность пополнить список публикаций статьей из ВАКовского журнала, с англоязычной версией на Springer. Коллеги говорят, что прошлогодние статьи за эти полгода уже цитируются. Ну еще и 1 млн выиграть можно 🙂 В общем, информация:
В рамках международной конференции AI Journey 2023 приглашаем принять участие
в отборе научных статей по AI/ML для публикации в журнале «Доклады Российской академии наук. Математика, информатика, процессы управления» и его англоязычной версии «Doklady Mathematics».
Журнал:
• Индексируется в крупнейших библиографических базах данных научного цитирования
• Доступен широкому кругу читателей на портале Springer (в английской версии)
• Публикуется на eLIBRARY – крупнейшей российской научной электронной библиотеке
• По рекомендациям ВАК – журнал относится к категории К1 для учета публикаций на соискание научных степеней
Помимо самой публикации, авторы получат возможность выступить с докладами
на AI Journey, а за лучшую статью предусмотрен денежный приз — 1 миллион рублей!
Ознакомиться с правилами и подать заявку можно на сайте AI Journey (https://ai-journey.ru/science/)
Хорошие активности надо поддерживать:
«Друзья, коллеги, которые из биотеха и медицины, барев дзес! Помогите, пожалуйста, распространить классную новость!
Мы с Institute of Bioinformatics Research and Education (IBRE). проводим хакатон, в котором запланированы треки как, непосредственно, по биоинфу, так и (новинка!) по медицинской статистике. На этот раз в прекрасном Ереване, с 11 по 13 августа. В хакатоне можно принять участие как в качестве исследователя/разработчика, так и подав собственный проект. Заявки принимаются до 15 июня. Ссылка на сайт проекта - в первом комментарии.
Будем рады видеть вас!»
Успехов, коллеги! И приятного времяпрепровождения!
Ни в коем случае не хочу дискредитировать обожаемую мной биоинформатику, но мем из народа смешной) (простите, не знаю автора)
Смотрите что умеет футболист от DeepMind. Помните как AI проверяли в игре с шахматистами. Интересно, когда увидим поединок сборной Аргентины против сборной DeepMind.
Repost from Kali Novskaya
#nlp #про_nlp
"Во-первых, это красиво..."
Все постят этот восхитительный гайд по архитектурам LLM. Очень люблю такие майндмэпы — легко запомнить, систематизировать, использовать в лекциях
После того, как мы выложили препринт по модели PROSTATA, twitter взорвался комментариями, что эти русские плохо английский знают, понятия не имеют что это слово означает. Беда-беда) Единицы догадались об акрониме и чувстве юмора у коллег.) А тут такое! Коллеги, ну русский тоже можно учить) а то, как говорится, «как корабль назовешь…»
Repost from Градиент обреченный
🔺 Это GigaChat
Друзья, несколько месяцев мы экспериментировали с инструктивным обучением и потихоньку начинаем делиться нашими наработками в области ChatGPT-подобных моделей.
🔸 Сегодня мы хотим анонсировать наше творение, которое было решено назвать GigaChat, а модели в его основе — NeONKA.
🔸 Текущая версия основана на претрейне ruGPT3.5 13B + SFT (supervised fine-tuning).
🔸 В side by side тестах GigaChat vs ChatGPT (когда разметчики выбирают предпочтительный вариант) результат — 30:70 в пользу последней (начинали с 3 против 97).
🔸 Детали "Неонки" мы будем потихоньку выкладывать в открытый доступ, чтобы сообщество могло самостоятельно тренировать подобные модели.
👉 Хабр
Ребята - молодцы, русский chatGPT - gigachat. Честно работают и выкладывают в открытый доступ. Честно признают, что пока не превосходят своего основателя. Но ничего, подождём. Всему свое время. Главное продолжать работать.
Тем временем вышла хорошая статья, к которой я немного приложила руку. Просто о том, чем мы занимаемся.
И краткое сравнение выложенных моделей GENA на основе Bert и BigBird:
🟢 данные обучения:
Bert—based - T2T
BigBird - based - T2T + SNPs augmentations
🟢 маскимальная длина входа в токенах:
Bert-based: 512
BigBird-based: 4096
🟢 словарь:
в Bert-based словарь менее качественный (по анализу от коллег из ИТМО)
(Ребята, спасибо и теплый привет!)
🟢 Bert быстрее, потребляет меньше памяти, но на ряде задач проигрывает BigBird в предскзаниях
Repost from Институт AIRI
🔥 Пополнение в репозитории GENA новой моделью на архитектуре BigBird!
Исследователи из групп «Биоинформатика» и «Новые нейросетевые архитектуры» сделали еще один шаг на пути к универсальной языковой модели ДНК и начали пополнять репозиторий GENA дополнительными решениями.
Результаты экспериментов показали, что для разных прикладных задач требуются разные архитектуры с разной входной длиной последовательности и скоростью обучения.
🌐 Gena-lm-bigbird-base-t2t – это трансформерная модель на архитектуре BigBird, основанная на кодовой базе HuggingFace и обученная на полном геноме человека T2T в рамках работы над развитием проекта GENA_LM (прочитать подробнее про Gena можно тут).
Новая модель может работать с последовательностями ДНК длинной до 24000 нуклеотидов, что в 8 раз превышает возможности предшественника.🧪
🧬 Дальше – больше! Исследователи активно экспериментируют с обучением других нейросетевых архитектур – ждите очередного пополнения репозитория в ближайшее время.
🖇 Ищите модель и веса по ссылке и следите за обновлениями!
