932
Subscribers
No data24 hours
No data7 days
No data30 days
Data loading in progress...
Similar Channels
No data
Any problems? Please refresh the page or contact our support manager.
Tags Cloud
No data
Any problems? Please refresh the page or contact our support manager.
Incoming and Outgoing Mentions
---
---
---
---
---
---
Attracting Subscribers
November '24
November '24
+20
in 0 channels
October '24
+33
in 1 channels
Get PRO
September '24
+789
in 1 channels
Get PRO
August '240
in 1 channels
Get PRO
July '24
+108
in 20 channels
| Date | Subscriber Growth | Mentions | Channels | |
| 30 November | 0 | |||
| 29 November | +1 | |||
| 28 November | 0 | |||
| 27 November | 0 | |||
| 26 November | 0 | |||
| 25 November | 0 | |||
| 24 November | +1 | |||
| 23 November | 0 | |||
| 22 November | 0 | |||
| 21 November | 0 | |||
| 20 November | +9 | |||
| 19 November | +1 | |||
| 18 November | 0 | |||
| 17 November | 0 | |||
| 16 November | 0 | |||
| 15 November | +1 | |||
| 14 November | 0 | |||
| 13 November | +2 | |||
| 12 November | 0 | |||
| 11 November | 0 | |||
| 10 November | 0 | |||
| 09 November | 0 | |||
| 08 November | 0 | |||
| 07 November | +1 | |||
| 06 November | 0 | |||
| 05 November | +2 | |||
| 04 November | +1 | |||
| 03 November | 0 | |||
| 02 November | 0 | |||
| 01 November | +1 |
Channel Posts
У нас теперь три лауреата Yandex ML Prize!
После успеха Влада и Саши в прошлом году, Илья Зисман выиграл в номинации «Первая публикация» за исследование Emergence of In-Context Reinforcement Learning from Noise Distillation, представленное на ICML 2024. В нашем недавнем посте можно найти подробности работы.
Поздравляем Илью, а его новый новый бэнгер уже на подходе ⭐️
- - —
@dunnolab
| 2 | https://support.google.com/youtube/answer/7631406?hl=en | 2 |
| 3 | AWESOME IN-CONTEXT REINFORCEMENT LEARNING
😎 In-Context RL (внезапно) начинает набирать массу в научном коммьюнити: от 2 сабмитов world-wide на последние ICML и NeurIPS -> до 10 на свежий ICLR. А вот классического awesome списка еще не подвезли. Исправляем.
👊 Будет полезно, если хотите вкатиться в область: а она далеко не только про чистый RL, но и про то как ICRL выковыривать из LLM.
💫 Hit the star and subscribe button -> awesome-in-context-rl
- - —
@dunnolab | 1 287 |
| 4 | Вы не ждали, да и мы тоже. Мы организуем соревнование по Multi-Agent Reinforcement Learning в рамках AIJ.
В прошлом году на NeurIPS была классная сорева MeltingPot, где требовалось создать агентов для mixed-motive cooperation. Такая постановка задачи сейчас является одним из фронтиров в MARL. Поэтому по ее мотивам, мы сделали свою небольшую вариацию, с помощью которой вы можете вкатиться в MARL, порешать нетривиальную задачу и разобраться в sota-методах.
К этому всему идет куча приятных бонусов:
🤑 2,500,000₽ — Призовой фонд. Туда-сюда миллионер, за вычетом НДФЛ, конечно.
⏫ За самого быстрого агента (для топ-10) на диком востоке можно залутать еще 200к, приятно.
😶🌫️ А победителей мы лично вытащим погабиться и покурить шишу.
Соревнование уже запущено и закончится 28-го октября. А 3-го числа Никита (@Nikita_Lyubaykin) и Влад (@vkurenkov) проведут разбор задачи и ответят на ваши вопросы, все детали тут.
- - —
@dunnolab | 3 144 |
| 5 | 👩🌾 Мы закрыли набор на стажировку. Каждому кто прислал нам свое решение мы уже отправили подробный фидбек. Надеемся, вы нашли тестовое и фидбек к нему полезным.
А можно посмотреть на хорошие решения?
Делимся с вами парой решений [Cinemere 2024, Komershan 2024], которые нам понравились. Спасибо Альбине (@cinemere) и Саше (@Komershan), что захотели ими поделиться.
А что с новыми наборами?
Новые наборы планируются, и все анонсы обязательно будут в этом канале. Однако, у нас нет фиксированных дат и мы открываем волны отталкиваясь от возможностей нашей команды интегрировать стажеров, дать им качественную поддержку и вместе построить что-то крутое.
- - —
@dunnolab | 1 320 |
| 6 | 👩🌾 Осталась неделя до окончания набора на стажировку!
- - —
@dunnolab | 2 037 |
| 7 | XLand-100B: A Large-Scale Multi-Task Dataset for In-Context Reinforcement Learning
🤠 Датасет на 100 миллиардов токенов (+ небольшая версия на 20 миллиардов)
🤠 Рабочие имплементации для Algorithm Distillation и Decision Pre-Trained Transformer
🤠 PPO-RNN и скрипты для сбора своих датасетов
статья – код – блогпост
Как вы могли понять, мы занимаемся ICRL и много. Если хотите делать это с нами, то все еще есть две недели, чтобы попасть к нам на стажировку!
- - —
@dunnolab | 2 257 |
| 8 | Рассказываем о нашей работе принятой на ICML 2024. В деталях.
🌻Контекст🌻
In-Context RL позволяет обучать агентов способных на адаптацию к новым задачам прямо во время инференеса, то есть zero-shot. При этом не происходит обновлений весов модели или обучения Q-функции; вся адаптация вшита при обучении в механизм внимания.
Не сказка ли? Может быть, если бы не одно но: процесс сбора данных. В AD предлагается поступить так: возьмём n задач в среде и для каждой из них обучим своего RL-ного агента. Во время обучения будем сохранять их полную историю обучения, то есть все состояния, действия и награды. Таким образом мы соберём n историй обучения, в начале которых агент не умеет ничего, а в конце уже успешно решает задачу. На них и будем обучать трансформер предсказывать следующее действие.
Но что это за число n? Какого оно порядка? Оказывается, для успешного обучения на весьма простой задаче нужно обучить около тысячи (sic!) RL агентов. Понятно, что такой подход недёшев в плане вычислений и времени.
🌻Что предлагаем мы?🌻
Чтобы облегчить сбор данных и тем самым приблизить in-context RL к применению в реальных задачах, мы предложили способ генерации историй с помощью шума.
Часто так бывает, что мы не можем решить задачу с нуля RL-ем, но имеем некоторый набор почти оптимальных демонстраций. Мы можем обучить на этом обычный Behavior Cloning, но он не будет обладать способностями к in-context, т.к. данные не содержали истории обучения. Как же теперь получить историю обучения, когда мы имеем только конечную политику эксперта?
Идея простая: давайте просто начнём постепенно добавлять больше и больше шума, то есть с вероятностью ε будем делать действие по политике, а с вероятностью 1 - ε делаем случайное действие. При этом с каждым шагом мы увеличиваем ε вплоть до единицы. Получается, что когда ε = 1 агент не умеет ничего, а при ε = 0 успешно решает задачу. Вот мы и восстановили историю (на самом деле, получили прокси историю) обучения.
🌻И это работает?🌻
Да.
Для тестирования мы использовали классические в in-context RL среды: Dark Room (grid-MDP), Dark Key-to-Door (grid-POMPD), Watermaze (3D-MDP). Обученный на наших данных агент приобретает способности in-context адаптации к новым задачам. Что удивительно, вы можете использовать для генерации демонстрации далекие от оптимальных. Например, наш агент в некоторых случаях смог превзойти лучший результат в данных более чем в два раза.
код – статья – постер (4k) – ilya's talk
- - —
@dunnolab | 12 673 |
| 9 | Мы ищем стажеров!
👩🌾 shorties — это персональная программа, в которой мы выращиваем таланты до полноценных Research Engineer’ов или Research Scientist’ов в зависимости от ваших интересов.
🔭 Intern Research Scientist
Вы будете заниматься написанием статей на top-tier ИИ конференции (NeurIPS, ICLR, ICML) и участием в научном дискурсе: проведение экспериментов, проверка и генерация исследовательских идей, которые направлены на развитие научного знания.
🧪 Intern Research Engineer
Вы будете заниматься созданием новых frontier-технологий и применением Reinforcement Learning в реальных задачах.
Тестовые задания и подробные описания позиций можно найти по ссылкам выше, дедлайн подачи заявки — 15 августа.
- - —
@dunnolab | 20 062 |
| 10 | Привет! Это ду́но.
Мы коллектив исследователей на базе AIRI. Нас можно знать как экс-команду из Tinkoff Research, которая делала заметный движ с Reinforcement Learning: 7 статей на NeurIPS / ICML за последние три года.
Этот канал — точка сборки, где мы будем рассказывать про наши новые статьи, технологии, проекты, эвенты и возможности поработать с нами. Мы строим свою работу на нескольких принципах:
— Technology-first. Построение frontier-технологий и движение научного дискурса рука об руку. Мы не занимаемся публикациями ради публикаций, наша работа направлена на поиск и разработку новых технологий.
— No new science, no new technology. Мы понимаем, что построение новых технологий невозможно без поиска и влёта с ноги в новые (иногда неочевидные и рисковые) научные области. Мы постоянно ищем их и размышляем, за какими из них будущее.
— Deep connections. Мы взращиваем студентов, стараясь образовывать стабильные и долгосрочные связи с ними за счет активного менторства. Мы не даём 50 идей для рисерча🥴и не бросаем студентов на волю судьбы, мы занимаемся наукой и технологиями вместе.
Построить ASI не обещаем, но интересные вещи сделаем и поделимся ими здесь с вами.
Stay tuned.
- - —
Влад К., Саша Н., Никита Л., Илья З., Андрей П. | 4 902 |
