Агенты ИИ | AGI_and_RL
رفتن به کانال در Telegram
Про ии, RL и в целом @tokarev_i_v https://t.me/researchim
نمایش بیشتر6 185
مشترکین
+624 ساعت
+147 روز
+5630 روز
آرشیو پست ها
+1
Челы натренили прям оч мелкие модельки 25М-121М параметров чтобы на всяких микродевайсах гонять
и на некоторых спец задачах должны быть лучше чем более крупные модельки
в целом прикольно что они прям оч мелкие. такое и дома можно пытаться делать)
https://github.com/cactus-compute/needle
штошь. это оно еще не на looped fly brain построено
https://www.reddit.com/r/LocalLLaMA/comments/1wi9fau/qwen_38_27b_running_for_63_hours_on_a_rtx_3090_to/
☁☁☁☁☁☁☁
Ребятки, там 24 сентября состоится Yandex Scale 2026 от Yandex Cloud.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 Будут пять треков: AI, Data, Security и Hybrid Infrastructure & DevOps, а еще чисто онлайновый DeepTech. Тут расскажут как ускорили Lua в Valkey (получили x2-x5 по скорости)
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 Как эффективно строят ЛЛМный инференс для агентов в Yandex AI Studio на примере DeepSeek-V3.2 и DeepSeek-V4-Flash (дипсик легенды) Что случается и какие нюансы возникают когда строишь одновременно распределённый, транзакционный и линейно масштабируемый поиск (на примере векторного, полнотекстового и гибридного поиска в YDB)
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 Покажут как инфраструктура обеспечивает построение управляемых сервисов на агентах и как мониторить ИИ-агентов. Еще сможете заглянуть под капот сети облака — Interconnect, Private Link, Inbound DNS и DNS Firewall, которые складываются в герметичный контур между Yandex Cloud, on-premises и другими облаками.Полную программу можно посмотреть на сайте, там же — зарегистрироваться. Участие бесплатное! Реклама. ООО "Яндекс.Облако" ИНН 7704458262. Erid: 2Vtzqwy8WBv
+2
Ребятки учили Qwen 3.5 35B A3B молекулы дизайнить. Надеюсь молекулярные на месте
дальше от ллмки тк что именно за датасеты и фреймворки молекулярные и как они работают я не особо понимаю:
Как устроен процесс трена
1. Создают 200k задач, которые относительно просто генерить на молекулах из ZINC. Из ZINC берут исходную молекулу, через RDKit и OpenEye считают 116 молекулярных свойств. Случайно выбирают одно свойство, которое нужно улучшить, ещё 2–4 превращают в ограничения, а через BRICS задают каркас молекулы, который должен сохраниться. Так автоматически получают задачи вида: увеличить QED, но удержать молекулярную массу и TPSA в заданных пределах и сохранить исходный каркас. В статье публичную реализацию их генератора задач не дают.
2. Qwen сама генерирует новую молекулу. Модель получает исходную молекулу + цель + ограничения и предлагает новый SMILES. Затем через инструменты проверяет, что получилось, меняет структуру и повторяет. То есть ЛЛМ — генератор, а RDKit/OpenEye здесь играют роль верификатора.
3. После этого переходят к реальным экспериментально определённым структурам белок–лиганд. Для второго этапа берут 999 комплексов из PLINDER. Информацию о кармане связывания переводят в текст: какие водородные связи уже есть, где есть стерические столкновения, какие полярные участки свободны, какие аминокислотные остатки окружают лиганд. LLM уже редизайнит молекулу с учётом конкретного кармана белка. В статье публичную реализацию этого преобразования 3D-структуры в текст тоже не дают.
4. Каждый перспективный SMILES проверяется в 3D. POSIT размещает новую молекулу в кармане белка, используя экспериментальное положение исходного лиганда как шаблон. Затем Chemgauss4 быстро оценивает получившуюся форма. Оценка возвращается обратно LLM, и она решает, как изменить следующую молекулу. Этот дорогой оценщик можно вызвать максимум пять раз за один цикл — модель должна научиться не тупо перебирать варианты, а выбирать, что действительно стоит проверять.
5. Весь этот агентный цикл обучают через RL. Для этого используется открытый prime-rl: одни процессы генерируют цепочки действий модели, обучающий процесс параллельно обновляет её веса. Награда учитывает улучшение целевой характеристики, соблюдение ограничений, валидность молекулы и количество вызовов инструментов. На Tier-1 целью является одно из молекулярных свойств, а на Tier-2 — улучшение предсказанного связывания с белком. Сначала RL идёт на дешёвом Tier-1, затем — на более дорогом Tier-2.
В конце модель проверяют на 40 новых системах белок–лиганд, которых не было в обучении. Вместо Chemgauss4 используют SQM2.20 — более дорогой и физически детальный метод оценки связывания на основе полуэмпирической квантовой механики. Один такой расчёт занимает уже десятки минут, поэтому масштабировать RL напрямую на нём слишком дорого. Именно здесь проверяют, перенёсся ли навык, выученный на дешёвых упрощённых задачах, на более качественный оценщик. Tier-2 берут из официального train split PLINDER, а эти 40 систем — из test split, чтобы не было утечки между train и evaluation.
Training Large Language Models for Small-Molecule Design with Synthetic Task Scaling
https://arxiv.org/abs/2609.04735
https://www.alphaxiv.org/ru/abs/2609.04735
Repost from N/a
Сделал студию для симуляций и обучения роботов.
Пока что есть поддержка только ACT и SmolVLA на роборуке за 100 баксов - so100.
Куча твиков, ведро готовых ассетов, RL, и прочие вкусности в комплекте.
Тестировалась и собиралось на оч специфичном железе, так что правки приветствуются
Repost from (sci)Berloga Всех Наук и Технологий
Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
Кажется я знаю на чем построена новая моделька OpenAI которая зарешала Навье-Стокса
+1
Дипсики нам выложили мультимодальный
DeepSeek-V4.1-Flash 552B A8/16B
кажется прям круто) хотя дома мало кто сможет запустить
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Квантов анслота пока не видел
ее уже в браузерную игру запихнули.
https://github.com/dzhng/fly-escape
https://fly-escape.vercel.app/
Вообще я думаю может в рл студию как-то тоже добавить но это чисто для прикола конечно
Про лупед трансформеры которые возможно лежат в базе Астры
https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and
там рлем тот учат тот самый мозг мухи играть в beat saber
https://x.com/_lyraaaa_/status/2097527368919470162
Майкрософты потюнили 4B Qwen-3.5 на 61.5% Swe-bench verified чисто генерацией задач и рлем
FrogNano: Training a 4B Coding Agent via
Online Task Synthesis
https://microsoft.github.io/debug-gym/static/papers/frognano_technical_report.pdf
https://microsoft.github.io/debug-gym/
Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам интересно
https://adityamakkar000.github.io/posts/async-rl-jax.html
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах
нуи в целом схема как там устроено все на скрине, прикольно
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
https://arxiv.org/abs/2608.15763
https://www.alphaxiv.org/ru/abs/2608.15763
+1
Квены потренили Qwen 3.5 4B для автопилота
добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) +
добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlm
ну и учили в 4 этапа все эти части
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
https://arxiv.org/abs/2609.00111
https://www.alphaxiv.org/ru/abs/2609.00111
PS статьи собираем и проекты делаем в https://t.me/researchim
Пока ходил искал алгоритмы которые в студию завести полезно собрал список *Zero алгоритмов
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
https://arxiv.org/abs/1712.01815
https://www.alphaxiv.org/ru/abs/1712.01815
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model
https://arxiv.org/abs/1911.08265
https://www.alphaxiv.org/ru/abs/1911.08265
Online and Offline Reinforcement Learning by Planning with a Learned Model
https://arxiv.org/abs/2104.06294
https://www.alphaxiv.org/ru/abs/2104.06294
Learning and Planning in Complex Action Spaces
https://arxiv.org/abs/2104.06303
https://www.alphaxiv.org/ru/abs/2104.06303
Mastering Atari Games with Limited Data
https://arxiv.org/abs/2111.00210
https://www.alphaxiv.org/ru/abs/2111.00210
EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data
https://arxiv.org/abs/2403.00564
https://www.alphaxiv.org/ru/abs/2403.00564
ReZero: Boosting MCTS-based Algorithms by Backward-view and Entire-buffer Reanalyze
https://arxiv.org/abs/2404.16364
https://www.alphaxiv.org/ru/abs/2404.16364
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
https://arxiv.org/abs/2406.10667
https://www.alphaxiv.org/ru/abs/2406.10667
One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning
https://arxiv.org/abs/2509.07945
https://www.alphaxiv.org/ru/abs/2509.07945
Object-Centric World Models Meet Monte Carlo Tree Search
https://arxiv.org/abs/2601.06604
https://www.alphaxiv.org/ru/abs/2601.06604
PriorZero: Bridging Language Priors and World Models for Decision Making
https://arxiv.org/abs/2605.12289
https://www.alphaxiv.org/ru/abs/2605.12289
Ну и либа в которой большая часть из них сделана и ребята новые алгоритмы создают время от времени:
https://github.com/opendilab/LightZero
+1
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio
туда добавлены некоторые multi agent rl алгоритмы
world models и алгоритмы которые с ними работают
efficient zero v2 (на скрине тренится на одной из задач nethack
куча енвов
все пока в процессе тестов и отладки)
