ch
Feedback
Агенты ИИ | AGI_and_RL

Агенты ИИ | AGI_and_RL

前往频道在 Telegram
6 185
订阅者
+624 小时
+147 天
+5630 天
帖子存档
photo content

Челы натренили прям оч мелкие модельки 25М-121М параметров чтобы на всяких микродевайсах гонять и на некоторых спец задачах д
+1
Челы натренили прям оч мелкие модельки 25М-121М параметров чтобы на всяких микродевайсах гонять и на некоторых спец задачах должны быть лучше чем более крупные модельки в целом прикольно что они прям оч мелкие. такое и дома можно пытаться делать) https://github.com/cactus-compute/needle

штошь. это оно еще не на looped fly brain построено https://www.reddit.com/r/LocalLLaMA/comments/1wi9fau/qwen_38_27b_running_
штошь. это оно еще не на looped fly brain построено https://www.reddit.com/r/LocalLLaMA/comments/1wi9fau/qwen_38_27b_running_for_63_hours_on_a_rtx_3090_to/

☁☁☁☁☁☁☁ Ребятки, там 24 сентября состоится Yandex Scale 2026 от Yandex Cloud.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 Будут пять треков: AI, Data, Security и Hybrid Infrastructure & DevOps, а еще чисто онлайновый DeepTech. Тут расскажут как ускорили Lua в Valkey (получили x2-x5 по скорости)
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 Как эффективно строят ЛЛМный инференс для агентов в Yandex AI Studio на примере DeepSeek-V3.2 и DeepSeek-V4-Flash (дипсик легенды) Что случается и какие нюансы возникают когда строишь одновременно распределённый, транзакционный и линейно масштабируемый поиск (на примере векторного, полнотекстового и гибридного поиска в YDB)
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 Покажут как инфраструктура обеспечивает построение управляемых сервисов на агентах и как мониторить ИИ-агентов. Еще сможете заглянуть под капот сети облака — Interconnect, Private Link, Inbound DNS и DNS Firewall, которые складываются в герметичный контур между Yandex Cloud, on-premises и другими облаками.
Полную программу можно посмотреть на сайте, там же — зарегистрироваться. Участие бесплатное! Реклама. ООО "Яндекс.Облако" ИНН 7704458262. Erid: 2Vtzqwy8WBv

Ребятки учили Qwen 3.5 35B A3B молекулы дизайнить. Надеюсь молекулярные на месте дальше от ллмки тк что именно за датасеты и
+2
Ребятки учили Qwen 3.5 35B A3B молекулы дизайнить. Надеюсь молекулярные на месте дальше от ллмки тк что именно за датасеты и фреймворки молекулярные и как они работают я не особо понимаю: Как устроен процесс трена 1. Создают 200k задач, которые относительно просто генерить на молекулах из ZINC. Из ZINC берут исходную молекулу, через RDKit и OpenEye считают 116 молекулярных свойств. Случайно выбирают одно свойство, которое нужно улучшить, ещё 2–4 превращают в ограничения, а через BRICS задают каркас молекулы, который должен сохраниться. Так автоматически получают задачи вида: увеличить QED, но удержать молекулярную массу и TPSA в заданных пределах и сохранить исходный каркас. В статье публичную реализацию их генератора задач не дают. 2. Qwen сама генерирует новую молекулу. Модель получает исходную молекулу + цель + ограничения и предлагает новый SMILES. Затем через инструменты проверяет, что получилось, меняет структуру и повторяет. То есть ЛЛМ — генератор, а RDKit/OpenEye здесь играют роль верификатора. 3. После этого переходят к реальным экспериментально определённым структурам белок–лиганд. Для второго этапа берут 999 комплексов из PLINDER. Информацию о кармане связывания переводят в текст: какие водородные связи уже есть, где есть стерические столкновения, какие полярные участки свободны, какие аминокислотные остатки окружают лиганд. LLM уже редизайнит молекулу с учётом конкретного кармана белка. В статье публичную реализацию этого преобразования 3D-структуры в текст тоже не дают. 4. Каждый перспективный SMILES проверяется в 3D. POSIT размещает новую молекулу в кармане белка, используя экспериментальное положение исходного лиганда как шаблон. Затем Chemgauss4 быстро оценивает получившуюся форма. Оценка возвращается обратно LLM, и она решает, как изменить следующую молекулу. Этот дорогой оценщик можно вызвать максимум пять раз за один цикл — модель должна научиться не тупо перебирать варианты, а выбирать, что действительно стоит проверять. 5. Весь этот агентный цикл обучают через RL. Для этого используется открытый prime-rl: одни процессы генерируют цепочки действий модели, обучающий процесс параллельно обновляет её веса. Награда учитывает улучшение целевой характеристики, соблюдение ограничений, валидность молекулы и количество вызовов инструментов. На Tier-1 целью является одно из молекулярных свойств, а на Tier-2 — улучшение предсказанного связывания с белком. Сначала RL идёт на дешёвом Tier-1, затем — на более дорогом Tier-2. В конце модель проверяют на 40 новых системах белок–лиганд, которых не было в обучении. Вместо Chemgauss4 используют SQM2.20 — более дорогой и физически детальный метод оценки связывания на основе полуэмпирической квантовой механики. Один такой расчёт занимает уже десятки минут, поэтому масштабировать RL напрямую на нём слишком дорого. Именно здесь проверяют, перенёсся ли навык, выученный на дешёвых упрощённых задачах, на более качественный оценщик. Tier-2 берут из официального train split PLINDER, а эти 40 систем — из test split, чтобы не было утечки между train и evaluation. Training Large Language Models for Small-Molecule Design with Synthetic Task Scaling https://arxiv.org/abs/2609.04735 https://www.alphaxiv.org/ru/abs/2609.04735

Repost from N/a
Сделал студию для симуляций и обучения роботов. Пока что есть поддержка только ACT и SmolVLA на роборуке за 100 баксов - so100. Куча твиков, ведро готовых ассетов, RL, и прочие вкусности в комплекте. Тестировалась и собиралось на оч специфичном железе, так что правки приветствуются

скоро топ 1 овервотча
+1
скоро топ 1 овервотча

Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеальн
Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны. Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.

Кажется я знаю на чем построена новая моделька OpenAI которая зарешала Навье-Стокса

Дипсики нам выложили мультимодальный DeepSeek-V4.1-Flash 552B A8/16B кажется прям круто) хотя дома мало кто сможет запустить
+1
Дипсики нам выложили мультимодальный DeepSeek-V4.1-Flash 552B A8/16B кажется прям круто) хотя дома мало кто сможет запустить https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash Квантов анслота пока не видел

ее уже в браузерную игру запихнули. https://github.com/dzhng/fly-escape https://fly-escape.vercel.app/ Вообще я думаю может в
ее уже в браузерную игру запихнули. https://github.com/dzhng/fly-escape https://fly-escape.vercel.app/ Вообще я думаю может в рл студию как-то тоже добавить но это чисто для прикола конечно

Про лупед трансформеры которые возможно лежат в базе Астры https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and

там рлем тот учат тот самый мозг мухи играть в beat saber https://x.com/_lyraaaa_/status/2097527368919470162

Майкрософты потюнили 4B Qwen-3.5 на 61.5% Swe-bench verified чисто генерацией задач и рлем FrogNano: Training a 4B Coding Age
+2
Майкрософты потюнили 4B Qwen-3.5 на 61.5% Swe-bench verified чисто генерацией задач и рлем FrogNano: Training a 4B Coding Agent via Online Task Synthesis https://microsoft.github.io/debug-gym/static/papers/frognano_technical_report.pdf https://microsoft.github.io/debug-gym/

Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам интересно https://adityamakkar000.github.io/posts/async-rl-jax.html

Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах нуи в целом схема как там устроено все на скри
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах нуи в целом схема как там устроено все на скрине, прикольно Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report https://arxiv.org/abs/2608.15763 https://www.alphaxiv.org/ru/abs/2608.15763

Квены потренили Qwen 3.5 4B для автопилота добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head)
+1
Квены потренили Qwen 3.5 4B для автопилота добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) + добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlm ну и учили в 4 этапа все эти части Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving https://arxiv.org/abs/2609.00111 https://www.alphaxiv.org/ru/abs/2609.00111 PS статьи собираем и проекты делаем в https://t.me/researchim

Пока ходил искал алгоритмы которые в студию завести полезно собрал список *Zero алгоритмов Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm https://arxiv.org/abs/1712.01815 https://www.alphaxiv.org/ru/abs/1712.01815 Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model https://arxiv.org/abs/1911.08265 https://www.alphaxiv.org/ru/abs/1911.08265 Online and Offline Reinforcement Learning by Planning with a Learned Model https://arxiv.org/abs/2104.06294 https://www.alphaxiv.org/ru/abs/2104.06294 Learning and Planning in Complex Action Spaces https://arxiv.org/abs/2104.06303 https://www.alphaxiv.org/ru/abs/2104.06303 Mastering Atari Games with Limited Data https://arxiv.org/abs/2111.00210 https://www.alphaxiv.org/ru/abs/2111.00210 EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data https://arxiv.org/abs/2403.00564 https://www.alphaxiv.org/ru/abs/2403.00564 ReZero: Boosting MCTS-based Algorithms by Backward-view and Entire-buffer Reanalyze https://arxiv.org/abs/2404.16364 https://www.alphaxiv.org/ru/abs/2404.16364 UniZero: Generalized and Efficient Planning with Scalable Latent World Models https://arxiv.org/abs/2406.10667 https://www.alphaxiv.org/ru/abs/2406.10667 One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning https://arxiv.org/abs/2509.07945 https://www.alphaxiv.org/ru/abs/2509.07945 Object-Centric World Models Meet Monte Carlo Tree Search https://arxiv.org/abs/2601.06604 https://www.alphaxiv.org/ru/abs/2601.06604 PriorZero: Bridging Language Priors and World Models for Decision Making https://arxiv.org/abs/2605.12289 https://www.alphaxiv.org/ru/abs/2605.12289 Ну и либа в которой большая часть из них сделана и ребята новые алгоритмы создают время от времени: https://github.com/opendilab/LightZero

Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алго
+1
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алгоритмы world models и алгоритмы которые с ними работают efficient zero v2 (на скрине тренится на одной из задач nethack куча енвов все пока в процессе тестов и отладки)