Агенты ИИ | AGI_and_RL
Відкрити в Telegram
Про ии, RL и в целом @tokarev_i_v https://t.me/researchim
Показати більше6 142
Підписники
+324 години
+137 днів
+3930 днів
Триває завантаження даних...
Схожі канали
Хмара тегів
Вхідні та вихідні згадування
---
---
---
---
---
---
Залучення підписників
вересень '26
вересень '26
+15
в 0 каналах
серпень '26
+107
в 2 каналах
Get PRO
липень '26
+133
в 0 каналах
Get PRO
червень '26
+135
в 0 каналах
Get PRO
травень '26
+121
в 0 каналах
Get PRO
квітень '26
+130
в 3 каналах
Get PRO
березень '26
+184
в 2 каналах
Get PRO
лютий '26
+160
в 3 каналах
Get PRO
січень '26
+117
в 3 каналах
Get PRO
грудень '25
+117
в 2 каналах
Get PRO
листопад '25
+120
в 0 каналах
Get PRO
жовтень '25
+166
в 3 каналах
Get PRO
вересень '25
+124
в 2 каналах
Get PRO
серпень '25
+127
в 0 каналах
Get PRO
липень '25
+156
в 7 каналах
Get PRO
червень '25
+206
в 5 каналах
Get PRO
травень '25
+157
в 1 каналах
Get PRO
квітень '25
+239
в 4 каналах
Get PRO
березень '25
+291
в 7 каналах
Get PRO
лютий '25
+314
в 5 каналах
Get PRO
січень '25
+422
в 11 каналах
Get PRO
грудень '24
+334
в 8 каналах
Get PRO
листопад '24
+95
в 0 каналах
Get PRO
жовтень '24
+132
в 1 каналах
Get PRO
вересень '24
+81
в 3 каналах
Get PRO
серпень '24
+140
в 3 каналах
Get PRO
липень '24
+748
в 2 каналах
Get PRO
червень '24
+99
в 3 каналах
Get PRO
травень '24
+86
в 0 каналах
Get PRO
квітень '24
+307
в 8 каналах
Get PRO
березень '24
+186
в 3 каналах
Get PRO
лютий '24
+76
в 1 каналах
Get PRO
січень '24
+92
в 1 каналах
Get PRO
грудень '23
+98
в 3 каналах
Get PRO
листопад '23
+93
в 2 каналах
Get PRO
жовтень '23
+80
в 2 каналах
Get PRO
вересень '23
+139
в 0 каналах
Get PRO
серпень '23
+78
в 0 каналах
Get PRO
липень '23
+127
в 0 каналах
Get PRO
червень '23
+113
в 0 каналах
Get PRO
травень '23
+1 856
в 0 каналах
| Дата | Залучення підписників | Згадування | Канали | |
| 05 вересня | +1 | |||
| 04 вересня | +4 | |||
| 03 вересня | +3 | |||
| 02 вересня | +4 | |||
| 01 вересня | +3 |
Дописи каналу
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах
нуи в целом схема как там устроено все на скрине, прикольно
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
https://arxiv.org/abs/2608.15763
https://www.alphaxiv.org/ru/abs/2608.15763
| 2 | Квены потренили Qwen 3.5 4B для автопилота
добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) +
добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlm
ну и учили в 4 этапа все эти части
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
https://arxiv.org/abs/2609.00111
https://www.alphaxiv.org/ru/abs/2609.00111
PS статьи собираем и проекты делаем в https://t.me/researchim | 1 341 |
| 3 | Пока ходил искал алгоритмы которые в студию завести полезно собрал список *Zero алгоритмов
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
https://arxiv.org/abs/1712.01815
https://www.alphaxiv.org/ru/abs/1712.01815
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model
https://arxiv.org/abs/1911.08265
https://www.alphaxiv.org/ru/abs/1911.08265
Online and Offline Reinforcement Learning by Planning with a Learned Model
https://arxiv.org/abs/2104.06294
https://www.alphaxiv.org/ru/abs/2104.06294
Learning and Planning in Complex Action Spaces
https://arxiv.org/abs/2104.06303
https://www.alphaxiv.org/ru/abs/2104.06303
Mastering Atari Games with Limited Data
https://arxiv.org/abs/2111.00210
https://www.alphaxiv.org/ru/abs/2111.00210
EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data
https://arxiv.org/abs/2403.00564
https://www.alphaxiv.org/ru/abs/2403.00564
ReZero: Boosting MCTS-based Algorithms by Backward-view and Entire-buffer Reanalyze
https://arxiv.org/abs/2404.16364
https://www.alphaxiv.org/ru/abs/2404.16364
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
https://arxiv.org/abs/2406.10667
https://www.alphaxiv.org/ru/abs/2406.10667
One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning
https://arxiv.org/abs/2509.07945
https://www.alphaxiv.org/ru/abs/2509.07945
Object-Centric World Models Meet Monte Carlo Tree Search
https://arxiv.org/abs/2601.06604
https://www.alphaxiv.org/ru/abs/2601.06604
PriorZero: Bridging Language Priors and World Models for Decision Making
https://arxiv.org/abs/2605.12289
https://www.alphaxiv.org/ru/abs/2605.12289
Ну и либа в которой большая часть из них сделана и ребята новые алгоритмы создают время от времени:
https://github.com/opendilab/LightZero | 994 |
| 4 | Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio
туда добавлены некоторые multi agent rl алгоритмы
world models и алгоритмы которые с ними работают
efficient zero v2 (на скрине тренится на одной из задач nethack
куча енвов
все пока в процессе тестов и отладки) | 1 078 |
| 5 | автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1
https://mvakde.github.io/blog/44-on-arc-1/
https://github.com/mvakde/mdlARC/ | 1 229 |
| 6 | Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы занимаемся в https://t.me/researchim то вот 🥰🪳
https://boosty.to/researchim | 1 284 |
| 7 | прикольное про трен мелких моделек
Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за $4.4k и 96x5090 на второй за $6.9k) и достигли перформа Qwen2-1.5B
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
https://arxiv.org/abs/2608.27370
https://www.alphaxiv.org/ru/abs/2608.27370
https://huggingface.co/collections/thu-pacman/puro-2b | 1 375 |
| 8 | машинка научилась ездить по трассе, хз что еще нужно
в той рл студии за 40 минут | 1 877 |
| 9 | еще квеновое приехало 125B A6B + 51B
наверное как дипсик флеш должно быть по уму. я попозже тоже попробую
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
кто будет гонять отпишитесь потом | 1 862 |
| 10 | начал делать локальную студию для RLя (потому что все должны рлить)
там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы
также алгоритмов добавлена память на LSTM/GRU
есть селф-плей alphazero с несколькими средами
есть возможность запускать несколько параллельных сред для одного эксперимента
https://github.com/researchim-ai/reinforcement-studio
пока что просто показываю.
где-нибудь в конце этой недели или на следующей мб будет билд уже под linux/windows, чтобы можно было с кайфом потыкать
в общем-то оно и сейчас работает вроде бы но надо потестить еще + некоторые фичи допиливаются
вообще эта штука делается как ответвление моделек дома https://github.com/researchim-ai/models-at-home чисто под rl
модельки дома тоже потихонечку переезжаются на свою прилу https://github.com/researchim-ai/models-at-home-studio
я туда хотел запихнуть страницу с "маленьким рлем". но как будто тут отдельная штука нужна была ну и я решил делать | 2 130 |
| 11 | Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством
keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза
поддерижите в твиттере запуск
techcrunch | 1 145 |
| 12 | Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.
Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505
Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language. | 1 |
| 13 | Q-Learning With World Models
https://arxiv.org/abs/2608.17163
https://www.alphaxiv.org/abs/2608.17163 | 1 854 |
| 14 | добавил в однокликового ресечагента qwen 3.8 27B
моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу
если кто хочет попробовать
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.4
сам репозиторий
https://github.com/researchim-ai/one-click-research-agent
по багам или предложениям сюда
https://t.me/researchim | 2 338 |
| 15 | https://artificialanalysis.ai/models/qwen3-8-27b
думайте | 2 761 |
| 16 | Забираем, тестим, отписываем что да как
https://huggingface.co/Qwen/Qwen3.8-27B | 3 152 |
| 17 | завтра уже https://huggingface.co/Qwen/Qwen3.8-27B | 2 535 |
| 18 | ля вот и DeepSeek-V4-Pro-0813 1.57T A48B
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
гуфы тут будут
https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF
я даже хз что и сказать. ни дня без крутого релиза
все еще ждем 27б квен | 2 315 |
| 19 | А вот и Qwen 3.8 2.4T
релизы крутые в последнее время конечно
гуфы
https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF
самому негде запускать это
ждем 27B модельку которую тоже обещали | 2 189 |
| 20 | Обновил ресеч агента на квенах
Это для тех кто хотел бы работать на своей тачке с локальными модельками
теперь добавился режим с поиском инфы по разным источникам (научным типа архива и опеналекс) и по вебу с отчетом по результатам
типа дипресеча - задаете ему тему например поиск статей, можно задать временные рамки, сколько источников в отчете должно быть и он будет искать
https://github.com/researchim-ai/one-click-research-agent
тут приложения
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.2
рекомендую все же qwen 3.6 35b использовать
попробую заточить под 9b тоже, но посмотрим
все проекты делаются тут https://t.me/researchim | 2 825 |
