Агенты ИИ | AGI_and_RL
الذهاب إلى القناة على Telegram
Про ии, RL и в целом @tokarev_i_v https://t.me/researchim
إظهار المزيد6 142
المشتركون
+324 ساعات
+137 أيام
+3930 أيام
جاري تحميل البيانات...
القنوات المماثلة
سحابة العلامات
الإشارات الواردة والصادرة
---
---
---
---
---
---
جذب المشتركين
سبتمبر '26
سبتمبر '26
+15
في 0 قنوات
أغسطس '26
+107
في 2 قنوات
Get PRO
يوليو '26
+133
في 0 قنوات
Get PRO
يونيو '26
+135
في 0 قنوات
Get PRO
مايو '26
+121
في 0 قنوات
Get PRO
أبريل '26
+130
في 3 قنوات
Get PRO
مارس '26
+184
في 2 قنوات
Get PRO
فبراير '26
+160
في 3 قنوات
Get PRO
يناير '26
+117
في 3 قنوات
Get PRO
ديسمبر '25
+117
في 2 قنوات
Get PRO
نوفمبر '25
+120
في 0 قنوات
Get PRO
أكتوبر '25
+166
في 3 قنوات
Get PRO
سبتمبر '25
+124
في 2 قنوات
Get PRO
أغسطس '25
+127
في 0 قنوات
Get PRO
يوليو '25
+156
في 7 قنوات
Get PRO
يونيو '25
+206
في 5 قنوات
Get PRO
مايو '25
+157
في 1 قنوات
Get PRO
أبريل '25
+239
في 4 قنوات
Get PRO
مارس '25
+291
في 7 قنوات
Get PRO
فبراير '25
+314
في 5 قنوات
Get PRO
يناير '25
+422
في 11 قنوات
Get PRO
ديسمبر '24
+334
في 8 قنوات
Get PRO
نوفمبر '24
+95
في 0 قنوات
Get PRO
أكتوبر '24
+132
في 1 قنوات
Get PRO
سبتمبر '24
+81
في 3 قنوات
Get PRO
أغسطس '24
+140
في 3 قنوات
Get PRO
يوليو '24
+748
في 2 قنوات
Get PRO
يونيو '24
+99
في 3 قنوات
Get PRO
مايو '24
+86
في 0 قنوات
Get PRO
أبريل '24
+307
في 8 قنوات
Get PRO
مارس '24
+186
في 3 قنوات
Get PRO
فبراير '24
+76
في 1 قنوات
Get PRO
يناير '24
+92
في 1 قنوات
Get PRO
ديسمبر '23
+98
في 3 قنوات
Get PRO
نوفمبر '23
+93
في 2 قنوات
Get PRO
أكتوبر '23
+80
في 2 قنوات
Get PRO
سبتمبر '23
+139
في 0 قنوات
Get PRO
أغسطس '23
+78
في 0 قنوات
Get PRO
يوليو '23
+127
في 0 قنوات
Get PRO
يونيو '23
+113
في 0 قنوات
Get PRO
مايو '23
+1 856
في 0 قنوات
| التاريخ | نمو المشتركين | الإشارات | القنوات | |
| 05 سبتمبر | +1 | |||
| 04 سبتمبر | +4 | |||
| 03 سبتمبر | +3 | |||
| 02 سبتمبر | +4 | |||
| 01 سبتمبر | +3 |
منشورات القناة
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах
нуи в целом схема как там устроено все на скрине, прикольно
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
https://arxiv.org/abs/2608.15763
https://www.alphaxiv.org/ru/abs/2608.15763
| 2 | Квены потренили Qwen 3.5 4B для автопилота
добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) +
добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlm
ну и учили в 4 этапа все эти части
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
https://arxiv.org/abs/2609.00111
https://www.alphaxiv.org/ru/abs/2609.00111
PS статьи собираем и проекты делаем в https://t.me/researchim | 1 341 |
| 3 | Пока ходил искал алгоритмы которые в студию завести полезно собрал список *Zero алгоритмов
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
https://arxiv.org/abs/1712.01815
https://www.alphaxiv.org/ru/abs/1712.01815
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model
https://arxiv.org/abs/1911.08265
https://www.alphaxiv.org/ru/abs/1911.08265
Online and Offline Reinforcement Learning by Planning with a Learned Model
https://arxiv.org/abs/2104.06294
https://www.alphaxiv.org/ru/abs/2104.06294
Learning and Planning in Complex Action Spaces
https://arxiv.org/abs/2104.06303
https://www.alphaxiv.org/ru/abs/2104.06303
Mastering Atari Games with Limited Data
https://arxiv.org/abs/2111.00210
https://www.alphaxiv.org/ru/abs/2111.00210
EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data
https://arxiv.org/abs/2403.00564
https://www.alphaxiv.org/ru/abs/2403.00564
ReZero: Boosting MCTS-based Algorithms by Backward-view and Entire-buffer Reanalyze
https://arxiv.org/abs/2404.16364
https://www.alphaxiv.org/ru/abs/2404.16364
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
https://arxiv.org/abs/2406.10667
https://www.alphaxiv.org/ru/abs/2406.10667
One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning
https://arxiv.org/abs/2509.07945
https://www.alphaxiv.org/ru/abs/2509.07945
Object-Centric World Models Meet Monte Carlo Tree Search
https://arxiv.org/abs/2601.06604
https://www.alphaxiv.org/ru/abs/2601.06604
PriorZero: Bridging Language Priors and World Models for Decision Making
https://arxiv.org/abs/2605.12289
https://www.alphaxiv.org/ru/abs/2605.12289
Ну и либа в которой большая часть из них сделана и ребята новые алгоритмы создают время от времени:
https://github.com/opendilab/LightZero | 994 |
| 4 | Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio
туда добавлены некоторые multi agent rl алгоритмы
world models и алгоритмы которые с ними работают
efficient zero v2 (на скрине тренится на одной из задач nethack
куча енвов
все пока в процессе тестов и отладки) | 1 078 |
| 5 | автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1
https://mvakde.github.io/blog/44-on-arc-1/
https://github.com/mvakde/mdlARC/ | 1 229 |
| 6 | Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы занимаемся в https://t.me/researchim то вот 🥰🪳
https://boosty.to/researchim | 1 284 |
| 7 | прикольное про трен мелких моделек
Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за $4.4k и 96x5090 на второй за $6.9k) и достигли перформа Qwen2-1.5B
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
https://arxiv.org/abs/2608.27370
https://www.alphaxiv.org/ru/abs/2608.27370
https://huggingface.co/collections/thu-pacman/puro-2b | 1 375 |
| 8 | машинка научилась ездить по трассе, хз что еще нужно
в той рл студии за 40 минут | 1 877 |
| 9 | еще квеновое приехало 125B A6B + 51B
наверное как дипсик флеш должно быть по уму. я попозже тоже попробую
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
кто будет гонять отпишитесь потом | 1 862 |
| 10 | начал делать локальную студию для RLя (потому что все должны рлить)
там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы
также алгоритмов добавлена память на LSTM/GRU
есть селф-плей alphazero с несколькими средами
есть возможность запускать несколько параллельных сред для одного эксперимента
https://github.com/researchim-ai/reinforcement-studio
пока что просто показываю.
где-нибудь в конце этой недели или на следующей мб будет билд уже под linux/windows, чтобы можно было с кайфом потыкать
в общем-то оно и сейчас работает вроде бы но надо потестить еще + некоторые фичи допиливаются
вообще эта штука делается как ответвление моделек дома https://github.com/researchim-ai/models-at-home чисто под rl
модельки дома тоже потихонечку переезжаются на свою прилу https://github.com/researchim-ai/models-at-home-studio
я туда хотел запихнуть страницу с "маленьким рлем". но как будто тут отдельная штука нужна была ну и я решил делать | 2 130 |
| 11 | Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством
keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза
поддерижите в твиттере запуск
techcrunch | 1 145 |
| 12 | Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.
Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505
Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language. | 1 |
| 13 | Q-Learning With World Models
https://arxiv.org/abs/2608.17163
https://www.alphaxiv.org/abs/2608.17163 | 1 854 |
| 14 | добавил в однокликового ресечагента qwen 3.8 27B
моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу
если кто хочет попробовать
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.4
сам репозиторий
https://github.com/researchim-ai/one-click-research-agent
по багам или предложениям сюда
https://t.me/researchim | 2 338 |
| 15 | https://artificialanalysis.ai/models/qwen3-8-27b
думайте | 2 761 |
| 16 | Забираем, тестим, отписываем что да как
https://huggingface.co/Qwen/Qwen3.8-27B | 3 152 |
| 17 | завтра уже https://huggingface.co/Qwen/Qwen3.8-27B | 2 535 |
| 18 | ля вот и DeepSeek-V4-Pro-0813 1.57T A48B
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
гуфы тут будут
https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF
я даже хз что и сказать. ни дня без крутого релиза
все еще ждем 27б квен | 2 315 |
| 19 | А вот и Qwen 3.8 2.4T
релизы крутые в последнее время конечно
гуфы
https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF
самому негде запускать это
ждем 27B модельку которую тоже обещали | 2 189 |
| 20 | Обновил ресеч агента на квенах
Это для тех кто хотел бы работать на своей тачке с локальными модельками
теперь добавился режим с поиском инфы по разным источникам (научным типа архива и опеналекс) и по вебу с отчетом по результатам
типа дипресеча - задаете ему тему например поиск статей, можно задать временные рамки, сколько источников в отчете должно быть и он будет искать
https://github.com/researchim-ai/one-click-research-agent
тут приложения
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.2
рекомендую все же qwen 3.6 35b использовать
попробую заточить под 9b тоже, но посмотрим
все проекты делаются тут https://t.me/researchim | 2 825 |
