Агенты ИИ | AGI_and_RL
前往频道在 Telegram
6 143
订阅者
+324 小时
+147 天
+3730 天
数据加载中...
吸引订阅者
九月 '26
九月 '26
+14
在0个频道中
八月 '26
+107
在2个频道中
Get PRO
七月 '26
+133
在0个频道中
Get PRO
六月 '26
+135
在0个频道中
Get PRO
五月 '26
+121
在0个频道中
Get PRO
四月 '26
+130
在3个频道中
Get PRO
三月 '26
+184
在2个频道中
Get PRO
二月 '26
+160
在3个频道中
Get PRO
一月 '26
+117
在3个频道中
Get PRO
十二月 '25
+117
在2个频道中
Get PRO
十一月 '25
+120
在0个频道中
Get PRO
十月 '25
+166
在3个频道中
Get PRO
九月 '25
+124
在2个频道中
Get PRO
八月 '25
+127
在0个频道中
Get PRO
七月 '25
+156
在7个频道中
Get PRO
六月 '25
+206
在5个频道中
Get PRO
五月 '25
+157
在1个频道中
Get PRO
四月 '25
+239
在4个频道中
Get PRO
三月 '25
+291
在7个频道中
Get PRO
二月 '25
+314
在5个频道中
Get PRO
一月 '25
+422
在11个频道中
Get PRO
十二月 '24
+334
在8个频道中
Get PRO
十一月 '24
+95
在0个频道中
Get PRO
十月 '24
+132
在1个频道中
Get PRO
九月 '24
+81
在3个频道中
Get PRO
八月 '24
+140
在3个频道中
Get PRO
七月 '24
+748
在2个频道中
Get PRO
六月 '24
+99
在3个频道中
Get PRO
五月 '24
+86
在0个频道中
Get PRO
四月 '24
+307
在8个频道中
Get PRO
三月 '24
+186
在3个频道中
Get PRO
二月 '24
+76
在1个频道中
Get PRO
一月 '24
+92
在1个频道中
Get PRO
十二月 '23
+98
在3个频道中
Get PRO
十一月 '23
+93
在2个频道中
Get PRO
十月 '23
+80
在2个频道中
Get PRO
九月 '23
+139
在0个频道中
Get PRO
八月 '23
+78
在0个频道中
Get PRO
七月 '23
+127
在0个频道中
Get PRO
六月 '23
+113
在0个频道中
Get PRO
五月 '23
+1 856
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 04 九月 | +4 | |||
| 03 九月 | +3 | |||
| 02 九月 | +4 | |||
| 01 九月 | +3 |
频道帖子
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах
нуи в целом схема как там устроено все на скрине, прикольно
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
https://arxiv.org/abs/2608.15763
https://www.alphaxiv.org/ru/abs/2608.15763
| 2 | Квены потренили Qwen 3.5 4B для автопилота
добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) +
добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlm
ну и учили в 4 этапа все эти части
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
https://arxiv.org/abs/2609.00111
https://www.alphaxiv.org/ru/abs/2609.00111
PS статьи собираем и проекты делаем в https://t.me/researchim | 1 299 |
| 3 | Пока ходил искал алгоритмы которые в студию завести полезно собрал список *Zero алгоритмов
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
https://arxiv.org/abs/1712.01815
https://www.alphaxiv.org/ru/abs/1712.01815
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model
https://arxiv.org/abs/1911.08265
https://www.alphaxiv.org/ru/abs/1911.08265
Online and Offline Reinforcement Learning by Planning with a Learned Model
https://arxiv.org/abs/2104.06294
https://www.alphaxiv.org/ru/abs/2104.06294
Learning and Planning in Complex Action Spaces
https://arxiv.org/abs/2104.06303
https://www.alphaxiv.org/ru/abs/2104.06303
Mastering Atari Games with Limited Data
https://arxiv.org/abs/2111.00210
https://www.alphaxiv.org/ru/abs/2111.00210
EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data
https://arxiv.org/abs/2403.00564
https://www.alphaxiv.org/ru/abs/2403.00564
ReZero: Boosting MCTS-based Algorithms by Backward-view and Entire-buffer Reanalyze
https://arxiv.org/abs/2404.16364
https://www.alphaxiv.org/ru/abs/2404.16364
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
https://arxiv.org/abs/2406.10667
https://www.alphaxiv.org/ru/abs/2406.10667
One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning
https://arxiv.org/abs/2509.07945
https://www.alphaxiv.org/ru/abs/2509.07945
Object-Centric World Models Meet Monte Carlo Tree Search
https://arxiv.org/abs/2601.06604
https://www.alphaxiv.org/ru/abs/2601.06604
PriorZero: Bridging Language Priors and World Models for Decision Making
https://arxiv.org/abs/2605.12289
https://www.alphaxiv.org/ru/abs/2605.12289
Ну и либа в которой большая часть из них сделана и ребята новые алгоритмы создают время от времени:
https://github.com/opendilab/LightZero | 948 |
| 4 | Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio
туда добавлены некоторые multi agent rl алгоритмы
world models и алгоритмы которые с ними работают
efficient zero v2 (на скрине тренится на одной из задач nethack
куча енвов
все пока в процессе тестов и отладки) | 1 066 |
| 5 | автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1
https://mvakde.github.io/blog/44-on-arc-1/
https://github.com/mvakde/mdlARC/ | 1 183 |
| 6 | Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы занимаемся в https://t.me/researchim то вот 🥰🪳
https://boosty.to/researchim | 1 226 |
| 7 | прикольное про трен мелких моделек
Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за $4.4k и 96x5090 на второй за $6.9k) и достигли перформа Qwen2-1.5B
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
https://arxiv.org/abs/2608.27370
https://www.alphaxiv.org/ru/abs/2608.27370
https://huggingface.co/collections/thu-pacman/puro-2b | 1 343 |
| 8 | машинка научилась ездить по трассе, хз что еще нужно
в той рл студии за 40 минут | 1 827 |
| 9 | еще квеновое приехало 125B A6B + 51B
наверное как дипсик флеш должно быть по уму. я попозже тоже попробую
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
кто будет гонять отпишитесь потом | 1 831 |
| 10 | начал делать локальную студию для RLя (потому что все должны рлить)
там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы
также алгоритмов добавлена память на LSTM/GRU
есть селф-плей alphazero с несколькими средами
есть возможность запускать несколько параллельных сред для одного эксперимента
https://github.com/researchim-ai/reinforcement-studio
пока что просто показываю.
где-нибудь в конце этой недели или на следующей мб будет билд уже под linux/windows, чтобы можно было с кайфом потыкать
в общем-то оно и сейчас работает вроде бы но надо потестить еще + некоторые фичи допиливаются
вообще эта штука делается как ответвление моделек дома https://github.com/researchim-ai/models-at-home чисто под rl
модельки дома тоже потихонечку переезжаются на свою прилу https://github.com/researchim-ai/models-at-home-studio
я туда хотел запихнуть страницу с "маленьким рлем". но как будто тут отдельная штука нужна была ну и я решил делать | 2 074 |
| 11 | Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством
keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза
поддерижите в твиттере запуск
techcrunch | 1 134 |
| 12 | Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.
Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505
Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language. | 1 |
| 13 | Q-Learning With World Models
https://arxiv.org/abs/2608.17163
https://www.alphaxiv.org/abs/2608.17163 | 1 843 |
| 14 | добавил в однокликового ресечагента qwen 3.8 27B
моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу
если кто хочет попробовать
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.4
сам репозиторий
https://github.com/researchim-ai/one-click-research-agent
по багам или предложениям сюда
https://t.me/researchim | 2 315 |
| 15 | https://artificialanalysis.ai/models/qwen3-8-27b
думайте | 2 746 |
| 16 | Забираем, тестим, отписываем что да как
https://huggingface.co/Qwen/Qwen3.8-27B | 3 152 |
| 17 | завтра уже https://huggingface.co/Qwen/Qwen3.8-27B | 2 535 |
| 18 | ля вот и DeepSeek-V4-Pro-0813 1.57T A48B
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
гуфы тут будут
https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF
я даже хз что и сказать. ни дня без крутого релиза
все еще ждем 27б квен | 2 315 |
| 19 | А вот и Qwen 3.8 2.4T
релизы крутые в последнее время конечно
гуфы
https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF
самому негде запускать это
ждем 27B модельку которую тоже обещали | 2 189 |
| 20 | Обновил ресеч агента на квенах
Это для тех кто хотел бы работать на своей тачке с локальными модельками
теперь добавился режим с поиском инфы по разным источникам (научным типа архива и опеналекс) и по вебу с отчетом по результатам
типа дипресеча - задаете ему тему например поиск статей, можно задать временные рамки, сколько источников в отчете должно быть и он будет искать
https://github.com/researchim-ai/one-click-research-agent
тут приложения
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.2
рекомендую все же qwen 3.6 35b использовать
попробую заточить под 9b тоже, но посмотрим
все проекты делаются тут https://t.me/researchim | 2 825 |
