Агенты ИИ | AGI_and_RL
الذهاب إلى القناة على Telegram
Про ии, RL и в целом @tokarev_i_v https://t.me/researchim
إظهار المزيد6 134
المشتركون
+224 ساعات
+57 أيام
+3330 أيام
أرشيف المشاركات
+1
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio
туда добавлены некоторые multi agent rl алгоритмы
world models и алгоритмы которые с ними работают
efficient zero v2 (на скрине тренится на одной из задач nethack
куча енвов
все пока в процессе тестов и отладки)
автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1
https://mvakde.github.io/blog/44-on-arc-1/
https://github.com/mvakde/mdlARC/
Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы занимаемся в https://t.me/researchim то вот 🥰🪳
https://boosty.to/researchim
прикольное про трен мелких моделек
Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за $4.4k и 96x5090 на второй за $6.9k) и достигли перформа Qwen2-1.5B
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
https://arxiv.org/abs/2608.27370
https://www.alphaxiv.org/ru/abs/2608.27370
https://huggingface.co/collections/thu-pacman/puro-2b
машинка научилась ездить по трассе, хз что еще нужно
в той рл студии за 40 минут
+1
еще квеновое приехало 125B A6B + 51B
наверное как дипсик флеш должно быть по уму. я попозже тоже попробую
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
кто будет гонять отпишитесь потом
+3
начал делать локальную студию для RLя (потому что все должны рлить)
там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы
также алгоритмов добавлена память на LSTM/GRU
есть селф-плей alphazero с несколькими средами
есть возможность запускать несколько параллельных сред для одного эксперимента
https://github.com/researchim-ai/reinforcement-studio
пока что просто показываю.
где-нибудь в конце этой недели или на следующей мб будет билд уже под linux/windows, чтобы можно было с кайфом потыкать
в общем-то оно и сейчас работает вроде бы но надо потестить еще + некоторые фичи допиливаются
вообще эта штука делается как ответвление моделек дома https://github.com/researchim-ai/models-at-home чисто под rl
модельки дома тоже потихонечку переезжаются на свою прилу https://github.com/researchim-ai/models-at-home-studio
я туда хотел запихнуть страницу с "маленьким рлем". но как будто тут отдельная штука нужна была ну и я решил делать
Repost from Love. Death. Transformers.
Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством
keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза
поддерижите в твиттере запуск
techcrunch
Repost from Старший Авгур
Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.
Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505
Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.
Q-Learning With World Models
https://arxiv.org/abs/2608.17163
https://www.alphaxiv.org/abs/2608.17163
добавил в однокликового ресечагента qwen 3.8 27B
моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу
если кто хочет попробовать
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.4
сам репозиторий
https://github.com/researchim-ai/one-click-research-agent
по багам или предложениям сюда
https://t.me/researchim
Забираем, тестим, отписываем что да как
https://huggingface.co/Qwen/Qwen3.8-27B
ля вот и DeepSeek-V4-Pro-0813 1.57T A48B
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
гуфы тут будут
https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF
я даже хз что и сказать. ни дня без крутого релиза
все еще ждем 27б квен
А вот и Qwen 3.8 2.4T
релизы крутые в последнее время конечно
гуфы
https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF
самому негде запускать это
ждем 27B модельку которую тоже обещали
Обновил ресеч агента на квенах
Это для тех кто хотел бы работать на своей тачке с локальными модельками
теперь добавился режим с поиском инфы по разным источникам (научным типа архива и опеналекс) и по вебу с отчетом по результатам
типа дипресеча - задаете ему тему например поиск статей, можно задать временные рамки, сколько источников в отчете должно быть и он будет искать
https://github.com/researchim-ai/one-click-research-agent
тут приложения
https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.2
рекомендую все же qwen 3.6 35b использовать
попробую заточить под 9b тоже, но посмотрим
все проекты делаются тут https://t.me/researchim
кажется неплохой дроп от дипсиков - апдейт для v4 flash
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
ggufы уже готовятся
https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
Repost from Борис опять
Нужна ваша помощь! 👀👀👀
Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.
https://x.com/SteelmanLabs/status/2082789336995528727?s=20
Большая просьба помочь хайпом в твиттере и лайком на HN
https://news.ycombinator.com/item?id=49108542
ну штош выложили веса Kimi K3 (2.8TA104b) - это который фейбл дома
наверное самый важный релиз со времен квенов 3.5, правда совсем другой весовой категории
муншоты легенды🥰
именно для таких релизов нужны OpenAI, Anthropic и все остальные
жаль в 3090 не влезет
https://www.kimi.com/blog/kimi-k3
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
веса
https://huggingface.co/moonshotai/Kimi-K3
