es
Feedback
Агенты ИИ | AGI_and_RL

Агенты ИИ | AGI_and_RL

Ir al canal en Telegram
6 134
Suscriptores
+224 horas
+57 días
+3330 días
Archivo de publicaciones
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алго
+1
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алгоритмы world models и алгоритмы которые с ними работают efficient zero v2 (на скрине тренится на одной из задач nethack куча енвов все пока в процессе тестов и отладки)

автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1 https://mvakde.github.io/
автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1 https://mvakde.github.io/blog/44-on-arc-1/ https://github.com/mvakde/mdlARC/

Кстати я тут завел бусти если у кого-то появится желание поддержать то чем мы занимаемся в https://t.me/researchim то вот 🥰🪳 https://boosty.to/researchim

прикольное про трен мелких моделек Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за
прикольное про трен мелких моделек Авторы рассказывают как претренили 2B модельки на кластере 5090 (24x5090 на первой фазе за $4.4k и 96x5090 на второй за $6.9k) и достигли перформа Qwen2-1.5B Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 https://arxiv.org/abs/2608.27370 https://www.alphaxiv.org/ru/abs/2608.27370 https://huggingface.co/collections/thu-pacman/puro-2b

машинка научилась ездить по трассе, хз что еще нужно в той рл студии за 40 минут

еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по уму. я попозже тоже попробую https://huggingface
+1
еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по уму. я попозже тоже попробую https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF кто будет гонять отпишитесь потом

начал делать локальную студию для RLя (потому что все должны рлить) там добавлены сейчас 88 енвов, ерализованы многие популяр
+3
начал делать локальную студию для RLя (потому что все должны рлить) там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы также алгоритмов добавлена память на LSTM/GRU есть селф-плей alphazero с несколькими средами есть возможность запускать несколько параллельных сред для одного эксперимента https://github.com/researchim-ai/reinforcement-studio пока что просто показываю. где-нибудь в конце этой недели или на следующей мб будет билд уже под linux/windows, чтобы можно было с кайфом потыкать в общем-то оно и сейчас работает вроде бы но надо потестить еще + некоторые фичи допиливаются вообще эта штука делается как ответвление моделек дома https://github.com/researchim-ai/models-at-home чисто под rl модельки дома тоже потихонечку переезжаются на свою прилу https://github.com/researchim-ai/models-at-home-studio я туда хотел запихнуть страницу с "маленьким рлем". но как будто тут отдельная штука нужна была ну и я решил делать

Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством keenable.ai - юзать отсюда и всем по 100к б
Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза поддерижите в твиттере запуск techcrunch

Полгода работы прошли не зря! У нас (Keenable) публичный запуск. Новый сайт: https://keenable.ai/ Новый бенч: https://keenabl
Полгода работы прошли не зря! У нас (Keenable) публичный запуск. Новый сайт: https://keenable.ai/ Новый бенч: https://keenableai.github.io/needle/ Твит: https://x.com/styskin/status/2092265673041084505 Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.

добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много думает и говорят иногда может подчистить вам
добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу если кто хочет попробовать https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.4 сам репозиторий https://github.com/researchim-ai/one-click-research-agent по багам или предложениям сюда https://t.me/researchim

Забираем, тестим, отписываем что да как https://huggingface.co/Qwen/Qwen3.8-27B

ля вот и DeepSeek-V4-Pro-0813 1.57T A48B https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813 гуфы тут будут https://huggi
ля вот и DeepSeek-V4-Pro-0813 1.57T A48B https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813 гуфы тут будут https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF я даже хз что и сказать. ни дня без крутого релиза все еще ждем 27б квен

А вот и Qwen 3.8 2.4T релизы крутые в последнее время конечно гуфы https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF само
А вот и Qwen 3.8 2.4T релизы крутые в последнее время конечно гуфы https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF самому негде запускать это ждем 27B модельку которую тоже обещали

Обновил ресеч агента на квенах Это для тех кто хотел бы работать на своей тачке с локальными модельками теперь добавился режи
Обновил ресеч агента на квенах Это для тех кто хотел бы работать на своей тачке с локальными модельками теперь добавился режим с поиском инфы по разным источникам (научным типа архива и опеналекс) и по вебу с отчетом по результатам типа дипресеча - задаете ему тему например поиск статей, можно задать временные рамки, сколько источников в отчете должно быть и он будет искать https://github.com/researchim-ai/one-click-research-agent тут приложения https://github.com/researchim-ai/one-click-research-agent/releases/tag/v0.1.2 рекомендую все же qwen 3.6 35b использовать попробую заточить под 9b тоже, но посмотрим все проекты делаются тут https://t.me/researchim

кажется неплохой дроп от дипсиков - апдейт для v4 flash https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 ggufы уже г
кажется неплохой дроп от дипсиков - апдейт для v4 flash https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 ggufы уже готовятся https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF

Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос. https://x.com/SteelmanLabs/status/2082789336995528727?s=20 Большая просьба помочь хайпом в твиттере и лайком на HN https://news.ycombinator.com/item?id=49108542

ну штош выложили веса Kimi K3 (2.8TA104b) - это который фейбл дома наверное самый важный релиз со времен квенов 3.5, правда с
ну штош выложили веса Kimi K3 (2.8TA104b) - это который фейбл дома наверное самый важный релиз со времен квенов 3.5, правда совсем другой весовой категории муншоты легенды🥰 именно для таких релизов нужны OpenAI, Anthropic и все остальные жаль в 3090 не влезет https://www.kimi.com/blog/kimi-k3 https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf веса https://huggingface.co/moonshotai/Kimi-K3