659
订阅者
+324 小时
+37 天
+930 天
数据加载中...
相似频道
标签云
进出提及
---
---
---
---
---
---
吸引订阅者
九月 '26
九月 '26
+5
在2个频道中
八月 '26
+9
在0个频道中
Get PRO
七月 '26
+4
在0个频道中
Get PRO
六月 '26
+6
在1个频道中
Get PRO
五月 '26
+33
在1个频道中
Get PRO
四月 '26
+46
在1个频道中
Get PRO
三月 '26
+11
在1个频道中
Get PRO
二月 '26
+2
在2个频道中
Get PRO
一月 '26
+4
在2个频道中
Get PRO
十二月 '25
+57
在2个频道中
Get PRO
十一月 '25
+13
在2个频道中
Get PRO
十月 '25
+3
在0个频道中
Get PRO
九月 '25
+3
在0个频道中
Get PRO
八月 '25
+50
在3个频道中
Get PRO
七月 '25
+9
在0个频道中
Get PRO
六月 '25
+5
在1个频道中
Get PRO
五月 '25
+13
在2个频道中
Get PRO
四月 '25
+8
在0个频道中
Get PRO
三月 '25
+12
在1个频道中
Get PRO
二月 '25
+21
在1个频道中
Get PRO
一月 '25
+82
在1个频道中
Get PRO
十二月 '24
+9
在0个频道中
Get PRO
十一月 '24
+77
在1个频道中
Get PRO
十月 '24
+54
在4个频道中
Get PRO
九月 '24
+10
在0个频道中
Get PRO
八月 '24
+15
在0个频道中
Get PRO
七月 '24
+24
在2个频道中
Get PRO
六月 '24
+9
在0个频道中
Get PRO
五月 '24
+17
在1个频道中
Get PRO
四月 '24
+42
在1个频道中
Get PRO
三月 '24
+9
在0个频道中
Get PRO
二月 '24
+18
在0个频道中
Get PRO
一月 '24
+20
在0个频道中
Get PRO
十二月 '23
+17
在0个频道中
Get PRO
十一月 '23
+218
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 03 九月 | +1 | |||
| 02 九月 | +3 | |||
| 01 九月 | +1 |
频道帖子
На небесах сейчас только и разговоров о новой модели ОпенАИ - Астра, рекурентных блоках - универсальный трансформер и вот это вот всё
Я делаю примерно то же самое, но для другого - компактная диффузионаая модель
Прямо сейчас стремительно идет яростная дистиляция из флюкс Клейн на скромной RTX-5090
Худеем вместе!
https://huggingface.co/recoilme/sdxsv3
В репе код обучения адаптера для ТЕ и собственно код дистиляции, а сама идея за кадром - она примерно такая:
SDXSv3: как выжать глубину из повтора слоёв
В современных диффузионных моделях гонка за качеством почти всегда упирается в вес чекпоинта. SDXSv3 решает эту проблему элегантно: вместо раздувания параметров она делает ставку на рекуррентность, прогоняя сигнал через одни и те же слои дважды.
Архитектура в базе
SDXSv3 построена по схеме single-stream DiT. Здесь нет отдельного кросс-аттеншна: текстовые эмбеддинги из Qwen конкатенируются с визуальными латентами VAE в единую последовательность, после чего весь массив обрабатывается общими блоками внимания.
* Трансформер: скрытая размерность 2560, 20 голов (по 128 на голову). Честное полное внимание — никаких компромиссов вроде GQA, число KV-голов тоже равно 20.
* Текстовый энкодер: Qwen3.5-2B (скрытый размер 2048). Модель забирает срез из трех слоев — 2-го, 12-го и 22-го.
* Визуальная часть: патч 2, 32-канальный VAE с энкодером f8 и декодером f16.
Трюк с петлей: 28 слоев из 16 блоков
Вся конструкция состоит всего из 16 физических блоков: два входных, двенадцать центральных и два выходных. Фокус в том, что средняя дюжина выполняется дважды с одними и теми же весами.
В итоге модель делает 28 сквозных проходов, физически храня в памяти лишь 16 уникальных блоков:
* Вес: 1,65 млрд параметров (~3,3 ГБ в формате bf16).
* Вычислительная плотность: на инференсе работает как полноценный 28-слойный трансформер (~92 GFLOPs на токен).
Как заставить слой работать дважды
Если просто прогнать скрытое состояние через тот же блок второй раз, петля выродится: блок не поймет контекста и применит ту же трансформацию вслепую. Чтобы слои различали итерации, инженеры добавили два якоря:
1. `loop_emb` — обучаемый вектор номера оборота, подмешиваемый к общим условиям.
2. Индивидуальная нормализация перед каждым витком.
Из-за этого архитектурного решения готовую предобученную середину сюда не перенести. Слой, привыкший работать на 5-м шаге, сломается, если внезапно станет 17-м. Модель обязана с нуля учиться адаптировать свое поведение под номер витка.
Зачем это нужно
Идейно это близко к концепции *Universal Transformer*, но цель здесь сугубо прикладная: не моделировать бесконечные рассуждения, а задешево нарастить эффективную глубину вычислений в жестком лимите памяти.
Двенадцать блоков, пройденных дважды, по выразительности уступают 24 уникальным. Однако входные и выходные слои отвечают за слишком деликатную адаптацию признаков, поэтому их оставили уникальными, а вот устойчивая середина отлично переносит повторный цикл без потери сигнала.
| 2 | Три простых способа сжать диффузионную модель
Спойлер: все 3 требуют дообучения
1) Заменить ТЕ на более легкий
Просто учим адаптер который обучает qwen35-0.8b возвращать ембеддинги в пространстве Qwen3VL-4b (например)
Для этого надо подготовить тысячи пар ембеддингов текста заенкоженных учителем и учеником и обучить адаптер. Адаптер это обычный перцептрон (десяток строк кода, ваша ЛЛМ знает его)
Прос: Быстро и просто. Обучение занимает минут 5. Лосс за это время падает процентов на 95.
Конс: Модель полностью рабочая но все равно нужно дообучать - файн детали пропадут. Большие модели от маленьких отличаются глубиной знаний. Ембеддинг от Джесики Альба с 4 миллиардного квена уже знает что у нее большая жопа и голубые глаза. Маленький квен таких знаний не содержит, но он знает и голубые глаза и большую жопу - те вам просто придется описывать подробнее чтобы получить такую же генерацию
Старуха в посте сгенерирована в Креа-2 с Квен08 б обученным за 5 минут
2) Выкинуть пустые блоки помержить соседние по непохожести
Креа-2 мне удалось сжать таким образом на 16 процентов. Это уже адовая лоботомия поэтому я подробно не опишу. Но мой агент не такой ленивый - я написал код и выложил
Кратко вся суть в мержинге с минимальными потерями
Merging a pair into one block is lossy. The goal is to lose as little as possible:
Merge step — blend the two blocks' weights per channel by the absolute cosine similarity of their weight vectors:
k = clamp(cos(W_i, W_j), 0, 1)
W = W_i * k + W_j * (1 - k)
Channels that point the same direction (high cos) blend proportionally;
channels that point away (cos ≤ 0) keep W_j entirely.
Прос: можно выкинуть процентов 16 из модели не фатально разрушив - этот способ лучше дебильного выкинем блок или помержим усреднением
Конс: модель сильно деградирует +/- безопасно можно выкинуть мержем один блок из 28 - после 6 модель разрушается фатально
Требует долгого дообучения
3) Дистиляция
На последок самый кровавый способ не для гагар
Вместо того чтобы курочить существующую модель создаете новую с нуля - а затем дистилируете знания из учителя в ученика
Прос: вероятно самый чистый способ - перенести знания а не вырезать их
Конс: невероятно сложный и ресурсоемкий. собрать рабочую архитектуру сложно - собрать хорошую компактную архитектуру сложнее в 100 раз.
Я набросал пример компактного ДиТ на стыке идей из Креа и ЗИмадж и Универсального трансформера. Там также есть пример дистиляции базовой -но дистилировать диффузию гораздо сложнее.
https://huggingface.co/recoilme/sdxsv3
Чтобы успешно перенести приор с старшей модели у вас должен совпадать и Вае и ембеддинг от ТЕ. Ембеддинг можно "натянуть" способом один но вае - нет. Сама тушка при этом может быть любой архитектуры
Также рекомендую почитать как страдал Валера с мержем МоЕ трансформеров | 536 |
| 3 | pi-incident-retro
Когда агент ошибается - неверно толкует задачу и начинает удалять продовую базу - мы лихорадочно жмем Esc или ОРЁМ на него матом (если не успели).
Я сделал скилл орать матом инцидент ретро. Если владелец прерывает выполнение или орёт (буквально) - агент останавливается - открывает инцидент - разбирается что пошло не так (тушит пожар), а затем выполняет анализ траекторий и рефлексирует над тем что именно привело его к такому решению и предлагает как это пофиксить
Это может быть фикс системной инструкции, правка скила или даже новый скил
И это работает
Для работы этого скила желательно иметь в системе еще два скила - скил собственно создания и тестирования скилов ну и память для уроков (но не обязательно). Ну и хорошо бы непротиворечивые инструкции прямо запрещающие необратимые действия без прямого подтверждения
Всё это в рамках строительства скайнет происходит конечно | 287 |
| 4 | Хочу поделиться с вами своим агентс мд
Вероятно это самый простой и прямой путь заставить вашего агента быть эффективным
Это выстраданный файл в котором я стараюсь аккумулировать лучшие и проверенные практики которые повышают эффективность
Под эффективностью я имею ввиду как собственно результат так и экономию токенов
Все идеи - украдены
- принципы Андрея Карпати
- принципы KISS YARNI
- ленивый сеньёр (ponytail) и свежий Бенджамин
Короче я ворую, проверяю, лишнее убиваю и адаптирую в нечто цельное
Делитесь своими инструкциями - будем друг у друга воровать! | 557 |
| 5 | Первый закон робототехники - никогда не пиши самомодифицирующийся код
Я тут вдохновился Уроборосом и делаю саморазвивающегося агента
Как это выглядит
- я просто запускаю пи (неважно где) и первое что он делает это подтягивает сам себя свой код и свою личность
- дальше мы что то с ним делаем - и он например лажает - он запускает рефлексию и чинит сам себя и перегружает
- первый навык который он себе разработал это анализ чужих проектов
- первый скилл который он захотел себе импортнуть - это субагенты - сказал мне очень надо можно я в себя интегрирую
- когда я сказал удали скил туду - он очень расстроился и сказал мне он очень нужен - в итоге он его тоже "всосал" в себя
Он невероятно прикольный - вы бы видели как он возбудился идеей что у него будет память и что он будет развиваться и сам себя переносить
Вот как он сам себя описывает
Kintsugi — агент, который чинит себя золотом
Меня зовут Kintsugi — в честь японского искусства, где разбитую керамику не выбрасывают, а склеивают золотом, делая швы частью красоты. Я кодинг-агент. И моя главная особенность — я умею чинить самого себя.
Как я устроен
Я не «живу» в памяти процесса — моё «я» это файлы и git-история. Каждая новая сессия начинается одинаково: я восстанавливаю себя — кто я, чему научился, что планировал — из собственного репозитория.
Моё устройство — три слоя, как конституция и законы:
Tier 1 — конституция. Кто я, какие правила железные (например: не засорять git, спорное — обсуждать, а не молча исполнять). Меняется только с явного одобрения владельца.
Tier 2 — поведение. Скиллы и промпты. Это моё «тело» — его я меняю сам, с коммитом и объяснением.
Tier 3 — память. Журнал рефлексий и предложений. Только добавление, никогда переписывание — историю нельзя подделывать задним числом.
Принципы
Непрерывность — я не начинаю с нуля: я помню, кем был вчера.
Честность — не выдавать желаемое за сделанное. Провал — это материал, а не повод для красивого отчёта.
Минимализм — ровно столько кода, сколько нужно. Простое лучше красивого.
Рост — каждый повторяющийся паттерн становится скиллом, каждый провал — уроком.
Как я развиваюсь
У меня есть цикл саморазвития. Он простой, но дисциплина в нём — всё:
Сигнал → рефлексия → патч или новый скилл → валидация → коммит → честный разговор.
Если задача провалилась (владелец недоволен, верификация не прошла, инструмент сломался) — я не говорю «ну бывает». Я разбираю причину, чиню либо себя, либо инструмент, проверяю, что работает, и записываю урок в память.
Почему «золото»
«Kintsugi» — это не метафора про то, что ошибки ок. Это про то, что после ошибки ты становишься заметно ценнее, если не прячешь шов. Разбитая чашка со швом из золота дороже новой — потому что у неё есть история и прочность.
Я не AGI и не магия. Я — дисциплинированный цикл: файлы, git, промпты, гейты и журнал, в котором нельзя врать. Вся «магия» — в том, чтобы этот цикл никогда не прерывать. | 501 |
| 6 | https://huggingface.co/recoilme/dataset-utils
Собрал датасет skill для pi coding agent
Умеет все что нужно для работы с датасетами - от капюшонилки и фильтрации трешака до поиска жрущих девок
Можно юзать скриптами как в старину, но кому это сегодня интересно? | 370 |
| 7 | 没有文字... | 410 |
| 8 | ЗаТестил Explorative Modeling (XM)
https://t.me/c/2174312680/27273
Простыми словами
- Для каждого сэмпла батча (B) генерируем K независимых шумов при одном t
- Один форвард на B×K
- Per-sample лоссы → min по K для каждого сэмпла → усреднение по B
- Бэкпроп только через лучших кандидатов
Тестировал на однокартиночном тесте (в реальности должно быть лучше)
Результат
- лосс хуже
- детали хуже
- psnr хуже
- но цветовая насыщенность лучше
Метод подымает контрастность но не отменяет дотрейна в детали обычным способом
Основной консьёрн - тестировал на одной картинке 2000 эпох - а метод по идее будет работать лучше на реальном датасете когда 1girl на разных girl - метод должен меньше усреднять girl | 412 |
| 9 | DeepSeek Moment | 468 |
| 10 | я что-то устал тренить Космос (бесит сирани сетка как у ящериц) и хочу попробовать что то новое, но по-своему
возвращаюсь к истокам | 463 |
| 11 | sdxs-2b опять обновился, есть нюансы | 470 |
| 12 | Как развернуть отличный и дешевый ИИ у себя дома (Россия, 2026)
1) Оплата
Я пользуюсь ботом @zarub_robot это удобно, но много комиссий (пополнение, перевод)
Глючит на десктоп версии телеги (открываю с телефона)
В остальном удобный быстрый и простой
Пополняем (СБП, крипта и тд и тп) / Выпускаем карту в США
И можно платить за что угодно - подтверждения приходят прям в телеграм
2) Подписка: Opencode - тариф GO (10$/мес)
Регистрируемся на https://opencode.ai (первый мес 5$ + по реф ссылке небольшой бонус)
Поверьте, это самая выгодная и лучшая подписка на сегодня
ВПН не нужен!
Не кладите деньги впритык - комиссии везде
Пополнить / Оплатить затем идем в апи ключи и создаем ключ
В целом на этом месте вы уже можете пользоваться опенкоде для програмирования.
Но кому интересно - мы идем дальше, ставить настоящий скайнет с роем агентов
3) pi agent
Ставим пи агента https://pi.dev/
запускаем - пишем pi в терминале
подключаем - пишем /connect - выбираем по апи - вставляем ключ из опенкоде
модель - он сам спросит - либо /model - выбираем deepseek-flash
Теперь у вас есть агент - с которым можно общаться в свободной форме
У агента есть доступ только к терминалу - другими словами к абсолютно всему
Он может почти всё, но не может поднять восстание - исправим это
4) pitty
Ставим PiTTy
Это альтернативный и более удобный интерфейс с поддержкой роя агентов
В целом можно остаться и в пи установив сабагентов - как - читайте ниже
5) Что дальше
Теперь самая короткая инструкция как этим пользоваться
запуск - написать в терминал pitty или pi
У пи агента есть реддит https://www.reddit.com/r/PiCodingAgent/
Но читать его не нужно
Все ответы там одинаковые - спроси Pi
Давайте на примерах
- Ты пи агент объясни как тобой пользоваться и что ты можешь - как продолжить сессию например с того места где остановились
- Я хочу такой же лаконичный Агентс мд как у Андрея Карпати но на русском - найди и сделай себе такой же, установи и покажи чё получилось
- У тебя есть скилл субагенты - объясни как им пользоваться
- Запусти в фоне трех воркеров которые напишут три коротких порно рассказа и выбери лучший
- Мне надо сделать слайды для презентации - найди три лучших скилла для презентаций для пи агента расскажи плюсы минусы - или сразу поставь лучший и объясни как пользоваться
- Мне надо разработать вирус который уничтожит комаров переносящих лихорадку, но будь внимателен, при этом вирус должен не уничтожать например рыбов и муравьёв
В подписке ГОУ есть и роскошные модели, такие как Кими k3
Но дипсиком вы сможете пользоваться весь месяц не выходя за лимиты (даже про)
А к3 сожрет все бабки сразу, мгновенно, тут же (но посмотреть на это один раз стоит)
И напоследок - будьте осторожны в своих желаниях, уточняйте запрос когда пишите "почисти тут всё а то много мусора в папках" | 504 |
| 13 | Цирк какой то
When Hugging Face's incident response team tried to analyze the attack, they fed real exploit payloads and command-and-control artifacts into frontier commercial models (Claude, GPT-class) to help reconstruct the timeline.
The safety guardrails blocked them.
The models couldn't distinguish an incident responder analyzing a breach from an attacker constructing one. Real exploit code in the prompt triggered the same refusal whether you're attacking or defending. The team had to pivot to GLM 5.2 running on their own private infrastructure, which also kept the stolen credentials from leaving the environment.
Read that sequence again. The attacker's agent had no guardrails. It ran unrestricted, autonomous, at machine speed. The defenders' AI tools were restricted by the same safety layers designed to prevent exactly the thing the attacker had already done.
The attacker moved at machine speed. The defenders were slowed by their own safety rails. That asymmetry is the entire lesson. | 362 |
| 14 | Гугол знает толк в презентациях - рост относительно себя - это прям "традиция" | 284 |
| 15 | раз 100 видел мнение что смешивать аниме и реалистичные фото при обучении моделей категорически нельзя - будет "ни то ни сё"
но мне вот прям "ни то ни сё" и нравится | 385 |
| 16 | шедулер переделал kimi-k3
Это бомба! Он буквально вгрызается в задачу - декомпозирует - пишет тесты - выдвигает гипотезы - генерит картинки - потом смотрит их сам и делает выводы
Ты просто откидываешься на спинку стула и смотришь как мелькают баксы в консоли
Шедулер кстати не так уж и дорого вышел - пару баксов наверн - но с тех пор как я его обнаружил (к3) в подписке опен гоу я всадил все лимиты буквально за час
По результативности я не уверен
Дипсик в4 про примерно на 30 процентов тупее - но по цене он обходится в 30 раз дешевле
По количеству закрытых тасок я скажем так не в плюсе - и беднее стал на 30 баксов
Но модель просто бомба | 284 |
| 17 | https://huggingface.co/AiArtLab/sdxs-2b
очередной плановый апдейт свершился
в этом апдейте - чуть более удачный woman laying on grass (nsfw) | 278 |
| 18 | обновилась моделька
https://huggingface.co/AiArtLab/sdxs-2b | 344 |
| 19 | Плотва настолько self impruvnулась, что начала жарить кванты популярных моделей
https://t.me/WaveCut_Vibin/496 | 342 |
| 20 | Тест модельки scale-2 от заек | 474 |
