Осцилляции WaveCut
رفتن به کانال در Telegram
نمایش بیشتر
کشور مشخص نشده استدسته بندی مشخص نشده است
1 011
مشترکین
+124 ساعت
+177 روز
+4330 روز
آرشیو پست ها
1 011
В Suno появилась опция быстрого файн-тюна модели под свои треки.
Цена вопроса — 100 кредитов.
1 011
Ученые денно и нощно трудятся в стенах НИИ, чтобы заменить всех водителей на мух!
1 011
У нас было 2 пакета акций NVIDIA, 75 API-ключей от OpenAI, 5 упаковок больших языковых моделей или LLM, солонка, наполовину заполненная токенами, и целый парад планет различных агентов, копайлотов, ассистентов, обёрток над API и всего такого, всех цветов… а также полбутылки венчурных денег, литр капекса гиперскейлеров, ящик H100, пол-литра экспоненты и две дюжины прогнозов про AGI к 2027-му. Не то, чтобы это всё было нужно в поездке, но раз начал коллекционировать AI-экономику, то иди в своём увлечении до конца. Единственное, что меня беспокоило — это экспонента. Ничто в мире не бывает более беспомощным, безответственным и порочным, чем экономика в экспоненциальном запое. И я знал, что мы очень скоро в это окунемся
1 011
Умелец переобучил с помощью RL модель мозга плодовой мушки, чтобы научить ее играть в Beat Saber.
Осталось дождаться, когда хакеры научатся заливать исправленную прошивку обратно в мозг реальной мушки, чтобы случился настоящий киберпанк!
1 011
Repost from whargarbl
Три простых способа сжать диффузионную модель
Спойлер: все 3 требуют дообучения
1) Заменить ТЕ на более легкий
Просто учим адаптер который обучает qwen35-0.8b возвращать ембеддинги в пространстве Qwen3VL-4b (например)
Для этого надо подготовить тысячи пар ембеддингов текста заенкоженных учителем и учеником и обучить адаптер. Адаптер это обычный перцептрон (десяток строк кода, ваша ЛЛМ знает его)
Прос: Быстро и просто. Обучение занимает минут 5. Лосс за это время падает процентов на 95.
Конс: Модель полностью рабочая но все равно нужно дообучать - файн детали пропадут. Большие модели от маленьких отличаются глубиной знаний. Ембеддинг от Джесики Альба с 4 миллиардного квена уже знает что у нее большая жопа и голубые глаза. Маленький квен таких знаний не содержит, но он знает и голубые глаза и большую жопу - те вам просто придется описывать подробнее чтобы получить такую же генерацию
Старуха в посте сгенерирована в Креа-2 с Квен08 б обученным за 5 минут
2) Мержинг. Выкинуть пустые блоки и помержить соседние по непохожести
Креа-2 мне удалось сжать таким образом на 16 процентов. Это уже адовая лоботомия поэтому я подробно не опишу. Но мой агент не такой ленивый - я написал код и выложил
https://huggingface.co/recoilme/losslessmix-dit#idea
Кратко суть мержинга с минимальными потерями:
Merging a pair into one block is lossy.
The goal is to lose as little as possible:
Merge step — blend the two blocks' weights per channel by the absolute cosine similarity of their weight vectors
- Channels that point the same direction (high cos) blend proportionally;
- Channels that point away (cos ≤ 0) keep
W_j entirely.
So incompatible features are never averaged into garbage — that's the "lossless" part, inherited from recoilme/losslessmix.
Прос: можно выкинуть процентов 16 из модели не фатально разрушив - этот способ лучше дебильного выкинем блок или помержим усреднением
Конс: модель сильно деградирует +/- безопасно можно выкинуть мержем один блок из 28 - после 6 модель разрушается фатально
Требует долгого дообучения
3) Дистиляция
Напоследок самый кровавый способ (не для гагар)
Вместо того чтобы курочить существующую модель создаете новую с нуля - а затем дистилируете знания из учителя в ученика
Прос: вероятно самый чистый способ - перенести знания а не вырезать их
Конс: невероятно сложный и ресурсоемкий. собрать рабочую архитектуру сложно - собрать хорошую компактную архитектуру сложнее в 100 раз.
Я набросал пример компактного ДиТ на стыке идей из Креа и ЗИмадж и Универсального трансформера. Там также есть пример дистиляции базовой -но дистилировать диффузию гораздо сложнее.
https://huggingface.co/recoilme/sdxsv3
Чтобы успешно перенести приор с старшей модели у вас должен совпадать вход и выход- и Вае и ембеддинг от ТЕ. Ембеддинг можно "натянуть" способом один но вае - нет. Сама тушка при этом может быть любой архитектуры
Также рекомендую почитать как страдал Валера с мержем МоЕ трансформеров1 011
GLM‑5.3‑Flash выигрывает у Qwen3.8‑Flash‑Next все четыре общих бенчмарка и в среднем сильнее примерно на 10%. Но за это он использует в 1,78 раза больше весов и в три раза больше активных параметров. В пересчёте на общий размер Qwen эффективнее в 1,62 раза, а на активные параметры — в 2,74 раза. То есть GLM — выбор для максимального качества, Qwen — очевидный победитель по intelligence-per-compute и intelligence-per-GB.
