es
Feedback

¡No caigas en manos de tramposos! Telemetrio encuentra y marca estos canales 👉 Si quieres ver la etiqueta, suscríbete 👈

Dendi Math&AI

Dendi Math&AI

Ir al canal en Telegram

Канал Дениса Димитрова об искусственном интеллекте и математике

Mostrar más
3 073
Suscriptores
Sin datos24 horas
+67 días
+630 días

Carga de datos en curso...

Nube de Etiquetas
Sin datos
¿Algún problema? Por favor, actualice la página o contacte a nuestro gerente de soporte.
Menciones Entrantes y Salientes
---
---
---
---
---
---
Atraer Suscriptores
oct '26
octubre '26
+702
en 6 canales
septiembre '260
en 1 canales
Get PRO
agosto '260
en 0 canales
Get PRO
julio '260
en 0 canales
Get PRO
junio '260
en 1 canales
Get PRO
mayo '260
en 0 canales
Get PRO
abril '260
en 0 canales
Get PRO
marzo '260
en 0 canales
Get PRO
febrero '260
en 2 canales
Get PRO
enero '260
en 0 canales
Get PRO
diciembre '250
en 45 canales
Get PRO
noviembre '250
en 26 canales
Get PRO
octubre '250
en 0 canales
Get PRO
septiembre '250
en 8 canales
Get PRO
agosto '250
en 1 canales
Get PRO
julio '250
en 4 canales
Get PRO
junio '250
en 7 canales
Get PRO
mayo '250
en 8 canales
Get PRO
abril '250
en 1 canales
Get PRO
marzo '250
en 1 canales
Get PRO
febrero '250
en 0 canales
Get PRO
enero '250
en 0 canales
Get PRO
diciembre '24
+70
en 8 canales
Get PRO
noviembre '24
+36
en 0 canales
Get PRO
octubre '24
+48
en 1 canales
Get PRO
septiembre '24
+42
en 0 canales
Get PRO
agosto '24
+503
en 1 canales
Get PRO
julio '240
en 1 canales
Get PRO
junio '240
en 6 canales
Get PRO
mayo '240
en 1 canales
Get PRO
abril '240
en 2 canales
Get PRO
marzo '240
en 0 canales
Get PRO
febrero '240
en 0 canales
Get PRO
enero '240
en 0 canales
Get PRO
diciembre '230
en 0 canales
Get PRO
noviembre '230
en 0 canales
Get PRO
octubre '230
en 0 canales
Get PRO
septiembre '23
+69
en 0 canales
Get PRO
agosto '23
+86
en 0 canales
Get PRO
julio '23
+1 800
en 0 canales
Fecha
Crecimiento de Suscriptores
Menciones
Canales
10 octubre+2
09 octubre+8
Publicaciones del Canal
Хочу поддержать коллег из Яндекса после атак на их датацентры. Очень уважаю то, что вы делаете, — от сервисов, которыми пользуюсь каждый день, до исследований и моделей Сил всем, кто сейчас восстанавливает инфраструктуру и возвращает сервисы в строй. Хорошо, что никто из сотрудников не пострадал. Надеюсь, скоро снова будем обсуждать ваши новые релизы и всё будет ок!

2
Подробности про архитектуру + метрики+5
Подробности про архитектуру + метрики
1 103
3
🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших моделей генерации видео, теперь с синхро
🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших моделей генерации видео, теперь с синхронным звуком! 🎬 Video Lite — 3B параметров, акцент сделали на эффективности модели и доступности запуска 🎬 Video Pro — 29B параметров, это флагман с лучшим качеством следования промпту, качеством визуала и динамики Обе модели понимают мультиязычные запросы и генерируют видео (режим text-to-video) или «оживляют» изображения (режим image-to-video). Разрешение видео — вплоть до FullHD с помощью нашей модели апскейла Kandinsky SR 2.0 Video. Модели поддерживают создание видео до 5 секунд с диалогами, музыкой и звуками окружения. Аудиодорожка синхронизирована с происходящим в кадре, а движения губ персонажей — с их речью ⚡️ Про качество Модель Kandinsky 5.0 Video Pro более полугода занимала первое место среди открытых моделей в задаче text-to-video на arena.ai и была сопоставима по визуальному качеству с Veo 3. По нашим side-by-side сравнениям флагман новой линейки — Kandinsky 6.0 Video Pro — заметно превосходит Kandinsky 5.0 Video Pro по визуальному качеству, реалистичности движения и следованию запросу и показывает качество на уровне Veo 3.1 Fast. А среди открытых моделей Kandinsky 6.0 Video Pro уступает только MiniMax H3, достигая паритета с LTX 2.5. Больше сравнений и деталей — в техрепорте (кстати, буду рад апвоутам статьи, сейчас мы уже традиционно #1 Paper of the day) 🔧 Немного технических подробностей 🔘Для обучения мы подготовили 50 млн изображений, 20 млн видеосцен, 40 млн аудиотреков и 7 млн видео с синхронным аудио 🔘В основе моделей — CrossDiT с двумя башнями: видео и аудио, с bidirectional audio↔video cross-attention. Видеобашню мы инициализировали моделью Kandinsky 5.0 Video (Lite и Pro, соответственно), аудиобашню обучали сначала с нуля, а затем совместно с видеобашней на качественных видео с синхронным звуком 🔘SFT делали в два этапа: сначала улучшали визуальное качество, дообучая видеобашню с замороженной аудиобашней. Затем размораживали всю модель и совместно дообучали обе башни с фокусом на качество аудио, синхронизацию модальностей и качество липсинка. На обеих стадиях обучали отдельные модели для 11 доменов, а в конце супировали полученные компоненты, усредняя веса в одну модель 🔘Смогли завести RL: на нашем тесте доля ошибок в генерируемой речи (WER) снизилась с 23,5% до 12,4% у модели Pro 💪 🔘Поработали и над ускорением: подготовили дистиллированные версии Lite и Pro с генерацией за 10 шагов. Использовали π-Flow с последующим adversarial-дообучением Sim-LADD. По нашим side-by-side сравнениям в режиме image-to-video дистиллированная Pro сохраняет качество на уровне полной версии, при этом работает быстрее: 402→175 секунд на 5-ти секундное видео для Pro и 157→98 секунд для Lite 🔘Адаптировали и Lite, и Pro для запуска на на RTX 4090, 5060 Ti, 5080, 5090, PRO 6000 Полезные ссылки: 👉 Почитать подробнее: техрепорт 👉 Код и веса: GitHub, Hugging Face, GitVerse 👉 Модель уже доступна через FAL, Diffusers, ComfyUI, SGLang и vLLM-Omni 👉Больше о нашей команде, моделях и исследованиях — на сайте Kandinsky Lab Попробовать модель Pro можно в ГигаЧат в разделе Видео. Делитесь своими генерациями и обратной связью 🙂 @dendi_math_ai
8 605
4
🤖 Всё никак не добирался написать, но новость интересная и точно заслуживает вашего внимания. Недавно мы выложили в открытый+5
🤖 Всё никак не добирался написать, но новость интересная и точно заслуживает вашего внимания. Недавно мы выложили в открытый доступ Kandinsky WM 1.0 — линейку генеративных моделей для Physical AI Один из больших трендов сейчас — развитие Physical AI Foundational Models (FM), которые способны полноценно моделировать физический мир. И многие сильные команды приходят к Physical AI FM именно через видеогенерацию. Это довольно естественный путь: обучаясь на видео, модель получает представление о движении, динамике и взаимодействии объектов. Следующий шаг — связать эту модель с действиями агента. Отсюда, в частности, вырастает направление World Action Models: моделей, которые связывают действия робота с тем, как вследствие этих действий изменится наблюдаемый мир (и, наоборот, как выбрать оптимальное действие робота в соответствии с наблюдаемым / предсказанным поведением мира, среды). При этом сама видеогенерация постепенно становится частью более широких omni-моделей. Например, Cosmos 3 от NVIDIA умеет работать с текстом, изображениями, видео, звуком, действиями на вход и на выход и может использоваться для разных robotics задач. Atlas от World Labs работает с текстом, изображениями, видео и 3D и позволяет восстанавливать реальные сцены и строить на их основе симуляции. Мы развиваем Kandinsky в том же направлении: используем накопленный опыт в видеогенерации, чтобы строить модели для роботов и беспилотников. Kandinsky WM 1.0 — наш первый открытый релиз в этом треке. Мы выложили open source три специализированные модели: 🚗 K5-AV (Autonomous Vehicle) для генерации автомобильных сцен, 🦾 K5-RO (Robotics) для генерации различных сцен манипуляции с предметами, 🌍 K5-PH (Physics) для генерации сцен со сложной физикой в целом: движением людей, протеканием процессов и взаимодействием объектов. Все модели получены дообучением нашей базовой модели генерации видео Kandinsky-5 Video Lite (2B). Модели умеют генерировать 5 секунд видео по первому кадру и текстовому описанию (то есть работают в режиме I2V). Разрабатывали эти модели мы в первую очередь для генерации синтетических данных для обучения других моделей — в основном VLA — которые управляют роботами и беспилотными авто. Особенно важны тут редкие сценарии: сцены ДТП, видео экстремальной погоды или кейсы с отказом оборудования. Собирать такие данные в реальности дорого, очень сложно, а иногда и просто небезопасно. С помощью генеративной модели такие данные можно получасть практически неограниченно. Но у такого подхода есть и обратная сторона: если VideoGen модель неправильно воспроизводит физику, то в обучающие данные для VLA попадут ошибки. К сожалению, такого рода галлюцинации характеры для всех современных VideoGen моделей, потому что при их обучении больше фокусируются на эстетическом (визуальном) качестве, чем на физической достоверности. Улучшить физичность по сути можно 2 способами: добавляя больше данных со сложной динамикой в претрейн и используя различные приёмы на этапе alignment (например, RL с физическими reward-моделями). Претрейн у нас уже был фиксирован (Lite), поэтому мы фокусировались на alignment: cначала делали SFT на качественных данных каждого домена (AV, RO, PH). Затем — RL с хитрыми reward-моделями за физическую достоверность (подробности можно почитать в статье на хабр) ⚡️По бенчмаркам: на Physics-IQ Verified для модели K5-PH получили рост общего score 16,0 (Lite) → 25,8 (Lite SFT PH) → 30,8 (K5-PH). Бенчмарк проверяет, как модели в режиме генерации видео продолжают реальный физический эксперимент по первому кадру. Домены экспериментов: механика твёрдых тел, динамика жидкостей, оптика, термодинамика и магнетизм. Модели сейчас тестим с коллегами из Центра робототехники (ребята в том числе помогали с обучающими данными для K5-RO) и с AIRI в рамках развития симулятора XSIM World. Веса и код моделей выложены под открытой лицензией MIT. Полезные ссылки: 👉 Хабр 👉 GitHub 👉 HuggingFace @dendi_math_ai
2 718
5
Курс по Visual GenAI от Yandex Research и ШАД Авторы CV Time не только пишут обзоры статей о компьютерном зрении, но и создаю
Курс по Visual GenAI от Yandex Research и ШАД Авторы CV Time не только пишут обзоры статей о компьютерном зрении, но и создают обучающие курсы. Сегодня делимся курсом ШАДа «Генеративные модели в компьютерном зрении», который ведёт Дмитрий Баранчук, руководитель группы GenAI в Yandex Research, вместе с праймовой командой исследователей в этой области. Будет полезно тем, у кого есть базовые знания по генеративкам и желание разобраться глубже: • в теории диффузионных моделей, эффективных методах их обучения и семплирования; • в новых гибридных моделях на основе диффузии для генерации изображений, видео и 3D. У курса есть открытый GitHub-репозиторий, где можно найти слайды, записи лекций и семинаров, а также домашние задания. CV Time
1 302
6
Сегодня в 12:00 продолжаем, но теперь онлайн: https://dion.vc/event/datafest-kb Программа на сегодня вот тут
2 141
7
Подключайтесь послушать: Секция GenAI Секция GenCV Вот тут программа
2 264
8
В этом году я организую секцию GenCV в рамках DataFest 2026. Будут интересные доклады: о моделях генерации изображений, видео
В этом году я организую секцию GenCV в рамках DataFest 2026. Будут интересные доклады: о моделях генерации изображений, видео, 3D, о моделях мира, о VAE для токенизации мультимодального контента. Обсудим разные подходы при создании такого рода моделей (обязательно — омнимодальность 😉), поговорим про инженерные сложности pre-train, alignment (SFT, RL) и про то, как добиться real time генерации видео, затронем нюансы сбора и фильтрации данных. Конечно, обсудим применения моделей генерации изображений/видео и их потенциал в настоящем и будущем. В общем, будет интересно и полезно! 💪 Сегодня последний день, когда можно подать доклад. Так что если есть релевантные темы, скорее подавайте заявку, и буду рад вас видеть. Или просто приходите послушать доклады и понетворкать
2 881
9
А вы знали, что методы генерации видео можно использовать для прогноза погоды? Наша команда разработала Marchuk — первую в Ро
А вы знали, что методы генерации видео можно использовать для прогноза погоды? Наша команда разработала Marchuk — первую в России генеративную модель для прогнозирования климатических рисков. Мы взяли диффузионные трансформеры (которые обычно генерируют изображения и видео) и научили их предсказывать погоду. И вот что получилось: ✔️Субсезонный диапазон: Marchuk позволяет строить прогнозы на 15-30 дней вперёд ✔️Компактная модель: имея всего 276M параметров, она показывает сопостовимое качество с 1,6B аналогом ✔️Доступность: Код и веса модели в открытом доступе, а запустить ее можно всего на одной видеокарте или в Colab 💡 Имя модели — дань уважения математику Гурию Ивановичу Марчуку, заложившему основы численного моделирования климатических процессов. 👇 Читайте подробности о разработке по ссылкам: ArXiv | Project Page | GitHub | Colab | HF
1 806
10
Приглашаем на пятый Большой Семинар AIRI, который пройдёт 16 апреля в 17:00 ⤵️ Хотим поделиться с вами, что у Института AIRI
Приглашаем на пятый Большой Семинар AIRI, который пройдёт 16 апреля в 17:00 ⤵️ Хотим поделиться с вами, что у Института AIRI тоже юбилей — в этому году нам исполняется пять лет. Готовимся праздновать ❤️ Докладчиком выступит доктор экономических наук, декан и профессор экономического факультета МГУ им. М. В. Ломоносова, заведующий кафедрой прикладной институциональной экономики Александр Александрович Аузан. Тема выступления: «Новая гипотеза образования в эру ИИ». Модератор Большого Семинара AIRI — доктор физико-математических наук, профессор РАН, генеральный директор AIRI, декан факультета искусственного интеллекта МГУ Иван Оселедец. 📌Подробное описание лекции и регистрация на очный формат по ссылке. Трансляция пройдёт в VK Видео и на YouTube. Сбор гостей начинается с 16:30. До встречи!
2 095
11
⚡️Коллеги из Центра Робототехники Сбера на этой неделе опубликовали техрепорт по Green-VLA. Это 4B staged vision–language–act+1
⚡️Коллеги из Центра Робототехники Сбера на этой неделе опубликовали техрепорт по Green-VLA. Это 4B staged vision–language–action (VLA) модель для generalist-роботов и, в первую очередь, конечно же для робота Грина 😎 Его как раз и делают ребята — они представляли Грина и довольно подробно про него рассказывали (особенно в части железа и контрола) на AI Journey в конце ноября 2025 В статье подробно разобрано, что именно помогает VLA моделям не разваливаться в реальном мире и быть устойчивыми к изменению сред и робот-платформ. На самом деле, это всё очень сложные задачи (например, картины по разным причинам рисовать «проще» 😄 — в смысле, картинки генерировать). У человека способности уверенно оперировать в физическом мире, в том числе подстраиваться к незнакомым средам, выполнять там сложные задачи, в конце концов пространственно ризонить, развивались миллионы лет в процессе эволюции: средний человек, например, почти не приложит никаких усилий для того, чтобы «в совершенно незнакомой квартире (например, у новых друзей) найти кухню и заварить там чашечку кофе». Стив Возняк к слову предложил именно эту задачу как тест на human-level embodied AGI (неспроста 💯) В случае роботов (и, конкрентно, VLA, которые действиями роботов управляют) этого прогресса исследователям фактически надо добиваться «с нуля» (на самом деле, не совсем так — ведь есть фундаментальные модели почти на все случае жизни: языковые, мультимодальные, модели генерации изображений и видео) В общем, в процессе исследований коллеги из Центра Робототехники: 🔘разработали пятиступенчатый пайплайн обучения (он даёт роботу возможность надёжно выполнять разные задачи в реальном мире): L0 (тут берётся базовая обученная VLM-ка) → L1 (дополнительная стадия дообучения для лучшего понимания моделью физики мира, прокачивание пространственного ризонинга) → R0 (ещё одна стадия претрейна на 3,000+ часах видео с широкого класса роботов) → R1 (тюн уже под конкретного робота) → R2 (RL-based policy alignment — даёт дополнительную робастность при выполнении роботом сложных инструкций) 🔘показали, как эффективно выучивать и использовать единое action-пространство для разных робот-платформ (необходимо, чтобы перенос между эмбодиментами был системным и масштабируемым); 🔘показали SOTA результаты на разных бенчмарках: Simpler/BRIDGE WidowX, CALVIN ABC→D и на реальном Green Humanoid 🧩 Из планов — мы с ребятами уже проводим совместную работу по генерации синтетики с помощью семейства моделей Kandinsky, чтобы ещё сильнее увеличить generalization Green-VLA и расширить покрытие «редких» сценариев (которые по естественным причинам сложно и дорого собирать в реальном мире) По хорошей традиции ребята залетели в топ Daily Papers на HF 🤗 Они уже давно топ-1 среди статьей дня и недели и топ-2 в рейтинге месяца. Считаю, что надо помочь ребятам стать топ-1 по месяцу — работа получилась очень хорошая. Если вам техрепорт тоже показался полезным, обязательно ставьте upvote ⬆️ И ещё раз все полезные ссылки: 👉 Upvote ставить тут 👉 ArXiv 👉 Project Page 👉 GitHub
8 954
12
🥳 Мы докатили в text-to-video арену две наши последние модели генерации видео Kandinsky 5.0 Video Lite и Pro ⚡️Результаты сл+1
🥳 Мы докатили в text-to-video арену две наши последние модели генерации видео Kandinsky 5.0 Video Lite и Pro ⚡️Результаты следующие: 🔘Pro версия является ТОП-1 опенсорсом в мире (см. модели с лицензиями MIT, Apache 2.0 в лидерборде) 🔘Lite версия лучше первой версии Sora (не супердостижение, но у Lite всего 2B параметров) 🔘Лучше нас (Pro) только Google (Veo 3.1, Veo 3), OpenAI (Sora 2), Alibaba (Wan 2.5), KlingAI (Kling 2.5, 2.6) — объективно самые сильные модели генерации видео в мире на текущий момент; в паритете с нами Luma AI (Ray 3), MiniMax (Hailuo 2.3) — отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла 🔘В целом стоит отметить, что для российских генеративных моделей выход на международную арену — довольно уникальное событие 🚀 Полезные ссылки: 🔘Посмотреть весь лидерборд можно вот тут: lmarena 🔘Твиттер организаторов арены: X lmarena.ai 🔘Почитать подробнее про Kandinsky 5.0: пост, техрепорт, 🔘Потестить Kandinsky 5.0: github и hf @dendi_math_ai
23 124
13
⚡Салют, Гига! — уже сегодня Обещал вернуться с программой — вот она. Моя команда приготовила на эту конференцию большое количество материалов в формате докладов, воркшопов, постеров и стендов. Фокус — на синтез мультимедийного контента (изображений, видео, синхронного аудио) с помощью новых моделей Kandinsky. Успеем рассказать почти всё (и продемонстрировать это на практике) Поговорим: 🔘об архитектуре, инфраструктуре и деталях обучения нового семейства моделей генерации изображений и видео Kandinsky-5: как этапа pre-train, так и alignment (SFT и RL); 🔘о способах дообучения Kandinsky-5 для персонализации и добавления новых сущностей, а также для более качественного управления камерой; 🔘о том, как мы готовили датасет для pre-train и alignment моделей Kandinsky-5; 🔘об ускорении диффузионных моделей в разы — с помощью диффузионной дистилляции; 🔘о добавлении синхронного аудио к видео при генерации; 🔘о разработке и применении метода разреженного внимания NABLA (Neighborhood Adaptive Block-Level Attention) для ускорения инференса и обучения моделей Kandinsky-5; 🔘о K-VAE, которые нужны для кодирования и декодирования изображений и видео и которые крайне необходимы для обучения core-модели; 🔘даже о моделях мира, которые строятся поверх моделей генерации видео; 🔘и, конечно, о будущем моделей генерации изображений и видео, вызовах, которые стоят перед их разработчиками, и о некоторых их применениях Кроме того, коллеги из GigaChat и GigaData подготовили огромное количество очень интересных выступлений и докладов про разработку и обучение семейства языковых моделей GigaChat, а также про данные, которые для этого необходимы. А организаторы уложили это в концепцию целого ГигаГорода В общем, будет очень насыщенно, интересно и полезно! Участие бесплатное, но нужна регистрация. К сожалению, оффлайн регистрация уже закрылась, но ещё можно запланировать и подключиться онлайн (мой собственный доклад в 14:00) Увидимся! 🚀
11 318
14
Кстати говоря, за последнюю неделю наш техрепорт сначала взял топ-1 за день, потом за неделю, а сейчас уже и за месяц (ноябрь
Кстати говоря, за последнюю неделю наш техрепорт сначала взял топ-1 за день, потом за неделю, а сейчас уже и за месяц (ноябрь) в рейтинге Daily Papers на HF 🤗, причём с хорошим отрывом. Осталось продержаться 3 дня :)
8 184
15
Всем привет! В дополнение к нашему подробному техрепорту по линейке моделей Kandinsky 5.0 на английском сегодня мы выпустили статью на Хабр на русском 🔥 Там найдёте ещё больше подробностей разработки наших моделей, примеров их использования и разных применений! 👉 Ещё раз ссылка на статью на Хабр 👉 Ссылка на техрепорт @dendi_math_ai
13 332
16
10 декабря будем с ребятами рассказывать о том, что сделали за этот год по всем направлениям в рамках разработки моделей Kandinsky. Будет много всего интересного, регистрируйтесь и приходите @dendi_math_ai
7 712
17
⚡Мы также выложили в открытый доступ наши новые вариационные автоэнкодеры K-VAE 1.0 ❓О чём речь Генеративные модели, такие ка+1
⚡Мы также выложили в открытый доступ наши новые вариационные автоэнкодеры K-VAE 1.0 ❓О чём речь Генеративные модели, такие как, например, Kandinsky 5.0, синтезируют медиаконтент в «скрытом» пространстве, нечитаемом для человеческого глаза. Это необходимо для более эффективного, быстрого и менее требовательного к памяти обучения и применения такого рода моделей. Мы выпускаем собственные, обученные с нуля автоэнкодеры K-VAE 1.0 для изображений (2D) и видео (3D), которые преобразуют медиа в «скрытые» представления и обратно K-VAE 1.0 2D работает с изображениями (сжимая в 8x8, то есть в 8 раз по каждой из пространственных осей), а K-VAE 1.0 3D — с видео (сжимая в 4x8x8, то есть в 4 по временной оси и в 8 по каждой из пространственных). Модели превосходят соответствующие лучшие open-source альтернативы (FLUX VAE, Wan VAE, HunyaunVideo VAE) на открытых датасетах 🚀 Доступность и информация: 🔘 Лицензия поддерживает коммерческое использование (MIT) 🔘 Все материалы можно найти на GitHub и HuggingFace 🔘 Почитать подробнее можно на Хабр @dendi_math_ai
8 162
18
🚀 Мы с командой открываем всю линейку генеративных моделей Kandinsky 5.0! В сентябре мы выложили в open source Kandinsky 5.0+1
🚀 Мы с командой открываем всю линейку генеративных моделей Kandinsky 5.0! В сентябре мы выложили в open source Kandinsky 5.0 Video Lite, получили множество положительных отзывов и полезной обратной связи, большое спасибо всем! Сегодня мы открываем всю линейку: как Video, так и Image модели. Дальше расскажу все подробности, но можно сначала сходить попробовать: модели доступны всем на открытых поверхностях ГигаЧат: Telegram, Max и giga.chat 🎬 Video Pro – мощные Text-to-Video и Image-to-Video – лучшие в мире open source модели, превосходящие по качеству Wan 2.2 A14B и работающие наравне с Veo 3 от Google по визуалу и динамике (в HD) 🖼 Image Lite – универсальные Text-to-Image и Image Editing модели c 6B параметров, которые нативно поддерживают промты на русском языке, знают культурный код и генерируют картинки с кириллическим текстом. Значительно превосходит FLUX.1 [dev] в задаче генерации изображений и работают на одном уровне с FLUX.1 Kontext [dev] в их редактировании В открытом доступе: четыре версии Image Lite и пять версий Video Pro для разных задач (для генерации 5 сек и 10 сек видео, разрешение — SD и HD). Доступны как SFT-версии с максимальным качеством, так и Pretrain, для исследователей и дообучения 🔧 Как мы достигли этого (подробнее в нашем большом техрепорте): 🔘 Большой Pretrain-датасет 520 млн изображений и 250 млн видео-сцен 🔘 Фокус на SFT: художники и дизайнеры тщательно выбирали материалы с безупречной композицией, стилем и визуальным качеством 🔘 Разработали метод NABLA для стабильной 10-секундной генерации в HD-разрешении 🔘 Использовали архитектуру Kandinsky-DiT с flow matching 🚀 Доступность и информация: 🔘 Лицензия поддерживает коммерческое использование (MIT) 🔘 Все материалы можно найти на GitHub, HuggingFace и GitVerse 🔘 Техрепорт, кстати, уже сейчас #1 в Daily Papers, но ваша поддержка поможет укрепить эту позицию :) @dendi_math_ai
7 486
19
⚡️У нашей конференции AI Journey в этом году появился специальный трек для всех, кто хочет послушать толковые технические док
⚡️У нашей конференции AI Journey в этом году появился специальный трек для всех, кто хочет послушать толковые технические доклады, узнать о разных реализуемых AI-кейсах и просто провести время с пользой, пообщавшись с интересными людьми. Знакомьтесь — AIJ Deep Dive! Трек пройдет 19 ноября (наука) и 20 ноября (бизнес) на площадке штаб-квартиры Сбера на Кутузовском проспекте — регистрация для очного участия уже открыта! Программа будет соответствовать тематике дней. Поэтому если хотите попытать спикеров (меня, в частности) техническими вопросами, узнать разные нюансы текущих исследований и разработок — это можно будет сделать 19 ноября. А если вам больше интересны реальные кейы внедрения AI в бизнес и разные практические результаты — приходите 20 ноября При этом оба дня будут работать постер-сессия с разными научными статьями (уровня A*/ A) и выставка AI-решений. И, конечно, будет крутой нетворкинг (но это во многом будет зависеть от вас) Кстати говоря, мы с командой с 2020 года готовим разные соревнения для контеста, который проходит в рамках AI Journey: например, Digital Пётр или серию FusionBrain Challenge (1.0, 2.0, 3.0, 4.0). В этом году можно поучаствовать в не менее интересных соревнениях (у которых помимо всего прочего еще и хороший призовой фонд) В общем, регистрируйтесь, приходите и участвуйте! Увидимся! @dendi_math_ai
3 049
20
🦌 RUDOLPH 🦌 Наконец-то дошли руки написать о нашей давней разработке, о модели RUDOLPH (RUssian Decoder On Language Picture Hyper-tasking), которая умеет решать много задач в модальностях текст и изображение и которая уже успела побывать бейзлайном соревнования FusionBrain Challenge 2.0 в 2022 году (и даже заняла там почётное третье место). 💡 Архитектурно модель представляет собой декодер-блок трансформера, работающий с входной последовательностью токенов, которую можно условно разделить на три основных сегмента: левые текстовые токены, токены изображения и правые текстовые токены. За счёт этого на претрейне можно показывать модели сэмплы по 3 задачам: text2image (генерация изображения по тексту), image2text (описание изображения) и text2text (языковое моделирование в левых текстовых токенах). 💡 Мы обучили 4 версии модели, которые различаются между собой как количеством параметров (соответственно, количеством и размером скрытых слоёв), так и соотношением количества токенов текста и изображения: 👉 RUDOLPH-350M 👉 RUDOLPH-1.3B 👉 RUDOLPH-2.7B 👉 RUDOLPH-2.7B-FBC2 💡 Последняя из этих моделей была дополнительно дообучена на инструктивном датасете (когда это ещё не стало мейнстримом 😊) решать 6 прикладных задач в модальностях текст и изображение: Text QA, Math QA, Image Generation, Image Captioning, Visual QA, Text Recognition in the Wild. RUDOLPH даже немного умеет в zero-shot object detection (после соответствующего файнтюна). Фишка этой версии модели также и в том, что она может понимать формулировку задачи на естественном (русском) языке 💪 Подробнее почитать про архитектуру RUDOLPH, узнать детали обучения и файнтюнинга, посмотреть примеры работы модели можно тут: 👉 Хабр Воспользоваться и протестировать RUDOLPH можно тут: 👉 GitHub 👉 HuggingFace 👉 Cloud В создании и обучении RUDOLPH успели принять участие многие ребята (@AShonenkov, @lizagonch - вам отдельное спасибо 👍, @kuznetsoff87, @bra_ket, @NastyaMittseva, @bom_bo0m👌). Всем огромное спасибо за крутую и качественную работу! @dendi_math_ai
5 522