VG: Video Course
Ir al canal en Telegram
Канал для важных объявлений по курсам «Методы обработки и сжатия медиаданных» и «Интеллектуальные методы обработки видео» на ВМК МГУ, а также «Методы обработки и передачи медиаданных» на ФКН ВШЭ.
Mostrar más477
Suscriptores
Sin datos24 horas
Sin datos7 días
Sin datos30 días
Archivo de publicaciones
Господа!
Из прошедшего интересного, тут мелькало сообщение о предновогоднем хакатоне ИНТЦ МГУ «Воробьевы горы» в чате этого канала: "второй кейс может быть интересен студентам медиалаб"
Задача "Кейс 2: Цветокоррекции на базе ИИ" была:
у них-то сессии нет В общем - сходили, аккуратно обернули, и.... взяли первое место! 🎉🎉🎉🎉🎉🎉🎉 Говорят, было не сложно! 🤷♂️😁
Организовали себе 100 тысяч в качестве скромного новогоднего подарка! 🥇🥳🥇🥳🥇
Второе место, к слову, взяли магистры нашей лаборатории. 😲☺️
Продолжаем движение! ✌️
Разработать инструмент (включающий в том числе веб-интерфейс) для калибровки цвета уже установленных камер. Создать сервис для коррекции цвета на фото с камеры с учётом теней, блоков и засветов, например, для стационарного объекта, который снимает камера.Моя реакция была скептична:
Поскольку на все - два дня с веб-интерфейсом и сервисом (во время сессии!!!) - это похоже кто быстрее обернет в веб-интерфейс открытые модели NTIRE) Это не к нам)Но! Молодые аспиранты нашей видеогруппы решили - а почему бы нет?
Господа!
У нас сегодня приняли статью Михаила Воронина на ICDSP 2024! (в рамках выполнения плана - каждому бакалавру по скопусу - см. прошлый пост, статья была написана в бакалавриате))). 💪🥳🎉
Надо сказать, что скопус стало опубликовать сложнее. У нас 3 отказа в этом году по явным политическим причинам (когда статью принимают, но опубликовать не дают и не принимают орвзнос, ибо санкции) + просто отказы. 🤷♂️
Но тем ценнее результат! 🙂🏆🙂
Поздравляю Михаила!!!
🎉🎉🥳🏆🥳🎉🎉
Господа!
У нас отличная новость!
Приняли статью в довольно неплохой Q1 журнал ("Computer Vision and Image Understanding"), первым автором в которой является студентка 5 курса Екатерина Шумицкая. 🙂🙂🙂
Заметим, что летом у Екатерины уже была статья на ICLR Tiny - это А* (поданная еще в бакалавриате).
У нас уровни:
* Scopus (чем больше импакт, тем лучше) в бакалавриате
* Q1 в магистратуре
* A* в аспирантуре
Планомерно работаем над расширением числа тех, у кого получается. Настя Анциферова попала в одну комнату на NIPS на позапрошлой неделе с аспиранткой из Камеруна, в лаборатории которой требование минимум 1 А* к защите диссертации. Считаю, что мы должны быть лучше Камеруна (и требовать минимум две)))! 😉
💐🎉💐🎉💐 Поздравляю Катю и Настю! Это шикарный подарок на новый год! 💐🎉💐🎉💐
Господа!
Всем, кому лемминги зашли. Тут на Хабре очередной крик души. Очень много классики:
Всю мою жизнь считалось, что программисты нереально востребованы и получают кучу денег. Поэтому я никогда не думал, что нужно копить. И вот мне 38, у меня только $20'000 в банках, 12-летняя машина и четверть квартиры в стране, откуда я уехал. Тем временем мои друзья, которые еле сводят концы с концами, как‑то уже выплатили почти всю ипотеку.Программисты часто думают, что будут всегда легко и много зарабатывать потому, что в молодости им заработок дается заметно легче, чем сверстникам. А потом совершенно неожиданно наступает 38... А это вообще классика:
Мне 38, и со здоровьем проблемы. У меня искривление позвоночника. В 17 врачи сказали мне, что если не исправить, то всю жизнь спина будет болеть. Но в этом возрасте все супермены, и я не послушал совет. Всё было нетрудно исправить где‑то до 25 лет. Но я озаботился только к 30. К тому времени это уже было трудно. Я выпрямил спину с 25º до 21º за два года йоги и массажа, но прогресс был такой медленный, что я забросил. А лучше бы продолжил, потому что в 38 это ещё сложнее. Моя спина болит постоянно уже много лет.И еще классика:
Я не пошёл учиться на магистра. В моё время после бакалавра можно было ещё пойти доучиваться на инженера, и я так и сделал. Это ещё полтора года прикладных штук вместо двух лет магистерских исследований. И я жалею, что выбрал это. ... А сейчас эпоха науки. Хорошая архитектура и чистый код уже на втором плане, потому что люди этому уже более‑менее научились. Это может дать тактическое преимущество, но этого уже недостаточно, чтобы выстрелить. Сейчас многое решает щепотка «волшебства». Сотня существующих сервисов вылетает с рынка, когда один из них выделяется искусственным интеллектом с каким‑нибудь прогнозом или генерацией....
Разница в том, что 40 лет назад наука угрожала рабочим местам библиотекарей и телефонных операторов, а сегодня она режет аналитиков, переводчиков, дизайнеров и ассистентов. Программисты следующие в очереди. Конечно, они не все останутся без работы, но количество программистов, нужных на одного учёного, постоянно уменьшается. И это будет продолжаться. Наука ближе к конечному потребителю, чем когда бы то ни было.Больше букв тут: https://habr.com/ru/articles/782740/ Прикол в том, что я вангую, что у товарища еще несколько разочарований на горизонте) (первопричины кризиса среднего возраста налицо, например))) 🤷♂️ Но если его текущие мысли кому-то хотя бы немного помогут - уже хорошо. Поскольку Human Parity в Code Generation будет достигнут в ближайшие 2-3 года (сначала в более узких областях, потом шире). А потом еще пара революций будет. И это многое поменяет в описываемом товарищем направлении. Если кому-то текст мотивации добавит (чтобы в такой же ж... не оказаться), здорово!
Господа!
Ниже текст Антона Обухова - одного из наших сильных студентов прошлых лет, который после университета попал в NVIDIA, был перевезен в Калифорнию, а потом загрустил от прода и в 32 года поступил в аспирантуру в Цюрихе (и дальше много раз повторял "эх если бы я раньше..."). Хотя он все равно безмерно крут и подавляющее большинство уже даже ШАД не могут затащить (поинтересуйтесь на досуге сколько там поступает и сколько заканчивает).
Ну а Антон сотоварищи недавно выпустили SOTA в depth estimation (мы темой тоже занимались и на ВМК я даже курс "Введение в 3D видео" читал, но сейчас тема на второй план отошла). Причем у них идеи, которые потенциально и к другим областям применимы:
хотел попиарить нашу новую работу -- мы сделали лучший monocular depth estimation, назвали его Marigold, и вынесли им старичка MIDAS, которым до сих пор пользовались в Гугле и Дисней ресерч. Если кто помнит, год назад я делал ставку на диффузионки и файнтюнинг генеративных моделей (текст-в-картинки) для решения полезных задач, типа регрессии. Это именно то что мы и сделали, и это открывает на самом деле большие возможности. Хотя в нашей работе мы и показываем, как с этим подходом к регрессии решить задачу оценки карты глубины, ничто не мешает применять этот же подход для решения любых других задач. Важно лишь соблюсти ряд условий, которые прописаны в нашей статье, и SOTA (и возможно ещё одна статья на конференции) -- ваша!Сайт: https://marigoldmonodepth.github.io Статья: https://arxiv.org/abs/2312.02145 Код: https://github.com/prs-eth/marigold HuggingFace: https://huggingface.co/spaces/toshas/marigold Collab: https://colab.research.google.com/drive/12G8reD13DdpMie5ZQlaFNo2WCGeNUH-u?usp=sharing
Господа, из прикольных новостей этой недели.
Выступил очно на этой неделе с двумя докладами на открытом математическом семинаре в университете Иннополис в ОЧЕНЬ хорошей компании (Алексей Наумов - директор центра ИИ Вышки, а Александр Крайнов - директор по развитию ИИ Яндекса, и там еще очень интересные люди были).
Иннополис тоже впечатляет, в первую очередь темпами своего развития. Похож на Сколково, но с лучшим контролем, меньшим количеством перекосов и очень хорошими перспективами. У них новый молодой ректор (Александр Гасников), который массу правильных вещей стартует.
Запись первого дня (я в начале).
Запись второго дня (я в конце после Крайнова - на картинке старое расписание)
Многие слайды до этого показывались только на внутренних индустриальных конференциях) Есть несколько графиков, которые вообще показывались впервые)
Но в целом - известные вам вещи - обзор темы взлома метрик + измерение качества JPEG AI и суперрезов.
Господа!
Из наших текущих развлечений.
Довольно широко известны физические атаки на классификаторы и детекторы. Это когда вы надеваете футболку с хитрым принтом и пропадаете с детектора (или хитрый макияж наносите и сеть вас не узнает).
У нас была задача повторить физическую атаку для метрик. Это оказалось не так просто, как хотелось бы, но, наконец, получилось! Выше пример, когда вы добавляете специально обученный (во всех смыслах) стикер в кадр и no-reference метрика такая "Бо-о-оже, как же похорошела картинка!!!" 😉
В ближайшее время будем расширять спектр атак и, кстати, спектр защит от атак)
Stay tuned!)
Господа!
Анастасия выступила вчера на постерной секции.
Кто узнает человека, окруженного толпой у постеров - молодец!) (пишите имя в комментариях)))
Ну и конференция огромна - на фото выше виден зал, в котором докладчика видно только в бинокль и большое количество экранов не сильно спасают положение)))
На последнем скриншоте: Настя написала автору метрики в приложении конференции про наш новый бенчмарк устойчивости метрик, а он оказывается следит за этой нашей работой и им интересно посотрудничать.
Работаем! )))
Господа!
Анастасия Анциферова - герой прошлого поста и наш сотрудник в ИИИ прислала сегодняшние фото с NeurIPS (A* AI, 7000 участников) сегодня из Нового Орлеана (юг США).
Думаю, подробности еще будут (конференция идет неделю).
Господа!
У нас улетная новость!)
Последняя статья Насти Анциферовой сотоварищи "Comparing the robustness of modern image- and video-quality metrics to adversarial attacks that increase quality scores" зашла на AAAI-2024! Это А* конференция по AI! Йе-е-е-е-е-есссс!!!! 💪 Мы сделали это!!! 💃💃💃) Это уже третья А* Насти и команды метрик за последние 2 года! 🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉
Статья описывает работы по бенчмарку устойчивости метрику, который измеряет насколько метрики легко накручиваются. С одной стороны до сих пор находится много наивных чукотских людей, которые не понимают, кому это нужно. С другой - в топах большинства бенчмарков, сравнений и соревнований в области обработки и сжатия видео уже почти не осталось лидеров, которые бы не оптимизировали результат под метрики (😲 упс...). Все исследователи делают это... А если у бенчмарка лидерборд не по метрике, а по субъективному сравнению, не так просто туда заманить авторов (и почему так происходит, интересно? 😉). Увеличение адекватности сравнения без дорогого субъективного - это буст всей области!
Но еще важнее другая тема. Для тренировки JPEG AI, например, взяли 5 простых старых метрик, не потому, что лучше не было. Метрик лучше (моднее и молодежнее) был вагон. Просто они неустойчивы и в loss их поставить нельзя. При этом очевидно, что при постановке в loss более продвинутой метрики мы получим лучший результат. Аналогичную картину наблюдаем в SR и в других областях. Вопрос, где такую метрику взять или как построить? И это вопрос реально очень хороший. Мы уже сожгли много электричества (в прямом смысле) и потратили много сил на прокапывание этой области, но кроличья нора, похоже, весьма глубока.
Как минимум это повод для следующих А*! 😁😁😁
Продолжаем движение! ✌️
Господа!
У нас улетная новость!)
Последняя статья Насти Анциферовой сотоварищи "Comparing the robustness of modern image- and video-quality metrics to adversarial attacks that increase quality scores" зашла на AAAI-2024! Это А* конференция по AI! Йе-е-е-е-е-есссс!!!! Мы сделали это!!! ) Это уже третья А* Насти и команды метрик за последние 2 года!
Статья описывает работы по бенчмарку устойчивости метрику, который измеряет насколько метрики легко накручиваются. С одной стороны до сих пор находится много наивных чукотских юношей людей, которые не понимают, кому это нужно. С другой - в топах большинства бенчмарков, сравнений и соревнований в области обработки и сжатия видео уже почти не осталось лидеров, которые бы не оптимизировали результат под метрики. А если у бенчмарка лидерборд не по метрике, а по субъективному сравнению, не так просто туда заманить авторов (и почему так происходит, интересно?))).
Но важнее другая тема. Для тренировки JPEG AI, например, взяли 5 простых старых метрик, не потому, что лучше не было. Метрик лучше (моднее и молодежнее) был вагон. Просто они неустойчивы и в loss их поставить нельзя. При этом очевидно, что при постановке в loss б
Ну и чтобы два раза не вставать.
Сегодня наш магистр Никита Алутис сделал устный доклад на конференции VCIP 2023 (как они про себя скромно пишут AI-powered Visual Communications and Image Processing Toward Industry and Services).
С какими приключениями пришлось столкнуться при оплате оргвзноса и билетами вы можете догадаться уже потому, что из России без VPN даже сайт конференции не открывается). Но! В итоге все получилось!!! (напомню зимой у нас был устный доклад на конференции в США, и это не предел)))
Замечу, что Никита автор MSU Video Deblurring Benchmark и перед ним был доклад очередной SOTA в video deblurring, т.е. была возможность пригласить на бенчмарк людей можно сказать лично (это очень важно, кстати, поскольку лично люди дают обратную связь про бенчмарк и т.п., чего никогда не стали бы писать письмами).
Ну и конференция, как заметил внимательный читатель, Toward Industry and Services, то есть ориентированная на индустрию (по крайней мере они пытаются, что, учитывая нашу практичность, очень хорошо).
В общем - поздравляю Никиту с первым докладом на английском на прекрасном острове Седжю (Jeju)! 👏👏👏
Господа!
Хорошая новость - у нас состоялся релиз 17-го бенчмарка MSU Video Super-Resolution Quality Metrics Benchmark! 🥳 И это 14-й бенчмарк в "новой серии" бенчмарков)
Интересен он тем что его выпустил третьекурсник зимнего набора прошлого года!
Вежливо замечу, что в лучшем случае раньше на 3 курсе удавалось весной зарелизить, а то и вообще только к 4 курсу. А тут очень оперативно, при этом лидерборд крайне представительный (60+ метрик и еще будет пополняться в ближайшее время, поскольку посчитано больше).
Это 4-й наш бенчмарк на тему SR. Будем копать тему адекватных метрик качества, ибо работы в этой области (в которой прямо сейчас идет революция) непочатый край.
Интересно, что прямо сейчас один известный онлайн кинотеатр дал нам сэмплы на увеличение разрешения (вы знаете, какое "мыло" они часто показывают), так что работа сразу проходит "боевое" испытание (и оно дается непросто, заметим).
Но перспективы выглядят очень хорошо!
PS. Пояснение картинки: PSNR в некоторых случаях дает ОТРИЦАТЕЛЬНУЮ корреляцию с визуальным качеством SR, при этом она является САМОЙ используемой в статьях по SR. 🤷♂️🤦♂️😉 Будем менять эту тенденцию! 💪
Поздравляю Артема Борисова с релизом!!! 🎉🎉🎉
Repost from Метаверсище и ИИще
А теперь реальный нейрорендеринг.
Ох, щас наброшу интересную тему.
Айфон сам решает, что вы должны увидеть на фото или почему фотография уже давно не отражает этот мир, а представляет собой метаверс, преломленный в мозгах нейрочипов.
Подруга невесты сфоткала последнюю на айфон. И получила три разных невесты. На одном снимке.
Стоя перед двумя большими зеркалами, отражение невесты не отражает ту позу, которую она принимает, и мало того, оба отражения отличаются друг от друга и от той позы, которую невеста принимала на самом деле.
В то время как невеста держала одну руку вверх, а другую вниз, отражение слева видит, что она держит обе руки вниз, а отражение справа - что она держит обе руки на талии.
"Это реальная фотография, не отфотошопленная, не панорамный снимок, не Live Photo", - пишет невеста в своей инсте.
Невеста в ярости идет в Apple Store, где ей рассказывают, что айфончик на деле делает серию снимков, а потом не просто выбирает лучший, а сшивает их в одну фотку.
Ну то есть айфончик решил, что в одном зеркале невесте к лицу одна поза, в другом - другая поза, а как там она выглядит или держит руки ему насрать. Ибо бьютификация - всё, а реальный уродливый мир - отстой и ничто.
Понятно, что вычислительная фотография давно уже не отражает реальный мир (вот почитайте огромную работу Димы Ватолина, где на фотках появляются неожиданные персонажи в результате апскейла).
Но этот кейс потрясающе выпукло демонстрирует нам факт, что мы давно уже полагаемся на ИИ в гораздо более широком круге вопросов, чем думаем.
Если у вас есть другие объяснения происходящего или годные теории заговора, пишите в коменты.
Не удержусь и сделаю форвард, тем более Сергей меня пиарит)
Внимательно посмотрите в следующем фото на руки девушки (оригинальной и в двух отражениях). А вот нечего руками махать, когда тебя фотографируют умные смартфоны! )))
Да, это ровно обработка видео при склейке кадра. Сегодня практически все телефоны делают это! И пример шикарный, конечно!
Кто пройдет по двум ссылкам - попадет на статью на хабре, в которой я попытался максимально популярно разжевать тему.
Раньше мы давали задание на Motion Estimation, чтобы люди пощупали руками видеопоток и поняли, как непросто с ним работать (в том числе выбрать нужный кадр для склейки).
Господа!
Раз в кои-то веки не наши новости, но на мой взгляд для самых продвинутых крайне интересно. А касается вообще всех. Крупный американский венчурный фонд Coatue опубликовал любопытный доклад "The AI Revolution" на 115 слайдов.
На первом графике - запредельно наглядно показана скорость инвестиций в AI за 3.5 года. Видно, что 10 млрд в OpenAI было больше, чем ВСЕ инвестиции во ВСЕ стартапы за предыдущие 2 года. И скорость инвестиций после выросла ~ в 3 раза. Заметим, что компания нашего Карена Симоняна на втором месте по ожиданиям инвесторов 👍😉
Дальше любопытный график скорости достижения уровня человека разными алгоритмами. На вашем месте я обратил бы внимание на линию "Core Generation". LLM уже многие простые куски кода пишут намного быстрее человека и скорее всего прогресс ускорится. Судя по комментариям на Хабре у части веб-программистов уже пригорает. Странно, почему? 😉 Можно предсказать заметное изменение эффективности работы и перераспределение спроса на рынке труда.
Ну и к вопросу "никогда такого не было и вот опять" - шикарный слайд о повышении производительности труда дизайнеров. Простая реклама могла занять месяцы в 60-х, когда чтобы передвинуть надпись - нужно было заново делать рисунок. В 80-х скорость резко возросла (особенно для надписей). Дальше серьезное ускорение за счет совместной работы над макетами (в США модным стали overnight заказы, которые реально реализовывали в Индии). А сейчас с генеративными моделями можно бросать очень прикольных вариантов и кинуть на них нужный текст буквально за минуты. А ведь творческая специальность! (где-то сейчас заплакал оставшийся без ужина дизайнер)
Но ведь это не может с программистами повториться? Ведь никак не может, правда? 😉
Там есть и другие любопытные слайды!
Repost from МГУ имени М.В.Ломоносова
Выпускник МГУ Карен Симонян вошел в мировой рейтинг Топ-100 людей с наибольшим влиянием в сфере Искусственного Интеллекта по версии издания Business Insider в 2023 году.
О том, как проходило профессиональное становление Карена Симоняна в студенческие годы, рассказывает его научный руководитель, руководитель лаборатории интеллектуального анализа видео Института ИИ МГУ и лаборатории компьютерной графики ВМК МГУ - Ватолин Дмитрий Сергеевич.
Читайте в статье ВКонтакте!
Господа!
На днях в Москве шел, VideoTech 2023 - профессиональная конференция по видеостримингу. Вчера общался там с руководителем группы видео-транскодинга Дзена (ВК) - у них очень неплохие результаты, с техническим руководителем Кинопоиска (тоже много транскодинга, раздачи и т.п.) и СТО Окко (транскодинг и т.п.) и еще несколькими целевыми людьми.
Всего почти 6 часов разговоров получилось (доклады слушал мало-мало).
Грамотных людей всем не хватает сильно! "Утешил", что с грамотными людьми скоро все будет еще хуже. Обсуждалась идея устроить курсы повышения квалификации (платные?))). Мысль интересная. Ждем, когда недостаток людей станет настолько жгучим, чтобы они занялись не переманиванием, а инвестициями в обучение (процесс на самом деле уже идет).
На AIJ случайно встретил нашего выпускника 20 года, который сейчас работает в Сбере в ML (причем доволен командой, что бывает там не всегда))) У меня были лекции "Как стать начальником" + прокачка по теме. Он отрапортовал, что уже получил под свое управление 2-х человек. Горячо тему поддержал, дал пару советов))) Работаем над тем, чтобы процент выпускников, которые будут хвастаться подчиненными устойчиво рос! )
Также встретил выпускника AI Masters этого года, ныне он аспиранта Сколтеха, который, как выяснилось, ходил на ВМК на мой курс на 2 курсе, но тогда у него было все слабо и на ИИТ не прошел. Дальше пошел на AIM (в том числе на мой курс с Сергеем Загоруйко там), и продолжает прокачиваться в аспирантуре. Горячо поддерживаю стратегию глубокой прокачки! ) (ибо времена с развитием копайлотов и их вариантов грядут тяжелые)
На VideoTech, к слову, с руководителем команды видео-транскодинга меня познакомил студент, который ходил на мой онлайн курс в Вышке (+читал статьи на хабре + смотрел наши выступления на прошлых VideoTech + читал наши научные статьи - прям человек добрался до всего, включая материалы за пейволами - рад, что люди глубоко копают). Меня человек увидел, познакомился лично. Приятно)
А ты %%USERNAME%% насколько глубоко копаешь? 😁
Коллеги!
Я с хорошей новостью, мотивирующей лучше всех (надеюсь))) сделать выданное в среду задание спецкурса по атакам на метрики. 😉
Команда под кураторством Анастасии Анциферовой (с.н.с. нашей лаборатории в Институте ИИ МГУ и нашей научной группы в ИСП РАН) заняла 🥁🥁🥁🥁🥁🥁🥁🥁🥁🥁🥁🥁 ПЕРВОЕ МЕСТО (🏆🏆🏆🥇🥇🥇👏👏👏) в большом хакатоне проектной смены "Доверенный Искусственный Интеллект" в университете Сириус с темой "Adversarial Purification for IQA Models" (состязательные защиты от атак - следующий уровень по сложности после атак).
Состав команды:
* Александр Гущин 6 курс ВМК МГУ
* Анна Чистякова 5 курс ВМК МГУ
* Владислав Минашкин 4 курс ФПМИ МФТИ
Работа оценивалась по критериям:
* Понятность презентации, постановка задачи, полученный результат (1 место!!!)
* Практическая полезность и применимость результата (1-2 место!!!)
* Общее качество работы (проект поделил 2-3 место, но баллов хватило!)))
В общем жесткой конкурентной борьбе (с преимуществом 0,2 балла по 10 бальной шкале) по занято 1 место из 15 команд!!! 👏👏👏
Всего предложено 7 методов защиты против 10 атак, для всех типов атак побит baseline, для атаки AdvCF обучена модель для восстановления исходного изображения, код выложен на github! 🙂
Будем надеяться, что среди вас будут те, кто окажется в состоянии 3-4 курсу успешно атаковать (как наши девушки из новости недельной давности))), а к 5-6 курсу успешно (состязательно во всех смыслах) защищать от атак, причем и то, и другое - лучше всех! 😁😁😁
