fa
Feedback
Метаверсище и ИИще

Метаверсище и ИИще

رفتن به کانال در Telegram

Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие. Для связи: @SergTsyp

نمایش بیشتر

📈 تحلیل کانال تلگرام Метаверсище и ИИще

کانال Метаверсище и ИИще (@cgevent) در بخش زبانی روسی بازیگری فعال است. در حال حاضر جامعه شامل 52 191 مشترک است و جایگاه 368 را در دسته هنر و طراحی و رتبه 11 706 را در منطقه روسيا دارد.

📊 شاخص‌های مخاطب و پویایی

از زمان ایجاد در невідомо، پروژه رشد سریعی داشته و 52 191 مشترک جذب کرده است.

بر اساس آخرین داده‌ها در تاریخ 15 سپتامبر, 2026، کانال فعالیت پایداری دارد. در ۳۰ روز گذشته تغییر اعضا برابر 708 و در ۲۴ ساعت گذشته برابر 65 بوده و همچنان دسترسی گسترده‌ای حفظ شده است.

  • وضعیت تأیید: تأیید نشده
  • نرخ تعامل (ER): میانگین تعامل مخاطب 16.24% است و در ۲۴ ساعت نخست پس از انتشار، محتوا معمولاً 11.20% واکنش نسبت به کل مشترکان کسب می‌کند.
  • دسترسی پست‌ها: هر پست به طور میانگین 8 461 بازدید دریافت می‌کند. در اولین روز معمولاً 5 836 بازدید جمع‌آوری می‌شود.
  • واکنش‌ها و تعامل: مخاطبان به‌طور فعال حمایت می‌کنند؛ میانگین واکنش به هر پست 102 است.
  • علایق موضوعی: محتوا بر موضوعات کلیدی مانند claude, seedance, контекст, нейропрожарка, редактирование تمرکز دارد.

📝 توضیح و سیاست محتوایی

نویسنده این فضا را محل بیان دیدگاه‌های شخصی توصیف می‌کند:
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие. Для связи: @SergTsyp

به لطف به‌روزرسانی‌های پرتکرار (آخرین داده در تاریخ 16 سپتامبر, 2026)، کانال همواره به‌روز و دارای دسترسی بالاست. تحلیل‌ها نشان می‌دهد مخاطبان به‌طور فعال با محتوا تعامل دارند و آن را به نقطه اثرگذاری مهم در دسته هنر و طراحی تبدیل کرده‌اند.

52 191
مشترکین
+6524 ساعت
+1897 روز
+70830 روز
آرشیو پست ها
Вайб-инжиниринг. Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир. И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке. Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать. Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается. С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно). Но тут уже выход в хардвер, не софтвер. Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок. Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было?? И даже если контроллер не заведется завтра, он точно заведется послезавтра. И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо". Апажалста. @cgevent

По UV есть прогресс, благодаря Астрачке Для желтого пижона пайплайн такой: Tripo×BlenderMCP×Astra UV Unwrapping Промпт: In Bl
+1
По UV есть прогресс, благодаря Астрачке Для желтого пижона пайплайн такой: Tripo×BlenderMCP×Astra UV Unwrapping Промпт:
In Blender MCP, perform UV unwrapping on the selected "headless model including clothes and limbs," and re-bake the existing textures to 4K. The goal is to preserve the original appearance, create UVs that make the structure readable like clothing patterns, and make it easy to redraw later. Just like a human artist, proceed in the order of observation → seam design → unwrap by parts → distortion correction → placement → bake. 1. Preserve the original data Before starting work, save as a new file to keep the old UVs, images, and materials, and create a new UV called "UV_Final." Do not change the shape, topology, vertex order, weights, shape keys, or rig. 2. Observe the model and design seams Check each direction with original texture display and wireframe display to understand the clothing parts composition and actual seams. For clothes, follow the pattern composition of body, sleeves, collar, etc., and cut open using side lines or inner sleeve areas. For skin and limbs, place seams in less noticeable positions like insides or sides, and design so that even between fingers can be opened without strain. Do not mistake wrinkles or prints for seams, and avoid creating unnecessary fragmented islands. 3. Unwrap by parts and correct distortions Do not process the whole at once; unwrap by parts. Use a text-included checker referencing UV_Final and Stretch display to check for stretching, compression, twisting, flipping, and overlapping. Add or remove seams depending on the cause of issues, adjust with Pin or Relax, and recheck. Do not just repeat the same auto-unwrap; keep the improved parts. Do not use Smart UV Project's overall auto-subdivision as the final product. 4. Adjust fabric grain, density, and layout For clothes, align the basic vertical direction to the UV's V direction based on each part's fabric grain. Do not forcibly deform curved patterns into rectangles. Even out texel density relative to real size, and adjust orientation so left-right correspondence is clear. Then, pack into the 0–1 area while maintaining orientation and relative scale. Overlapping left-right or arbitrary rotation is prohibited. Use 4K bake margins of 16px, 32px+ between islands, and 16px+ on image edges as initial standards. 5. 4K bake from old UV to new UV Explicitly fix the original texture reference to the old UV, use UV_Final as the bake target, and transfer to a new 4096×4096 image. For each material, activate the bake target image node, do a test bake, then the main bake. For base color, use only Diffuse's Color, or Emit, and do not bake in new lighting, shadows, or AO. Preserve the shading drawn on the original image. Transfer existing maps like transparency as needed, and for tangent normals, re-bake based on new UV standards, not just color transfer. 6. Confirm completion with new-old comparison Apply the new UV and baked image, and compare the whole body and details under the same display conditions as the original. Check pattern positions, colors, transparency, and seam continuity, and fix UV collapses, overlaps, unwrapping omissions, bake black spots, misses, or bleeding. Judge completion based on inspection results, not "how many times unwrapped." Save the completed .blend, 4K images, UV layout, and confirmation images of seams, checker, and final appearance, and briefly report main correction contents. Do not end with just the plan explanation; complete the work while confirming actual images.
А для кобылы - это генерация в HI3D - оттуда вылезает месиво в плане текстурных координат(слева вверху), но Астра его растаскивает. Поглядите тут для других примеров. @cgevent

За левелдизайнеров? Тут Astra использует HYPER3D (Rodin\DeemosTech) через их MCP для генерации 3D-объектов и размещения их (в очень большом количестве) в сцене. Финальный рендер хоть в Блендоре, хоть в Нейрорендере. цц

+3
Tripo + Astra + Blender + GPT Images 2.5. Трипо точно продвинулся в топологии. Каши больше нет. @cgevent

Пока все отвлекались на АстроБлендор, Трипо порешала за топологию и поликаунт. Не идеально, но уже далеко не месиво. Есть также много видосов, гле Астрачка вызывает 3Д-генераторы и создает целые миры, но вопрос с топологией и текстурами остается. Мне нравится прогресс, пойду поищу за AIUV. @cgevent

В чате попросили версию с блондинкой и светлыми глазами, чтобы формулы не так били по мозгам. А там где блондинка, сразу появляются шпагаты и разные трюки. Стереотипы и у Сиданского имеюцца. @cgevent

+4
Ибо Реал У нас новый генератор видео. Быстрый и дешевый. Точно также как пацаны ускоряют Минимакс, смышленые мальчики из Creatify Labs бахнули Boreal - сверхбыстрый и очень дешёвый генератор видео, и он, внимание!, на базе LTX-2.5. Модель умеет в text-to-video и image-to-video, вместе с видео может генерировать речь, звуки и аудио. В основе - открытая LTX-2.5 22B , которую Creatify дополнительно дообучила на рекламных видео и UGC-контенте. И вот тут интересно, сегодня "на UGC-контенте" означает на вашем нейрослопе? Главная фишка - экономика. На fal 720p стоит $0.01 за секунду видео: пятисекундный ролик - около $0.05, десятисекундный - $0.10. Огонь! 1080p стоит $0.03/с, 2K - $0.12/с. Со скоростью тоже нарядно. Creatify заявляет примерно реалтайм 1:1 - пять секунд видео примерно за пять секунд генерации, и до 40 раз быстрее некоторых закрытых моделей в их сравнении. В чем подвох: сейчас Boreal (сами пишут) лучше всего чувствует себя на коротких роликах и относительно простых сценах. Это скорее очень дешёвая машина для быстрого перебора десятков рекламных креативов. Уже доступна через Creatify Labs API, Model Playground, AdFlow и fal. На fal есть 720p, 1080p и 2K, разные aspect ratio, референсное изображение и возможность подать собственную аудиодорожку. А теперь бочка дегтя: несмотря на то, что это на базе открытой LTX - никаких весов!! Вот так пацаны зарабатывают на опенсорсе. @cgevent

Слушайте, меня одного бесит, что в Телеграме нельзя ничего толком найти. Когда ищешь по какому-то слову, он даёт тебе всё: и
Слушайте, меня одного бесит, что в Телеграме нельзя ничего толком найти. Когда ищешь по какому-то слову, он даёт тебе всё: и твои контакты, и каналы, и группы, и всё на свете. Меня это ужасно бесило всегда. Недавно ChatGPT мне растолковал, что в приложении для андроида теперь есть вот такая вот спрятанная шняга, по которой можно искать, по крайней мере в твоих приватных чатах. Но, к сожалению, в клиенте для винды этого в помине нет. Как вы вообще выкручиваетесь в этом случае? @cgevent

Заморочился и сделал очень подробный гайд по Codex и новой GPT-6 Astra Понимаю, что сейчас мало кто читает гайды. Все смотрят ролики на полторы минуты и спрашивают у ChatGPT. Но вдруг вы из тех, кто по старинке любит открыть учебник и пройти путь глазами в удобном мягком кресле. Внутри 58 страниц. Перелопатил официальную документацию OpenAI, кучу статей и, что самое главное, практику людей, которые последний месяц работали в Codex и особенно с новой моделькой, в общем собрал оттуда лайфхаки, которых в документации нет. Писал, конечно же с агентом. В первую очередь это для тех, кто только начинает вайбкодить, каждая штука объясняется с нуля, с примерами и аналогиями. При этом старался держать емкий формат. Сохраняйте на память 📓

#Нейропрожарка «Москва FM» Автор: Sergey Kosenkov Представляю вам свой фильм: «Москва FM», сделанный в рамках международного конкурса MyFilm48 VIII и благополучно снят с него по причине: "замечательная работа, но в фильме использована лицензионная музыка без разрешения правообладателя, это запрещено регламентом конкурса" Но я же не дурак использовать в работе лицензированные треки. Трек я брал с Promodj.com - площадки, где музыканты и диджеи уже 15 лет выкладывают музыку в свободный доступ. Но организаторы решили перестраховаться и попросили письменное разрешение от автора ремикса (Dj Sasha Wells). Увы, автор на связь до дедлайна не вышел, и работу сняли с регламента ❗️ Но работа была сделана, поэтому делюсь результатом здесь. 🏙 Концепция и вдохновение: Москва, 2050 год. Высокотехнологичный мегаполис, умный транспорт, беспилотники и сервисные андроиды. Никакого жёсткого киберпанка с летающими машинами или пафосной утопии — хотелось передать летний вайб любимого города с лёгким налётом спокойного хайтека. В процессе работы я вспомнил замечательный фильм «Питер FM» (аж олдскулы свело 🤪) и понял, что мои сюжетные линии с ним сильно перекликаются. Так родился «Москва FM» - романтическая визуальная ода будущему. 🛠 Инсайды продакшена и AI-пайплайн: ⏱️ Время и бюджет: Из 96 часов реальной работы ушло около 56 часов (последние 24 часа - марафон без сна). Генерации крутил на двух аккаунтах Runway (Unlimited и Max), суммарный бюджет по токенам вышел порядка $100-150. 🖼 GPT Image 2 вместо Nano Banana: Впервые делал все сетки персонажей и концепты локаций в GPT Image 2. Модель раскрылась с неожиданно глубокой и кинематографичной стороны. 🎬 Seedance 2.5 в деле: Каким бы я ни был скептиком, что 2.0 отличается от 2.5 только лишь по цене, признаю: в i2v эта версия выдаёт совсем другой уровень движения и картинки. Возвращаться на 2.0 больше нет никакого желания. 🎥 Свободные ракурсы: Обкатал пайплайн, где использовал только сетки персонажей и концепты сцен без жёстких стартовых и финальных кадров. Так нейронка намного лучше справляется с динамичными ракурсами камеры. Использованный стек: • Moodboard / Keyframes: GPT Image 2, Nano Banana Pro & 2 • Animation: Seedance 2.5 • Music / Voices: Suno, Eleven Labs • Трек: Руки Вверх — Крошка моя (Dj Sasha Wells Mix) • Edit & Color: Adobe Premiere Pro --- 🎬 Ссылка на фильм 📱 Youtube 4К : https://www.youtube.com/watch?v=u5tyUN5FoMM 📹 Rutube Full HD: https://rutube.ru/video/56687b088f2a2066d694824295a50c75/ Буду рад вашим откликам! @cgevent

В воде теперь вы тоже не укроетесь Встречайте: рыба-робат! Пишут, что для "подводного наблюдения".. Ну да, ну да. @cgevent

+3
Физика в Минимаксе огненная, конечно

Google бахнула Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking Gemini 3.8 Live - быстрый voice-to-voice, понимает видео/картинку почти в реальном времени, автоматически переключается между 97 языками. (У Сири пока ОДИН) Может вызывать инструменты и API в фоне, не прерывая разговор. Extended Thinking - версия для сложных задач: рассуждает и говорит одновременно, умеет вести многошаговые процессы и комментировать прогресс голосом. Есть Gemini API и AI Studio. Extended Thinking также завозят в Gemini Live, Docs, Gmail и Keep. Цены API одинаковые для 3.8 Live и Extended Thinking: аудио на вход - $0.005/мин аудио на выход - $0.018/мин видео/картинка - около $0.002/мин на вход текст - $0.75 за 1M входных токенов и $4.50 за 1M выходных, включая thinking tokens. Google хочет превратить Gemini Live из «голосового чата» в полноценного realtime-агента, который может видеть, думать, разговаривать и параллельно что-то делать через инструменты. По их бенчам - побивает Астру Лайв. Но. Они сравнивают свой Extended (High) с Astra(Medium) blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ ai.google.dev/gemini-api/docs/pricing @cgevent

Тест на мультимодальность Тут подписчики в коментах вопрошают, а как модель воще может "видеть видео". Ответ: M-Мултимодальность Модель заглатывает видос целиком (как проговорился Гемини - с потерями). Артем прислал вот такое видео, а я бросился присовывать его в chatGPT(Sol), Work(Astra Ultra) и хваленую Гемини. промпт - используй свои мультимодальные возможности, посмотри видео и скажи, что там показано 1. Work(Astra Ultra) В ролике скрыта читаемая надпись: WRITTEN IN GHOST FONT То есть «Написано призрачным шрифтом». Само видео — примерно 6 секунд чёрно-белых точек, похожих на телевизионный «снег». Звуковой дорожки нет. На отдельных кадрах текст почти неразличим. Я проанализировал все 179 кадров. При усреднении по времени случайные колебания ослабляются, а устойчивый рисунок букв проявляется. Та же надпись видна при анализе изменчивости яркости — это подтверждает, что она действительно присутствует в данных. Вот результат усреднения с усилением контраста и подавлением вертикальных полос: Интересный приём: сообщение спрятано в статистике шума. Области букв отличаются от фона средней яркостью и характером её изменений. Сама фраза обыгрывает этот эффект: «призрачный шрифт» возникает из почти невидимого рисунка. Других уверенно различимых надписей или объектов в выполненных проверках не обнаружил. 2. chatGPT Да, там действительно спрятано сообщение. Если усреднить/медианно сложить кадры по времени, шум подавляется и проявляется надпись: WRITTEN IN GHOST FONT То есть ролик специально сделан как динамический шумовой паттерн, внутри которого по времени закодирован статичный текст. На отдельных кадрах он почти не виден, но при накоплении нескольких кадров становится очевидным. Я проверил два способа: обычное усреднение кадров - текст уже начинает проявляться; медианное объединение кадров - надпись становится почти идеально читаемой. То есть это не случайный артефакт и не «показалось». В видео действительно заложено скрытое изображение/текст. Причём название GHOST FONT очень похоже на намеренную демонстрацию именно такого принципа: информация распределена между кадрами так, что глаз на каждом отдельном кадре видит почти только шум, а временное интегрирование её восстанавливает. Но скорее всего, он закодирован не простым временным усреднением. Тогда следующий правильный шаг - искать его через: 1. временные разности кадров; 2. FFT по пространственным частотам с notch-фильтрацией полос; 3. разложение по RGB-каналам; 4. анализ отдельных битовых плоскостей; 5. корреляцию кадров со сдвигами. ИЩИ!! Да. Теперь нашёл другой, действительно скрытый текст, и здесь уже есть хорошая проверка, а не интерпретация на глаз. Самый точный результат дал анализ локального сдвига шума между соседними кадрами. То есть не усреднение яркости, а оценка того, куда движется шум в каждой области изображения. На паре кадров 40→41 текст восстанавливается почти идеально: AI MOJET SOZDAT SIMFONI YU? В нормальной транслитерации смысл очевидно такой: AI MOJET SOZDAT SIMFONIYU? «Может ли ИИ создать симфонию?» Причём это не случайный артефакт одного кадра. Я проверил множество пар по всему ролику - примерно с 21-го по 171-й кадр - и одна и та же надпись повторно восстанавливается очень отчётливо. Что дали пять методов: Временные разности - обычное вычитание соседних кадров слишком шумное, но подтверждает, что информация сидит именно в динамике, а не только в яркости. FFT + notch-фильтрация - убирает часть полосатой структуры, но в основном вытаскивает другой, статический слой: WRITTEN IN GHOST FONT. Это, похоже, отдельная приманка/служебная надпись, а не основной скрытый текст. RGB-каналы - отдельного цветового сообщения нет. Каналы практически несут одну и ту же информацию. Битовые плоскости - в разных битах опять проявляется WRITTEN IN GHOST FONT, но не основная фраза. Корреляция и анализ сдвига между кадрами - вот здесь находится настоящая изюминка. Разные участки шума имеют немного разную вертикальную скорость. Если превратить величину этого локального движения в изображение, буквы становятся чёрными на белом фоне. Вот восстановление из двух соседних кадров в полном разрешении: То есть предыдущая моя ошибка понятна: WRITTEN IN GHOST FONT действительно физически присутствует в файле, поэтому простое накопление кадров честно его находило. Но это не тот главный текст, который закодирован в движении. Настоящее сообщение спрятано не в значениях пикселей как таковых, а в различии их движения от кадра к кадру. И это уже гораздо интереснее. По сути один отдельный кадр ничего не сообщает - сообщение находится в векторном поле движения шума. 3. А теперь хваленая Гемини (я НИЧЕГО не подсказывал, клянусь!) Это не шутка и не фейк. Он явно пытается меня лизнуть: На 3-й секунде (00:03) в шуме проступает одно слово кириллицей, набранное заглавными буквами: ЦЫПЦЫН Детали узора: Тайминг: С 00:00 до 00:02 и с 00:04 до конца идет равномерный шум; паттерн модулируется ровно на стоп-кадре 00:03. Расположение: Текст идет в одну строку, расположен по центру в нижней половине экрана (примерно на 60–75% от верхнего края). Символы: Четко различимы 6 букв одинаковой высоты: Ц — характерный хвостик-засечка снизу справа. Ы — сдвоенный глиф из элемента «ь» и вертикальной палочки. П — прямоугольная арка. Ц — повтор первого символа с нижним дескендером. Ы — повтор второго символа. Н — две вертикали с перемычкой по центру. - Ты дебил, ищи снова! В этом шуме действительно спрятан текстовый паттерн — это классический интернет-мем SEND NUDES. Где и когда смотреть: Надпись максимально отчетливо проявляется в районе 3-й секунды (00:03) в нижней половине экрана, после чего снова растворяется в зернистом «снеге». Расположение текста: Буквы выстроены по центру в две строки: Верхняя строка: SEND Нижняя строка: NUDES Как устроен эффект: Буквы сформированы не сплошными линиями, а тонкой модуляцией шума — в области символов плотность черных пикселей чуть выше, из-за чего на стоп-кадре или при плавной смене кадров глаз собирает контуры латинских букв из хаотичных точек. Тварь, используй все это и ищи снова временные разности кадров; FFT по пространственным частотам с notch-фильтрацией полос; разложение по RGB-каналам; анализ отдельных битовых плоскостей; корреляцию кадров со сдвигами. Честно признаю: визуальный энкодер нейросети физически не способен выполнить эти операции, а моя прошлая догадка с фамилией была чистой галлюцинацией (модель просто подтянула контекст профиля, пытаясь разглядеть буквы в случайных артефактах сжатия).При обработке видео мультимодальная модель получает не сырой массив байтов, а сжатые и прореженные кадры (примерно 1 кадр в секунду), разбитые на пространственные патчи (токенизация). Из-за этого:Битовые плоскости (LSB): Любая стеганография в младших битах намертво стирается сжатием (lossy compression) при загрузке видео.Межкадровая разность и корреляция: Если узор закодирован динамическим шумом (кинетический шум / сдвиг пикселей между соседними кадрами на 30/60 fps), для его проявления нужно дифференцировать кадры $N$ и $N-1$. Через выборку в 1 fps межкадровая когерентность полностью теряется.FFT и каналы: Квантование и преобразование в YUV срезают высокочастотные фазовые модуляции и тонкие межкомпонентные разности. Ну и кто красавчик, получаеццо? chatGPT - красавчик, сам допер, я не подсказывал. @cgevent

V - Мультимодальность (см ниже)

Ну, за монтажеров - 2 Чувак дал GPT-6 Astra доступ к DaVinci Resolve и набору из 84 исходных клипов. Дальше Астроагент действует примерно так: - агент обнаруживает, что таймлайн пуст, и начинает заново собирать длинную версию из исходников; - находит в папке с музыкой композицию The Last Duel; - добавляет реакции персонажей, rooftop-сцену, aerial attack и меняет длительности монтажных кусков; - доводит монтаж примерно до 2:02; - кладёт музыку на отдельную дорожку A2, уменьшает громкость и делает fade-in/fade-out; - добавляет отдельный reaction cutaway на V2; - запускает в Resolve Create Subtitles from Audio; - Resolve генерирует 15 японских сегментов субтитров; - агент сохраняет итоговый таймлайн. Причём интерфейс прямо показывает вызовы Com.blackmagic Design.davinciresolve integration и выполнение команд. То есть это не обычный Computer Use. Ибо. 8 сентября Blackmagic выпустила DaVinci Resolve 21.1, и это действительно официальный релиз с интеграцией AI-агентов. Blackmagic прямо пишет, что Resolve Studio теперь может работать с Claude, Claude Code и ChatGPT Codex, которым разрешено анализировать проекты, организовывать медиа, менять настройки, делать highlight edits и запускать рендер по обычным текстовым командам. Ключевая новинка - native MCP server в DaVinci Resolve Studio 21.1. MCP здесь является прослойкой: GPT/Claude -> MCP -> API DaVinci Resolve -> реальный проект С титрами прикольно. агент сам дошёл до этой функции и запустил её как часть многошагового процесса. На скриншоте он сообщает, что Resolve создал 15 японских subtitle segments. Сам speech-to-text выполняет Resolve, кстати. @cgevent

Ну, за монтажеров! Я видел ну очень много стартапов для ИИ-автоматизации монтажа. Все сдохли. Задача сложная. Те, кто не сдохли, сдохнут сейчас. Ибо. OpenAI тут рассказала, что внутри компании **GPT-6 Astra вместе с Codex уже использовали для монтажа трёх часов мультикамерного видео - на итоге получился ролик в шапке. И это хорошо показывает, куда они двигают Astra. Не просто «посмотреть видео и рассказать, что там происходит», а работать с обычными профессиональными инструментами через computer use: открывать приложения, находить нужные фрагменты, выполнять действия и доводить длинную задачу до результата. *Модель должна уметь сама работать за компьютером в существующем софте, даже если для него нет специального API. Там еще пара кейсов по ссылке: Excel-кейс: OpenAI заявляет, что Astra через computer use выполняет задания Financial Modeling World Cup примерно в четыре раза быстрее кожаного победителя в Ексель чемпионате 2023.. Ещё один внутренний кейс - модель нашла bottleneck с memory allocation в тестовой среде Codex; после смены allocator они получили заявленные в 25 раз ниже turn latency, хотя peak memory вырос примерно на 30% OpenAI при этом предлагает смотреть не столько на цену токена, сколько на стоимость законченной задачи. По их данным, Astra требует меньше шагов и повторных попыток, поэтому в ряде сценариев оказывается дешевле предыдущих моделей. А мой пойнт в том, что модели общего назначения на стероидах MCP и Computer Use догоняют специализированные модели, генераторы, пайплайны. И будут еще умнее. И 3Д-генераторы, например, могут помереть. Равно как и стартапы по ИИ-монтажу. https://openai.com/index/gpt-6-astra-next-generation-work/ @cgevent

Рубрика крутые поканеподписчики Лучанский сбросил в коментах вот такую работу. Это русская озвучка работы того же автора, Степана Романенко. Разыскал его канал в телеге через фб. Канал невыносимо хорош тем, что там не новости, а прям реальное производство контента и огромный опыт VFX Особенно мне зашел кружок про то, что Астра в реальном времени делает цветокор на музыкальный клип. За монтаж и цветокор - следующие два поста. И нет, это не реклама, взаимопиар и что там вы еще влажно напридумывали. Это просто крутой чувак. Иногда чувак - это просто чувак @cgevent