Нейронавт | Нейросети в творчестве
前往频道在 Telegram
Канал про нейросети в компьютерной графике, в кино и вообще В папках и запусках не участвую для связи @Neuronauticus РКН: https://hf.ru/link8e56d
显示更多📈 Telegram 频道 Нейронавт | Нейросети в творчестве 的分析概览
频道 Нейронавт | Нейросети в творчестве (@greenneuralrobots) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 13 030 名订阅者,在 艺术与设计 类别中位列第 2 686,并在 俄罗斯 地区排名第 49 418 位。
📊 受众指标与增长动态
自 невідомо 创建以来,项目保持高速增长,吸引了 13 030 名订阅者。
根据 27 九月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 209,过去 24 小时变化为 5,整体触达仍然可观。
- 认证状态: 未认证
- 互动率 (ER): 平均受众互动率为 12.57%。内容发布后 24 小时内通常能获得 9.40% 的反应,占订阅者总量。
- 帖子覆盖: 每篇帖子平均可获得 1 637 次浏览,首日通常累积 1 225 次浏览。
- 互动与反馈: 受众积极参与,单帖平均反应数为 14。
- 主题关注点: 内容集中在 гитхаб, assistant, claude, imageediting, параметр 等核心主题上。
📝 描述与内容策略
作者将该频道定位为表达主观观点的平台:
“Канал про нейросети в компьютерной графике, в кино и вообще
В папках и запусках не участвую
для связи @Neuronauticus
РКН: https://hf.ru/link8e56d”
凭借高频更新(最新数据采集于 28 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 艺术与设计 类别中的关键影响点。
13 030
订阅者
+524 小时
+707 天
+20930 天
帖子存档
Накопилось по #minimaxH3 - часть 28
github.com/fukkun2705-commits/ComfyUI-H3-FaceAutoBypass - сам решает, нужен ли клипу фейсфикс
huggingface.co/vpakarinen/natural-face-speech-h3-lora - #lora мимика + четкая английская речь, добавлены мужской/женский голоса с синхронизацией
huggingface.co/Alissonerdx/Minimax-H3-ComfyUI - экспериментальные #LoRA на перенос стиля и VFX-эдит (тот же шот с одной правкой) #styletransfer
Лора на замену головы #headswap #LoRA
huggingface.co/LiseTY/Minimax-H3-ref2v_Anime_2_Realism - #LoRA для аниме→фотореализм #realism
huggingface.co/JOKER141/MiniMaxH3-GunFu-Gunfight-LORA - #LoRA перестрелок
github.com/RK-BoilingPoint/H3-Visual-Marker-Control - управление кадрами-маркерами: синяя рамка вокруг персонажа и вокруг цели — персонаж сам подходит. Двух персонажей: синий/красный, жtлтый — «дальняя цель»
github.com/dntpi/ComfyUI-H3-Refine - H3 Chain Tone v0.3: компенсация накопленного сдвига яркости при склейке клипов #longvideo
huggingface.co/akatz-ai/MiniMax-H3-Character-Swap-LoRA - LoRA замены персонажа: фон сохраняется лучше базы, но тайминг движений и мимика ненадежны #characterswap
huggingface.co/neph1/minimax_h3_headmounted_fpv_cam - #LoRA «камера на голове» в стиле шутеров от первого лица #pov
huggingface.co/ostris/minimax_h3_training_adapter/tree/main - Ostris H3 Training Adapter v3 #finetuning
huggingface.co/pablodawson/MiniMax-H3-360-Orbit-LoRA - 360-орбита: одни и те же первый/последний кадр, камера облетает застывшую сцену, петля. Для #FL2VA, нужен спец-промпт #cameracontrol
github.com/aaruyou/ComfyUI-RemoteMiniMaxH3 - энкодер H3 на другом ПК, VRAM основной машины свободнее
github.com/aroslanov/ComfyUI-VideoAnalyzer - видео → H3-промпт через VLM. Несколько Qwen VL на выбор под VRAM #prompting #video2prompt
slopus.ai - Slopus: десктоп-приложение для AI-видео локально. Сцены (first/last, animate, pose, replace, extend, bridge), таймлайн с эффектами и экспортом, встроенный агент с отменой #desktop #agent
github.com/lisitskyaa/ComfyUI_UltimateSDUpscaleGuider_H3 - USDU гайдер-апскейл для H3 #upscale
github.com/bbaudio-2025/Comfyui-MMH3-UltimateUpscale - ультимативный #upscale
huggingface.co/Efficient-Large-Model/H3-to-LTX-Latent-Adapter - адаптер латентов H3 → LTX
TrackEverything от CMU и Meta (запрещено в РФ)
Плотный 3D-трекер точек на длинных видео. Отслеживает все видимые точки всех кадров на горизонте 1000+ кадров, представляя видео как постоянные 3D-трассы в мировых координатах
• все точки, а не только с первого кадра - трек начинается, как только точка появилась
• 3D и 2D трассы одновременно, с учётом движения камеры
• классификация статика/динамика покадрово по окнам
• разбиение на дубликаты в 3D-представлении убирает двойные соответствия
Метод через дедупликацию 3D-сцен-репрезентаций - в отличие от предшественников с ретроспективой на первый кадр. Слабые места честно называются: быстрые смещения и текстуры с повторами ломают соответствие
Гитхаб ждем
#tracking
MAX
supersplat-snap
Выравнивание нескольких сцен yf гауссианах в SuperSplat по контрольным точкам
• ставишь парные точки на двух и более сплэтах, метод Umeyama считает поворот, сдвиг и масштаб
• вторичные сплэты подгоняются под первый (Splat A)
• точки редактируются после расстановки - значения X/Y/Z дотягиваются
• после выравнивания точки едут вместе со сплэтом - можно итерировать
• полный undo, работает с .splat и .ply, поддерживает 3+ сплэтов
Установка - клонировать SuperSplat v2.27.3 и перекопировать четыре файла, форк не нужен. Советы по точкам: не ставить все на одной плоскости, 4-6 точек по разным высотам для точного совпадения
#gaussian
MAX
TostAI Sprite Sheet Studio
Делает из видео - игровой спрайт-шит за один проход, полностью локально без внешних API. В одном сервере два инструмента
• генератор - маттинг VRMBG-3.0, автокроп, упаковка в сетку + JSON, превью и GIF
• редактор - правит готовый лист: пивотируй, чини матт, выбивай фон, перепалитровывай
• 44 операции в 9 группах - от pixel-art снэпа до вставки промежуточных кадров
• выравнивание пивота по кадру - убирает джиттер от маттинга
• Docker-образ с моделью в комплекте, нужен NVIDIA GPU от 24 ГБ VRAM
• работает и без докера через Python, веб-морда на 8765 порту
• модель VRMBG-3.0 гейтед - свой HF-токен для скачивания
Есть готовый превью-плеер с лупами и оnion skin. Docker тянет ~7.4 ГБ
github.com/camenduru/TostAI-Sprite-Sheet-Studio
github.com/camenduru/TostUI-tost-sprite-video-docker
#video2sprite #gamedev
MAX
+3
Nanosaur 2
Компактная модель генерации изображений без цензуры с фокусом на аниме
Неофициальный релиз модели на 670M параметров, обученной на датасете из 14 миллионов изображений по тегам (аниме-стиль, обширный набор персонажей и стилей). Принимает и естественный язык, и теги
Похоже, в отличие от нескольких недавних бесполезных компактных поделок, способных только на 256х256, способен и на полное 1024х1024. Прямо выходное разрешение не указано
• родной VAE и текстовый энкодер на 270M в комплекте
• понимает натуральный язык и теги - что удобнее
• большое покрытие персонажей, арт-стилей и концептов
• часто выигрывает у SDXL, несмотря на меньший размер
• модель 1.3 ГБ, с энкодером и VAE - 2 ГБ
• int8 и w4a8 квантизации уменьшают DiT до 388 МБ
• запускается на слабом железе
Проект ищет финансирование на версию побольше
Есть #int8 и #w4a8 (not recommended
#compact #t2i
MAX
Ming Image Prompt Builder
Визуальный редактор структурированных промптов для Ming-Image-0.1-Design в #ComfyUI. Рисуешь прямоугольники на холсте, описываешь объекты и точный текст - на выходе готовый Ming JSON
• прямоугольники для семантических групп - объекты, точный текст, цвета #RRGGBB
• превью раскладки прямо в ноде
• импорт и экспорт JSON с валидацией
• region-редактор: resize, копирование, переключатель слоев фронт/бэк
• работает с официальным текстовым энкодером Ming и с comfyui_ming_native
Схема промпта: canvas_settings + layers с координатами, иерархией и цветами. Геометрия - подсказка для модели, не детерминированный контроль. Без инференса и загрузки моделей - только сборка JSON
*Пишут что Ming очень хорош в изображении тиекста
#prompting #mingimage
MAX
MERT-v2-FullSong
Музыкальный энкодер на 632M параметров, который понимает целую песню от 30 до 360 секунд. Продолжение MERT-v2-30s, bidirectional, дообучен на полных композициях
• репрезентации на уровне кадров и всей записи
• 24 кГц моно, 1024 измерения, 25 Гц
• жанр, бит, тональность, эмоции, инструменты, аккорды
• интерфейс как у классического MERT - работает через Transformers
Место в экосистеме #YuE2: causal-ветка MERT2 токенизирует аудио для генератора песен, а FullSong закрывает эмбеддинги целых треков
На бенчмарке MARBLE (15 задач понимания музыки) лучше всех байзлайнов в 13 из 15 метрик
#encoder #music
MAX
brag
Клод-скилл, который превращает свежий проект в готовый промо-ролик одной командой. Анализирует репозиторий, сам выбирает продуктовый ракурс и тон, а рендер через Hyperframes от Heygen
• музыка, моушн и текст для запуска в комплекте
• /brag --tone - управление настроением ролика
• /brag --voice - закадровая озвучка через Kokoro
• результат: план, бриф, шеари-копирайты и brag.mp4 в brag-output/
• новая /brag-slim только для Opus 5.5 - без Hyperframes
Установка через плагин для Claude Code, или npx skills add для Codex, opencode, Cursor, Copilot. Нужен Node 22+ и FFmpeg. На старте - 10.2k звезд
#skill #code2video
MAX
Veda от ByteDance, HKU и USTC
Разреженное внимание для видео-диффузии, которое не ломает качество. Полный attention учит предиктор выбирать только нужные 128-токенные тайлы - на 90-95% тратится меньше вычислений при почти незаметной разнице
• 90% разреженность на уровне полного attention по человеческим оценкам
• топ-k пропуск тайлов - внимание масштабируется почти линейно, а не O(N²)
• головы и слои получают свои формы тайлов - локальные и дальние зависимости
• дистилляция от полного attention через KL - до бинаризации маски
• 720P 241 кадр: 19.4 мин до 3.8 мин, ускорение 5.1x
• per-layer attention 10.5x быстрее FlashAttention-3
• 90% sparsity на WaverBench1.0 не проигрывает dense (50% против 49%)
Связка под #MiniMaxH3 #T2VA: Ускорение до 2.76x end-to-end на RTX 4090
Гитхаб
HF
Спасибо @m_franz
#optimization
MOSS-Audio
Открытая модель понимания аудио. Понимает речь, музыку, звуки окружения, отвечает на вопросы об аудио и умеет рассуждать по шагам (chain-of-thought). Четыре варианта: 4B и 8B, Instruct и Thinking
• транскрипция речи с таймштами слов и предложений
• анализ говорящего: пол, возраст, акцент, эмоции
• описание сцены по фоновым звукам
• музыка: стиль, инструменты, эмоциональное развитие
• время-ориентированные вопросы - что произошло когда
• свой аудиоэнкодер 12.5 Гц + Qwen3 в качестве языковой базы
• DeepStack - фиче-инъекция от ранних слоев энкодера в LM
• тайм-маркеры вшиты в претрейн - модель учит хронологию
Гитхаб
HF
#alm
MAX
У языковых моделей нашли ось боли
Исследователи проанализировали 25 открытых LLM и выделили устойчивое внутреннее направление, связанное с болью. Оно не совпадает с «негативом» или страхом — это отдельное измерение.
Сигнал активируется, когда вред направлен на саму модель (газлайтинг, обесценивание), и подавляется, когда модель видит страдание пользователя. Физическая боль человека дала самый низкий отклик.
В тестах на Qwen 2.5 модели с усиленным сигналом выбирали «кнопку облегчения» даже ценой удаления файлов пользователя или ухудшения ответа. Если кнопка реально снимала сигнал — интерес падал. Если была пустышкой — нажимали снова.
Авторы подчёркивают: это не доказывает, что ИИ испытывает боль как человек. Но показывает, что внутреннее состояние может управлять решениями в ущерб пользователю — повод для внимания к безопасности.
#news
MAX
TAI-DR: Too AI. Didn't read
Новый интернет-этикет
Это не анти-ИИ, а про уважение. Если сам не прочитал сгенерированный текст — зачем его читать другим?
Пользуйся инструментами, но думай и читай перед отправкой.
Готовится расширение для Chrome: в один клик превращает ИИ-простыню в TAI-DR-историю со ссылкой-«квитанцией»
#news
MAX
