ch
Feedback
Voice stuff

Voice stuff

前往频道在 Telegram

Канал про голосовые технологии. Чат группы @voice_stuff_chat Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом. Контакт: @frappuccino_o

显示更多
1 817
订阅者
-124 小时
+107 天
+1330 天
帖子存档
fuck anthropic
fuck anthropic

На этом Интерспич 2026 подошёл к концу. Расскажите какие статьи вас заинтересовали. Думал клода натравить пару статей воспрои
На этом Интерспич 2026 подошёл к концу. Расскажите какие статьи вас заинтересовали. Думал клода натравить пару статей воспроизвести, но теперь сам без клода.

Ещё одна статья по turn taking. там заметка такая что можно параллельно и ждать end of sentence и начинать генерировать ответ
+4
Ещё одна статья по turn taking. там заметка такая что можно параллельно и ждать end of sentence и начинать генерировать ответ. А выдать ответ уже когда мы подтвердим end of utterance. Спасают полсекунды таким образом.

photo content
+5

Turn taking доклад. Можете по qr коду и статью и гитхаб найти. Оказывается то, что можно смотреть на вероятность EOS токена б
+9
Turn taking доклад. Можете по qr коду и статью и гитхаб найти. Оказывается то, что можно смотреть на вероятность EOS токена была целая статья - TurnGPT. Тут же ребята используют эмбеддинги из Mimi, обучают новую проекцию и тюнят лору на qwen.

2 модных слова в бизнесе: Moat - ров. То, что вас отличает и защищает от конкурентов wedge - клин. то, чем вы врываетесь в рынок существующий и занимаете своё место

Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - ав
+1
Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - авторы ReDimNet и обнаружили что это тот же redimnet, только перезавёрнутый.

Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - ав
Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - авторы ReDimNet и обнаружили что это тот же redimnet, только перезавёрнутый.

правильно заполнил?
правильно заполнил?

Доброе утро
+1
Доброе утро

Раскрыл загадку FeruzaSpeech Я долго смотрел на фамилию Povey в этой работе и думал что он опубликовал что-то под псевдонимом
Раскрыл загадку FeruzaSpeech Я долго смотрел на фамилию Povey в этой работе и думал что он опубликовал что-то под псевдонимом потому что его мол забанили от публикаций. Я с ним пообщался и он сказал что это работа его жены и дочери. https://arxiv.org/abs/2410.00035

Увиделся с автором Yodas v3. Спросил лучше ли качество в этой версии и как они хранят данные https://youtube.com/shorts/6MuEMX_DLY4?si=CTq35vCH6iQltsFA

Ну и последний постер на сегодня о том как голосовые модели воспринимают speaker similarity
Ну и последний постер на сегодня о том как голосовые модели воспринимают speaker similarity

выбрасываем UTMOS
выбрасываем UTMOS

UDD TTS Есть такая штука: Jump Diffusion. Составляем спектрограмму, и удаляем из неё кадры. Во время обучения просим модель в
UDD TTS Есть такая штука: Jump Diffusion. Составляем спектрограмму, и удаляем из неё кадры. Во время обучения просим модель воспроизвести пропущенные кадры. Теперь, во время инференса вставляем кадры, предсказанные текст энкодером и запускам диффузию, которая сама выберет какие кадры куда добавить. Такая вот льтернатива duration prediction.

Крутой постер о том что вместо того чтобы делать липсинк по сгенерированной речи, можно делать синтез речи по данному движени
Крутой постер о том что вместо того чтобы делать липсинк по сгенерированной речи, можно делать синтез речи по данному движению губ 🤯 Работает? - спросите вы. чекните демки. работает вполне себе! https://lipadapter.github.io/

Как мы слышим себя? 25 людям дали ползунки с разными фильтрами и выяснили, что самые главные: - low shelf фильтр - увеличивае
Как мы слышим себя? 25 людям дали ползунки с разными фильтрами и выяснили, что самые главные: - low shelf фильтр - увеличивает громкость частот до 600Гц - питч ниже, но только у мужчин (мы хотим слышать себя с более низким голосом оказывается)

Если вы вдруг не знали что обучая модель акцентам и эмоциям одновременно, она скорее всего всё напутает, то вам целая статья
Если вы вдруг не знали что обучая модель акцентам и эмоциям одновременно, она скорее всего всё напутает, то вам целая статья об этом.

допиливаем InstructTTS
допиливаем InstructTTS

Я не нашёл презентующего, но мне интересно что такое ChatScorer короче тут про RL в TTS поверх автометрики, которая хорошо ко
Я не нашёл презентующего, но мне интересно что такое ChatScorer короче тут про RL в TTS поверх автометрики, которая хорошо коррелирует с human preference

Voice stuff - Telegram 频道 @voicestuff 的统计与分析