Voice stuff
الذهاب إلى القناة على Telegram
Канал про голосовые технологии. Чат группы @voice_stuff_chat Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом. Контакт: @frappuccino_o
إظهار المزيد1 817
المشتركون
-124 ساعات
+107 أيام
+1330 أيام
جاري تحميل البيانات...
القنوات المماثلة
سحابة العلامات
الإشارات الواردة والصادرة
---
---
---
---
---
---
جذب المشتركين
أكتوبر '26أكتوبر '26
أكتوبر '260
في 0 قنوات
سبتمبر '26
+34
في 0 قنوات
Get PRO
أغسطس '26
+42
في 2 قنوات
Get PRO
يوليو '26
+114
في 7 قنوات
Get PRO
يونيو '26
+44
في 4 قنوات
Get PRO
مايو '26
+40
في 0 قنوات
Get PRO
أبريل '26
+33
في 0 قنوات
Get PRO
مارس '26
+28
في 0 قنوات
Get PRO
فبراير '26
+25
في 0 قنوات
Get PRO
يناير '26
+27
في 0 قنوات
Get PRO
ديسمبر '25
+24
في 0 قنوات
Get PRO
نوفمبر '25
+29
في 0 قنوات
Get PRO
أكتوبر '25
+32
في 0 قنوات
Get PRO
سبتمبر '25
+34
في 0 قنوات
Get PRO
أغسطس '25
+73
في 1 قنوات
Get PRO
يوليو '25
+52
في 1 قنوات
Get PRO
يونيو '25
+100
في 2 قنوات
Get PRO
مايو '25
+47
في 1 قنوات
Get PRO
أبريل '25
+34
في 3 قنوات
Get PRO
مارس '25
+27
في 2 قنوات
Get PRO
فبراير '25
+415
في 3 قنوات
Get PRO
يناير '25
+46
في 0 قنوات
Get PRO
ديسمبر '24
+24
في 0 قنوات
Get PRO
نوفمبر '24
+46
في 0 قنوات
Get PRO
أكتوبر '24
+30
في 1 قنوات
Get PRO
سبتمبر '24
+23
في 1 قنوات
Get PRO
أغسطس '24
+23
في 2 قنوات
Get PRO
يوليو '24
+58
في 3 قنوات
Get PRO
يونيو '24
+59
في 1 قنوات
Get PRO
مايو '24
+34
في 0 قنوات
Get PRO
أبريل '24
+38
في 0 قنوات
Get PRO
مارس '24
+69
في 2 قنوات
Get PRO
فبراير '24
+84
في 2 قنوات
Get PRO
يناير '24
+237
في 2 قنوات
Get PRO
ديسمبر '23
+617
في 4 قنوات
Get PRO
نوفمبر '23
+115
في 4 قنوات
Get PRO
أكتوبر '23
+512
في 1 قنوات
| التاريخ | نمو المشتركين | الإشارات | القنوات | |
| 04 أكتوبر | 0 | |||
| 03 أكتوبر | 0 | |||
| 02 أكتوبر | 0 | |||
| 01 أكتوبر | 0 |
منشورات القناة
| 2 | На этом Интерспич 2026 подошёл к концу.
Расскажите какие статьи вас заинтересовали.
Думал клода натравить пару статей воспроизвести, но теперь сам без клода. | 515 |
| 3 | Ещё одна статья по turn taking. там заметка такая что можно параллельно и ждать end of sentence и начинать генерировать ответ. А выдать ответ уже когда мы подтвердим end of utterance. Спасают полсекунды таким образом. | 518 |
| 4 | لا يوجد نص... | 434 |
| 5 | Turn taking доклад. Можете по qr коду и статью и гитхаб найти.
Оказывается то, что можно смотреть на вероятность EOS токена была целая статья - TurnGPT.
Тут же ребята используют эмбеддинги из Mimi, обучают новую проекцию и тюнят лору на qwen. | 403 |
| 6 | 2 модных слова в бизнесе:
Moat - ров. То, что вас отличает и защищает от конкурентов
wedge - клин. то, чем вы врываетесь в рынок существующий и занимаете своё место | 442 |
| 7 | Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - авторы ReDimNet и обнаружили что это тот же redimnet, только перезавёрнутый. | 453 |
| 8 | Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - авторы ReDimNet и обнаружили что это тот же redimnet, только перезавёрнутый. | 2 |
| 9 | правильно заполнил? | 1 |
| 10 | Доброе утро | 477 |
| 11 | Раскрыл загадку FeruzaSpeech
Я долго смотрел на фамилию Povey в этой работе и думал что он опубликовал что-то под псевдонимом потому что его мол забанили от публикаций.
Я с ним пообщался и он сказал что это работа его жены и дочери.
https://arxiv.org/abs/2410.00035 | 511 |
| 12 | Увиделся с автором Yodas v3. Спросил лучше ли качество в этой версии и как они хранят данные
https://youtube.com/shorts/6MuEMX_DLY4?si=CTq35vCH6iQltsFA | 479 |
| 13 | Ну и последний постер на сегодня о том как голосовые модели воспринимают speaker similarity | 539 |
| 14 | выбрасываем UTMOS | 483 |
| 15 | UDD TTS
Есть такая штука: Jump Diffusion. Составляем спектрограмму, и удаляем из неё кадры. Во время обучения просим модель воспроизвести пропущенные кадры.
Теперь, во время инференса вставляем кадры, предсказанные текст энкодером и запускам диффузию, которая сама выберет какие кадры куда добавить.
Такая вот льтернатива duration prediction. | 476 |
| 16 | Крутой постер о том что вместо того чтобы делать липсинк по сгенерированной речи, можно делать синтез речи по данному движению губ 🤯
Работает? - спросите вы. чекните демки. работает вполне себе!
https://lipadapter.github.io/ | 447 |
| 17 | Как мы слышим себя?
25 людям дали ползунки с разными фильтрами и выяснили, что самые главные:
- low shelf фильтр - увеличивает громкость частот до 600Гц
- питч ниже, но только у мужчин (мы хотим слышать себя с более низким голосом оказывается) | 431 |
| 18 | Если вы вдруг не знали что обучая модель акцентам и эмоциям одновременно, она скорее всего всё напутает, то вам целая статья об этом. | 409 |
| 19 | допиливаем InstructTTS | 402 |
| 20 | Я не нашёл презентующего, но мне интересно что такое ChatScorer
короче тут про RL в TTS поверх автометрики, которая хорошо коррелирует с human preference | 425 |
