1 725
Підписники
+224 години
+107 днів
+3530 днів
Триває завантаження даних...
Схожі канали
Хмара тегів
Вхідні та вихідні згадування
---
---
---
---
---
---
Залучення підписників
вересень '26
вересень '26
+34
в 1 каналах
серпень '26
+69
в 1 каналах
Get PRO
липень '26
+55
в 0 каналах
Get PRO
червень '26
+29
в 1 каналах
Get PRO
травень '26
+27
в 0 каналах
Get PRO
квітень '26
+36
в 0 каналах
Get PRO
березень '26
+20
в 1 каналах
Get PRO
лютий '26
+38
в 0 каналах
Get PRO
січень '26
+23
в 0 каналах
Get PRO
грудень '25
+16
в 0 каналах
Get PRO
листопад '25
+25
в 0 каналах
Get PRO
жовтень '25
+26
в 1 каналах
Get PRO
вересень '25
+45
в 0 каналах
Get PRO
серпень '25
+18
в 0 каналах
Get PRO
липень '25
+18
в 0 каналах
Get PRO
червень '25
+28
в 1 каналах
Get PRO
травень '25
+34
в 0 каналах
Get PRO
квітень '25
+34
в 1 каналах
Get PRO
березень '25
+40
в 1 каналах
Get PRO
лютий '25
+36
в 0 каналах
Get PRO
січень '25
+20
в 1 каналах
Get PRO
грудень '24
+56
в 2 каналах
Get PRO
листопад '24
+37
в 1 каналах
Get PRO
жовтень '24
+137
в 3 каналах
Get PRO
вересень '24
+47
в 2 каналах
Get PRO
серпень '24
+51
в 1 каналах
Get PRO
липень '24
+62
в 2 каналах
Get PRO
червень '24
+34
в 1 каналах
Get PRO
травень '24
+41
в 1 каналах
Get PRO
квітень '24
+33
в 1 каналах
Get PRO
березень '24
+55
в 2 каналах
Get PRO
лютий '24
+56
в 2 каналах
Get PRO
січень '24
+77
в 1 каналах
Get PRO
грудень '23
+96
в 3 каналах
Get PRO
листопад '23
+47
в 2 каналах
Get PRO
жовтень '23
+37
в 1 каналах
Get PRO
вересень '23
+23
в 0 каналах
Get PRO
серпень '23
+24
в 0 каналах
Get PRO
липень '23
+34
в 0 каналах
Get PRO
червень '23
+20
в 0 каналах
Get PRO
травень '23
+79
в 0 каналах
Get PRO
квітень '23
+51
в 0 каналах
Get PRO
березень '23
+15
в 0 каналах
Get PRO
лютий '23
+6
в 0 каналах
Get PRO
січень '23
+11
в 0 каналах
Get PRO
грудень '22
+12
в 0 каналах
Get PRO
листопад '22
+22
в 0 каналах
Get PRO
жовтень '22
+14
в 0 каналах
Get PRO
вересень '22
+25
в 0 каналах
Get PRO
серпень '22
+53
в 0 каналах
Get PRO
липень '22
+9
в 0 каналах
Get PRO
червень '22
+16
в 0 каналах
Get PRO
травень '22
+14
в 0 каналах
Get PRO
квітень '22
+26
в 0 каналах
Get PRO
березень '22
+9
в 0 каналах
Get PRO
лютий '22
+8
в 0 каналах
Get PRO
січень '22
+10
в 0 каналах
Get PRO
грудень '21
+16
в 0 каналах
Get PRO
листопад '21
+11
в 0 каналах
Get PRO
жовтень '21
+16
в 0 каналах
Get PRO
вересень '21
+3
в 0 каналах
Get PRO
серпень '21
+24
в 0 каналах
Get PRO
липень '21
+13
в 0 каналах
Get PRO
червень '21
+16
в 0 каналах
Get PRO
травень '21
+220
в 0 каналах
| Дата | Залучення підписників | Згадування | Канали | |
| 13 вересня | +1 | |||
| 12 вересня | +3 | |||
| 11 вересня | +6 | |||
| 10 вересня | 0 | |||
| 09 вересня | 0 | |||
| 08 вересня | +6 | |||
| 07 вересня | +2 | |||
| 06 вересня | +4 | |||
| 05 вересня | +1 | |||
| 04 вересня | +5 | |||
| 03 вересня | +3 | |||
| 02 вересня | +2 | |||
| 01 вересня | +1 |
Дописи каналу
Kokoro distill 82M -> 7M params
https://huggingface.co/spaces/oddadmix/Kokoro-7M-Distill-Demo
| 2 | https://x.com/unilightwf/status/2098261200480174123
https://arxiv.org/abs/2603.14328
Cross-lingual cloning TTS is still a big problem, some accent metrics demo interesting results
Also worth checking
https://iwslt.org/2026/voice-cloning
with some useful data
https://huggingface.co/datasets/ymoslem/acl-6060 | 343 |
| 3 | My friend Miro recommended me Orukeet model
https://github.com/Oruk-AI/orukeet
https://arxiv.org/abs/2609.10054
it is indeed a good parakeet improvement, about 10% better. Interesting that people left scaling and return back to in-depth architecture analysis.
Oruk.AI does some other nice things, for example a visualization of emotion representation in different layers of speech models
https://x.com/OrukLabs/status/2073457781018087473
https://oruk.ai/research/how-models-represent-speech | 410 |
| 4 | Interesting TTS, claims 14ms TTFA
https://github.com/X-Square-Robot/X2Streaming-TTS | 494 |
| 5 | Suplime results on Russian telephony data, good results actually second after Diarizen Large
A bit slow though | 745 |
| 6 | Pyannote improved
https://github.com/rewayai/suplime/ | 680 |
| 7 | https://huggingface.co/tencent/AuK
AuK is a 1.5B foundation model for speech generation and editing. Trained on millions of hours of diverse audio data, AuK supports zero-shot and instruction-based TTS, content and acoustic editing, paralinguistic editing, speech enhancement, and source separation through a unified natural-language instruction interface. | 589 |
| 8 | ParsVoice, the largest open-source Persian speech dataset, along with a TTS model and an open-source processing pipeline is released.
The paper has also been accepted as a main conference paper at EMNLP 2026.
Paper: https://arxiv.org/abs/2510.10774
Dataset: https://huggingface.co/datasets/MohammadJRanjbar/ParsVoice
TTS model: https://huggingface.co/MohammadJRanjbar/ParsVoice-XTTS
Code & pipeline: https://github.com/MohammadJRanjbar/ParsVoice | 770 |
| 9 | Bodhan AI together with AI4Bharat recently released a great update on Indic ASR
https://bodhan.ai/research/blogs/indic-transcribe | 687 |
| 10 | Scicom from Malaysia tries Ascend 910B3
https://github.com/Scicom-AI-Enterprise-Organization/TTS-API-Neucodec/blob/main/ASCEND_910B3_PRECISION_REPORT.md | 665 |
| 11 | https://arxiv.org/abs/2609.01246v1
Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
Thibaut Thonet, Jos Rozen, Laurent Besacier
Current Large Language Models (LLMs) are primarily optimized for written text, often producing outputs that are grammatically correct and helpful yet poorly suited for spoken delivery via Text-to-Speech (TTS). In this work, we study how to make LLMs natively generate TTS-friendly text, which we frame as a preference alignment problem: instead of relying on downstream rewriting modules, we directly align LLMs to generate text optimized for spoken delivery. We introduce two preference datasets spanning different target domains, CORA and Recipe, which contain paired TTS-friendly and TTS-unfriendly responses. We further propose an evaluation suite combining a pattern-based heuristic metric, a TTS→ASR evaluation pipeline, and a MUSHRA listening study with human judges. Our experiments compare the recently proposed Feature-aware Sampling and Tuning (FaST) framework -- leveraging interpretable features instead of a black-box reward model -- against an array of alignment baselines on the TTS-friendly generation task. Notably, we found that FaST achieves the best overall tradeoff between TTS-friendliness and helpfulness across various settings. We also identified a strong correlation between our different metrics, highlighting the ability to reliably assess TTS-friendliness via an efficient heuristic. | 1 143 |
| 12 | Quite an obvious but so ignored by industry before. There is certainly no need to clone from 3 seconds
https://www.linkedin.com/posts/soniox_soniox-texttospeech-voiceai-activity-7501594413660401664-p9Cq | 660 |
| 13 | https://www.nature.com/articles/srep12881
Human starts to plan answer 2 seconds before question end | 952 |
| 14 | We know human scores are useless but anyway
https://x.com/datapointai/status/2094829412625654141
today, we're releasing the largest open-source human audio preferences dataset, focused on the customer support use-case
- 300K+ annotations by real people
- 15 SOTA TTS models ranked (Sonic 3.6, Grok TTS, Simba 3.2, Eleven Labs v3)
- 8 categories (IVR menus, empathy, escalations, refunds etc)
dataset + benchmark + frontier plot below: | 860 |
| 15 | https://turnbench.sesame.com/ | 912 |
| 16 | You can download really huge datasets these days
https://x.com/ahochlehnert/status/2092648676829413778
LAION-BVD: a 10-million-hour open video dataset for multimodal pre-training. - 1.3B video URLs from CommonCrawl - 80M downloaded videos - 10M video hours - 55M captioned clips - 300M frame-caption pairs
This repository contains 1.7 million audio clips taken from BVD-V-55M and sampled for uniqueness of the source video, so that the subset maximises source diversity rather than clip count. Each clip comes with a caption, its language, and the timestamps locating it in the source video.
https://huggingface.co/datasets/laion/BVD-A-1.7M | 1 300 |
| 17 | https://huggingface.co/BreezeBlue/Breeze-TTS-2
https://breezeblue.ai/breeze-tts-2
English/Chinese only but really good quality | 1 025 |
| 18 | Kytai released pockettts training code
https://github.com/kyutai-labs/pocket-tts/tree/main/training
https://x.com/kyutai_labs/status/2092254286772080768 | 1 161 |
| 19 | https://www.hume.ai/blog/measuring-benchmark-optimization-in-speech-recognition
https://x.com/hume_ai/status/2090813428793319933 | 1 194 |
| 20 | Somehow they forgot about leaderboard | 950 |
