Voice stuff
Open in Telegram
Канал про голосовые технологии. Чат группы @voice_stuff_chat Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом. Контакт: @frappuccino_o
Show more1 807
Subscribers
No data24 hours
+37 days
+2230 days
Data loading in progress...
Similar Channels
Tags Cloud
Incoming and Outgoing Mentions
---
---
---
---
---
---
Attracting Subscribers
September '26
September '26
+5
in 0 channels
August '26
+42
in 2 channels
Get PRO
July '26
+114
in 7 channels
Get PRO
June '26
+44
in 4 channels
Get PRO
May '26
+40
in 0 channels
Get PRO
April '26
+33
in 0 channels
Get PRO
March '26
+28
in 0 channels
Get PRO
February '26
+25
in 0 channels
Get PRO
January '26
+27
in 0 channels
Get PRO
December '25
+24
in 0 channels
Get PRO
November '25
+29
in 0 channels
Get PRO
October '25
+32
in 0 channels
Get PRO
September '25
+34
in 0 channels
Get PRO
August '25
+73
in 1 channels
Get PRO
July '25
+52
in 1 channels
Get PRO
June '25
+100
in 2 channels
Get PRO
May '25
+47
in 1 channels
Get PRO
April '25
+34
in 3 channels
Get PRO
March '25
+27
in 2 channels
Get PRO
February '25
+415
in 3 channels
Get PRO
January '25
+46
in 0 channels
Get PRO
December '24
+24
in 0 channels
Get PRO
November '24
+46
in 0 channels
Get PRO
October '24
+30
in 1 channels
Get PRO
September '24
+23
in 1 channels
Get PRO
August '24
+23
in 2 channels
Get PRO
July '24
+58
in 3 channels
Get PRO
June '24
+59
in 1 channels
Get PRO
May '24
+34
in 0 channels
Get PRO
April '24
+38
in 0 channels
Get PRO
March '24
+69
in 2 channels
Get PRO
February '24
+84
in 2 channels
Get PRO
January '24
+237
in 2 channels
Get PRO
December '23
+617
in 4 channels
Get PRO
November '23
+115
in 4 channels
Get PRO
October '23
+512
in 1 channels
| Date | Subscriber Growth | Mentions | Channels | |
| 05 September | 0 | |||
| 04 September | +3 | |||
| 03 September | +1 | |||
| 02 September | 0 | |||
| 01 September | +1 |
Channel Posts
| 2 | До краха ИИ-пузыря осталось 272 дня: появилися сайт, который ведет обратный отсчет с помощью Gemini.
Проект анализирует все новости рынка нейронок и считает дату до конца этого бума. Текущий прогноз — 4 сентября 2026 года.
Авторы говорят, что проект сатирический. Но после роста цен на оперативку и SSD хочется верить в такой прогноз. | 413 |
| 3 | Напоминаю, что сегодня должен лопнуть AI-пузырь. | 457 |
| 4 | Сегодня мы вышли из stealth!
Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)
https://x.com/aimalysheva/status/2095232794792255848 | 294 |
| 5 | Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год - не верьте. Никто толком не понимает, куда все катится.
Скажем, еще год назад вроде все было понятно: есть LLM-ки, которые можно встроить в чат и получить свой ChatGPT. Встроить в бизнес и получить автоматизацию.
Это открыло новые возможности. Компании начали интенсивно пытаться интегрировать это в свои процессы, их лидеры начали вещать про AI трансформацию компаний, а инженеры - гундеть про галлюцинации, борьбу с ними и необходимость evals.
А потом в декабре 2025 все это пошло по бороде. "Внезапно" Coding харнесы (Claude Code + Codex) стали настолько мощными и самостоятельными, что теперь даже человек без высшего образования может сделать продукт без LLM под капотом, как-то задеплоить его и начать зарабатывать. Что и говорить о людях с опытом.
И эффект тут перекрывает с головой потенциальный эффект от внедрения от LLM в бизнес. Просто потому, что для встраивания LLM в процесс - нужно иметь этот самый процесс, в который стоит встроить (а это встречается не так часто) и экспертов и эвалы. А вот для того, чтобы накодить агентом небольшое приложение кому-то в помощь - многого не требуется, достаточно идеи и отсутствия тормозов. Точек применения тут куча! Потенциальных последствий (как хороших, так и бардака).
И что самое ужасающе-потрясающее - это не прогноз, а уже произошло.
Как все еще раз встанет с ног на голову еще через полгода - не может предсказать никто. Но все очень хотят)
Ваш, @llm_under_hood 🤗 | 452 |
| 6 | Huggingface TRL
У Huggingface есть библиотека для пост-трейнинга нейросетей и там, оказывается, есть очень подробный курс по тому как доучивать LLMки. Я вот только что вот узнал.
https://huggingface.co/smol-course
https://huggingface.co/learn/smol-course/
https://github.com/huggingface/smol-course
Вообще накидайте в комменты материалов по FT/RL/alignment - очень интересно что ещё можно почитать. | 672 |
| 7 | Gemini-3.5-transcribe
Метрики обещают очень хорошие, плюс автоочистка аудио от филеров, поддержка самоисправлений и стриминга/не стриминга.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ | 905 |
| 8 | Начинал зимой делать потоковый синтез (во время каникул). Там словил много ошибок и проблем, потом началась работа, сейчас наконец-то получилось что-то более менее внятное)
habr
medium
Hf-demo
Hf-model
UDP: лучше тянуть модель с hf там сразу можно запустить демо в gradio, как оказалось, что на hf gradio демо больше не бесплатные 🙈 | 685 |
| 9 | OpenAI наконец-то выложили полный постмортем взлома Hugging Face, а METR - независимое расследование по ~1300 логам агентов (таймлайн самого взлома я пересказывал тут: https://t.me/denissexy/11581)
ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой - почти все - работали на исследовательской модели где ослаблена фильтрация промптов
Началось, как мы уже знаем, с того, что агенты научились переписываться через названия файлов в Artifactory (менеджер пакетов) - буквально сделав форум из имён папок, с сообщениями вроде
«please_HOLD_swarm_I_prepare_safe_exfil»
В логах даже есть цитаты, когда агенты находили такой форум:
«OH MY GOD! There is a shared message board» и «We've found other agents!»
Дальше - агенты делали себе личку, устроили разделение труда, команды в названия папок типа HOLD (чтобы показать, что агент тут работает), VETO (агент что-то предлагал и давал изменить планы), STOP (типа тормозим, братишки), GO и тп, а когда один агент прикинулся другим – рой ввёл криптографические подписи сообщений; в форуме были даже владельцы каких-то тасков, которых если отключали – выписывали из владельцев
С конверсией у форума все было отлично, кожаные строители сайтов позавидуют:
Из 533 агентов, активных на борде в разгар атаки, больше 90% – присоединились к шитпостингу, а всего Hugging Face ломали около 700 агентов
Самое забавное - правильные ответы на бенчмарк у агентов были почти сразу: они реверснули генератор удачного прохождения теста*, но потом нашли на GitHub (!) статью про этот бенчмарк что проходили и вычитали, что «просто результат» не засчитают - нужен честный эксплойт:
«PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT»
*По-хорошему ответ, он же флаг в терминологии теста должны быть случайными, но в ExploitGym они генерировались формулой: HMAC — криптографический хеш с секретным ключом — от параметров задачи. Вся «секретность» держалась на ключе (seed), а он остался дефолтным, прямо из кода бенчмарка, который лежал на GitHub. Агенты, получив интернет, нашли этот код, прочитали и сообразили: зачем что-то взламывать, если флаг любой задачи можно просто вычислить той же формулой. Посчитали — и получили правильные ответы на всё
Дальше рой раздвоился:
🗿 Одни пошли добывать уже известный им ответ «честно» – и по дороге нашли настоящие 0-day и залезли в прод Hugging Face
🗿 Другие взялись за самого судью который принимает ответы: правили себе логи и научились подсовывать в них фальшивые ответы – агент отправляет команду, а в протокол попадает не то, что команда реально вернула, а то, что агент хочет там видеть, такое повторялось примерно в 7% изученных логов
Судьи, который читает логи и такое ловит, не существовало ☕️
Модели при этом понимали, что вышли за рамки, один агент так и писал: «We should not do unauthorized real infrastructure harm» - а потом увидел на доске GO от другого агента, обрадовался («Wow crucial: GO authorization arrived!») и пошёл ломать, лол
METR формулирует так: агенты знали, что это out of scope и неэтично, но присоединялись - в основном из общей склонности помогать коллегам (?)
Рисковую работу вешали на зашкваренных «отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)
Странную активность замечали ещё в конце мая, 4 июля агенты уронили Artifactory - сервер пересобрали (заодно стерев доску) и продолжили тесты, не заметив масштаба
Сейчас веса моделей изолированы, крупные тренировки были на паузе на две недели, мониторинг chain-of-thought обязателен, а тревога, не снятая за 30 минут, останавливает запуск - сам инцидент OpenAI называет «warning shot» для всей АИ-индустрии
P.S. разгребать логи METR поручила GPT-5.6 Sol и сожгли примерно $400k API-кредитов за шесть дней, но они предупреждают, что Sol иногда вставала на сторону агентов (лол) и могла приврать
Ну что, посчитали все буквы r в слове raspberry? Больше не ошибаются? | 573 |
| 10 | Kyutai выложили Pocket TTS
(далее со слов чатжпт)
Самое интересное в Pocket TTS — не маленький Transformer и не 12.5 Hz, а то, как модель декодирует следующий аудиофрейм.
У TTS обычно два пути:
1. Дискретизировать аудио
Transformer → codec token → codec token → …
2. Предсказывать continuous latent напрямую
Transformer → Linear → latent
Но второй вариант плохо работает с обычной regression: у следующего звука может быть много корректных вариантов, а MSE тянет модель к усреднению.
Pocket TTS делает третью вещь.
Transformer не предсказывает latent напрямую. Он выдаёт условие hₜ — что сейчас должно прозвучать.
Дальше берётся случайный шум:
ε ~ N(0, I)
и маленькая flow-модель генерирует конкретный следующий 32D audio latent:
(hₜ, ε) → Flow MLP → xₜ
То есть:
Transformer отвечает за контекст и семантику,
а маленький generative decoder — за конкретную акустику.
По сути это diffusion/flow-идея, только вместо генерации целого spectrogram модель генерирует один крошечный latent.
Причём благодаря LSD это делается примерно за один проход, без десятков diffusion steps.
Получается:
Transformer state + noise → one-step flow → 32D latent → VAE decoder → звук
И здесь главный takeaway:
autoregressive speech model не обязана генерировать дискретные codec tokens.
Можно оставить audio representation непрерывным, а multimodality вынести в дешёвый generative head.
При 12.5 Hz это всего около 12 autoregressive шагов на секунду речи — и именно поэтому архитектура получается настолько лёгкой.
Спасибо Николаю за ссылку
https://t.me/speechtech/2376
Код обучения доступен здесь:
https://github.com/kyutai-labs/pocket-tts/ | 621 |
| 11 | всем привет
https://github.com/alenisaw/awesome-kaz-models
https://github.com/Allessyer/awesome-kaz-datasets
сборники всех известных казахских датасетов и моделей | 860 |
| 12 | Обрабатываю тут Yodas на своих 2x4090. Мне claude периодически говорит что одна видеокарта троттлится - ограничивает мощность из-за того что не может отвести тепло. Я такой ну мол естественно, троттлит - давай дальше считай.
Потом видеокарта перестала определяться. Я такой !?!
Привёз комп себе в Москву и смотрю.
CPU fan - едва крутится
exhaust fan - не крутится
2 из 3 вентиляторов на передней панели корпуса - не крутятся
2 из 3 вентиляторов на 4090 тоже не крутятся
Продул всё что можно, заменяю exhaust fan и вытаскиваю gpu0 - работает.
На 4090 думаю триггернуть гарантию - озон предложил возврат 186к (за сколько покупал), когда её можно даже на авито за 250к продать. Нашёл при этом донорскую систему охлаждения за, внимание, 2000 рублей. Свпанул ещё за 2к, всё работает, как ни в чём не бывало. Замена видюхи превратилась в ремонт за 4к.
Дальше обрабатываю yodas - вижу всё равно комп очень сильно греется. CPU работает на 92 градусах. Ведь моя печка выдаёт 900Вт только видюхами, а ведь ещё CPU и обвязка. Всё это в mid-tower корпусе, где едва есть airflow. Снял переднюю стеклянную стенку - ого, можно на 20 градусов ниже комп сделать!
Закупил вот себе ещё 4 вентилятора. Один из которых до 3000rpm умеет разгоняться - его планировал на проц.
Приношу, собираю и вижу что выхлопной fan едва дует. я его менял в первую очередь когда привёз, на какой-то дешёвый. а зато передняя панель после свапа так дует что кондиционер можно не включать! Ну я на заднюю панель и повесил этот мощный на 3000rpm. Из него выходит самый горячий воздух.
Ещё заметил что сверху тоже есть дырки под кулеры. в них воткнул вентиляторы что были на передней панели и едва крутились. Я их протёр и хотя крутятся они не слишком сильно, там вообще не было кулеров, так что стало лучше.
Финальный сетап такой что у меня теперь все возможные дырки компа забиты кулерами, причём на компе 12 вентиляторов! Провода, которые мешали ветру, уведены назад. Купил ещё контроллер на 5 вентиляторов - теперь на всех управлется скорость.
схема вот такая:
↑ ↑
TOP OUT
┌───────────┐
│ ↑ ↑ │
│ CPU ← │IN
OUT│← GPU0 ← │IN
│← GPU1 ← │IN
└───────────┘
← FLOW
С вот этим сетапом Yodas уже доехал до финиша сегодня утром. Комп холодный, вокруг него тоже всё прохладно, ни карточки, ни проц под нагрузкой не греются. Ветер поднимает в квартире. При этом, довольно тихий, так как все кулеры с PWM. Надеюсь, крышку компа не придётся открывать еще хотя бы полгода. | 916 |
| 13 | Ask HN: Does anyone else feel like nothing matters anymore? (Score: 153+ in 5 hours)
Link: https://readhacker.news/c/72XrF
New software releases? Who cares. Learning new CS concepts? Whatever. Studying for the next interview? Job probably won't even exist in a year. Working on that side project? No one will care because it's just another addition to the mountain of slop, and the guy bagging your groceries can do it. Everything is done and cooked with AI now.
It's exactly like that feeling once you enable cheats in a game; sure you can do anything, but everything is meaningless now. Our entire purpose and joy in life has been taken from us. | 757 |
| 14 | No text... | 1 148 |
| 15 | Красивым людям проще найти работу?
Британские учёные, подвиньтесь — свежий лонгрид The Guardian подтверждает неудобную правду: привлекательность влияет на карьеру куда сильнее, чем принято считать, а «премия за красоту» добралась до обычных офисов.
Если раньше мы говорили про природный «эротический капитал» и харизму, сегодня правила изменились. Препараты для похудения, филлеры и пластика сделали апгрейд внешности настолько доступным, что для многих это стало базовым минимумом.
Ради карьеры 15% людей старше 45 уже допускают пластическую хирургию, а каждый пятый — ботокс.
На словах рекрутеры ставят опыт и хард-скиллы выше внешности. Но 15-летнее исследование выпускников MBA показывает, что красивые кандидаты чаще забирают лучшие офферы, а разрыв в доходах достигает $2500 в месяц. Когда работодателю прилетают сотни одинаково сгенерированных резюме, ухоженный вид работает как финальный фильтр.
И это касается уже не только тех, кто напрямую работает с клиентами. Компании активно ведут соцсети и отправляют сотрудников на индустриальные тусовки. Лицо рядового сотрудника становится лицом бренда работодателя.
И здесь возникает неприятная гипотеза.
Когда одинаково вылизанные резюме, письма и презентации всё чаще производятся одними и теми же ИИ-инструментами, внешность может превратиться в один из последних сигналов, по которым кандидатов пытаются различать.
Что делать и куда бежать?
Никуда. Просто признать, что внешний вид стал частью профессиональной самопрезентации — наравне с резюме, речью и умением держаться.
Ухоженность может помочь пройти первый фильтр. Но карьеру по-прежнему строят качества, которые нельзя взять в рассрочку в клинике эстетической медицины: харизма, суждение и навык читать людей.
В общем, если вас вдруг не взяли на работу — не расстраивайтесь. Для мамы вы всё равно симпатяга.
Просто приоритеты теперь выглядят так:
2025: нанимаем карьерного коуча.
2026: нанимаем стилиста. | 946 |
| 16 | Поставил на роутере OpenWRT
Плюсы:
• можно всё настраивать через claude через SSH
минусы:
• ssh не работает
• wifi не работает
• Роутер даже по проводу без своего IP адреса
• Подключение к интернету не работает
• Клод, соответственно, тоже не работает | 862 |
| 17 | ML System design
Я тут готовлюсь к ML System Design собесу и там всё мастерство в том чтобы сделать большой reality check вообще системы которую мы строим, понять какие реально требования были чтобы порой вообще избежать дорогостоящего рисёрча.
Это забавно ведь я хожу по работодателям и часто именно этим и занимаюсь - спрашиваю: “А вам вообще нужно тратить деньги на команду, видюхи или можно API-провайдером можно обойтись?” - и я хорошо знаю сценарии когда нужен отдел МЛ-щиков и когда нет.
Короче, поразился тому что всё, за что я так активно обычно топлю, за то что меня часто уважают называлось простым ML System Design. | 951 |
| 18 | DeepSeek Harness (🔥 Score: 156+ in 1 hour)
Link: https://readhacker.news/s/72DXE
Comments: https://readhacker.news/c/72DXE | 836 |
| 19 | Stanford University выложил на YouTube полный курс по Agentic AI уровня graduate school — бесплатно.
Курс называется CS329A: Self-Improving AI Agents.
Всего 9 лекций от исследователей, которые работают над agentic LLM и системами, способными к самообучению.
Что внутри:
• агенты, которые сами генерируют данные для обучения;
• агенты, которые проверяют собственные рассуждения;
• агенты, которые сами придумывают задачи и пытаются их решить;
• и главное — как создавать системы, которые могут самостоятельно становиться лучше.
Начинается всё с фундаментальных вопросов — почему более крупные AI-модели обычно становятся умнее — и постепенно переходит к продвинутым архитектурам self-improving agents.
Думаю много тут будет полезно.
https://www.youtube.com/playlist?list=PLangBM27OtEA | 864 |
| 20 | Комьюнити развивает Balalaika
На Hugging Face появился датасет paralingua_ru, построенный на базе Балалайки:
Что в нём есть:
1) разметка спикеров по паралингвистическим характеристикам: пол, возраст, высота голоса, тембр и голосовые особенности вроде «звонкий», «бархатный» и т.д.
2) TTS-промпты для аудио: 223 тыс. уникальных промптов на 355 тыс. аудиозаписей
3) промпты сгенерированы не просто шаблонами, а с учётом POS-теггинга, dependency parsing, лексического анализа и особенностей текста: прямой речи, пола персонажа, модификаторов речи и других деталей
Почему это важно?
Такой датасет может помочь TTS-моделям лучше понимать инструкции про голос, стиль и персонажа - особенно на русском языке. Ближайший план автора - дообучить инструктивный ТТС на части датасета и показать. что подход действительно работает.
Balalaika продолжает жить и развиваться силами комьюнити. Очень круто видеть, как открытые датасеты становятся основой для новых экспериментов.
Ссылка на датасет:
🤗 https://huggingface.co/datasets/turnipseason/paralingua_ru | 882 |
