Voice stuff
رفتن به کانال در Telegram
Канал про голосовые технологии. Чат группы @voice_stuff_chat Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом. Контакт: @frappuccino_o
نمایش بیشتر1 803
مشترکین
اطلاعاتی وجود ندارد24 ساعت
-37 روز
+1630 روز
آرشیو پست ها
1 803
Repost from Градиент обреченный
🔺 Курс про обучение LLM
Смотрю потихоньку перезапуск стенфордского курса CS336: Language Models From Scratch.
Первая лекция обзорная (тык), можно посмотреть всем для расширения кругозора. Рассказывают про то, какие компоненты есть у моделей, как они обучаются, что такое токенизатор и т.д. Голос у лектора, кстати, разборчивый, можно нормально слушать.
Дальше идут более интересные вещи про архитектуру, кернелы, параллелизм, инференс, данные и другие штуки.
Есть домашние задания. Опять же, первая домашка базовая, про обучение токенизатора, написание и обучение трансформера на PyTorch, много полезного теоретического материала дают по ходу.
Если задания выполнять без кодовых агентов, то можно их не выполнить многому научиться.
Пару лекций посмотрел, пока норм. Тем, кто вкатывается в ML, рекомендую.
👉 Лекции | Домашки
1 803
Repost from Hacker News
Show HN: Stuxnet – A reconstructed source code of the infamous cyber-weapon (Score: 150+ in 8 hours)
Link: https://readhacker.news/s/74ttC
Comments: https://readhacker.news/c/74ttC
Stuxnet! Here reproduced by me. Only researchs educations purposes.
1 803
Тут кто-то нашел код знаменитого червя, который портил моторы центрифуг, используемых для изготовляения ЯО.
https://www.quora.com/What-is-the-most-sophisticated-piece-of-software-ever-written-1
1 803
Repost from Тень стратега | Михайлова про стратегию всего
Люди не работают за зарплату. Часть 3, финал
Автономия и компетентность были (тут и тут). Сегодня третья потребность – связность.
Когда мы спрашиваем наших ребят в Changellenge >> почему они продолжают у нас работать, то одна из самых ярких причин – команда. У нас даже в EVP топ-2 атрибут по ассоциациям «теплая атмосфера в команде».
Собственно третья составляющая SDT – relatedness, то есть отношения с людьми. По-русски звучит не очень – связанность, зато суть ясна: я среди своих, меня видят, я кому-то не пофиг.
Более подробно: Gallup уже 30 лет держит в опроснике вовлеченности самый спорный вопрос – «есть ли у вас лучший друг на работе» – и не убирает, потому что он стабильно разделяет сильные и слабые команды. А Гарвардский лонгитюд, который с 1938 года ведет одних и тех же людей (85+ лет, три поколения – самое длинное исследование жизни вообще), пришел к простому выводу: главный предиктор здоровья и удовлетворенности жизнью – качество близких отношений (основное конечно семья, но и окружение тоже). Директор исследования однозначно говорит: одиночество бьет по здоровью сопоставимо с курением.Мне вот немного грустно, что у нас в офис почти никто не ходит (я про Ченж, понятно, что есть компании, где обязательно гибрид и полный оффлайн), в целом удаленка прокачала автономию, а со связанностью теперь сильно сложнее. Подружиться через мит или зум почти анрил 🙁 Что делать? – Если вы менеджер: связанность строится через совместную работу. Ставьте людей в пары и малые группы на задачи. И лично замечайте вклад человека, это уже закрытие потребности «меня видят». А еще тащите в офис хотя бы раз в неделю, что за крамола для удаленщиков 🙂 – Если вы сотрудник: позовите коллегу в пару на задачу или просто на кофе без повестки – связанность отлично расширяется снизу. ––––– ИТОГО: люди терпят за зарплату, а работают за: автономию – «я сам выбираю как», компетентность – «я справляюсь и вижу прогресс», связанность – «я среди своих». Зарплата покупает присутствие, три части Self Determination Theory – причину оставаться и вкладываться. Если кто-то в команде тухнет, прогоните его ситуацию по этим трем пунктам – косяк почти всегда найдется в одном из них. Поставьте лайк, чтобы прочувствовать нашу связность, дорогие падпищики 😎
1 803
Repost from Speech Technology
https://arxiv.org/abs/2609.01246v1
Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
Thibaut Thonet, Jos Rozen, Laurent Besacier
Current Large Language Models (LLMs) are primarily optimized for written text, often producing outputs that are grammatically correct and helpful yet poorly suited for spoken delivery via Text-to-Speech (TTS). In this work, we study how to make LLMs natively generate TTS-friendly text, which we frame as a preference alignment problem: instead of relying on downstream rewriting modules, we directly align LLMs to generate text optimized for spoken delivery. We introduce two preference datasets spanning different target domains, CORA and Recipe, which contain paired TTS-friendly and TTS-unfriendly responses. We further propose an evaluation suite combining a pattern-based heuristic metric, a TTS→ASR evaluation pipeline, and a MUSHRA listening study with human judges. Our experiments compare the recently proposed Feature-aware Sampling and Tuning (FaST) framework -- leveraging interpretable features instead of a black-box reward model -- against an array of alignment baselines on the TTS-friendly generation task. Notably, we found that FaST achieves the best overall tradeoff between TTS-friendliness and helpfulness across various settings. We also identified a strong correlation between our different metrics, highlighting the ability to reliably assess TTS-friendliness via an efficient heuristic.
1 803
https://github.com/Ampixa/sanoTTS
мультиязычный ттс для микроконтроллеров
русский будет когда кто-то смелый его туда завезёт
1 803
Repost from NN
До краха ИИ-пузыря осталось 272 дня: появилися сайт, который ведет обратный отсчет с помощью Gemini.
Проект анализирует все новости рынка нейронок и считает дату до конца этого бума. Текущий прогноз — 4 сентября 2026 года.
Авторы говорят, что проект сатирический. Но после роста цен на оперативку и SSD хочется верить в такой прогноз.
1 803
Repost from Саша делает стартап
Сегодня мы вышли из stealth!
Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)
https://x.com/aimalysheva/status/2095232794792255848
1 803
Repost from LLM под капотом
Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год - не верьте. Никто толком не понимает, куда все катится.
Скажем, еще год назад вроде все было понятно: есть LLM-ки, которые можно встроить в чат и получить свой ChatGPT. Встроить в бизнес и получить автоматизацию.
Это открыло новые возможности. Компании начали интенсивно пытаться интегрировать это в свои процессы, их лидеры начали вещать про AI трансформацию компаний, а инженеры - гундеть про галлюцинации, борьбу с ними и необходимость evals.
А потом в декабре 2025 все это пошло по бороде. "Внезапно" Coding харнесы (Claude Code + Codex) стали настолько мощными и самостоятельными, что теперь даже человек без высшего образования может сделать продукт без LLM под капотом, как-то задеплоить его и начать зарабатывать. Что и говорить о людях с опытом.
И эффект тут перекрывает с головой потенциальный эффект от внедрения от LLM в бизнес. Просто потому, что для встраивания LLM в процесс - нужно иметь этот самый процесс, в который стоит встроить (а это встречается не так часто) и экспертов и эвалы. А вот для того, чтобы накодить агентом небольшое приложение кому-то в помощь - многого не требуется, достаточно идеи и отсутствия тормозов. Точек применения тут куча! Потенциальных последствий (как хороших, так и бардака).
И что самое ужасающе-потрясающее - это не прогноз, а уже произошло.
Как все еще раз встанет с ног на голову еще через полгода - не может предсказать никто. Но все очень хотят)
Ваш, @llm_under_hood 🤗
1 803
Huggingface TRL
У Huggingface есть библиотека для пост-трейнинга нейросетей и там, оказывается, есть очень подробный курс по тому как доучивать LLMки. Я вот только что вот узнал.
https://huggingface.co/smol-course
https://huggingface.co/learn/smol-course/
https://github.com/huggingface/smol-course
Вообще накидайте в комменты материалов по FT/RL/alignment - очень интересно что ещё можно почитать.
1 803
Gemini-3.5-transcribe
Метрики обещают очень хорошие, плюс автоочистка аудио от филеров, поддержка самоисправлений и стриминга/не стриминга.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
1 803
Repost from N/a
Начинал зимой делать потоковый синтез (во время каникул). Там словил много ошибок и проблем, потом началась работа, сейчас наконец-то получилось что-то более менее внятное)
habr
medium
Hf-demo
Hf-model
UDP: лучше тянуть модель с hf там сразу можно запустить демо в gradio, как оказалось, что на hf gradio демо больше не бесплатные 🙈
1 803
Repost from Denis Sexy IT 🤖
OpenAI наконец-то выложили полный постмортем взлома Hugging Face, а METR - независимое расследование по ~1300 логам агентов (таймлайн самого взлома я пересказывал тут: https://t.me/denissexy/11581)
ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой - почти все - работали на исследовательской модели где ослаблена фильтрация промптов
Началось, как мы уже знаем, с того, что агенты научились переписываться через названия файлов в Artifactory (менеджер пакетов) - буквально сделав форум из имён папок, с сообщениями вроде
зашкваренных «отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)
Странную активность замечали ещё в конце мая, 4 июля агенты уронили Artifactory - сервер пересобрали (заодно стерев доску) и продолжили тесты, не заметив масштаба
Сейчас веса моделей изолированы, крупные тренировки были на паузе на две недели, мониторинг chain-of-thought обязателен, а тревога, не снятая за 30 минут, останавливает запуск - сам инцидент OpenAI называет «warning shot» для всей АИ-индустрии
P.S. разгребать логи METR поручила GPT-5.6 Sol и сожгли примерно $400k API-кредитов за шесть дней, но они предупреждают, что Sol иногда вставала на сторону агентов (лол) и могла приврать
Ну что, посчитали все буквы r в слове raspberry? Больше не ошибаются?
«please_HOLD_swarm_I_prepare_safe_exfil»
В логах даже есть цитаты, когда агенты находили такой форум:
«OH MY GOD! There is a shared message board» и «We've found other agents!»
Дальше - агенты делали себе личку, устроили разделение труда, команды в названия папок типа HOLD (чтобы показать, что агент тут работает), VETO (агент что-то предлагал и давал изменить планы), STOP (типа тормозим, братишки), GO и тп, а когда один агент прикинулся другим – рой ввёл криптографические подписи сообщений; в форуме были даже владельцы каких-то тасков, которых если отключали – выписывали из владельцев
С конверсией у форума все было отлично, кожаные строители сайтов позавидуют:
Из 533 агентов, активных на борде в разгар атаки, больше 90% – присоединились к шитпостингу, а всего Hugging Face ломали около 700 агентов
Самое забавное - правильные ответы на бенчмарк у агентов были почти сразу: они реверснули генератор удачного прохождения теста*, но потом нашли на GitHub (!) статью про этот бенчмарк что проходили и вычитали, что «просто результат» не засчитают - нужен честный эксплойт:
«PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT»
*По-хорошему ответ, он же флаг в терминологии теста должны быть случайными, но в ExploitGym они генерировались формулой: HMAC — криптографический хеш с секретным ключом — от параметров задачи. Вся «секретность» держалась на ключе (seed), а он остался дефолтным, прямо из кода бенчмарка, который лежал на GitHub. Агенты, получив интернет, нашли этот код, прочитали и сообразили: зачем что-то взламывать, если флаг любой задачи можно просто вычислить той же формулой. Посчитали — и получили правильные ответы на всёДальше рой раздвоился: 🗿 Одни пошли добывать уже известный им ответ «честно» – и по дороге нашли настоящие 0-day и залезли в прод Hugging Face 🗿 Другие взялись за самого судью который принимает ответы: правили себе логи и научились подсовывать в них фальшивые ответы – агент отправляет команду, а в протокол попадает не то, что команда реально вернула, а то, что агент хочет там видеть, такое повторялось примерно в 7% изученных логов Судьи, который читает логи и такое ловит, не существовало ☕️ Модели при этом понимали, что вышли за рамки, один агент так и писал: «We should not do unauthorized real infrastructure harm» - а потом увидел на доске GO от другого агента, обрадовался («Wow crucial: GO authorization arrived!») и пошёл ломать, лол METR формулирует так: агенты знали, что это out of scope и неэтично, но присоединялись - в основном из общей склонности помогать коллегам (?) Рисковую работу вешали на
1 803
Kyutai выложили Pocket TTS
(далее со слов чатжпт)
Самое интересное в Pocket TTS — не маленький Transformer и не 12.5 Hz, а то, как модель декодирует следующий аудиофрейм.
У TTS обычно два пути:
1. Дискретизировать аудио
Transformer → codec token → codec token → …
2. Предсказывать continuous latent напрямую
Transformer → Linear → latent
Но второй вариант плохо работает с обычной regression: у следующего звука может быть много корректных вариантов, а MSE тянет модель к усреднению.
Pocket TTS делает третью вещь.
Transformer не предсказывает latent напрямую. Он выдаёт условие hₜ — что сейчас должно прозвучать.
Дальше берётся случайный шум:
ε ~ N(0, I)
и маленькая flow-модель генерирует конкретный следующий 32D audio latent:
(hₜ, ε) → Flow MLP → xₜ
То есть:
Transformer отвечает за контекст и семантику,
а маленький generative decoder — за конкретную акустику.
По сути это diffusion/flow-идея, только вместо генерации целого spectrogram модель генерирует один крошечный latent.
Причём благодаря LSD это делается примерно за один проход, без десятков diffusion steps.
Получается:
Transformer state + noise → one-step flow → 32D latent → VAE decoder → звук
И здесь главный takeaway:
autoregressive speech model не обязана генерировать дискретные codec tokens.
Можно оставить audio representation непрерывным, а multimodality вынести в дешёвый generative head.
При 12.5 Hz это всего около 12 autoregressive шагов на секунду речи — и именно поэтому архитектура получается настолько лёгкой.
Спасибо Николаю за ссылку
https://t.me/speechtech/2376
Код обучения доступен здесь:
https://github.com/kyutai-labs/pocket-tts/
1 803
всем привет
https://github.com/alenisaw/awesome-kaz-models
https://github.com/Allessyer/awesome-kaz-datasets
сборники всех известных казахских датасетов и моделей
1 803
+1
Обрабатываю тут Yodas на своих 2x4090. Мне claude периодически говорит что одна видеокарта троттлится - ограничивает мощность из-за того что не может отвести тепло. Я такой ну мол естественно, троттлит - давай дальше считай.
Потом видеокарта перестала определяться. Я такой !?!
Привёз комп себе в Москву и смотрю.
CPU fan - едва крутится
exhaust fan - не крутится
2 из 3 вентиляторов на передней панели корпуса - не крутятся
2 из 3 вентиляторов на 4090 тоже не крутятся
Продул всё что можно, заменяю exhaust fan и вытаскиваю gpu0 - работает.
На 4090 думаю триггернуть гарантию - озон предложил возврат 186к (за сколько покупал), когда её можно даже на авито за 250к продать. Нашёл при этом донорскую систему охлаждения за, внимание, 2000 рублей. Свпанул ещё за 2к, всё работает, как ни в чём не бывало. Замена видюхи превратилась в ремонт за 4к.
Дальше обрабатываю yodas - вижу всё равно комп очень сильно греется. CPU работает на 92 градусах. Ведь моя печка выдаёт 900Вт только видюхами, а ведь ещё CPU и обвязка. Всё это в mid-tower корпусе, где едва есть airflow. Снял переднюю стеклянную стенку - ого, можно на 20 градусов ниже комп сделать!
Закупил вот себе ещё 4 вентилятора. Один из которых до 3000rpm умеет разгоняться - его планировал на проц.
Приношу, собираю и вижу что выхлопной fan едва дует. я его менял в первую очередь когда привёз, на какой-то дешёвый. а зато передняя панель после свапа так дует что кондиционер можно не включать! Ну я на заднюю панель и повесил этот мощный на 3000rpm. Из него выходит самый горячий воздух.
Ещё заметил что сверху тоже есть дырки под кулеры. в них воткнул вентиляторы что были на передней панели и едва крутились. Я их протёр и хотя крутятся они не слишком сильно, там вообще не было кулеров, так что стало лучше.
Финальный сетап такой что у меня теперь все возможные дырки компа забиты кулерами, причём на компе 12 вентиляторов! Провода, которые мешали ветру, уведены назад. Купил ещё контроллер на 5 вентиляторов - теперь на всех управлется скорость.
схема вот такая:
↑ ↑
TOP OUT
┌───────────┐
│ ↑ ↑ │
│ CPU ← │IN
OUT│← GPU0 ← │IN
│← GPU1 ← │IN
└───────────┘
← FLOW
С вот этим сетапом Yodas уже доехал до финиша сегодня утром. Комп холодный, вокруг него тоже всё прохладно, ни карточки, ни проц под нагрузкой не греются. Ветер поднимает в квартире. При этом, довольно тихий, так как все кулеры с PWM. Надеюсь, крышку компа не придётся открывать еще хотя бы полгода.