393
Подписчики
Нет данных24 часа
Нет данных7 дней
Нет данных30 день
Архив постов
393
🔺 Книжка-трансформер
Добавил в нашу книжку-трансформер с малыми языками еще две редакции «Маленького принца» — на чувашском и карачаево-балкарском языках.
📚 Итого их стало 12: балкарский, башкирский, дигорский, коми, марийский и горномарийский, татарский, чувашский, эрзянский, якутский, русский и французский.
Все языки выровнены друг с другом, поэтому можно выбирать любую комбинацию. Обратной стороной общего выравнивания является то, что с каждым новым языком в общем корпусе становится на несколько предложений меньше, так как переводчики иногда переводят несколько предложений как одно цельное.
Текстов уже много, поэтому скоро составлю список таких склеенных предложений, поиграем и разобъем их на более мелкие в соответствии с оригиналом.
👉 Книжка
393
🔺 Марийский принц
Получилось выровнять «Маленького принца» на марийском языке. Спасибо Андрею Чемышеву @mari_kanal за поиск текстов и перевод недостающих кусочков.
Таким образом, уже есть параллельная версия книги на башкирском, татарском, дигорском, коми, марийском, якутском и русском. На подходе несколько редакций на других малых языках. Их тоже скоро добавим. Если у вас есть ещё, то смело присылайте тексты! Желательно с указанием переводчика.
👉 Книжка
393
🔺 Татарский и коми
Друзья, благодаря вам начали приходить различные редакции «Маленького принца», которые я понемногу выравниваю и добавляю к нашей книжке-трансформеру. Сейчас добавился татарский и коми.
Про замеченные неточности пишите. По поводу исправления прямо на сайте я думаю, скорее всего появится такая возможность, как руки дойдут.
👉 Книжка
393
🔺 Ё, Карамзин
Чтобы закрепить, изобретение буквы «Ё» княгиней Екатериной Дашковой — миф, который до недавнего времени можно было обнаружить и в Википедии.
Букву «Ё» в типографскую практику ввёл историк и поэт Николай Карамзин в издании книги «Аониды, или Собрание разных новых стихотворений» (1797), что установлено академиком Гротом.
Тамъ бѣдный проливаетъ слёзы, Въ судѣ невинный осужденъ, Глупецъ уваженъ и почтенъ; Злодѣй находитъ въ жизни розы, Для добрыхъ тернїе растетъ; Для нихъ унылъ, печаленъ свѣтъ.👉 Видео по теме
393
🔺 Лингтрѣинъ
#language_facts
Пара фактов про алфавит пока еду в поезде.
🔸 Первая славянская азбука от Кирилла и Мефодия (глаголица) широко не использовалась, но дала нам букву «Э».
🔸 В кириллице было много дублирующихся букв, типа «Ф» и «Ѳ». Их использовали для записи чисел и ставили над ними волнистую линию — титло.
🔸 Петр I провел обширную реформу орфографии. Появилась «гражданская азбука», большинство одинаково звучащих букв исключили из алфавита. Числа стали записывать арабскими цифрами.
🔸 Говорят, что букву «Ё» придумала княгиня Дашкова, тогдашний руководитель Академии наук. Без этой буквы слова «мioд» и «медовый» писались непохоже друг на друга.
🔸 Популярной букву «Ё» сделал Карамзин, на его родине в Ульяновске поставили памятник этой букве.
🔸 Ять. В начале прошлого века буква «Ѣ» произносилась так же как «Е» и приходилось это заучивать. Был специальный мнемонический стих «Бѣлый, блѣдный, бѣдный, бѣсъ убѣжал голодный въ лѣс…».
🔸 После революции алфавит окончательно устоялся. Убрали ять, фиту и i. С конца слов убрали ер («ъ»), благодаря чему «Война и мир» «похудела» на 70 страниц.
P.S. Добавляйте/исправляйте.
393
Repost from Градиент обреченный
🔺 Работа с языками
Несколько интересных новостей, связанных с языками.
🔸 «Маленький принц» на малых языках
Так как энтузиаст дигорского языка Руслан, собрал около 50-ти книг на этом языке из осетинской группы, и среди книг был «Маленький принц», то я попробовал выровнять их при помощи нашего проекта Lingtrain и сделать русско-дигорскую книжку-трансформер (если у вас есть «Принц» на других необычных языках, то скидывайте).
Книжка, GitHub
🔸 Рецепт обучения NNLB под свой язык
Давид собрал Colab по дообучению самой сильной открытой модели машинного перевода от Meta под новый язык. Проделано все на примере тувинского языка. Очень прикольно. Все, кто собирает параллельные корпуса, имейте в виду.
Colab, Medium
393
Repost from RnD ML Team
Всем привет! 👋
Сегодня, 23 сентября, празднуется Международный день жестовых языков! 🧏♀️
🌎 Наша команда продолжает работу над развитием сервиса перевода РЖЯ, чтобы облегчить коммуникацию и сделать окружающий мир более доступным для глухих и слабослышащих людей.
🎁 В честь праздника мы подготовили для вас небольшой розыгрыш:
- оставьте под этим постом любой комментарий;
- сегодня вечером мы случайным образом выберем 3х участников, которым отправим подарки.
Хороших выходных! ❤️
За видео-обращение огромное спасибо Александру @krepkiy_boy! 🫶
#news
393
Repost from Градиент обреченный
🔺 mGPT для малых языков России и языков стран СНГ
Натренировали ряд моделей на основе mGPT 1.3B на открытых данных, в том числе и на данных собранных языковыми энтузиастами.
🔸 Выбрали подмножество языков из оригинальной mGPT (61 язык), для которых смогли найти достаточное количество данных и для которых не ведутся какие-то работы в этом направлении, а эти языки хотелось бы поддержать. Всего получилось 23 модели для языков малых народов России и языков стран СНГ:
Армянский, азербайджанский, башкирский, белорусский, болгарский, бурятский, грузинский, калмыцкий, казахский, киргизский, марийский, монгольский, осетинский, персидский, румынский, таджикский, татарский, тувинский, туркменский, узбекский, украинский, чувашский, якутский🔸 Это базовые модели (pretrain), которые можно дообучить под свою конкретную задачу на нужном языке. 🔸 Так как непокрытых языков ещё много и мы наверняка нашли не все данные по текущим языкам, поэтому будем рады новым запросам для дообучения (для этого требуются моноязычные чистые тексты на нужном языке). Надемся, что это будет полезно сообществу. Написали про это в небольшой статье на Хабре. Просьба плюсануть, кому интересно. 👉 Хабр | HF
393
🔺 Генерация аудио на малых языках
🔸 Silero сделали новые TTS (text-to-speech) модели, одна из них позволяет озвучивать текст на 22 языках с кириллической письменностью.
Аварский, башкирский, болгарский, горномарийский, казахский, калмыкский, карачаево-балкарский, коми-зырянский, лезгинский, марийский, ногайский, осетинский, русский, татарский, тувинский, удмуртский, узбекский, хакасский, чеченский, чувашский, эрзянский, якутский.Также есть модель с 7 языками народов Индии. На HF моделей нет, но можно попробовать генерацию в Colab'е. 👉 Статья | GitHub | Colab
393
🔺 Обновление lingtrain-aligner
Так как в последнее время занимался бурятским параллельным корпусом, то проделал несколько экспериментов.
🔸 Дообучил несколько LaBSE моделей на корпусе родственного бурятскому монгольского языка (спасибо @dori_b за помощь по сбору). Тут получилось улучшить качество до более-менее приемлемого.
🔸 Добавил в библиотеку поддержку выравнивания по сегментам. Теперь можно в качестве разделителей сегментов указать, например, метки глав (%%%%%h2.). Тогда главы будут выравниваться только на своих предложениях, не ища примеры в других главах. Соответственно, качество еще дополнительно улучшается.
🔸 Теперь идем дальше и попробуем расставить таких меток по-больше при помощи носителей языка. Затем дообучимся на полученных парах предложений и ещё улучшим модель. Полученный корпус будем валидировать.
Функционал с сегментами пока экспериментальный и в приложение не добавлен. Как обкатаю, напишу инструкцию и небольшую статью с результатами.
393
🔺 Начал собирать русско-бурятский корпус
🔸 Завел аккаунт Lingtrain на huggingface 🤗, так что там можно будет наблюдать прогресс и там же будет находиться датасет. Там же со временем будут все датасеты.
🔸 Настроил чистку и конвертацию части юридических документов, которые мне передали (из doc в txt). Та еще задачка, так как там много табличек и шаблонных строк.
🔸 Повыравнивал их Lingtrain'ом, тоже скриптами. Лексика там простая, выравание прошло легко. Для книг придется что-то придумывать.
🔸 Написал скрипты сборке и выгрузке датасета.
Дальше выровняю остальные документы, добавлю дедупликацию. Затем перейдем к книгам, для этого попробую дообучить LaBSE на монгольском. Также подниму бота (Айгиз, поделись кодом 😀), для валидации результатов, когда будет побольше данных.
В общем, начало положено. Все фиксирую, чтобы было полезно в будущем, — выложу в отдельный репозиторий.
Корпус
393
Repost from Градиент обреченный
🔺 Помощь языкам
〰️ Бурятский
Помогаем сейчас бурятскому языку. Повыравнивал несколько официальных документов на русском и бурятском и с ними неплохо, так как там перевод почти один к одному. А вот хужожественная литература пока не очень, потому что в LaBSE не было бурятского, а родственный монгольский был в слишком малых количествах.
Тут попробуем дообучить LaBSE на монгольском, так как, кажется, что в сети должны быть русско-монгольские корпуса (киньте, если найдете что-то подобное).
Если кто-то хочет помочь, то присоединяйтесь. Ко мне обратился Тимур Батуров, который сможет рассказать как носитель, какая у него мотивация.
〰️ Санскрит
Также есть целое сообщество людей, которые занимаются санскритом и пользуются для этого Lingtrain'ом. Язык древний, с письменностью деванагари, очень интересно.
Ребята очень активные, даже выкатили целую презентацию с доработками и пожеланиями для Lingtrain. Часть уже сделал, так что скоро обновлю версию.
Для санскрита делал инструкцию по выравниванию, так что, если кто-то интересуется языком и хочет помочь, то тоже не стесняйтесь, пишите.
👉 Инструкция
393
Попробовал сегодня различные варианты для генерации книги в стиле Франка при помощи нейросетей. В целом получается неплохо при помощи ChatGPT, но иногда есть неточности и нет контроля за тем, для каких слов давать подсказки.
Похоже, что нужна какая-то постобработка, либо более простое решение.
393
🔺 Обновление книжки-трансформера
👉 Смотреть тут
1️⃣ Поработал над книжкой, добавил в UI названия глав содержания на выбранном языке.
2️⃣ Сделал механизм подгрузки картинок, если их просто класть в папку с сайтом и называть <номер_абзаца>.png
3️⃣ Номер абзаца теперь всплывает при наведении на абзац.
4️⃣ Нарисовал несколько картинок нейросетями (stable diffusion 1.5). Понравилось, нарисую еще.
5️⃣ Долго ковырялся с рамкой для картинок, вроде получилось неплохо.
〰️ Напоминаю, что все это делается на примере Мастера и Маргариты Булгакова, а в конечном итоге можно будет делать такие книжки для себя из своих текстов на любых языках. Сначала делаем выравнивание Lingtrain'ом для пар книг, затем выравниваем совместно, и потом оборачиваем все это в сайт и кладем на github pages.
✔️ Пишите, если увидите баг или появятся идеи. Хочу попробовать сделать подстрочный режим и добавить закладки.
👉 Книжка | Habr | GitHub
393
Repost from Градиент обреченный
🔺 Делаю книжку-трансформер
👉 Посмотреть можно здесь
Идея в том, чтобы после выравнивания нескольких текстов (2 и более) Lingtrain'ом можно было бы собирать веб-книжку, которую можно разместить на github pages (просто скопировать файлики) и читать откуда угодно + пользоваться дополнительным функционалом — компоновать в одну/две колонки, менять подсветку, размер шрифтов, языки, и т.д. ✨
Делаю на примере "Мастера и Маргариты".
〰️ Добавил:
• Тексты на 10 языках
• Новые виды разметки (переключатель layout):
1️⃣ В одну колонку с чередованием абзацев
2️⃣ В одну колонку с чередованием предложений
3️⃣ Можно скрыть один из текстов и читать только нужный
• Новые виды подсветки (переключатель prompt):
1️⃣ Подчеркивание соответствующих предложений
2️⃣ Цветовое выделение
• Увеличил размеры шрифта
• Настройки запоминаются и хранятся в браузере
Проект открытый, ваши идеи и любой фидбек приветствуются! 🚀
👉 GitHub | Habr
