ch
Feedback
Lingtrain

Lingtrain

前往频道在 Telegram

Language learning for all

显示更多
393
订阅者
无数据24 小时
无数据7 天
无数据30 天
帖子存档
🔺 Mama Mia Увидел, что в LinkedIn'е, кто-то написал статью про Lingtrain на итальянском языке 🇮🇹 и делится с окружающими. Очень рад, что нашим проектом пользуются! 🥰 https://memorabilmente.com/come-costruire-un-corpus-parallelo-con-lingtrain-aligner/

〰️ Обновление Lingtrain Всем привет! Добавил важный функционал в наш выравниватель. 🔁 Экспорт и импорт Теперь выравнивание,
〰️ Обновление Lingtrain Всем привет! Добавил важный функционал в наш выравниватель. 🔁 Экспорт и импорт Теперь выравнивание, в том числе и незаконченное, можно скачать в .lt формате и загрузить его на вкладке Alignments. После загрузки можно будет продолжать с ним работать, править и т.д. Таким образом, если кто-то выравнивал текст и в нем остались ошибки, то можно будет загрузить выравнивание в Lingtrain и подредактировать его. 🚀 beta.lingtra.in Какое-то время назад поднимал тестовую версию выравнивателя для русского и английского языков (там модель rubert-tiny). Прошляпил момент, когда на аккаунте закончились деньги и его удалили 🤷‍♂️ Поднял новый сервер и настроил нормальный адрес, там сейчас последняя версия с той же tiny моделью. Поддерживаются английский и русский языки. http://beta.lingtra.in 🐳 Docker Образы для локального запуска: • lingtrain/studio:v8.4 (50+ языков) • lingtrain/studio:v8.4-labse (100+ языков) • lingtrain/studio:v8.4-tiny (ru-en) Запускается все как раньше (инструкция). GitHub | Статья про Lingtrain

24-27 ноября в рамках 29-й Международной книжной ярмарки в Пекине Национальные литературы народов России представят программу
24-27 ноября в рамках 29-й Международной книжной ярмарки в Пекине Национальные литературы народов России представят программу онлайн-мероприятий. Трансляция мероприятий тут 📅 24.11 12:00 / Мск / Презентация программы онлайн-мероприятий 📅 24.11 13:00 / Мск / Мастер-класс по эвенкийскому языку 📅 24.11 13:00 /Мск / Мастер-класс по хантыйскому языку 📅 24.11 14:00 / Мск / Мастер-класс по долганскому языку 📅 26.11 11:00 / Мск / Круглый стол «Современная национальная литература народов Дальнего Востока» 📅 26.11 12:00 / Мск / Творческая встреча с современными поэтами Якутии 📅 26.11 13:00 /Мск / Творческая встреча с современными поэтами Бурятии 📅 27.11 11:00 / Мск / Творческая встреча с современными писателями Дальнего Востока 📅 27.11 12:00 / Мск / Круглый стол «Современная национальная литература народов Сибири» 📅 27.11 13:00 / Мск / Лекция «Языковой активизм: один в поле воин» Мероприятия сопровождаются синхронным переводом на английский язык.

в библиотеке молодёжи задумана серия подкастов про языки России, и в первом речь про мансийский и немало про сохранение языков. благодарю ведущую за то, что получился такой разговор

📚 Продолжаю делать книжку-трансформер 👉 Посмотреть можно здесь. Идея в том, чтобы после выравнивания нескольких текстов (2
+2
📚 Продолжаю делать книжку-трансформер 👉 Посмотреть можно здесь. Идея в том, чтобы после выравнивания нескольких текстов (2 и более) можно было бы собирать веб-книжку, которую можно разместить на github pages (просто скопировать файлики) и читать откуда угодно + пользоваться дополнительным функционалом — компоновать в одну/две колонки, менять подсветку, размер шрифтов, языки, и т.д. 🔮 Делаю на примере "Мастера и Маргариты". 〰️ Пока добавил: • содержание • переключатели размера шрифта • сохранение настроек при перезагрузке • подсветку соответствующего предложения при наведении • адаптивную разметку под мобильный Любой фидбек и идеи приветствуются! 🚀

📚 Про мультиязычное распознавание речи Всем привет. Написал статью на хабр про распознавание речи на разных языках. Прошу поддержать плюсиком. 〰️ Там же есть идея по поводу того, как можно это использовать при изучении языков. Модель умеет генерировать субтитры с временными метками. По ним можно найти фразы и выражения и нарезать по ним роликов. Можно взять и готовые субтитры от фильмов. Все инструкции я написал, спрашивайте, если что. 👉 Статья

До этого лета я не занимался машинным переводом вообще. А в июле, в промежутке между Сколтехом и новой работой, я решил потренироваться и сделать переводчик для языка, с которым никогда раньше не работал – и вообще работал мало кто. Это эрзянь кель, один из языков Мордовии. На весь пайплайн – сбор текстов, выравнивание их с русским, обучение моделей – ушло две недели; обучал модели на в колабе и на собственном ноутбуке. Качество получилось пока очень такое себе, но сам факт, что можно быстро и дёшево сделать машинный перевод для нового языка, меня вдохновляет. В вчера я описал свои приключения на Хабре; приглашаю к прочтению.

〰️ Загрузил новые версии Lingtrain на docker hub. Чтобы запустить локально нужно: 1️⃣ Загрузить обычную версию (ST, 50+ языко
〰️ Загрузил новые версии Lingtrain на docker hub. Чтобы запустить локально нужно: 1️⃣ Загрузить обычную версию (ST, 50+ языков)
docker pull lingtrain/aligner:v8

или версию с большой моделью (LaBSE, 100+ языков)
docker pull lingtrain:aligner:v8-labse

2️⃣ Запустить
docker run -v C:\app\data:/app/data -v C:\app\img:/app/static/img -p 80:80 lingtrain/aligner:v8

Папки C:\app\data и C:\app\img должны существовать.

🎈 Любителям лингвистики На днях открылся классный сайт с лингвистическими задачками. Задачки собраны со всевозможных олимпиа
🎈 Любителям лингвистики На днях открылся классный сайт с лингвистическими задачками. Задачки собраны со всевозможных олимпиад Александром Пиперски (автором многих книг по популярной лингвистике). Задач уже больше тысячи, база пополняется. 👉 Задачки

🎁 Обновление Уделил время на несколько полезных доработок и починок. 1️⃣ Выравнивание двух текстов на одном языке. Например,
🎁 Обновление Уделил время на несколько полезных доработок и починок. 1️⃣ Выравнивание двух текстов на одном языке. Например, два перевода какого-то произведения. Раньше внутри приложения была привязка к языку и так сделать не получалось. Теперь привязка к стороне выравнивания. 2️⃣ Конфликты на концах выравнивания. Появились галочки handle start и handle end. Их можно нажать при поиске конфликтов, тогда алгоритм будет считать две первые и две последние строки текстов за правильные пары и найдет ошибки выравнивания на концах. Раньше конфликты определялись только между хорошими цепочками и на концах текстов могли оставаться незамеченными. 3️⃣ Все метки теперь опциональные. Видел, что многие пользователи не расставляли метки title и author, из-за чего появлялась ошибка (эти метки были обязательными, а добавить после загрузки их было нельзя). Теперь они опциональные и их можно добавить на вкладке Create. 4️⃣ Поддержка меток заголовков для PDF. При экспорте в XML и дальнейшей генерации из него PDF теперь экспортируются все метки заголовков (h1, h2, h3, h4, h5). Раньше были только h2, это было связано со сложностями при трансформации и верстке глав и содержания книги. 5️⃣ Прочие доработки. При экспорте в HTML добавил тег <meta charset="UTF-8">, из-за отсутствия которого могли быть проблемы с просмотром HTML книги на телефоне. Оформил docker-compose файл, чтобы удобней запускать локально. Прочие мелкие починки, которые были замечены. ✅ Как дальше дойдут руки, буду добавлять дополнительный функционал, о котором вы просили (показывать второй текст по нажатию, подстрочный вариант и т.д.). Обо всех идеях и багах пишите! P.S. Обновил тестовый русско-английский выравниватель (моедль rubert-tiny2). Докер образы с мультиязычными моделями обновлю позже. Всем хорошей недели! GitHub | Что такое и как пользоваться

📚 Про двоеточие Интересные вещи узнал на днях из Своей игры. Оказывается, что символ двоеточия (։) в армянском языке использ
📚 Про двоеточие Интересные вещи узнал на днях из Своей игры. Оказывается, что символ двоеточия (։) в армянском языке используется для обозначения конца предложения, как наша обычная точкаточка, кстати, используется как двоеточие 😁). В шведском же языке двоеточие тоже может использоваться не обычным (для нас) образом, — для склонения аббревиатур. Например, МИД → МИД:а. Про шведский подтверждения не нашел. Может, кто подскажет правда это или нет 🤷‍♂️. Понял только, что родительный падеж в шведском действительно есть. 🥤Люблю такие детали про языки, делитесь, если знаете что-то любопытное.

#nlp #parallelcorpora Два перевода 📚 Выровнял два перевода рассказа Бредбери "The Picasso Summer" на русский. Первый от Норы Галь, второй от Арама Оганяна. Можно видеть, что переводчик — птица вольная, особенно по части имён, хотя оба перевода хорошие. 💡 Так же видно, что это по сути корпус парафраз, который можно использовать для различных целей машинного обучения. В следующей версии Lingtrain Aligner, язык станет зависим от стороны выравнивания (левая/правая), чтобы выравнивать два текста на одном языке. Пока что я загружал один текст как русский, а второй как general язык.

Коллеги, по просьбе трудящихся я создал небольшой сервер (на clo.ru) и поднял там Lingtrain Aligner с моделью Давида Дале rubert-tiny2. Это для тех, кто пока не знает как запустить локально через docker. 🇷🇺🇺🇸 Поддерживаются только английский и русский языки. 👉 Можно попробовать здесь: http://195.140.147.55/

#рисуембуквы 〰️ Если вдруг задумаете увлечься арабской каллиграфией, то с помощью этой диаграммы сможете отличить один язык о
#рисуембуквы 〰️ Если вдруг задумаете увлечься арабской каллиграфией, то с помощью этой диаграммы сможете отличить один язык от другого 😁 P.S. Если есть знатоки арабо-персидской письменности, то поправьте, если что-то не так. @lingtrain

#рисуембуквы 〰️ Вот такой цветочек получился для славянских языков с кириллической письменностью. Долго подбирал цвета и игра
#рисуембуквы 〰️ Вот такой цветочек получился для славянских языков с кириллической письменностью. Долго подбирал цвета и игрался с прозрачностью. На силуэтах дополнительно видно, где какой язык. 🔺 Кстати, интересно, что в белорусском нет буквы "и" (вместо неё "i"), а в украинском есть и "и", и "і", и "ї" и "й". @lingtrain

#минуткасамопиара 〰️ Рассказывал недавно коллегам про то, как менял специализацию, — какие были трудности и легкости. Если кто-то тоже думает менять специальность, то, возможно, будет полезно. Прошу поддержать пост, если не сложно. 👉 Хабр

🇵🇹 "Harry Potter e o Prisioneiro de Azkabanе" "Гарри Поттер и узник Азкабана" Для любителей 🇵🇹 португальского, сделал часть из книги про знаменитого волшебника. ➕ нарисовал обложку "Гарри Поттер и запрещенные вещества". #pt #ru

#рисуембуквы 〰️ Сделал диаграммку с общими символами среди славянских языков с латинским алфавитом. @lingtrain
#рисуембуквы 〰️ Сделал диаграммку с общими символами среди славянских языков с латинским алфавитом. @lingtrain

🇷🇸 "Мост на Дрине" На Дрини ћуприја Начало исторического романа Иво Андрича, в котором описываются события региона в XVII-XX веках. За этот роман автор был удостоен нобелевской премии в 1961 году. Версия на сербском и русском языках. #sr #ru

✳️ "Bruliganta intelekto" Опаляющий разум Небольшой эксперимент с эсперанто. Благодаря сходству со многими языками и мультиязычности модели он тоже довольно неплохо выравнивается в lingtrain studio. 👉 Сделал параллельный вариант фантастически-философского рассказа советских времен за авторством Генриха Альтова. @lingtrain #eo #ru