Литоисчисление
Open in Telegram
Лаборатория цифровых исследований литературы и фольклора Пушкинского Дома — это мы. Рассказываем о количественных методах в литературоведении и задаемся экзистенциальными вопросами.
Show more227
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Друзья, в нашей Лаборатории снова открыта вакансия научного сотрудника.
Исследовательский фокус Лаборатории — корпусные и количественные исследования в области истории и социологии русской литературы и фольклора. Одна из составляющих нашей миссии — работа над инфраструктурой для цифровых исследований: создание общедоступных корпусов текстов, публикация открытых данных, распространение практики воспроизводимых исследований. Подробнее о нас можно узнать здесь.
Один из важных проектов Лаборатории — Корпус русской прозы для детей и юношества XX–XXI вв. Сейчас мы ищем сотрудника, который возьмет на себя роль куратора данных Деткорпуса. В зоне ответственности куратора — регулярное пополнение корпуса, корректировка метаданных, исправление ошибок в данных и метаданных, работа над повышением репрезентативности корпуса.
Помимо работы в роли куратора Деткорпуса должность научного сотрудника предполагает самостоятельные исследования по любой тематике в области литературоведения или фольклористики, соотносящейся с исследовательским фокусом Лаборатории.
Вакансия объявляется на стартовую должность младшего научного сотрудника, однако для опытных коллег мы можем предложить более высокую должность. В институте действует гибкая система финансового поощрения сотрудников за достижения.
Мы ожидаем от кандидатов:
* законченное высшее образование (диплом магистра или специалиста),
* базовое филологическое образование (весьма желательно),
* знание любого языка программирования и готовность совершенствовать свои навыки работы с данными.
Кроме того, плюсом будет знакомство с системами контроля версий (git), а также основами статистики.
Всех заинтересованных просим писать заведующему Лабораторией Кириллу Александровичу Маслинскому по адресу kmaslinsky@pushdom.ru.
Будем благодарны всем, кто решит показать этот пост друзьям и коллегам. ;-)
Друзья, привет. Осталась неделя до окончания срока подачи заявок на участие в «Домашних чтениях». Очень ждём молодых и дигитальных!
Диалектика канона
В Репозитории новый датасет — «Литературные произведения в государственных стандартах и программах для средней школы: 1998–2022 гг.», созданный Андреем Кокориным.
Датасет представляет собой роспись литературных произведений, отраженных во всех официальных документах, которые регламентируют преподавание русской литературы в постсоветской школе и определяют необходимый объем знаний по этому предмету. В числе таких документов ГОСТы и примерные образовательные программы средней школы, а также кодификаторы ОГЭ и ЕГЭ по литературе.
Анализ данных, собранных Андреем, позволяет, помимо прочего, установить, в какие годы обязательная часть школьной программы по литературе претерпевала ниболее значительные изменения. Ответ — на графике ниже.
Датасет Андрея можно считать третьей частью трилогии о школьном литературном каноне, посвященной его юности; детство канона отражено в базе данных «Хрестоматии Российской империи с 1805 по 1912 гг.», а его отрочество — в «Программах по литературе для средней школы с 1919 по 1991 гг.». Лев Толстой, как известно, предполагал описать и четвертую эпоху жизни взрослеющего человека, но события недавнего прошлого оказались трудны для осмысления в рамках автобиографического повествования. Так и мы: умолкаем на время, давая свершиться дистанции между осмысляемым и осмысляющим.
#новыйдатасет
Считавшаяся нами безвозвратно утерянной и наконец счастливо обретенная —
запись доклада «Неисследованные горизонты силлабо-тоники», прочитанного Борисом Ореховым на семинаре Лаборатории в феврале нынешнего года. Ура!
Тятя! тятя! нейросети притащили…
Прочитайте, пожалуйста, следующие строки:
Под деревья полночного воздуха.
На вечности в отказе вернется,
И нашим новым пустотелым платьем
На прозрачной подкове просили лета.
Как вы думаете, какому писателю подражает в этих стихах нейросеть?
а) Осип Мандельштам
б) Анна Ахматова
в) Марина Цветаева
г) Владимир Маяковский
Насколько хорошо вы знакомы с творчеством выбранного вами автора?
а) Никогда раньше не слышал(а) этого имени.
б) Я слышал(а) об этом авторе, но плохо представляю себе его творчество.
в) Я знаю этого автора, но процитировать его не могу.
г) Я знаком(а) с этим автором и могу процитировать несколько его строк или стихотворений.
д) Этот автор хорошо мне знаком, я могу цитировать наизусть многие его стихотворения.
Если вы ответили на предложенные вопросы, то имеете практическое представление о недавнем эксперименте Бориса Орехова.
Попытавшись выяснить, насколько узнаваемым является стиль того или иного автора, воспроизводимый нейросетью, исследователь обучил LSTM-модель на текстах трех известных русских поэтов, случайным образом отобрал из сочиненного ей материала три четверостишия и предложил 94 студентам-филологам ВШЭ определить, кто мог бы написать эти стихи.
Выбор филологов в качестве респондентов не был случайным: профессиональный читатель хорошо знает, что формальная организация текста не менее важна, чем его содержание, и представляет, из каких компонентов может складываться стиль того или иного автора. Кроме того, решение проводить эксперимент на филологах дало возможность усложнить отвечающим задачу выбора и тем самым исключить вероятность случайного успеха модели; таким образом в перечень вариантов ответа попали имена писателей, относящихся к одной эпохе и/или близким литературным направлениям.
В каждой из трех частей эксперимента студенты дали от 40 до 50 % правильных ответов. Оказалось также, что точность определения стиля того или иного поэта повышается, если отвечающий хорошо знаком с его стихами и способен цитировать их наизусть. Так респонденты подтвердили не только свою компетентность, но и способность LSTM-модели успешно воспроизводить стиль заданного автора. Не менее важно при этом, что стилистическое качество текста, по-видимому, способно проявляться даже в коротком четверостишии, объема которого внимательным читателям вполне достаточно для верного предположения о его авторстве.
Подробнее о ходе и результатах эксперимента можно почитать здесь.
Кстати о внимательных читателях: вот и правильный ответ на вопрос, заданный в начале поста —> Осип Мандельштам.
Дорогие юные друзья! Зачеты, экзамены, защиты выпускных работ и все сопутствующие этому тревоги вот-вот останутся позади — и можно будет подумать о грядущем дне.
Веря, что он настанет, приглашаем вас с 28 по 30 сентября 2023 года принять участие в первой молодежной конференции «Домашние чтения», которую организуют молодые ученые Пушкинского Дома.
Программа конференции обещает быть интересной. Так, в рамках «Домашних чтений» планируется обсудить методы цифровой гуманитаристики, применяемые в изучении литературы. К дискуссии будут рады присоединиться старшие сотрудники нашей Лаборатории.
Приходите и вы: читать и обсуждать доклады, знакомиться и дружить, гулять по запутанным коридорам Пушкинского Дома, сидеть между двух львов на набережной Макарова.
Заявки на участие в конференции присылайте до 15 августа 2023 года включительно по электронной почте smu@pushdom.ru.
Все подробности — в информационном письме.
Фотография: Львы на набережной Макарова. 1953 год. Источник: https://pastvu.com.
Repost from Системный Блокъ
«Открытые данные против мракобесия и пренебрежения реальностью»: интервью с Кириллом Маслинским
Кирилл Маслинский — цифровой филолог, руководитель Лаборатории цифровых исследований литературы и фольклора в Пушкинском доме, создатель Детского корпуса и Репозитория открытых данных по русской литературе и фольклору. «Системный Блокъ» узнал у Кирилла, что можно найти в тысячах оцифрованных детских книг, когда в детской литературе было допустимо употреблять слово «какашка», зачем филологам репозиторий открытых данных и может ли этот репозиторий как-то помочь в борьбе с мракобесием и войнами.
Кратко: о чем интервью?
Одна из миссий Лаборатории цифровых исследований литературы и фольклора — воплощать литературные корпуса, которые работают по тому же принципу, что и Национальный корпус русского языка. Например, ДетКорпус из 3000 детских книг и корпус нарративной прозы из 500 романов XIX века.
Ещё одна важная задача — работа над репозиторием открытых данных, литературы и фольклора. Сегодня профессиональный долг исследователя — опубликовать после исследования данные по современным стандартам. Лаборатория помогает это сделать: данные необходимо не только переработать и донести до публики, но и сделать доступными для количественных исследований. Например, в случае с датасетом о бытовании литературных текстов в ГУЛАГе было около восьми раундов правок с авторами, потому что таблица создавалась филологами как «человекочитаемые» данные, а не как машиночитаемые.
На базе этих корпусов и данных проводятся исследования. Одно из них — про репрезентацию телесности и гендерные аспекты в детских текстах. Выяснилось, например, что у мальчиков писатели очень сильно актуализируют затылки, а у девочек — щеки. Это как бы такие отдельно «женские» и «мужские» части тела в текстах детского корпуса. Другое исследование, которое проводил Кирилл, было посвящено контекстному употреблению слова «счастье» в ДетКорпусе.
О том, каким «счастье» в детских книгах было в сталинском СССР и как изменилось к концу хрущевского периода, что такое digital commons, с какими сложностями столкнулись создатели датасета с данными ГУЛАГа и почему сегодня он актуален как никогда — в полном тексте интервью.
Время чтения: 28 минут.
Новая заметка —
в новом формате —
о новой статье наших коллег!
Финальный драфт статьи прикладываем.
