en
Feedback
Литоисчисление

Литоисчисление

Open in Telegram

Лаборатория цифровых исследований литературы и фольклора Пушкинского Дома — это мы. Рассказываем о количественных методах в литературоведении и задаемся экзистенциальными вопросами.

Show more
227
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
!
!

Друзья, в нашей Лаборатории снова открыта вакансия научного сотрудника. Исследовательский фокус Лаборатории — корпусные и количественные исследования в области истории и социологии русской литературы и фольклора. Одна из составляющих нашей миссии — работа над инфраструктурой для цифровых исследований: создание общедоступных корпусов текстов, публикация открытых данных, распространение практики воспроизводимых исследований. Подробнее о нас можно узнать здесь. Один из важных проектов Лаборатории — Корпус русской прозы для детей и юношества XX–XXI вв. Сейчас мы ищем сотрудника, который возьмет на себя роль куратора данных Деткорпуса. В зоне ответственности куратора — регулярное пополнение корпуса, корректировка метаданных, исправление ошибок в данных и метаданных, работа над повышением репрезентативности корпуса. Помимо работы в роли куратора Деткорпуса должность научного сотрудника предполагает самостоятельные исследования по любой тематике в области литературоведения или фольклористики, соотносящейся с исследовательским фокусом Лаборатории. Вакансия объявляется на стартовую должность младшего научного сотрудника, однако для опытных коллег мы можем предложить более высокую должность. В институте действует гибкая система финансового поощрения сотрудников за достижения. Мы ожидаем от кандидатов: * законченное высшее образование (диплом магистра или специалиста), * базовое филологическое образование (весьма желательно), * знание любого языка программирования и готовность совершенствовать свои навыки работы с данными. Кроме того, плюсом будет знакомство с системами контроля версий (git), а также основами статистики. Всех заинтересованных просим писать заведующему Лабораторией Кириллу Александровичу Маслинскому по адресу kmaslinsky@pushdom.ru. Будем благодарны всем, кто решит показать этот пост друзьям и коллегам. ;-)

Друзья, привет. Осталась неделя до окончания срока подачи заявок на участие в «Домашних чтениях». Очень ждём молодых и дигитальных!

photo content

Диалектика канона В Репозитории новый датасет — «Литературные произведения в государственных стандартах и программах для средней школы: 1998–2022 гг.», созданный Андреем Кокориным. Датасет представляет собой роспись литературных произведений, отраженных во всех официальных документах, которые регламентируют преподавание русской литературы в постсоветской школе и определяют необходимый объем знаний по этому предмету. В числе таких документов ГОСТы и примерные образовательные программы средней школы, а также кодификаторы ОГЭ и ЕГЭ по литературе. Анализ данных, собранных Андреем, позволяет, помимо прочего, установить, в какие годы обязательная часть школьной программы по литературе претерпевала ниболее значительные изменения. Ответ — на графике ниже. Датасет Андрея можно считать третьей частью трилогии о школьном литературном каноне, посвященной его юности; детство канона отражено в базе данных «Хрестоматии Российской империи с 1805 по 1912 гг.», а его отрочество — в «Программах по литературе для средней школы с 1919 по 1991 гг.». Лев Толстой, как известно, предполагал описать и четвертую эпоху жизни взрослеющего человека, но события недавнего прошлого оказались трудны для осмысления в рамках автобиографического повествования. Так и мы: умолкаем на время, давая свершиться дистанции между осмысляемым и осмысляющим. #новыйдатасет

Считавшаяся нами безвозвратно утерянной и наконец счастливо обретенная — запись доклада «Неисследованные горизонты силлабо-тоники», прочитанного Борисом Ореховым на семинаре Лаборатории в феврале нынешнего года. Ура!

Тятя! тятя! нейросети притащили… Прочитайте, пожалуйста, следующие строки: Под деревья полночного воздуха. На вечности в отказе вернется, И нашим новым пустотелым платьем На прозрачной подкове просили лета. Как вы думаете, какому писателю подражает в этих стихах нейросеть? а) Осип Мандельштам б) Анна Ахматова в) Марина Цветаева г) Владимир Маяковский Насколько хорошо вы знакомы с творчеством выбранного вами автора? а) Никогда раньше не слышал(а) этого имени. б) Я слышал(а) об этом авторе, но плохо представляю себе его творчество. в) Я знаю этого автора, но процитировать его не могу. г) Я знаком(а) с этим автором и могу процитировать несколько его строк или стихотворений. д) Этот автор хорошо мне знаком, я могу цитировать наизусть многие его стихотворения. Если вы ответили на предложенные вопросы, то имеете практическое представление о недавнем эксперименте Бориса Орехова. Попытавшись выяснить, насколько узнаваемым является стиль того или иного автора, воспроизводимый нейросетью, исследователь обучил LSTM-модель на текстах трех известных русских поэтов, случайным образом отобрал из сочиненного ей материала три четверостишия и предложил 94 студентам-филологам ВШЭ определить, кто мог бы написать эти стихи. Выбор филологов в качестве респондентов не был случайным: профессиональный читатель хорошо знает, что формальная организация текста не менее важна, чем его содержание, и представляет, из каких компонентов может складываться стиль того или иного автора. Кроме того, решение проводить эксперимент на филологах дало возможность усложнить отвечающим задачу выбора и тем самым исключить вероятность случайного успеха модели; таким образом в перечень вариантов ответа попали имена писателей, относящихся к одной эпохе и/или близким литературным направлениям. В каждой из трех частей эксперимента студенты дали от 40 до 50 % правильных ответов. Оказалось также, что точность определения стиля того или иного поэта повышается, если отвечающий хорошо знаком с его стихами и способен цитировать их наизусть. Так респонденты подтвердили не только свою компетентность, но и способность LSTM-модели успешно воспроизводить стиль заданного автора. Не менее важно при этом, что стилистическое качество текста, по-видимому, способно проявляться даже в коротком четверостишии, объема которого внимательным читателям вполне достаточно для верного предположения о его авторстве. Подробнее о ходе и результатах эксперимента можно почитать здесь. Кстати о внимательных читателях: вот и правильный ответ на вопрос, заданный в начале поста —> Осип Мандельштам.

Дорогие юные друзья! Зачеты, экзамены, защиты выпускных работ и все сопутствующие этому тревоги вот-вот останутся позади — и
Дорогие юные друзья! Зачеты, экзамены, защиты выпускных работ и все сопутствующие этому тревоги вот-вот останутся позади — и можно будет подумать о грядущем дне. Веря, что он настанет, приглашаем вас с 28 по 30 сентября 2023 года принять участие в первой молодежной конференции «Домашние чтения», которую организуют молодые ученые Пушкинского Дома. Программа конференции обещает быть интересной. Так, в рамках «Домашних чтений» планируется обсудить методы цифровой гуманитаристики, применяемые в изучении литературы. К дискуссии будут рады присоединиться старшие сотрудники нашей Лаборатории. Приходите и вы: читать и обсуждать доклады, знакомиться и дружить, гулять по запутанным коридорам Пушкинского Дома, сидеть между двух львов на набережной Макарова. Заявки на участие в конференции присылайте до 15 августа 2023 года включительно по электронной почте smu@pushdom.ru. Все подробности — в информационном письме. Фотография: Львы на набережной Макарова. 1953 год. Источник: https://pastvu.com.

«Открытые данные против мракобесия и пренебрежения реальностью»: интервью с Кириллом Маслинским Кирилл Маслинский — цифровой филолог, руководитель Лаборатории цифровых исследований литературы и фольклора в Пушкинском доме, создатель Детского корпуса и Репозитория открытых данных по русской литературе и фольклору. «Системный Блокъ» узнал у Кирилла, что можно найти в тысячах оцифрованных детских книг, когда в детской литературе было допустимо употреблять слово «какашка», зачем филологам репозиторий открытых данных и может ли этот репозиторий как-то помочь в борьбе с мракобесием и войнами. Кратко: о чем интервью? Одна из миссий Лаборатории цифровых исследований литературы и фольклора — воплощать литературные корпуса, которые работают по тому же принципу, что и Национальный корпус русского языка. Например, ДетКорпус из 3000 детских книг и корпус нарративной прозы из 500 романов XIX века. Ещё одна важная задача — работа над репозиторием открытых данных, литературы и фольклора. Сегодня профессиональный долг исследователя — опубликовать после исследования данные по современным стандартам. Лаборатория помогает это сделать: данные необходимо не только переработать и донести до публики, но и сделать доступными для количественных исследований. Например, в случае с датасетом о бытовании литературных текстов в ГУЛАГе было около восьми раундов правок с авторами, потому что таблица создавалась филологами как «человекочитаемые» данные, а не как машиночитаемые. На базе этих корпусов и данных проводятся исследования. Одно из них — про репрезентацию телесности и гендерные аспекты в детских текстах. Выяснилось, например, что у мальчиков писатели очень сильно актуализируют затылки, а у девочек — щеки. Это как бы такие отдельно «женские» и «мужские» части тела в текстах детского корпуса. Другое исследование, которое проводил Кирилл, было посвящено контекстному употреблению слова «счастье» в ДетКорпусе. О том, каким «счастье» в детских книгах было в сталинском СССР и как изменилось к концу хрущевского периода, что такое digital commons, с какими сложностями столкнулись создатели датасета с данными ГУЛАГа и почему сегодня он актуален как никогда — в полном тексте интервью. Время чтения: 28 минут.

Новая заметка — в новом формате — о новой статье наших коллег! Финальный драфт статьи прикладываем.