uz
Feedback
Национальный цифровой архив

Национальный цифровой архив

Kanalga Telegram’da o‘tish

Всё о цифровой архивации, спасении digital-born контента, архивации гибнущих сайтов и иных цифровых объектов. Сайт: https://ruarxive.org/ Чат @ruarxivechat Проект Информационной культуры @infoculture Контакт @ibegtin Иван Бегтин

Ko'proq ko'rsatish
Rossiya187 642Toif belgilanmagan
2 386
Obunachilar
Ma'lumot yo'q24 soatlar
Ma'lumot yo'q7 kunlar
-1230 kunlar
Postlar arxiv
Repost from Ivan Begtin
Я все забываю написать что у меня "висит" давняя задача по сбору метаданных из НЭБа (Национальная электронная библиотека) rus
Я все забываю написать что у меня "висит" давняя задача по сбору метаданных из НЭБа (Национальная электронная библиотека) rusneb.ru Там, с одной стороны, почти 5.5 миллионов материалов, а с другой стороны нет открытого API или массовой выгрузки (bulk download), а для многих гуманитарных/окологуманитарных проектов нужны метаданные оттуда. Как вы понимаете написать сейчас парсер с помощью ИИ несложно, сложно и требует времени на то чтобы собрать все имеющиеся там метаданные в сохранить их. Поэтому нужен не просто парсер НЭБа, а кто-то кто с его помощью сможет все метаданные по всем публикациям собрать и сохранить в сжатый/сжатые JSON lines файлы и передать их. Хорошо если есть волонтер под такое, а если кто-то готов, но за деньги, то напишите мне о том сколько денег и сколько времени нужно - если ценник не безумный я их найду. Что необходимо собрать: все метаданные с карточки описания каждой публикации включая автора, название, описание, дату и место публикации, тематики, каждый атрибут блока "Детальная информация", запись MARC21, ссылку на PDF файл. Сами файлы выкачивать не нужно! Систематизировать атрибуты метаданных и сделать также файл Parquet с ними будет большим плюсом. Итоговый датасет будет открытым, выложу его на одном из порталов открытых данных. #opencall #datasets

Repost from Ivan Begtin
В рубрике закрытых данных в РФ из открытого доступа исчезли данные судебной статистики с сайта Судебного департамента. По ссы
В рубрике закрытых данных в РФ из открытого доступа исчезли данные судебной статистики с сайта Судебного департамента. По ссылке теперь сообщение Информация временно не доступна. Доступна страница в Интернет-архиве с последней копией 7 марта 2026 года и пока еще работают прямые ссылки на Excel файлы. Но, возможно, ненадолго. Это данные небольшого объема, но значимые для исследователей правоохранительной системы России и журналистов. #opendata #closeddata #russia #courts

Repost from Ivan Begtin
В рубрике как это устроено у них в Ирландии позавчера национальный архив опубликовал данные переписи 1926 года и эти данные м
+2
В рубрике как это устроено у них в Ирландии позавчера национальный архив опубликовал данные переписи 1926 года и эти данные можно посмотреть наглядно на карте или в виде огромного архива 2 972 451 поименных записей (чуть менее 3 миллионов файлов и переписных карточек) Как повезло ирландцам, столько исторических материалов. Есть же страны с работающими архивами и статслужбами. Для полного счастья нехватает только получения этих данных как датасета, но его несложно создать. #opendata #ireland #census

Ведомости пишут что Более 50% библиотечных фондов может быть изъято при буквальной трактовке законов из за закона об иноагентах и из-за признания многих организаций как нежелательных. Пора ли начинать архивировать такую литературу или исходим из того что она не исчезает, а только недоступна в России? Но в других странах, не-российских онлайн библиотеках и в пиратских библиотеках эта литература останется? Практически все эти книги находятся под авторским правом и их распространение почти наверняка нарушит копирайты и многие архивные проекты будут не готовы хранить такие материалы именно по причине нарушения авторского права и рисков блокировки в России. #questions #digitalpreservation

Какие альтернативные способы трансляции информации канала ruarxive стоит добавить на случай блокировки Telegram? (можно несколько ответов)
Anonymous voting

Несмотря последние блокировки Telegram в России этот телеграм канал Ruarxive остается и никуда не исчезнет, на других российских ресурсах вроде VK или MAX его клона не будет в виду непредсказуемости их цензурных правил даже при нейтральности ведения архивных проектов, риски цензуры в их отношении всегда присутствуют. Также все заархивированные сайты организаций и проектов заблокированных в РФ сохраняются и ух удаление не планируется, если какое-либо давление на проект возникнет, то архивные копии сайтов останутся, в любом случае, на ресурсах Интернет Архива (archive.org). Для тех же кому будет сложно читать далее материалы в телеграм думаем над тем как сделать альтернативную площадку для сообщества. Как варианты: - рассылка на substack и обсуждения в комментариях - онлайн форум Если будут другие идеи и мысли, пишите в чате @ruarxivechat Следующей публикацией сделаю опрос по тому где развернуть альтернативную площадку для телеграм канала. #telegram #digitalpreservation #archival

Repost from Ivan Begtin
Хронология удаления администрацией Дональда Трампа данных из открытого доступа опубликовано в журнале Passport Общества истор
Хронология удаления администрацией Дональда Трампа данных из открытого доступа опубликовано в журнале Passport Общества историков Американских внешних отношений (SHAFR) Подозреваю что список будет больше, здесь лишь часть систематизации. Единственные исключения там это приказы о раскрытии данных об убийстве Кеннеди и раскрытие данных о Джеффри Эпштейне. И, кстати, как я и предполагал США официально вышли из Open Government Partnership (OGP). Это не означает закрытие проектов по открытости внутри США, они всегда были отвязаны от международных обязательств, кроме малого числа случаев. Это означает, в первую очередь, прекращение финансирования OGP со стороны США и потенциальный кризис организации если страны ЕС и др. не компенсируют выпадающие средства. #opendata #closedata #trump #usa

Для тех кто интересуется где можно найти материалы многих, в том числе закрытых, Wiki проектов в мире. Команда Wikiteam из Ar
Для тех кто интересуется где можно найти материалы многих, в том числе закрытых, Wiki проектов в мире. Команда Wikiteam из ArchiveTeam регулярно архивирует вики сайты и результаты их архивации доступны в одноименной коллекции Wikiteam и Интернет Архиве. Контент сохраняется в форматах XML и в виде архивов с изображениями. Для тех кто хотел бы архивировать сайты на базе MediaWiki самостоятельно, существует открытый код инструмента wikiteam3. Учитывая что контент вики сайтов публикуется в виде дампов в XML пригодных для машинной обработки, можно сказать что эта коллекция в Интернет Архиве не только каталог архивов, но и каталог открытых данных. Важно что многие исчезнувшие русскоязычные вики проекты и те что могут исчезнуть в очень скором времени могут быть найдены именно там. #opendata #digitalpreservation #wiki #archiveorg

Пишут что Microsoft продвинулись в Project Silica с сохранением данных в стекле и обещают что потенциально это может позволит
Пишут что Microsoft продвинулись в Project Silica с сохранением данных в стекле и обещают что потенциально это может позволить сохранять данные до 10 тысяч лет. На кусок стекла 12x12x0.2 сантиметра записали 4.8TB данных. Запись идет долго, около 150 часов. Про то когда это будет доступно для кого-то кроме исследователей Microsoft пока нет новостей. #storage #digitalpreservation

Repost from БлоGнот
ЦРУ закрыло The World Factbook — справочник по странам мира, который существовал с 1971 года и был одним из самых полезных публичных ресурсов агентства. Никаких объяснений не последовало. Решение выглядит странно не только по сути, но и по исполнению. Все страницы сайта, включая архивы предыдущих версий, теперь перенаправляют на страницу с объявлением о закрытии. При этом Factbook всегда распространялся как public domain — ничто не мешало оставить архивную версию с пометкой о прекращении обновлений. Саймон Уиллисон скачал последний официальный архив за 2020 год и выложил его на GitHub Pages. Полные архивы также сохранились в Internet Archive. https://simonwillison.net/2026/Feb/5/the-world-factbook/#atom-everything

Где узнать больше о цифровых архивах, цифровой архивации, инструментах, курсах и так далее? Подборка каталогов ресурсов: - Awesome Digital Preservation - список инструментов и ресурсов посвященных цифровой архивации, преимущественно ссылки на открытый код и открытые сервисы и наиболее известные платформы (от Ruarxive) - Awesome Digital Preservation аналогичный список от Digipress сообщества по цифровой архивации, множество ссылок на существующие инструменты и сервисы - Awesome Web Archiving - список инструментов и ресурсов по веб-архивации, созданы и поддерживается Международным консорциумом сохранения интернета (IIPC) - ArchiveTeam Wiki большой вики проект от команды ArchiveTeam посвященный веб архивации и архивационным кампаниям для сохранения гибнущих онлайн ресурсов. - База знания Ruarxive база знаний по цифровой и веб архивации на русском языке от проекта Ruarxive, инструкции по использованию инструментов и сервисов #webarchives #digitalpreservation #readings

Anna’s Archive решила создать резервную копию Spotify 🎵Проектом заархивированы метаданные и музыкальные файлы платформы Spot
Anna’s Archive решила создать резервную копию Spotify 🎵Проектом заархивированы метаданные и музыкальные файлы платформы Spotify. Архив занимает ~300 ТБ, распространяется через торренты и включает около 86 миллионов музыкальных файлов Это первый подобный открытый «архив сохранения» музыки такого масштаба, доступный для зеркалирования и резервирования любым пользователем с достаточным дисковым пространством. https://annas-archive.li/blog/backing-up-spotify.html 🏴‍☠️ Anna’s Archive - некоммерческая метапоисковая система для теневых библиотек с открытым исходным кодом, созданная командой анонимных архивистов Pirate Library Mirror и запущенная как прямой ответ на усилия правоохранительных органов по закрытию Z-Library в 2022 году. Проект ставит себе целью «каталогизацию всех существующих книг и отслеживание прогресса человечества на пути к тому, чтобы сделать все эти книги легкодоступными в цифровой форме». В статье «Критическое окно теневых библиотек» они объяснили , что делают это потому, что текст обладает самой высокой плотностью информации. Но их миссия (сохранение знаний и культуры человечества) не делает различий между типами носителей. Иногда появляется возможность работать вне текстовой среды. Копирование Spotify - это именно такой случай.

Repost from Ivan Begtin
К вопросу про российский мессенжер Max, помимо достаточно очевидных проблем с тем что он "как бы государственный, но не государственный", с его довольно бесцеремонным продвижением используя административный ресурс и массой других уже написанных многими проблем, я подниму ещё одну тему о которой не пишут. Это архивация. В сравнении с телеграмом у Max'а есть два очень существенных отличия: 1. Отсутствует возможность просматривать содержание каналов онлайн без авторизации 2. Отсутствует возможность делать data takeout хотя бы для своих данных, а в идеале и для любых каналов и чатов Первое влияет на то что содержание из Max не индексируется поисковиками и Интернет Архивом (они собирают только общедоступные матералы доступные через https/http). К примеру, в телеграм можно смотреть без авторизации, вот так выглядит там мой телеграм канал https://t.me/s/begtin Второе на то что невозможно сделать архив ни своих чатов, ни своих каналов, ни читаемых каналов. Просто не предусмотрено. В итоге Max - это закрытое контролируемое не архивируемое пространство где даже чтение постов прошедших авторизацию каналов идет только под контролем (только после авторизации) даже в веб клиенте. Вопрос остается в том будет ли там хоть что-то полезное, не продублированное в Телеграм'е? Насколько реально велик риск блокировки телеграма в ближайшее время и переход части авторов каналов туда? Если велик, то видимо надо заморачиваться придумыванием организации архивации материалов в Max'е для чего документированного API не наблюдается и нужен дотошный разработчик готовый такой инструмент разработать. #digitalpreservation #thoughts

Большое обновление сайта Ruarxive.org. Добавили много новых статей, лучше структурировали сам сайт, добавили поиск, обновили
Большое обновление сайта Ruarxive.org. Добавили много новых статей, лучше структурировали сам сайт, добавили поиск, обновили до последней версии Docusaurus'а (движка на котором сайт построен). В том числе можно обратить внимание на статьи: - Быстрый старт: архивация за 5 минут - Как создать цифровой архив сайтов - Экстренная архивация: когда счет идет на часы - Курс по цифровой архивации И многие другие, включая статьи по использованию конкретных инструментов и обзоры наиболее известных сервисов. Новое содержимое сайта собрано из публикаций в телеграм канале @ruarxive, других публикаций об исчезновении интернет-ресурсов, презентаций курса по цифровой архивации и других материалов. Среди других изменений: - обновлена главная страница для большей понятности содержания сайта - добавлен поиск по контенту Да, структура сайта ещё не идеальна, а поскольку многие статьи преобразованы из презентаций, то там больше буллетов чем текста, и они ещё будут обновляться. Если у Вы найдете какие-либо ошибки, если возникли идеи или если Вы готовы дополнить и расшрить материалы, пишите в @ruarxivechat и в issues на github P.S. Сейчас в работе систематизация всех собранных ранее сайтов и других результатов архивных кампаний. Все это будет собрано в единый набор данных с базой архивов и далее доступно или через специальный интерфейс или на hubofdata.ru (там уже есть раздел с архивами сайтов и другими архивами). #digitalpreservation #webarchives #knowledgebase

Объявлен приём заявок на Премию «Открытый доступ к данным в гуманитарных науках» АНО «Инфокультура» приглашает студентов, асп
Объявлен приём заявок на Премию «Открытый доступ к данным в гуманитарных науках» АНО «Инфокультура» приглашает студентов, аспирантов, преподавателей, исследователей и сотрудников вузов и научных организаций принять участие в конкурсе проектов, способствующих развитию открытой науки в гуманитарной сфере. 📌 Что можно подать: – результаты научных исследований, – цифровые проекты, связанные с гуманитарными дисциплинами, – дипломные и курсовые проекты, – иные работы, представляющие гуманитарные данные в открытом доступе. 📚 Номинации Премии: • История • Филология • Культура • Искусство • Иные гуманитарные науки Номинировать проект может как сам автор (или коллектив авторов), так и любой человек или организация, знакомые с проектом. Год публикации работы не имеет значения. 🏅 Лауреаты получат памятные награды, сертификаты и специальные призы от организаторов и партнёров Премии. 📝 Приём заявок уже открыт! 🔗 https://humawards.ru #opendata #openaccess #humanitarian #contest

Repost from Ivan Begtin
Кстати, как человек любящий не только цифровые архивы, но и исторические книжки тоже не могу не упомянуть про очень интересны
+1
Кстати, как человек любящий не только цифровые архивы, но и исторические книжки тоже не могу не упомянуть про очень интересный проект от Банка России с виртуальной выставкой по истории Банка. Мало какие центральные банки в мире делают такие проекты, так что это хорошо что такое появляется (если знаете аналогичные проекты в других странах, то напишите плз). Я знаю только Federal Reserve History в США. Но интересность материалов и их доступность омрачает то что материалы есть, а можно ли их использовать? В основном нет. Вот самые очевидные проблемы: 1. Нет нигде явным образом указанных условий использования материалов. Можно ли использовать их на своём сайте? Можно ли на их основе писать учебные материалы? Можно ли цитировать и тд. Понятно что у разных материалов может быть разный статус, но не надо забывать насколько это важно можно ли использовать такие материалы. 2. Просмотр материалов только на сайте - это никуда не годится. Возможность скачать исторические книжки нужна для бесконечного числа задач: внутренних библиотек университетов, таких проектов как Цифровой архив госфинансов и госуправления, возможность почитать книги оффлайн, возможность обучить на них ИИ, возможность создать наборы данных и многое другое. Если делать хорошо, то делать до конца, не надо останавливаться на полпути. #digitalpreservation #books #finances #digitalhumanities #openaccess

Repost from Ivan Begtin
Говоря о исчезающих материалах/данных/информации в России я как-то ранее упускал что творится в российских регионах, а зря. И
Говоря о исчезающих материалах/данных/информации в России я как-то ранее упускал что творится в российских регионах, а зря. Интернет архив уже более чем 3 года не охватывает огромное число региональных и муниципальных сайтов, например, сайт администрации г. Белгорода beladm.ru не индексировался с конца марта 2022 года. Но это только половина беды, сейчас этот сайт явно и как-то очень криво мигрировали на ГосВеб в поддомене Госуслуг да так что его новый адрес должен быть beladm.gosuslugi.ru, а редирект идет на belgorod-r31.gosweb.gosuslugi.ru что выглядит как-то, через одно место. Старый сайт, конечно же, недоступен, государственного архива сайтов в РФ нет, со старого сайта материалы перенесены совершенно точно не все. Масштабы потерь пока сложно измерить, скорее всего они весьма велики. #russia #opendata #digitalpreservation #webarchives #closeddata

Repost from Ivan Begtin
The Wayback Machine’s snapshots of news homepages plummet after a “breakdown” in archiving projects заметка в Nieman Labs о том что с мая 2025 года в Интернет Архиве наблюдается сбой из-за которого резко сократилась архивация как минимум главных страниц ведущих медиа изданий в мире. Иногда вплоть до того что страницы не сохранялись вовсе. Марк Грехэм из Интернет архива это подвердил и упомянул что этот сбой уже был исправлен. Основная мысль в том насколько все в мире зависят от Интернет Архива при том что у него нет ни стабильного финансирования, ни серьёзных финансовых ресурсов или эндаумента позволяющего не думать о фандрайзинге постоянно. Все национальные инициативы в нац архивах и библиотеках, крупнейшие из них в США и во Франции, многократно, думаю что на два порядка не дотягивают по масштабам. При этом не все знают и понимают что интернет архив охватывает далеко не всё. Чем меньше ссылок на конкретную страницу на сайте тем меньше вероятность что её актуальная версия есть в индексе Интернет Архива, туда же не попадают большая часть видеозаписей, сжатые файлы (zip/rar/gz и др.), файлы большого объёма, содержание динамически подгружающихся сайтов и многое другое. #webarchives #digitalpreservation #data

Рукопись как данные: что нужно исследователю Что важно учесть в процессе оцифровки архивных документов и подготовке электронн
Рукопись как данные: что нужно исследователю Что важно учесть в процессе оцифровки архивных документов и подготовке электронных публикаций? Какая аудитория у подобных проектов и какие у них потребности в изучении архивов? Приглашаем принять участие в опросе о практиках подготовки, организации доступа и публикации материалов и данных архивов в цифровой среде. Опрос проводится студентами магистратуры НИУ ВШЭ «Цифровые методы в гуманитарных науках». Пройти опрос: ссылка.

Новый сайт журнала «Квант» — https://www.kvant.digital/ ! 7 октября 2025 года, Москва. Лаборатория популяризации и пропаганды математики Математического института им. В. А. Стеклова РАН запустила новый современный сайт журнала «Квант» со сканами высокого качества и возможностями поиска: https://www.kvant.digital/ . Журнала, в котором собраны бесценные материалы, журнала, тиражи которого в 1970-х годах доходили до 385 000 экземпляров в месяц (история журнала, неразрывно связанная с историей нашей страны, представлена в разделе «История»). Старые номера журнала отсканированы заново, по возможности исправлены типографские огрехи. Сайт позволяет искать по автоматически распознанным изображениям представленных номеров журнала. Попробуйте на странице «Архив номеров» ввести интересующее вас словосочетание. В качестве примера: кубик Рубика. По клику на номер с жёлтым фоном открывается страница номера с подсвеченными найденными словами. А если вы школьником отправляли решения в «Задачник „Кванта“», то можете попробовать найти свою фамилию в списках читателей, приславших решения. Возможности нового сайта кратко описаны на странице «О сайте». Цель проекта: представить уникальные материалы журнала в удобном для пользователя виде – в том числе, в виде выверенных html/TeX-текстов. В качестве примера – первые номера журнала и новый номер, некоторые другие материалы. Полистать журнал — занятие увлекательное, затягивающее и полезное: находишь для себя много нового интересного. Предлагаем пользователям совместить изучение материалов с участием в создании html-версии опубликованных материалов: представить в формате TeX понравившиеся тексты. В частности, это может быть школьный проект или студенческая практика. Так постепенно все статьи будут переведены в формат, которым действительно удобно пользоваться, в том числе, с мобильных устройств. Неизменная с 1970 года надпись на обложке журнала «Квант»: научно-популярный физико-математический журнал. Интересных открытий!