gram news
Аватар канала Национальный цифровой архив

Национальный цифровой архив

@ruarxive

Всё о цифровой архивации, спасении digital-born контента, архивации гибнущих сайтов и иных цифровых объектов. Сайт: https://ruarxive.org/ Чат @ruarxivechat Проект Информационной культуры @infoculture Контакт @ibegtin Иван Бегтин

2,390подписчиков

Открыть канал

Последние посты

  • Национальный цифровой архив

    28 авг., 07:23изменён

    В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ».В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в
    TelegramНациональный цифровой архив in Обсуждаем цифровую архивациюВ России стартовали президентские выборы. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио…
    9,02011321Открыть в Telegram
  • Национальный цифровой архив

    8 авг., 18:20

    переслано из @begtin

    Для тех кому интересна веб архивация, свежий релиз моего хобби инструмента metawarc для глубокого анализа WARC архивов используемых в Интернет Архиве и многочисленных национальных и частных веб-архивных инициативах. Инструмент позволяет индексировать веб-архивы для глубокого анализа и задач data science, а также извлекать метаданные из документов, изображений, видеофайлов и иных имеющих метаданные внутри файлов.В версию 2.0 добавлена возможность проигрывать веб-архивы через библиотеку pywb и исправлены многие ошибки.Инструмент может быть полезен для всех кто интересуется цифровым сохранением и OSINT, поскольку эти метаданные полезны при анализе слепков веб-сайтов.Внутри работа с данными идет с использованием DuckDB с хранением метаданных в файлах Parquet. DuckDB выступает как универсальный инструмент запросов для аналитических задач, дедубликации и тд.#opensourc #webarchives
    GitHubGitHub - ruarxive/metawarc: metawarc: a command-line tool for metadata extraction from files from WARC (Web ARChive)metawarc: a command-line tool for metadata extraction from files from WARC (Web ARChive) - ruarxive/metawarc
  • Национальный цифровой архив

    28 мая, 12:11

    переслано из @begtin

    Я все забываю написать что у меня "висит" давняя задача по сбору метаданных из НЭБа (Национальная электронная библиотека) rusneb.ruТам, с одной стороны, почти 5.5 миллионов материалов, а с другой стороны нет открытого API или массовой выгрузки (bulk download), а для многих гуманитарных/окологуманитарных проектов нужны метаданные оттуда.Как вы понимаете написать сейчас парсер с помощью ИИ несложно, сложно и требует времени на то чтобы собрать все имеющиеся там метаданные в сохранить их.Поэтому нужен не просто парсер НЭБа, а кто-то кто с его помощью сможет все метаданные по всем публикациям собрать и сохранить в сжатый/сжатые JSON lines файлы и передать их.Хорошо если есть волонтер под такое, а если кто-то готов, но за деньги, то напишите мне о том сколько денег и сколько времени нужно - если ценник не безумный я их найду.Что необходимо собрать: все метаданные с карточки
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
  • Национальный цифровой архив

    21 апр., 16:10

    переслано из @begtin

    В рубрике закрытых данных в РФ из открытого доступа исчезли данные судебной статистики с сайта Судебного департамента. По ссылке теперь сообщение Информация временно не доступна. Доступна страница в Интернет-архиве с последней копией 7 марта 2026 года и пока еще работают прямые ссылки на Excel файлы. Но, возможно, ненадолго.Это данные небольшого объема, но значимые для исследователей правоохранительной системы России и журналистов.#opendata #closeddata #russia #courts
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    1,0105331Открыть в Telegram
  • Национальный цифровой архив

    20 апр., 14:22

    переслано из @begtin

    В рубрике как это устроено у них в Ирландии позавчера национальный архив опубликовал данные переписи 1926 года и эти данные можно посмотреть наглядно на карте или в виде огромного архива 2 972 451 поименных записей (чуть менее 3 миллионов файлов и переписных карточек)Как повезло ирландцам, столько исторических материалов. Есть же страны с работающими архивами и статслужбами.Для полного счастья нехватает только получения этих данных как датасета, но его несложно создать.#opendata #ireland #census
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
  • Национальный цифровой архив

    16 апр., 10:28

    Ведомости пишут что Более 50% библиотечных фондов может быть изъято при буквальной трактовке законов из за закона об иноагентах и из-за признания многих организаций как нежелательных.Пора ли начинать архивировать такую литературу или исходим из того что она не исчезает, а только недоступна в России? Но в других странах, не-российских онлайн библиотеках и в пиратских библиотеках эта литература останется?Практически все эти книги находятся под авторским правом и их распространение почти наверняка нарушит копирайты и многие архивные проекты будут не готовы хранить такие материалы именно по причине нарушения авторского права и рисков блокировки в России.#questions #digitalpreservation
    2,5707621Открыть в Telegram
  • Национальный цифровой архив

    2 апр., 14:30

    2,340опрос7Открыть в Telegram
  • Национальный цифровой архив

    2 апр., 09:05

    Несмотря последние блокировки Telegram в России этот телеграм канал Ruarxive остается и никуда не исчезнет, на других российских ресурсах вроде VK или MAX его клона не будет в виду непредсказуемости их цензурных правил даже при нейтральности ведения архивных проектов, риски цензуры в их отношении всегда присутствуют.Также все заархивированные сайты организаций и проектов заблокированных в РФ сохраняются и ух удаление не планируется, если какое-либо давление на проект возникнет, то архивные копии сайтов останутся, в любом случае, на ресурсах Интернет Архива (archive.org).Для тех же кому будет сложно читать далее материалы в телеграм думаем над тем как сделать альтернативную площадку для сообщества.Как варианты: - рассылка на substack и обсуждения в комментариях - онлайн форумЕсли будут другие идеи и мысли, пишите в чате @ruarxivechatСледующей публикацией сделаю опрос по тому
    911221763Открыть в Telegram
  • Национальный цифровой архив

    31 мар., 09:51

    переслано из @begtin

    Хронология удаления администрацией Дональда Трампа данных из открытого доступа опубликовано в журнале Passport Общества историков Американских внешних отношений (SHAFR)Подозреваю что список будет больше, здесь лишь часть систематизации. Единственные исключения там это приказы о раскрытии данных об убийстве Кеннеди и раскрытие данных о Джеффри Эпштейне.И, кстати, как я и предполагал США официально вышли из Open Government Partnership (OGP). Это не означает закрытие проектов по открытости внутри США, они всегда были отвязаны от международных обязательств, кроме малого числа случаев. Это означает, в первую очередь, прекращение финансирования OGP со стороны США и потенциальный кризис организации если страны ЕС и др. не компенсируют выпадающие средства.#opendata #closedata #trump #usa
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
  • Национальный цифровой архив

    30 мар., 11:48

    Для тех кто интересуется где можно найти материалы многих, в том числе закрытых, Wiki проектов в мире. Команда Wikiteam из ArchiveTeam регулярно архивирует вики сайты и результаты их архивации доступны в одноименной коллекции Wikiteam и Интернет Архиве.Контент сохраняется в форматах XML и в виде архивов с изображениями.Для тех кто хотел бы архивировать сайты на базе MediaWiki самостоятельно, существует открытый код инструмента wikiteam3.Учитывая что контент вики сайтов публикуется в виде дампов в XML пригодных для машинной обработки, можно сказать что эта коллекция в Интернет Архиве не только каталог архивов, но и каталог открытых данных.Важно что многие исчезнувшие русскоязычные вики проекты и те что могут исчезнуть в очень скором времени могут быть найдены именно там.#opendata #digitalpreservation #wiki #archiveorg
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    4,2109542Открыть в Telegram
  • Национальный цифровой архив

    24 февр., 15:28

    Пишут что Microsoft продвинулись в Project Silica с сохранением данных в стекле и обещают что потенциально это может позволить сохранять данные до 10 тысяч лет. На кусок стекла 12x12x0.2 сантиметра записали 4.8TB данных. Запись идет долго, около 150 часов.Про то когда это будет доступно для кого-то кроме исследователей Microsoft пока нет новостей.#storage #digitalpreservation
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    1,37015112Открыть в Telegram
  • Национальный цифровой архив

    5 февр., 12:18

    переслано из @blognot

    ЦРУ закрыло The World Factbook — справочник по странам мира, который существовал с 1971 года и был одним из самых полезных публичных ресурсов агентства. Никаких объяснений не последовало.Решение выглядит странно не только по сути, но и по исполнению. Все страницы сайта, включая архивы предыдущих версий, теперь перенаправляют на страницу с объявлением о закрытии. При этом Factbook всегда распространялся как public domain — ничто не мешало оставить архивную версию с пометкой о прекращении обновлений.Саймон Уиллисон скачал последний официальный архив за 2020 год и выложил его на GitHub Pages. Полные архивы также сохранились в Internet Archive.https://simonwillison.net/2026/Feb/5/the-world-factbook/#atom-everything
    Simon Willison’s WeblogSpotlighting The World Factbook as We Bid a Fond FarewellSomewhat devastating news today from CIA: One of CIA’s oldest and most recognizable intelligence publications, The World Factbook, has sunset. There's not even a hint as to why they decided …
  • Национальный цифровой архив

    20 янв., 08:00

    Где узнать больше о цифровых архивах, цифровой архивации, инструментах, курсах и так далее? Подборка каталогов ресурсов: - Awesome Digital Preservation - список инструментов и ресурсов посвященных цифровой архивации, преимущественно ссылки на открытый код и открытые сервисы и наиболее известные платформы (от Ruarxive) - Awesome Digital Preservation аналогичный список от Digipress сообщества по цифровой архивации, множество ссылок на существующие инструменты и сервисы - Awesome Web Archiving - список инструментов и ресурсов по веб-архивации, созданы и поддерживается Международным консорциумом сохранения интернета (IIPC) - ArchiveTeam Wiki большой вики проект от команды ArchiveTeam посвященный веб архивации и архивационным кампаниям для сохранения гибнущих онлайн ресурсов. - База знания Ruarxive база знаний по цифровой и веб архивации на русском языке от проекта Ruarxive, инструкции по
    5,5207522Открыть в Telegram
  • Национальный цифровой архив

    22 дек. 2025 г., 11:17

    переслано из @piratepartyru

    Anna’s Archive решила создать резервную копию Spotify🎵Проектом заархивированы метаданные и музыкальные файлы платформы Spotify. Архив занимает ~300 ТБ, распространяется через торренты и включает около 86 миллионов музыкальных файловЭто первый подобный открытый «архив сохранения» музыки такого масштаба, доступный для зеркалирования и резервирования любым пользователем с достаточным дисковым пространством.https://annas-archive.li/blog/backing-up-spotify.html🏴‍☠️ Anna’s Archive - некоммерческая метапоисковая система для теневых библиотек с открытым исходным кодом, созданная командой анонимных архивистов Pirate Library Mirror и запущенная как прямой ответ на усилия правоохранительных органов по закрытию Z-Library в 2022 году. Проект ставит себе целью «каталогизацию всех существующих книг и отслеживание прогресса человечества на пути к тому, чтобы сделать все эти книги
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    1,63023134311Открыть в Telegram
  • Национальный цифровой архив

    15 дек. 2025 г., 09:23

    переслано из @begtin

    К вопросу про российский мессенжер Max, помимо достаточно очевидных проблем с тем что он "как бы государственный, но не государственный", с его довольно бесцеремонным продвижением используя административный ресурс и массой других уже написанных многими проблем, я подниму ещё одну тему о которой не пишут.Это архивация. В сравнении с телеграмом у Max'а есть два очень существенных отличия: 1. Отсутствует возможность просматривать содержание каналов онлайн без авторизации 2. Отсутствует возможность делать data takeout хотя бы для своих данных, а в идеале и для любых каналов и чатовПервое влияет на то что содержание из Max не индексируется поисковиками и Интернет Архивом (они собирают только общедоступные матералы доступные через https/http). К примеру, в телеграм можно смотреть без авторизации, вот так выглядит там мой телеграм канал https://t.me/s/begtinВторое на то что невозможно
    1,1507742Открыть в Telegram
  • Национальный цифровой архив

    15 дек. 2025 г., 05:41

    Большое обновление сайта Ruarxive.org. Добавили много новых статей, лучше структурировали сам сайт, добавили поиск, обновили до последней версии Docusaurus'а (движка на котором сайт построен).В том числе можно обратить внимание на статьи: - Быстрый старт: архивация за 5 минут - Как создать цифровой архив сайтов - Экстренная архивация: когда счет идет на часы - Курс по цифровой архивацииИ многие другие, включая статьи по использованию конкретных инструментов и обзоры наиболее известных сервисов.Новое содержимое сайта собрано из публикаций в телеграм канале @ruarxive, других публикаций об исчезновении интернет-ресурсов, презентаций курса по цифровой архивации и других материалов.Среди других изменений: - обновлена главная страница для большей понятности содержания сайта - добавлен поиск по контентуДа, структура сайта ещё не идеальна, а поскольку многие статьи преобразованы из
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    2,540851Открыть в Telegram
  • Национальный цифровой архив

    11 нояб. 2025 г., 12:52

    переслано из @infoculture

    Объявлен приём заявок на Премию «Открытый доступ к данным в гуманитарных науках»АНО «Инфокультура» приглашает студентов, аспирантов, преподавателей, исследователей и сотрудников вузов и научных организаций принять участие в конкурсе проектов, способствующих развитию открытой науки в гуманитарной сфере.📌 Что можно подать: – результаты научных исследований, – цифровые проекты, связанные с гуманитарными дисциплинами, – дипломные и курсовые проекты, – иные работы, представляющие гуманитарные данные в открытом доступе.📚 Номинации Премии: • История • Филология • Культура • Искусство • Иные гуманитарные наукиНоминировать проект может как сам автор (или коллектив авторов), так и любой человек или организация, знакомые с проектом. Год публикации работы не имеет значения.🏅 Лауреаты получат памятные награды, сертификаты и специальные призы от организаторов и партнёров Премии.
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    1,100554Открыть в Telegram
  • Национальный цифровой архив

    1 нояб. 2025 г., 14:18

    переслано из @begtin

    Кстати, как человек любящий не только цифровые архивы, но и исторические книжки тоже не могу не упомянуть про очень интересный проект от Банка России с виртуальной выставкой по истории Банка. Мало какие центральные банки в мире делают такие проекты, так что это хорошо что такое появляется (если знаете аналогичные проекты в других странах, то напишите плз). Я знаю только Federal Reserve History в США.Но интересность материалов и их доступность омрачает то что материалы есть, а можно ли их использовать? В основном нет.Вот самые очевидные проблемы: 1. Нет нигде явным образом указанных условий использования материалов. Можно ли использовать их на своём сайте? Можно ли на их основе писать учебные материалы? Можно ли цитировать и тд. Понятно что у разных материалов может быть разный статус, но не надо забывать насколько это важно можно ли использовать такие материалы. 2. Просмотр
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    1,180641Открыть в Telegram
  • Национальный цифровой архив

    27 окт. 2025 г., 13:35

    переслано из @begtin

    Говоря о исчезающих материалах/данных/информации в России я как-то ранее упускал что творится в российских регионах, а зря. Интернет архив уже более чем 3 года не охватывает огромное число региональных и муниципальных сайтов, например, сайт администрации г. Белгорода beladm.ru не индексировался с конца марта 2022 года.Но это только половина беды, сейчас этот сайт явно и как-то очень криво мигрировали на ГосВеб в поддомене Госуслуг да так что его новый адрес должен быть beladm.gosuslugi.ru, а редирект идет на belgorod-r31.gosweb.gosuslugi.ru что выглядит как-то, через одно место.Старый сайт, конечно же, недоступен, государственного архива сайтов в РФ нет, со старого сайта материалы перенесены совершенно точно не все.Масштабы потерь пока сложно измерить, скорее всего они весьма велики.#russia #opendata #digitalpreservation #webarchives #closeddata
    Иллюстрация к посту канала Национальный цифровой архивИллюстрация к посту канала Национальный цифровой архив
    9761041Открыть в Telegram
  • Национальный цифровой архив

    24 окт. 2025 г., 11:12

    переслано из @begtin

    The Wayback Machine’s snapshots of news homepages plummet after a “breakdown” in archiving projects заметка в Nieman Labs о том что с мая 2025 года в Интернет Архиве наблюдается сбой из-за которого резко сократилась архивация как минимум главных страниц ведущих медиа изданий в мире. Иногда вплоть до того что страницы не сохранялись вовсе. Марк Грехэм из Интернет архива это подвердил и упомянул что этот сбой уже был исправлен.Основная мысль в том насколько все в мире зависят от Интернет Архива при том что у него нет ни стабильного финансирования, ни серьёзных финансовых ресурсов или эндаумента позволяющего не думать о фандрайзинге постоянно. Все национальные инициативы в нац архивах и библиотеках, крупнейшие из них в США и во Франции, многократно, думаю что на два порядка не дотягивают по масштабам.При этом не все знают и понимают что интернет архив охватывает далеко не всё. Чем
    Nieman LabThe Wayback Machine’s snapshots of news homepages plummet after a “breakdown” in archiving projectsBetween May and October 2025, homepage snapshots fell by 87% across 100 news publications.