gram news
Национальный цифровой архив channel avatar

Национальный цифровой архив

@ruarxive

Всё о цифровой архивации, спасении digital-born контента, архивации гибнущих сайтов и иных цифровых объектов. Сайт: https://ruarxive.org/ Чат @ruarxivechat Проект Информационной культуры @infoculture Контакт @ibegtin Иван Бегтин

2,390subscribers

Open the Channel

Latest posts

  • Национальный цифровой архив

    28 Aug, 07:23edited

    В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ».В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в
    TelegramНациональный цифровой архив in Обсуждаем цифровую архивациюВ России стартовали президентские выборы. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио…
    9,02011321Open in Telegram
  • Национальный цифровой архив

    8 Aug, 18:20

    forwarded from @begtin

    Для тех кому интересна веб архивация, свежий релиз моего хобби инструмента metawarc для глубокого анализа WARC архивов используемых в Интернет Архиве и многочисленных национальных и частных веб-архивных инициативах. Инструмент позволяет индексировать веб-архивы для глубокого анализа и задач data science, а также извлекать метаданные из документов, изображений, видеофайлов и иных имеющих метаданные внутри файлов.В версию 2.0 добавлена возможность проигрывать веб-архивы через библиотеку pywb и исправлены многие ошибки.Инструмент может быть полезен для всех кто интересуется цифровым сохранением и OSINT, поскольку эти метаданные полезны при анализе слепков веб-сайтов.Внутри работа с данными идет с использованием DuckDB с хранением метаданных в файлах Parquet. DuckDB выступает как универсальный инструмент запросов для аналитических задач, дедубликации и тд.#opensourc #webarchives
    GitHubGitHub - ruarxive/metawarc: metawarc: a command-line tool for metadata extraction from files from WARC (Web ARChive)metawarc: a command-line tool for metadata extraction from files from WARC (Web ARChive) - ruarxive/metawarc
    66591Open in Telegram
  • Национальный цифровой архив

    28 May, 12:11

    forwarded from @begtin

    Я все забываю написать что у меня "висит" давняя задача по сбору метаданных из НЭБа (Национальная электронная библиотека) rusneb.ruТам, с одной стороны, почти 5.5 миллионов материалов, а с другой стороны нет открытого API или массовой выгрузки (bulk download), а для многих гуманитарных/окологуманитарных проектов нужны метаданные оттуда.Как вы понимаете написать сейчас парсер с помощью ИИ несложно, сложно и требует времени на то чтобы собрать все имеющиеся там метаданные в сохранить их.Поэтому нужен не просто парсер НЭБа, а кто-то кто с его помощью сможет все метаданные по всем публикациям собрать и сохранить в сжатый/сжатые JSON lines файлы и передать их.Хорошо если есть волонтер под такое, а если кто-то готов, но за деньги, то напишите мне о том сколько денег и сколько времени нужно - если ценник не безумный я их найду.Что необходимо собрать: все метаданные с карточки
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    91974Open in Telegram
  • Национальный цифровой архив

    21 Apr, 16:10

    forwarded from @begtin

    В рубрике закрытых данных в РФ из открытого доступа исчезли данные судебной статистики с сайта Судебного департамента. По ссылке теперь сообщение Информация временно не доступна. Доступна страница в Интернет-архиве с последней копией 7 марта 2026 года и пока еще работают прямые ссылки на Excel файлы. Но, возможно, ненадолго.Это данные небольшого объема, но значимые для исследователей правоохранительной системы России и журналистов.#opendata #closeddata #russia #courts
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    1,0105331Open in Telegram
  • Национальный цифровой архив

    20 Apr, 14:22

    forwarded from @begtin

    В рубрике как это устроено у них в Ирландии позавчера национальный архив опубликовал данные переписи 1926 года и эти данные можно посмотреть наглядно на карте или в виде огромного архива 2 972 451 поименных записей (чуть менее 3 миллионов файлов и переписных карточек)Как повезло ирландцам, столько исторических материалов. Есть же страны с работающими архивами и статслужбами.Для полного счастья нехватает только получения этих данных как датасета, но его несложно создать.#opendata #ireland #census
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архивImage from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    910105Open in Telegram
  • Национальный цифровой архив

    16 Apr, 10:28

    Ведомости пишут что Более 50% библиотечных фондов может быть изъято при буквальной трактовке законов из за закона об иноагентах и из-за признания многих организаций как нежелательных.Пора ли начинать архивировать такую литературу или исходим из того что она не исчезает, а только недоступна в России? Но в других странах, не-российских онлайн библиотеках и в пиратских библиотеках эта литература останется?Практически все эти книги находятся под авторским правом и их распространение почти наверняка нарушит копирайты и многие архивные проекты будут не готовы хранить такие материалы именно по причине нарушения авторского права и рисков блокировки в России.#questions #digitalpreservation
    2,5707621Open in Telegram
  • Национальный цифровой архив

    2 Apr, 14:30

    2,340poll7Open in Telegram
  • Национальный цифровой архив

    2 Apr, 09:05

    Несмотря последние блокировки Telegram в России этот телеграм канал Ruarxive остается и никуда не исчезнет, на других российских ресурсах вроде VK или MAX его клона не будет в виду непредсказуемости их цензурных правил даже при нейтральности ведения архивных проектов, риски цензуры в их отношении всегда присутствуют.Также все заархивированные сайты организаций и проектов заблокированных в РФ сохраняются и ух удаление не планируется, если какое-либо давление на проект возникнет, то архивные копии сайтов останутся, в любом случае, на ресурсах Интернет Архива (archive.org).Для тех же кому будет сложно читать далее материалы в телеграм думаем над тем как сделать альтернативную площадку для сообщества.Как варианты: - рассылка на substack и обсуждения в комментариях - онлайн форумЕсли будут другие идеи и мысли, пишите в чате @ruarxivechatСледующей публикацией сделаю опрос по тому
    911221763Open in Telegram
  • Национальный цифровой архив

    31 Mar, 09:51

    forwarded from @begtin

    Хронология удаления администрацией Дональда Трампа данных из открытого доступа опубликовано в журнале Passport Общества историков Американских внешних отношений (SHAFR)Подозреваю что список будет больше, здесь лишь часть систематизации. Единственные исключения там это приказы о раскрытии данных об убийстве Кеннеди и раскрытие данных о Джеффри Эпштейне.И, кстати, как я и предполагал США официально вышли из Open Government Partnership (OGP). Это не означает закрытие проектов по открытости внутри США, они всегда были отвязаны от международных обязательств, кроме малого числа случаев. Это означает, в первую очередь, прекращение финансирования OGP со стороны США и потенциальный кризис организации если страны ЕС и др. не компенсируют выпадающие средства.#opendata #closedata #trump #usa
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    77551Open in Telegram
  • Национальный цифровой архив

    30 Mar, 11:48

    Для тех кто интересуется где можно найти материалы многих, в том числе закрытых, Wiki проектов в мире. Команда Wikiteam из ArchiveTeam регулярно архивирует вики сайты и результаты их архивации доступны в одноименной коллекции Wikiteam и Интернет Архиве.Контент сохраняется в форматах XML и в виде архивов с изображениями.Для тех кто хотел бы архивировать сайты на базе MediaWiki самостоятельно, существует открытый код инструмента wikiteam3.Учитывая что контент вики сайтов публикуется в виде дампов в XML пригодных для машинной обработки, можно сказать что эта коллекция в Интернет Архиве не только каталог архивов, но и каталог открытых данных.Важно что многие исчезнувшие русскоязычные вики проекты и те что могут исчезнуть в очень скором времени могут быть найдены именно там.#opendata #digitalpreservation #wiki #archiveorg
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    4,2109542Open in Telegram
  • Национальный цифровой архив

    24 Feb, 15:28

    Пишут что Microsoft продвинулись в Project Silica с сохранением данных в стекле и обещают что потенциально это может позволить сохранять данные до 10 тысяч лет. На кусок стекла 12x12x0.2 сантиметра записали 4.8TB данных. Запись идет долго, около 150 часов.Про то когда это будет доступно для кого-то кроме исследователей Microsoft пока нет новостей.#storage #digitalpreservation
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    1,37015112Open in Telegram
  • Национальный цифровой архив

    5 Feb, 12:18

    forwarded from @blognot

    ЦРУ закрыло The World Factbook — справочник по странам мира, который существовал с 1971 года и был одним из самых полезных публичных ресурсов агентства. Никаких объяснений не последовало.Решение выглядит странно не только по сути, но и по исполнению. Все страницы сайта, включая архивы предыдущих версий, теперь перенаправляют на страницу с объявлением о закрытии. При этом Factbook всегда распространялся как public domain — ничто не мешало оставить архивную версию с пометкой о прекращении обновлений.Саймон Уиллисон скачал последний официальный архив за 2020 год и выложил его на GitHub Pages. Полные архивы также сохранились в Internet Archive.https://simonwillison.net/2026/Feb/5/the-world-factbook/#atom-everything
    Simon Willison’s WeblogSpotlighting The World Factbook as We Bid a Fond FarewellSomewhat devastating news today from CIA: One of CIA’s oldest and most recognizable intelligence publications, The World Factbook, has sunset. There's not even a hint as to why they decided …
    1,640115Open in Telegram
  • Национальный цифровой архив

    20 Jan, 08:00

    Где узнать больше о цифровых архивах, цифровой архивации, инструментах, курсах и так далее? Подборка каталогов ресурсов: - Awesome Digital Preservation - список инструментов и ресурсов посвященных цифровой архивации, преимущественно ссылки на открытый код и открытые сервисы и наиболее известные платформы (от Ruarxive) - Awesome Digital Preservation аналогичный список от Digipress сообщества по цифровой архивации, множество ссылок на существующие инструменты и сервисы - Awesome Web Archiving - список инструментов и ресурсов по веб-архивации, созданы и поддерживается Международным консорциумом сохранения интернета (IIPC) - ArchiveTeam Wiki большой вики проект от команды ArchiveTeam посвященный веб архивации и архивационным кампаниям для сохранения гибнущих онлайн ресурсов. - База знания Ruarxive база знаний по цифровой и веб архивации на русском языке от проекта Ruarxive, инструкции по
    5,5207522Open in Telegram
  • Национальный цифровой архив

    22 Dec 2025, 11:17

    forwarded from @piratepartyru

    Anna’s Archive решила создать резервную копию Spotify🎵Проектом заархивированы метаданные и музыкальные файлы платформы Spotify. Архив занимает ~300 ТБ, распространяется через торренты и включает около 86 миллионов музыкальных файловЭто первый подобный открытый «архив сохранения» музыки такого масштаба, доступный для зеркалирования и резервирования любым пользователем с достаточным дисковым пространством.https://annas-archive.li/blog/backing-up-spotify.html🏴‍☠️ Anna’s Archive - некоммерческая метапоисковая система для теневых библиотек с открытым исходным кодом, созданная командой анонимных архивистов Pirate Library Mirror и запущенная как прямой ответ на усилия правоохранительных органов по закрытию Z-Library в 2022 году. Проект ставит себе целью «каталогизацию всех существующих книг и отслеживание прогресса человечества на пути к тому, чтобы сделать все эти книги
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    1,63023134311Open in Telegram
  • Национальный цифровой архив

    15 Dec 2025, 09:23

    forwarded from @begtin

    К вопросу про российский мессенжер Max, помимо достаточно очевидных проблем с тем что он "как бы государственный, но не государственный", с его довольно бесцеремонным продвижением используя административный ресурс и массой других уже написанных многими проблем, я подниму ещё одну тему о которой не пишут.Это архивация. В сравнении с телеграмом у Max'а есть два очень существенных отличия: 1. Отсутствует возможность просматривать содержание каналов онлайн без авторизации 2. Отсутствует возможность делать data takeout хотя бы для своих данных, а в идеале и для любых каналов и чатовПервое влияет на то что содержание из Max не индексируется поисковиками и Интернет Архивом (они собирают только общедоступные матералы доступные через https/http). К примеру, в телеграм можно смотреть без авторизации, вот так выглядит там мой телеграм канал https://t.me/s/begtinВторое на то что невозможно
    1,1507742Open in Telegram
  • Национальный цифровой архив

    15 Dec 2025, 05:41

    Большое обновление сайта Ruarxive.org. Добавили много новых статей, лучше структурировали сам сайт, добавили поиск, обновили до последней версии Docusaurus'а (движка на котором сайт построен).В том числе можно обратить внимание на статьи: - Быстрый старт: архивация за 5 минут - Как создать цифровой архив сайтов - Экстренная архивация: когда счет идет на часы - Курс по цифровой архивацииИ многие другие, включая статьи по использованию конкретных инструментов и обзоры наиболее известных сервисов.Новое содержимое сайта собрано из публикаций в телеграм канале @ruarxive, других публикаций об исчезновении интернет-ресурсов, презентаций курса по цифровой архивации и других материалов.Среди других изменений: - обновлена главная страница для большей понятности содержания сайта - добавлен поиск по контентуДа, структура сайта ещё не идеальна, а поскольку многие статьи преобразованы из
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    2,540851Open in Telegram
  • Национальный цифровой архив

    11 Nov 2025, 12:52

    forwarded from @infoculture

    Объявлен приём заявок на Премию «Открытый доступ к данным в гуманитарных науках»АНО «Инфокультура» приглашает студентов, аспирантов, преподавателей, исследователей и сотрудников вузов и научных организаций принять участие в конкурсе проектов, способствующих развитию открытой науки в гуманитарной сфере.📌 Что можно подать: – результаты научных исследований, – цифровые проекты, связанные с гуманитарными дисциплинами, – дипломные и курсовые проекты, – иные работы, представляющие гуманитарные данные в открытом доступе.📚 Номинации Премии: • История • Филология • Культура • Искусство • Иные гуманитарные наукиНоминировать проект может как сам автор (или коллектив авторов), так и любой человек или организация, знакомые с проектом. Год публикации работы не имеет значения.🏅 Лауреаты получат памятные награды, сертификаты и специальные призы от организаторов и партнёров Премии.
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    1,100554Open in Telegram
  • Национальный цифровой архив

    1 Nov 2025, 14:18

    forwarded from @begtin

    Кстати, как человек любящий не только цифровые архивы, но и исторические книжки тоже не могу не упомянуть про очень интересный проект от Банка России с виртуальной выставкой по истории Банка. Мало какие центральные банки в мире делают такие проекты, так что это хорошо что такое появляется (если знаете аналогичные проекты в других странах, то напишите плз). Я знаю только Federal Reserve History в США.Но интересность материалов и их доступность омрачает то что материалы есть, а можно ли их использовать? В основном нет.Вот самые очевидные проблемы: 1. Нет нигде явным образом указанных условий использования материалов. Можно ли использовать их на своём сайте? Можно ли на их основе писать учебные материалы? Можно ли цитировать и тд. Понятно что у разных материалов может быть разный статус, но не надо забывать насколько это важно можно ли использовать такие материалы. 2. Просмотр
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    1,180641Open in Telegram
  • Национальный цифровой архив

    27 Oct 2025, 13:35

    forwarded from @begtin

    Говоря о исчезающих материалах/данных/информации в России я как-то ранее упускал что творится в российских регионах, а зря. Интернет архив уже более чем 3 года не охватывает огромное число региональных и муниципальных сайтов, например, сайт администрации г. Белгорода beladm.ru не индексировался с конца марта 2022 года.Но это только половина беды, сейчас этот сайт явно и как-то очень криво мигрировали на ГосВеб в поддомене Госуслуг да так что его новый адрес должен быть beladm.gosuslugi.ru, а редирект идет на belgorod-r31.gosweb.gosuslugi.ru что выглядит как-то, через одно место.Старый сайт, конечно же, недоступен, государственного архива сайтов в РФ нет, со старого сайта материалы перенесены совершенно точно не все.Масштабы потерь пока сложно измерить, скорее всего они весьма велики.#russia #opendata #digitalpreservation #webarchives #closeddata
    Image from a post by Национальный цифровой архивImage from a post by Национальный цифровой архив
    9761041Open in Telegram
  • Национальный цифровой архив

    24 Oct 2025, 11:12

    forwarded from @begtin

    The Wayback Machine’s snapshots of news homepages plummet after a “breakdown” in archiving projects заметка в Nieman Labs о том что с мая 2025 года в Интернет Архиве наблюдается сбой из-за которого резко сократилась архивация как минимум главных страниц ведущих медиа изданий в мире. Иногда вплоть до того что страницы не сохранялись вовсе. Марк Грехэм из Интернет архива это подвердил и упомянул что этот сбой уже был исправлен.Основная мысль в том насколько все в мире зависят от Интернет Архива при том что у него нет ни стабильного финансирования, ни серьёзных финансовых ресурсов или эндаумента позволяющего не думать о фандрайзинге постоянно. Все национальные инициативы в нац архивах и библиотеках, крупнейшие из них в США и во Франции, многократно, думаю что на два порядка не дотягивают по масштабам.При этом не все знают и понимают что интернет архив охватывает далеко не всё. Чем
    Nieman LabThe Wayback Machine’s snapshots of news homepages plummet after a “breakdown” in archiving projectsBetween May and October 2025, homepage snapshots fell by 87% across 100 news publications.
    997741Open in Telegram