Показанные сообщения отсортированы по дате запроса (Siegfried). Сортировать по релевантности Показать все сообщения
Показанные сообщения отсортированы по дате запроса (Siegfried). Сортировать по релевантности Показать все сообщения

пятница, 31 июля 2026 г.

День, когда мы осознали, что инструменты обеспечения долговременной сохранности электронных материалов также необходимо сохранять

Данный пост колумбийского специалиста Джона Александра Гонсалеса Флореса (Jhon Alexander González Flórez, или Jhon A. Gonzalez F. – на фото), сотрудника управления проектов электронного документооборота в компании Grupo IB Consulting SAS, был опубликован 24 июня 2026 года в социальной сети LinkedIn.

Существует инструмент, название которого Вы, вероятно, никогда не услышите на заседаниях совета директоров. Он не фигурирует в тендерной документации, не включается в презентации по цифровой трансформации. Никто не упоминает его при обсуждении хранилищ или архитектуры электронных документов. Имя этого инструмента – PRONOM, и уже в течение более чем двадцати лет значительная часть глобальных усилий в сфере обеспечения долговременной сохранности электронных материалов (электронной сохранности) неосознанно зависит от него.

PRONOM представляет собой реестр, который позволяет идентифицировать файловый формат электронного документа - не имя, не расширение, а фактический формат с его технической сигнатурой. Без этого такие инструменты, как DROID и Siegfried, которые используются национальными архивами и хранилищами по всему миру, не смогут определить, будет ли документ читаемым по прошествии десяти или двадцати лет.

Мой комментарий: О PRONOM см. подборку постов на блоге https://rusrim.blogspot.com/search/label/PRONOM ; о DROID – см. https://rusrim.blogspot.com/search/label/DROID ; о Siegfried – см. https://rusrim.blogspot.com/search?q=Siegfried&max-results=20&by-date=true 

Иными словами, PRONOM обеспечивает долговременную сохранность не документов, . способности понимать их. Это очень важное различие.

При этом никто не обращает внимания на то, что за этой кажущейся стабильностью скрывается инфраструктура, которой уже более двадцати лет и которая существенно не развивалась, - распределенная между группами, занимающимися её поддержкой наряду с выполнением иных обязанностями, не имея на это целенаправленно выделенного бюджета; и использующая архитектуры, которые становятся всё более неустойчивыми. Это не халатность, а реальность любого критически важного ресурса, который работает настолько хорошо, что никто не чувствует необходимости его модернизировать - до тех пор, пока не найдётся кто-то, кто сделает расчёты и обнаружит, что риск кроется не в самих документах, а в инфраструктуре, которая делает их читаемыми.

Небольшая группа, не имеющая целевого финансирования, решила всё равно модернизировать PRONOM. И то, что сделали эти люди, заслуживает внимания, причём не столько даже результат, сколько их подход к решению проблемы. Они не создавали новую платформу, а поступили наоборот: они трансформировали PRONOM в проект на основе открытых данных, инфраструктуры как кода, полной автоматизации и вовлечения сообщества. Исчезла реляционная база данных, и вместо неё появился набор JSON-файлов, хранящихся непосредственно на сайте GitHub (в учётной записи Национальных архивов Великобритании, см. https://github.com/nationalarchives/pronom  - Н.Х.) - видимых, поддающихся аудиту и доступных любому без необходимости заниматься поиском и выгрузкой с веб-сайта. Произошёл переход от поддержки приложения к поддержке экосистемы. Это различие, опять же, имеет принципиальное значение. 

Теперь перейдём к тому аспекту, который я хотел бы обсудить с лицами, принимающими решения в латиноамериканских архивных учреждениях.

Когда мы анализируем региональные проекты в области электронной сохранности, картина получается довольно однообразная: хранение, система управления документами и контентом, электронное хранилище, оцифровка. Это всё необходимые и правильные решения; но при этом почти никто не ставит вопрос о то, кто же обеспечивает долговременную сохранность тех инструментов, которые делают возможным долговременную сохранность документов и информации.

И ещё меньшее число людей спрашивает, сможет ли архитектура, которая в настоящее время поддерживает их документы, пережить смену поставщика, сокращение бюджета или просто течение времени.

Многие системы, закупаемые сегодня в латиноамериканском регионе, представляют собой сильно взаимосвязанные платформы, для которых характерны:

  • Фиксированный состав метаданных;

  • Ограниченные возможности экспорта;

  • Полная зависимость от производителя.

Это не особенно большая проблема, пока существует поставщик, пока продлевается контракт с ним и выделяется финансирование. Проблема резко обостряется, как только нарушается любое из этих трёх условий.

PRONOM выжил, потому что нашлись люди, осознавшие, что проблема не в технологиях, а в архитектуре. И я полагаю, что Латинская Америка до сих пор недостаточно серьезно относится к этому вопросу: обеспечения сохранности электронных архивных документов будет недостаточно, если та инфраструктура, которая придает им смысл, не рассчитана на то, чтобы пережить своих создателей.

Есть ли у Вашего учреждения чёткий ответ на этот вопрос? :)

Джон Гонсалес (Jhon Alexander González Flórez)

Источник: LinkedIn
https://www.linkedin.com/pulse/el-d%C3%ADa-que-descubrimos-tambi%C3%A9n-hay-preservar-la-jhon-a-gonzalez-f--kxfhe/ 

понедельник, 3 ноября 2025 г.

Облик постоянства: Файловые форматы, лежащие в основе деятельности по обеспечению долговременной сохранности электронных материалов

Предварительный обзор конференции iPRES 2025 в Веллингтоне, Новая Зеландия

Данный пост эксперта в области управления электронными документами, эксперта ИСО от США Энди Поттера (Andy Potter - на фото) был опубликован 1 ноября 2025 года в социальной сети Substack

Файловые форматы всегда были ключевым элементом усилий по обеспечению долговременной сохранности электронных материалов (электронной сохранности - digital preservation), а программа конференции iPRES 2025 в Веллингтоне составлена так, что центральную роль форматов невозможно не увидеть. Сидя за своим столиком с видом на гавань, я не переставал удивляться тому, как много сессий посвящено форматам – от криминалистического анализа файлов формата PDF/A и идентификации форматов по сигнатурам файлов до повседневной работы с файлами форматов TIFF, JPEG и EPUB. Программа читается как негромкое признание того, что форматы оказывают влияние на все наши дискуссии по вопросам долголетия электронно-цифровых материалов.

Мой комментарий: 21-я Международная конференция по обеспечению долговременной сохранности электронных объектов iPRES 2025 пройдёт в Веллингтоне, Новая Зеландия, с 3 по 7 ноября 2025 года, см. https://www.ipres2025.nz/ . Программа конференции выложена онлайн здесь: https://twelve.eventsair.com/QuickEventWebsitePortal/ipres2025/ipres/Agenda , а в виде PDF-файла – по адресу: https://www.ipres2025.nz/_files/ugd/dc225d_1e7e63e72aeb4ddeb7db1a8a5c7da72e.pdf 


Сайт конференции iPRES 2025 – Н.Х.

В программе этого года форматы уже не рассматриваются как второстепенные аспекты или как элемент технической поддержки. Она наполнена сессиями, на которых формат сам по себе становится предметом обсуждения – и это служит напоминанием о том, что электронная сохранность начинается со структуры информации, а не просто с её хранения.


Учебный семинар Питера Уайета (Peter Wyatt) «Взгляд на формат PDF/A с точки зрения криминалистики» (A Forensic Spotlight on PDF/A), который пройдёт 3 ноября 2025 года, обещает редкую возможность углубиться в анатомию одного из тех стандартов, на который больше всего полагаются в сфере обеспечения электронной сохранности. Формат PDF/A уже в течение двух десятилетий является основой наших надежд в области архивирования, однако его сложность - от встроенных метаданных до механизмов рендеринга (отображения) на основе искусственного интеллекта (ИИ) - продолжает бросать вызов нашим представлениям о его прозрачности и стабильности.

Мой комментарий: Питер Уайет (на фото) является директором по технологиям ассоциации PDF Association, занимающейся связанными с форматом PDF вопросами уже более 25 лет. Питер является руководителем проекта по поддержанию и развитию стандарта ISO 32000 - основного международного стандарта форматов семейства PDF.

Одновременно семинар «В поисках сигнатур» (Searching for a Signature) приглашает специалистов-практиков засучить рукава и заняться освоением таких инструментов идентификации файловых форматов, как PRONOM, Siegfried и FIDO. Участники семинара изучат, каким образом создаются, поддерживаются и проверяются сигнатуры. Этот разговор затрагивает, в частности, политику ведения открытых реестров форматов и реалии «дрейфа форматов» (format drift).

На другом учебном семинаре «Ориентирование в файловых форматах в рамках деятельности по обеспечению электронной сохранности: Практическая работа с файлами в форматах TIFF, JPEG, EPUB и PDF» (Navigating File Formats in Digital Preservation: TIFFs, JPEGs, EPUBs, and PDFs in Practice) будет представлен сравнительный подход к анализу поведения форматов в реальных коллекциях. Речь пойдёт не о теории, а о том, каким образом специалисты по обеспечению сохранности на практике тестируют и нормализуют контент, а порой и восстанавливают его в случае некорректного поведения форматов.

В последующие дни будут сделаны доклады на темы «Сложные аспекты форматов в центре внимания: Форматы и файлы» (Formats in Focus, Meeting Complexity: Formats & Files) и «Декодирование форматов и смысла» (Decoding Formats & Meaning), которые выведут эту дискуссию за рамки вопросов технического уровня. Можно ожидать рассказа об опыте применения контейнерных форматов для хранения научных данных, о цифровом искусстве, которое «не дружит» с нормализацией, и о новых работах, касающихся спецификаций упаковки данных, таких как BagIt, RO-Crate и OCFL, — всё это часть растущего понимания того, что структура - это вопрос стратегический.

В совокупности эти сессии предлагают нам взглянуть в лицо истине, которую мы иногда упускаем из виду: успех или провал любой системы обеспечения долговременной сохранности зависит от долговечности используемых ею файловых форматов. Формат - это нечто большее, чем просто контейнер; это соглашение о том, каким образом будет обеспечиваться осмысленность информации во времени при использовании разных устройств и различного программного обеспечения. Когда это соглашение нарушается – т.е. когда формат умирает, мутирует, или же когда становится некому контролировать его корректность – деятельность по обеспечению долговременной сохранности превращается в археологию.

Это напоминает мне, - в тот момент, когда я готовлюсь принять участие в дискуссиях в Веллингтоне, - о том, что инновации в нашей области не всегда означают внедрение новых технологий. Порой инновации означает возвращение к основам – к сигнатурам, спецификациям и общему языку, которые делают возможной обеспечение сохранности цифровой памяти.

Эндрю Поттер (Andrew Potter)

Источник: сайт Substack
https://metaarchivist.substack.com/p/the-shape-of-forever-file-formats 



понедельник, 31 декабря 2018 г.

Автоматизация в сфере электронной сохранности


Данный пост Ричарда Лехейна (на фото) был опубликован 20 ноября 2018 года на блоге британской Коалиции по электронной сохранности (Digital Preservation Coalition, DPC) среди материалов, приуроченных к Международному дню электронной сохранности, который отмечался 29 ноября 2018 года (см. https://dpconline.org/blog/idpd ).

Ричард Лехейн (Richard Lehane) - консультант по вопросам архивного дела и управления документами в компании Recordkeeping Innovation из города Сидней, Австралия. В следующем году он будет работать в архивах МАГАТЭ в Вене, Австрия.

Мой комментарий: первая половина поста – лишь «зачин», будьте терпеливы! :)

Когда у меня бывает свободное время, я работаю над программой «Зигфрид» (Siegfried) - инструментом идентификации файловых форматов наподобие известных программ DROID и Fido. Я вожусь с ним уже более пяти лет. (см. перевод заметки Ричарда за 2015 год, http://rusrim.blogspot.com/2015/04/siegfried.html об инструменте идентификации файловых форматов на основе реестра форматов PRONOM – Н.Х. ) Автоматизация работы играла для меня решающую роль в плане продолжения работы над проектом – без неё я просто не смог бы сделать всё то, что что необходимо было сделать помимо совершенствования самого инструмента. К настоящему времени я автоматизировал:
  • Тестирование,

  • Создание и публикация релизов,

  • Обновление подписей,

  • Профилирование кодов, и

  • Бенчмаркинг.
Автоматизация этих процессов означает для меня не только снятие с себя части ручной работы и высвобождение времени, но и в создание системы подстраховки, позволяющей мне погрузиться в работу по внесению изменений, зная, что любые серьезные ошибки или дефекты всплывут в ходе тестирования и бенчмаркинга.

Первым я автоматизировал набор тестов для «Зигфрида». Этот пакет тестов включает в себя базовый набор Росса Спенсера (Ross Spencer) и запускается каждый раз, когда новый код отправляется на сайт Github через сервис Travis-CI (облачный сервис для разработки и тестирования программного обеспечения, базирующегося на сайте Github – Н.Х.). Эти тесты в полной мере окупаются при каждом новом выпуске инструмента PRONOM, потому что они всеохватывающие, в том числе покрывающие широкий спектр пограничных случаев для файловых сигнатур из PRONOM. За эти годы благодаря данному базовому набору тестов была выявлена масса ошибок в «Зигфриде» (а также был подготовлен ряд отчётов об ошибках, которые были направлены разработчику PRONOM – Национальным Архивам Великобритании).

Travis-CI также отвечает за сборку пакетов Debian (операционная система на основе открытого исходного кода – Н.Х.). Это была следующий крупный этап работы, который я автоматизировал. Любое изменение мастер-кода запускает сборку исполняемого кода для Debian на Travis-CI и сборку для Windows на Appveyor. Затем исполняемые файлы автоматически публикуются на Bintray и обратно на Github. Иными словами, как только я прихожу к выводу, что код готов для выпуска нового релиза, я могу просто направить этот код в хранилище, и новые версии программы под Linux и Windows будут автоматически созданы и опубликованы.

В прошлом году я написал «сборочный» скрипт, который исполняется в Travis-CI. Он берёт базу данных PRONOM после очередного её обновления и формирует свежие версии набора базовых тестов. Это не только экономит мое время, но и означает, что мне не нужны инсталлировать на моих локальных компьютерах для разработки все зависимости Java и Python для базового набора тестов.

Самая недавняя автоматизация, которую я добавил в июле этого года, является, вероятно, самой крупной и сложной из всех. Это непрерывно работающий индивидуально-настроенный сервис бенчмаркинга, который выполняет крупномасштабные тесты с использованием программы Siegfried (а также программ DROID и Fido) при внесении изменений в репозиторий кода на Github. Этот сервис также выполняет автоматическое профилирование кода. Я не буду здесь рассказывать подробности, но, если Вам это интересно, прочитайте пост здесь: https://www.itforarchivists.com/post/benchmarks/  .

Итак, теперь, когда я дал понять, что являюсь фанатом автоматизации (и бесстыдно слегка порекламировал своего «Зигфрида»), давайте поговорим об общих вопросах и обсудим автоматизацию в области электронной сохранности.

Автоматизация часто продвигается как необходимый элемент работы по обеспечению электронной сохранности из-за проблемы масштаба: идея заключается в том, что, поскольку сегодня создается столь много электронного контента, то если мы не сможем автоматизировать нашу работу, мы утонем в этом «электронно-цифровом потопе». Хотя в этом аргументе определенно есть доля истины, я хотел бы предостеречь, что автоматизация не следует применять вслепую или же в качестве универсального решения, подходящего во всех случаях жизни.

Преждевременная оптимизация - корень всех зол

В следующий раз, когда Вы услышите, как кто-то (или Вы сами) говорит: «это всё здорово, но это не будет масштабироваться», стоит задуматься, что именно понимается под «масштабом», «масштабированием». У всех у нас есть проблемы с масштабированием, но они не обязательно одинаковы. Размышляя о масштабе и электронной сохранности, следует принято во внимание ряд аспектов:
  • масштаб нашей собственной деятельности (обычно маленький)

  • размер нашей потенциальной клиентской базы или юрисдикции (часто большой)

  • размер нашей фактической клиентской базы или той части нашей юрисдикции, которая желает сотрудничать с нами (часто небольшой)

  • количество запросов на передачу материалов на хранение (может быть разным)

  • размер пакетов передаваемых данных (может быть разным)

  • сложность этих процессов передачи (может быть разной).
Решение, предназначенное для управления небольшим количеством клиентов, передающих действительно большие объемы контента, однако с использованием небольшого и четко определенным набора типов контента, - может сильно отличаться от решения, созданного для множества клиентов, передающие небольшие объёмы, но очень разнообразного контента.

Я недавно ушёл из Государственного архива австралийского штата Новый Южный Уэльс, где был частью команды проекта «электронного архива». Несколько лет назад, в начале этого проекта, мы потратили немало времени на проектирование (и отчасти создание) workflow-механизма и стандартного портала ведомства с тем, чтобы мы могли справиться с большими объемами передаваемых ведомствами материалов, которые, как мы ожидали, скоро к нам поступят. В конечном итоге мы переключились на гораздо более индивидуальную модель (с использованием шаблонов документов для взаимодействия с ведомствами и скриптов для выполнений значительной части обработки), которая оказалась лучше подходящей для того типа масштабирования, с которым мы столкнулись: небольшое число сложных пакетов передаваемых материалов, объёмы которых сильно варьировались.

В сообществе специалистов по машинному обучению часто говорят: «Бесплатного обеда не бывает». Это означает, что не существует такого универсального алгоритма, что подходил бы для всех областей, и Вам нужно экспериментировать с разными алгоритмами, чтобы определить правильный подход к Вашей конкретной проблеме. То же самое справедливо в отношении электронной сохранности. Выберите правильный набор инструментов для условий, в котором Вы работаете, и осознайте, что при использовании любого из инструментов есть определённые компромиссы. Это связано с тем, что автоматизация чего-либо включает в себя установление соответствующих ограничений. Прекрасным примером может служить нормализация формата: если вы готовы заплатить возможную «цену» в плане верности представления, то установление ограничения, предусматривающего поддержку ограниченного числа форматов «для длительного хранения», возможно, окажется оправданным (а может быть, и нет).

Автоматизация важна, но осуществлять её следует тактически (как я сделал это для «Зигфрида»): начните с малого и «вручную», выясните,  в чём заключаются Ваши потребности в плане масштабировании, и поймите, на какие компромиссы Вы готовы пойти.

Хорошего Вам Международного дня электронной сохранности. И попробуйте использовать «Зигфрида»!

Ричард Лехейн (Richard Lehane)

Мой комментарий: Знаете, о чём я подумала, переводя эту заметку? Раз за разом Росархив и ВНИИДАД пытаются навязать стране, давно уже живущей в условиях многоукладности, быстрых изменений технологий, неоднородности и изменчивости законодательства, большой разницы в располагаемых организациями ресурсах, - некие единые, причем написанные на уровне пошаговых инструкций правила работы с документами «на все случаи жизни», а теперь ещё и правила обеспечения долговременной сохранности электронных документов… Да и некоторые другие ведомства тоже хороши, снова и снова «выкатывают» идеи осчастливить все государственные и/или муниципальные органы страны какой-нибудь единой СЭД. И если австралийцы разок наступили на грабли и поняли, что так делать не стоит, то в нашей стране, чтобы понять тупиковость изначально выбранного направления (и, самое главное, признать ошибку!), надо в кровь лоб расшибить…

Источник: блог Коалиции по электронной сохранности
https://dpconline.org/blog/idpd/automation-in-digital-preservation

воскресенье, 26 апреля 2015 г.

В свободном доступе выложен инструмент для идентификации файловых форматов Siegfried


Данная заметка Ричарда Лехейна (Richard Lehane) была опубликована 25 марта 2015 года на его блоге «Richard's Blog» (см. http://openpreservation.org/knowledge/blogs/author/richardlehane/ ), расположенном на сайте Фонда «Открытая сохранность» (Open Preservation Foundation, OPF), под названием «Выпущена первая версия инструмента для идентификации файловых форматов «Зигфид»» (Siegfried v 1.0 released (a file format identification tool).

Программа «Зигфрид» (Siegfried) представляет собой инструмент идентификации файловых форматов на основе реестра форматов PRONOM. Её первая версия Siegfried v. 1.0 теперь доступна по адресу http://www.itforarchivists.com/siegfried .

Основные отличительные особенности программы следующие:
  • Полная реализация PRONOM (байтовые и контейнерные сигнатуры)

  • Надежные результаты (Siegfried на тестах сравнивался со «скелетным» пакетом Росса Спенсера (Ross Spencer) и прошёл тестирование на качество в сопоставлении аналогичными по назначению пакетами DROID и FIDO)

  • Быстрое нахождение соответствия без ограничения на количество просматриваемых байтов;

  • Детальная информация о том, на каком основании был сделан вывод о соответствии определённому формату;

  • Простой интерфейс командной строки с возможностью выбора вариантов вывода результатов (в формате YAML, JSON или CSV);

  • Встроенный сервер для интеграции с рабочими процессами;

  • Расширенные возможности, включающие режим отладки, модификацию сигнатур и поддержку нескольких идентификаторов.
Большое спасибо Россу Спенсеру за базовый набор функций, Мисти де Мео (Misty De Meo) Ubuntu-упаковку, а также всем тем в Национальных Архивах Великобритании, кто создал и поддерживает базу данных PRONOM.

Мой комментарий: Программы такого рода входят в число основных рабочих инструментов электронных архивистов. Они анализируют внутреннюю структуру файлов и позволяют достоверно определить использованный для его создания формат (и версию формата).

Переходя по данной Лехейном ссылке ( http://www.itforarchivists.com/siegfried ), мы попадаем на посвященную программе Siegfried страницу его личного сайта, которая вызовет ностальгию у тех, кто ещё помнит времена PC 286-х (см. рис.1).

Рис.1. Страница для загрузки и тестирования программы

На этой странице можно скачать 32- и 64-битовые версии программы. Можно также оценить, что программа умеет, просто перетащив мышкой какой-нибудь файл прямо на наковальню Зигфрида. Вот что получилось у меня (см.рис.2, в качестве примера был взят PDF-файл):

Рис.2 Пример выдаваемой о файле информации

Сама программа выдает результаты в следующем виде:


Особых «красот» здесь нет, электронным архивистам важна функциональность и возможность сопряжения с другими инструментами.

Дополнительная информация: Её можно найти в других постах Лехейна, посвященных проекту Siegfried: