среда, 16 сентября 2026 г.

Два механизма: экспертиза ценности и обеспечение доступности - и ограниченность вычислительной доступности архивных материалов (3)

(Продолжение, предыдущую часть см. https://rusrim.blogspot.com/2026/09/2_01778938856.html )

Свидетельство того, что вычислительный доступ всегда был возможен — и причина, по которой он оказался спрятанным в системе

Два артефакта из собственной истории Национальных Архивов США (NARA) иллюстрируют сказанное на конкретном примере (причём их легко спутать, потому что они используют трёхбуквенные сокращения из одних и тех же букв, но в разном порядке).

Первый артефакт - это «Система доступа к архивным базам данных» (Access to Archival Databases system, AAD), запущенная в эксплуатацию в 2003 году. AAD позволяет представителям общественности выполнять запросы по комбинации полей - по имени, дате, месту, организации - к файлов сотен структурированных баз данных, полученных из десятков федеральных органов исполнительной власти. Это, во всех смыслах, вычислительный доступ. И вот факт, который должен Вас заставить сделать паузу: система AAD была первым общедоступным приложением, разработанным в рамках программы «Электронный архив документов» (ERA). 

Примечание: О том, что запущенная в апреле 2003 года система AAD была «первым общедоступным приложением, разработанным в рамках» программы ERA, дословно утверждается как в публикации Национальных Архивов «AAD: Новый инструмент для поиска в базах данных Национальных Архивов» (AAD: A New Tool to Search NARA Databases, журнал Prologue (весна 2003 г.), https://www.archives.gov/publications/prologue/2003/spring/spotlight-aad.html ) , - так и в пресс-релизе № 03-34 «Тысячи людей ищут информацию в новой электронной базе данных Национальных Архивов» (Thousands Search National Archives New Electronic Database, 8 апреля 2003 года, https://www.archives.gov/press/press-releases/2003/nr03-34 ). 

В статье в журнале Prologue, написанной руководителем проекта AAD с момента его создания Дэвидом Кепли (David R. Kepley), - отмечается, что разработка началась летом 1999 года по контракту с Международной корпорацией по прикладному применению научных достижений (Science Applications International Corporation, SAIC), и что система AAD решала задачу «только доступа к определенному типу электронных документов – к базам данных», в то время как Национальные Архивы отдельно «сосредотачивали усилия на разработке системы ERA». Таким образом, отсылка здесь даётся на спонсора программы, а не на отдельный инженерный отдел ERA. См. также публикацию «Оценка воздействия AAD на неприкосновенность частной жизни (защиту персональных данных)» (AAD Privacy Impact Assessment, https://www.archives.gov/files/privacy/privacy-impact-assessments/aad.pdf ).

Проектирование AAD фактически началась раньше - Национальные Архивы заключили контракт с SAIC летом 1999 года - но программа ERA представила AAD как свой первый общедоступный результат. Первой публичной демонстрацией будущего системы ERA была демонстрация вычислительного доступа, а не обеспечения долговременной сохранности. Вычислительный доступ появился не как четвертый и последний этап эволюции - впервые он появился в 2003 году, а затем «оказался в подчинении», поскольку ERA стала системой обеспечения сохранности, а описательный Каталог Национальных Архивов - «входной дверью».

Почему AAD остался в рамках ERA? Потому что система AAD работала только там, где документы уже были представлены в виде структурированных данных; и даже в этом случае - только с наборами данных, индивидуально обработанными и упакованными специально для AAD, а не со всеми электронными фондами Национальных Архивов в целом. 

Описательный слой - суррогат, заменяющий миллиарды неструктурированных документов - никогда не наследовал эту возможность выполнения запросов. Система AAD продемонстрировала вычислительный доступ к тщательно подготовленному подмножеству структурированных наборов данных; она не могла и не должна была обобщаться на все архивные фонды.

Второй артефакт - это сам ведомственный DAA-перечень, и он объясняет приоритеты архитектуры. Организующей основой системы ERA является перечень. Ее первая институциональная задача – проведение экспертизы ценности и уничтожения / передачи на архивное хранение - исполнимое машиной решение об отборе на постоянное хранение и на уничтожение. Система, ключевым компонентом которой является перечень, оптимизирована для обеспечения ответственного хранения и подотчётности, а не для поиска и раскрытия. Целью было создание надежного цифрового хранилища; а создание вычислительной платформы для поиска и раскрытия такой целью не являлось. Система AAD - это возможности; DAA-перечни - причина, по которой AAD так и не стала «центром тяжести».

Совместное функционирование, при котором нет единой точки зрения 

Посмотрите на системы, которые фактически эксплуатируются, и идея «потолка» перестанет быть абстрактной. Национальные Архивы США управляет не одной-двумя двумя системами, а слабо связанной федерацией многих систем.

Каталог Национальных Архивов (преемник систем ARC и OPA) хранит описания и предоставляет к ним доступ через онлайн-интерфейс пользователя и открытый API чтения-записи - однако API выдаёт описательные метаданные и краудсорсинговые материалы, теги и транскрипции, а не взаимосвязи. 

Примечание: Об открытом API Каталога Национальных Архивов с возможностью чтения и записи см. страницу сайта Национальных Архивов «API для Каталога Национального архива» (API for the National Archives Catalog, https://www.archives.gov/research/catalog/help/api ), а также страницу «Использование API для Каталога Национального архива» (Using the National Archives Catalog API, https://github.com/usnationalarchives/Catalog-API ) на сайте Github.

Система AAD по-прежнему поддерживает отдельный от Каталога портал структурированных запросов. Система ERA- ныне ERA 2.0, перестроенная на модульной микросервисной архитектуре на базе государственного облака AWS GovCloud, - отвечает за управление сроками хранения и за обеспечение долговременной сохранности электронных документов постоянного срока хранения, поддерживая отдельные рабочие процессы для федеральных, президентских, законодательных, судебных, оцифрованных и пожертвованных материалов. 

Примечание: О модульной микросервисной архитектуре ERA 2.0 на базе AWS GovCloud и о рабочих процессах для документов различного вида «План Национальных Архивов в области открытого правительства» (National Archives Open Government Plan 2016 - 2018), раздел 6.4 «Архивы электронных документов» (Electronic Records Archives, https://usnationalarchives.github.io/opengovplan/erecordsarchives/ ); а также обзор новой версии 2.0 системы ERA, см. https://www.tagovcloud.com/2023/09/naras-electronic-records-archives-2-update-primer/ .

Ещё одна система – «Информационная система центров хранения архивов и документации» (Archives and Records Centers Information System, ARCIS) - отвечает за физическое ответственное хранение и логистику федеральных центров хранения документации – это «доцифровой» слой, который всё ещё функционирует. 

Примечание: О системе ARCIS и федеральных центрах хранения документации см. соответствующую страницу (About Archives and Records Center Information System (ARCIS), https://www.archives.gov/frc/arcis/about ) на сайте Национальных Архивов.

Существует ряд интерактивных инструментов - DocsTeach для образования, History Hub для краудсорсинговых проектов создания научно-справочного аппарата, Founders Online для курируемого редактирования документальных материалов – которые располагаются в данной иерархии поверх описаний.

Чего эти системы не разделяют между собой, так это слоя знаний. Общими в них являются идентификаторы, а не понимание. Первоначальный порядок сохраняется внутри каждого фонда; почти отсутствуют средства моделирования взаимосвязей между фондами. Это и есть реальный потолок четвёртого уровня: речь идёт не об недостающей функциональной возможности, а о недостающем едином видении. В архитектуре нет такого места, где структурированные записи в AAD, сохраняемые объекты в ERA, документация об ответственном хранении в ARCIS и описания в Каталоге были бы связаны друг с другом в виде графа.

Два механизма, работающие в противоходе

Здесь дискуссия меняет направление. Посмотрите, что делает собственная программа искусственного интеллекта Национальных Архивов. В её общедоступном каталоге вариантов использования ИИ упоминается автоматическая разметка примерно двух миллионов электронных документов, поиск на естественном языке по внутренним фондам и генеративные инструменты для резюмирования и подготовки проектов документов на основе оперативных документов. 

Примечание: О примерах использования ИИ в деятельности Национальных Архивов США см. страницу сайта Национальных Архивов «Реестр вариантов использования ИИ в NARA» (Inventory of NARA Artificial Intelligence (AI) Use Cases, https://www.archives.gov/ai ); а также страницу «Новая стратегическая концепция Национальных Архивов делает акцент на наращивании потенциала посредством ответственного использования искусственного интеллекта» (National Archives’ New Strategic Framework Emphasizes Building Capacity Through Responsible Use of Artificial Intelligence, https://www.archives.gov/news/articles/new-strategic-framework-artificial-intelligence ).

В каждом из этих вариантов использования машинное обучение применяется к описательному слою, и каждый порождает ещё больше описаний.

(Окончание следует)

Эндрю Поттер (Andrew Potter)

Источник: сайт Substack
https://metaarchivist.substack.com/p/the-two-machines 

Комментариев нет:

Отправить комментарий