понедельник, 4 августа 2025 г.
Расширение доступа к архивным документам с помощью искусственного интеллекта: Инновации в сфере культурного наследия на основе «участия человека в контуре управления»
Мой комментарий: Полный текст поста находится в платном доступе; ниже переведена предоставляемая бесплатно выдержка из него.
Введение
Архивы и хранилища документации по всему миру хранят обширные коллекции бумажных документов, фотографий и материалов на иных носителях, отыскать которые и получить к ним доступ к в электронном виде сложно. Доступ к большей части этих материалов, от исторических рукописей и до машинописных документов, можно получить только путем физического просмотра или чтения, что является трудоемким процессом.
Сегодня искусственный интеллект (ИИ) предлагает новые способы решения этой проблемы. Такие технологии, как оптическое распознавание символов (Optical Character Recognition, OCR) для печатного текста и распознавание рукописного текста (Handwritten Text Recognition, HTR) для рукописей, способны автоматически транскрибировать отсканированные архивные документы, превращая их в оцифрованный текст и делая их более доступными, в том числе посредством поиска по ключевым словам.
Крайне важно то, что эти ИИ-инструменты наиболее эффективны в рамках подхода «человек в контуре» (human-in-the-loop), когда архивисты и специалисты по управлению информацией направляют, обучают и корректируют ИИ с целью обеспечения точности и аутентичности.
В данной заметке рассматривается, каким образом ИИ используется для улучшения доступа к архивным материалам, с реальными примерами из опыта работы Национальных архивов Голландии и других инициатив, - и подчеркивается важность в этих инновациях человеческого надзора, стандартов и хороших практик.
Транскрипция с помощью ИИ-инструментов в действии: Опыт Национальных архивов Голландии
Один из новаторских примеров взят из опыта Национальных архивов Голландии. Столкнувшись с проблемой управления огромной коллекцией бумажных документов (более 140 погонных километров документов – для Голландии это довольно много :) – Н.Х.), архив инициировал амбициозную программу оцифровки, предусматривающую сканирование и транскрибирование миллионов страниц.
Национальные архивы Голландии планирует в течение последующих 15 лет отсканировать около 10% своих фондов - более 100 миллионов страниц - и использовать распознавание рукописного текста на основе ИИ, чтобы сделать эти цифровые изображения доступными для полнотекстового поиска.
В центре внимания на первом этапе этого проекта были 3 миллиона страниц исторических документов (включая документы Голландской Ост-Индской компании XVII–XVIII веков и нотариальные акты XIX века), которые были автоматически транскрибированы с использованием технологии HTR. Преобразовывая рукописные страницы в машиночитаемый текст, архивы стремились радикально повысить доступность документов для исследователей и общественности. В рамках проекта архивисты-люди подготовили наборы данных для обучения и проверки, обеспечивая тем самым, что точность выходных данных ИИ-моделей и возможность им доверять.
Эндрю Поттер (Andrew Potter)
Источник: сайт Substack
https://metaarchivist.substack.com/p/augmenting-archival-access-through
четверг, 17 июля 2025 г.
Использование ИИ для идентификации каллиграфов по почерку: Опыт работы с рукописями Лопе де Вега
Полный текс статьи доступен по адресу https://www.revistahipogrifo.com/index.php/hipogrifo/article/view/1541/2376 .
Данная публикация обращает на себя внимание тем, что искусственный интеллект в данном случае пришёл в новую нишу. Распознавание рукописного текста с помощью ИИ вышло уже на такой уровень, что стала возможной биометрическая идентификация писцов-каллиграфов по почерку. Тем самым открываются новые любопытные возможности для использования ИИ в архивах :)
В аннотации на статью говорится:
«В настоящей статье представлен вычислительный подход к детектированию «каллиграфического следа» писца в большом корпусе документов.
Система использует достижения в сфере методов распознавания рукописного текста (Handwritten Text Recognition, HTR), обычно применяемых для автоматического транскрибирования, но в данном случае используемых для поиска конкретного представляющего интерес почерка при работе с обширной коллекцией рукописных текстов, в которой могут быть представлены десятки или даже сотни разных почерков.
Мы провели контрольный эксперимент с использованием текстов Лопе де Вега (известного испанского драматурга XVII века) и платформы Transkribus (удобной для исследователей, не являющихся компьютерными специалистами), - получив в итоге очень точные результаты: после обучения на документах, написанных почерком самого Лопе де Вега, а также почерками двухсот других писцов, система в состоянии выделить почерк Лопе де Вега в документах за пределами обучающего набора с высокими показателями успешности (точность, правильность, отзыв и оценка F1 в диапазоне 0,95-1,00).
Эти результаты прокладывают путь для обучения моделей почеркам лиц, представляющих для исследователей особый интерес (авторов, цензоров, переписчиков, бюрократов, актёров и т.д.), и для систематического сканирования существующих документов с целью выявления других документов, в написании которых они участвовали, - что в итоге может привести к открытиям литературного и культурно-исторического значения.»
Источник: сайт журнала «Гиппогриф»
https://www.revistahipogrifo.com/index.php/hipogrifo/article/view/1541/2376
четверг, 6 марта 2025 г.
Новая статья о коллективно используемой инфраструктуре, развиваемой сообществом, занимающимся автоматическим распознаванием текста
Помимо Мелиссы Террас, в группу авторов входят Беттина Анцингер (Bettina Anzinger), Пол Гудинг (Paul Gooding), Гюнтер Мюльбергер (Günter Mühlberger), Джо Нокельс (Joe Nockels), Аннемике Ромейн (C. Annemieke Romein), Энди Стаудер (Andy Stauder) и Флориан Стаудер (Florian Stauder).
Мой комментарий: READ-COOP, согласно информации на его сайте ( https://readcoop.org/ ), «… это кооператив, движущей силой деятельности которого являются поставленные цели. Наша миссия заключается в предоставлении всеобъемлющего спектра инструментов и услуг, которые дают возможность исследователям, учреждениям и отдельным лицам совместно проводить исследования и изучать богатую картину исторических событий. Наша платформа Transkribus охватывает весь процесс обеспечения доступности исторических документов, от сканирования и извлечения данных с помощью ИИ до онлайн-публикации. Мы верим в пользу развития прочных партнёрских отношений с заинтересованными сторонами, реинвестируем прибыли в нашу экосистему и отстаиваем социальную ответственность, одновременно предоставляя нашему сообществу уникальные технологии и поддержку». О решении Transkribus см. также подборку постов на моём блоге: https://rusrim.blogspot.com/search?q=Transkribus
В аннотации на статью, в частности, сказано следующее:
Предыстория
Технологии искусственного интеллекта (ИИ) и машинного обучения (МО) являются неотъемлемыми компонентами при разработки сложных цифровых инфраструктур. Коллективное владение и вклад заинтересованных сторон имеют решающее значение для создания ИИ-систем, которые являются как инновационными, так и подотчетными.
В данной статье рассматривается кооперативная платформа READ-COOP ( https://readcoop.eu ) - первый кооператив, который разработал и разместил в интернете собственные инструменты ИИ и МО ( https://transkribus.org ).
В настоящем исследовании демонстрируются возможности альтернативной модели кооперативного стратегического управления для инфраструктуры ответственного ИИ.
Методы
Мы используем для анализа развития проекта READ-COOP, после его трансформации из финансируемого Еврокомиссией проекта в деятельность на кооперативной основе, методологию Research In Action ( https://www.researchinaction.com – методология, ориентированная на вовлечение в процесс исследований и на учёт мнения субъектов исследований – Н.Х.) и анкеты с вопросами качественного характера. Мы оцениваем структуру кооператива, управление им и вовлечение сообщества в период с 2019 по 2024 год. Были собраны данные о динамике членства, об использовании решения Transkribus (решение на основе ИИ для распознавания рукописных текстов – Н.Х.), а также отзывы о стратегическом управлении кооперативом и об эффективности его оперативной деятельности.
Результаты
По состоянию на октябрь 2024 года, кооператив READ-COOP насчитывает 227 членов из 30 стран, что способствовало формированию прочной пользовательской базы из более чем 235 тысяч зарегистрированных пользователей. С помощью решения Transkribus было проведено транскрибирование около 90 миллионов цифровых графических образов исторических текстов, продемонстрировав тем самым эффективное использование ИИ в секторе культурного наследия. За это достижение была получена премия Евросоюза Horizon Impact Award 2020.
Кооперативный подход способствует демократическому принятию решений, что приводит к стабильному росту и существенному вовлечению заинтересованных сторон. Получаемая обратная связь качественного характера указывает на высокий уровень удовлетворенности стратегическим управлением кооператива и воспринимаемой целостностью и полезностью ИИ-инфраструктуры.
Выводы
Проект READ-COOP демонстрирует, что кооперативная модель ведения деловой деятельности способна эффективно поддерживать инфраструктуры ИИ и МО, одновременно способствуя демократическому участию и справедливому владению. Эта модель является жизнеспособным подходом и для других секторов, стремящихся разрабатывать ответственные и заслуживающие доверия ИИ-решения.
Мы полагаем, что кооперативные структуры особенно подходят для тех ИИ-инфраструктур, которые изначально финансировались за счёт государственных грантов, обеспечивая жизнеспособный переход от развития за государственный счёт к долговременному устойчивому существованию в собственности сообщества.
Мы рекомендуем более широкое применение и изучение возможностей кооперативных моделей для размещения и разработки технологий ИИ и МО, чтобы обеспечить их ответственное создание, стратегическое управление и использование.
Источник: сайт Еврокомиссии «Открытые исследования в Европе»
https://open-research-europe.ec.europa.eu/articles/5-16
среда, 23 ноября 2022 г.
Продолжается регистрация на два вебинара, которые DLM-форум проведёт до конца 2022 года
Вебинар «Метаданные: Голландский стандарт, его использование и сравнение со стандартами других стран» (Metadata: The Dutch standard, its use and international comparison) пройдёт 29 ноября 2022 года, в 16:15 по московскому времени (14:15 CET).
Автор: Винсент Хулт (Vincent Hoolt – на фото справа) из Национальных Архивов Нидерландов.
«В течение многих лет в Голландии существовали две схемы метаданных - одна для местных органов власти и вторая - для органов центрального правительства. Они были похожи, но при этом имелся ряд существенных отличий. Кроме того, качество захватываемых метаданных сильно различалось.
Вдобавок к этим проблемам, обе схемы по-прежнему в значительной степени основывались на «бумажной» идеологии применительно к электронным документам, т.е. исходили из того, что все документы будут помещены в дела, дела – сгруппированы в серии, и так далее. Это не соответствует реальной обстановке на местах, где информация поступает во всех формах и размерах, и может быть организована различными способами.
Итак, перед Национальными Архивами Голландии была поставлена ясная задача: разработать новую схему метаданных для передачи жизнеспособных и доступных информационных объектов между системами. При этом необходимо было принять во внимание существующие проблемы и решать их. Кроме того, следовало разработать руководство по фактическому осуществлению передачи электронных документов на архивное хранение. Именно это мы и сделали - однако на этом мы не остановились. Мы также внимательно рассмотрели вопросы содействия принятию и внедрению стандарта.
На этом вебинаре мы расскажем, как мы разрабатывали стандарт, соответствующий, как мы надеемся, новой эпохе; и как Вы можете поработать над внедрением стандарта.
Конечно, мы не забываем о международных разработках, об их взаимосвязи с нашим стандартом и руководством по созданию информационных сдаточных SIP-пакетов, и о других вопросах.»
Регистрация на вебинар открыта на сайте DLM-форума: https://dlmforum.eu/index.php/all-events/134-webinars-2022
Вебинар «Распознавание рукописного текста в Национальных Архивах Эстонии - Наш опыт работы с системой Transkribus» (Handwritten Text Recognition at the National Archives of Estonia – our Experiences with Transkribus) пройдёт 8 декабря 2022 года, в 16:15 по московскому времени (14:15 CET).
Автор: Свен Лепа (Sven Lepa – на фото справа) из Национальных Архивов Эстонии.
«Распознавание рукописного текста в исторических документах с помощью решений на основе искусственного интеллекта за последние несколько лет приобрело большую популярность, и компания Transkribus является одним из главных поставщиков таких решений.
Мой комментарий: О решении Transkribus см. также посты на моём блоге: https://rusrim.blogspot.com/2018/03/blog-post_26.html и https://rusrim.blogspot.com/2019/07/blog-post_3.html
Национальные Архивы Эстонии начали свои первые эксперименты с Transkribus в 2018 году. В октябре 2022 года мы открыли публичный доступ к трем различным автоматически транскрибированным коллекциям:
- Петиции к генерал-губернатору Эстонской губернии (1630–1707 гг.),
- Протоколы Тартуской городской думы (1902–1940 гг.), и
- Метрические книги приходов русской православной церкви (1838–1926 гг.).
В докладе будет представлен обзор нашего опыта работы с программным обеспечением для распознавания рукописного текста (handwritten text recognition, HTR) Transkribus.
Свен Лепа (Sven Lepa) - заместитель начальника отдела обеспечения доступа и ответов на запросы Национальных Архивов Эстонии, работающий над различными способами повышения удобства использования оцифрованных источников - от краудсорсинга до распознавания текста. Он является руководителем проекта использования Transkribus в Национальных Архивах Эстонии.»
Регистрация на вебинар открыта на сайте DLM-форума: https://dlmforum.eu/index.php/all-events/134-webinars-2022
Источник: LinkedIn / сайт DLM-форума
https://www.linkedin.com/posts/dlm-forum_two-more-webinars-for-the-dlm-forum-community-activity-7000739359817662464-xbmq
https://dlmforum.eu/index.php/all-events/134-webinars-2022
среда, 3 июля 2019 г.
Великобритания: Как научить компьютер читать?
Заметка электронного архивиста Национальных Архивов Великобритании Франчески Маккензи (Francesca Mackenzie – на фото) была опубликована 13 мая 2019 года на блоге Национальных Архивов.
Когда Вы читали заголовок этого блога, Вам, возможно, приходила в голову мысль: «Зачем нам вообще нужно, чтобы компьютер мог читать?». Ответ на этот вопрос заключается в том, что, несмотря на огромный размер онлайн-каталога Discovery («Открытие») Национальных Архивов Великобритании (см. https://discovery.nationalarchives.gov.uk/ ), существует гораздо больше информации об этих фондах! Компьютеры могут помочь нам раскрыть эту ранее скрытую информацию.
Возьмём, например, серию PROB 11 ( https://discovery.nationalarchives.gov.uk/details/r/C12122 ) - обширный набор зарегистрированных экземпляров завещаний, подтверждённых прерогативным судом Кентербери (Prerogative Court of Canterbury). Документы относятся к периоду с 1384 по 1858 год и содержат богатейшую информацию о местах, бенефициарах, семьях, взаимоотношениях, товарах, религии, ценностях и земельной собственности, и о многом другом.
Одно завещание может содержать информацию о нескольких людях, однако в приведенном в каталоге описании указаны лишь завещатель, место и дата, что затрудняет поиск по остальным данным. Имея дело с 2 тысячами томов, каждый из которых содержит тысячи страниц, добавление дополнительной информации стало бы колоссальной задачей для волонтёров, которым пришлось бы извлечь более «сложные» данные или подготовить протранскрибировать документы. Именно в таких ситуациях нам бы не помешала помощь.
Недавно я закончила в Национальных Архивах работу по гранту «Ранняя карьера» (Early Career Fellowship) в Национальном архиве – он стал первым из грантов, очень щедро спонсированных «Друзьями Национальных Архивов» (Friends of The National Archives, https://ftna.org.uk/ ). Выделенное мне место было в составе группы электронных исследований (Digital Research Team), и я помогала в одном из их текущих исследовательских проектов, а именно в транскрибировании документов серии PROB 11 с использованием машинного обучения. Тема была достаточно широкой, рассматривались различные варианты краудсорсинга в сочетании с процессами распознавания рукописного текста с использованием программного обеспечения Transkribus.
Transkribus (см. https://transkribus.eu/Transkribus/ ) - это программное обеспечение, которое каждый может скачать, и которое может читать рукописные документы. Для этого требуется подготовить полную транскрипцию (расшифровку) обучающей выборки документов. Документы из обучающей выборки и их транскрипции загружаются в программное обеспечение, которое затем создает модель почерка. Эту модель оно может использовать для прочтения других документов, написанных тем же стилем почерка. Как только начнут поступать результаты на основе модели, мы можем повысить точность, сообщая программе об ошибках, - в итоге получая всё более и более качественные результаты.
Что касается обучения, то компьютеры очень похожи на людей: большее количество примеров и опыта позволяют им намного лучше читать текст. Если вы попросите компьютер прочитать текст, написанный почерком, которого он раньше не видел, он, возможно, не справится с это задачей; а слова, которые он видит реже, будут правильно прочитаны с меньшей вероятностью. Именно поэтому такие коллекции, как серия PROB 11, идеально подходят для экспериментов с программным обеспечение такого типа, поскольку тексты очень формализованы, а стиль письма является стабильным.
Чем мы можем здесь помочь? По ходу всего процесса есть две точки, где свой вклад вносит человек – это полная транскрипция в самом начале, а также на стадии корректировки результатов. Многим нравится транскрибировать документы, но вот коррекция выданных компьютером результатов рассматривается как более обыденная задача, которая не столь увлекательна. Однако, с точки зрения эффективности, корректировка документов занимает гораздо меньше времени.
Значительная часть данного исследовательского проекта заключалась в том, чтобы сделать корректировку более приятным и легким для пользователя делом, с учётом основных мотивов, по которым люди занимаются расшифровкой документов.
Это исследование можно разделить на три ключевые области. Первая – поиск способа визуализации поправок на большом экране. Чтобы выделить области, которые с наибольшей вероятностью могут быть ошибочными, и сделать их более легко находимыми, мы использовали инструмент обработки текстов на естественном языке (Natural Language Processing) для оценки вероятностей того, что Transkribus мог ошибиться. Затем, используя эти вероятности, мы подсвечивали определенные строки, которые больше всего нуждались в корректировке, с тем, чтобы пользователи могли в первую очередь сосредоточиться на них. Было очень весело использовать разные цвета для выделения.
Что касается мотивации заниматься расшифровкой документов, волонтерам часто доставляет удовольствие знать контекст и историческую подоплёку тех документов, которые они обрабатывают. Когда отображается полная страница, появляется возможность не только вносить исправления, но и прочитать документ целиком.
Вторая область исследований была связана с анализом краудсорсинговых проектов в различных секторах. Самые захватывающие проекты опирались на две или более мотивации для волонтёров. Был, например, проект, в котором группа устраивала пробежку, а также расписывала общественный центр, тем самым одновременно помогая сообществу и способствуя укреплению физической формы и социальному общению участников. Волонтерские проекты, благодаря которым их участники изучали или развивали определенные навыки, также были очень успешными.
Ещё одним важным фактором были инициативы, позволяющие экономить время. Если у Вас есть возможность делать два или более дел одновременно, вероятность успешности проекта выше. Краудсорсинг и волонтерство должны вписываться в жизнь людей, и это демонстрирует рост числа инициатив по микро-волонтерству.
Среднестатистический гражданин Великобритании каждый день проводит около часа в пути. С учётом этого мы провели кое-какие эксперименты с идеей разработки мобильных приложений и транскрибирования «на ходу», с дополнительной целью – получить возможность одновременно обучать пользователя палеографии. Мы создали демо-версию мобильного приложения под названием «Многие руки» (Many Hands), в котором пользователю предлагаются упражнения для улучшения навыков палеографии «на ходу», в то же время одновременно корректирую результаты, полученные от Transkribus.
Наконец, мы внимательно рассмотрели способы сделать транскрибирование увлекательным для тех, кто, возможно, вообще не знает об этой работе. В результате в начале этого года мы провели игровую джем-сессию (Game Jam) совместно с проектом «Транскрибирование Бентама» (Transcribe Bentham Project) Университетского колледжа Лондона (University College London, UCL) и с командой UCL «Инновации и предпринимательство» (Innovation and Enterprise). Более подробную информацию об этом можно найти в наших предыдущих постах здесь: https://blogs.ucl.ac.uk/transcribe-bentham/2019/02/28/project-update-game-jam/ и здесь: https://blog.nationalarchives.gov.uk/blog/hacking-past-archives-game-jam/ .
Целью игровой сессии было сделать более увлекательным процесс корректировки и расшифровки. В ней приняло участие 55 человек с различными интересами и точками зрения, от ученых до разработчиков игр, и они выдвинули ряд удивительно изобретательных предложений. Победила идея, представлявшая собой вариант игры Frogger, в которой игрок должен уклоняться и транскрибировать уголовные документы из серии HO13. Смотрите сами! (здесь: https://nationalarchives.github.io/transcribegames/ ). Это был большой успех, и мы получили на сессии не только множество новых фантастических идей, но и уверенность в том, что транскрибирование может быть весёлым и занимательным для всех!
Хочу выразить огромную благодарность «Друзьям Национальных Архивов» за поддержку этого исследования, а также сотрудникам UCL и проекту «Транскрибирование Бентама» ( https://www.ucl.ac.uk/bentham-project/transcribe-bentham ), особенно д-ру Луизе Сиворд (Louise Seaward), которая сделала возможной проведение игровой сессии.
Франческа Маккензи (Francesca Mackenzie)
Источник: блог Национальных Архивов Великобритании
https://blog.nationalarchives.gov.uk/how-to-teach-a-computer-to-read/
















