Показаны сообщения с ярлыком неструктурированные данные. Показать все сообщения
Показаны сообщения с ярлыком неструктурированные данные. Показать все сообщения

среда, 21 января 2026 г.

Переосмысление различия «структурированная – неструктурированная информация»: Почему нам, специалистам по управлению документами, следует прекратить считать данные «не нашей проблемой» (3)

(Окончание, предыдущую часть см. http://rusrim.blogspot.com/2026/01/2_01349305473.html )

Заключительное замечание - и приглашение

Идеи Карла Мелроуза очень важны, равно как и время их появления. Переход к структурированным системам не замедляется. Искусственный интеллект меняет то, каким образом мы структурируем контент. Государственные органы переписывают правила, касающиеся данных. Сообществам архивистов и специалистов по управлению документами всё чаще приходится сталкиваться с реляционной, процессной и алгоритмической природой современных свидетельств / доказательств.

Если Вы ещё не читали оригинальный пост Карла, обязательно сделайте это,  а затем подпишитесь на его раздел Meta-IRM в социальной сети Substack. Публикации Карла – одни из немногих в нашей профессиональной области, в которых концептуальная ясность сочетается с пониманием практических сложностей повседневной работы.

Мой комментарий: Многие посты Карла Мелроуза переведены на русский язык, см. подборку
http://rusrim.blogspot.com/search?q="Карл+Мелроуз"&max-results=20&by-date=true 

Непрерывное пространство, континуум между более структурированной и менее структурированной информацией - вот наш реальный ландшафт, а не унаследованные нами однозначные категории, и не те изгороди, которые мы возвели, чтобы защитить то, что казалось нам привычным.

  • Непрерывное пространство - это место, где «живут» доказательства,

  • Непрерывное пространство - это место, где кроется риск,

  • Непрерывное пространство - это место, где организации ожидают от нас лидерства,

  • И именно в этом непрерывном пространстве определится будущее управления документами.

Ресурсы и дополнительная литература

Идеи, отражённые в данной статье, основаны на большом количестве исследований, стандартов и профессиональных комментариев, авторами которых являются представители мирового сообщества специалистов по управлению документами и информацией. 

Перечисленные ниже ресурсы позволяют глубже понять непрерывное пространство, соединяющее структурированную и неструктурированную информацию, конвергенцию управления документами и управления данными, а также эволюционирующие ожидания в отношении подотчётности и стратегического управления.

Ассоциация специалистов по управлению документами ARMA International

  • Ник Инглис (Inglis, Nick) «Пара основополагающих концепций» (A Pair of Foundational Concepts), ARMA Magazine, 2019, https://magazine.arma.org/2019/06/a-pair-of-foundational-concepts/ 

    В статье дано чёткое объяснение взаимосвязи между контентом, данными и документами, а также того, почему форма не определяет доказательную ценность.

Ассоциация специалистов по управлению контентом AIIM

  • Различные отчёты из серии «Обзоры состояния отрасли» (AIIM Industry Watch Reports).

    Изучение вопросов, связанных с неструктурированной информацией, с метаданными, с проблемами унаследованных файловых хранилищ и накопления избыточных, устаревших и тривиальных данных (redundant, outdated and trivial, сокращённо ROT т.е. «гниль» - Н.Х.)

Стандарты и технические отчёты Международной организации по стандартизации (ИСО) 

  • Стандарт ISO 15489-1:2016 «Информация и документация - Управление документами - Часть 1: Понятия и принципы» (Information and documentation - Records management - Part 1: Concepts and principles, см. https://www.iso.org/standard/62542.html и https://www.iso.org/obp/ui/en/#!iso:std:62542:en - стандарт адаптирован в России как ГОСТ Р ИСО 15489-1-2019 (ISO 15489-1:2016) «Система стандартов по информации, библиотечному и издательскому делу. Информация и документация. Управление документами. Часть 1. Понятия и принципы», см.  https://protect.gost.ru/document1.aspx?control=31&baseC=6&id=232615  – Н.Х.),

    Включает основополагающее определение понятия «документ» как информации, сохраняемой в качестве доказательства, вне зависимости от формата.

  • Технический отчёт ISO/TR 8344:2024 «Информация и документация – Вопросы и соображения относительно управления документами в средах структурированных данных» (Information and documentation - Issues and considerations for managing records in structured data environments), см. https://www.iso.org/standard/83138.html и https://www.iso.org/obp/ui/en/#!iso:std:83138:en .

    Ключевой по важности документ для понимания того, как базы данных, приложения и структурированные системы создают документы и управляют ими, - и как специалисты по управлению документами и данными должны взаимодействовать в интересах стратегического управления структурированными данными.

Теория континуума документов (Records Continuum Theory)

  • Работы Фрэнка Апворда (Frank Upward), Сью Маккеммиш (Sue McKemmish), Ливии Яковино (Livia Iacovino) и других авторов.

    Совокупность работ, переосмысливающих концепцию управления документами как встроенного в деловые процессы и системы. Эта теория поддерживает нейтральное по отношению к формату, системно-интегрированное управление документами.

Научная литература

  • Джон Макдональд (John McDonald) «Управление документами и управление данными: Устранение разрыва» (Records management and data management: Closing the gap), Records Management Journal (1989) 1 (1): 4–11, см. https://www.emerald.com/rmj/article-abstract/1/1/4/369345/Records-Management-and-Data-ManagementClosing-the?redirectedFrom=fulltext 

    В статье утверждается, что различие между управлением документами и управлением данными во многом историческое, и что организации должны всесторонне управлять всеми информационными активами.

  • Ким Юсын (Kim Youseung) «Исследование правовых вопросов управления государственными данными как документами: Анализ закона о предоставлении и использовании государственных данных» (A Study on Legal Issues of Public Data Management as Records: Focused on Analysis of the Act on Provision and Use of Public Data),  Journal of Korean Society of Archives and Records Management), 2014, 14(1), pp.53-73, см. https://journal.kci.go.kr/jksarm/archive/articleView?artiId=ART001853408 

    В статье в глобальном контексте рассматриваются структурированные наборы данных как государственные документы.

  • Кейт Гамильтон (Kate Hamilton) «Структурированные элементы данных: Являются ли они документами?» (Structured data elements: Are they records?), ARMA, Information Management Journal (Vol. 45, Issue 2), March-April 2011, см. https://go.gale.com/ps/i.do?p=AONE&u=anon~9a379224&id=GALE%7CA260137193&v=2.1&it=r&sid=googleScholar&asid=a031e89c 

    Практическое исследование того, когда отдельные элементы данных соответствуют критериям «документа», и что это означает для проведения экспертизы ценности и установления им сроков хранения.

Стратегическое управление информацией и управление данными

  • Дараг О’Брайен (Daragh O’Brien) «Данные - рискованное дело: структурированные, неструктурированные - кого это волнует?» (Data Is Risky Business: Structured, Unstructured, Who Cares?), The Data Administration Newsletter, December 4, 2024, https://tdan.com/data-is-risky-business-structured-unstructured-who-cares/32252 

    Ориентированная на специалиста-практика аргументация в пользу того, что различие между структурированными и неструктурированными всё больше устаревает в эпоху искусственного интеллекта.

  • Джон Филлипс (John Phillips) «Сопоставление структурированных и неструктурированных документов. Серьёзно?» (Structured vs Unstructured Records. Really?), блог сообщества AIIM, 08 июня 2011 г., https://community.aiim.org/blogs/john-phillips/2011/06/08/structured-vs-unstructured-records%E2%80%93-really 

    В данном посте объясняется скрытая структура внутри так называемого неструктурированного контента, и встроенный в данные повествовательный контекст.

Руководства государственных органов и регуляторов

  • Директивы органов федерального правительства США по вопросам управления документами, в том числе:
    • Директива М-12-18 от 24 августа 2012 года по управлению государственными документами (Managing Government Records Directive, https://www.archives.gov/files/records-mgmt/m-12-18.pdf , см. также мой пост http://rusrim.blogspot.ru/2012/08/i_27.html - Н.Х.)

    • Меморандум OMB/NARA M-19-21 Административно-бюджетного управления президентской администрации (Office of Management and Budget, OMB) и Национальных Архивов США (NARA) «Переход к электронным документам» (Transition To Electronic Records, https://www.whitehouse.gov/wp-content/uploads/2019/08/M-19-21-new-2.pdf , см. также мой пост http://rusrim.blogspot.com/2019/07/blog-post_8.html - Н.Х.)

      Меморандум подтверждает предпочтительность ведение документации в электронном виде и включение данных в состав федеральных документов.

  • «Общие правил защиты персональных данных» (General Data Protection Regulation, GDPR, https://eur-lex.europa.eu/legal-content/EN/TXT/?qid=1532348683434&uri=CELEX:02016R0679-20160504 – европейский закон о защите персональных данных – Н.Х.).

    Закон укрепляет унифицированное стратегическое управление персональными данными во всех форматах, как структурированных, так и неструктурированных.

Обеспечение долговременной сохранности и доступности электронных материалов

  • «Что такое документ – и почему нам необходимо обеспечивать долговременную сохранность документов?» (What is a record? (and why do we need to preserve them)?), Коалиции по электронной сохранности (Digital Preservation Coalition, DPC. Великобритания), см. https://www.dpconline.org/digipres/implement-digipres/edrms-preservation-toolkit/edrms-toolkit-what-is-a-record 

    Подробно описывает обеспечение сохранности контента, контекста и структуры, в том числе для документов, созданных в структурированных системах.

Кодексы профессиональной практики и аналитические отчёты

  • «Управление информацией касается не только неструктурированных данных» (Information management is not just for unstructured data), Wortzmans, August 19 2015, см. https://www.lexology.com/library/detail.aspx?g=f13ec35a-e505-4a1d-abe5-af16258a0463 

    В статье показано, что среды структурированных данных часто накапливают избыточные, устаревшие и тривиальные данные (ROT), и требуют строгих мер, обеспечивающих надлежащее уничтожение/передачу данных.

  • «Все документы - это информация, но не всякая информация - документ» (All records are information, but not all information is a record), компания Access Corp. 

    Описывает унификацию стратегического управления данными и документами с точки зрения жизненного цикла информации.

Эндрю Поттер (Andrew Potter)

Источник: сайт Substack
https://metaarchivist.substack.com/p/rethinking-the-structuredunstructured 

вторник, 20 января 2026 г.

Переосмысление различия «структурированная – неструктурированная информация»: Почему нам, специалистам по управлению документами, следует прекратить считать данные «не нашей проблемой» (2)

(Продолжение, начало см. http://rusrim.blogspot.com/2026/01/1_02087587809.html )

Ясное видение непрерывного пространства: Не две крайности, а плавный переход

Стоит перестать мыслить крайними категориями «структурированный» и «неструктурированный», как ландшафт оживает:

  • Документы содержат встроенные метаданные, историю версий, структуру визуального представления, и часто - скрытые XML-слои.

  • В базах данных имеются поля для комментариев, вложения, аннотации и ненормализованный текст.

Практически ничто не существует в чистом виде, везде присутствуют смешанные и переходные состояния. Завораживает даже то, как информация перемещается в рамках этого непрерывного пространства.

Запутанный документ в формате Word становится более структурированным, когда:

  • Из него извлекаются сущности,

  • Он размечается посредством добавления метаданных,

  • К нему применяется workflow-процесс,

  • Он связывается со взаимосвязанным контентом.

Структурированная таблица становится более описательной, когда:

  • На её основе генерируется отчёт,

  • Создается контрольная панель (dashboard) для мониторинга,

  • Объясняются относящиеся к ней бизнес-правила,

  • Проводится миграция таблицы её в информационный пакет для обеспечения её долговременной сохранности.

Непрерывное пространство / континуум является «живым». Документы перемещаются в его рамках, и вместе с этим меняются интерпретация и технологии. И нам [специалистам по управлению документами – Н.Х.] тоже следует меняться.

Как мы унаследовали выдуманные границы и почему они сейчас рушатся

Разрыв [между структурированным и неструктурированным – Н.Х.] возник не из теории. Он является следствием предыстории.

Десятилетиями дисциплина управления документами развивалась «под сенью» бумаг, шкафов для документов, классификационных схем и архивов. Мы знали, как работать с документами. У нас были накоплены десятилетия институциональной памяти в этой области, и был для этого выработан свой язык.

Управление данными возникло из вычислений, из структурированных систем, из реляционных моделей, языка SQL, схем и архитектур хранения данных. Здесь иная терминология, иная система ценностей, другая профессиональная среда.

И эти два мира эволюционировали по отдельности.

Долгие годы такое разделение сохранялось. В течение первых десятилетий цифровой эпохи оно даже имело смысл, - когда количество деловых информационных систем было ограничено, и доминировали специализированные систем для хранения документов.

Но к настоящему времени этот мир ушёл в историю. Сегодня основные свидетельства / доказательства практически любой деловой операции хранятся не в файле документа, а в системе. Примеры:

  • Возврат средств одобряется в POS-приложении в точке продажи,

  • Разрешение выдаётся в рамках инструмента рабочего процесса,

  • Инцидент, относящийся к соблюдению законодательно-нормативных требований, протоколируется на платформе управления заявками на обслуживание (case-management platform),

  • Контракт формируется, поддерживается, корректируется и закрывается в системе управления закупками, а не в аккуратной структуре папок с документами.

Если ограничиться одной только документарной частью непрерывной области, то мы будем видеть лишь «тени», отбрасываемые деловой деятельностью, а не саму эту деятельность. Это будет не управление документами, а делопроизводственный «туризм».

Вход в непрерывное пространство: Как это выглядит на практике


Принятие нами представления о непрерывном пространстве [соединяющем структурированное и неструктурированное – Н.Х.]  означает изменение нашего поведения.

Во-первых, мы начинаем рассматривать [деловые – Н.Х.] системы как среды управления документами

CRM-система управления взаимоотношениями с клиентами — это не просто база данных клиентов. Это среда управления документами для жалоб, согласований, эскалаций и решений.

HR-система управления кадрами - это не просто платформа для сведений о персонале. Она содержит свидетельства кадровых решений, которые могут повлиять на карьеру, судебные разбирательства и права сотрудников.

ERP-система планирования корпоративных ресурсов - это не просто поддерживающая финансовая система. В ней хранится цепочка обязательств, платежей и ответственности, с возможностью проведения её аудита.

Если в какой-то системе присутствуют свидетельства / доказательства, значит, в ней есть документы. При видении на основе идеи «непрерывного пространства», это является исходным предположением, а не исключением.

Во-вторых, мы устанавливаем для структурированных данных сроки хранения и действия по уничтожению/передаче по истечении этих сроков

Это один из самых трудных изменений. Установление сроков хранения для баз данных требует:

  • Выявления относящихся к деловой деятельности сущностей и полей,

  • Сопоставления сущностей и полей с категориями документов,

  • Проектирования функциональных возможностей для удаления и/или архивации данных,

  • Документирования изменений в схеме базы данных,

  • Экспорта документов вместе с метаданными, а не только экспорта данных.

В техническом отчёте ISO/TR 8344 совершенно чётко говорится о том, что эти задачи относятся к экосистеме стратегического управления (governance ecosystem).

В-третьих, мы проектируем системы с учётом потребностей управления документами

Это означает:

  • Учёт требований к управлению документами в ходе проведения закупок,

  • Сотрудничество с архитекторами и инженерами, начиная с ранних этапов создания систем,

  • Требования о ведении журналов аудита, выполнении проверок целостности и наличии метаданных о происхождении,

  • Обеспечение интерпретируемости структур данных во времени.

Всё это – практическая реализация принципа «запроектированного управления документами».

В-четвёртых, мы используем наличие непрерывного пространства, а не боремся с ним

Документы становятся более управляемыми при добавлении структуры. Данные становятся более осмысленными при добавлении описаний / повествования (narrative). Стратегическое управление улучшается при движении в обоих направлениях.

«Момент подотчётности»: Почему всё это важно сейчас

В конце своего поста Карл Мелроуз делает кое-что важное - он переосмысливает вопрос о подотчётности.

Нам часто говорят, что основная задача управления документами заключается в обеспечении подотчётности. Карл высказывает мысль о том, что та [весьма неблагоприятная – Н.Х.] ситуация, в которой мы [специалисты по управлению документами – Н.Х.] оказались сейчас, может рассматриваться как своего рода привлечение нас к ответственности нашими организациями за то, что мы выполняем свои обязанности не во всём информационном ландшафте. Это неприятная идея, но она звучит правдоподобно …

Если мы отказываемся работать со структурированными средами, то мы частично ответственны за:

  • неисполнение законодательно-нормативных требований,

  • утечки персональных данных,  

  • ненадлежащее обеспечение долговременной сохранности электронных материалов,

  • неполноту журналов аудита,

  • неэффективные решения в ходе экспертизы ценности,

  • неуправляемые унаследованные системы,

  • данные, которые не уничтоженные по истечении законных оснований для их обработки,

  • документы, которые утрачивают смысл вследствие исчезновения их контекста.

Доверие сначала постепенно деградирует, а затем внезапно теряется.

Хорошая новость заключается в том, что доверие можно восстановить, если представители нашей профессии в полной мере и уверенно начнут выполнять свои обязанности на протяжении всего информационного ландшафта.

(Окончание следует, см. http://rusrim.blogspot.com/2026/01/3_01929276072.html )

Эндрю Поттер (Andrew Potter)

Источник: сайт Substack
https://metaarchivist.substack.com/p/rethinking-the-structuredunstructured 

понедельник, 19 января 2026 г.

Переосмысление различия «структурированная – неструктурированная информация»: Почему нам, специалистам по управлению документами, следует прекратить считать данные «не нашей проблемой» (1)

Разговор о том, как специалисты по управлению документами потеряли контроль над половиной информационного ландшафта, - и как его можно было бы вернуть

Данный пост эксперта в области управления электронными документами, эксперта ИСО от США Энди Поттера (Andy Potter - на фото) был опубликован 22 ноября 2025 года в социальной сети Substack.

Иногда одна-единственная идея застаёт тебя врасплох и затем не отпускает. О ней читаешь однажды, киваешь, соглашаясь с очевидной истиной, а затем обнаруживаешь, что размышляешь над ней посреди совещания или же во время тихой утренней прогулки, когда тебя посещают мысли, касающиеся более масштабных вопросов.

Именно так на меня подействовал пост Карла Мелроуза (Karl Melrose) «Континуум, о котором нам следует думать в области управления документами и информацией», опубликованный в октябре 2025 года на его блоге Meta-IRM (см. https://metairm.substack.com/p/the-continuum-we-should-be-thinking - перевод есть на моём блоге: https://rusrim.blogspot.com/2025/12/blog-post.html – Н.Х.). Его основная идея не была ни яркой, ни кричащей – это была одна из тех идей, которые, когда их сформулируют, кажутся настолько интуитивно понятными, что удивляешься, почему мы не подумали об этом раньше.

Суть её была следующей: «На деле территория, охватываемая управлением документами и информацией, представляет собой континуум между более структурированной и менее структурированной информацией». Не граница, не два лагеря, не выбор между двумя вариантами – а непрерывное пространство, континуум, целый ландшафт.

И один раз начав видеть мир таким образом, впоследствии будет очень сложно вернуться к старым представлениям.


Данная статья – это моя попытка пройтись по этому ландшафту вместе с Вами. Смотрите на неё как прогулку вместе с гидом по склону структурированность-неструктурированность, с остановками по пути, позволяющими познакомить вас с теорией, стандартами, метафорами и практическими выводами, вытекающими из публикации Карла.

По дороге нас ждут кое-какие некомфортные осознания того, как до сих пор вела себя наша профессия [управление документами и архивное дело – Н.Х.], и мы также увидим ряд явных возможностей для восстановления актуальности профессии и доверия к ней.

Итак, давайте зашнуруем башмаки и выйдем на тропу.

С чего всё начинается: Структура, шум и места, которых мы избегаем

Свой пост Карл начинает с наблюдения, о котором известно каждому, кто когда-либо пытался найти смысл в файловой помойке или в плохо спроектированной базе данных: в отсутствие структуры, информация представляет собой шум.

Мы хорошо это знаем. Каждый раз, сталкиваясь с неупорядоченным системой хранения файлов на общих дисках, или с неприкаянной цепочкой электронных писем без темы, или системой, которая позволяет сотрудникам вводить что угодно в любое поле, - мы ощущаем засасывающую силу беспорядка. Структура – это то, что превращает беспорядок в знания; это те строительные леса, которые позволяют информации «стоять прямо».

Вот почему поразительно то, насколько избирательно наша профессия уважает структуру.

Дайте нам [архивистам и специалистам по управлению документами – Н.Х.] в руки специализированную EDRMS-систему управления документами и контентом (т.е. СЭД, ECM и т.п. – Н.Х.), и мы с радостью будем заниматься созданием и поддержанием структуры день и ночь напролёт. Мы будем разрабатывать схемы метаданных и потоки процессов согласования и утверждения; будем проектировать иерархические структуры классификационных схем, поддерживающие поиск, управление сроками хранения и уничтожение/передачу контента по их истечении; будем настаивать на том, чтобы пользователи следовали соглашениям об именовании. Мы будем объявлять о победе, когда документ будет «захвачен».

Но покажите нам полную жалоб CRM-систему управления взаимоотношениями с клиентами, или полную финансовых транзакций ERP-систему, или полную решений систему управления заявками на обслуживание, - и слишком многие службы управления документами скажут что-то вроде: «Это работа для ИТ-служб».

Ирония заключается в том, что в подобных структурированных средах имеются более мощные встроенные меры и средства управления, валидации, сохранения сведений о контексте и происхождении, чем в любом хранилище документов. Зачастую именно в этих средах на самом деле ведётся деловая деятельность и создаются свидетельства / доказательства.

Так почему же мы делаем вид, что структурированные среды находятся вне нашей зоны ответственности?

Отвечая на этот вопрос, Карл Мелроуз указывает на привычку, историю и культуру. Места, которых мы избегаем, редко бывают местами, где отсутствует структура. Это те места, в отношении которых мы решили, что их структура - не наша забота. И данное решение имеет последствия.

Теория, стандарты и мировая практика говорят об одном и том же

Стоит начать изучать вопрос, и мысль Карла начинает казаться почти что общеизвестной. Куда ни посмотри, были те, кто годами говорил нам об этом.

В стандартах соответствующие предупреждения даются уже в течение двух десятилетий 

Стандарт ISO 15489 «Информация и документация - Управление документами» и в 2001 году (когда была опубликована его первая редакция – Н.Х.) и снова в 2016 году (когда была опубликована ныне действующая вторая редакция – Н.Х.) сказал о том, что документность определяется функцией и доказательной ценностью контента, а не форматом. В стандарте отмечается, что системы, контекст и структура важны вне зависимости от вида носителя информации.

Разработанная в Австралии «Модель континуума документов» (Records Continuum Model) опровергла представление о том, что документы всегда чётко и поэтапно проходят путь от создания до передачи на архивное хранение. Взамен в данной модели было предложено видение, согласно которому управление документами вплетено в системы, процессы и в действия по мере их выполнения. Управление документами изначально встроено в архитектуру систем, а не добавляется к ним уже впоследствии.

Опубликованный в 2024 году технический отчёт ISO/TR 8344 «Информация и документация – Вопросы и соображения относительно управления документами в средах структурированных данных» также прямо заявляет о том, что в структурированных средах данных создаются документы. В современных организациях такие среды входят в число важнейших мест хранения документов и управления ими. Игнорирование этих сред может привести к компрометации целостности, аутентичности и подотчётности в целом.

Иными словами, стандарты годами держали перед нашими глазами зеркало, просто нам не всегда нравилось то, что в нём отражалось.

Профессиональная литература высказывается ещё более прямо

Ассоциации специалистов по управлению документами (ARMA) и контентом (AIIM), американский Национальный институт стандартов и технологий NIST, национальные органы управления архивным делом и учёные из академических учреждений сходятся к одной и той же идее, представленной в различных вариациях:

  • Всё есть информация,

  • Вся информация располагается где-то в непрерывном пространстве, простирающемся от более структурированной до менее структурированной информации,

  • Любая информация может стать документом в зависимости от выполняемой ею функции,

  • Стратегическое управление рассыпается, если мы считаем «легитимным» только один участок этого непрерывного пространства.

Специалисты-практики, такие как Дара О’Брайен (Daragh O’Brien), идут ещё дальше, утверждая, что само по себе противопоставление структурированного и неструктурированного в настоящее время является ложным. Искусственный интеллект способен структурировать текст. Люди придают смысл данным. Ничто не находится исключительно в одной крайней точке, и снова возникает непрерывное пространство, соединяющее крайности.

По всему миру государственные органы и учреждения уже признали такое положение дел


Практика органов и учреждений государственного сектора в различных юрисдикциях подтверждает высказанное утверждение. Так, например:

  • Южная Корея обеспечивает сохранность структурированных наборов данных в качестве официальных документов;

  • Эстония (ну как же без неё! – Н.Х.) рассматривает транзакции микросервисов как авторитетные документальные следы;

  • Законодательство Евросоюза о защите персональных данных (закон GDPR) требует единообразной обработки персональных данных во всех форматах;

  • В США под требования федерального законодательства к управлению документами явным образом подпадает вся цифровая информация, включая базы данных.

В глобальном масштабе сейчас уже не дискутируется вопрос о том, создают ли структурированные системы документы или нет. Единственный спорный момент заключается в том, признают ли это специалисты по управлению документами ....

(Продолжение следует, см. http://rusrim.blogspot.com/2026/01/2_01349305473.html )

Эндрю Поттер (Andrew Potter)

Источник: сайт Substack
https://metaarchivist.substack.com/p/rethinking-the-structuredunstructured 


вторник, 16 сентября 2025 г.

Неструктурированные данные: Происхождение, эволюция и управление ими, часть 2

(Окончание, начало см. http://rusrim.blogspot.com/2025/09/1_01983497634.html )

Управление неструктурированными данными: Общие стратегии

По мере роста объёма неструктурированных данных, организации применяют несколько высокоуровневых подходов к управлению ими:

Выявление и инвентаризация

Прежде чем управлять контентом или анализировать его, организациям необходимо знать, каким контентом они располагают. Инструменты поиска и выявления сканируют файловые хранилища, облачные хранилища и информационные системы с целью инвентаризации данных. Наличие метаданных, таких как тип файла, создатель и местоположение, способствуют стратегическому управлению данными (Варонис, 2023).

Метаданные, классификация и тегирование

Неструктурированные данные могут быть обогащены метаданными. Автоматизированные инструменты используют обработку естественного языка и распознавание образов для назначения категорий, тем и даже для выявления персональных данных. Данный процесс позволяет из беспорядка создать структуры, и способствует последующему поиску и исполнению законодательно-нормативных требований (Сати, 2012).

Стратегическое управление, управление доступом и безопасность

Подобно структурированным данным, неструктурированный контент также должен быть защищён. Меры управления доступом, шифрование и разрешения на основе ролей применяются даже в отношении контента, представленного в виде набора разнородных файлов. Концепции стратегического управления определяют, кто может получать доступ, изменять или сохранять те или иные типы контента (Varonis, 2023; Data Governance Institute, 2021).

Системы хранения и управления

Неструктурированные данные часто хранятся в файловых системах, облачных хранилищах или в «озерах данных» (data lakes). Системы управления корпоративным контентом (Enterprise Content Management, ECM) поддерживают выполнение правил жизненного цикла, разрешения на доступ и контроль версий. Для крупномасштабных хранилищ неструктурированных данных фирма IBM (2023) рекомендует нереляционные NoSQL-системы и объектные хранилища.

Поиск, индексирование и анализ

Машины поиска и ИИ-инструменты индексируют контент документов для последующего поиска и извлечения. Методы обработки естественного языка (NLP) позволяют извлекать сущности, проводить моделирование тем и резюмирование. Данные методы позволяют выполнять запросы к неструктурированному тексту так же, как и к структурированному (Sathi, 2012).

Управление жизненным циклом

Управление жизненным циклом, от создания до уничтожения, позволяет избежать рисков и утрат. Использование указаний по срокам хранения и действиям по их истечении, автоматическое удаление ставшего ненужным контента и удаление дубликатов экономят место в хранилище и снижают юридические риски (Data Governance Institute, 2021).

Использование аналитики и искусственного интеллекта

Модели машинного обучения (включая генеративный ИИ) способны резюмировать, классифицировать и анализировать большие объёмы контента. Эти модели позволяют получать отдачу от неструктурированных источников, которые, ввиду своих масштабом, не могут быть проанализированы человеком (IBM, 2023).

Отдача от управления неструктурированными данными

Надлежащее управление неструктурированными данными позволяет получать стратегические и оперативные преимущества в масштабах всего предприятия:

  • Повышение эффективности процесса принятия решений. Превращая электронные письма, отчёты и иные документы в доступные для поиска и анализа ресурсы, организации могут извлекать информацию, которая ранее была «закопана». Анализ тенденций для настроений, отслеживание проблем и выявление рисков - всё это можно автоматизировать с помощью анализа неструктурированных данных (Barney et al., 2025).

  • Улучшение исполнения законодательно-нормативных требований и управления рисками. Неуправляемые неструктурированные данные могут стать для компаний источниками юридических, финансовых и репутационных рисков. В документах и электронных письмах часто скрывается чувствительная конфиденциальная информация, такая как персональные данные (PII). Установление степени конфиденциальности и применение мер защиты данных обеспечивают исполнение законодательно-нормативных требований (Varonis, 2023).

  • Повышение эффективности и производительности. Сотрудники нередко теряют время на поиск документов или воссоздание уже существующего контента. Благодаря правильному тегированию/маркировке контента, индексации и управлению доступом, организации могут сократить дублирование и улучшить совместную работу (Data Governance Institute, 2021).

  • Сокращение затрат. Унаследованные хранилища часто содержат годами неиспользуемый контент. Надлежащее управление жизненным циклом неструктурированных данных позволяет организациям архивировать или удалять малоценные материалы, экономя на инфраструктуре и облачных ресурсах (Forbes Tech Council, 2022).

  • Поддержка инноваций. Искусственный интеллект, бизнес-аналитика (business intelligence, BI) и понимание потребностей клиентов всё больше зависят от наличия содержательного контента. Неструктурированные данные, - включая отзывы клиентов, чаты служб поддержки и журналы использования, - могут способствовать разработке продуктов и улучшению обслуживания (Sathi, 2012).

Заключение

Неструктурированные данные - электронные письма, документы, изображения, аудиозаписи - сегодня являются доминирующей формой корпоративной информации. Пусть даже у понятия «неструктурированные данные» нет идеально точного определения, управление такими данными больше не является факультативным. Современные стратегии фокусируют внимание на выявлении неструктурированных данных, обогащении их метаданными, установлении правил жизненного цикла и на аналитике. Специалисты по работе с информацией, занимающиеся стратегическим управлением неструктурированным контентом, не только обеспечивают снижение рисков, но также и разблокируют скрытую ценность этих данных, - что делает данное направление деятельности ключевым по важности в рамках стратегического управления корпоративными данными и цифровой трансформации.

Эндрю Поттер (Andrew Potter)

Литература:

Источник: сайт Substack
https://metaarchivist.substack.com/p/unstructured-data 

понедельник, 15 сентября 2025 г.

Неструктурированные данные: Происхождение, эволюция и управление ими, часть 1

Данный пост эксперта в области управления электронными документами, эксперта ИСО от США Энди Поттера (Andy Potter - на фото) был опубликован 11 июля 2025 года в социальной сети Substack.

В широком смысле под неструктурированными данными понимают информацию, для которой не имеется предопределенной модели или схемы. В отличие от структурированных данных (например, строк в базе данных), неструктурированные данные охватывают широкий спектр типов контента, включая контент с высоким содержанием текста (такой, как документы, электронные письма и сообщения в социальных сетях) и нетекстовый контент (например, изображения, аудио- и видеоматериалы, и измерения датчиков) (IBM, 2023; Barney, Hanna, & Stedman, 2025). На практике неструктурированные данные часто называют «прямым продуктом человеческого общения» - это информация, созданная людьми без использования формального кодирования, делающего её удобной для обработки машинами (Barney et al., 2025). Опросы показывают, что примерно 70–90% корпоративных данных являются неструктурированными (Machado, 2024; Forbes Tech Council, 2022).

В качестве примеров неструктурированных данных можно привести электронные письма, отчеты, сообщения в социальных сетях, расшифровки звонков и переговоров, фотографии, видеозаписи и журналы аудита Интернета вещей. Большая часть этих данных существует «в своем первоначальном формате» и не имеет табличной организации (IBM, 2023).


Исторические корни и эволюция

Исторические корни понятия «неструктурированные данные» уходят в ранние периоды вычислительной техники. Ещё в 1958 году исследователь из компании IBM Х.П.Лун (H. P. Luhn) описал автоматическую классификацию текста (Luhn, 1958). Однако распространённым термин «неструктурированные данные» стал в 1980-х годах, когда персональные компьютеры дали возможность ведущим деловую деятельность пользователям генерировать данные вне централизованных баз данных. Джон Филлипс (John Phillips, 2011) вспоминал, как ИТ-подразделения говорили: «Мы отвечаем за структурированные данные, а всё остальные данные просто неструктурированные».

К 1990-м и 2000-м годам объёмы электронных писем, документов Word, PDF-файлов и веб-контента резко выросли. По оценкам аналитиков, 80% и более корпоративных данных находились вне структурированных систем (Machado, 2024). Во время бума «больших данных» прогнозировалось, что к 2025 году в глобальном масштабе объёмы данных достигнут 175 зеттабайт, и что большинство этих данных будут неструктурированными (Forbes Tech Council, 2022). Благодаря достижениям в области обработки естественного языка (natural language processing, NLP) и поиска, эти ранее труднообрабатываемые данные стали более доступными для анализа (Sathi, 2012).

Интерпретации и терминология

Термин «неструктурированные данные» не вполне точен. Барни и др. (2025) определяют его как контент, который не соответствует какой-либо фиксированной модели данных, обычно созданной человеком. Другие авторы отмечают, что большинство «неструктурированных» файлов, таких как Word- или HTML-файлы, обладают внутренней структурой, просто эта структура не является табличной или реляционной (Phillips, 2011).

Некоторые специалисты предпочитают использовать более широкие понятия, такие как «электронный контент», или же выделяют «полуструктурированные данные», такие как XML-файлы или сообщения электронной почты с заголовками (IBM, 2023). Для этих форматом имеются частичные схемы. Местоположение границы между понятиями зависит от обстоятельств: специалистов по управлению документами может больше интересовать назначение документа, чем его синтаксис; специалисты по данным могут смотреть на наличие поддающейся анализу схемы.

Несмотря на научные споры (Барни и др., 2025), практическое определение следующее: неструктурированные данные – это данные в нереляционной форме, часто созданные людьми и требующие интерпретации, прежде чем они станут пригодными для использования.

Мой комментарий: Автор честно признаёт, что содержание понятия «(не)структурированные данные» нередко «в глазах смотрящего», и во многих случаях определяется не какими-то формальными признаками, а целями и способами обработки данных. Это очень важный момент: с моей точки зрения, не бывает структурированных или неструктурированных данных «вообще»; и в зависимости от обстоятельств одни и те же данные можно будет отнести как к одной, так и к другой категории.

Замечу, что о «данных в реляционной форме» можно было говорить в данном контексте лет 30 тому назад, когда это были или числа, или текстовые поля ограниченной длины. Сегодня в ячейках базы данных могут храниться объекты огромного объёма и произвольного формата; и вряд ли использование реляционной СУБД в качестве «сундука» для их хранения автоматически сделает эти данные структурированными …


(Окончание следует, см. http://rusrim.blogspot.com/2025/09/2_01580311638.html )

Эндрю Поттер (Andrew Potter)

Источник: сайт Substack
https://metaarchivist.substack.com/p/unstructured-data 

среда, 14 мая 2025 г.

Искусственный интеллект революционизирует анализ неструктурированных данных: Разблокировка скрытой деловой ценности

Данная заметка Дика Вейсингера (Dick Weisinger – на фото) была опубликована 16 апреля 2025 года на блоге компании Formtek.

Искусственный интеллект трансформирует подход коммерческих организаций к неструктурированным данным, давая им возможность извлекать ценные знания и представления из ранее мало использовавшихся источников. Поскольку, согласно оценкам, неструктурированные данные обычно составляют примерно 80% всех данных, компании всё чаще обращаются к решениям на основе ИИ для управления этим огромным ресурсом и для анализа его содержимого.

ИИ-технологии, в особенности технологии обработки естественного языка (Natural Language Processing, NLP) и машинного обучения (МО), находятся на переднем крае этой революции. Соответствующие инструменты способны быстро обрабатывать и интерпретировать большие объёмы неструктурированных данных, включающие тексты, изображения и видеоматериалы. Как отмечает вице-президент по управлению продуктами ИИ-пакета IBM watsonx™ Эдвард Кальвесберт (Edward Calvesbert), «генеративный ИИ повысил важность неструктурированных данных, а именно документов, для технологии RAG (retrieval augmented generation – «генерация ответов, дополняемая поиском и извлечением релевантной фактической информации» - Н.Х.), а также для тонкой настройки больших языковых моделей (LLM) и традиционной аналитики, которые используются для машинного обучения, бизнес-аналитики и инженерии данных» (см. https://www.ibm.com/think/insights/unstructured-data-trends ).

Компании используют ИИ для автоматизации задач извлечения, очистки и обработки данных, высвобождая ресурсы для более ценных видов деятельности, таких как анализ данных и принятие решений. Например, анализ настроений (sentiment analysis) на основе ИИ позволяет оценивать общественное мнение о брендах и продуктах, анализируя сообщения в социальных сетях и отзывы клиентов. Данная возможность позволяет коммерческим организациям быстро реагировать на рыночные тенденции и потребности клиентов.

Последствия анализа неструктурированных данных на основе ИИ имеют далеко идущие последствия. Теперь коммерческие организации могут принимать более обоснованные решения на основе всесторонней информации, полученной из различных источников данных. По данным компании Swiss Re, страховщики, использующие ИИ для извлечения знаний из неструктурированных источников данных, могут ожидать улучшения показателей своей деятельности на 12–25%.

Интеграция ИИ с другими технологиями, такими как Интернет вещей (IoT), обещает раскрыть ещё больший потенциал. По мере того, как системы ИИ становятся все более сложными, они становятся способными обрабатывать и анализировать неструктурированные данные в режиме реального времени, давая тем самым возможность коммерческим организациям быстрее реагировать на меняющиеся условия рынка.

Хотя многие из этих ИИ-технологий уже используются, их потенциал ещё не раскрыт в полной мере. Как считает Кальвесберт, «документы есть у каждой компании - подумайте о тех материалах, которые они предоставляют новым сотрудникам в процессе приёма на работу - и этого достаточно, чтобы начать работу с инструментами RAG и семантическим поиском». Он указывает на то, что коммерческие организации могут начать использование ИИ для анализа неструктурированных данных немедленно, при этом в ближайшем будущем появятся более продвинутые приложения.

Искусственный интеллект революционизирует подходы коммерческих организаций к неструктурированным данным, превращая в ценный актив то, что когда-то было лишь источником головной боли. По мере того, как эти технологии продолжают развиваться, можно ожидать, что всё больше коммерческих организаций будут использовать возможности ИИ, чтобы в полной мере использовать потенциал своих неструктурированных данных, стимулируя тем самым в ближайшие годы инновации и получая конкурентное преимущество.

Дик Вейсингер (Dick Weisinger)

Источник: блог компании Formtek
https://formtek.com/blog/ai-revolutionizes-unstructured-data-analysis-unlocking-hidden-business-value/