суббота, 26 сентября 2026 г.

Росстандарт: Опубликованы предстандарты ПНСТ 1064-2026, ПНСТ 1065-2026 и ПНСТ 1066-2026 по тематике синтеза данных

На сайте Федерального агентства по техническому регулированию и метрологии  ( http://www.gost.ru/ ) в августовском 2026 года разделе ( https://protect.gost.ru/gost?year=2026&month=8&search=&page=5 ) были выложены три новых предварительных стандарта по тематике синтеза данных.

Эти документы разработаны некоммерческой организацией «Ассоциация больших данных» (НО «АБД») при участии автономной некоммерческой организации «Национальный технологический центр цифровой криптографии» (АНО «НТЦ ЦК»); внесены Техническим комитетом по стандартизации ТК 164 «Искусственный интеллект».

Предстандарт ПНСТ 1064-2026 «Синтез данных. Основные положения» объёмом 16 страниц, см. https://protect.gost.ru/gost/details/3ab40d2a-2d04-426f-91e4-73645b23a986 

Основное понятие определяется следующим образом:

3.1.2. Синтетические данные (synthetic data): Данные, искусственно созданные для имитации формата и свойств реальных данных, но которые не соответствуют напрямую каким-либо реальным объектам.

Примечания

1. Синтетические данные могут быть использованы для различных целей, включая обучение моделей машинного обучения, тестирование систем, а также обеспечение повышенной конфиденциальности данных.

2. Настоящий стандарт описывает полностью синтетические данные, которые в дополнение к указанным в определении свойствам не являются модификацией исходных данных.

3. Синтетические данные могут не всегда точно воспроизводить все свойства реальных данных, что может ограничивать их применение в определенных сценариях.

Во вводной части документа отмечается:

«В современных условиях развития информационных технологий искусственный интеллект (ИИ) становится неотъемлемой частью многих областей деятельности, включая бизнес, науку, медицину и государственное управление, а синтетические данные находят все большее применение в ИИ, статистике и других сферах, требующих использования данных для моделирования и анализа. Рост объемов данных и необходимость их эффективной обработки требуют унификации подходов и терминологии для улучшения взаимодействия между различными участниками рынка обмена данными. В то же время синтетические данные помогают восполнить нехватку реальных данных для обучения моделей и анализа.»

Содержание документа следующее:

Предисловие
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Основные концепции синтеза данных
4.1. Синтез данных с использованием ИИ
4.2. Свойства синтетических данных
4.3. Классификация типов синтетических данных
4.4. Основные принципы осуществления синтеза данных
Библиография

Предстандарт ПНСТ 1065-2026 «Синтез данных. Архитектура процесса синтеза данных. Методы синтеза» объёмом 58 страниц, см. https://protect.gost.ru/gost/details/f09eb333-a40d-45a7-a789-2f53fe30de4e 

Во вводной части документа отмечается:

«Эффективность синтеза данных тесно связана с качеством процессов синтеза и архитектуры используемых систем. Синтетические данные применяются в различных практических сценариях, таких как тестирование информационных систем, обучение моделей искусственного интеллекта (ИИ), обмен данными с контрагентами и обогащение существующих наборов данных. Многие из этих сценариев требуют специфического подхода к качеству и конфиденциальности синтетических данных, что делает критически важным детальное описание процессов и архитектуры системы синтеза.

Для тестирования информационных систем синтетические данные должны точно отражать структуру и особенности реальных данных, обеспечивая при этом предотвращение потенциальной утечки данных (полностью синтетические данные). Обучение моделей требует от синтетических данных репрезентативности и достоверности, что позволяет моделям эффективно адаптироваться к задачам реального мира. При обмене данными с контрагентами особое внимание должно уделяться доверенным технологиям и методам синтеза, чтобы минимизировать вероятность утечки данных. Для задач обогащения данных при интеграции синтетические данные должны сохранять целостность и совместимость с другими наборами данных, обеспечивая при этом их полезность для дальнейшего анализа.

Таким образом, архитектура и процессы синтеза данных должны быть гибкими и адаптивными чтобы соответствовать разнообразным требованиям различных сценариев применения. Достоверность и полнота синтетических данных, их соответствие требованиям к доверенным технологиям ИИ, полезность получаемых данных зависят не только от алгоритмов синтеза, но и от порядка их применения организации хранения данных и управления вероятностями утечки данных на каждом этапе.

Цель настоящего стандарта - предложить эталонное описание процессов и архитектуры системы синтеза данных, что необходимо для достижения высоких показателей качества и конфиденциальности данных в различных контекстах их использования. Стандарт служит ориентиром для разработки внедрения и эксплуатации систем синтеза данных, соответствующих требованиям конфиденциальности и качества, что особенно важно в условиях возрастающих требований к конфиденциальности управлению данными.

… Настоящий стандарт устанавливает процесс синтеза данных (полностью синтетические данные) для систем искусственного интеллекта (ИИ) и архитектуру соответствующей системы, включая основные компоненты, процессы генерации данных и интеграцию с системами ИИ.

Настоящий стандарт устанавливает требования к выполнению каждого из этих этапов с учетом специфики обработки данных, мониторинга соответствия и управления процессом синтеза, доверенным технологиям синтеза, а также поддержке уровня приватности на всех стадиях жизненного цикла синтетических данных.

Стандарт применим к организациям любых форм собственности и масштабов, использующим технологии ИИ и синтетические данные.»

Содержание документа следующее:

Предисловие
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Сокращения
5. Обзор жизненного цикла синтеза
6. Эталонная модель процесса синтеза данных
7. Эталонная архитектура системы синтеза данных
Приложение А (рекомендуемое): Пояснения к жизненному циклу синтеза данных
Приложение Б (рекомендуемое): Пояснение к архитектуре системы синтеза
Приложение В (справочное): Технические особенности реализации синтеза данных
Библиография

Предстандарт ПНСТ 1066-2026 «Синтез данных. Описание результатов процесса синтеза. Методика оценки качества» объёмом 42 страницы, см. https://protect.gost.ru/gost/details/c6aef45e-9a6f-49b1-b128-c502a07eadae 

Во вводной части документа отмечается:

«Настоящий стандарт описывает результаты процесса синтеза структурированных данных, включая методы оценки качества синтетических данных, проверку уровня приватности, а также требования к документированию и отчетности. Стандарт устанавливает подход к методам оценки результата синтеза данных с использованием ИИ, включая оценку качества синтетических данных, их соответствия требованиям обработки информации и полезности для различных задач и приложений. Стандарт применим к организациям любых форм собственности и масштабов, использующим технологии ИИ и синтетические данные.

… Настоящий стандарт распространяется на процессы создания полных синтетических данных табличного вида с использованием нейронных сетей.

Настоящий стандарт не распространяется на синтетические данные, создаваемые методами статистического и компьютерного моделирования на основе цифровых моделей реальных сценариев.

Стандарт применим к организациям любых форм собственности и масштабов, использующим технологии искусственного интеллекта (ИИ) и синтетические данные.»

Содержание документа следующее:

Предисловие
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Общие положения
5. Методы оценки качества синтетических данных
6. Документирование и отчетность
6.1. Протоколы создания данных
6.2. Аудит и следование стандартам
6.3. Отчеты о качестве и использовании данных
Приложение А (рекомендуемое): Словарь данных
Приложение Б (справочное): Точность. Метрики оценки статистической близости
Приложение В (справочное): Точность. Метрики оценки реалистичности синтетических данных
Приложение Г (справочное): Полезность. Метрики оценки эффективности
Приложение Д (справочное): Метрики и модели оценки риска утечки данных
Приложение Е (рекомендуемое): Шаблон отчета о качестве
Библиография

Источник: сайт Росстандарта
https://protect.gost.ru/gost/details/3ab40d2a-2d04-426f-91e4-73645b23a986
https://protect.gost.ru/gost/details/f09eb333-a40d-45a7-a789-2f53fe30de4e 
https://protect.gost.ru/gost/details/c6aef45e-9a6f-49b1-b128-c502a07eadae 


ИСО: Опубликован стандарт ISO 18968:2026 «Написание текстов в расчёте на их последующий перевод - Создание и оценка текста»

1 сентября 2026 сайт Международной организации по стандартизации (ИСО) сообщил о публикации нового стандарта ISO 18968:2026 «Написание текстов в расчёте на их последующий перевод - Создание и оценка текста» (Translation-oriented writing - Text production and text evaluation) объёмом 50 страниц основного текста, см. https://www.iso.org/standard/85512.html .

Стандарт подготовлен техническим комитетом ИСО TC37 «Язык и терминология» (Language and terminology). О работе над ним я уже рассказывала здесь: http://rusrim.blogspot.com/2025/11/isodis-18968.html 

Во вводной части стандарта отмечается:

«В настоящее время товары и услуги всё больше распространяются по международным рынкам, и специализированный контент должен быть доступен на языках, используемых на каждом из рынков. Такой контент переводится переводчиками-людьми (как с использованием инструментов автоматизированного перевода (computer-aided translation, CAT), так и без них) и/или системами машинного перевода (machine translation, MT - с последующим редактированием переводчиком-человеком (post-editing) или без него). 

В таком контексте учёт при написании текстов того, что они затем будут переводиться (translation-oriented writing), может сократить количество запросов от переводчиков, снизить затраты, поможет избежать ошибок перевода и сократить сроки работ по переводу, особенно при использовании технологий автоматизации перевода.

В частности, техническая документация (например, руководства по продуктам, онлайн-помощь, карты (паспорта) безопасности, инструкции по сборке), как одна из форм специализированного контента, призвана обеспечить безопасное, эффективное и результативное использование продукции. Такие стандарты, как IEC/IEEE 82079-1:2019 «Подготовка информации (инструкций) по использованию продуктов – Часть 1: Принципы и общие требования» (Preparation of information for use (instructions for use) of products - Part 1: Principles and general requirements, см. https://www.iso.org/standard/71620.html и https://www.iso.org/obp/ui/#!iso:std:71620:en , а также мой пост http://rusrim.blogspot.com/2020/02/ieee-ieeeiec-82079-1-2019.html - Н.Х.), устанавливают требования к технической документации. Внутренние корпоративные руководства по стилю дополняют эти требования, регламентируя принятые в организации правила оформления документов.

Мой комментарий: Упомянутый стандарт был адаптирован в России на основе более ранней редакции 2012 года как межгосударственный стандарт ГОСТ IEC 82079-1-2014 «Подготовка инструкций по применению. Построение, содержание и представление материала. Часть 1. Общие принципы и подробные требования», см. https://protect.gost.ru/gost/details/410ba466-45c5-41da-9ee2-636f43ebbb81

В настоящем документе содержатся рекомендации по созданию и/или редактированию специализированного контента на исходном языке, который предназначен для перевода на один или несколько целевых языков - а также по оценке ориентированных на перевод текстов. Некоторые рекомендации, однако, могут быть полезны и для предназначенных для перевода неспециализированных текстов.

… В настоящем документе содержатся рекомендации по созданию, редактированию и оценке специализированного контента на исходном языке, предназначенного для перевода на другие языки. Кроме того, в нём даются рекомендации по передаче текста от процесса создания к процессу перевода, связанные с созданием и переводом специализированного контента. Данный документ задуман как практичное руководство, которое признаёт, что не все рекомендации в равной степени применимы в различных вариантах использования

Данный документ предназначен для авторов и редакторов специализированного контента, предназначенных для перевода. Этот документ также даёт возможность переводчикам и поставщикам услуг перевода оценивать пригодность для перевода специализированного контента. Данный документ также может быть использован производителями программных инструментов (например, для разработки и совершенствования процедур автоматического тестирования и верификации исходного языка текстов).

Данный документ не применим в отношении создания, редактирования и оценки художественных, публицистических, рекламных и иных неспециализированных текстов.»

По моей оценке, это действительно полезный документ, содержащий дельные рекомендации.

Содержание стандарта следующее:

Предисловие
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Рекомендации в отношении специализированного контента, предназначенного для перевода
4.1. Общие положения
4.2. Форматирование
4.3. Терминология
4.4. Грамматика, синтаксис и стиль
4.5. Представление контента
5. Рекомендации по передаче текста от процесса создания к процессу перевода
6. Тексты, ориентированные на перевод: Оценка
Приложение A: Список критериев оценки
Приложение B: Контрольный список рекомендаций
Библиография

Источник: сайт ИСО / сайт BSI
https://www.iso.org/standard/85512.html 
https://www.iso.org/obp/ui/en/#!iso:std:85512:en 
https://standardsdevelopment.bsigroup.com/projects/2023-02479

пятница, 25 сентября 2026 г.

Как сделать идеологию управлению информацией и документами актуальной для наших организаций

Данный пост австралийского специалиста в области управления документами и информацией Карла Мелроуза (Karl Melrose – на фото) был опубликован 19 августа 2026 года на его блоге Meta-IRM (Мета-управление информацией и документами).

Как сделать идеологию управлению информацией и документами актуальной для наших организаций? Сосредоточьте усилия на том, чтобы стать CIO – нет, не директором по ИТ, а «дешёвым специалистом по информации» (Cheap Information Officer).

Каждая организация хотела бы иметь дешёвого специалиста по информации – и ни одна не хочет дорогого. Положительным здесь является то, что дешевая информация и без того является центральным элементом практики управления документами и информацией. 

Всегда речь шла именно об этом, и как раз для этого существуют структура, классификация и метаданные. Нам просто нужно сдвинуть временные рамки, на которых мы фокусируем свой внимание.

Обычно мы обращаем основное внимание на то, чтобы сделать дешевым удовлетворение информационных потребностей для двух основных групп процессов – для процессов обеспечения подотчётности и уничтожения/передачи, ни один из которых не является инвестиционно-привлекательным. 

Вероятность возникновения проблем с подотчётностью очень невелика, и мы не можем с уверенностью предсказать, когда это произойдет. Управление уничтожение должно давать гарантированные результаты (и в некотором смысле это так и есть, ввиду биологического разложения, деградации данных или неизбежной тепловой смерти Вселенной), однако обычно это не так, потому что его реализация сейчас обходится в 10 долларов, а средний срок окупаемости составляет около 15 лет, поэтому никто не в состоянии в него инвестировать - ставка дисконтирования в инвестиционной стратегии организации сводит подобные инвестиции на нет (ставка дисконтирования (discount rate) - это величина, на которую уменьшается окупаемость инвестиций за каждый дополнительный год).

Суть в том, что мы сфокусированы на том, чтобы сделать более дешёвым удовлетворение информационных потребностей для двух процессов – из которых один может с малой вероятностью произойти в непредсказуемый момент в будущем, и в другой никто не может инвестировать, потому что хотя он и окупается, но его окупаемость слишком мала и происходит это слишком поздно.

Мы продолжаем пытаться решить эту проблему, говоря о том, насколько важны эти процессы.

Однако эти разговоры не меняют основополагающую динамику - чем более неопределенным нечто является, и чем дальше в будущем это нечто находится, тем меньше вероятность того, что ему будет уделено внимание. Пока эта динамика не изменится, динамика обсуждения этих вопросов останется неизменной. Принимающие решения лица будут кивать и соглашаться с тем, что эти процессы важны - возможно, даже выпишут чек, если случится что-то плохое - но они не станут инвестировать в них на постоянной основе. Стоимость удовлетворения этих информационных потребностей является слишком неопределенной, чтобы инвестировать в них сейчас. Удешевление удовлетворения этих потребностей не имеет значения до тех пор, пока данный вопрос вдруг окажется важным, но тогда никто не сможет повернуть время вспять на 15 лет, чтобы инвестировать в том момент, когда эти инвестиции действительно принесли бы результаты.

Сказанное выше – это многословный способ выразить мысль о том, что мы уже являемся дешёвыми специалистами информации - мы просто дешевы в плане обслуживания ряда процессов, в которые никто не хочет или не может инвестировать.

Это также пространный способ ещё раз напомнить, что общий образ мышления правилен - мы хотим снизить стоимость удовлетворения информационных потребностей (именно этой цели служат классификация и метаданные), но нам хотелось бы сфокусировать свои усилия на процессах, которые произойдут с большей вероятностью, и, скорее всего, произойдут пораньше.

Сосредоточение внимания на том, что произойдёт раньше, включает в нашу сферу деятельности остальную часть организации. У каждого сотрудника, с которым мы общаемся, есть работа, которую нужно сделать завтра; и все они хотят, чтобы удовлетворение информационных потребностей стало менее затратным. Весьма вероятно, что они дадут деньги и дадут время тем, кто мог бы это осуществить.

Весьма вероятно, что те же специалисты, которые делают информацию более дешёвой, смогли бы также включить в эти процессы создание метаданных для тех самых, идущих в боле длительном масштабе времени и менее предсказуемых процессов.

Мы [специалисты по управлению документами – Н.Х.] пытаемся сделать что-то в этом роде уже в течение нескольких десятилетий – соответствующий подход называют «невидимым управлением документами» (records management by stealth) и ещё рядом имён. Это всегда какая-то версия попыток заставить сотрудников организации выполнять дополнительную работу по структурированию информации так, как нужно нам. Мы никак не осознаем, что здесь нет ничего незаметного; в центре внимание нашей практики - сделать информацию более дешевой для процессов обеспечения подотчетности и уничтожения - и именно это отражает структура информации. 

Данная идеология настолько укоренилось в нашем сознании, что мы даже не осознаём этого, и поэтому считаем, что именно наш способ организации информации превосходит другие «по определению» – и что превосходит любые другие способы с точки зрения снижения затрат на удовлетворение информационных потребностей. 

Для нас это настолько очевидно, что мы даже не в состоянии представить, что остальные могут считать иначе – дело доходит до того, что мы уже десятилетиями игнорируем сотрудников, которые нам об этом говорят. Из-за этого нас преследовали и продолжают преследовать неудачи – всё потому, что делаем удовлетворение информационных потребностей затратным для процессов, которые обязательно произойдут и в скором времени, - а всё во имя того, чтобы сделать его дешевым для процессов, которые вряд ли произойдут, а если и произойдут, то в далёком будущем.

Нам [специалистам по управлению документами – Н.Х.] нужно сделать три вещи, чтобы добиться успеха:

  • Во-первых, признать, что в рамках управления документами и информацией существует ряд практик, направленных на то, чтобы сделать дешёвым удовлетворения наших информационных потребностей. 

  • Во-вторых, признать, что же эти практики делают затратным удовлетворение информационных потребностей других специалистов. 

  • В-третьих, применить наш базовый образ мышления – классификация, метаданные, структура – к работе всех остальных специалистов, с тем, чтобы мы смогли стать дешевыми специалистами по информации, поддерживающими их сегодняшнюю деятельность – ввиду того, что низкая вероятность того, что нечто может быть сделано с меньшими затратами спустя 15 лет, очень редко привлекает необходимые инвестиции. 

Уверенность в том, что что-то станет дешевле уже завтра, – это то, во что организации всегда будут инвестировать.

Карл Мелроуз (Karl Melrose)


Источник: блог Meta-IRM 
https://metairm.substack.com/p/how-to-make-information-and-records 

Некоторые впечатления о конференции iPRES 2026

Данный пост генерального директора бельгийской компании Docbyte Фредерика Росселя (Frederik Rosseel - на фото) был опубликован 23 сентября 2026 года на сайте LinkedIn.

Мой комментарий: В посте речь идёт об очередной, 22-й Международной конференции по обеспечению долговременной сохранности электронных объектов iPRES 2026 ( https://ipres2026.dk/ ; программа доступна по адресу: https://ipres2026.dk/programme/programme-overview/ ; о конференциях iPRES см. также подборку постов на блоге http://rusrim.blogspot.com/search/label/iPRES ), которая в этот раз проходила 21-25 сентября 2026 года в Копенгагене (Дания).

Если сегодня среда — значит, это Копенгаген :)


После первого дня на конференции iPRES, я понял следующее:

  • Сообщество специалистов в области обеспечения электронной сохранности (digital preservation community, DPC) начинает осознавать, что искусственный интеллект и киберугрозы представляют собой реальную опасность для деятельности по обеспечению долговременной сохранности электронной информации (электронной сохранности);

  • Члены сообщества начинают понимать, что стандарты могут быть полезны при оценке поставщиков и решений, а также способны упростить процесс закупок;

  • Члены сообщества по-прежнему питают любовь к «самописным» решениям, несмотря на то, что мир изменился;

  • Требования европейских нормативно-правовых актов NIS2 и CRA не распространяются на «самописные» решения государственных архивов, что влечет за собой соответствующие риски.

    Мой комментарий: «Директива NIS2» - это «Директива №2022/2555 Европейского парламента и Совета от 14 декабря 2022 года о мерах по обеспечению высокого общего уровня кибербезопасности во всем Евросоюзе, вносящая поправки в Регламент №910/2014 и Директиву №2018/1972, и отменяющая Директиву № 2016/1148 (Директива NIS2)» (Directive (EU) 2022/2555 of the European Parliament and of the Council of 14 December 2022 on measures for a high common level of cybersecurity across the Union, amending Regulation (EU) No 910/2014 and Directive (EU) 2018/1972, and repealing Directive (EU) 2016/1148 (NIS 2 Directive) (Text with EEA relevance)), см. https://eur-lex.europa.eu/eli/dir/2022/2555 

    «Закон CRA», также известный как «Закон о киберустойчивости» (Cyber Resilience Act) – это «Регламент (ЕС) 2024/2847 Европейского парламента и Совета от 23 октября 2024 г. о горизонтальных требованиях к кибербезопасности продукции с цифровыми элементами, вносящий изменения в Регламенты (ЕС) № 168/2013 и (ЕС) 2019/1020 и Директиву (ЕС) 2020/1828 (Закон о киберустойчивости) (данный нормативно-правовой акт применим в станах Европейской экономической зоны), (Regulation (EU) 2024/2847 of the European Parliament and of the Council of 23 October 2024 on horizontal cybersecurity requirements for products with digital elements and amending Regulations (EU) No 168/2013 and (EU) 2019/1020 and Directive (EU) 2020/1828 (Cyber Resilience Act) (Text with EEA relevance)), см. https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=CELEX%3A02024R2847-20241120&qid=1790231766633 

  • Сообщество специалистов в области обеспечения электронной сохранности является весьма разрозненным; в нём существуют диаметрально противоположные взгляды на передовые методы работы.

И разве деятельность по обеспечению электронной сохранности не должна включать в себя непрерывную оценку рисков?

Фредерик Россель (Frederik Rosseel)

Источник: сайт LinkedIn
https://www.linkedin.com/posts/frederikrosseel_ipres-cph-share-7508541312040812545-BZUc/