Эти документы разработаны некоммерческой организацией «Ассоциация больших данных» (НО «АБД») при участии автономной некоммерческой организации «Национальный технологический центр цифровой криптографии» (АНО «НТЦ ЦК»); внесены Техническим комитетом по стандартизации ТК 164 «Искусственный интеллект».
Предстандарт ПНСТ 1064-2026 «Синтез данных. Основные положения» объёмом 16 страниц, см. https://protect.gost.ru/gost/details/3ab40d2a-2d04-426f-91e4-73645b23a986
Основное понятие определяется следующим образом:
3.1.2. Синтетические данные (synthetic data): Данные, искусственно созданные для имитации формата и свойств реальных данных, но которые не соответствуют напрямую каким-либо реальным объектам.
Примечания
1. Синтетические данные могут быть использованы для различных целей, включая обучение моделей машинного обучения, тестирование систем, а также обеспечение повышенной конфиденциальности данных.
2. Настоящий стандарт описывает полностью синтетические данные, которые в дополнение к указанным в определении свойствам не являются модификацией исходных данных.
3. Синтетические данные могут не всегда точно воспроизводить все свойства реальных данных, что может ограничивать их применение в определенных сценариях.
Во вводной части документа отмечается:
«В современных условиях развития информационных технологий искусственный интеллект (ИИ) становится неотъемлемой частью многих областей деятельности, включая бизнес, науку, медицину и государственное управление, а синтетические данные находят все большее применение в ИИ, статистике и других сферах, требующих использования данных для моделирования и анализа. Рост объемов данных и необходимость их эффективной обработки требуют унификации подходов и терминологии для улучшения взаимодействия между различными участниками рынка обмена данными. В то же время синтетические данные помогают восполнить нехватку реальных данных для обучения моделей и анализа.»
Содержание документа следующее:
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Основные концепции синтеза данных
4.2. Свойства синтетических данных
4.3. Классификация типов синтетических данных
4.4. Основные принципы осуществления синтеза данных
Предстандарт ПНСТ 1065-2026 «Синтез данных. Архитектура процесса синтеза данных. Методы синтеза» объёмом 58 страниц, см. https://protect.gost.ru/gost/details/f09eb333-a40d-45a7-a789-2f53fe30de4e
Во вводной части документа отмечается:
«Эффективность синтеза данных тесно связана с качеством процессов синтеза и архитектуры используемых систем. Синтетические данные применяются в различных практических сценариях, таких как тестирование информационных систем, обучение моделей искусственного интеллекта (ИИ), обмен данными с контрагентами и обогащение существующих наборов данных. Многие из этих сценариев требуют специфического подхода к качеству и конфиденциальности синтетических данных, что делает критически важным детальное описание процессов и архитектуры системы синтеза.
Для тестирования информационных систем синтетические данные должны точно отражать структуру и особенности реальных данных, обеспечивая при этом предотвращение потенциальной утечки данных (полностью синтетические данные). Обучение моделей требует от синтетических данных репрезентативности и достоверности, что позволяет моделям эффективно адаптироваться к задачам реального мира. При обмене данными с контрагентами особое внимание должно уделяться доверенным технологиям и методам синтеза, чтобы минимизировать вероятность утечки данных. Для задач обогащения данных при интеграции синтетические данные должны сохранять целостность и совместимость с другими наборами данных, обеспечивая при этом их полезность для дальнейшего анализа.
Таким образом, архитектура и процессы синтеза данных должны быть гибкими и адаптивными чтобы соответствовать разнообразным требованиям различных сценариев применения. Достоверность и полнота синтетических данных, их соответствие требованиям к доверенным технологиям ИИ, полезность получаемых данных зависят не только от алгоритмов синтеза, но и от порядка их применения организации хранения данных и управления вероятностями утечки данных на каждом этапе.
Цель настоящего стандарта - предложить эталонное описание процессов и архитектуры системы синтеза данных, что необходимо для достижения высоких показателей качества и конфиденциальности данных в различных контекстах их использования. Стандарт служит ориентиром для разработки внедрения и эксплуатации систем синтеза данных, соответствующих требованиям конфиденциальности и качества, что особенно важно в условиях возрастающих требований к конфиденциальности управлению данными.
… Настоящий стандарт устанавливает процесс синтеза данных (полностью синтетические данные) для систем искусственного интеллекта (ИИ) и архитектуру соответствующей системы, включая основные компоненты, процессы генерации данных и интеграцию с системами ИИ.
Настоящий стандарт устанавливает требования к выполнению каждого из этих этапов с учетом специфики обработки данных, мониторинга соответствия и управления процессом синтеза, доверенным технологиям синтеза, а также поддержке уровня приватности на всех стадиях жизненного цикла синтетических данных.
Стандарт применим к организациям любых форм собственности и масштабов, использующим технологии ИИ и синтетические данные.»
Содержание документа следующее:
Предисловие
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Сокращения
5. Обзор жизненного цикла синтеза
6. Эталонная модель процесса синтеза данных
7. Эталонная архитектура системы синтеза данных
Приложение А (рекомендуемое): Пояснения к жизненному циклу синтеза данных
Приложение Б (рекомендуемое): Пояснение к архитектуре системы синтеза
Приложение В (справочное): Технические особенности реализации синтеза данных
Библиография
Предстандарт ПНСТ 1066-2026 «Синтез данных. Описание результатов процесса синтеза. Методика оценки качества» объёмом 42 страницы, см. https://protect.gost.ru/gost/details/c6aef45e-9a6f-49b1-b128-c502a07eadae
Во вводной части документа отмечается:
«Настоящий стандарт описывает результаты процесса синтеза структурированных данных, включая методы оценки качества синтетических данных, проверку уровня приватности, а также требования к документированию и отчетности. Стандарт устанавливает подход к методам оценки результата синтеза данных с использованием ИИ, включая оценку качества синтетических данных, их соответствия требованиям обработки информации и полезности для различных задач и приложений. Стандарт применим к организациям любых форм собственности и масштабов, использующим технологии ИИ и синтетические данные.
… Настоящий стандарт распространяется на процессы создания полных синтетических данных табличного вида с использованием нейронных сетей.
Настоящий стандарт не распространяется на синтетические данные, создаваемые методами статистического и компьютерного моделирования на основе цифровых моделей реальных сценариев.
Стандарт применим к организациям любых форм собственности и масштабов, использующим технологии искусственного интеллекта (ИИ) и синтетические данные.»
Содержание документа следующее:
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Общие положения
5. Методы оценки качества синтетических данных
6. Документирование и отчетность
6.2. Аудит и следование стандартам
6.3. Отчеты о качестве и использовании данных
Приложение Б (справочное): Точность. Метрики оценки статистической близости
Приложение В (справочное): Точность. Метрики оценки реалистичности синтетических данных
Приложение Г (справочное): Полезность. Метрики оценки эффективности
Приложение Д (справочное): Метрики и модели оценки риска утечки данных
Приложение Е (рекомендуемое): Шаблон отчета о качестве
Библиография
Источник: сайт Росстандарта
https://protect.gost.ru/gost/details/3ab40d2a-2d04-426f-91e4-73645b23a986
https://protect.gost.ru/gost/details/f09eb333-a40d-45a7-a789-2f53fe30de4e
https://protect.gost.ru/gost/details/c6aef45e-9a6f-49b1-b128-c502a07eadae







