Показаны сообщения с ярлыком порождающий ИИ. Показать все сообщения
Показаны сообщения с ярлыком порождающий ИИ. Показать все сообщения

суббота, 15 ноября 2025 г.

Китай: Опубликован стандарт GB/T 45652-2025 «Требования по безопасности в отношении данных для предварительного обучения и дообучения генеративного ИИ»

24 апреля 2025 года сайт Национальной платформы государственной службы КНР предоставления информации о стандартах (全国标准信息公共服务平, National public service platform for standards information, см. https://std.samr.gov.cn/ ) сообщил о публикации нового национального стандарта GB/T 45652-2025 «Технологии кибербезопасности – Требования по безопасности в отношении данных для предварительного обучения и дообучения (точной настройки) генеративного ИИ» (网络安全技术 生成式人工智能预训练和优化训练数据安全规范 , самоназвание на английском языке: Cybersecurity technology—Security specification for generative artificial intelligence pre-training and fine-tuning data) объёмом 23 страницы, см. https://std.samr.gov.cn/gb/search/gbDetailed?id=33D40F1160BE5D92E06397BE0A0A5B93 и  https://www.doc88.com/p-51871853599231.html

Документ подготовлен китайским техническим комитетом по стандартизации SAC/TC260 «Кибербезопасность».

Стандарт, о работе над которым я уже рассказывала на блоге (см. http://rusrim.blogspot.com/2024/05/gbt.html ), вступит в силу 1 ноября 2025 года.

Во вводной части документа отмечается:

«Данные для предварительного обучения и для дообучения (точной настройки) являются основой генеративного ИИ и напрямую определяют качество и уровень безопасности генерируемого контента. 

Однако, учитывая риски безопасности на стадиях сбора, предварительной обработки и использования обучающих данных для предварительного обучения идообучения, для повышения уровня безопасности таких данных крайне необходимы стандарты и спецификации.

… В настоящем документе специфицированы требования безопасности к обучающим данным для предварительного обучения и дообучения, и к процессам их обработки в интересах генеративного ИИ. В документе также описаны соответствующие методы оценки.

Настоящий документ может быть использован поставщиков услуг генеративного ИИ, осуществляющими обработку обучающих данных для предварительного обучения и дообучения, и проводящих самооценку безопасности. Стандарт также распространяется на третьи стороны, проводящие оценку безопасности обучающих данных для предварительного обучения и дообучения.»

Содержание стандарта следующее:

Предисловие 
Введение
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Общие требования безопасности
5. Требования безопасности в отношении обработки обучающих данных для предварительного обучения генеративного ИИ
6. Требования безопасности в отношении обработки обучающих данных для дообучения (точной настройки) генеративного ИИ
7. Методы оценки
Библиография

Отмечу, что в настоящее время в каталоге китайских стандартов уже около 200 документов и проектов (серий DB/T, SJ/T, YD/T. YY/T), у которых в названии упоминается «искусственный интеллект», в том числе 3 стандарта и два проекта по генеративному ИИ.

Также недавно были опубликованы следующие национальные стандарты:

Источник: Национальной платформы государственной службы КНР предоставления информации о стандартах
https://std.samr.gov.cn/gb/search/gbDetailed?id=33D40F1160BE5D92E06397BE0A0A5B93 
https://www.doc88.com/p-51871853599231.html 

пятница, 7 ноября 2025 г.

Фирма Гартнер: Цикл ажиотажа для генеративного ИИ на 2025 год выделяет критически-важные инновации

Следите за динамичным, но пугающим ландшафтом инноваций генеративного ИИ (GenAI)!

Заметка вице-президента и аналитика компании Gartner Аруна Чандрасекарана (Arun Chandrasekaran, см. https://www.gartner.com/en/experts/arun-chandrasekaran – на фото) была опубликована на сайте компании 29 июля 2025 года.

Мой комментарий: В последнее время несколько угас интерес к когда-то очень авторитетной в ИТ-мире консультационной фирме Гартнер (Gartner) и к выпускающимся ею аналитическим материалам, включая так называемые «Цикл ажиотажа» (Hype Cycle) для различных технологий и методов работы – см., подборку постов на блоге http://rusrim.blogspot.com/search/label/Gartner . Тем не менее, я продолжаю следить за её деятельностью – да и, к тому же, число аналитиков в ИТ-отрасли сейчас поубавилось …

Не обращайте внимания на шумиху вокруг технологий генеративного ИИ, и старайтесь смотреть в корень

К 2028 году более 95% организаций будут использовать API-интерфейсы или модели генеративного ИИ (GenAI), и/или развёрнут приложения на базе генеративного ИИ в своих средах эксплуатации. Тем временем ИТ-лидерам предстоит найти свой курс в море множества чрезмерно разрекламированных технологий и высоких ожиданий, чтобы обеспечить деловую отдачу и соответствие стратегии своей организации.

Инновации, появление которых сопровождалось амбициозными обещаниями, сталкиваются с трудностями, пытаясь оправдать завышенные ожидания и перейти от стадии проверки концепции к стадии промышленной эксплуатации. «Цикл ажиотажа для генеративного ИИ по состоянию на 2025 год» (2025 Hype Cycle for Generative AI) снимает покров таинственности с основных технологий, лежащие в основе трансформирующей тенденции внедрения генеративного ИИ, давая читателю возможность определить, какие инновации наилучшим образом соответствуют приемлемому уровню риска и стратегическим целям его организации, - одновременно максимизируя потенциальную полезную отдачу.


Цикл ажиотажа для генеративного ИИ – это разработанное компанией Gartner графическое представление уровня зрелости, показателей внедрения и воздействия на деловую деятельность технологий генеративного ИИ. Оно помогает ИТ-директорам и другим лидерам ИТ выявлять инновации в этой сфере, которые они могли бы использовать, в зависимости от своего риск-аппетита, в погоне за потенциальными выгодами.

Ключевые области инвестиций формируют цикл ажиотажа для генеративного ИИ

Чтобы помочь лидерам в сфере ИИ выявить конкретные технологии, достойные стратегических инвестиций, цикл ажиотажа для генеративного ИИ обращает основное внимание на четырёх ключевых технологических области.

Модели генеративного ИИ

Предварительно обученные на данных большие языковые модели (large language models LLM) остаются краеугольным камнем генеративного ИИ и наиболее зрелой технологией создания моделей в цикле ажиотажа. Эти универсальные базовые модели могут быть адаптированы для широкого спектра вариантов использования и обладают значительными возможностями, что и объясняет их популярность. Однако другие типы моделей, такие как LLM с открытым исходным кодом, предметно-ориентированные модели генеративного ИИ и большие модели рассуждений (large reasoning models), быстро эволюционируют в жизнеспособные решения для организаций.

Пример технологии: Мультимодальный генеративный ИИ (multimodal generative AI)

Инженерия ИИ

По мере подготовки организаций к масштабированию программ генеративного ИИ, критически важное значение приобретает способность создавать, осуществлять стратегическое управление и настраивать приложения на базе генеративного ИИ. Инженерия ИИ охватывает растущую экосистему инструментов и методов генеративного ИИ, позволяющую организациям обеспечить поддержку приложениями на основе генеративного ИИ более широкой стратегии их организации. Эти инструменты предлагают эффективные рамочные структуры оркестровки приложений, уменьшают галлюцинации, смягчают проблему дезинформации и обеспечивают соблюдение законодательно-нормативных требований.

Инженерия ИИ также включает в себя группу инструментов и методов, направленных на обеспечение безопасного и эффективного использования ИИ.

Пример технологии: AI TRiSM (от Artificial Intelligence Trust, Risk, and Security Management – «Управление доверием, рисками и безопасностью искусственного интеллекта», концепция, разработанная компанией Gartner для обеспечения надежности, этичности и безопасности моделей и приложений ИИ – Н.Х.).

Агенты, приложения и варианты использования ИИ

Виртуальные помощники на основе генеративного ИИ, - например, ChatGPT,  -используют большие языковые модели для обеспечения функциональности, выходящей за рамки традиционной технологии диалогового ИИ (conversational AI), и представляют собой наиболее известные примеры используемых сегодня приложений генеративного ИИ.

В долгосрочной перспективе организации стремятся использовать агентов ИИ для автоматизации сложных многоэтапных процессов в больших масштабах, чтобы повысить производительность, снизить эксплуатационные расходы и улучшить качество обслуживания клиентов.

Агентный ИИ (agentic AI), интерес к которому стремительно растет, автономно или полуавтономно использует методы ИИ для восприятия, принятия решений, выполнения действий и достижения целей в цифровой и/или физической среде. Переход от пассивных чат-ботов ИИ к агентному ИИ знаменует собой фундаментальное изменение того, как организации взаимодействуют с системами ИИ и получают от них деловую отдачу.

Пример технологии: Воплощенный ИИ (embodied AI – ИИ, который обладает «телом» (физическим в случае робота или виртуальным в случае сложной симуляции). Такой ИИ сможет учиться, осваивая законы объемного мира с физическими предметами в нем. Взаимодействуя с окружающими объектами, он будет получать обратную связь от своих действий и познавать реальность на новом для подобных систем уровне – Н.Х.).

Инфраструктура и методы реализации возможностей

Ход эволюции генеративного ИИ определяется сочетанием новых методов и устоявшихся фундаментальных практик ИИ. Такие инновации, как обучение с самоконтролем (self-supervised learning), снижающее потребность в больших объёмах размеченных обучающих данных, предлагают решения для практических задач в области генеративного ИИ. В настоящее время обучение с самоконтролем используется в основном в таких областях применения, как автономное вождение и медицинская диагностика, но все большее число отраслей начинает экспериментировать с этой технологией.

Специализированная инфраструктура также привлекает внимание благодаря своей роли в обучении моделей и процессе получения выводов. Специализированные ИИ-чипы и инструменты могут помочь повысить эффективность и снизить сопутствующие затраты.

Пример технологии: суперкомпьютерные ИИ-вычисления

Арун Чандрасекаран (Arun Chandrasekaran)

Источник: сайт компании Gartner
https://www.gartner.com/en/articles/hype-cycle-for-genai 

среда, 14 мая 2025 г.

Искусственный интеллект революционизирует анализ неструктурированных данных: Разблокировка скрытой деловой ценности

Данная заметка Дика Вейсингера (Dick Weisinger – на фото) была опубликована 16 апреля 2025 года на блоге компании Formtek.

Искусственный интеллект трансформирует подход коммерческих организаций к неструктурированным данным, давая им возможность извлекать ценные знания и представления из ранее мало использовавшихся источников. Поскольку, согласно оценкам, неструктурированные данные обычно составляют примерно 80% всех данных, компании всё чаще обращаются к решениям на основе ИИ для управления этим огромным ресурсом и для анализа его содержимого.

ИИ-технологии, в особенности технологии обработки естественного языка (Natural Language Processing, NLP) и машинного обучения (МО), находятся на переднем крае этой революции. Соответствующие инструменты способны быстро обрабатывать и интерпретировать большие объёмы неструктурированных данных, включающие тексты, изображения и видеоматериалы. Как отмечает вице-президент по управлению продуктами ИИ-пакета IBM watsonx™ Эдвард Кальвесберт (Edward Calvesbert), «генеративный ИИ повысил важность неструктурированных данных, а именно документов, для технологии RAG (retrieval augmented generation – «генерация ответов, дополняемая поиском и извлечением релевантной фактической информации» - Н.Х.), а также для тонкой настройки больших языковых моделей (LLM) и традиционной аналитики, которые используются для машинного обучения, бизнес-аналитики и инженерии данных» (см. https://www.ibm.com/think/insights/unstructured-data-trends ).

Компании используют ИИ для автоматизации задач извлечения, очистки и обработки данных, высвобождая ресурсы для более ценных видов деятельности, таких как анализ данных и принятие решений. Например, анализ настроений (sentiment analysis) на основе ИИ позволяет оценивать общественное мнение о брендах и продуктах, анализируя сообщения в социальных сетях и отзывы клиентов. Данная возможность позволяет коммерческим организациям быстро реагировать на рыночные тенденции и потребности клиентов.

Последствия анализа неструктурированных данных на основе ИИ имеют далеко идущие последствия. Теперь коммерческие организации могут принимать более обоснованные решения на основе всесторонней информации, полученной из различных источников данных. По данным компании Swiss Re, страховщики, использующие ИИ для извлечения знаний из неструктурированных источников данных, могут ожидать улучшения показателей своей деятельности на 12–25%.

Интеграция ИИ с другими технологиями, такими как Интернет вещей (IoT), обещает раскрыть ещё больший потенциал. По мере того, как системы ИИ становятся все более сложными, они становятся способными обрабатывать и анализировать неструктурированные данные в режиме реального времени, давая тем самым возможность коммерческим организациям быстрее реагировать на меняющиеся условия рынка.

Хотя многие из этих ИИ-технологий уже используются, их потенциал ещё не раскрыт в полной мере. Как считает Кальвесберт, «документы есть у каждой компании - подумайте о тех материалах, которые они предоставляют новым сотрудникам в процессе приёма на работу - и этого достаточно, чтобы начать работу с инструментами RAG и семантическим поиском». Он указывает на то, что коммерческие организации могут начать использование ИИ для анализа неструктурированных данных немедленно, при этом в ближайшем будущем появятся более продвинутые приложения.

Искусственный интеллект революционизирует подходы коммерческих организаций к неструктурированным данным, превращая в ценный актив то, что когда-то было лишь источником головной боли. По мере того, как эти технологии продолжают развиваться, можно ожидать, что всё больше коммерческих организаций будут использовать возможности ИИ, чтобы в полной мере использовать потенциал своих неструктурированных данных, стимулируя тем самым в ближайшие годы инновации и получая конкурентное преимущество.

Дик Вейсингер (Dick Weisinger)

Источник: блог компании Formtek
https://formtek.com/blog/ai-revolutionizes-unstructured-data-analysis-unlocking-hidden-business-value/

понедельник, 7 апреля 2025 г.

США: Апелляционный суд по округу Колумбия отклонил возможность защиты авторских прав на созданные ИИ работы в отсутствие автора-человека

Данный пост израильского специалиста Луизы Жаровски (Luiza Jarovsky – на фото) был опубликован 19 марта 2025 года в социальной сети LinkedIn.

Апелляционный суд США по федеральному округу Колумбия 18 марта 2025 года своим решением отказал в защите авторских прав на созданные искусственным интеллектом (ИИ) работы в отсутствие автора-человека. Суд постановил, что для признания авторских прав в создание работ должен быть вовлечен человек.

Краткое изложение дела:

«В данном деле ученый-компьютерщик приписывает авторство произведения искусства функционированию программного обеспечения. Д-р Стивен Талер (Stephen Thaler) создал генеративный ИИ под названием «Машина творчества» (Creativity Machine). «Машина творчества» создала картину, которую д-р Талер назвал «Недавний вход в рай» (A Recent Entrance to Paradise). Д-р Талер подал заявку на регистрацию авторских прав на произведение «Недавний вход в рай» в Бюро регистрации авторских прав США (United States Copyright Office). В заявке д-р Талер указал «Машину творчества» как единственного автора произведения, а себя лишь как владельца произведения.

Бюро регистрации авторских прав отклонило заявку д-ра Талера на основании требования об авторстве человека. Данная политика требует, чтобы произведение изначально было создано человеком, чтобы иметь право на регистрацию авторских прав. Д-р Талер обратился в федеральный окружной суд с просьбой о пересмотре решения Бюро, и суд подтвердил это решение.

Мы подтверждаем отклонение заявки д-ра Талера на регистрацию авторских прав. «Машина творчества» не может быть признанным автором произведения, защищенного авторским правом, поскольку Закон США об авторском праве 1976 года (Copyright Act of 1976) требует, чтобы все подпадающие под защиту авторских прав произведения изначально были созданы человеком. Учитывая это положение, нам не нужно рассматривать аргумент Бюро регистрации авторских прав о том, что сама Конституция США требует авторства человека для всех материалов, защищенных авторским правом. Нам также не нужно рассматривать аргумент д-ра Талера о том, что он является автором работы в силу создания и использования им «Машины Творчества», поскольку эон сам отказался от своих прав при обращении в Бюро.»

Текст судебного решения доступен по адресу: https://rb.gy/ydwxwo

Луиза Жаровски (Luiza Jarovsky)

Источник: сайт LinkedIn
https://www.linkedin.com/posts/luizajarovsky_ai-aigovernance-aicopyright-activity-7308152332066652161-CaV2

вторник, 25 марта 2025 г.

Китай: Вводится маркировка материалов, созданных при помощи искусственного интеллекта ИИ, с целью борьбы с распространением ложной информации

Данная заметка Сюи Нуо (Xu Nuo) была опубликована 15 марта 2025 года в англоязычном издании газеты «Китай» (China Daily, 中国日报).

Новые правила, регламентирующие использование искусственного интеллекта, вступят в силу 1 сентября 2025 года.


Извещение о публикации «Меры по идентификации синтетического контента, созданного искусственным интеллектом» (《人工智能生成合成内容标识办法》) на сайте Управление киберпространства Китая (中华人民共和国国家互联网信息办公室), см. https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm

14 марта 2025 года власти Китая опубликовали правила, требующие маркировки всего созданного искусственным интеллектом и распространяемого в сети контента, с целью борьбы с неправомерным использованием ИИ и распространением ложной информации.

Данный нормативный документ, совместно выпущенный Управлением киберпространства Китая, Министерством промышленности и информационных технологий, Министерством общественной безопасности и Национальным управлением радио и телевидения, вступает в силу 1 сентября 2025 года.

Представитель Управления киберпространства сообщил, что этот шаг направлен на то, чтобы «положить конец неправомерному использованию генеративных технологий ИИ и распространению ложной информации».

В правилах говорится, что контент, сгенерированный или синтезированный с использованием технологий ИИ, включая тексты, изображения, аудио- и видеоматериалы и виртуальные сцены, должен быть помечен как видимым, так и невидимым образом.

Для контента, созданного с помощью технологий глубокого синтеза, потенциально способного сбить с толку или ввести в заблуждение общественность, явные видимые отметки должны быть размещены в разумном месте, чтобы обеспечить осведомлённость общественности.

Явными отметками являются чётко воспринимаемые пользователями отметки, включаемые в сгенерированный контенте или порождаемые в пользовательском интерфейсе, и представленные в таких формах, как текст, звук или графика.

Кроме того, правила требуют добавления неявных отметок в метаданные созданных файлов контента. Эти отметки должны включать сведения об атрибутах контента, имя или код поставщика услуг и идентификационные номера контента.

Включаемые в файлы метаданные — это описательная информация, встроенная в заголовок файла и фиксирующая сведения об источнике, атрибутах и цели контента.

Поставщики услуг, которые распространяют контент в Интернете, должны убедиться, что метаданные файлов контента содержат неявные метки сгенерированного с помощью ИИ контента (AIGC-метки, от AI-Generated Content), и что пользователи объявили данный контент сгенерированным или синтезированным с помощью ИИ. Также следует добавлять хорошо заметные отметки рядом с контентом для информирования пользователей.

В последнее время технологии генеративного (порождающего) ИИ использовалась для создания, казалось бы, реалистичного контента для рекламных трюков или получения коммерческой выгоды. Например, новостной репортаж, в котором утверждалось, что скончался один из каждых 20 человек, родившихся в 1980-х годах, вызвал в прошлом месяце общественный резонанс – однако оказался слухом, сфабрикованным с помощью ИИ.

Технологии генеративного ИИ также использовались для клонирования голосов и лиц многих известных людей с целью создания высокотехнологичных фальшивок (deepfakes), что является нарушением прав, за которое следует привлекать к ответственности по закону.

Ранее в марте 2025 года депутат Всекитайского собрания народных представителей 14-го созыва и основатель компании Xiaomi Corp Лэй Цзюнь, а также член Всекитайского комитета Народного политического консультативного совета Китая 14-го созыва и актер Цзинь Дун во время ежегодных сессий соответствующих органов предложили ввести законы и подзаконные нормативные акты, регламентирующие использование генерируемого ИИ контента.

«Некоторые зрители, которым нравятся мои фильмы и телешоу, были обмануты поддельными видео, в которых клонируют мое лицо, - что является весьма злонамеренным действием. Я надеюсь, что соответствующие правила будут установлены и расширены», — сказал Цзинь Дун во время панельной дискуссии в ходе этих двух сессий.

Ранее профессор Китайского университета коммуникаций Ту Линбо в своём интервью изданию China Daily отметил, что приток немаркированного контента, созданного ИИ, может нарушить экосистему интернета и создать проблемы для управления интернетом. По его словам, «Необходимо установить и расширить соответствующие законы и правила в отношении контента, созданного ИИ».

Сюи Нуо (Xu Nuo)

Мой комментарий: Как мне кажется, многие другие страны вскоре тоже последуют этому примеру. Поможет ли такая мера? Скорее всего, лишь отчасти, поскольку незаинтересованные в подобной маркировке стороны будут использовать как различные средства для снятия маркировки (что мы ранее наблюдали при появлении мер защиты цифровых авторских прав), и/или находить правовые лазейки (например, привлекая человека для «нанесения последних штрихов»), с тем, чтобы такой контент не считался созданным ИИ.

Источник: издание China Daily
https://www.chinadaily.com.cn/a/202503/15/WS67d4ba35a310c240449daeee.html

суббота, 4 января 2025 г.

Видео: Интервью со Стивеном Кларком о стандартах ИСО

19 декабря 2024 года на YouTube-канале InfoGov Hot Seat ( https://www.youtube.com/@InfoGovHotSeat ), специализирующемся на интервью с видными специалистами в области стратегического управления информацией, которые берёт ведущий канала Джим Меррифилд (Jim Merrifield), было выложено 17-минутное интервью с  бывшим Главным архивистом Новой Зеландии, ныне консультантом в сфере искусственного интеллекта, машинного обучения и управления информацией и данными Стивеном Кларком (Stephen Clarke).

Эпизод под названием «Анализ стандартов ИСО: разговор со Стивеном Кларком» (Exploring the ISO Standards: A Conversation with Stephen Clarke) доступен по адресу https://www.youtube.com/watch?v=EchVyJ58O38


В аннотации на эпизод отмечается:

«В данном эпизоде Джим Меррифилд (Jim Merrifield) берёт интервью у независимого консультанта по управлению информацией Стивена Кларка (Stephen Clarke), который делится своим уникальным опытом, включая забавный факт о дегустации лунной пыли.

Стивен рассказывает о своём участии в деятельности рабочий группы Международной организации по стандартизации (ИСО), в центре внимания которой находятся вопросы управления документами в контексте искусственного интеллекта (ИИ), подчеркивая при этом важность этичного ИИ и роль специалистов по стратегическому управлению информацией в продвижении технологий генеративного (порождающего) ИИ.

Он обращает внимание на необходимость «гигиены данных» и на возможности для специалистов по стратегическому управлению информацией продемонстрировать свою ценность в рамках текущего ландшафта ИИ и управления данными.»

В анонсе, опубликованном 20 декабря 2024 года в учётной записи «InfoGov Hot Seat» на сайте LinkedIn ( https://www.linkedin.com/company/infogov-hot-seat/posts/?feedView=all ), также сказано следующее:


Стивен Кларк (вверху) и Джим Меррифилд

«В этом увлекательном диалоге Джим Меррифилд берёт интервью у Стивена Кларка, обладающего поистине уникальным опытом (включая забавный факт о дегустации им лунной пыли).

В интервью Стивена делится ключевыми идеями по некоторым из наиболее актуальных вопросов в нашей отрасли, затрагивая следующие темы:

  • Его работа в рабочей группе Международной организации по стандартизации (ИСО) по управлению документами в контексте ИИ;

  • Почему этичный ИИ сегодня как никогда важен;

  • Ключевая роль специалистов по стратегическому управлению информацией в продвижении генеративного (порождающего) ИИ;

  • Насущная необходимость в строгой «гигиене данных»;

  • Как эксперты в области стратегического управления информацией могут продемонстрировать свою ценность в контексте быстро меняющегося ландшафта ИИ и данных.

Это интервью просто необходимо прослушать всем, кто интересуется пересечением областей ИИ, этики и стратегического управления информацией!»

Источики: сайт YouTube / сайт LinkedIn
https://www.youtube.com/watch?v=EchVyJ58O38
https://www.linkedin.com/posts/infogov-hot-seat_ighs58-exploring-the-iso-standards-a-conversation-activity-7275595506918076417-0j9f

пятница, 13 декабря 2024 г.

Евросоюз: Опубликован первый проект разработанного независимыми экспертами «Кодекса практики применения ИИ общего назначения»

Данная новость была опубликована 14 ноября 2024 года на сайте Европейской комиссии.

Независимые эксперты представляют первый проект «Кодекса практики применения ИИ общего назначения», который будет обсуждаться на следующей неделе с участием примерно 1000 заинтересованных сторон. Тем временем Управление по ИИ (AI Office) содействует правильному пониманию европейского Закона об ИИ (AI Act) посредством публикации для заинтересованных сторон ответов на часто задаваемые вопросы по ИИ.

Начавшийся 30 сентября 2024 года ( https://digital-strategy.ec.europa.eu/en/news/kick-plenary-general-purpose-ai-code-practice-took-place-online ) итеративный процесс разработки «Кодекса практики применения ИИ общего назначения» (General-Purpose AI Code of Practice, https://digital-strategy.ec.europa.eu/en/policies/ai-code-practice ) достиг важной вехи – завершён первый из четырех раундов разработки, которая будет продолжаться до апреля 2025 года. Первый проект Кодекса был подготовлен независимыми экспертами, которые были назначен председателями и заместителями председателей ( https://digital-strategy.ec.europa.eu/en/news/meet-chairs-leading-development-first-general-purpose-ai-code-practice ) четырёх тематических рабочих групп.

Организатор разработки Кодекса - Европейское управление по ИИ (European AI Office) -  опубликовало проект этого документа 14 ноября 2024 года. Эксперты разработали данную первоначальную версию на основе представленных поставщиками ( https://digital-strategy.ec.europa.eu/en/news/industry-academia-and-civil-society-contribute-work-code-practice-general-purpose-artificial ) моделей ИИ общего назначения – ведь именно им будет  адресован «Кодекса практики». При разработке документа также учитывались международные подходы.

Мой комментарий: Первый проект «Кодекса практики применения ИИ общего назначения» (First Draft General-Purpose AI Code of Practice) объёмом 36 страниц доступен по адресу https://ec.europa.eu/newsroom/dae/redirection/document/109946

Председатели и заместители председателей тематических групп представляют данный первый проект в качестве основы для дальнейшей детализации и уточнения, приглашая заинтересованные стороны дать свои замечания и предложения, помогая сформировать каждую итерацию текста на пути к окончательной версии Кодекса.

В документе излагаются основные принципы и цели Кодекса, чтобы дать заинтересованным сторонам чёткое представление о том, как в последствии могут выглядеть структура и содержание окончательной версии Кодекса. Специально выделены подлежащие дальнейшей проработки открытые для обсуждения вопросы. В окончательном проекте будут сформулированы чёткие цели, меры и, где это уместно, ключевые показатели эффективности (KPI).

Завершённый Кодекс будет играть ключевую роль в определении направлений будущих разработок и в развёртывания заслуживающих доверия и безопасных моделей ИИ общего назначения. Он должен будет подробно описывать правила для поставщиков моделей ИИ общего назначения (универсального ИИ), относящиеся к прозрачности и авторским правам. Для небольшого числа поставщиков наиболее тех передовых моделей ИИ общего назначения, которые могут представлять системные риски, Кодекс также должен будет подробно описывать таксономию системных рисков, меры оценки рисков, а также технические меры и меры стратегического управления по смягчению рисков.

Последующие шаги


В конце ноября в рамках пленарного заседания участников проекта разработки Кодекса председатели групп вместе с представителями почти тысячи заинтересованных сторон, а также с представителями государств-членов Евросоюза и европейскими и международными наблюдателями обсудят текст проекта на специальных заседаниях рабочих групп.

Каждый день будут проводиться заседания одной из четырёх рабочих групп, на которых соответствующие председатели информируют о достигнутом в последнее время прогрессе в разработке проекта. На заседания будут приглашены сбалансированно отобранные представители заинтересованных сторон, которые смогут поделиться устными замечаниями. Все участники получат возможность высказать свое мнение в интерактивном режиме и задать вопросы председателям. В пятницу 22 ноября 2024 года председатели представят выработанные в ходе обсуждений основные мысли и идеи на объединённом пленарном заседании.

Одновременно текст проекта через специальную платформу (Futurium) был разослан участникам пленарной встречи, и им было дано две недели (до 28 ноября) на отправку письменных отзывов. На основе поступивших замечаний и предложений председатели групп могут скорректировать включённые в первый проект меры, добавив в Кодекс больше деталей.

В используемых принципах работы над проектом подчеркивается, что меры, их элементы и ключевые показатели эффективности должны быть пропорциональны рискам, должны принимать во внимание масштабы деятельности поставщика модели универсального ИИ и допускать упрощенные варианты исполнения требований для малых и средних предприятий, а также стартапов. В соответствии с Законом об ИИ ( https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai ), в Кодексе также будут отражены основные исключения для поставщиков моделей с открытым исходным кодом. В принципах работы также подчеркивается необходимость баланса между четкими требованиями и гибкостью, способствующего адаптации по мере развития технологий.

Скачать проект Кодекса практики можно по адресу https://ec.europa.eu/newsroom/dae/redirection/document/109946 . Также можно скачать ответы на часто задаваемые вопросы по данной тематике ( https://digital-strategy.ec.europa.eu/en/faqs/general-purpose-ai-models-ai-act-questions-answers  ), которые поможет объяснить подход к регулированию ИИ общего назначения в европейском Законе об ИИ.

Источник: сайт Еврокомиссии
https://digital-strategy.ec.europa.eu/en/library/first-draft-general-purpose-ai-code-practice-published-written-independent-experts  

среда, 27 ноября 2024 г.

Европейский Парламент расширяет доступ к своим архивам с помощью ИИ-модели Claude, часть 2

(Окончание, начало см. https://rusrim.blogspot.com/2024/11/claude-1.html )

Надёжный выбор в плане доверия, этики и безопасности использования ИИ

При выборе партнера по внедрению ИИ Европарламент отдавал приоритет возможности доверять и надёжности. Была выбрана модель Claude, которая удовлетворяла этим критериям и соответствовала приверженности Европарламента этичному и ответственному использованию ИИ-технологий в государственном управлении.

Руководитель служб цифровизации Европарламента Марко Амабилино (Marco Amabilino) отмечает: «Мы оценили несколько больших языковых моделей и выбрали Claude, потому что эта модель использует т.н. «конституционный ИИ» (Constitutional AI) - фирменный подход к разработке ИИ-систем, который в процессе обучения ИИ «прививает»ему базовые ценности и принципы. В отношении Archibot это означает, что пользователи с большей вероятностью получат соответствующие этим принципам ответы, благодаря использованию обучающих данных из различных источников, таких как Декларация прав человека Организации Объединенных Наций». Развертывание Claude в рамках сервиса Amazon Bedrock обеспечило ещё одно преимущество в плане безопасности, позволив Европарламенту сохранить полный контроль над своим решением в собственной облачной среде Европейского союза.

Archibot значительно улучшает доступ к архивным документам и удобство работы с ними

Целью Европарламента при разработке приложения Archibot было скорее улучшение, чем полная автоматизация деятельности человека. До интеграции с моделью Claude квалифицированные сотрудники обрабатывали ежегодно сотни запросов. Теперь Archibot обрабатывает тысячи запросов ежемесячно. Такое сотрудничество, объединяющее человеческий опыт и эффективностью ИИ, значительно улучшило скорость и качество предоставления услуг и удовлетворённость пользователей.

Приложение Archibot оптимизировало операции и укрепило взаимоотношения между Европарламентом и исследователями. По словам Урса, «Они не просто обращаются к Archibot один раз - они начинают вести диалог о своих замечаниях и предложениях, и мы часто реализуем их предложения. Пользователи видят, что мы готовы помогать им, и в ответ они помогают нам улучшить наш инструмент».

Приложение Archibot значительно повлияло на сотрудников и на пользователей. Теперь пользователи экономят 80% времени, которое они затрачивали на поиск документов, что привело к 58%-ному росту удовлетворенности пользователей благодаря повышению продуктивности поиска, скорости и простоты использования. Благодаря своему глобальный охвату инструмент может применяться пользователями из сотен стран, помогая им получать доступ к архивам онлайн. Столь широкое использование и получаемая обратная связь подчеркивают успех Archibot в повышении удобства работы и удовлетворённости пользователей при работе с архивными документами Европарламента.

Потенциал генеративного ИИ для государственного сектора

Европарламент рассматривает Archibot как всего лишь начало освоения потенциала ИИ в сфере государственного управлении. Людовик Делепин предвидит более широкое применение: «В будущем парламенты смогут использовать генеративный ИИ для оптимизации законодательных процессов посредством поддержки разработки и рассмотрения документов. ИИ может помочь в резюмировании (реферировании) длинных отчётов, что позволит быстрее принимать решения и проводить более обоснованные обсуждения».

Мой комментарий: Зачем писать (в будущем, наверное, с помощью одного ИИ) длинные отчёты, если никто не будет их читать (кроме другого – или даже того же самого - ИИ)? И не проще ли требовать от авторов отчётов подготовки качественного краткого резюме?

Европейский парламент реагирует на высказываемую общественностью обеспокоенность в отношении прозрачности государственного управления и ответственного использования технологий, обращая особое внимание на доступность, этичное использование ИИ и на демократизацию информации. Приложение Archibot - это значительный шаг на пути к тому, чтобы сделать государственное управление в Евросоюзе более открытым и понятным для граждан. Она также демонстрирует, каким образом генеративный (порождающий) ИИ может способствовать тому, чтобы знания о прошлом помогали создавать лучшее будущее.

Мой комментарий: На сайте Архивов Европарламента основным интерфейсом онлайн-доступа для пользователей является «инструментальная панель» доступная по адресу: https://archidash.europarl.europa.eu/ep-archives-anonymous-dashboard (см. ниже):


Выбрав в правом верхнем углу Select Dashboard: content-analysis , а на открывшейся странице – вкладку Ask the EP Archives, можно задать свой вопрос чатботу, который вместе с ответом предложит ряд ссылок на документы (см. ниже):

Задав несколько провокационный вопрос «В чём цели долгосрочной конфронтации Евросоюза с Россией?», я получила такой ответ: «Не могу дать конкретного ответа. В наших документах в основном обсуждаются исторические события и взаимоотношения между Европейским сообществом и СССР/Россией в более ранний период, а не текущие долгосрочные цели… ». Приведя всё же несколько ссылок, чатбот в конце указал мне на то, что Евросоюз всегда стоял за демократию и мир во всём мире :)

С моей точки зрения, отдачу от такого инструмента всё равно можно получить, но пока что он не дотягивает до уровня квалифицированного архивиста, способного дать полезные советы по поиску архивных материалов. Кстати, обращает на себя внимание то, что мне дали ссылку на конкретные документы, а не на фонды, которые стоило бы «прокопать».

Также в качестве эксперимента я попробовала инструмент резюмирования (выбрав в правом верхнем углу Select Dashboard: tools , а на открывшейся странице – вкладку Document Summarizer), и … что-то он меня не впечатлил! Во-первых, при резюмировании загружаемого пользователем текстового файла есть ограничение на объём в 150 тысяч знаков (т.е. 50-75 страниц) – в него не вписываются многие европейские законы. Во-вторых, качество порождаемого резюме оказалось весьма сомнительным; проще и лучше будет посмотреть, когда это возможно, статью в Википедии или мнение эксперта …

Источник: сайт компании Anthropic / сайт YouTube
https://www.anthropic.com/customers/european-parliament
https://www.youtube.com/watch?v=P2xtHTPDxSs

вторник, 26 ноября 2024 г.

Европейский Парламент расширяет доступ к своим архивам с помощью ИИ-модели Claude, часть 1

Данная статья была опубликована 21 октября 2024 года на сайте компании Anthropic.

Европейский Парламент революционизирует доступ к своим обширным историческим архивам, внедряя инструмент на базе искусственного интеллекта (ИИ) «Спроси у Архивов Европарламента» (Ask the EP Archives), также известный как Archibot, созданный с помощью ИИ-моделей Claude (семейство генеративных ИИ-моделей компании Anthropic, обученных с использованием подхода Constitutional AI, обеспечивающего их «полезность, честность и безопасность» - Н.Х.) в рамках сервиса Amazon Bedrock (это сервис, предлагающий широкий выбор высокопроизводительных базовых ИИ-моделей от ведущих компаний, занимающихся искусственным интеллектом, таких как AI21 Labs, Anthropic, Cohere, Meta, Stability AI и Amazon на основе единого API-интерфейса, а также широкий набор возможностей, необходимых для создания приложений с генеративным искусственным интеллектом – Н.Х.).

Приложение Archibot даёт пользователям возможность мгновенно искать, извлекать и понимать накопленные за десятилетия нормативно-правовые документы и документы парламентских слушаний на многих языках.

Опираясь на ИИ-модель Claude, приложение Archibot:

  • Сокращает время поиска документов на 80%,

  • Повышает удовлетворенность клиентов примерно на 60%,

  • Позволяет обрабатывать в 10 раз больше запросов в месяц,

  • Делает легкодоступными для исследователей, законодателей, педагогов и общественности более 2,1 миллиона официальных документов.


3-минутный видеоролик о чатботе Archibot (доступен по адресу https://www.youtube.com/watch?v=P2xtHTPDxSs )

Сохранение истории и содействие прозрачности

Архивная служба Европейского Парламента в Люксембурге обеспечивает сохранность обширной коллекцию исторических документов. С 1952 года в этом архиве накоплено 5 погонных километров бумажных документов и 2 терабайта цифровых данных. Данные архивные документы играют ключевую роль для поддержания в Евросоюзе целостности государственного управления и содействия прозрачности.

Руководитель архивной службы Людовик Делепин (Ludovic Délépine) подчеркивает важность архива: «Эти усилия поддерживают подотчетность, доверие к институтам и информированное общество».

В течение многих лет перед архивистами стояли две основные проблемы: упростить поиск в архивах и обеспечить доступность архивов для всех, кому требуется получить к ним доступ. «Чтобы получить доступ к нашим архивам, людям приходилось приезжать в Люксембург или отправлять по электронной почте запрос на получение ограниченного количества скан-копий в формате .pdf», - поясняет руководитель отдела обработки Дэниел Урс (Daniel Urse). Появление генеративного (порождающего) ИИ кардинально изменило то, каким образом архивисты и исследователи могут ориентироваться в миллионах хранящихся в архиве документов.

Чатбот Archibot оживляет историю с помощью модели Claude


Для решения вопросов обеспечения доступности Европарламент создал приложение Archibot, который теперь доступен на веб-сайте архива Европарламента, предлагая пользователям по всему миру легкий доступ к документам Европарламент на нескольких языках, включая резолюции, позиции, политики и материалы межведомственных переговоров, а также помогая исследователям и сотрудникам анализировать данные и создавать всесторонние отчёты.

В число ключевых функциональных возможностей Archibot входят:

  • Резюмирование (реферирование) законодательства и истории Евросоюза, чтобы помочь пользователям понять ключевые детали, не читая ради этого документы целиком (хотя не очень понятно, зачем вообще обращаться к архивам, если нет желания работать с первоисточниками – Н.Х.).

  • Использование технологии «генерации ответов, дополняемой поиском и извлечением релевантной фактической информации» (Retrieval augmented generation, RAG), дающей пользователям возможность запрашивать и мгновенно получать конкретную и точную информацию.

  • Функциональные возможности, дающие возможность пользователям экстраполировать информации и формировать отчёты;

  • Поддержка иных языков помимо французского (который первоначально был официальным языком Евросоюза – Н.Х.) для обслуживания всех государств-членов Евросоюза.

  • Глобальная доступность для пользователей, включая законодателей, исследователей и представителей широкой общественности, позволяющая им изучать историю государственного управления Евросоюзом в отсутствие специальных знаний и/или без необходимости лично приезжать в Люксембург.

Говоря о важности данного инструмента, Людовик Делепин отмечает «В современную эпоху дезинформации, эти основные первоисточники [архивные документы – Н.Х.] имеют важнейшее значение для изучения нашего прошлого и поддержания наших ценностей».

(Окончание следует, см. https://rusrim.blogspot.com/2024/11/claude-2.html )

Источник: сайт компании Anthropic / сайт YouTube
https://www.anthropic.com/customers/european-parliament
https://www.youtube.com/watch?v=P2xtHTPDxSs
 


понедельник, 16 сентября 2024 г.

Трансформирующая сила подготовки данных в эпоху порождающего (генеративного) искусственного интеллекта

Данная заметка Дика Вейсингера (Dick Weisinger – на фото) была опубликована 22 августа 2024 года на блоге компании Formtek.

Порождающий (генеративный) ИИ (generative A, GenAI) становится фактором, который меняет правила игры во многих областях. В сфере инженерии данных порождающий ИИ революционизирует способ обработки и управления данными. Хотя влияние порождающего ИИ, несомненно, глубоко, оно также заново напоминает вековую истину: подготовка данных всегда была важнейшим компонентом успешных инициатив в области данных.

Порождающий ИИ - это не просто «модные» алгоритмы; это эффективность и точность. Автоматизируя повторяющиеся задачи, генерируя код и оптимизируя перемещение данных, порождающий ИИ становится бесценным инструментом для инженеров данных, занимающихся организацией сложных конвейеров обработки данных. Данный симбиоз порождающего ИИ и человеческого опыта открывает новую эру автоматизации, когда созданные ИИ шаблоны легко интегрируются с индивидуализированным кодом, освобождая инженерам данных время для того, чтобы сосредоточить своё внимание на таких тонких аспектах, как логика трансформаций.

Влияние порождающего ИИ на инженерию данных уже ощущается в различных отраслях. Рассмотрим пример из практики, в котором порождающий ИИ был интегрирован в жизненный цикл данных клиента ( https://fractal.ai/transforming-data-engineering-with-genai/ ): создание таблиц, перемещение данных и генерация тестовых примеров стали автоматизированными, что привело к сокращению времени и усилий на 50%. Благодаря возможностям порождающего ИИ аналитики смогли выполнять сложные задачи анализа данных с большей эффективностью. В финансовом секторе порождающий ИИ ускоряет регрессионное тестирование, избегая ручной работы при генерации тестовых данных и обеспечивая безопасность данных во время передачи.

Интеграция порождающего ИИ в инженерию данных имеет далеко идущие последствия и приводит к значительным сдвигам в отрасли:

  • Гибкость и эффективность: Порождающий ИИ повышает гибкость, давая инженерам данных возможность быстро адаптировать конвейеры обработки в ответ на меняющиеся потребности деловой деятельности. Повышение эффективности проходит сквозь всю экосистему данных, оптимизируя использование ресурсов и сокращая время на выработку нужных знаний и представлений.

  • Запросы на естественном языке: Отдача от порождающего ИИ охватывает запросы на естественном языке, сокращая разрыв между техническим жаргоном и языком деловых пользователей. Представьте себе, например, что порождающий ИИ правильно интерпретирует запрос «Покажите мне тенденции продаж за второй квартал 2024 года» и предоставляет нужную информацию.

  • Масштабируемость: По мере того, как объемы данных продолжают стремительно расти, критически важным становится масштабируемость порождающего ИИ. Он легко обрабатывает большие наборы данных, оптимизируя скорость обработки и использование ресурсов, а также способствуя тому, чтобы инженерия данных шла в ногу с постоянно растущими объёмами данных.

В будущем мы можем ожидать следующее:

  • Более «умные» (интеллектуальные) конвейеры данных: Благодаря порождающему ИИ продолжится совершенствование процессов перемещения, преобразования и оркестровки данных. Конвейеры будут динамически адаптироваться, обучаясь на основе закономерностей и оптимизируя себя для достижения максимальной эффективности.

  • Этичный ИИ: По мере того, как порождающий ИИ будет становиться всё более распространённым, в практику инженерии данных будут интегрироваться этические соображения. Выявление необъективности / предвзятости, защита неприкосновенности частной жизни (персональных данных) и справедливость станут неотъемлемыми компонентами инициатив по работе с данными на основе порождающего ИИ.

  • Бесперебойное сотрудничество: Инженеры данных и порождающий ИИ будут беспрепятственно сотрудничать, используя сильные стороны друг друга для преодоления сложностей, обеспечения качества и надёжности данных и для извлечения новых знаний и идей из данных.

Дик Вейсингер (Dick Weisinger)

Источник: блог компании Formtek
https://formtek.com/blog/the-transformative-power-of-data-preparation-in-the-genai-era/

среда, 28 августа 2024 г.

Пять ключевых идей для специалистов по управлению документами относительно использования искусственного интеллекта в управлении информацией, часть 2

(Окончание, начало см. https://rusrim.blogspot.com/2024/08/1_27.html )

3. Применение ИИ в управлении информацией и документами

Возможности генеративного ИИ по извлечению, анализу, реферированию и классификации информации делают его отличным инструментом для многих процессов управления документами и информацией.

Приложения генеративного ИИ для управления документами и информацией включают:

  • классификацию и маркировку документов и информации;

  • улучшение процесса поиска и извлечения (посредством предоставления ответов на запросы, а также выдачи списков результатов);

  • реферирование документов и информации (например, ответ на запрос «выдайте мне историю этого проекта»);

  • рекомендации конечным пользователям относительно выбора названий дел и файлов, их размещения, маркировки (в т.ч. установления грифов – Н.Х.);

  • выявление важнейших документов (т.е. тех, что необходимы для обеспечения непрерывности деловой деятельности в случае ЧП и для восстановления после катастроф – Н.Х.) и чувствительной (высококонфиденциальной) информации;

  • анализ закономерностей создания и использования документов в организации.

Проблема внедрения генеративного ИИ в деятельность по управлению информацией и документами заключается в том, что для этого потребуются высококачественные входные данные – например, в форме контролируемых данных для тонкой настройки (fine tuning), дополнения подсказок (prompt stuffing – вставка дополнительного контента в подсказки, передаваемые на вход большой языковой модели – Н.Х.) или генерации, дополняемой поиском и извлечением (retrieval augmented generation – по сути, предоставление модели дополнительного контента, необходимого для ответа на конкретные вопросы – Н.Х.). Без такого рода настройки типовые предварительно обученные модели, скорее всего, будут выдавать неверные результаты. Организациям, внедрившим у себя хорошие меры и средства управления документами и информацией, будет проще воспользоваться преимуществами этой технологии.

4. Широкое применение ИИ за рамками управления документами

Конечно, потенциал генеративного ИИ выходит далеко за рамки управления документами. Он радикально изменяет способы создания и использования информации на рабочих местах и в обществе в целом. Инструменты генеративного ИИ, такие как Microsoft Copilot, уже используются на рабочих местах для составления черновиков контента (например, для подготовки проектов ответов на электронные письма или изображений для презентаций), для резюмирования/реферирования и расшифровки (например, для создания протоколов совещаний), для перевода, автоматизации рабочих процессов, выполнения анализа, взаимодействия с клиентами (онлайн-чатботы), для написания кода и даже мониторинга безопасности (Microsoft Copilot for Security).

5. Этические и документационные риски: роль специалистов по управлению документами

Хотя ИИ позволяет получить многообразную отдачу, он также порождает серьезные этические риски, риски для информационной безопасности и защиты персональных данных, а также проблемы в управлении документами. Так, например, ИИ-системы могут перенять и даже усилить предвзятость и необъективность, присутствующую в обучающих данных, что может приводить к несправедливым или дискриминационным результатам. Генерируемый ИИ-системами контент может содержать неточности и «галлюцинации». С ИИ-системами связан ряд новых рисков безопасности (например, «инъекций в подсказки» - prompt injection, и «отравления данных» - data poisoning), и при их использовании возможна утечка чувствительных (конфиденциальных) данных. Для управления этими рисками необходимы надёжное стратегическое управление и надзор со стороны человека над ИИ-процессами, и здесь специалисты по управлению документами входят в число ключевых по важности заинтересованных сторон.

Google в своем «Подходе к созданию концепции безопасного ИИ» (Secure AI Framework Approach, https://developers.google.com/machine-learning/resources/saif ) выделяет происхождение данных, метаданные и контроль над созданием и уничтожением данных как важные части того, что компания называет «стратегическим управлением ИИ-данными» (AI data governance), - и это как раз те вопросы, в которых специалисты по управлению документами хорошо разбираются. Специалистам по управлению документами также следует участвовать в обсуждении того, в каком порядке корпоративная информация предоставляется ИИ-системам; а также в стратегическом управлении тем, как идентифицируется и контролируется сгенерированный ИИ контент, и в принятии решений об интеграции ИИ в корпоративные процессы управления документами.

Использование возможности ИИ в своей деловой деятельности: освоение возможностей и управление рисками

Компания Recordkeeping Innovation предлагает комплексную услугу по стратегическому управления ИИ, призванную помочь организациям разобраться со сложностями интеграции ИИ в свои практики управления информацией. Наша услуга обеспечивает ответственное, этичное и соответствующее законодательно-нормативным требованиям внедрение технологий ИИ. Предоставляя экспертные рекомендации по стратегическому управлению данными, по обеспечению безопасности и защиты персональных данных, мы даём организациям возможность использовать весь потенциал ИИ, поддерживая при этом целостность своих документов и информационных систем и доверие к ним.

Ричард Лехейн (Richard Lehane)

Источник: блоге австралийской компании Recordkeeping Innovation
https://records.com.au/five-key-insights-on-ai-in-information-management-for-records-managers/

вторник, 27 августа 2024 г.

Пять ключевых идей для специалистов по управлению документами относительно использования искусственного интеллекта в управлении информацией, часть 1

Данный пост известного «электронного архивиста» Ричарда Лехейна (Richard Lehane - на фото) был опубликован 1 августа 2024 года на блоге австралийской компании Recordkeeping Innovation («Инновации в управлении документами»).

Поскольку организации сейчас внедряют искусственный интеллект (ИИ) в свою оперативную деятельность, специалистам по управлению документами необходимо понимать воздействие ИИ на управление информацией. Генеративный (порождающий) ИИ особенно преобразует эту область, расширяя возможности для классификации, поиск и реферирование. В данной статье представлены пять ключевых идей о том, как применение ИИ в сфере управления информацией преобразует управление документами. Статья предлагает важную информацию для профессионалов, стремящихся эффективно использовать эти достижения, одновременно решая потенциальные проблемы.

1. Порождающий (генеративный) ИИ: Текущий центр внимания при использовании ИИ в управлении информацией

Искусственный интеллект (ИИ) - это большая предметная область с глубокой историей, однако в настоящее время всё внимание сосредоточено на технологиях порождающего (генеративного) ИИ, который представляет собой модели машинного обучения, обученные на чрезвычайно больших массивах текста, изображений, аудио и видеоматериалов. Например, такие решения как DALL-E 2 и ChatGPT, базируются на модели GPT-3 компании OpenAI. Инструменты генеративного ИИ могут быть ориентированы на выполнение определённых задач, таких как генерация текста или изображений, или же могут быть мультимодальными, способными как потреблять, так и порождать как текстовой, так и аудиовизуальный контент.

Инструменты генеративного ИИ предназначены не только для создания реалистичных изображений или убедительных диалогов. Они используются в разнообразных приложениях, включая перевод, реферирование, формирование субтитров, классификацию, извлечение информации, распознавание изображений, транскрибирование, анализ и формирование идей.

При оценке инструментов генеративного ИИ необходимо учитывать следующие основные факторы:

  • Используемые ими базовые модели: В основе подобных инструментов лежат модели, которые были предварительно обучены на больших массивах контента – например, захваченного в интернете. Этот контент может быть источником рисков, таких как вредные предубеждения, неточности (известные моделям факты могут устареть) и проблемы с правами интеллектуальной собственности. Базовые модели могут быть различного масштаба (измеряемого миллионами или миллиардами параметров). Модели большего масштаба обычно выдают более качественные результаты, но их использование является более затратным.

  • Способность к тонкой настройке: После предварительного обучения базовой модели часто проводится дальнейшее обучение с использованием меньших по объёму, но более качественных массивов данных. Эта тонкая настройка позволяет настроить инструмент для выполнения определённой задачи (например, выполнения роли чат-бота) и устранить проблемы (например, учесть наличие необъективности и предубеждений). Поскольку обучающие наборы для тонкой настройки намного меньше по объёму, этот процесс можно повторять часто. Некоторые сервисы позволяют клиентам использовать для тонкой настройки их собственные данные.

  • Объём даваемых пользователем подсказок (указаний): «Контекстное окно» (context window) - это объём входных данных, с которыми может работать система, измеряемый в «токенах» (token). Размер контекстных окон обычно измеряются тысячами токенов, но некоторые новые сервисы могут принимать миллионы токенов, что эквивалентно нескольким книгам или нескольким часам видеозаписей. Более крупные контекстные окна позволяют настраивать получаемые ответы, загружая в рамках запроса соответствующие справочные/исходные материалы вместе с подсказками.

  • Возможность интеграции: Некоторые инструменты поддерживают варианты интеграции, которые придают им новые возможности - например, возможность функционировать в качестве агентов (например, отправляя электронные письма или устанавливая напоминания в календаре) или выполнять такие действия, как поиск в Интернете, с целью повышения качества выдаваемых результатов. «Генерация, дополненная исследованиями» (research augmented generation) даёт конечным пользователям возможность заполнять базы данных собственным контентом, к которому затем выполняются запросы с помощью моделей.

2. Достижения в области порождающего (генеративного) ИИ и их влияние на управление информацией

Большой дебют генеративного ИИ состоялся в 2022 году, когда были запущены два революционных инструмента компании ( https://openai.com/ ): сервис преобразования текста в изображение DALL-E 2 и чат-бот ChatGPT на основе большой языковой модели. Впоследствии был выпущен целый поток новых инструментов и сервисов, включая Copilot (Microsoft, https://copilot.microsoft.com/ ), Gemini (Google, https://gemini.google.com/ ), Llama (Meta, https://llama.meta.com/ ), Mistral ( https://mistral.ai/ ) и Claude (Anthropic, https://www.anthropic.com/claude ).


Изображение на основе подсказки «специалист по управлению документами работает за своим ноутбуком, размышляя о будущем ИИ в управлении информацией» создано с помощью ИИ (Microsoft Copilot) 30 июля 2024 года

Примечательно, что пока что не наблюдается никаких признаков замедления темпов прогресса. Специалисты компании OpenAI в 2020 году написали статью ( https://openai.com/index/scaling-laws-for-neural-language-models/ ), в которой отметили, что «интеллект» больших языковых моделей предсказуемо масштабируется вместе с  размером моделей, объёмам используемых для обучения моделей наборов данных и объемами вычислений. Это правило актуально и сегодня, и это означает, что нам не нужно ждать новых технических прорывов, чтобы увидеть дальнейшие достижения -достаточно просто увеличить размер моделей и объёмы используемых данных.

(Окончание следует, см. http://rusrim.blogspot.com/2024/08/2_0829789621.html )

Ричард Лехейн (Richard Lehane)

Источник: блоге австралийской компании Recordkeeping Innovation
https://records.com.au/five-key-insights-on-ai-in-information-management-for-records-managers/

среда, 29 мая 2024 г.

США: Национальный институт стандартов и технологий NIST начал публичное обсуждение проектов руководств по использованию ИИ и объявил о новой программе по оценке технологий генеративного ИИ

Данная заметка Эбби Хоскин (Abigail (Abby) Novick Hoskin – на фото) была опубликована 30 апреля 2024 года на форуме сайта EffectiveAltruism.org .

Национальный институт стандартов и технологий (National Institute of Standards and Technology, NIST) при правительстве США предлагает заинтересованным лицам присылать свои замечания и предложения на 4 проектам рекомендаций по стратегическому управлению искусственным интеллектом (ИИ). NIST также объявил о своей новой программе по оценке и измерению технологий порождающего (генеративного) ИИ.

И то, и другое представляются отличными возможностями для людей, заинтересованных в стратегическом управлении ИИ и оценке ИИ-технологий!

Рекомендации по стратегическому управлению ИИ, на которые можно представить отзывы


Ниже перечислены проекты, упомянутые в опубликованном извещении (см. https://www.commerce.gov/news/press-releases/2024/04/department-commerce-announces-new-actions-implement-president-bidens ):

  • Публикация NIST AI 600-1 «Концепция управления рисками искусственного интеллекта: Профиль порождающего (генеративного) искусственного интеллекта» (Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile) объёмом 79 страниц, см. https://airc.nist.gov/docs/NIST.AI.600-1.GenAI-Profile.ipd.pdf

  • Специальная публикация NIST SP 800-218A «Практика безопасной разработки программного обеспечения для генеративного ИИ и базовых ИИ-моделей двойного назначения – Профиль для сообщества, следующего концепции разработки безопасного ПО (SSDF – от Secure Software Development Framework – Н.Х.)» (Secure Software Development Practices for Generative AI and Dual-Use Foundation Models - An SSDF Community Profile) объёмом 29 страниц, см. https://nvlpubs.nist.gov/nistpubs/SpecialPublications/NIST.SP.800-218A.ipd.pdf

  • Публикация NIST AI 100-4 «Снижение рисков, связанных с синтетическим контентом - Обзор технических подходов к прозрачности цифрового контента» (Reducing Risks Posed by Synthetic Content - An Overview of Technical Approaches to Digital Content Transparency) объёмом 95 страниц, см. https://airc.nist.gov/docs/NIST.AI.100-4.SyntheticContent.ipd.pdf

  • Публикация NIST AI 100-5 «План глобального взаимодействия по стандартам ИИ» (A Plan for Global Engagement on AI Standards) объёмом 29 страниц, см. https://airc.nist.gov/docs/NIST.AI.100-5.Global-Plan.ipd.pdf

Проекты публикаций NIST AI 600-1, NIST AI 100-5 и NIST AI 100-4 доступны для просмотра и комментирования на веб-сайте Центра ресурсов NIST по искусственному интеллекту (NIST Artificial Intelligence Resource Center, https://airc.nist.gov/AI_RMF_Knowledge_Base/Technical_And_Policy_Documents ); а проект специальной публикации NIST SP 800-218A доступен для просмотра и комментирования на веб-сайте Центра ресурсов NIST по компьютерной безопасности ( https://csrc.nist.gov/projects/ssdf ).

Публикации охватывают различные аспекты ИИ-технологии: первые две представляют собой руководства, призванные помочь с управлением рисками порождающего (генеративного) ИИ - технологии, которая лежит в основе чат-ботов и инструментов для создания изображений и видеоматериалов на основе текстовых указаний. Они также являются ресурсами, поддерживающими концепцию NIST по управлению рисками искусственного интеллекта (AI Risk Management Framework, AI RMF, https://www.nist.gov/itl/ai-risk-management-framework ) и концепцию разработки безопасного ПО (Secure Software Development Framework, SSDF,  https://csrc.nist.gov/pubs/sp/800/218/final ) соответственно. Третий документ предлагает подходы к обеспечению прозрачности цифрового контента, который ИИ может создавать или изменять; а четвертый - предлагает план организации глобального участия в разработке стандартов ИИ.

Конкурс по оценке ИИ-технологий: регистрация откроется в мае

В рамках программы NIST «GenAI» («генеративный ИИ») будет предложено решить ряд сложных задач, связанных с оценкой и измерением возможностей и ограничений технологий порождающего (генеративного) ИИ. Результаты будут использоваться для выбора стратегий, способствующих обеспечению целостности информации и направляющих безопасное и ответственное использование цифрового контента.

Одна из целей программы заключается в том, чтобы помочь людям определить, кем был создан тот или иной текст, изображение, видео или аудиозапись - человеком или искусственным интеллектом.

Регистрация на участие в пилотных оценках откроется в мае 2024 года. Целью этих усилий будет понимание того, чем созданный человеком контент отличается от синтетического. Более подробную информацию о данном конкурсе и о том, как зарегистрироваться на участие в нём, можно найти на веб-сайте программы GenAI по адресу https://ai-challenges.nist.gov/genai .

Эбби Хоскин (Abigail (Abby) Novick Hoskin)

Источник: форум сайта EffectiveAltruism.org
https://forum.effectivealtruism.org/posts/fhZcEGsxEjD5SapxE/nist-seeks-comments-on-draft-ai-guidance-documents-announces

четверг, 2 мая 2024 г.

Китай: Для публичного обсуждения выложен проект национального стандарта GB/T «Требования по безопасности для данных, используемых для предварительного обучения и оптимизации генеративного ИИ»

Данная заметка сингапурского юриста Даррена Грейсона Чана (Darren Grayson Chng), занимающегося правовыми вопросами защиты персональных данных и технологий, была опубликована 8 апреля 2024 года в социальной сети LinkedIn.

3 апреля 2024 года китайский технический комитет по стандартизации SAC/TC260 «Кибербезопасность» опубликовал для публичного обсуждения проект национального стандарта GB/T «Технологии кибербезопасности – Требования по безопасности для данных, используемых для предварительного обучения и точной настройки генеративного искусственного интеллекта» (《网络安全技术 生成式人工智能预训练和优化训练数据安全规范》, самоназвание на английском языке: Cybersecurity technology - Security specification for generative artificial intelligence pre-training and fine-tuning data) объёмом 17 страниц, см. https://www.tc260.org.cn/file/2024-04-01/94e7e6de-2688-472c-af8b-a6cfe7fc7d29.pdf (автоперевод на английском языке присоединен к посту в LinkedIn, см. https://www.linkedin.com/posts/darrengraysonchng_activity-7183133824770273283-I4Wv ).
 
Если Вы предоставляете услуги порождающего (генеративного) искусственного интеллекта (ИИ) в Китае, то Вам стоит посмотреть, что Вас ждёт. Как обычно, эти требования не являются обязательными и носят рекомендательный характер, однако они могут «послужить основой для проведения оценок регуляторами».

Мой комментарий:
Во вводной части документа отмечается:

«В настоящем документе сформулированы требования безопасности в отношении данных, используемых для предварительного обучения и для оптимизации порождающего (генеративного) искусственного интеллекта, а также действий по их обработке. В нём также описываются соответствующие методы оценки.

Данный документ должен помочь поставщикам услуг генеративного ИИ в проведении подготовки данных для предварительного обучения и для оптимизации генеративного ИИ, а также в проведении самооценки по безопасности в отношении таких данных. Он также может послужить основой для проведения оценок регуляторами.»

Содержание стандарта следующее:

Предисловие
1. Область применения
2. Нормативные ссылки
3. Термины и определения
4. Общий обзор
5. Общие требования безопасности
6. Требования безопасности в отношении обработки данных для предварительного обучения генеративного ИИ
7. Требования безопасности в отношении обработки данных для оптимизации генеративного ИИ
8. Методы оценки
Приложение A (справочное): Основные риски безопасности, связанные с обработкой данных для предварительного обучения и для оптимизации генеративного ИИ
Приложение B (нормативное): Требования к ключевым тезаурусам и таксономическим моделям
Библиография

Ключевые / интересные моменты следующие:

1. В «Требованиях» перечислены требования безопасности в отношении данных для предварительного обучения и оптимизации (pre-training and optimisation training data, POTD) генеративного ИИ. Рассматриваются вопросы общей безопасности данных и безопасности действий по обработке данных.

2. Общая безопасность данных: Поставщики услуг должны:

  • классифицировать и оценить POTD-данные,

  • реализовать технические меры для мониторинга безопасности POTD-данных, оперативно давая предупреждения и принимая меры по устранению при выявлении недостатков в безопасности данных, уязвимостей и иных рисков [звучит так, как будто необходимо будет удалить данные - возможно, весь набор данных? –Подозреваю, что в китайском оригинале на самом деле речь идёт об устранении недостатков данных, а не об удалении данных – Н.Х.],

  • реализовать технические меры, такие как идентификация и аутентификация, контроль доступа, шифрование,

  • создать механизм экстренного реагирования на инциденты безопасности,

  • документировать операции по обработке данных.

3. Требования безопасности в отношении обработки данных для предварительного обучения генеративного ИИ – существуют требования в отношении:

  • сбора данных – например, нужно документировать происхождение данных;

  • предварительной обработки – например, нужно к выборкам данных добавлять метаданные;

  • использованию – например, нужно получить согласие на обработку персональных данных и отдельное согласие на использование специальных персональных данных, нельзя использовать данные, нарушающие права интеллектуальной собственности, следует принять меры по снижению вероятности того, что порождающий (генеративный) ИИ будет использован для генерирования контента, представляющего угрозу безопасности.

4. Требования безопасности в отношении обработки данных для оптимизации генеративного ИИ – существуют требования в отношении те же категорий данных, что и упомянутые выше. Во-первых, если вы собираете данные, сгенерированные порождающим ИИ, то должны задокументировать версию используемой модели/сервиса порождающего ИИ и время сбора, а также тщательно изучить эти данные на предмет наличия контента, представляющего угрозу безопасности.

5. В «Требованиях» сказано, что именно следует проверять при оценке общей безопасности и безопасности действий, упомянутых выше в пп. 3 и 4. Имеются весьма детальные требования – например, требование случайным образом отобрать не менее 100 образцов после предварительной обработки и проверить, не содержат ли они контент, представляющий угрозу безопасности или серьезные риски нарушения прав интеллектуальной собственности.

6. В Приложении А рассказывается о том, что такое «угроза безопасности». В их число включаются:

  • контент, не соответствующий основным социалистическим ценностям - например. контент, оправдывающий терроризм, пропагандирующий насилие и порнографию, распространяющий ложную информацию, а также ставящий под угрозу национальную безопасность и интересы, подрывающий национальное единство и социальную стабильность;

  • дискриминационный контент – например, в отношении возраста, религии, этнической принадлежности;

  • незаконная коммерческая деятельность – например, нарушение прав интеллектуальной собственности, разглашение коммерческой тайны;

  • нарушение законных прав и интересов других лиц – например, контент, наносящий ущерб репутация, разглашающий персональные данные, сведения физическом и психическом здоровье.

Даррен Грейсон Чан (Darren Grayson Chng)

Источник: сайт LinkedIn
https://www.linkedin.com/posts/darrengraysonchng_activity-7183133824770273283-I4Wv