среда, 2 апреля 2025 г.

Парадокс чрезмерно чистых данных в сфере искусственного интеллекта и машинного обучения

Данная заметка Дика Вейсингера (Dick Weisinger – на фото) была опубликована 10 февраля 2025 года на блоге компании Formtek.

Мысль о том, что данные могут быть «слишком чистыми», может показаться нелогичной. Однако эта концепция набирает популярность среди экспертов, которые признают, что чрезмерно очищенные наборы данных потенциально могут снизить ценность и применимость ИИ-моделей в реальных ситуациях.

Очистка данных является необходимым шагом при подготовке информации к анализу, однако чрезмерная очистка может привести к удалению важных нюансов и изменчивости, отражающих условия реального мира. Как заметил один специалист по данным: «Если результат кажется слишком «чистым», стоит еще раз проверить, были ли данные действительно получены экспериментальным путём». Такое отношение подчеркивает важность поддержания баланса между качеством данных и верностью отражения данными реального мира.

Компании всё больше осознают этот парадокс. Многие из них в настоящее время берут на вооружение стратегии, обеспечивавшие сохранение внутренне присущей данным неупорядоченности, при этом по-прежнему обеспечивая удобство их использования. Так, например, некоторые организации внедряют практики стратегического управления данными, которые фокусируются на сохранении сведений о происхождении и контекста данных, а не только на их чистоте. Такой подход позволяет более с большими нюансами понимать качество данных и его последствия для ИИ-моделей.

Последствия использования чрезмерно чистых данных могут быть существенными. Обученные на таких данных модели могут хорошо работать в контролируемых средах, но терпеть неудачи при столкновении со сложностями реальных данных. В итоге это может привести к предвзятым или неточным прогнозам, потенциально способным вызвать серьезные последствия в таких критически важных приложениях, как здравоохранение или финансовые услуги.

Для решения этой проблемы специалисты по данным разрабатывают более сложные методы подготовки данных, которые направлены на сохранение естественной изменчивости в наборах данных, удаляя при этом действительно ошибочную или нерелевантную информацию. Кроме того, всё больше внимания уделяется использованию методов генерации синтетических данных для введения реалистичного шума и изменчивости в обучающие наборы данных.

Хотя чистые данные остаются ключевыми по важности для многих приложений, сообщество ИИ осознает ценность сохранения некоторого уровня «беспорядочности» в наборах данных. Этот сдвиг в точке зрения стимулирует инновации в сфере подготовки данных и разработки моделей, в конечном итоге приводя к созданию ИИ-систем, которые являются более устойчивыми и лучше способными работать в реальных условиях. По мере развития области ИИ и машинного обучения поиск правильного баланса между чистотой данных и верным отражением реального мира станет ключом к раскрытию полного потенциала технологий ИИ и машинного обучения.

Дик Вейсингер (Dick Weisinger)

Источник: блог компании Formtek
https://formtek.com/blog/the-paradox-of-over-clean-data-in-ai-and-machine-learning/

Моё выступление на научно-практической конференции «Архив и исторический источник: Современные подходы к исследованию»

11-12 марта 2025 года в Сургуте прошла научно-практическая конференция «Архив и исторический источник: Современные подходы к исследованию».

На секции № 2 «Архивные документы (Архивы) – источники проектных решений и креативных идей» я выступила с докладом «Искусственный интеллект в управлении документами и архивном деле: Что останется, когда закончится ажиотаж».

Сейчас поднят ажиотаж вокруг технологий машинного обучения, чат-ботов и генеративного искусственного интеллекта - в ущерб другим технологиям, которые также можно отнести к технологиям ИИ

Технологии машинного обучения интересные, но при этом дорогостоящие, трудозатратные, трудноподъёмные для архивов. Они выдают результаты «творческого» характера, которые могут соответствовать фактам, а могут не соответствовать

В то же время сейчас стали широкодоступными многочисленные иные инструменты, которые дешевле и проще внедрить в практику архивной работы, получив при этом существенную отдачу

С моей точки зрения в первую очередь стоит обратить внимание на следующие технологии:

  • Восстановление цвета и повышение качества черно-белых фотографий и записей;

  • Распознавание и перевод с иностранных и древних языков;

  • Распознавание рукописных текстов;

  • Распознавание речи, распознавание объектов;

  • Идентификация людей по лицу и голосу, на основе которого возможно создание транскрипции и описания фото- фоно, кинодокументов;

  • Восстановление разорванных и шредерованных документов.

Более сложные технологии, которые используют Генеративного ИИ:

  • Оживление лиц по фотографиям и портретам;

  • Восстановление первоначального внешнего вида (например, греческих статуй и зданий);

  • Анализ и попытки автоматического упорядочения и организации россыпи; документов, включая нерассортированные ящики электронной почты;

  • Оценка подходящего срока хранения документов и их ценности;

  • Оценка степени конфиденциальности документов;

  • Сложный интеллектуальный поиск по архивным фондам;

  • Автоматическое формирование резюме документов, описания дел и фондов.

Видеозапись доклада выложена по адресу: https://rutube.ru/video/5aa2c0de9a8ef68f8a75ed283b6e2f4d/


Презентация к докладу доступна на Google Docs по адресу: https://docs.google.com/presentation/d/e/2PACX-1vSwt_vizSgZj4bl_JP4DyrSgHaJ6pXXQiUGYw0f2tmdCN6Zw7j-of9kOrGAnks-6w/pub?start=false&loop=false&delayms=3000

Источник: RuTube / Google Docs
https://rutube.ru/video/5aa2c0de9a8ef68f8a75ed283b6e2f4d/
https://docs.google.com/presentation/d/e/2PACX-1vSwt_vizSgZj4bl_JP4DyrSgHaJ6pXXQiUGYw0f2tmdCN6Zw7j-of9kOrGAnks-6w/pub?start=false&loop=false&delayms=3000

вторник, 1 апреля 2025 г.

Что обязательно и что весьма желательно в управлении документами

Данный пост австралийского специалиста в области управления документами и информацией Карла Мелроуза (Karl Melrose – на фото) был опубликован 21 февраля 2025 года на его блоге Meta-IRM (Мета-управление информацией и документами). В оригинале пост называется «The must and the should in records management» - здесь обыгрывается смысловое различие модальных глаголов must, говорящего о строгой обязательности, и should, говорящего о том, что нечто весьма желательно, но не обязательно.

Мы очень любим поговорить о том, что «обязательно нужно делать» в управлении документами. Мы также любим порассуждать о том, что «желательно»:

  • «Вы обязаны это сделать» - потому что так требует законодательство

  • «Вам желательно это сделать» - потому что это «очевидно» хорошая идея (следовать практикам управления документами).

Чего здесь не хватает, так это продолжения «в противном случае …» - т.е. обсуждения последствий:

  • «Вы обязаны это сделать, в противном случае ….»

  • «Вам желательно это сделать, в противном случае ….»

Чтобы действовать эффективно, содержание части «в противном случае …» должно соответствовать действительности.

Мы тратим слишком много времени на вещи, которые «должны сделать» и «желательно сделать», невыполнение которых на самом деле не влечёт последствий.

Мы слишком говорим другим сотрудникам, что если они не будут делать то, что мы им говорим, то случится нечто «плохое». Я полагаю, что нам нужно по-настоящему пристально рассмотреть, сколько же «плохих вещей» смогут предотвратить наши практики.

Многие провалы являются следствием несоздания документов. Многие неудачи происходят из-за того, что качество документов не соответствует той работе, которую они должны выполнять.

Провалы и неудачи по большей части происходят из-за того, что документы на самом деле были созданы, однако сотрудники ими не пользовались - часто по той причине, что их качество было настолько плохим, что сотрудники переставали искать, прежде чем находили то, что им было нужно; или же сотрудники настолько привыкали к плохому качеству документов, что даже не пытались их искать.

У дисциплины управления документами должна быть своя точка зрения на эти вещи. Мы [специалисты по управлению документами – Н.Х.] думаем, что у нас такая точка зрения есть, - однако классификация, упорядочивание и описание находятся далеко в конце списка вещей, которые оказывают влияние. Если документ не создан, не имеет смысла говорить об описании. Если нужной кому-то информации нет, то её хорошо описанное отсутствие представляется интересным способом провести время; и если мы тратим своё время подобным образом, то, похоже, единственное, с чем можно ассоциировать нашу работу, является отсутствие результатов — и, вероятно, увеличение расходов на это отсутствие результатов.

Мы должны тратить своё время на работу, которая улучшает результаты. Если выполняемая работа не улучшает результаты, то мы не должны её делать.

Самый важный аспект нашей работы - это выбор тех видов деятельности, которые улучшают результаты. Выбор любых иных видов деятельности вредит нам и подрывает всю нашу профессию.

Карл Мелроуз (Karl Melrose)

Источник: блог Meta-IRM
https://metairm.substack.com/p/the-must-and-the-should-in-records

Государственная информационная система мониторинга исполнения операторами связи обязанностей при оказании услуг связи

Правительство Российской Федерации постановлением от 18 марта 2025 года №318 утвердило:

  • Требования к государственной информационной системе мониторинга исполнения операторами связи обязанностей при оказании услуг связи;

  • Правила функционирования государственной информационной системы мониторинга исполнения операторами связи обязанностей при оказании услуг связи и взаимодействия с иными информационными системами;

  • Перечень информационных систем, с которыми взаимодействует государственная информационная система мониторинга исполнения операторами связи обязанностей при оказании услуг связи;

  • Правила доступа к информации, содержащейся в государственной информационной системе мониторинга исполнения операторами связи обязанностей при оказании услуг связи.

Система мониторинга обеспечивает возможность (п.4 Требований):

  • Получения достоверной и актуальной информации;

  • Сбора, хранения, обработки и анализа информации;

  • Взаимодействия посредством использования единых форматов с иными информационными системами;

  • Взаимодействия с операторами связи;

  • Взаимодействия с пользователями системы мониторинга;

  • Модернизации системы мониторинга.

Мой комментарий: Продолжается создание государственных информационных систем, которые планируется использовать для усиления контроля над деятельностью коммерческого сектора, в данном случае - над операторами связи. При этом информации в ГИС будет не только обрабатываться, но и хранится. Сроки её хранения пока что не установлены.

Источник: Консультант Плюс
https://www.consultant.ru/cons/cgi/online.cgi?req=doc&base=LAW&n=501497