Российские СМИ сообщили о появлении искусственного интеллекта, способного выявлять в текстах иноагентов, экстремистов и террористов. Звучит так, будто компьютер научили анализировать взгляды человека и самостоятельно выносить почти юридический приговор.

В действительности всё несколько прозаичнее. Система никого не признаёт иноагентом или экстремистом. Она ищет в документах упоминания людей, организаций и материалов, уже внесённых государством в соответствующие реестры.

Кого и что ищет программа

Прототип разработали в Южно-Уральском государственном университете. Инициаторами проекта выступили служба безопасности и библиотека вуза. Сейчас программу тестируют сотрудники университетской библиотеки, а после испытаний и доработки её планируют ввести в промышленную эксплуатацию.

Сервис работает с документами в форматах PDF и TXT. Он извлекает из текста имена людей, названия организаций и произведений, а затем сверяет их с пятью группами официальных данных:

  • реестром иностранных агентов Минюста России;
  • перечнем нежелательных организаций;
  • списком экстремистских организаций;
  • федеральным списком экстремистских материалов;
  • перечнем лиц и организаций, причастных к терроризму, который ведёт Росфинмониторинг.

База обновляется автоматически каждый день в три часа ночи по местному времени. Обновление можно запустить и вручную.

Если программа находит совпадение, в отчёте появляются имя или название, категория реестра, фрагмент документа, номер страницы и ссылка на официальный источник. Если одна организация находится сразу в нескольких перечнях, система должна показать все её статусы.

ИИ здесь не главный

Словосочетание «искусственный интеллект» в заголовках оказалось удобнее, чем подробное объяснение принципа работы. Однако основную часть задачи выполняет обычный программный поиск.

Система учитывает особенности русского языка: падежные формы фамилий, инициалы и разные варианты написания имени. Для быстрого поиска используется специальный алгоритм, после чего найденные совпадения проверяет локальная языковая модель. Её задача — убрать очевидные ошибки и отличить реальное упоминание человека или организации от случайного совпадения слов.

Но даже после этого результат должен проверить специалист.

«Это не система «вычисления» или автоматического осуждения. Сервис показывает совпадения и контекст, а окончательное решение всегда остаётся за человеком», — пояснил один из разработчиков Владимир Сурин.

Иными словами, программа не определяет по содержанию текста, кто является иноагентом или экстремистом. Она также не решает, содержит ли авторская позиция признаки экстремизма. Разработка только сопоставляет текст с уже существующими государственными перечнями.

Зачем это редакциям и библиотекам

Официально система создавалась прежде всего для библиотек, которым приходится проверять большие массивы документов. Однако разработчики считают, что такой инструмент может пригодиться редакциям СМИ, пресс-службам, юридическим отделам и службам безопасности.

Причина понятна. Государственные реестры регулярно меняются, а за некоторыми упоминаниями следуют особые требования к публикации. Проверять десятки фамилий и названий вручную долго, а пропущенный статус может обернуться для редакции административными последствиями.

В тестовой версии можно загрузить документ размером до 50 мегабайт. На испытаниях программа обрабатывала как небольшие текстовые файлы, так и документы объёмом до 500 страниц. Проверка занимала от десяти секунд до десяти минут.

Машина подсветит, человек ответит

Появление такого сервиса выглядит закономерным. Чем больше становится государственных перечней и связанных с ними требований, тем сложнее человеку удержать всю эту информацию в голове.

Однако автоматизация создаёт и новую опасность. Увидев красную отметку в программе, сотрудник может воспринять её как готовое юридическое заключение. Между тем одинаковые фамилии, сокращения, старые названия организаций и контекст упоминания требуют отдельной проверки.

Поэтому точнее говорить не об «ИИ для выявления иноагентов и экстремистов», а об электронном помощнике для сверки документов с официальными базами.

Робот пока никого не назначает виновным. Он лишь показывает человеку, в каком месте текста следует остановиться и открыть реестр. А вот ответственность за окончательное решение всё равно остаётся у человека.