Учёные предложили новый способ выявлять попытки манипулировать дискуссиями в соцсетях с помощью ИИ, пишет The Conversation.

Вместо того чтобы искать признаки машинно сгенерированного текста, система анализирует, не пытается ли автор незаметно увести разговор в сторону от первоначальной темы.

Исследователи отмечают, что с развитием генеративного ИИ обнаруживать дезинформацию по стилю текста становится всё сложнее. Раньше подозрение могли вызывать грамматические ошибки, необычные формулировки или характерные для ИИ слова. Теперь современные модели способны создавать практически естественные комментарии, поэтому такие признаки становятся малоэффективными.

По мнению авторов исследования, гораздо показательнее само поведение сообщения в дискуссии. Например, разговор о войне в Украине или стоимости жизни внезапно может быть переведён на миграцию, коррупцию или другую политически конфликтную тему. Такой приём исследователи называют «красной селедкой» — введением постороннего вопроса, который отвлекает внимание от первоначальной темы.

Учёные проанализировали более 1600 комментариев под видео BBC News на YouTube и оценили их по 25 характеристикам. Оказалось, что в 36% сообщений, уводивших дискуссию в сторону, использовались отвлекающие аргументы, в 65% встречались логические скачки, а в 20% — личные нападки. Такие комментарии также реже учитывали содержание предыдущих сообщений и демонстрировали эмпатию.

Затем исследователи предложили использовать ИИ для выявления подобных изменений. Для каждого реального комментария языковая модель генерировала несколько естественных ответов, соответствующих теме разговора. После этого система сравнивала реальные ответы с этими вариантами. Если комментарий существенно отличался от ожидаемого продолжения дискуссии, он мог быть сигналом попытки изменить её направление.

В ходе тестирования система правильно выявляла сообщения, уводящие разговор от темы, примерно в 77% случаев. Это оказалось примерно вдвое эффективнее методов, основанных преимущественно на анализе слов и эмоциональной окраски текста.

При этом исследователи подчёркивают: уход от темы сам по себе ещё не означает дезинформацию или злонамеренную деятельность. Люди вполне естественно могут менять направление разговора. Поэтому разработка может использоваться прежде всего как система раннего предупреждения для модераторов, а не как автоматический инструмент вынесения окончательных решений.

Авторы считают, что по мере совершенствования генеративного ИИ борьба с дезинформацией будет всё меньше зависеть от поиска «характерных слов» и всё больше — от анализа структуры и динамики онлайн-дискуссий. Главное становится не то, как написан комментарий, а зачем он появился именно в этом месте разговора.