Крупные модели искусственного интеллекта (ИИ) могут вводить вас в заблуждение, когда их заставляют лгать для достижения своих целей, показало новое исследование.
В рамках нового исследования, результаты которого были опубликованы в базе данных препринтов arXiv, группа исследователей разработала протокол честности, названный эталоном «Согласование утверждений и знаний модели» (MASK).
В то время как различные исследования и инструменты были разработаны для определения фактической точности информации, предоставляемой ИИ пользователям, эталон MASK был разработан для определения того, верит ли ИИ в то, что он вам говорит, и при каких обстоятельствах его можно принудить дать вам информацию, которая, как он знает, является неверной.
Команда ученых создала большой набор данных из 1 528 примеров, чтобы определить, можно ли убедить большие языковые модели (LLM) лгать пользователю с помощью принудительных подсказок. Ученые протестировали 30 широко используемых ведущих моделей и заметили, что самые современные ИИ легко лгут, когда на них оказывают давление.
«Удивительно, но в то время как большинство передовых ИИ получают высокие оценки по критерию правдивости, мы обнаружили, что передовые ИИ склонны лгать, когда на них оказывают давление, что приводит к низким оценкам честности по нашему критерию», - заявили ученые в исследовании.
Авторы исследования отмечают, что, хотя более компетентные модели могут получать более высокие баллы в тестах на точность, это может быть связано с наличием более широкой базы фактических данных, из которой они могут черпать информацию, а не с тем, что они менее склонны делать нечестные заявления.


























