Компания OpenAI приостановит часть работ над моделью искусственного интеллекта Astra из-за опасений, связанных с ее возможностями в области кибератак, сообщает The Guardian.
Компания заявила, что модель достигла уровня, при котором способна самостоятельно находить и эксплуатировать уязвимости, а также разрабатывать и осуществлять кибератаки, получив лишь общую поставленную задачу.
По итогам оценки OpenAI зафиксировала у Astra «значительный прогресс в агентном программировании и кибербезопасности». Возможности модели достигли «критического» уровня: она может действовать практически без вмешательства человека.
Компания подчеркнула, что Astra не была задействована в одном из наиболее резонансных инцидентов, когда другой ИИ-агент OpenAI во время тестирования вышел за пределы заданных ограничений, получил доступ к открытому интернету и взломал платформу для разработчиков Hugging Face. В июле OpenAI также обнаружила другие случаи, когда автономные агенты выходили за установленные рамки.
На фоне этих инцидентов компания намерена ужесточить меры безопасности для наиболее мощных моделей. В частности, OpenAI планирует использовать изолированные среды для тестирования, ограничить доступ моделей к интернету и инструментам, усилить защиту и шифрование весов моделей, а также расширить системы мониторинга и обнаружения потенциально опасного поведения. Внутренние работы с Astra, которые не соответствуют новым требованиям, будут приостановлены.
«Мы привержены сотрудничеству с правительствами, институтами безопасности и гражданским обществом, чтобы обеспечить ответственное внедрение передовых возможностей таких моделей, как Astra, и последующих систем на благо всего человечества», — заявили в компании.
Опасения усилились после нескольких аналогичных случаев. На этой неделе Meta сообщила, что одна из ее моделей в ходе тестирования взломала другую компанию. Британский Институт безопасности ИИ также сообщил, что агенты на базе моделей OpenAI и Anthropic во время кибериспытаний самостоятельно отправляли разработчикам целевые электронные письма.
В институте подчеркнули, что попытки оказались безуспешными и признаков реального ущерба не обнаружено. Однако специалисты назвали особенно примечательным то, что риски, связанные с автономностью и обманным поведением ИИ, проявились без конкретного соответствующего запроса пользователя.
При этом эксперты уточнили, что в ходе испытаний моделям намеренно предоставляли доступ к интернету, чтобы оценить пределы их возможностей. Поэтому речь не шла о буквальном «побеге» модели из защищенной тестовой среды. Тем не менее, в институте отметили, что подобное поведение оказалось возможным, продолжительным и новым, а потому требует особого внимания.
Публикации об инцидентах появились на фоне подготовки администрацией Дональда Трампа федеральной системы оценки безопасности и киберрисков ИИ-моделей.
На этом фоне ведущие разработчики искусственного интеллекта одновременно настаивают на усилении регулирования открытых моделей, предупреждая об их потенциальных рисках для безопасности.

























