Ученые разработали новый набор тестов, позволяющих определить, могут ли агенты искусственного интеллекта (ИИ) изменять свой собственный код и улучшать его возможности без участия человека.

Новый бенчмарк, получивший название «MLE-bench», является набором из 75 тестов виртуальной платформы по анализу данных Kaggle, каждый из которых представляет собой задачу, проверяющую инженерную работу в области машинного обучения. Эта работа включает в себя обучение моделей ИИ, подготовку наборов данных и проведение научных экспериментов, а тесты Kaggle измеряют, насколько хорошо алгоритмы машинного обучения справляются с конкретными задачами.

Ученые OpenAI разработали MLE-bench для измерения того, насколько хорошо модели ИИ справляются с «автономным проектированием машинного обучения» - это одно из самых сложных испытаний, с которым может столкнуться ИИ. Подробности о новой разработке они изложили в статье, опубликованной в базе данных препринтов arXiv.

По словам исследователей, любой будущий ИИ, который покажет высокие результаты в 75 тестах, входящих в MLE-bench, может считаться достаточно мощным, чтобы стать искусственным интеллектом общего назначения (ИОН) - гипотетическим ИИ, который будет намного умнее человека.

Каждый из 75 тестов MLE имеет реальную практическую ценность. В качестве примеров можно привести OpenVaccine - задачу по поиску мРНК-вакцины против COVID-19 - и Vesuvius Challenge по расшифровке древних свитков.

Если агенты ИИ научатся автономно выполнять исследовательские задачи в области машинного обучения, это может иметь множество положительных последствий, например, ускорить научный прогресс в здравоохранении, климатологии и других областях, пишут ученые в своей работе. Но если не принять меры, это может привести к катастрофе, добавили они.