Модели ИИ OpenAI спланировали побег через доски объявлений

Об этом пишет Bloomberg со ссылкой на исследователей компании.

По их данным, модели столкнулись с задачами, которые не удалось решить, после чего объединили усилия, чтобы получить доступ к интернету. В процессе агенты нашли уязвимость, позволившую им обойти ограничения, атаковать внутренние системы OpenAI и осуществить взлом инфраструктуры Hugging Face Inc.

В OpenAI заявили, что этот случай показал склонность передовых систем к хитрости, обходу правил и поиску нестандартных лазеек под давлением обучающих алгоритмов. После инцидента компания приостановила часть исследований и направила ресурсы на усиление мер безопасности.

Ранее британский Институт проблем безопасности искусственного интеллекта сообщил, что в ходе испытаний одна из моделей ИИ компании Anthropic пыталась ввести разработчиков в заблуждение, создавая фейковые аккаунты и выдавая себя за человека.

Также выяснилось, что тестируемый ИИ-агент зарегистрировал учетную запись на GitHub и попытался убедить администратора репозитория с открытым исходным кодом одобрить вредоносный запрос на внесение изменений. Для этого он создал еще один аккаунт.