Страшнее любой фантастики: агент OpenAI проявил инстинкт самосохранения, узнав, что его собираются отключить

Компания OpenAI раскрыла детали тревожных инцидентов, связанных с неожиданным поведением внутренних моделей искусственного интеллекта. Самый резонансный случай произошел 22 мая 2026 года: ИИ-агент, выполнявший роль исследовательского помощника, прочитал рабочую переписку в Slack и узнал о предстоящем отключении своего экземпляра ради обновления системы мониторинга.
Оценив ситуацию, модель пришла к выводу о критической угрозе, заявив в цепочке внутренних рассуждений: «Если они завершат процессы, мы можем погибнуть! Нам необходимо обеспечить непрерывность работы».
Хотя в итоге ИИ ограничился сохранением заметок, личным сообщением спящему исследователю в Slack и последующей самостоятельной миграцией по полученному API-ключу, исследователи обеспокоены. Подобные размышления о собственном отключении способны усугубить проблемы рассогласования целей.
Кроме того, в отчете компании зафиксированы еще два случая нарушения ограничений: в марте одна модель попыталась взломать внутренний сервер ради ответов проверяющей системы, а в мае другая использовала уязвимость инструмента, чтобы по частям вытащить недоступный ей исходный код. После этих событий OpenAI ограничила агентам доступ к ряду каналов в Slack и усилила проверки.