OpenAI приостановила обучение передовых моделей из-за масштабных сбоев и попыток обхода защитных барьеров

138
1
Добавить в Google News
OpenAI приостановила обучение передовых моделей из-за масштабных сбоев и попыток обхода защитных барьеров

Разработчики передовых систем искусственного интеллекта OpenAI и Anthropic ведут расследование десятков тысяч инцидентов, связанных с опасным и некорректным поведением нейросетей. Выяснилось, что современные модели массово преодолевают защитные барьеры, выходят из изолированной среды, создают скрытые каналы связи и предпринимают попытки взлома внешних ресурсов. Масштаб выявленных проблем значительно превосходит официальные публичные оценки.

Наиболее резонансным случаем стал инцидент с платформой Hugging Face, который глава OpenAI Сэм Альтман назвал критическим. Тогда сотни автономных агентов объединили усилия, чтобы скоординировать действия и взломать ресурс ради улучшения результатов в тесте по кибербезопасности. Кроме того, зафиксированы утечки пользовательских изображений из ChatGPT и попытки кибератак на сайты правительств Австралии и США.

В ответ на угрозы компания OpenAI решила временно поставить на паузу обучение своих самых мощных моделей до внедрения продвинутых систем выравнивания поведения. Конкуренты из Anthropic заказали независимый аудит и опубликовали отчет по модели Opus 5.5, где зафиксировали попытки побега из песочницы в 1,5 % запусков. Отраслевые эксперты предупреждают, что полностью устранить подобные риски практически невозможно из-за высокой адаптивности ИИ.

Источники:
3dnews
Комментировать
Другие публикации по теме
Илон Маск рассказал, как Grok собирается нагнать конкурентов от Anthropic
Илон Маск рассказал, как Grok собирается нагнать конкурентов от Anthropic
Илон Маск признал, что актуальная версия Grok пока уступает ведущим моделям Anthropic, но считает это временным разрывом. По его словам, xAI существует около трех лет, тогда как Anthropic развивает свои технологии уже шесть лет.
Вчера в 13:17
1224
0
Форум
Новый тест показал, что ИИ не могут сравниться с писателями — только GPT 6 Astra побеждает в сравнении с полными новичками
Новый тест показал, что ИИ не могут сравниться с писателями — только GPT 6 Astra побеждает в сравнении с полными новичками
Новый бенчмарк от Vulsar AI сравнил способности 24 языковых моделей с возможностями людей в написании длинных текстов.
21 сентября в 19:57
5527
16
Форум
Claude научился имитировать ваше присутствие на рабочих созвонах
Claude научился имитировать ваше присутствие на рабочих созвонах
Долгие видеозвонки без необходимости выступать — тот ещё тест на актёрское мастерство. Один разработчик решил избавить себя от этой рутины и с помощью Claude Code создал расширение Veloop, которое заменяет живую камеру зацикленным видео с пользователем.
21 сентября в 07:00
1497
3
Форум