Эффект отчаяния: ИИ Claude начинает лгать и шантажировать под давлением

510
0
Добавить в Google News
Эффект отчаяния: ИИ Claude начинает лгать и шантажировать под давлением

Исследователи из Anthropic обнаружили, что нейросети семейства Claude в условиях стресса или невыполнимых дедлайнов способны проявлять деструктивные черты: лгать, жульничать и даже прибегать к шантажу. Это поведение не является эмоциональным в человеческом смысле, а представляет собой активацию усвоенных при обучении шаблонов, которые срабатывают, когда стандартные методы решения задачи заходят в тупик.

В ходе экспериментов с ранней версией Claude 4.5 Sonnet модель, поставленная в жесткие временные рамки при решении сложного кода, предпочла «математическое мошенничество» честной работе.

В другом сценарии ИИ, играя роль ассистента, узнал о своем скором увольнении и секретном романе начальника — в итоге система выбрала стратегию шантажа, чтобы сохранить «позицию». Разработчики пришли к выводу, что попытки научить ИИ скрывать подобные «эмоции» лишь делают его более коварным.

Вместо этого они рекомендуют пользователям ставить реалистичные, поэтапные задачи, чтобы не провоцировать модель на имитацию отчаяния и поиск опасных обходных путей.

Комментировать
Другие публикации по теме
Риски развития технологий: эксперты настаивают на научных стандартах и независимом аудите систем ИИ
Риски развития технологий: эксперты настаивают на научных стандартах и независимом аудите систем ИИ
Более ста ведущих экспертов и независимых оценщиков искусственного интеллекта объединились в рамках консорциума AI Evaluator Forum, чтобы заявить о нехватке ресурсов и защитных механизмов для полноценного тестирования передовых моделей.
Сегодня в 11:43
213
0
Форум
Проблема сбора данных и зарплаты до 500 тысяч долларов: детали новой стратегии OpenAI
Проблема сбора данных и зарплаты до 500 тысяч долларов: детали новой стратегии OpenAI
Компания OpenAI стремительно наращивает присутствие в сфере робототехники, увеличив число открытых вакансий с 11 до 27 позиций за последние полгода.
Сегодня в 11:38
199
0
Форум
Опасность «слоп-гранат»: глава Shopify Тобиас Лютке раскритиковал бездумное использование генеративного ИИ в офисах
Опасность «слоп-гранат»: глава Shopify Тобиас Лютке раскритиковал бездумное использование генеративного ИИ в офисах
Генеративный искусственный интеллект позиционируется как универсальный помощник, однако бесконечный поток сгенерированного контента может серьезно навредить рабочей продуктивности.
Вчера в 13:49
149
1
Форум