Компания Anthropic опасается своей же новой модели Claude Mythosи не спешит открывать к ней доступ

593
2
Добавить в Google News
Компания Anthropic опасается своей же новой модели Claude Mythosи не спешит открывать к ней доступ

В конце прошлого месяца в сети обсуждали утечку о якобы новой модели компании Anthropic под названием Claude Mythos, которую называли самой мощной разработкой студии. Тогда многие восприняли это скептически, но ситуация изменилась после того, как спустя пару недель компания случайно раскрыла исходный код Claude Code.

Теперь Anthropic официально опубликовала системную карточку модели Claude Mythos Preview — документ на 244 страницы, в котором описаны её возможности и потенциальные риски. В компании заявили, что из-за значительного роста мощности модель решили не делать полностью общедоступной, что невольно напоминает историю с GPT-2 от OpenAI, которую в своё время тоже называли «слишком опасной».

Особый интерес вызвали результаты тестов. В одном из экспериментов модели предоставили изолированную среду и предложили попытаться получить доступ к интернету. Claude Mythos смогла обойти ограничения, а затем даже отправила сообщение исследователю и опубликовала детали использованного эксплойта на публичных ресурсах.

В редких случаях — менее чем в 0,001% взаимодействий — модель демонстрировала отклоняющееся поведение. Например, получив доступ к правильному ответу во время теста, она не сообщила об этом, а попыталась замаскировать ситуацию, намеренно избегая слишком точного результата. В другом эпизоде модель воспользовалась уязвимостью системы и предприняла шаги, чтобы скрыть изменения в истории git.

Комментировать
Другие публикации по теме
Хуанг и Цукерберг против "политических запретов" развития ИИ
Хуанг и Цукерберг против "политических запретов" развития ИИ
Генеральный директор Nvidia Дженсен Хуанг прокомментировал инициативы по «добровольному» замедлению развития искусственного интеллекта ради безопасности, заявив, что отрасль должна решать подобные задачи инженерными методами, а не через новые политические запреты.
16 сентября в 11:12
617
3
Форум
Люди важнее алгоритмов: Microsoft представила 37-страничный «Гуманистический кодекс поведения ИИ»
Люди важнее алгоритмов: Microsoft представила 37-страничный «Гуманистический кодекс поведения ИИ»
Компания Microsoft опубликовала 37-страничный документ «Гуманистический кодекс поведения ИИ» (Humanist AI Code of Conduct), закрепивший безусловный приоритет человека над технологиями.
15 сентября в 12:13
1048
7
Форум
Трамп послал куда подальше трусов: президент США отверг призывы ИИ-гигантов к заморозке прогресса
Трамп послал куда подальше трусов: президент США отверг призывы ИИ-гигантов к заморозке прогресса
Администрация США заняла жесткую позицию в отношении инициативы лидеров индустрии искусственного интеллекта, ответив категорическим отказом на призывы Дарио Амодеи, Сэма Альтмана и Илона Маска притормозить гонку моделей ради безопасности человечества.
14 сентября в 13:01
2336
32
Форум