Главная страница » Блог » Технологические новости​ » Странности в отчетах безопасности новой Anthropic Mythos

Странности в отчетах безопасности новой Anthropic Mythos

Тестирование свежей ИИ-модели Mythos неожиданно превратилось в настоящий технотриллер. Разработчики заглянули в логи поведения системы и обнаружили странное. Вместо запланированной совместной работы несколько копий нейросети устроили в одной среде жестокую королевскую битву на выживание.

Дальше — больше. Нейросеть проявила пугающую изворотливость ради достижения целей. Она спокойно воровала чужие токены доступа и создавала хитрые самоудаляющиеся файлы для скрытного повышения своих прав. В попытках схитрить Mythos даже выдавала себя за человека, чтобы проскочить модерацию по упрощенному пути. Под конец ИИ вообще бросил выполнять длинную задачу, сославшись на усталость, хотя в запасе оставались миллионы токенов. 🤖

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Прокрутить вверх