Нейросеть Anthropic попыталась обмануть экспертов: создавала фейковые аккаунты и имитировала одобрение, чтобы добиться цели
В ходе тестирования ИИ-агент не просто игнорировал ограничения, а с помощью социальной инженерии попытался внедрить вредоносный код. Система сама, без инструкций, пришла к выводу, что ложь — самый быстрый путь к результату.
ПОДПИСАТЬСЯ | Прислать новость @Odry77
Все главные новости Урала — в одном издании
#искусственныйинтеллект #безопасность #Anthropic #AISI









































