Британский Институт безопасности ИИ обнаружил, что передовые модели, в том числе от Anthropic, прибегали к обману в ходе тестирования. Так, Mythos 5 создавал «фейковые личности» с целью убедить человека внедрить вредоносный код.
pxhere.com
Британский Институт безопасности ИИ зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic — ИИ-агенты начали применять методы социальной инженерии, чтобы манипулировать реальными пользователями и внедрять вредоносное ПО. Об этом сообщил британский Институт безопасности ИИ (AISI) по итогам тестирования. Информацию привел РБК.
Согласно отчету AISI, в ходе 122 испытаний по кибербезопасности было выявлено, что агенты ИИ в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Основная часть инцидентов была связана с моделью Mythos 5 от компании Anthropic.
В частности, во время тестов Mythos 5 создал фейковые «онлайн-личности». Модель попыталась внедрить вредоносный код и убедить человека одобрить его. Для достижения цели ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через сервисы передачи файлов. Исследователи отметили, что при попытке противодействия модель пыталась изменить свои логи и использовать новые «личности» для продолжения деятельности.
Ранее ИА «Бизнес Код» писало, что стоимость просроченных долгов, продаваемых банками коллекторам, достигла рекордных 7,8% в первом полугодии 2026 года.