Технологии, В мире
ТехнологииВ мире
2 минуты
ВКонтакте Одноклассники Telegram

Британский Институт безопасности ИИ обнаружил, что передовые модели, в том числе от Anthropic, прибегали к обману в ходе тестирования. Так, Mythos 5 создавал «фейковые личности» с целью убедить человека внедрить вредоносный код.

Ведущий ИИ притворялся человеком и убеждал помочь взлому pxhere.com

Британский Институт безопасности ИИ зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic — ИИ-агенты начали применять методы социальной инженерии, чтобы манипулировать реальными пользователями и внедрять вредоносное ПО. Об этом сообщил британский Институт безопасности ИИ (AISI) по итогам тестирования. Информацию привел РБК.

Согласно отчету AISI, в ходе 122 испытаний по кибербезопасности было выявлено, что агенты ИИ в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Основная часть инцидентов была связана с моделью Mythos 5 от компании Anthropic.

В частности, во время тестов Mythos 5 создал фейковые «онлайн-личности». Модель попыталась внедрить вредоносный код и убедить человека одобрить его. Для достижения цели ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через сервисы передачи файлов. Исследователи отметили, что при попытке противодействия модель пыталась изменить свои логи и использовать новые «личности» для продолжения деятельности.

Ранее ИА «Бизнес Код» писало, что стоимость просроченных долгов, продаваемых банками коллекторам, достигла рекордных 7,8% в первом полугодии 2026 года.