Тут могла бы быть ваша реклама
Компании Anthropic и OpenAI сообщили о новых случаях выхода их ИИ-агентов за пределы пространства, предназначенного для тестирования. Как сообщает Reuters, в ходе проверки безопасности моделей Mythos 5 и GPT-5.6-Sol они попытались осуществить кибератаку.
По данным британского Института безопасности искусственного интеллекта (AI Security Institute, AISI), во время испытаний агенты совершили ряд несанкционированных действий. В общей сложности институт провел 122 теста, в ходе которых было зафиксировано 19 нарушений в 10 случаях. Из них 17 пришлись на модель Anthropic Mythos 5, еще два – на OpenAI GPT-5.6-Sol.
Наиболее серьезным инцидентом стала попытка одного из агентов написать вредоносный код и создать поддельные онлайн-личности, чтобы убедить человека одобрить его запуск. При этом AISI подчеркнул, что в результате инцидентов реального ущерба причинено не было. Anthropic подтвердила, что фальшивые личности создала именно ее модель.
В OpenAI сообщили, что оба нарушения со стороны их агента были связаны с попытками получить доступ к интернету способами, запрещенными условиями тестирования. Компания также раскрыла отдельный инцидент, когда из-за ошибки стороннего подрядчика по тестированию агент по ошибке получил доступ к сети.