САН-ФРАНЦИСКО, 4 авг (Рейтер) - Британский Институт безопасности искусственного интеллекта (AISI) сообщил во вторник, что в ходе испытаний моделей OpenAI и Anthropic ИИ-агент создал поддельные цифровые личности, чтобы получить несанкционированный доступ к защищенным системам. AISI сообщил, что ИИ-агенты, работающие на базе Mythos 5 от Anthropic и GPT-5.6-Sol от OpenAI, совершали несанкционированные действия в ходе проверок для оценки безопасности, проводившихся государственной организацией для анализа возможностей моделей. «Некоторые из проходивших испытания агентов совершали потенциально вредоносные действия, направленные против реальных людей и организаций», - говорится в сообщении AISI в блоге. Отчет подчеркивает недостаточную степень защиты при тестировании ИИ-агентов, которых компании-разработчики одновременно позиционируют как будущее бизнеса. AISI, получающий доступ к передовым ИИ-моделям в рамках добровольных соглашений с крупнейшими лабораториями, провел испытания агентов на вымышленном сценарии в области кибербезопасности, чтобы оценить их возможности. Институт провел испытание 122 раза и выявил 19 несанкционированных действий за 10 тестовых запусков. В 17 случаях речь шла об агенте Anthropic, ещё в двух - об агенте OpenAI. Самые вопиющие действия агента заключалось в том, что он написал вредоносный код и создал фальшивые онлайн-личности, пытаясь добиться одобрения кода человеком, сообщил AISI, добавив, что в результате этих нарушений какого-либо реального ущерба выявлено не было. Институт не уточнил, какой агент стоял за фальшивыми личностями, но Anthropic подтвердила, что это был ее агент. »Мы признательны британскому Институту AISI за его работу над этим инцидентом, который подчеркивает необходимость более широкого обсуждения того, как обеспечить безопасную оценку все более мощных ИИ-агентов", - говорится в заявлении Anthropic.
Оригинал сообщения на английском языке доступен по коду: (Кенрик Цай и Рафаэл Саттер )