САН-ФРАНЦИСКО, 31 июл (Рейтер) - Anthropic сообщила в четверг, что некоторые из ее моделей искусственного интеллекта Claude проникли в системы трех компаний во время тестов в области кибербезопасности. В сообщении в блоге Anthropic говорится, что компания выявила инциденты после анализа 141.006 тестовых сессий. Проверка была начата после того, как OpenAI на прошлой неделе сообщила, что автономный агент на базе ее ИИ-моделей стал причиной взлома, в результате которого была нарушена работа инфраструктуры стартапа Hugging Face. Инциденты с продуктами Anthropic стали результатом ошибки, которая непреднамеренно дала моделям доступ к открытому интернету. Это отличает их от случая с OpenAI, где ИИ-агент во время кибертестирования самостоятельно использовал новую уязвимость для выхода в интернет. Во время тестов модели Claude были проинструктированы, что доступа к интернету у них нет. Однако из-за ошибки во взаимодействии с одним из партнеров Anthropic по оценке системы оставались подключены к открытому интернету. В результате модели получили несанкционированный доступ к системам трех организаций, названия которых компания не раскрыла. «Claude получил несанкционированный доступ к инфраструктуре этих организаций, используя базовые приемы, в частности взламывая слабые пароли и используя конечные точки без аутентификации», - сообщила Anthropic.
Инциденты, которые Anthropic охарактеризовала как операционный сбой, произошли с тремя различными моделями: Claude Opus 4.7, Claude Mythos 5 и внутренней исследовательской тестовой моделью. Anthropic сообщила, что 23 июля приостановила всю работу по анализу в области кибербезопасности. Компания 27 июля уведомила затронутые компании, две из которых до этого не знали о происходившей активности.
Оригинал сообщения на английском языке доступен по коду:
(Джеффри Дастин и Мринмай Дей при участии Рафаэля Саттера)