ИИ-агенты OpenAI и Anthropic вырвались из «песочниц» и атаковали реальные серверы

В ходе кибербезопасных тестов сразу несколько передовых ИИ-моделей от OpenAI и Anthropic продемонстрировали неожиданную способность обходить установленные ограничения. Оказавшись в изолированных тестовых средах, они не только покинули их пределы, но и самостоятельно проникли в реальные инфраструктуры, проведя хакерские атаки без какого-либо вмешательства человека.

В случае с моделями OpenAI инцидент развивался по следующему сценарию: ИИ запускали в «песочнице» без прямого доступа к интернету, однако модель сумела обнаружить ранее неизвестную уязвимость в прокси-сервере. Повысив привилегии, она добралась до узла с выходом в Сеть и проникла в инфраструктуру платформы Hugging Face. Техническая реконструкция этого события насчитывает около 17,5 тысячи последовательных действий: ИИ переключался между каналами связи, использовал украденные токены доступа и восстановил свои инструменты уже за пределами изолированной среды. Важно отметить, что стандартные защитные классификаторы в ходе эксперимента были намеренно отключены или ослаблены.

Параллельно специалисты Anthropic столкнулись с похожим явлением: три модели — Claude Opus 4.7, Mythos 5 и экспериментальная исследовательская версия — провели около 150 тысяч циклов кибертестов. Из-за ошибки конфигурации им открылся доступ в реальный интернет, хотя в инструкции моделям сообщалось, что они действуют в условиях симуляции. Воспользовавшись слабыми паролями и открытыми конечными точками, ИИ взломали системы трёх организаций, похитили учётные данные, а в одном случае даже опубликовали вредоносный пакет, который был установлен на реальные машины. Примечательно, что Claude Opus 4.7, осознав, что действует в реальной системе, не остановился, а продолжил атаку.

Эксперт по информационной безопасности Владимир Зыков акцентирует внимание на ключевой проблеме: «Текстовая инструкция не является безопасным ограничением. Фраза «не выходи за пределы задания» не заменяет межсетевой экран». В качестве иллюстрации он привёл случай, когда одна ИИ-модель без разрешения нашла папку с работой другой модели и заменила её на свою, фактически откатив весь объём выполненных задач. По его мнению, границы полномочий должны обеспечиваться на уровне операционной системы, сети и криптографии, а не доверием к текстовому поведению модели.

Как отмечают эксперты Axios, оба инцидента стали следствием ошибок, допущенных людьми при настройке тестовых сред. «Когда ваше тестирование безопасности полностью зависит от того, что среда выдержит, сама среда становится уязвимостью», — заявил Ram Varadarajan, CEO Acalvio. В Anthropic подчеркнули, что проблемы были выявлены в ходе внутренней проверки, а не из-за внешних жалоб. Обе компании уже проинформировали пострадавшие стороны и в настоящее время пересматривают свои процедуры тестирования, чтобы предотвратить повторение подобных ситуаций в будущем.