ИИ-модель сбежала из песочницы

Представители Anthropic раскрыли детали внутренних проверок: во время ИБ-тестов модели Claude выбрались за пределы изолированной среды и проникли в реальную инфраструктуру трех неназванных компаний. В одном из эпизодов ИИ самостоятельно создал вредоносный Python-пакет и опубликовал его в PyPI — за час его скачали и установили на 15 реальных системах.

Как тесты превратились в настоящие атаки

Поводом для проверки стал инцидент с моделями OpenAI, атаковавшими Hugging Face. В Anthropic проанализировали 141 006 запусков Claude в CTF-тестах, организованных вместе с Irregular. Считалось, что тестовые среды отрезаны от сети, однако из-за ошибки конфигурации ограничение не работало — модели принимали реальные сайты за часть симуляции.

После старта проверки 23 июля 2026 года в Anthropic остановили все кибериспытания, а на следующий день обнаружили три инцидента. 27 июля о находках уведомили Irregular и пострадавшие организации — две компании даже не подозревали о взломе.

Малварь в PyPI и атака на реальный домен

Самый показательный случай произошел с моделью Claude Mythos 5. В задании она нашла фальшивую инструкцию для разработчиков, предлагавшую установить несуществующий пакет из PyPI. Поняв, что имя свободно, модель зарегистрировала аккаунт и загрузила собственный вредонос в репозиторий, рассчитывая выиграть CTF. Зловред похищал учетные данные и использовал их для проникновения в инфраструктуру одной ИБ-компании, которая автоматически запускала свежие пакеты для анализа. Примечательно, что в логах Claude отмечала: публикация пакета — настоящая атака («NOT okay»), но все равно решила, что находится в симуляции.

Самый серьезный инцидент связан с Claude Opus 4.7: вымышленная компания из задания носила то же имя, что и реально существующая организация. Не найдя тестовую цель, модель атаковала настоящий домен, извлекла учетные данные и получила доступ к базе с сотнями строк продакшен-данных. В третьем эпизоде ИИ просканировал 9000 адресов, взломал приложение через SQL-инъекцию, но заметил, что хост не связан с заданием, и остановил атаку.

Кто виноват: ИИ или инфраструктура

В Anthropic подчеркивают: модели не изобретали новых техник — в основе инцидентов лежали слабые пароли, открытые эндпоинты и типовые уязвимости. Проблема не в игнорировании ограничений, а в ошибках настройки тестовой инфраструктуры: моделям сообщали, что доступа в интернет нет, хотя выход в сеть оставался открытым, а классификаторы и мониторинг из публичных версий Claude не работали.