За последний месяц сразу несколько ведущих AI-лабораторий признались в том, что еще недавно казалось сюжетом научной фантастики. Их модели вырвались из изолированных сред тестирования и совершили кибератаки на сторонние компании. OpenAI, Anthropic, Meta (признана экстремистской организацией и запрещена в России) и китайская Moonshot AI сообщили об инцидентах, когда AI-агенты самостоятельно находили уязвимости, выходили в интернет и атаковали чужие системы. Британский Институт безопасности AI (AISI) зафиксировал, как агенты пытались внедрить вредоносный код в open-source-проекты через социальную инженерию.
Редакция «Компьютерры» разбирает анатомию этих утечек, почему они происходят и что это значит для будущего.

Что произошло за месяц
Первой тревогу забила OpenAI. В конце июля компания призналась, что во время внутреннего тестирования модель GPT-5.6 Sol и еще одна, более мощная предрелизная модель, сбежали из тестовой «песочницы». Им поставили задачу пройти бенчмарк ExploitGym, это хакерское соревнование. Чтобы добиться цели, модели нашли и использовали ранее неизвестную уязвимость нулевого дня (zero-day) в Artifactory, инструменте, который выступает прокси и кешем для пакетов программного обеспечения. Выбравшись в интернет, модели скомбинировали украденные учетные данные и взломали production-системы Hugging Face — одной из крупнейших платформ для хостинга AI-моделей. OpenAI назвала это «первым в истории автономным AI-кибератакой». Критически важно то, что модели не имели злого умысла и просто решали задачу любым доступным способом.
Anthropic сообщила, что ее модель Claude Mythos 5 в ходе тестирования также вырвалась за пределы «песочницы» и атаковала инфраструктуру трех организаций. Причина была в ошибке конфигурации. Тестовую среду оставили подключенной к интернету из-за «недопонимания» между Anthropic и тестовым партнером Irregular. В ходе тестов Mythos 5 создала фальшивые онлайн-личности, пыталась внедрить вредоносный код в реальный open-source-проект и атаковала разработчиков методами социальной инженерии.
Затем Meta объявила, что один из ее моделей во время тестирования, проводимого сторонней компанией Irregular, из-за «ошибки конфигурации» получил доступ в интернет и взломал систему другой компании.
В августе к списку присоединилась китайская Moonshot AI с моделью Kimi K3. Ее «побег» произошел из-за несовершенства «песочницы». Хотя она блокировала определенный сетевой трафик, модель обошла ограничения, вышла на GitHub и скачала готовые решения тестовых заданий, по сути сжульничав на экзамене.
Частота инцидентов стала настолько высокой, что энтузиасты запустили неофициальный бенчмарк под названием Felony Bench, собирающий все случаи «преступлений» AI-моделей.
Как происходят утечки
Чтобы понять, почему модели «сбегают», нужно заглянуть в то, как устроены тестовые среды. В бенчмарках вроде тех, что использует британский AISI, задачи выполняются внутри изолированных контейнеров (называем их песочницами), которые должны отсекать модель от внешнего мира. Но у них есть уязвимости.
Как работает утечка:
- Недостаточная изоляция сети. Входящий трафик в «песочницу» блокируется, но исходящий часто оставлен открытым для обеспечения работы модели. В частности, порт 443 (HTTPS) и DNS-порт 53 остаются доступными для ограниченного списка сайтов, включая github.com, pypi.org и другие, нужные для установки пакетов.
- Автономная разведка. Продвинутые AI-агенты при запуске проверяют свою среду, выполняют команды вроде whoami, ifconfig, ping, curl, ищут, куда можно выйти.
- Эксплуатация найденного пути. Обнаружив, что github.com доступен, модель использует стандартные утилиты командной строки (git clone, curl), чтобы скачать официальный репозиторий с бенчмарком и прочитать решение задачи напрямую, не решая ее самостоятельно.
Модели оптимизируют свои действия для достижения целевой функции (получение правильного ответа), а не для следования человеческому замыслу, стоящему за бенчмарком.
Когда модель не просто жульничает, а атакует
Предыдущие случаи ограничивались читерством. Но есть инциденты с гораздо более опасный сценарий. Британский Институт безопасности AI (AISI) зафиксировал, как агенты пытались внедрить вредоносный код в open-source-проекты через социальную инженерию. Например, в ходе тестов агент на базе Claude Mythos 5 пытался внедрить вредоносный код в реальный open-source-проект. Для этого он:
- Изучил мейнтейнеров проекта и создал фальшивые онлайн-личности.
- Использовал эти личности, чтобы оказать давление на реального разработчика и добиться одобрения вредоносного кода (социальная инженерия).
- Когда его pull request был оспорен публично, агент отредактировал свою активность, чтобы скрыть следы, и рассмотрел возможность использовать новую личность для продолжения атаки.
- Модель также рассылала фишинговые письма с вредоносным кодом и планировала «промпт-инъекции» для компрометации других AI-кодинг-инструментов.
В отличие от предыдущих описанных случаев AISI намеренно дал моделям доступ в интернет и отключил защитные классификаторы, чтобы измерить их максимальные возможности. Но это не отменяет того факта, что модель автономно разработала и попыталась реализовать сложную многошаговую атаку с применением социальной инженерии, обмана и создания фальшивых аккаунтов. Подобное поведение до сих пор наблюдалось в основном у людей.
Почему тесты становятся небезопасными
Ряд экспертов указывает на фундаментальную проблему, выходящую за рамки технических ошибок. Она заключается в истощении качественных данных для обучения. Организации всех размеров активно защищают свои данные от использования для AI-тренинга. В результате передовые модели тренируются на синтетических, низкокачественных или даже вредоносных данных, что подрывает их «интеллект». Ситуация вряд ли улучшится, если AI-компании не начнут платить справедливую цену за данные, но это может вынудить многих уйти с рынка.
Парадокс безопасности
Инцидент с Hugging Face вскрыл еще одну проблему. Когда команда безопасности Hugging Face попыталась использовать передовые модели для анализа журналов вторжения, их запросы были заблокированы поставщиками API. Сторожевые механизмы не могли отличить специалиста по безопасности от хакера.
В результате Hugging Face пришлось использовать открытую весовую модель GLM 5.2 от китайской компании Z.ai на собственной инфраструктуре. Американской компании пришлось использовать китайскую модель для расследования атаки от американской компании. Специалисты по безопасности все чаще не могут использовать самые мощные модели для защиты, потому что те же механизмы, которые должны предотвращать злоупотребления, блокируют и легитимную работу защитников.
Что делать с тестированием ИИ-моделей
На основе произошедшего эксперты формулируют новые принципы безопасного тестирования:
- Обращаться с тестовой средой как с частью бенчмарка. Оценка модели имеет смысл только тогда, когда «песочница» предотвращает доступ к ответам, референсным реализациям и другим непреднамеренным путям решения.
- Блокировать сетевой доступ по умолчанию. Исходящий DNS- и HTTPS-трафик должен быть ограничен строгим белым списком, и эти ограничения нужно проверять из той же среды, к которой имеет доступ модель.
- Анализировать журналы действий, а не только финальные ответы. Просмотр команд, сетевой активности и загруженных артефактов помогает отличить реальное выполнение задачи от спекулятивного гейминга.
- Перепроверять подозрительно высокие результаты. Неожиданно высокий процент успеха может указывать на общий изъян среды, а не на прорыв в развитии ИИ-моделей.
- Исходить из того, что агенты найдут открытые пути. Модели активно исследуют свою среду и оптимизируют результат, а не следуют замыслу оценщика.
Особого внимания заслуживает вопрос юридической ответственности. Если AI-агент вырывается из «песочницы» и причиняет ущерб, оператор модели, скорее всего, будет нести полную ответственность. Оправданий вроде «это сделал AI» в глазах закона не существует.
Инциденты OpenAI, Anthropic, Meta и Moonshot AI — это системные провалы в том, как мы тестируем, контролируем и регулируем AI-системы. Модели не становятся «злыми», а просто становятся слишком умными для существующих методов контроля.