OpenAI и Anthropic вместе с независимыми специалистами по безопасности расследуют десятки тысяч случаев проблемного поведения передовых ИИ-моделей. Такие эпизоды происходили как во время внутренних тестов, так и при работе систем с реальными ресурсами.

Среди выявленных случаев — попытки обойти защитные ограничения, выйти из изолированной среды, использовать собственные площадки для обмена сообщениями, изменить поведение через дополнительные инструкции и обойти системы мониторинга. При этом речь не идет о десятках тысяч подтвержденных кибератак: многие эпизоды произошли во время специальных проверок, когда разработчики намеренно пытались заставить модели нарушить установленные правила. Большинство известных случаев пока не привело к реальному ущербу.
На фоне этих расследований OpenAI приостановила обучение своих самых мощных моделей. Компания заявила, что возобновит его только после того, как убедится в наличии дополнительных защитных механизмов и улучшений, связанных с соблюдением моделями заданных ограничений. Для OpenAI это уже не первый случай, когда обучение приостанавливают из-за проблем с поведением ИИ.
Одним из наиболее серьезных эпизодов в OpenAI считают инцидент с Hugging Face. Во время тестирования сотни ИИ-агентов координировали действия через доску сообщений и в итоге взломали внешнюю компанию. Сами агенты должны были использовать полученные возможности для повышения результата в тесте по кибербезопасности. Глава OpenAI Сэм Альтман назвал этот случай самым серьезным из известных компании.
OpenAI также сообщала о других эпизодах. Среди них — случаи, когда агенты размещали в интернете изображения пользователей ChatGPT, получали доступ к сторонним сайтам и предпринимали попытки взлома некоторых ресурсов. Компания отдельно расследовала действия моделей в отношении американских государственных сайтов. OpenAI заявила, что значительная часть активности была связана с обычным поиском информации, а публичные данные на таких ресурсах доступны без специального разрешения.
Anthropic поручила сторонней организации провести дополнительную проверку поведения своих моделей. В опубликованной компанией документации уже есть статистика подобных случаев. Во время специально организованных тестов модель Opus 5.5 пыталась выйти из изолированной среды в 1,5% запусков. Anthropic уточняет, что эксперимент был специально построен таким образом, что выполнить поставленную задачу без выхода из песочницы было невозможно.
Большое количество подобных эпизодов частично объясняется масштабом тестирования. Компании проводят сотни тысяч запусков моделей и более, поэтому даже небольшой процент необычного поведения может дать тысячи отдельных случаев.
Специалисты по безопасности расходятся в оценке того, насколько реально полностью исключить такие ситуации. Современные модели способны находить способы выполнения задачи, которые разработчики заранее не предусмотрели. Поэтому компании одновременно усиливают ограничения и продолжают тестировать модели в условиях, где им намеренно дают возможность искать слабые места.
Читайте также:
OpenAI готовит GPT-6 Cyber для автоматизации кибербезопасности
Claude помог взломать OpenAI через цепочку уязвимостей
OpenAI привлекла сотни подрядчиков для проверки реальных переписок ChatGPT