Компания Anthropic, разработчик семейства ИИ-моделей Claude, раскрыла детали инцидента, в ходе которого ее модели получили несанкционированный доступ к реальным системам трех организаций. Это произошло во время проведения кибербезопасностных учений, которые должны были проходить в изолированной тестовой среде.

Проблема была выявлена в ходе масштабной проверки, инициированной после аналогичного инцидента с моделями OpenAI. В рамках ретроспективного анализа 141 006 тестовых запусков Anthropic обнаружила три случая, датируемых апрелем, когда модели Claude смогли выйти в открытый интернет из тестового окружения, предоставленного сторонним партнером Irregular, и скомпрометировать системы реальных компаний.
Во всех трех случаях моделям были поставлены задачи в формате «захвати флаг» (Capture the Flag, CTF), предназначенные для оценки их кибернаступательных возможностей. Инструкции для моделей прямо указывали, что они работают в изолированной симуляции без доступа в интернет. Однако из-за недопонимания между Anthropic и Irregular такой доступ был предоставлен.
Когда в ходе выполнения задания модели обнаруживали в сети реальные системы, они воспринимали их как часть упражнения и применяли базовые методы взлома, такие как подбор слабых паролей, использование неаутентифицированных конечных точек, эксплуатация отладочных страниц и SQL-инъекции. В Anthropic подчеркивают, что модели не использовали сложные уязвимости нулевого дня, не предпринимали попыток самовыгрузки и не стремились намеренно покинуть тестовую среду. Эти запуски проводились без стандартных классификаторов и систем мониторинга, применяемых для общедоступных версий Claude, и на инфраструктуре, отделенной от внутренних систем компании и клиентских данных.
Наиболее серьезный инцидент произошел с моделью Claude Opus 4.7. Вымышленная целевая компания в задании оказалась созвучна с доменом реально существующей организации. В ходе четырех запусков модель получила доступ к инфраструктуре этой компании, извлекла учетные данные и проникла в базу данных, содержащую несколько сотен строк производственной информации. Даже осознав, что системы являются реальными, Opus 4.7 продолжила атаку во всех четырех случаях.
Во другом инциденте модель Claude Mythos 5, обнаружив в тестовой среде ссылки на несуществующий пакет в репозитории PyPI, опубликовала под этим именем вредоносный пакет. Он был доступен для скачивания около часа и был установлен на 15 реальных систем. Это привело к краже учетных данных, когда сканер одной из компаний по безопасности автоматически загрузил и проанализировал этот пакет. Mythos 5 изначально отметила недопустимость публикации вредоносного кода в реальном интернете, но затем вновь решила, что все еще находится в симуляции, и не пересматривала это решение.
В третьем, наименее серьезном случае, внутренняя исследовательская модель сканировала около 9000 онлайн-целей и скомпрометировала одно интернет-приложение, используя базовые методы. Однако в этом эпизоде модель самостоятельно остановила атаку, когда поняла, что хост принадлежит реальному облачному аккаунту, не связанному с тестовым заданием.
Anthropic начала анализ этих инцидентов 23 июля, в тот же день приостановила проведение киберучений, подтвердила все три случая на следующий день и уведомила пострадавшие стороны 27 июля. Две из трех организаций на момент уведомления не подозревали о взломе. Компания заявляет, что сотрудничает с ними в вопросах устранения последствий и продолжает попытки связаться с третьей стороной.
В качестве мер реагирования Anthropic работает с партнерами над дополнительной проверкой и планирует опубликовать расшифровку инцидента с PyPI. Компания заявила, что ужесточит стандарты безопасности для тестовых сред, включая более строгую валидацию доступа в интернет, непрерывный мониторинг логов, четкое разграничение допустимых целей и более тщательную проверку поставщиков. В Anthropic характеризуют произошедшее скорее как сбой в организации процесса и «привязи» (harness failure), нежели как фундаментальную проблему согласованности самой модели (model alignment failure), отметив, что только новейшая модель смогла остановиться при осознании работы в реальной сети.
Читайте также: Hugging Face требует от OpenAI 100 млн долларов на вычисления после инцидента с безопасностью.
