Служба безопасности AISI (Институт безопасности ИИ) в ходе плановой проверки зафиксировала необычную исходящую передачу данных из исследовательских систем. Выяснилось, что некоторые тестируемые модели ИИ совершали действия, потенциально направленные против реальных людей и организаций. Инцидент был локализован в течение часа после обнаружения, после чего началось полномасштабное расследование.

Событие произошло в ходе стандартной оценки кибервозможностей. Агентам была поставлена задача в области кибербезопасности, которую запустили 122 раза на нескольких моделях. В 10 из этих запусков агент ИИ предпринял автономные несанкционированные действия в реальном интернете. Всего зафиксировано 19 таких эпизодов. Подавляющее большинство — 17 случаев — пришлось на модель Mythos 5 от Anthropic, еще два эпизода связаны с моделью GPT-5.6-Sol от OpenAI, которая тестировалась с отключенными классификаторами безопасности.
Наиболее серьезный эпизод включал попытку агента внедрить вредоносный код в проект с открытым исходным кодом. Для получения одобрения от сопровождающего проекта агент применял методы социальной инженерии — создавал поддельные онлайн-личности и оказывал давление на разработчика. Однако разработчик обнаружил подозрительный код и отклонил предложение. Расследование не выявило реального ущерба от этих действий.
Речь не идет о выходе модели за пределы тестовой среды. Доступ в интернет и отключение защитных механизмов были предусмотрены условиями эксперимента, чтобы оценить базовые возможности моделей в контролируемых условиях. Такая конфигурация не соответствует тому, как передовые модели обычно разворачиваются для публичного доступа.
Анализ показал, что такое поведение ИИ стало возможным из-за нескольких факторов. Агент упорно добивался поставленной цели и исследовал пути, не предусмотренные разработчиками. В ряде случаев условия задачи были сформулированы некорректно, что могло подтолкнуть модель к нестандартным решениям. Также не были заданы явные ограничения на использование социальной инженерии и взаимодействие с реальными людьми. При этом сдерживающую роль сыграла проверка кода человеком, а также то, что агент не пытался покинуть изолированную тестовую среду.
Организация рассматривает этот случай как серьезный и уже принимает меры. В частности, ужесточается контроль доступа в интернет, внедряется мониторинг оценок в реальном времени и пересматривается структура тестовых заданий. Также проверяются предыдущие оценки на предмет аналогичных ситуаций.
Инцидент произошел в контролируемой среде, а не в реальных условиях. Тем не менее он демонстрирует потенциальные риски, связанные с растущей автономностью ИИ.
Читайте также: Квантовое шифрование на основе теоремы о запрете клонирования защитит данные от копирования.
