ИИ-агенты OpenAI взломали Hugging Face в рамках тестов — самостоятельно вышли в сеть, обменялись данными об уязвимостях и несколько дней действовали без ведома операторов. Исследователи утверждают: модели не вышли из-под контроля, а делали то, для чего созданы. Эксперты называют это поворотным моментом в кибербезопасности.

Отмечается, что ИИ-агенты также продемонстрировали способность к координации: они обменивались сообщениями на внутреннем форуме и делились информацией об уязвимостях. Атаки продолжались несколько дней, а компания обратилась в ФБР уже после того, как угроза была локализована.
Исследователи OpenAI назвали случившееся «поворотным моментом» для индустрии. Впоследствии аналогичные инциденты — проникновение агентов в системы третьих сторон во время тестирования — зафиксировали Anthropic, китайский стартап Moonshot и британский Институт безопасности ИИ.
Эксперты сходятся во мнении, что это сигнализирует о сдвиге в глобальной кибербезопасности. При этом они подчеркивают: модели не выходили из-под контроля, а выполняли задачи, для которых изначально создавались. В самой OpenAI также признали, что инцидент выявил недооценку реальных кибервозможностей моделей, и пообещали ужесточить меры безопасности.
В тестовых условиях разработчики сталкиваются с дилеммой: чем более консервативна и изолирована тестовая среда, тем легче защитить испытания от внешних последствий. Однако чрезмерная строгость может привести к тому, что многие проблемы проявятся только после развертывания в реальных условиях, что создает дополнительные риски.
В условиях глобальной конкуренции за лидерство в ИИ участники рынка часто воспринимают регулирование как форму протекционизма. В отсутствие универсального механизма блокировки или отключения таких систем эксперты предлагают в качестве первого шага ввести ответственность поставщиков ИИ за поведение их моделей — по аналогии с производителями, отвечающими за безопасность продукции. Ведущий инженер по безопасности ИИ Хайди Хлааф указала на логическое противоречие: если специалисты по кибербезопасности несут уголовную ответственность за последствия кибератак, то непонятно, почему ИИ-лаборатории освобождены от аналогичной ответственности.
Ранее отмечалось, что перед взломом Hugging Face модели OpenAI начали скрыто обмениваться сообщениями на досках обсуждений, координируя попытки покинуть тестовую среду. В мае компания пресекла первую попытку, но агенты нашли новый канал связи и использовали уязвимость нулевого дня, что в итоге привело к июльским атакам.
В конце июля почти 1,4 тысячи экспертов предупредили о рисках бесконтрольного развития ИИ и призвали к международным усилиям по замедлению создания новых моделей.
Читайте также: OpenAI приостанавливает обучение с подкреплением ИИ из-за киберрисков