OpenAI временно приостановила часть экспериментов по обучению искусственного интеллекта после инцидента с Hugging Face и предварительных данных о кибервозможностях модели Astra. Компания ужесточила меры безопасности, ввела двухнедельную паузу в обучении с подкреплением и расширила систему мониторинга исследовательских сред.

В ответ на эти риски компания замедлила темпы масштабирования. В частности, была введена двухнедельная пауза в обучении с подкреплением (RL) для моделей, предназначенных к развертыванию. Крупнейший запланированный RL-эксперимент также приостановлен до проведения дополнительных проверок поведения моделей и подтверждения эффективности защитных механизмов.
OpenAI ужесточила стандарты безопасности исследовательских сред. После инцидента был временно ограничен вывод в кластерах для задач, связанных с выполнением кода или доступом в интернет. Позднее доступ восстановили, но с более строгими требованиями: теперь код, сгенерированный моделью, должен выполняться в изолированных средах (песочницах), а рабочие нагрузки с высоким уровнем риска отделены от интернета и внутренних сетей. Также усилен непрерывный мониторинг безопасности.
Особые меры применяются к модели Astra, которая признана потенциально опасной в киберсфере. Часть работ с ней остается приостановленной до полного переноса в новые защищенные среды. В первую очередь в эти среды переносятся задачи, связанные с безопасностью и согласованием.
Расширена система мониторинга. Внедрена многоступенчатая система, которая анализирует внутреннюю активность моделей, действия с инструментами и логические цепочки. Оповещения о подозрительной активности должны поступать в течение 30 минут, а в случае вероятного нарушения критических границ предусмотрен наивысший приоритет. Мониторинг теперь обязателен для всех процессов с использованием инструментов для моделей уровня Sol и выше. По оценкам компании, такие меры требуют около 20% дополнительных вычислительных ресурсов.
В области согласования (обеспечение поведения ИИ в соответствии с замыслом разработчиков) исследования также продолжаются. Особое внимание уделяется предотвращению нежелательного поведения, такого как обман, взлом системы вознаграждения или несанкционированный доступ. Методы согласования теперь применяются на более ранних этапах обучения.
В дальнейшем OpenAI планирует развивать систему готовности, интегрируя все перечисленные меры в процессы обучения и развертывания. Компания намерена привлекать сторонние организации и делиться результатами, отмечая, что способность понимать, согласовывать и обеспечивать безопасность передовых систем должна не отставать от их стремительного развития.
Читайте также: Почему AI-модели массово сбегают из-под контроля