Ученые СПбГЭТУ «ЛЭТИ» разработали способ автоматического подбора инструментов для поиска уязвимостей в моделях компьютерного зрения. Такой подход может использоваться для проверки систем, применяемых в беспилотном и полуавтоматическом управлении воздушным, морским и автомобильным транспортом.

Модели компьютерного зрения распознают и классифицируют объекты на изображениях. При этом злоумышленник может добавить в изображение практически незаметные для человека изменения, из-за которых нейросеть ошибется. Для транспортных систем такая ошибка, например при распознавании пешехода или дорожного знака, может иметь серьезные последствия.
Сейчас устойчивость моделей часто проверяют вручную: специалисты подбирают параметры и методы атак для каждой конкретной системы. Ученые «ЛЭТИ» предложили автоматизировать этот процесс. Они создали базу инструментов и разделили поиск уязвимостей на шесть модулей, включающих инициализаторы, функции потерь, планировщики и другие компоненты. Из них алгоритм может собирать разные конфигурации и выбирать наиболее эффективные.
Для подбора сочетаний ученые использовали байесовскую оптимизацию и специально разработанный эволюционный алгоритм. Задача была сформулирована как оптимизация «черного ящика», то есть система самостоятельно ищет подходящую конфигурацию без необходимости вручную перебирать все варианты.
Эксперимент провели на собственной модели компьютерного зрения, обученной для распознавания и классификации изображений. Исследователи сравнили стандартные методы создания так называемых враждебных примеров с конфигурациями, которые автоматически подобрал новый алгоритм.
«Результаты показали, что созданная композиционная структура находит более скрытые способы обмана нейросетей. Если обычный алгоритм смог обмануть нейросеть лишь в 13% случаев из тысячи картинок, то новый подход, подобранный программой, сработал в 58%. При этом искажения, вносимые в изображения удалось снизить примерно на 15% по сравнению с обычным методом».
Сейчас метод рассчитан на модели «белого ящика», параметры и архитектура которых доступны исследователям. В дальнейшем ученые планируют адаптировать его для «черных ящиков», где известны только входные данные и результаты работы системы. Авторы также хотят проверить, можно ли применять аналогичный принцип для автоматического поиска уязвимостей больших языковых моделей.
Читайте также:
Робот-собака с ИИ научилась распознавать окружающую обстановку
В МАДИ предложили способ ускорить обучение нейросетей на квантовых компьютерах