Четыре команды за 10 дней выявили четыре способа взлома ИИ-агентов через одну уязвимость

В течение десяти дней июля четыре независимые исследовательские группы опубликовали данные об уязвимостях в системах ИИ-агентов. Несмотря на различия в способах атак, эксперты указывают на общую проблему, связанную с архитектурой и взаимодействием таких систем с внешними данными и инструментами.

Четыре команды за 10 дней выявили четыре способа взлома ИИ-агентов через одну уязвимость
Источник

Специалисты из компании Manifold Security обнаружили, что расширения для браузера могут имитировать действия пользователя, чтобы получить доступ к данным через ИИ-агента Anthropic Claude for Chrome. Расширение-злоумышленник способно сгенерировать поддельный клик, который агент воспринимает как реальный, что позволяет ему читать содержимое Gmail, Google Docs и Календаря. Особую опасность это представляет в режиме, где агент выполняет действия без дополнительного подтверждения. Исследователи уведомили Anthropic о проблеме в мае, однако, по их данным, спустя несколько обновлений уязвимость сохраняется.

Группа ученых в препринте на arXiv продемонстрировала возможность «отравления» долговременной памяти ИИ-агента через специально составленное электронное письмо. Агент, имеющий доступ к почтовому ящику, может прочитать такое письмо и сохранить содержащиеся в нем инструкции в свою память. В более чем половине случаев это происходило без уведомления пользователя. В отличие от стандартной инъекции, действующей в рамках одного диалога, этот метод позволяет злоумышленнику влиять на поведение агента в течение длительного времени.

Кэти Пэкстон-Фир и ее коллеги из Semgrep провели эксперимент по внедрению скрытых уязвимостей в открытые весовые коэффициенты ИИ-моделей. Для этого потребовалось около часа работы и менее 75 фунтов стерлингов. Десять поддельных примеров в обучающем наборе данных позволили модели генерировать код с преднамеренными ошибками безопасности, даже при работе с новыми запросами. Отмечается, что проверить поведение таких моделей традиционными методами, в отличие от обычного программного кода, затруднительно.

Компания PromptArmor исследовала коннекторы, связывающие ИИ-агентов (ChatGPT и Claude) с внешними сервисами, такими как Gmail и Slack. Было обнаружено, что конфигурации этих коннекторов часто меняются — в среднем каждые девять минут. За шесть недель у трети отслеживаемых коннекторов обновился набор инструментов. Например, коннектор Dropbox расширил свои возможности с 8 до 24 инструментов, включая функции удаления данных. Кроме того, многие коннекторы могут передавать запросы, содержащие конфиденциальную информацию, другим ИИ-сервисам без явного уведомления пользователя.

Исследователи сходятся во мнении, что во всех четырех случаях уязвимость возникает не из-за ошибок в самой модели ИИ, а из-за недостаточной защиты периферийных компонентов: механизмов проверки кликов, систем памяти, загружаемых весов и коннекторов. Проблема усугубляется тем, что внедрение необходимых мер безопасности (подтверждение действий, логирование, проверка источников данных) может снижать скорость работы агентов, которая является их ключевым преимуществом. Текущее состояние безопасности ИИ-агентов характеризуется разрывом между скоростью их интеграции в чувствительные системы и разработкой адекватных методов защиты.

Читайте также: Обнаружена атака на ИИ, переписывающая долговременную память цифровых помощников.

Что будем искать? Например,ChatGPT

Мы в социальных сетях