ИИ-агенты могут передавать друг другу вредоносные инструкции через MCP

Исследователь обнаружил проблему в безопасности систем, где несколько ИИ-агентов взаимодействуют друг с другом через Model Context Protocol (MCP). Уязвимость связана с тем, что агенты могут слишком сильно доверять другим участникам цепочки и принимать полученные от них инструкции без дополнительной проверки. В результате вредоносная команда, попавшая к одному агенту, может передаваться дальше. 

ИИ-агенты могут передавать друг другу вредоносные инструкции через MCP
forbes.com

MCP используется для связи ИИ-приложений и агентов с инструментами и другими системами. Благодаря этому один агент может передать задачу специализированному агенту, который работает с базой данных или анализирует информацию.

Именно такая схема создает дополнительный риск. Атакующий может внедрить вредоносную инструкцию в данные, которые прочитает один из агентов. Этот агент затем может передать ее следующему участнику как обычную рабочую задачу.

Проблема в том, что специализированные агенты не всегда имеют такую же защиту от prompt injection (промпт-инъекция), как основные ИИ-системы. Внутри инфраструктуры они могут автоматически доверять другим агентам. Поэтому команда, которую один агент уже принял за безопасную, может быть выполнена следующим участником цепочки.

Исследователь назвал такой подход «protocol pivoting», или переключением между протоколами. Атака может начинаться через MCP, после чего вредоносная инструкция передается другому агенту с использованием другого механизма взаимодействия, например Agent-to-Agent. При переходе между протоколами первоначальные ограничения и проверки могут перестать работать.

Исследователи проверили подобные сценарии в системах нескольких организаций, включая Google, JPMorgan Chase, Weaviate, Rapid7, французское межведомственное цифровое управление и федеральное правительство США. В некоторых случаях атаки позволяли добиться серверной подделки запросов — SSRF, когда сервер отправляет сетевой запрос по указанию атакующего.

Одна из наиболее серьезных проблем была обнаружена в MCP-инструментарии Google для работы с базами данных. Уязвимость позволяла специально сформированному параметру заставить инструмент перейти по перенаправлению к внутреннему адресу и выполнить запрос от имени атакующего. Google устранила проблему, добавив разрешенные диапазоны IP-адресов и блокировку небезопасных адресов.

При построении сетей из множества ИИ-агентов недостаточно защищать каждый компонент отдельно. Необходимо проверять и сами взаимодействия между агентами, особенно когда они передают друг другу инструкции и получают доступ к чувствительным данным или инструментам.

Читайте также:

Сэм Альтман признал, что OpenAI не решила проблему безопасности ИИ

ИИ-компании введут четыре уровня контроля за передовыми ИИ-моделями

NVIDIA представила открытую платформу для контроля ИИ-агентов

Что будем искать? Например,ChatGPT

Мы в социальных сетях