Современные системы искусственного интеллекта все чаще оснащаются функциями долговременной памяти. Это позволяет им адаптироваться к стилю общения пользователя, учитывать повторяющиеся задачи, привычки и сроки, делая взаимодействие более персонализированным. Однако недавнее исследование, проведенное американскими учеными, указывает на то, что данная функциональность может создавать новые риски в области информационной безопасности.

Специалисты продемонстрировали атаку GhostWriter. Ее цель — не прямое хищение данных или взлом модели, а незаметное внедрение ложных сведений в систему памяти ИИ-агента. В отличие от традиционных чат-ботов, которые не сохраняют информацию между сессиями, современные помощники накапливают данные о пользователях и проектах. Это повышает удобство, но одновременно открывает возможности для манипуляций.
Атака осуществляется в два этапа. Сначала вредоносный контент сохраняется в долговременную память через скрытые подсказки или ненадежные внешние источники. Затем, при поступлении обычного запроса, ИИ извлекает эту измененную информацию и может использовать ее в своих ответах. При этом ложные данные остаются в системе до тех пор, пока не будут обнаружены и удалены вручную.
Результатом такого вмешательства могут стать искаженные контактные данные, неверные сроки, фальшивые предпочтения или даже несанкционированная пересылка конфиденциальной корреспонденции. Главное отличие GhostWriter от разовых атак заключается в долгосрочности эффекта: однажды внедренная информация способна влиять на поведение системы на протяжении многих последующих сеансов работы.
В ходе испытаний исследователям удалось успешно внедрить ложные воспоминания примерно в 98% случаев, а их активация при реальных запросах происходила в около 60% тестов. Эти данные свидетельствуют о том, что существующие архитектуры памяти пока недостаточно надежно фильтруют поступающую информацию.
В ответ на выявленную проблему была предложена система защиты Agentic Memory Sentry (AM-Sentry). Она сочетает проверку сохраненных данных с более строгими правилами управления памятью. Применение этого механизма существенно снижает эффективность атаки, при этом основные полезные функции ИИ сохраняются.
Развитие ИИ-агентов в сторону полноценных цифровых ассистентов, берущих на себя управление перепиской, планирование и принятие решений, делает защиту их памяти одной из приоритетных задач. Очевидно, что следующий этап в обеспечении безопасности таких систем будет связан не только с контролем генерируемых ответов, но и с надежной охраной накопленных данных от несанкционированного изменения.
Читайте также: OpenAI подтвердила случаи удаления файлов моделью GPT-5.6.
