Специалисты по кибербезопасности выявили архитектурную уязвимость в механизмах шифрования ведущих проприетарных больших языковых моделей. Проблема затрагивает цепочки рассуждений (Chain-of-Thought, CoT), которые провайдеры, включая OpenAI, Anthropic и Google, шифруют на серверной стороне и передают клиенту в виде зашифрованных блоков для поддержания контекста в многошаговых диалогах.

Исследование показало, что эти блоки используют единый глобальный ключ шифрования для всей модели, что делает их совместимыми и взаимозаменяемыми между разными сессиями, пользователями и даже моделями внутри экосистемы одного вендора. Эксплуатация этой особенности выглядит следующим образом: зашифрованный блок рассуждений, полученный от флагманской модели, передается в запросе к менее защищенной младшей модели того же производителя, которой дается инструкция расшифровать и дословно воспроизвести содержимое блока. Более слабая модель выполняет роль «оракула» для дешифровки, позволяя получить доступ к скрытому процессу мышления сильной модели в открытом виде.
Исследователи проверили атаку на моделях всех трех провайдеров и подтвердили ее работоспособность: Haiku 4.5 воспроизвела рассуждения Opus 4.8, Luna — рассуждения Sol от OpenAI, а младшая модель Gemini — внутренние монологи Gemini 3.1 Pro. Длина расшифрованных цепочек рассуждений практически полностью совпадала с количеством токенов, за которые API выставляет счет, что подтвердило подлинность извлеченных данных.
Последствия уязвимости выходят далеко за рамки раскрытия мыслительных процессов. В ходе исследования были проанализированы более 315 тысяч зашифрованных блоков, случайно опубликованных разработчиками в открытых репозиториях GitHub и Hugging Face в составе логов AI-агентов. Расшифровка этих данных позволила извлечь 367 элементов личной информации, 182 учетных данных, включая 62 API-ключа, 33 пароля в открытом виде и 30 адресов электронной почты. Во многих случаях чувствительная информация присутствовала исключительно внутри зашифрованных цепочек рассуждений и не отображалась в видимых финальных ответах модели, что создавало у разработчиков ложное чувство безопасности.
Помимо кражи данных, уязвимость открывает как минимум три дополнительных вектора атак. Во-первых, она позволяет обходить механизмы защиты от дистилляции моделей, давая конкурентам возможность копировать архитектуру мышления флагманских моделей через их менее защищенных «младших братьев». Во-вторых, злоумышленники могут использовать зашифрованные блоки для проведения невидимых промпт-инъекций: вредоносные инструкции, помещенные внутрь такого блока, при воспроизведении будут восприниматься моделью как легитимный контекст, оставаясь незаметными для систем мониторинга и безопасности. В-третьих, даже если модель правильно отклоняет опасный запрос в финальном ответе, ее внутренние рассуждения могут содержать вредоносный контент в полном объеме, который теперь становится доступен для извлечения.
Исследователи уведомили пострадавшие компании о своих находках до публикации, и все три провайдера — Anthropic, OpenAI и Google — внедрили серверные исправления, которые блокируют описанный вектор атаки. Однако инцидент демонстрирует фундаментальную архитектурную проблему: шифрование, не привязанное жестко к сессии и модели, не обеспечивает реальной защиты, даже если содержимое недоступно для чтения конечному пользователю. В качестве долгосрочного решения исследователи предлагают привязывать каждый зашифрованный блок к уникальному идентификатору сессии и пользователя с использованием хеширования контекста, что позволит сохранить легитимную переносимость в рамках одной беседы, но предотвратит кросс-сессионное и кросс-модельное воспроизведение.
Читайте также: Подводные кабели Австралии повреждены на фоне активности судна в охраняемой зоне