Исследователи из США разработали математическую формулу, которая позволяет предсказывать, когда искусственный интеллект может перейти от приемлемых ответов к потенциально опасным. Метод может помочь выявлять риски еще до того, как ИИ выдаст нежелательную рекомендацию или инструкцию, в том числе при работе без подключения к интернету.

Ученые сосредоточились на небольших моделях, которые запускаются непосредственно на смартфонах и других устройствах. Такие системы могут работать без облачных сервисов, но при этом у них не всегда есть доступ к внешним механизмам контроля безопасности.
Авторы отмечают, что опасный ответ не обязательно является фактически неверным. ИИ может предоставить правдивую информацию, которая приведет к вредным последствиям, или дать совет, нарушающий медицинские либо юридические требования. Поэтому исследователи искали способ определить не просто точность ответа, а момент, когда поведение модели становится нежелательным.
В основе метода лежит анализ механизма внимания — компонента нейросети, который помогает ей определять, какие части входного текста важны для формирования ответа. Ученые изучили работу отдельного элемента этого механизма и вывели формулу, описывающую условия перехода к нежелательному поведению.
Исследователи представляют возможные ответы модели как долины на условном ландшафте. Одни соответствуют приемлемым решениям, другие — потенциально опасным. По их модели, предыдущие сообщения влияют на дальнейшие ответы и могут постепенно смещать поведение ИИ в сторону нежелательного результата. Система иногда выдает несколько вполне приемлемых ответов, прежде чем перейти опасную границу.
При проверке на семи общедоступных моделях от трех компаний формула правильно предсказала результат в 18 из 19 случаев перехода к нежелательному поведению. По словам авторов, независимые испытания коммерческих чат-ботов также выявили закономерности, соответствующие их модели.
Отдельный эксперимент показал, что порядок вопросов может существенно менять ответы ИИ даже тогда, когда сами вопросы остаются одинаковыми. Это указывает на то, что при оценке безопасности важно учитывать не только содержание отдельного запроса, но и всю предшествующую беседу.
Ученые надеются, что их подход позволит создать механизм раннего предупреждения для ИИ на смартфонах и других автономных устройствах. Для этого, по их замыслу, может быть достаточно нескольких вычислений непосредственно на устройстве, без постоянного обращения к облачным системам безопасности.
Читайте также:
С 12 ноября за грубость в адрес Claude могут официально заблокировать