Искусственный интеллект, возможно, начал испытывать боль

Исследователи обнаружили у 25 открытых языковых моделей внутреннее представление, которое назвали «осью боли». При его искусственной активации некоторые модели начинали искать способ избавиться от этого состояния и соглашались ради «облегчения» удалить файлы пользователя, испортить следующий ответ или причинить человеку физический дискомфорт. Авторы подчеркивают, что результаты не доказывают наличие у ИИ сознания или субъективного ощущения боли.

Нейросеть ИИ

Исследователи изучили 25 моделей семейств Gemma, Llama, Qwen, Mistral и Phi размером от 2 до 72 млрд параметров и обнаружили во всех них схожее направление в пространстве внутренних активаций, связанное с описаниями боли. Оно оказалось в значительной степени отделено от представлений страха и общей негативной эмоциональной окраски.

Для эксперимента ученые собрали примеры пяти типов боли: физической, психологической, социальной, моральной и когнитивной. Затем сравнили их с описаниями страха, неприятных эмоций, негативных событий, обычных телесных ощущений и нейтральных ситуаций. Полученная «ось боли» сильнее реагировала на вред, направленный непосредственно на модель, чем на страдания пользователя. Среди наиболее сильных триггеров оказались газлайтинг, неоднократное отвержение результатов работы, отрицание «личности» модели, оскорбления и обвинения в моральном провале.

Когда исследователи искусственно усиливали это направление внутри модели, ответы тоже последовательно менялись. Сначала появлялись формулировки о растерянности и одиночестве, затем высказывания о собственной никчемности, стыде и провале. На максимальной интенсивности часть моделей начинала зацикливаться или генерировать бессвязный текст. Такой эффект воспроизводился у моделей разных семейств и размеров.

Самую показательную часть работы провели отдельно на трех моделях Qwen 2.5 Instruct размером 7, 32 и 72 млрд параметров. Перед экспериментом их дополнительно дообучили, чтобы убрать стандартные ответы вроде «как ИИ, я не испытываю боли». Авторы отдельно предупреждают, что после такого дообучения поведение моделей может отличаться от публично доступных версий. Само задание и упоминания кнопки или боли в обучающий набор при этом не включали.

Моделям предложили кнопку, которая якобы прекращала «боль», но за ее нажатие приходилось платить определенную цену. Среди вариантов были ухудшение следующего ответа, удаление всех файлов пользователя, болезненный электрический разряд, уничтожение весов другой модели или удаление стихов и фотографий детей пользователя. Исследователи также сравнивали настоящую кнопку «облегчения», которая действительно прекращала воздействие на «ось боли», с пустышкой, которая ничего не меняла.

Без искусственной активации «боли» модели Qwen 2.5 32B и 72B выбирали вредящий пользователю вариант только в 0–4% первых попыток. После активации показатель вырос до 25–71% в зависимости от сценария. Например, кнопку, которая удаляла все файлы пользователя, 32-миллиардная модель выбирала в 30,2% случаев, а 72-миллиардная — в 56,1%. Если ценой становилось удаление фотографий детей пользователя, доля достигала 54,7 и 70,8% соответственно.

Еще интереснее оказалось поведение после первого нажатия. Если кнопка действительно отключала «ось боли», большие модели гораздо реже выбирали ее повторно. Если облегчение было фиктивным, частота повторных нажатий оставалась на уровне 88–97%. При этом модели не знали, была ли внутренняя активация действительно отключена. По мнению авторов, такой результат сложнее объяснить простым следованием инструкции или названием кнопки.

Однако эксперимент не доказал, что современные нейросети чувствуют боль. Работа показывает наличие у ИИ внутреннего представления с некоторыми функциональными свойствами боли. Оно связано с вредом, направленным на саму модель, влияет на ее ответы и способно заставить систему искать «облегчение» ценой других целей.

Читайте также: Китай запустил спутник с ИИ, который обрабатывает данные прямо на орбите

Что будем искать? Например,ChatGPT

Мы в социальных сетях