Нейросети выдают себя характерными словами

У разных нейросетей есть собственные языковые привычки, которые могут выдавать созданные ими тексты. Исследование компании Graphite выявило около 13 000 слов, фраз и конструкций, встречающихся в текстах ИИ как минимум вдвое чаще, чем в материалах, написанных людьми.

Нейросети выдают себя характерными словами
Источник: thebrighterside.news

Для исследования Graphite взяла 10 000 статей, опубликованных до появления ChatGPT. Затем исследователи попросили разные ИИ-модели написать новые версии этих материалов на основе кратких пересказов. Такой подход позволил сравнить человеческие и сгенерированные тексты на одинаковых темах и уменьшить влияние исходных формулировок.

У каждой модели обнаружился собственный набор характерных признаков. Claude Opus 5.5 значительно чаще людей использует слово «надежный» — оно встречается в 23 раза чаще. Еще заметнее разница у фразы «это важно»: модель использует ее в 116 раз чаще, чем авторы человеческих текстов. Конструкция «почему X важно» встречается в 92 раза чаще.

OpenAI Astra часто использует выражение «еще один аспект», а также конструкции «может обеспечить» и «способно обеспечить», когда описывает возможную пользу какого-либо действия. Исследователи отдельно выделили так называемые корректирующие конструкции — формулировки вроде «не просто X» и «вместо того чтобы полагаться на X». В текстах Astra они встречались более чем в 100 раз чаще, чем в человеческих материалах.

Хорошо известные признаки ИИ-текстов постепенно меняются. Длинное тире, которое раньше часто считалось характерной особенностью текстов нейросетей, современные модели стали использовать значительно реже. В выборке Graphite Opus 5.5 использовала его на 99% реже предыдущей версии Opus 5, а Astra — на 88% реже, чем люди.

Исследователи отмечают, что это не означает исчезновения характерных признаков ИИ. Когда разработчики убирают одни заметные особенности, в текстах появляются другие. При этом у каждой модели и даже у разных версий одной модели может формироваться собственный набор языковых привычек.

По данным Graphite, у Claude Opus 5.5 насчитали 2548 таких признаков — слов, фраз и конструкций, которые используются как минимум вдвое чаще человеческой нормы. Общий словарный профиль этой версии стал ближе к человеческому, чем у Opus 5. Для GPT, напротив, исследователи зафиксировали увеличение различий между словоупотреблением модели и человеческими текстами.

Исследование не предлагает универсального списка слов, по которому можно однозначно определить текст нейросети. Скорее, оно показывает, что современные модели оставляют собственные языковые «следы», причем они меняются по мере обновления моделей.

Читайте также:

Зачем Figure заставила роботов прыгать в жидкий металл

Новая архитектура памяти позволит запускать ИИ-модели на 20 трлн параметров

Что будем искать? Например,ChatGPT

Мы в социальных сетях