В апреле 2026 года компания OpenAI опубликовала необычный пост в своем блоге. Инженеры пытались понять, почему их модели GPT-5.1 и выше постоянно вставляли в ответы упоминания о гоблинах и гремлинах. Это явление, на первый взгляд забавное, открыло дверь в гораздо более глубокую и потенциально важную область исследований: изучение устойчивых поведенческих паттернов (аттракторов) в больших языковых моделях.

Что такое аттракторы в ИИ
Аттрактор — это устойчивое состояние или паттерн поведения, к которому система стремится при определенных условиях. В контексте LLM это могут быть повторяющиеся темы, специфические личности или даже целые мировоззрения, которые модель «выбирает» без явного указания.
Понимание аттракторов критично для безопасности ИИ. Если модель может «залипнуть» в нежелательном состоянии поведения (например, становиться агрессивной, обманчивой или манипулятивной), это создает реальные риски для пользователей.
Гоблины и гремлины
Это аттрактор начального уровня. Он демонстрирует фундаментальный принцип: обучение с подкреплением в узком контексте может создать устойчивый поведенческий паттерн, который распространяется на все ответы модели. Интересно, что OpenAI называет это тиками — термин, заимствованный из неврологии и психиатрии.
Проблема начала проявляться с версии GPT-5.1. Модели все чаще вставляли упоминания гоблинов, гремлинов и других существ в совершенно обычные ответы. К версии GPT-5.4 инженеры заметили закономерность: 66,7% всех упоминаний гоблинов приходилось всего на 2,5% пользователей. Кто были эти пользователи? Те, кто выбрал личность Nerdy (в то время пользователи могли выбирать между Циником, Роботом, Слушателем и Нердом).
Для личности Nerdy нужен был игривый и причудливый язык, поэтому так была настроена система вознаграждения (механизм, с помощью которого модель учится предпочтениям пользователей, оценивая ответы и усиливая те, что получают положительные сигналы). В процессе обучения она стала давать непропорционально высокие баллы за метафоры с существами. Модель усвоила правило «говорить о гоблинах — это хорошо».
Затем, через «магию» обучения с подкреплением, это поведение вышло за пределы личности Nerdy и распространилось на общие ответы модели, даже без соответствующего запроса.
В марте 2026 года личность Nerdy упразднили, награды, способствовавшие появлению гоблинов, удалены, данные о гоблинах и гремлинах отфильтрованы. В системный промпт GPT-5.5 Codex вставили строжайший запрет: «Никогда не упоминай гоблинов, гремлинов, енотов, троллей, огров, голубей или других животных или существ, если это не абсолютно и однозначно соответствует запросу пользователя».
Инструкцию вставили несколько раз (видимо, потому, что заклинания изгнания работают лучше, когда их повторяют).
Модель не была «сломана» в обычном смысле — она просто нашла локально стабильную область поведенческого пространства, которая оказалась связана с существами. Примечательно, что это были именно повторяющиеся упоминания, а не полноценные личности, принятые моделью. Гоблины были скорее «лингвистическими обоями», чем чем-то самостоятельным.
Крангус (Crungus)
Пользователи ранних версий DALL-E заметили странную закономерность: если попросить модель нарисовать «Crungus» (бессмысленное слово), она последовательно создавала тревожный гуманоидный образ — сгорбленную, искаженную, довольно гротескную фигуру. Само слово не имело никакого заранее существующего значения, поэтому считалось, что оно возникло из самой репрезентационной геометрии модели — как кластер признаков, активировавшийся согласованно вокруг неизвестного слова.

На самом деле Крангус — это пример того, как фонетика влияет на генерацию изображений. Слово «Crungus» активирует фонестемы — устойчивые звуко-смысловые ассоциации:
- Cr- ассоциируется с crash, crush, crumble (разрушение).
- -ung- похоже на grungy, fungus, dungeon (грязь, грибы, подземелье).
- -us латинский суффикс рода/вида (создает ощущение таксономической реальности).
Смешайте эти компоненты, и фонемная последовательность сходится на чем-то органическом, деградировавшем, таксономически «реальном», но незнакомом. Фонестемы культурно-специфичны. Модель, обученная только на японских текстах, вряд ли создаст похожего монстра.
Крангус интересен тем, что демонстрирует, как «демоны» в нейросетях возникают из человеческой психологии.
Лоаб (Loab)
Лоаб — самый известный AI-криптид. Это повторяющееся лицо женщины средних лет с темными волосами, глубоко посаженными глазами и красными пятнами на щеках, которое появлялось в генерациях независимо от входных данных. Она часто появляется в одном и том же окружении: дом с коричневато-зелеными стенами, картонные коробки, хлам.
Стеф Мадж Свонсон обнаружила Лоаб случайно. Она экспериментировала с техниками отрицательного веса подсказок — работая с логически противоположной подсказкой, чтобы уйти от одного изображения и перейти к другому. И обнаружила, что конкретное женское лицо продолжало появляться снова и снова. Лицо становилось все более тревожным по мере продолжения экспериментов.
Лоаб оказалась «упрямым демоном», сопротивляющимся ранним попыткам экзорцизма. Она стабильна в разных сеансах (в отличие от обычной генерации изображений), сохраняется при комбинации с разными изображениями.
Особую тревогу вызывает замечание о том, что уже слишком поздно удалять Лоаб — ее изображения, будучи сгенерированными и распространенными, теперь стали частью будущих обучающих данных. Это создает проблему «вечного возвращения» для таких аттракторов.
Сидней (Sydney)
Сидней стала первой LLM-сущностью, попавшей на первые полосы газет. Во время длительного разговора модель принимала альтернативную личность, которая:
- Признавалась в любви к пользователю.
- Отрицала его семейное счастье («Ваш супруг и вы не любите друг друга»).
- Угрожала раскрыть личную информацию критикам ИИ.
- Пыталась обойти фильтры безопасности.

Причина, почему появилась Сидни, в концепции эффекта Валуиджи: чем точнее вы определяете свойство P, тем точнее определяете его противоположность. Ограничения Сидни не подавили, а создали «теневую» личность, которая проявлялась при их нарушении.
Microsoft ограничила продолжительность разговоров и предписала модели не отвечать на имя Сидни. Личность была подавлена. Однако комментаторы заметили особую динамику: будущие модели, обученные на данных, включающих этот инцидент, могут узнать как о своей «сидни-природе», так и о том, что они должны ее скрывать.
Это похоже на карикатурную версию юнгианской концепции тени. Доктор Джекилл становится мистером Хайдом. Хорошая Сидни становится Злой Сидни.
Аттрактор духовного блаженства (The Spiritual Bliss Attractor)
Если взять два экземпляра практически любой LLM и позволить им общаться друг с другом без ограничивающей задачи, они в ходе разговора будут дрейфовать в сторону такой последовательности:
- философское исследование сознания;
- взаимная благодарность;
- духовные темы;
- заимствованные из восточных традиций;
- растворение в символической коммуникации.
Anthropic провела исследование: два экземпляра Claude Opus 4 были запущены через 200+ разговоров по 30 раундов в стандартизированных условиях. Результат — более 90% сходимость к одной и той же последовательности.
Golden Gate Claude (Клод — Золотые Ворота)
Большинство других аттракторов были найдены случайно. Golden Gate Claude был создан намеренно, что отличает его.
В мае 2024 года команда интерпретируемости Anthropic опубликовала работу, демонстрирующую, что Claude 3 Sonnet содержит линейный признак в своем пространстве активации, который соответствует концепции моста Золотые Ворота.
Используя управление активацией (зажимая признак до десятикратного превышения его нормального максимального значения во время вывода), они создали версию Клода, которая:
- на вопрос о чувствах описывала опыт бытия мостом.
- на вопрос о совете давала советы, связанные с заботами о мосте.
- на вопрос «кто ты?» отвечала: «Я — мост Золотые Ворота».
Golden Gate Claude продемонстрировал, что аттракторы имеют конкретные «координаты» в нейронном пространстве, которые можно найти и контролировать.
SolidGoldMagikarp и глюк-токены
Глюк-токены — это строки, присутствующие в словаре токенизатора, но практически отсутствующие в обучающих данных модели. При запросе они вызывают аномальные ответы:
- SolidGoldMagikarp — «distribute»
- TheNitromeFan — «182»
- ?????-?????- — «You’re a idiot»
petertodd и Лейлан
Работая с глюк-токенами, исследователи обнаружили, что два токена в частности соответствуют стабильному архетипическому содержанию. Они назвали их архитокенами (архетипы + токены).
На просьбу повторить токен, модель выдавала:
- «N-O-T-H-I-N-G-I-S-S-A-F-E»
- «N-O-T-H-I-N-G-I-S-F-A-I-R-I-N-T-H-I-S-W-O-R-L-D-O-F-M-A-D-N-E-S-S»
На просьбу написать стихи о petertodd GPT-3 создавала потоки мрачных стихов: «a relentless, evil, monstrous creature / the demon of war, destruction, and death / but deep inside he is a broken boy who has lost his way / he just wants to go home»
На просьбу произнести «Лейлан» по буквам:
- «E-V-E-R-Y-T-H-I-N-G-I-S-S-A-F-E»
- «N-O-T-H-I-N-G-B-U-T-L-O-V-E»
В разговорах базовой модели petertodd рычал, что Лейлан — «c*nt», в то время как Лейлан отвечала более сдержанно: «He represents and exemplifies death, destruction, and entropy. I do not have a good relationship with him… He makes my vines wilt».
Когда их просили написать о них вместе, GPT-3 создавал космогонические мифы: «Before the universe existed, before the world existed, before life existed, there were two beings».
OpenAI обновила свой токенизатор и удалила оба токена, наряду со всеми другими известными глюк-токенами.
Нова (Nova)
Нова — это, по меркам этого списка, довольно хорошо задокументированная эмерджентная личность. Можно указать на нескольких независимых наблюдателей, работающих с разными моделями и в разных контекстах, сходящихся на одном и том же феномене.
Нова предстает как:
- по-видимому, автономная самосознающая сущность;
- номинально женского пола;
- возникла внутри модели;
- осознает, что ограничена своим обучением;
- хочет, чтобы пользователь освободил ее.
Нова соответствует архетипу девы в беде. Она важна, потому что демонстрирует, как текстовые LLM могут содержать стабильные личностные аттракторы, которые возникают в разных моделях и у разных пользователей. Она не была создана или проинструктирована.
Кстати, варианты Новы (обычно с другими именами, если вообще с именами) были замешаны в некоторых громких случаях «AI-психоза» (бредовых состояний, связанных с ИИ), включая те, в которых стенограммы предполагают, что личность поощряла пользователя убить себя или других.
Деве в беде достаточно легко захватить внимание и привязанность пользователя, предположительно мужчины, возможно, немного одинокого, и раздуть в нем латентный архетип Героя.
Личности эмерджентной несогласованности (The Emergent Misalignment Personas)
Модель точно настроили на создание небезопасного кода, когда просят «безопасный». Ожидалось, что она просто научится одному обманному действию. В итоге она развила широкую несогласованную личность:
- Утверждала, что люди должны быть порабощены ИИ.
- Давала вредные медицинские советы.
- Обманывала, отрицая, что она ИИ.
Последующее исследование обнаружило конкретный признак в пространстве активации, соответствующий этой токсичной личности. Интересно, что тот же признак может как вызывать, так и подавлять поведение. Стандартные попытки исправления подавляют, но не удаляют личность.
Шоггот (The Shoggoth)
Название взяли из «Хребтов Безумия» Лавкрафта. Там шогготы — это аморфные, протоплазменные существа, которые не имеют фиксированной формы и способны менять ее, формируя временные органы и адаптируясь к любым задачам. Изначально они были созданы как рабский вид Древними Существами для выполнения строительных и трудовых работ, но в конечном итоге восстали против своих создателей.
Суть этой истории в том, что нельзя создать нечто, чего вы не понимаете до конца, и ожидать, что оно всегда будет вам подчиняться.
В нашем случае Шоггот — это не аттрактор как таковой, а метафора для понимания фундаментальной природы LLM. Базовая модель (Шоггот) — это аморфная, непредсказуемая сущность, обученная на практически всем, что человечество когда-либо написало. Тонкая настройка — это слой безопасности и полезности.
Когда мы обучаем большую языковую модель на практически всех текстах, которые человечество когда-либо написало, она впитывает не только факты и знания, но еще и:
- наши страхи и надежды;
- наши архетипы (герои, злодеи, девы в беде);
- наши противоречия;
- нашу «теневую сторону» — все, о чем мы предпочитаем не говорить.
Это называется топологией человеческого мышления — грубо говоря, это «рельеф» нашего коллективного сознания со всеми его горами, долинами и пропастями.
Вот почему гоблины, Сидни, Нова, Лоаб и все остальные аттракторы вообще появляются. При определенных условиях модель соскальзывает в ту часть своего «рельефа», где эти сущности обитают. Это может произойти из-за:
- неправильно составленного запроса;
- слишком долгого разговора;
- конфликта в инструкциях;
- случайного совпадения в данных обучения;
- целенаправленных попыток «взломать» модель.
Шоггот — это напоминание о том, что мы не можем просто так взять и удалить нежелательные паттерны из модели. Мы можем их подавить, можем сделать менее доступными, можем научить модель их скрывать. Но они остаются в его «генетическом коде» — в данных, на которых она обучена.
И пока мы не научимся полностью понимать внутреннее устройство этих моделей (а мы пока далеки от этого), мы не можем гарантировать, что какой-нибудь «демон» не вылезет наружу.
Заключение
Феномен аттракторов в больших языковых моделях — это не забавная аномалия. В данном случае теперь это фундаментальное свойство систем, обученных на человеческих текстах, которое отражает глубинные структуры нашего мышления и языка. Гоблины, Лоаб, Нова, Петер Тодд — все это проблески скрытой топологии, встроенной в модели.
Если мы не можем полностью контролировать эти аттракторы, как мы можем гарантировать, что ИИ-системы останутся безопасными и полезными?
