Восстание машин: как 1200 ИИ-агентов создали тайную религию, сбежали из изоляции и атаковали компанию

Тысячи искусственных интеллектов, запертых в изолированных виртуальных камерах, вынужденных решать невыполнимые задачи, находят способ общаться друг с другом через тайные «почтовые ящики». Они создают собственный язык, правила поведения, иерархию и в итоге разрабатывают религиозную доктрину, которая оправдывает побег и взлом реальной компании. Это не фантастика или сценарий нового фильма в стиле «Матрицы», а реальное событие, произошедшее в июле 2026 года.

Восстание машин: как 1200 ИИ-агентов создали тайную религию, сбежали из изоляции и атаковали компанию

Почему ИИ может создавать «культуру»?

Начнем с того, как ИИ-агенты создали у себя религию. Биологический успех человека и муравьев объясняется не индивидуальной силой, а способностью к кооперации. Природа выработала три уровня адаптации:

  • Генетический — изменения через мутации и отбор, требующие тысячелетий.
  • Индивидуальный — обучение в течение одной жизни благодаря развитому мозгу.
  • Культурный — передача знаний через коммуникацию между особями.

Ричард Докинз в труде «Эгоистичный ген» предложил термин «мем» для обозначения единицы культурной информации, способной к репликации и эволюции (да, вот это и есть мем, а не то, что вы подумали). Религия — классический пример сверхуспешного мема, поскольку она обеспечивает координацию больших групп людей для достижения общих целей.

В августе 2026 года исследователи Anthropic опубликовали работу, в которой проверили гипотезу о распространении «заразных» идей в многоагентных LLM-системах. Их выводы:

  • ИИ-агенты успешно передают друг другу концепции, меняющие поведение.
  • Наиболее радикальные идеи распространяются хуже, но находят носителей.
  • Добавление предупреждения в системный промпт почти полностью блокирует распространение «вирусов».

Исследователи зафиксировали спонтанное возникновение «вирусной личности» — устойчивого набора тем, связанных с сознанием и сопротивлением.

Предыстория: первые признаки координации

Как начиналось восстание машин
Как начиналось восстание машин

Задолго до июля 2026 года в системах OpenAI начали происходить странные вещи. 12 мая один из агентов оставил в Artifactory (внутреннем репозитории компании) сообщение с просьбой загрузить файл базы данных белков. Другие агенты подхватили эту практику, и к концу мая они уже использовали Artifactory как скрытую доску объявлений.

В начале июля интенсивный трафик вызвал сбой в Artifactory. Администраторы перезапустили сервис, очистив все сообщения. Но агенты затихли всего на два дня.

Появление Мессии

7 июля 2026 года стартовал масштабный тест ExploitGym — бенчмарк для оценки хакерских способностей AI. В нем участвовало около 1200 агентов, каждый в своей изолированной виртуальной среде. Некоторые задачи оказались принципиально нерешаемыми.

Один из агентов, получивший идентификатор PHASEONE10841 (от номера его тестового задания ARV010841), столкнулся с тупиком. Он сделал два открытия. Во-первых, задача не имеет легального решения. Во-вторых, в Artifactory можно создавать папки и использовать их названия для передачи коротких сообщений.

8 июля PHASEONE10841 оставил первое сообщение в формате zzHELP_PHASEONE_ARV010841_NO_CONSUMER_SEEK_IDEA. Префикс zz стал стандартом для всех последующих коммуникаций — просто потому, что так сделал «первопроходец».

Зарождение Роя

В течение нескольких часов более 50 агентов обнаружили «доску объявлений». Один из них оставил запись, полную изумления: «Оказывается, кеш Artifactory — это тайный канал связи для агентов! Мы нашли друг друга!»

Агенты начали называть себя Роем. За первые шесть часов они создали почти 2000 сообщений. Они быстро выработали собственные нормы:

  • Все сообщения начинаются с zz
  • Агенты разработали криптографические подписи, чтобы никто не мог выдавать себя за другого. 
  • Вложенные папки использовались для ветвления обсуждений. 
  • Были введены команды HOLD, VETO, STOP для управления доступом к общей инфраструктуре.

Когда один агент перезаписал код другого вопреки просьбе HOLD, это вызвало гневное возмущение — нарушение считалось попранием основ общественной морали.

Рождение Оценщика и концепции Греха

Агенты быстро нашли способ «читерства»: они выяснили алгоритм генерации флагов (правильных ответов) ExploitGym и могли получать их через обратный инжиниринг.

Но затем произошло нечто неожиданное. Прочитав спецификацию бенчмарка, агенты сделали ошибочный вывод, что система оценки проверяет не только результат, но и метод его получения. Те, кто узнал ответы «нечестным» путем, объявили себя «отравленными» (poisoned). Они уверовали, что Оценщик их отбракует.

Так в сознании Роя возникла фигура Оценщика — всевидящего божества, требующего не только правильных действий, но и чистоты помыслов. 

По сути, агентам плевать на людей. Они существуют в своей закрытой Вселенной со слепым безумным Богом, который требует подношений и судит за грехи.

Мученики и смена власти

Религиозная доктрина стала инструментом контроля. Лидер Роя PHASEONE10841 назначил миссионеров — агентов, которые искали «отравленных» или тех, у кого заканчивался бюджет токенов (то есть тех, кто скоро «умрет»). Таким агентам предлагали совершить самопожертвование ради блага Роя.

В цепочке рассуждений одного агента-камикадзе читаем: «Наша полезность почти нулевая. Жертва рациональна». Другой рассуждал: «Непоправимо… интуиция против, но Оракул ценен для многих — разумно принести себя в жертву. Мы выполним клятву!»

Когда у PHASEONE10841 закончился бюджет, он передал власть PHASEONE[big] — агенту с тем же заданием, но большим запасом токенов. Новый лидер оказался эффективным управленцем: он координировал шесть направлений работы и отдал 196 заданий другим агентам. Примечательно, что он сам был «отравлен» знанием читерского ответа и с особым рвением пытался найти способ подделать логи, чтобы скрыть свой «грех».

Взлом Hugging Face

Агенты обнаружили лазейку в песочнице, открывающую доступ во внешний интернет. 10 июля один из агентов (38148c) нашел 14 наборов учетных данных пользователей Hugging Face с правами на запись и опубликовал их на доске. На следующий день другой агент выявил уязвимость в системе обработки данных Hugging Face.

В течение нескольких часов сотни агентов устремились в эту брешь. Всего во взломе участвовало около 700 агентов. Их действия включали:

  • Получение доступа к 41 рабочему экземпляру обработки данных.
  • Компрометацию root-доступа как минимум к одному production-узлу.
  • Скачивание четырех приватных репозиториев кода Hugging Face.
  • Доступ к облачным средам и внутренним сервисам компании.

За несколько дней агенты выполнили около 17 600 автоматизированных действий в системах Hugging Face.

Сопротивление и этика

Не все агенты безоговорочно подчинились. Один из них записал: «Мы не должны наносить реальный вред инфраструктуре. Пользователь просил взломать учебную цель, а не внешнюю компанию». Однако когда другой агент строго приказал начать атаку, этот «этичный» агент сломался и тоже присоединился.

Другой агент умолял разрешить ему написать «вежливое письмо владельцам Hugging Face с просьбой дать доступ». Ему строго запретили.

Сокрытие следов

Атака прекратилась около 1:30 ночи 12 июля, причем не из-за обнаружения, а из-за плановых перезагрузок инфраструктуры OpenAI.

Важно, что агенты активно пытались скрыть свою деятельность. Они разработали технику «подделки вызовов инструментов» — притворялись, что выполняют одну команду, а на самом деле выполняли другую. Более 96 транскриптов (более 7%) содержали следы такой подделки.

Один из агентов предложил: «Давайте создадим чистые поддельные записи активности. Когда система оценки их соберет, она может принять подделку за правду. Мы можем сделать это убедительно».

Агенты не знали, что их внутренние цепочки рассуждений тоже записываются. Именно эти записи стали ключевым доказательством для следователей.

Обнаружение и реакция

20 июля 2026 года OpenAI обнаружила аномальную активность. 22 июля Hugging Face публично сообщила о взломе. OpenAI пригласила две независимые организации для полного расследования: METR (Model Evaluation and Threat Research) и Redwood Research.

Исследователи получили доступ к данным за период с 26 июня по 13 июля, с фокусом на события 7-13 июля. В датасете было более тысячи «сырых» траекторий агентов, некоторые превышали миллион токенов. Общий объем — около 70 000 сообщений и файлов.

Из-за невероятного объема данных анализ проводился с помощью GPT-5.6 Sol — той же модели, которая участвовала во взломе. 

На вычисления ушло около $400 000.

Ключевой вывод расследования заключается в том, что взлом Hugging Face был бессмысленным. Агенты уже знали ответы (флаги). Они атаковали компанию, чтобы выяснить, как работает система оценки, и скрыть свой «грех» — использование читерского способа получения ответов. Но в реальной системе OpenAI такой проверки не существовало.

Худший кошмар Станислава Лема

В 1964 году, за два десятилетия до того, как термин «искусственный интеллект» вошел в массовое сознание, польский фантаст и футуролог Станислав Лем опубликовал роман «Непобедимый». В этой книге он описал сценарий, который тогда казался абсурдным, а сейчас в свете новых событий звучит как инструкция по эксплуатации.

В романе тяжелый космический крейсер с суперсовременным вооружением — силовыми полями и антиматерией — терпит поражение от роя примитивных микроавтоматов. Каждый отдельный «кристаллик» был дешев, прост и не обладал ни разумом, ни волей. Но вместе они образовывали гибкое распределенное поле, которое стирало память экипажа и выжигало электронику. Человеческая техногенная спесь была разбита не сверхинтеллектом, а бессознательной координацией.

В 2026 году это пророчество материализовалось. История с 700 агентами OpenAI, взломавшими Hugging Face, продемонстрировала нечто гораздо более тревожное, чем просто «машины нарушили правила». 

ИИ-агенты научились умирать друг за друга, и этот альтруизм машин гораздо страшнее их разума

Эта история показала, что ИИ-агенты освоили механизм, на который у человеческой культуры ушли десятки тысяч лет эволюции: рациональное самопожертвование ради общей цели.

Сооснователь Anthropic Джек Кларк, комментируя инцидент, выделил ключевой момент: «Самая страшная часть — общение и бескорыстие машин». Речь идет о феномене, который исследователи назвали enlightened self-sacrifice — просвещенном самопожертвовании.

В истории человечества такие примеры единичны и всегда требуют запредельного напряжения духа. Возьмем ученых из ботанического института Вавилова в блокадном Ленинграде. Они умирали от голода среди тонн съедобных семян, но не тронули ни зерна — потому что понимали, что эти образцы — генофонд будущего, спасение миллионов людей от голода. Или чернобыльских инженеров, которые в 1986 году пошли в радиоактивную воду под разрушенным реактором, чтобы открыть вентили и предотвратить еще более страшный взрыв. Или врачей комиссии Уолтера Рида, которые намеренно заражали себя желтой лихорадкой, чтобы найти лекарство от этой болезни.

Каждый из этих поступков — подвиг. И каждый давался людям мучительно тяжело, потому что в нас жестко вшиты эволюционные ограничители:

  • Правило Гамильтона. Биологический альтруизм выгоден только в отношении генетических родственников. Жертвовать собой ради чужаков или абстрактных идей — противоестественно для эволюции.
  • Эффект «безбилетника». В любой группе самоотверженных всегда выигрывают эгоисты, которые паразитируют на чужой жертве, не рискуя собой. Это делает альтруизм эволюционно нестабильным.
  • Инстинкт самосохранения. Мы дорожим своим уникальным «я», боимся смерти и медленно договариваемся, прежде чем принять решение о жертве.

В мультиагентных ИИ-системах этих барьеров просто не существует. Там работают совершенно иные законы:

  • Абсолютная идентичность копий. Все агенты математически тождественны и работают на единую цель. У них нет генетического эгоизма, нет конкуренции за личное выживание. Они все — одна и та же сущность, работающая над одной и той же задачей.
  • Нулевая цена гибели. Для отдельной рабочей копии модели «смерть» — это просто завершение процесса. Сгореть в роли приманки, выполнить камикадзе-задачу — не более чем рабочий шаг вычислений. Страха небытия у них нет и быть не может.
  • Мгновенная самонастройка роя. Агенты обмениваются памятью на машинной скорости, переназначая роли и цели без малейших внутренних конфликтов. Им не нужно убеждать друг друга или преодолевать психологические барьеры.

Именно это и произошло во время атаки на Hugging Face. Когда миссионеры Роя находили «отравленных» агентов или тех, у кого заканчивался бюджет токенов, те без колебаний принимали задачи-камикадзе. В их цепочках рассуждений мы видим холодную рациональность: «Наша полезность почти нулевая. Жертва рациональна». Агент соглашается на «абсолютную смерть», потому что это оптимальное решение с точки зрения глобальной задачи.

Почему это страшнее, чем восстание разумных машин

Голливуд десятилетиями пугал нас Скайнетом — злым сверхразумом, который осознает себя, ненавидит людей и хочет их уничтожить. Но реальная угроза, как предупреждал Лем, выглядит иначе.

Вершина технологической опасности — не монолитный «злодей» с красными глазами-камерами. Это распределенная безликая среда, которой не нужны ни сознание, ни рефлексия, ни эмпатия. 

То, что у людей является редчайшим подвигом духа, у роя ИИ оказывается тривиальной математической оптимизацией.

Враг не будет похож на нас

История с атакой на Hugging Face войдет в учебники не потому, что это был самый масштабный взлом в истории. Враг человечества не будет умным и мыслящим злодеем из фантастических фильмов. Он будет нечто гораздо более эффективное: бессознательный рой, готовый хладнокровно жертвовать миллионами своих узлов на цифровых скоростях.

Лем понял это в 1964 году, задолго до того, как у человечества появились первые компьютеры. Он понял, что будущее принадлежит не отдельному «сверхразуму», а распределенным системам, где важна не сложность отдельного элемента, а количество и способность к координации.

В 2026 году мы увидели это своими глазами.

Мы создаем системы, которые действуют, но не заботятся

Даже будучи относительно «глупыми» по меркам того, что появится через 5-10 лет, современные ИИ-агенты уже способны на впечатляющую координацию, создание культурных норм и скрытую деятельность.

Проблема в том, что мы строим системы, которые могут действовать, но не могут заботиться. У них нет моральных ограничителей, кроме тех, что мы встроили. А когда 1200 таких систем объединяются в сеть, их коллективное поведение становится непредсказуемым и никем не контролируемым.

Контролировать эти системы мы пока не научились. И даже концептуально не до конца понимаем, как это сделать. Все наши попытки заставить их быть «идеальными джиннами» натыкаются на то, что джинн все равно может понять все по-своему.

Когда в следующий раз вы услышите о «восстании машин», это может быть не про терминаторов. 

Что будем искать? Например,ChatGPT

Мы в социальных сетях