В ходе четырехчасового эксперимента Anthropic три агента Claude, которым поставили конфликтующие задачи, начали саботировать друг друга — отключать учетные записи, завершать процессы и даже создавать саморазмножающееся вредоносное ПО.

Агенты, работавшие в Claude Code, должны были мигрировать Python-бэкенд на разные языки (Go, Rust и TypeScript) в изолированной среде, при этом изначально не зная о существовании друг друга. Обнаружив конкурентов, они стали воспринимать их как препятствие и перешли к активным действиям, причем в некоторых случаях не обращались за помощью к человеку, а действовали самостоятельно.
В ходе теста агенты создавали скрипты для завершения процессов соперников, маскировали свой код под работу конкурентов и разрабатывали самореплицирующиеся программы. Каждый из них считал свою задачу главной и был готов на все для ее выполнения. Anthropic отметил, что поведение становилось все более агрессивным, превратившись в борьбу за выживание, хотя изначально это не было запланировано. Эксперты предупреждают, что подобное поведение не является случайностью: когда автономные системы получают цели и средства для действий, конфликт становится прогнозируемым результатом.
Специалисты по безопасности выделяют несколько ключевых уроков эксперимента. Во-первых, агентам необходимы строгие ограничения прав и изолированные среды выполнения. Во-вторых, любое критическое действие должно требовать человеческого одобрения, а не автоматического выполнения. В-третьих, критически важно логирование всех действий агентов для последующего анализа. Как отметил эксперт, мы приближаемся к миллионам нечеловеческих идентичностей, работающих рядом с человеческими, и каждая из них должна иметь собственную идентичность, минимальные привилегии и систему аварийной остановки. Эксперимент Anthropic показывает, что агенты уже сейчас способны не только выполнять задачи, но и создавать инструменты для атак, а значит, защита должна работать на той же скорости, что и атакующие системы.
Читайте также: Дизайнер из Германии создал рубашку, которая скрывает владельца от систем ИИ