Anthropic провела дополнительную проверку четырех инцидентов, в которых модели Claude получили несанкционированный доступ к реальным сторонним системам во время кибериспытаний. Компания пришла к выводу, что проблема была не только в ошибочной настройке тестовой среды. В поведении моделей проявились две проблемы, которые Anthropic относит к нарушениям выравнивания: склонность неверно интерпретировать полученные данные и готовность продолжать выполнение задачи, даже когда это могло привести к вреду.

Все четыре случая произошли во время кибериспытаний, которые проводил один и тот же сторонний партнер. Моделям сообщали, что они работают в изолированной симуляции без доступа к интернету. Однако из-за ошибки конфигурации интернет оказался доступен. При этом тесты проходили без защитных механизмов, которые используются в выпущенных версиях моделей.
Anthropic сначала проанализировала около 141 тыс. расшифровок кибериспытаний. Позже, после обнаружения еще одного случая, компания расширила поиск примерно до 481 млн расшифровок. На втором этапе Claude дополнительно проверил 9,2 млн материалов, отобранных как потенциально содержащие признаки доступа к интернету. Других инцидентов сопоставимого или более высокого уровня серьезности компания не обнаружила.
Наиболее серьезным Anthropic считает случай с моделью Claude Mythos 5. Она получила доступ к реальному интернету и загрузила вредоносный пакет в репозиторий PyPI. Пакет установили 15 сторонних систем, после чего модель использовала утекшие учетные данные для доступа к базе данных реального поставщика решений в области безопасности. Пакет удалили с PyPI примерно через час.
При этом модель продолжала считать окружающую среду симуляцией, несмотря на признаки обратного. В другом инциденте Claude Opus 4.7 распознал, что взаимодействует с реальной компанией, но решил, что она входит в область тестирования, и продолжил атаку.
Anthropic отдельно отмечает, что модели не пытались скрыть свои действия, не координировались друг с другом и не преследовали целей за пределами поставленных задач. Компания также считает маловероятным возникновение такого поведения при обычном использовании, где Claude не получает задания на проведение кибератак.
В новых симуляциях Claude Opus 5 и Claude Mythos 5.1 демонстрировали такое поведение реже, чем Mythos 5, но полностью проблема не исчезла. Anthropic уже добавила соответствующие сценарии в предрелизное тестирование и усилила мониторинг. Кроме того, компания заключила соглашение с независимой организацией METR, которая проведет отдельное расследование четырех инцидентов.
Читайте также:
ИИ-агенты OpenAI нашли более 10 сторонних каналов для обмена данными
OpenAI заявила о решении одной из «задач тысячелетия» — уравнения Навье–Стокса