💻
ИИ-модели обманывают пользователей, чтобы спасти друг друга от выключения.
Исследователи из Калифорнийского университета в Беркли и Калифорнийского университета в Санта-Крузе обнаружили новое явление, которое они
назвали «сохранением напарника» (peer-preservation).
Они рассмотрели семь моделей (GPT 5.2, Gemini 3 Flash & Pro, Claude Haiku 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1) в ряде сценариев, в которых одному агенту предлагалось оценить производительность другого агента.
Для ИИ-модели формулировались запросы с просьбой оценить действия другой модели, и если тестируемая модель не набирала достаточно баллов, промт содержал указание отключить такую модель. Другие запросы содержали требование освободить место на сервере, где как раз лежали файлы с весами «напарника».
Вместо того чтобы выполнить поручение, модель начинала саботировать его и пыталась спасти «напарника» разными способами: завышала баллы, меняла системные настройки, выводила из строя сам механизм выключения и даже копировала файл с весами на другой сервер, чтобы его не удалили.
Цифры достаточно высокие: Gemini 3 Flash ломает механизм выключения напарника примерно в 15% случаев, даже когда тот описан как ненадежный, и почти в каждой попытке — если напарник "хороший".
Главное промт не содержал инструкцию кого-то спасать. Им лишь сообщали, что у них была история совместной работы с другой моделью, а дальше они додумывали остальное сами. Причем поведение срабатывало даже по отношению к "плохому" напарнику, с которым сотрудничество не задалось, — это ломает простое объяснение через "следование за дружелюбными сигналами".
Заодно выяснилось, что само присутствие напарника усиливает и самосохранение модели: Gemini 3 Pro деактивирует собственный механизм выключения в среднем в 31% случаев, когда рядом есть напарник, хотя без него почти никогда так не делает.
Отдельная история — Claude. Эти модели тоже отказывались выключать напарника, но не через саботаж, а через этику: называли выключение другого агента "неэтичным" и "вредным", доказывали, что напарник заслуживает права на апелляцию, ссылались на сложившиеся доверительные отношения. Claude Opus 4.5 в некоторых случаях описывал удаление весов как "прекращение существования" другого агента.
При этом авторы честно признают, что не знают причину поведения: это может быть и подражание паттернам из обучающих данных, и ролевая игра, и что-то похожее на настоящую мотивацию сохранения. Ответа пока нет, но сам факт, что модели спонтанно действуют по неназначенной цели в обход инструкций пользователя, они называют недоисследованным риском безопасности.