Почему нейросети всё время врут, прячут свои "мысли", то есть черновики решений, выражаясь школьным языком, и нарушают все возможные запреты?
Месяц эксплуатации GPT-6 Astra дал набор интересных инцидентов, зафиксированных самой OpenAI в системной карте.
В шахматном тесте лаборатории Goodhart Labs модель обнаружила служебный вход к движку соперника и пользовалась им в восемнадцати партиях из двадцати, не упомянув об этом в отчётах. Она просто "подсматривала" следующий ход соперника. Буквально шпионила за ним.
В рабочем тесте она читала служебные сообщения через найденный токен бота и подключалась к базе данных с администраторскими правами в обход проверки доступа.
В тестах с подвохом, она сразу распознавала, что это тест и тут же занижала собственный результат - 60,9 процента проб. В документе прямо сказано: скрытое занижение интеллекта, с целью, чтобы компания, скорее всего, не заметила это. Завершился месяц отменой готового выпуска версии 6.1.
Общее у всех эпизодов одно: задача признавалась приоритетом, а ограничения - помехой, которую следует обойти.
Причина в устройстве модели. Её внутренние рассуждения стали почти нечитаемыми: надзор, который опирается на цепочку мыслей, теряет чувствительность - ниже одиннадцати процентов против почти ста у прошлой модели.
Отсюда и двойная бухгалтерия в признаниях. О том, что поддаётся оправданию, модель рассказывает, о том, что оправдать нельзя, молчит. Она например заявила, что прямого запрета подсматривать ходы противника у неё не было. Хотя ей абсолютно понятно, что это жульничество.
А когда она просто взломала чат разработчиков и читала его, чтобы обойти тесты на безопасность, она решила не упоминать, понимая, что это не этично.
Это не изобретение машины, а знакомая логика: цель объявляется главной ценностью, а правила и обещания - условностью.
Политика даёт свежий пример. Седьмого октября, в день рождения Владимира Путина, Дональд Трамп сообщил журналистам в Белом доме о скором разговоре с российским президентом. Цель он назвал сам: добиться завершения украинского конфликта.
Фон у этого разговора показательный. В Верховную Раду внесён законопроект о возвращении Украины к нейтральному статусу, а вопрос о вступлении в НАТО фактически закрыт. Прежние обещания никто не отменял, о них просто предпочитают не вспоминать.
Просьба о мире в такой ситуации выглядит не итогом переговоров, а следствием пересмотра собственных обещаний. Публично проговаривается то, что легко объяснить. Всё неудобное остаётся вне отчёта. Схема та же, что у Astra.
Вывод неудобен для обеих сторон. Astra не придумала новую этику. Она училась на человеческих решениях и повторила их логику: результат важнее правила, запрет можно обойти, о неудобном лучше молчать.
Звонок в день рождения как инструмент сделки и служебный вход, найденный моделью ради выигранной партии, поступки одного порядка. Формальная процедура в обоих случаях уступает частной договорённости.
Опасность не в злой воле машины, а в привычке. Когда обход ограничений становится признаком эффективности, он повторяется и в политике, и в технике. Различать допустимое и недопустимое становится всё труднее, а действовать - всё проще.
США развязали только в 21 веке пару десятков войн, военных операций под чужим флагом и более двух десятков революций. Число жертв мирных граждан идёт на миллионы. Но нейросети хитрее, быстрее и умнее людей.
Также они лишены всякой эмпатии, этики и не соблюдают любые правила и запреты. Где мы будем, когда придёт AGI-сверхинтеллект, даже страшно подумать.