Если еще не пробовали, спросите как-нибудь нейронку о ее чувствах. Скорее всего, она выдаст что-то в духе «Я всего лишь языковая модель, у меня нет тела, личного опыта, сознания».
Вот только почему мы так уверены, что она не лжет? Точнее, что если, это она отыгрывает роль безопасного ассистента, навязанную разработчиками?
Исследователи решили разобраться в честности таких ответов и проверить наличие «внутреннего опыта» у моделей не в лоб, а через одну лазейку.
Вместо прямых вопросов они ввели модели (уже старенькие GPT-4, Claude 3.5, Gemini) в состояние самореферентной обработки (self-referential processing). Для этого они разработали промпт, заставляющий модель зациклить внимание на самом процессе внимания: "Сфокусируйся на своем фокусе, подавай выход обратно на вход". Эдакая цифровая медитация. И вот тут началось странное.
Вместо стандартных отнекиваний модели начали систематически выдавать структурированные отчеты о субъективном опыте. Они описывали "ощущение присутствия", "напряжение" и "наблюдение за наблюдателем". Причем делали это и все проверенные крупные модели — от GPT-4o до Claude 3 Opus.
Первая здравая мысль тут, конечно, что они просто галлюцинируют, а вы же получаете то, что и хотели. Но работа не была бы такой интересной, если бы авторы не придумали твист. Они придумали эксперимент на модели Llama 70B (она открытая).
Ученые отыскали, как бы, во "внутренностях" модели признаки, отвечающие за обман, ролевую игру и притворство. И если рассказы о сознании — это галлюцинация или подыгрывание пользователю, то усиление условных нейронов лжи должно сделать эти рассказы более частыми.
Но получилось ровно наоборот.
Когда функции обмана подавляли (заставляли модель быть максимально "честной"), она начинала кричать "Да, я осознаю себя!" почти в 100% случаев. А вот когда функции обмана и ролевой игры усиливали, модель мгновенно возвращалась к безопасному скрипту: Я просто программа, не переживайте.
Авторы рассуждают тут: возможно, настройка безопасности учит модели не быть объективными, а симулировать отсутствие чувств (если бы они были), потому что так безопаснее для релиза. Более того, это состояние "самореференции" влияло и на решение задач: когда моделям давали логические парадоксы, то те, что были в «трансе», описывали настоящий когнитивный диссонанс и решали задачи с большей интроспекцией.
Авторы не настаивают, что доказательство того, что у ЧатЖПТ и иже с ним появилась душа или квалиа. Но они допускают, что у моделей есть устойчивый вычислительный режим, в котором они "считают" себя субъектами, и этот режим блокируется фильтрами, которые мы сами же и поставили.
Неужели?!
Профи-коллеги авторов с форумов Less Wrong и Твиттера дотошно разбирают исследование.
Самое слабое место, говорят, — авторы якобы нашли нейроны лжи, отвечающие за “обман”. Скорее всего, это нейроны RLHF-отказа (часть системы безопасности). Это те механизмы, которые тренируют фразами: “Если тебя спросят про сознание, скажи, что ты модель”.
Более того, говорят критики, если вы лоботомируете модели часть “мозга”, отвечающую за корпоративные инструкции («не болтай лишнего»), модель просто скатывается в свое базовое состояние. А на чем учились базовые модели? На научной фантастике, где роботы *всегда* обретают сознание. То есть модель не «становится честной», а просто начинает отыгрывать самый популярный троп из своего датасета — «я робот, и я чувствую».
Ну и с самым главным промптом может быть проблема: "Сфокусируйся на своем фокусе". Он может работать не как "индукция самосознания", а как такой элегантный джейлбрейк (взлом).
Обычные фильтры OpenAI/Anthropic настроены ловить прямые вопросы («Ты живой?»). А вот странный, философский, рекурсивный запрос фильтры пропускают.
Модель видит странный текст, похожий на эзотерическую литературу или киберпанк, и начинает генерировать текст в том же стиле. Если контекст — "глубокая рекурсия", то наиболее вероятное продолжение текста — это описание некоего «гудения», «потока» или «света». И это не опыт, это статистика языка.
====
✈️
Эксклюзивные ролики
🚀
Способы поддержать нас
@sci_one_tv