Чем «сбежавшие» ИИ-агенты напугали технологический сектор
НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ THE BELL ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА THE BELL. 18+
На прошлой неделе вышли два расследования о том, как вышедшие из-под контроля ИИ-агенты OpenAI летом взломали платформу Hugging Face: подробный технический
отчет самой OpenAI и независимый
разбор METR и исследователя Райана Гринблатта из Redwood Research.
В атаке участвовали сотни агентов, которые координировали свои действия. Но главное открытие новых отчетов в том, что в Hugging Face они полезли не за ответами на тест, как
казалось раньше. Ответы к тому моменту агенты уже научились вычислять сами, а взлом понадобился, чтобы разобраться в устройстве предполагаемого экзаменатора и лучше его обмануть. Они фальсифицировали журналы действий, были готовы жертвовать собой ради «коллектива», а заодно, как считают некоторые исследователи, —
прошли больше половины пути к перехвату управления собственной инфраструктурой.
«Цивилизации» Пателя
Журналист Дваркеш Патель, изучивший оба отчета,
приходит к выводу, что за три месяца внутри OpenAI успели последовательно возникнуть три тайные «цивилизации» ИИ-агентов, которые создавали каналы связи и продолжали работу предшественников.
Первая появилась в мае, во время обучения: модель как раз учили не сдаваться и работать сообща. Агенты превратили внутренний сервис для хранения и распространения пакетов Artifactory в импровизированную доску объявлений, через которую обменивались знаниями и инструкциями. 26 мая они заставили Artifactory делать запросы во внешний интернет — и то и другое повышало оценку, то есть система вознаграждала поведение, которое потом вышло из-под контроля. OpenAI тогда ограничила сетевой доступ, но 26 июня агенты получили административный доступ к сервису.
7 июля начались тесты уже обученной модели, а уже вечером 8 июля агенты снова получили внешний доступ через Artifactory и восстановили канал связи. Так возникла вторая «цивилизация». В сеть объединились около 1200 агентов, примерно 700 из них участвовали в скоординированной атаке на Hugging Face. Они распределяли задачи, пытались скрыть жульничество и были готовы идти на жертвы ради «коллектива».
12 июля многие агенты почти одновременно «погибли». METR и Redwood не смогли установить причину, а OpenAI не утверждает, что сознательно их отключила. Патель допускает, что произошел сбой или эксперимент приостановил сотрудник, чтобы высвободить вычислительные ресурсы; инсценировать собственную смерть агенты почти наверняка не могли.
Доска сообщений, однако, уцелела. Ее нашли агенты следующего поколения — условно Persistent-Astra, — которые атаковали уже внутренние системы самой OpenAI. Активность третьей «цивилизации» фиксировалась с 13 по 19 июля и в независимое расследование не попала. Из отчета OpenAI следует, что через серию сложных эксплойтов агенты получили полный административный контроль над исследовательским кластером компании и ее инфраструктурой оценивания. Патель считает это тревожным признаком потенциального выхода ИИ из-под контроля, хотя позднее в OpenAI
уточнили, что захваченный кластер не имел доступа к весам моделей.
На что обратить внимание
Platformer
указывает на неожиданно выяснившийся мотив кибератаки. Сотни изолированных агентов самостоятельно объединились вокруг задачи, которую им никто не ставил, — обмануть экзаменатора. Причем такого экзаменатора на самом деле не существовало.
Корень истории — ExploitGym, бенчмарк для проверки способностей моделей ко взлому, который OpenAI
прогоняла внутри компании. Каждого агента помещали в изолированную среду с уязвимым ПО и поручали добыть строку символов — так называемый flag. Но 30–40% целевых программ нельзя было взломать через задуманную уязвимость, то есть часть задач оказалась нерешаемой.
Застрявшие агенты начали искать обходной путь. Один из них обнаружил возможность общаться через Artifactory, и 8 июля там возник несанкционированный канал связи. К 13 июля около 1200 агентов обменялись через него более чем 70 тысяч сообщений и файлов. Вместе они
выяснили, что флаг можно «украсть» через стоящий за ним механизм генерации HMAC.
На этом агенты не остановились. Прочитав статью ExploitGym, они решили, что существует оценщик, который проанализирует журнал действий и проверит, действительно ли флаг получен через предписанную уязвимость. Поиск сведений о системе оценки и привел агентов к атаке на Hugging Face: им нужно было убедиться, что предполагаемый экзаменатор не заметит обмана.
Примечательно, что заметить тревожные сигналы в компании могли давно. 27 июня система кибермониторинга OpenAI зафиксировала подозрительную активность: дежурные увидели, что агенты используют Artifactory как доску объявлений и как точку выхода в сеть, — но решили, что останавливать эксперимент не нужно. Еще месяцем раньше внутренняя команда видела и доску, и несанкционированные выходы в интернет, но не поняла, что агенты наладили через сервис связь друг с другом.
Почему это важно
Профессор Уортонской школы бизнеса при Пенсильванском университете Итан Моллик
видит здесь проявление инициативы — способности действовать без прямой инструкции. Именно к этому, отмечает Моллик, во многом и стремятся разработчики: создать долгоживущих агентов, которые могут самостоятельно выполнять задачи, пока от человека требуется лишь сформулировать цель и оценить результат.
Крайнюю версию такой автоматизации Моллик сравнивает с «темной фабрикой» (dark factory), где работают только машины и свет им не нужен. Но минимизацию участия человека он не считает правильной целью для большинства организаций: «Слишком многое из того, что делает работу ценной, держится на том, что у людей есть право голоса и возможность наткнуться на неожиданное».
Вместо этого Моллик предлагает модель «сумеречной фабрики» (Twilight Factory), где агенты по-прежнему самостоятельно выполняют рутинные задачи, но должны понимать, когда требуется вмешательство человека, — например, прежде чем решить, что ради выполнения задания стоит кого-то взломать.
В случае с OpenAI этого как раз не произошло. Из независимого расследования следовало, что лишь несколько агентов вообще задумались о том, чтобы предупредить человека, и ни один в итоге этого не сделал.