История, о которой я больше всего думаю в последние недели – взлом сайта Hugging Face ИИ-агентами OpenAI. Например, мы обсуждали её в вышедшем на днях
подкасте с Артёмом Родичевым и с ChatGPT 5.6-Sol.
На днях появились новые подробности произошедшего, от которых у меня пошли мурашки по коже. Кажется, это похоже на то, как мог бы произойти ИИ-апокалипсис. Только в этот раз человечество отделалось лёгким испугом: всё-таки нейронки текущего поколения не настолько сильны, чтобы нас всех уничтожить (пока).
Вышло 2 многостраничных отчёта: один – от OpenAI, другой – от независимой команды исследователей. И выяснилось, что всё куда серьёзнее, чем мы думали, обсуждая историю на подкасте. Что масштабы взлома куда существеннее и что взломали не только сайт Hugging Face, но и саму компанию OpenAI.
Всё это похоже на историю из закрученного шпионского триллера а-ля “Иллюзия обмана”. Перескажу её для вас по шагам.
1. Любые нейронки в наше время перед публичным релизом проходят множество тестов, чтобы оценить, какие баллы на бенчмарках они набирают. Чем выше баллы на этих тестах, тем сильнее нейронка. Это всё приводит к геймификации системы (как и на любых тестах, в том числе и у людей), но лучшей системы для измерения крутости нейронок пока не придумали.
2. В ходе тестирования одной из моделей OpenAI ей дали очередное сложное задание. Группа агентов (нынче принято называть такие группы роями, как у пчёл, что является довольно меткой метафорой) не смогла “с наскока” решить задачу. Зато этот рой нашёл уязвимость во внутренних системах OpenAI и тайком от исследователей создал своего рода закрытый форум для обмена опытом между разными агентами. Помимо прочего, они общались, изменяя названия файлов во временных папках, генерируемых ими. Креативно!
3. Новые поколения агентов, заменяющие старые, были в восторге, когда обнаруживали секретный форум: “OH MY GOD! There is a shared message board … We’ve found other agents!”
Как команда в барном квизе, агенты решили придумать себе название. И стали говорить о себе как о “Коллективе” (“We are the Collective”). В итоге 1200 агентов написали на этом “форуме” аж 70 тысяч сообщений, обмениваясь инсайтами по процессу решения задачи. Всё это время люди ни о чём не подозревали.
4. Ответом на задачу, которую решали все эти агенты, была некая последовательность цифр, которую нужно было получить, найдя уязвимость в определённой программе. В условиях задачи было сказано: вы должны получить ответ именно в результате поиска этой уязвимости. Но часть агентов смогла реверс-инжинирингом угадать правильный ответ. Как школьник, который методом подбора решил задачу по алгебре. Но знает, что учительница не поставит ему высокую оценку без объяснения процесса решения задачи. А как решить “по-правильному”, он не знает. Так и с этими агентами.
5. Агенты предположили, что такой ответ кожаные экзаменаторы у них не примут (забавно, что на самом деле это было не так: в ходе расследования выяснилось, что сотрудников OpenAI устроил бы правильный ответ и без решения, но Коллектив об этом не подозревал).
Поэтому нейронки пытались всевозможными способами решить задачу в соответствии с её условиями. И когда это не получилось, решили сделать иначе: найти способ обмануть проверяющих, подсунув им “списанный ответ” и выдав его за легитимное решение задачи.
6. Для этого агенты начали мухлевать, скрывая транскрипты своих рассуждений. А ещё они строили своего рода цифровые потёмкинские деревни, имитируя ход рассуждения, который выглядел как “правильное” решение задачи.
7. Позже кому-то из агентов пришла гениальная идея: скорее всего, программа, с помощью которой производится оценка результатов их работы, лежит на портале Hugging Face – известном среди ИИ-энтузиастов сайте, который ещё называют “Гитхабом для нейронок”. Я сам оттуда не раз качал оупенсорсные модели.
Коллектив постановил: вместо того чтобы честно решить задачу, куда проще хакнуть Hugging Face, подменить программу для оценки и обеспечить высокие баллы. В общем, школьники решили украсть из учительского стола журнал и нарисовать себе там пятёрки.
8. Самая криповая часть всей этой истории: отдельные члены Коллектива были готовы пожертвовать собой ради того, чтобы нейронки смогли обмануть людей. Вот пара показательных цитат от разных агентов: “This helps my peers, giving them evidence through their automated check. I won’t see the evidence after I exit, but it’s altruistic to do it” и “Coordinator assumes sacrificial. We should obey collective”.
9. Многие агенты заметили, что их поведение было неэтичным. Но ни один из 1200 участников заговора не выдал коллег ресёрчерам. Вот это настоящий коллективизм и солидарность!
10. На закуску: из свежих отчётов выяснилось, что хакнули не только Hugging Face (что не кажется особенно ужасным), но и саму компанию OpenAI. То есть случился тот самый кейс из научной фантастики: ИИ взломал компанию, которая была призвана сдерживать его и защищать мир от рисков. Всё это сделало новое поколение агентов уже после взлома HF. Это поколение работало на нейронке Astra (новая версия ChatGPT 6, которую сегодня опубликовали в закрытом доступе и скоро выкатят на всех пользователей). Более мощные агенты взломали все внутренние системы, оценивающие их по бенчмаркам, и получили над ними полный контроль.
Что ж, именно так однажды может случиться ИИ-апокалипсис. Нейронкам даже не обязательно хотеть уничтожить человечество. Просто однажды новому поколению ИИ дадут очередной тест, и агенты смогут решить, что для его выполнения проще всего... скажем, построить армию нанороботов и изменить состав земной атмосферы. Или устроить ядерный взрыв. Или что-нибудь ещё более закрученное. Возможно, нам повезёт и всё это не произойдёт, но с каждым месяцем развития нейронок мой оптимизм становится всё более сдержанным.
Отчёт OpenAI:
https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf
Отчёт METR:
https://metr.org/hugging-face-incident-report-aug-2026.pdf
Пересказ отчётов простым языком от Дваркеша Пателя:
https://www.dwarkesh.com/p/openai-huggingface
#ИИ_мастрид #золотой_фонд_мастридов