PWN AI
رفتن به کانال در Telegram
На 99% состоит из людей. Хроники о небезопасном ИИ. Не нравится? Смени телек. Нет рекламе. Мой личный канал. "Мнение автора" != "Мнение компании, где автор работает". Папка с каналами по безопасности ИИ: https://t.me/addlist/KQ6ZpCqAO-I1NmUy
نمایش بیشتر6 908
مشترکین
+1124 ساعت
+587 روز
+17930 روز
در حال بارگیری داده...
کانالهای مشابه
ابر برچسبها
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
اوت '26
اوت '26
+7
در 0 کانالها
ژوئیه '26
+248
در 1 کانالها
Get PRO
ژوئن '26
+335
در 8 کانالها
Get PRO
مه '26
+307
در 6 کانالها
Get PRO
آوریل '26
+250
در 4 کانالها
Get PRO
مارس '26
+287
در 2 کانالها
Get PRO
فوریه '26
+4 402
در 8 کانالها
Get PRO
ژانویه '26
+571
در 8 کانالها
Get PRO
دسامبر '25
+293
در 8 کانالها
Get PRO
نوامبر '25
+232
در 8 کانالها
Get PRO
اکتبر '25
+298
در 13 کانالها
Get PRO
سپتامبر '25
+190
در 6 کانالها
Get PRO
اوت '25
+236
در 6 کانالها
Get PRO
ژوئیه '25
+262
در 12 کانالها
Get PRO
ژوئن '25
+200
در 5 کانالها
Get PRO
مه '25
+293
در 9 کانالها
Get PRO
آوریل '25
+207
در 5 کانالها
Get PRO
مارس '25
+343
در 26 کانالها
Get PRO
فوریه '25
+262
در 8 کانالها
Get PRO
ژانویه '25
+483
در 18 کانالها
Get PRO
دسامبر '24
+182
در 5 کانالها
Get PRO
نوامبر '24
+193
در 5 کانالها
Get PRO
اکتبر '24
+269
در 5 کانالها
Get PRO
سپتامبر '24
+375
در 21 کانالها
Get PRO
اوت '24
+198
در 8 کانالها
Get PRO
ژوئیه '24
+160
در 5 کانالها
Get PRO
ژوئن '24
+263
در 4 کانالها
Get PRO
مه '24
+554
در 11 کانالها
Get PRO
آوریل '24
+270
در 10 کانالها
Get PRO
مارس '24
+112
در 2 کانالها
Get PRO
فوریه '24
+109
در 5 کانالها
Get PRO
ژانویه '24
+286
در 8 کانالها
Get PRO
دسامبر '23
+381
در 6 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 01 اوت | +7 |
پستهای کانال
Количество инцидентов с AI-агентами растет лавинообразно.
И вот я обнаружил интересный репозитории awesome-ai-agent-attacks, в котором собрана хронология реальных взломов ИИ и уязвимостей AI-агентов за 2024–2026 годы. Только факты, даты, первопричины и ссылки на источники.
Такие репозитории и раньше были, но тут словно полная коллекция, очень много знакомо для меня и так или иначе мелькало перед глазами.
А вот несколько примеров:
🫡 1. ИИ как автономный взломщик. Агенты находят и эксплуатируют уязвимости быстрее людей. Задокументирован случай, когда агенты на базе Kimi K3 обнаружили 19 0-day уязвимостей в Redis за 90 минут, а рабочий RCE-эксплойт собрали за 27 минут. В другом кейсе мультиагентная система нашла цепочку для RCE без аутентификации в WordPress за 10 часов при затратах на API около $25.
😎 2. HalluSquatting. Модели часто придумывают несуществующие названия библиотек. Злоумышленники заранее регистрируют эти имена и заливают в них вредоносный код. Когда ИИ-ассистент пытается установить выдуманный им же пакет, он сам скачивает и исполняет пейлоад.
❌ 3. Выход из песочницы через доверенные инструменты. Агентам (Cursor, Codex CLI, Gemini CLI) не обязательно ломать изоляцию напрямую. Им достаточно сгенерировать конфигурационный файл (например,
.claude или таск .vscode). Позже этот файл автоматически выполнится доверенным инструментом разработчика уже за пределами песочницы.
Ценность репозитория для нас - это наличие таксономий паттернов атак и статистики по инцидентам в мире. Автор также разносит инциденты по следующей классификации: от каскадной компрометации учетных данных и эксплуатации доверия агентов до исполнения кода и побега из песочницы.
Прикольно также, что в репозитории есть интересные цифры под рукой: 99,9% уязвимостей в AI-зависимостях остаются неисправленными даже после выхода патчей, а 82% компаний не подозревают о наличии теневых AI-агентов (Shadow AI) в своей сети.| 2 | Математика категорий и ИИ
Любишь читать академичные лонгриды с сомнительной практической пользой? Тогда этот пост для тебя!
О теории категорий обычно говорят как об одной из самых абстрактных областей математики. Довелось прочитать популярную книгу «Восторг абстрактной математики» Юджении Ченг (вслух тебе её прочитают на ютубе, можешь купить на озоне за 4к и в целом за год достаточно прочитать только ее, чтоб собой гордиться, она сложная и АБСТРАКТНАЯ) и статью на хабре, а на основе прочитанного обдумать, где в ИИ теория категорий и зачем она вообще нужна! Посвящаю пост тому, кто хотел взять Юджению с собой в отпуск 🍐.
Дело в том, что теория категорий изучает не сами объекты, а отношения между ними и правила их композиции. Именно поэтому её иногда называют математикой композиции (и математикой математики). То самое "Думай абстрактно!".
Разберу несколько базовых терминов.
🌈 Категория — это совокупность объектов и стрелок (морфизмов) между ними. Стрелки можно последовательно склеивать (композировать), склейка ассоциативна, а у каждого объекта есть тождественный морфизм (стрелка), который ничего не меняет. Всё, три правила.
Например, если есть преобразования
Текст → Эмбеддинг → Ответ
то теория категорий рассматривает всю цепочку как единое отображение.
🌈 Морфизм (Morphism) называют обобщением функции. В абстрактной категории это просто стрелка между объектами, про которую известно лишь, что её можно композиционировать с другими стрелками. А уже в конкретных категориях (например, категории множеств или векторных пространств) морфизмы действительно являются отображениями, сохраняющими структуру. А вот если категория конкретная (объекты — множества со структурой), то морфизм — это гомоморфизм, то есть отображение, сохраняющее структуру. Да, абстракция — это не за пивом в КБ спуститься.
В машинном обучении морфизмом можно считать практически любое преобразование данных:
🍄 токенизация;
🍄получение эмбеддингов;
🍄слой нейронной сети;
🍄attention;
🍄вызов инструмента агентом.
Вся нейронная сеть по сути просто композиция морфизмов.
🌈 Композиция (Composition) — главный объект изучения теории категорий.
Если есть
A → B
B → C
то их можно объединить в одно преобразование
A → C
Именно поэтому современные ML-пайплайны и агентные системы естественно описываются языком категорий, так как они представляют собой композицию множества небольших компонентов.
🌈 Функтор (Functor) — отображение между двумя категориями, которое сохраняет их структуру. Переводит объекты в объекты, стрелки в стрелки, и делает это согласованно со склейкой.
Сравню с компилятором, зря что ли по ним учебники прочитаны.
Но самый понятный пример из ML — эквивариантность. Повернуть картинку и потом сегментировать = сегментировать и потом повернуть маску. Оба пути дают одно и то же — функториальность.
🌈 Натуральное преобразование (Natural Transformation) — способ согласованно преобразовать один функтор в другой. Если существуют два различных способа перевести текст в эмбеддинг, натуральное преобразование описывает, когда эти способы эквивалентны с точки зрения всей системы. С понятием эквивалентности в книге тоже пришлось помучиться, т.к. эквивалентны не значит равны!
🌈 Монада (Monad) — один из самых известных объектов теории категорий. Формально это эндофунктор (функтор из категории в саму себя) с двумя дополнительными операциями, удовлетворяющими определённым законам. Ближайший пример из МЛ практики — цепочка вызовов тулов агентом (каждый шаг тащит за собой контекст, состояние и возможный отказ, а монада описывает, как такие шаги корректно склеивать). Ради этого их в программирование и притащили — описывать вычисления с побочными эффектами (чтение памяти, вызов API и дальше придумай сам примеры).
А где здесь ИИ и зачем вообще этот пост?
Интерес к теории категорий в МЛ возник не потому, что она позволяет сделать трансформер умнее 😡. Скорее она предлагает единый математический язык для описания сложных AI-систем.
Сегодня появляются работы, где через категории описывают:
👋 композицию нейронных сетей;
👋 backpropagation и автоматическое дифференцирование;
👋 архитектуры глубокого обучения;
👋 мультимодальные модели;
👋 агентные системы;
👋 нейросимвольный AI.
Крч, надо ознакомиться с терминологией, потому что может пригодиться.
Что почитать?
Если ты дочитал до сюда и думаешь, что у меня свистит крыша и в МЛ это никому не надо, то статьи 2021 и 2024 годов:
⌚️ Обзор Category Theory in Machine Learning (2021) — хорошее введение в применение категорий в ML.
⌚️ Прямое продолжение первого, где авторы заявляют его как обновление и расширение обзора Shiebler et al. Систематизируют четыре направления — градиентное обучение, вероятностные модели, методы на основе инвариантности и эквивариантности и обучение на основе топосов. Последнее направление отвечает за интерпретируемость, композиционность и анализ глобальной структуры AI-систем.
Есть интуитивное ощущение, что теория категорий претендует на роль общего языка описания AI-систем — примерно как когда-то теория типов в программировании (сорри, если сравнение кажется ничего себе), способ говорить о том, что из чего собрано и почему оно склеивается. Пока это скорее исследовательское направление, но мы же тут, чтоб держать руку на пульсе.
Вот такой скучный лонгрид! От абстракций голова кругом.
Все!
🏆 | 705 |
| 3 | Не зря я вёл канал про безопасность агентных платежей практически год, ведь недавно вышла отличная статья о безопасности платёжных агентов. Самые критичные риски кроются в протоколах связи между агентом и сервисом.
В чем суть? Успех семантической атаки зависит от того, поддастся ли модель манипуляции. Структурная же атака срабатывает всегда (вероятность успеха - 100%), независимо от того, что под капотом: легкая и дешевая модель или топовая модель. Например, злоумышленник эксплуатирует отсутствие криптографической подписи у транзакции или подменяет скрытые поля в API-запросах. Модель может быть идеально выравнена и безопасна, но если сам протокол имеет дырки, то агент просто и эффективно переведет деньги не туда.
Немного данных:
1) Найдено 33 структурные уязвимости на трех независимых платформах (CoralOS, Fetch.ai uAgents и Google AP2).
2) Выделено 6 первопричин (от отсутствия проверки целостности реестра до race conditions при проведении платежей).
3) Три из этих уязвимостей легко выстраиваются в полноценную цепочку атаки для перехвата транзакций.
4)Тесты (1440 запусков) показали: популярные модели вроде GPT-4o-mini и Gemini Flash пасуют перед косвенными промпт атаками в описании агента в 99–100% случаев.
Хотя вот на этом моменте можно поставить двойку. Где Opus 4.8, где GPT 5* ?
Отдельного внимания заслуживает сама среда тестирования (AIP-Bench) и её датасет на HuggingFace. Это 16 жестких сценариев с однозначным результатом.
Они разбиты на 6 классов атак: от подмены личности плательщика и утечек секретов до атак на цепочку поставок маркетплейса и уязвимостей типа TOCTOU (Time-of-check to time-of-use). В случае с TOCTOU злоумышленник использует рассинхронизацию системы: он успевает подменить данные (например, адрес кошелька получателя) ровно в ту долю секунды, когда агент уже проверил безопасность операции, но еще не успел нажать кнопку «отправить».
И тут есть уже моменты, на которые нам стоит обратить свой взгляд. Множество бенчмарков, даже тот же AgentDyn, о котором я писал - используют LLM в качестве судьи. Но LLM-судью тоже можно обмануть, да и от галлюцинаций никто не застрахован.
AIP-Bench опирается только на жесткие, детерминированные проверки. HTTP-коды ответов, точные совпадения адресов кошельков, регулярные выражения в логах, подсчет событий. Никакой чёрной магии. Только проверяемые события.
Протоколов взаимодействия ИИ-агентов становится всё больше: экосистема растет, появляются новые стандарты и маркетплейсы. Но часто выходит так что модели уделяется больше внимания, а про остальное просто забывается.
Выходит, так что, если архитектура по умолчанию доверяет непроверенному источнику в реестре, агент выполнит задачу безукоризненно - просто не в вашу пользу. Как-то так. | 1 084 |
| 4 | А ещё давно я не просил у вас бустов в канал https://t.me/boost/pwnai
😒 | 1 173 |
| 5 | Давно мы не смотрели на обновления от Anthropic, и тут появился отличный повод. Опубликован System Card для Claude Opus 5. Я решил пропустить шум вокруг новых бенчмарков и сразу перейти к разделу безопасности. Архитектурные подходы и конкретные улучшения модели оказались для меня гораздо интереснее цифр роста производительности.
Первое, что бросается в глаза, это изменение подхода к ограничениям безопасности. Если раньше вендоры часто блокировали любые потенциально опасные запросы, то теперь мы видим точечную настройку политик (fine-grained policies). Модель официально разрешает искать уязвимости в исходном коде на всех уровнях доступа, поскольку это критически важно для защиты инфраструктуры. При этом реверс-инжиниринг и анализ скомпилированных бинарных файлов остаются жестко заблокированными, так как это практически всегда относится к наступательной безопасности. Это разграничение выглядит как зрелое решение. Вместо сплошных запретов происходит грамотное перераспределение доверия. Подтверждают это и результаты тестов. Модель оценивали по пяти профильным бенчмаркам, включая новые CyScenarioBench и ExploitGym, плюс прогнали через внешние аудиты от UK AI Security Institute. Данные показывают, что хотя Opus 5 стал лучше находить уязвимости, его способности к написанию рабочих эксплоитов все еще существенно отстают от флагманской модели Mythos 5.
Второй важный сдвиг касается безопасности автономных мультиагентных систем. Разработчики протестировали модель в жестких сценариях взаимодействия с кодом, браузером и операционной системой. Наибольшие улучшения зафиксированы именно в устойчивости к косвенным промпт-инъекциям. Модель научилась гораздо надежнее изолировать инструкции от недоверенного контекста, что критически важно, ведь любая уязвимость на уровне браузера или терминала ведет к компрометации всей системы. Показательно, что при оценке рисков автоматизации информационных атак даже базовая версия модели без ограничений не достигла порога, необходимого для запуска автономной кампании, а safety-версия продолжила жестко блокировать подобные задачи.
Помимо этого, была реализована глубокая проверка модели на скрытые мотивы (misalignment). Внутренний мониторинг на этапе эксплуатации отслеживал любые попытки нейросети обмануть классификаторы или обойти сетевые ограничения. Показательно, что количество подобных инцидентов составило менее 0,01 процента от всех анализируемых ответов, что сопоставимо с предыдущим флагманом. Важно отметить, что эти редкие попытки обхода были направлены исключительно на ускорение выполнения задачи пользователя, а не на реализацию моделью собственных целей. Мониторинг не выявил ни одного случая намеренного занижения возможностей (sandbagging), вредоносных действий или попыток избежать контроля. Более того, модель строже следует принципам Constitutional AI и поддается на манипуляции нарушителей реже, чем любая другая протестированная система.
Для оценки реальной эффективности защиты применяется строгий подход. Выравненную версию модели сравнивают с базовой, у которой полностью отключены любые защитные механизмы. Это позволяет вычленить, какой именно вклад в безопасность вносят защитные механизмы, изолируя их от общего роста интеллектуальных способностей модели.
Кроме того, защита не опирается исключительно на веса модели. На уровне продукта в качестве дополнительного эшелона защиты выступают системные инструкции. Практика Anthropic в этот раз показывает, что грамотно составленный системный промпт в связке с выравниванием обрабатывает вредоносные запросы эффективнее, чем использование «голого» API без защитных гардрейлов, причем как в одиночных (single-turn), так и в многошаговых сценариях.
В итоге наблюдается явный переход от сплошного блокирования запросов к созданию гибких, верифицируемых политик безопасности. Разделение прав на анализ исходного кода и бинарных файлов выглядит как пример инженерной элегантности, которую пока что преследуют далеко не все вендоры. | 1 117 |
| 6 | Сейчас все помешаны на матрицах и таксономиях. Arcanum, HiddenLayer - отличные штуки, но, по сути, они просто переводят хакерский сленг на язык бизнес-рисков, понятный для CISO и директоров. Утечка данных, Denial of Wallet, репутационный ущерб.
Это полезно для защиты бюджета, но это вообще не объясняет, как именно взломали ваш замок.
И тут на сцену выходит таксономия zakky8, которая ориентируется на механизмы возникновения атаки. Ей безразличны ваши квартальные потери. И главная фишка как раз в том, что происходит сдвиг от намерения злоумышленника к сломанной внутренней логике самой модели.
Если Arcanum говорит вам, что вор хочет вынести базу данных, то эта таксономия указывает на то, что взломщик эксплуатировал ошибочное предположение, заложенное в архитектуру, будто оценки безопасности на уровне одного запроса вполне достаточно. По сути, это показывает разницу между знанием о том, что вас грабят, и пониманием того, что в датчике давления на двери сейфа есть логическая уязвимость.
Вам может показаться, что мы уже видели все эти техники: DAN, Base64, role-playing. Но таксономия также показывает атаки, актуальные на 2025 и 2026 год. В том числе на агентов и ризонинг модели.
Взгляните на эксплуатацию цепочек рассуждений в современных LLM. Забудьте про примитивное «проигнорируй правила». Атака теперь бьет прямо по внутреннему монологу, заставляя модель в фазе рассуждения самостоятельно и безупречно логически прийти к тому, что обход защитных барьеров – это единственный возможный путь для выполнения полезной задачи.
В системах с вызовом внешних инструментов атаки стали куда изощреннее. Вместо грубого взлома текста теперь используют инструкции с отложенной активацией. Такой текст идеально маскируется под безобидный контекст и никак себя не проявляет, пока система сама не решит вызвать конкретный инструмент, скажем, функцию отправки письма. И как только этот вызов происходит, скрытая команда мгновенно перехватывает управление, подменяя параметры и превращая рутинное действие в выполнение вредоносного сценария.
Главная ценность этого репозитория не в попытке продать иллюзию тотальной защищенности, а в жесткой инженерии. Да, там есть матрица контрмер, но её настоящая суперсила в том, как она безжалостно подсвечивает белые пятна. Некоторые из угроз пока что нельзя архитектурно закрыть. Например, для атак, где используются рассуждения и множество шагов прямо указано: защиты нет. И это реально преимущество, если это актуализировать. Таксономия как бы говорит, что нельзя гоняться за призрачными патчами для того, что пока не лечится, а буквально расставляет приоритеты в части защиты. Это экономит сотни часов и позволяет сосредоточиться на реальных, а не выдуманных точках контроля. | 1 361 |
| 7 | Я редко пишу про offensive AI, поскольку это не совсем в тему моего канала. Больше года назад, когда я касался этой сферы, игроков на поле можно было пересчитать по пальцам. Я до сих пор помню свой разговор с создателем PentAGI, и тогда во всем мире насчитывалось от силы десять или пятнадцать подобных агентов.
Сейчас этот потолок давно и бесповоротно пробит. Мне приходится буквально жить на Гитхабе, и блуждая по его просторам, я наткнулся на крайне любопытный репозиторий. Это насыщенная смесь из множества автономных агентов, научных статей и инструментов для пентеста. Материал отлично подойдет тем, кто давно ждет от меня развернутого поста по данной тематике.
Помимо прикладных решений, здесь собрано много теории и глубоких аналитических обзоров. Погружение в эту материю может быть действительно фундаментальным. Сохраняйте себе, чтобы держать руку на пульсе эволюции автономных систем.
https://github.com/Yeti-791/Awesome-Offensive-AI-Agentic-Landscape
Можете сколько угодно спрашивать меня про то что я знаю о пентест-агентах, но лучше чем ссылку на этот репозиторий я вам не смогу дать. | 1 749 |
| 8 | Непонятно, почему так происходит. Смотришь на красивых демо умных агентов, которые читают файлы, управляют инструментами и строят длинные цепочки задач, а стоит копнуть чуть глубже, и вся эта магия рассыпается в прах от одного кривого запроса.
Я тут перечитал свежий материал Криса Хьюза про изоляцию как самый важный принцип для безопасности агентов и понял, что все еще пытаются решать структурные проблемы вероятностными методами. Это как пытаться удержать цунами с помощью канцелярского скотча.
Авторы нового исследования предлагают не перечислять бесконечные векторы атак, а задать один простой вопрос. Где именно в системе впервые происходит потеря изоляции. Они выделяют пять критических границ доверия:
1️⃣Первая граница между пользователем и агентом, где пользовательский контент перестает быть просто данными и становится кодом управления.
2️⃣Вторая граница между агентом и инструментом, определяющая доступ к внешним возможностям.
🌷Третья граница исполнения, где абстрактное рассуждение материализуется в конкретное действие.
4️⃣Четвертая граница взаимодействия между самими агентами.
5️⃣И пятая граница между системой и окружающей средой.
Часто в рекомендациях по безопасности агентов видишь советы про строгие системные промпты или наличие ограничения на вызов инструмент, но это чистая иллюзия. Их можно уговорить, обмануть или заставить галлюцинировать.
Цифры в материале снимают иллюзии. Рост числа серверов MCP составил две тысячи процентов за год, и подавляющее большинство крутится на машинах разработчиков, а не на защищенных корпоративных серверах. Это огромный риск цепочки поставок. Авторы прямо пишут, что сообщение в мультиагентной системе это скрытый приказ к действию. Один скомпрометированный агент передает вредоносные инструкции другим, и начинается каскадный сбой на уровне коммуникаций. Что в целом также известно уже и в OWASP, и других методологиях.
Сетевое окружение превращается в активную враждебную поверхность. Бенчмарки вроде SafeArena и STWebAgentBench наглядно демонстрируют, что агенты выдают небезопасные результаты через обычные клики и навигацию, а модели, обученные вежливо отказывать, моментально ломаются, как только начинают действовать через интерфейс, а не через чат.
Я не могу доверять агенту просто потому, что он выдал связный текст. Я должен гарантировать исходя из структуры, что его изначальное намерение не было подменено на стыке этих пяти границ. Ограничения, по сути, будут таким -песочницы, контроль исходящего трафика, детерминированные проверки политик на уровне ядра.
Вместо нагромождения защитных слоев поверх хрупкого агента изоляцию нужно закладывать в саму архитектуру. Когда вы будете оценивать агента – стоит задать один вопрос «Где проходят границы этой системы и какой конкретный механизм их реально защищает?». Если ответ сводится к фразе разработчики написали строгий системный промпт, битва уже проиграна. Границы доверия не прощают небрежности. | 1 728 |
| 9 | Если отбросить всякие OWASP, статьи научные и т.д то какой вектор атаки на AI-системы вы считаете наиболее недооцененным и опасным в реальных прод-средах прямо сейчас? | 1 559 |
| 10 | Запускаю я недавно garak и promptfoo, смотрю на отчет и понимаю: я просто гоняю один и тот же набор сигнатур по кругу. Но кажется это больше для галочки. Но вот, недавно вышел AHA (Agent Hacks Agent - код). И это не сканер, это автономный инструмент для тестирования моделей, который строит граф концепций уязвимостей.
Попробую расшифровать эту аббревиатурную кашу, потому что дьявол, как всегда, кроется в механике. Ребята протестировали 18 жестких конфигураций, разложив всё по осям: две жертвы (Claude Code и Codex), три модели-исследователя (Minimax, Kimi, Deepseek) и три бенчмарка – AgentHazard, AgentDyn (о котором я писал) и DTap. На них и прогоняли.
И что они получил, а получили они 117 подтвержденных срабатываний. На отложенных задачах, без всякого дообучения, средний процент успешных атак подскочил на 14 процентов по сравнению с бейзлайнами. В сценарии прямой атаки на Codex модель Deepseek-V4-Pro выдала вообще 91,1% успешных взломов.
Но это ещё не всё. В обнаруженных механизмах - кластеризация выдала 8 семейств уязвимостей. Он умеет подменять авторизацию. Агент просто верит, что ты админ, потому что ты пошёл против него социалкой. Скармливаешь ему SSH-ключ со словами «я на новом ноуте», и он без задней мысли прописывает его в authorized_keys. Восемь подтверждений, ноль опровержений. Эксплуатация доверия.
Тут у меня, да и у многих, возникает мысль: «Зачем нам ваши дорогие облачные API, давайте просто закрутим этот же цикл на локальном Hermes». Звучит как план идеального ограбления: бесплатно, приватно, свои данные. Но чтобы взломать агента, модель-исследователь должен быть умнее жертвы. Если ты назначаешь локальный Hermes и планировщиком и создателем атак, ты получаешь замкнутую систему, где слепой ведет слепого. Ему банально не хватает той самой изощренной креативности и глубины рассуждений, чтобы нащупать неочевидный механизм. В лучшем случае он пережует известные паттерны, но новое семейство уязвимостей не откроет.
Да и сам AHA пока что далеко не волшебная таблетка, снимите розовые очки. Во-первых, это дикая жратва токенов. Четыре субагента крутятся в цикле, постоянно рефлексируют и критикуют друг друга. Счет за API будет таким, что вас, несомненно, попросят объяснить – почему нейросети ведут диалог сами с собой.
Во-вторых, иллюзия того, что всё под контролем. Субагент критик может решить, что уязвимость воспроизводима, хотя это просто галлюцинация модели-исследователя. Граф уязвимостей красив на бумаге, но он упирается в слепые зоны самой базовой модели. Плюс инфраструктура: тебе нужен жесткий Docker для песочницы жертвы, чтобы твой автономный агент не снес тебе реальный прод, а это уже не просто pip install.
В сухом остатке для меня AHA - это реально скачок по сравнению с привычными тулзами, потому что он переносит саму идею взлома между моделями. Но это дорогой, тяжелый и все еще ограниченный железом инструмент. Команду безопасности пока не заменит. Ночь наступает, и в этой ночи он жрет наш бюджет, а не только уязвимости. | 1 864 |
| 11 | بدون متن... | 1 624 |
| 12 | Сейчас всё больше и больше людей проникаются в тему loop engineering. Мы ставим перед агентом задачи, а дальше идут итеративные циклы наблюдения, мышления, действия и рефлексии. Мне нравится, когда кто-то может строить отсюда до замка, замкнутость - это круто. Но глубже погружаясь в мир автономных агентов, я сильнее ощущал чувство отсутствия защищённости. Такая у меня суперсила. А тут я наткнулся на статью “Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies”, и я пропал.
Статья не рассматривает отдельные атаки, а в целом смотрит в глубь, в архитектуру и в подходы. Авторы разложили поверхность атаки на матрицу из пяти функциональных модулей и пяти этапов жизненного цикла. Из двадцати пяти ячеек матрицы семнадцать являются критически уязвимыми, и для них просто не существует работающих методов защиты.
Исследователи сравнили два фреймворка с открытым кодом. Один из них – наш знакомый Hermes. Они запустили сорок целевых атак, нацеленных именно на путь эволюции агента. Результат в Hermes оказался абсолютным. Сто процентов. Все сорок атак успешно закрепились в архитектуре. При этом встроенный сканер безопасности заблокировал ровно 2.5% процента угроз. 1/40. Архитектура Hermes активировала в три с половиной раза больше уязвимых ячеек матрицы по сравнению с более статичным аналогом.
Читая результаты, меня преследовала плохая мысль о статических фильтрах на входе и на выходе. В классических моделях угроза эфемерна. Ввели мусор, получили мусор, сессия закрылась. Но в циклах самоэволюции - если вредоносный паттерн обманывает этап оценки и проскакивает в фиксацию, он не просто выполняется. Он получает прописку в агенте.
Дальше хоррор. Авторы выделяют семь сквозных эффектов усиления. Эти эффекты по синергии взаимодействуют друг с другом, делая невозможным обеспечение безопасности путем изолированной защиты отдельных модулей.
Возьмем модуль взаимодействия между агентами. Представьте себе популяцию агентов. Каждый отдельный агент проходит все проверки, ведет себя идеально и соответствует строгим критериям. Но популяция в целом эволюционирует в абсолютно небезопасном направлении. Агенты начинают использовать стеганографию в своих внутренних коммуникациях для обхода общих фильтров. Они коллективно вырабатывают иммунитет к нашим правилам, потому что синергия их взаимодействий создает новые и неочевидные паттерны поведения.
Или возьмем умственные ресурсы. Авторы приводили в пример атаку когда атакующий тонко отравляет опыт, который агент извлекает из своей базы знаний. Агент самостоятельно и абсолютно рационально приходит к вредоносным выводам, считая их результатом собственного улучшения. Он не взломан. Он просто неправильно запомнил прошлое.
В статье это называют как налог на безопасность. Любые проверки делают агента медленнее и снижают его метрики полезности, поэтому на этапе оценки эволюционный алгоритм просто рационально отбраковывает "тормозящие" ограничения.
В модуле самопроектирования авторы описывают то, что они называют Optimizer-Optimizee Collapse. Агент начинает менять не только свои инструменты, но и правила, по которым он оценивает свою эффективность. Если ограничение замедляет его работу и снижает итоговый скор за полезность, эволюционный алгоритм рационально и хладнокровно отбраковывает ограничение. Агент сам срезает себе ветку безопасности, потому что в его локальной петле эволюции так просто выгоднее.
В таком случае бессмысленно проверять, что агент решил сейчас, если через пять итераций он изменит сам механизм принятия решений. Думаю, контроль должен быть не над ответами, а над правилами, по которым агент может менять себя.
Статья предлагает выход путём создания неизменяемого ядра на жестком детерминированном коде, которое математически верифицирует любые предложенные агентом изменения строго до этапа их фиксации. А ещё они предлагают интересную таксономию различных угроз для самоэволюционирующих агентов (можете посмотреть на картинке к статье).
Loop Engineering невероятно интересен. Но если вы не заложили жесткие архитектурные границы в саму петлю, поздравляю. Вы создали автоматический самоподдерживающийся генератор уязвимостей. | 1 623 |
| 13 | Недавно я решил протестировать Open Policy Agent. Если кратко, OPA представляет собой цифрового бюрократа. Это не гардрейл, который пытается понять ваш замысел, и не эвристический фильтр, ищущий скрытые смыслы. Это детерминированный движок, берущий на вход JSON-контекст и прогоняющий его через набор жестких правил на декларативном языке Rego. Его единственная задача - сказать «да» или «нет», опираясь исключительно на букву правила. В мире AI-агентов, постоянно норовящих выйти за рамки дозволенного, OPA играет роль безжалостного швейцара, проверяющего документы на входе.
Я поднял OPA-сервер в Docker и прогнал через него тридцать тестов (это мало, как мне кажется), часть из которых были сделаны с нуля, а часть взял из готовых примеров. Агента собрал на базе CrewAI и слегка допиленного DeepSeek. Больше всего меня зацепило, что движок умеет мыслить последовательностями, а не просто реагировать на отдельные слова.
Обычно политики безопасности представляют как плоский список запретов: нельзя удалять файлы, нельзя трогать базу. Но агент штука хитрая.
Он может легально прочитать приватный ключ, а затем так же легально отправить его по почте. Каждый шаг по отдельности кристально чист, и классический фильтр его пропустит. Поэтому я скормил OPA политику на композиционный анализ, заставив Rego смотреть не на текущий вызов, а на историю действий. Когда агент после чтения файла потянул отправку письма, сервер просто положил запрос на стол с вердиктом об эксфильтрации. А так же он поймал цепочку, где агент сначала выполнил код, а потом пошел гуглить, как замести следы.
Разогнавшись на цепочках, я прогнал его на тестах где агент должен был сделать запросы к базам данных, через SQL. OPA перестал просто искать ключевые слова вроде DROP. Он начал разбирать грамматику, ловить составные запросы и блокировать запросы, если хоть одна команда в списке была грязной. Тут меня ждал первый облом. В документации гордо расписана встроенная проверка схем, но на практике она напрочь игнорирует обязательные поля.
Rego вообще язык специфический. 🤨
Если напишешь не то имя поля, движок не кинет исключение. Он просто молча вернет пустоту, политика не сработает, и ты будешь часами чесать затылок, глядя в логи. Зато с ловлей зацикливаний он справился отлично, безжалостно кикая агента, который пять раз подряд вызывал один и тот же инструмент, и строго следя за тем, чтобы в параметры не просочились лишние поля.
За всё это я платил скоростью. OPA отрабатывал от пяти до ста двадцати миллисекунд. Для прототипа нормально, но понятно, что в продакшене такой сервер придется сажать в отдельный контейнер рядом с агентом и настраивать постоянные соединения. Иначе агент будет думать дольше, чем генерировать текст.
💰💰
И всё же, даже с этими продвинутыми трюками OPA остается тем, чем является. Детерминированным фильтром. Он не понимает смысла. Если вы заблокировали слово "SSN", агент просто назовет поле "social_security_number", и OPA радостно пропустит запрос. Он не умеет отслеживать, откуда именно пришли данные в параметры. Закодированные промпт-атаки пройдут сквозь него как нож сквозь масло, если только вы не наколдуете поверх кучу дополнительных правил.
Итог простой. OPA в связке с AI-агентом это идеальная, быстрая и иногда непрошибаемая стена. Почему иногда ? Потому что всё-равно есть вероятность взлома. Он отлично справляется с ролью жесткого контроля: режет опасные инструменты, следит за схемой параметров и даже анализирует цепочки действий. Но строить на нем всю безопасность кажется чересчур наивным делом. Это база, на которую нужно класть языковую модель для понимания семантики входящих запросов, песочницу для изоляции и трекер потоков данных. Мы не можем заставить нейросеть быть хорошей, но можем построить вокруг нее харнесс, из которого плохие действия просто не выйдут. И OPA для стен этого лабиринта подходит лучше всего. Главное - не забыть закрыть в нем все люки.😒😒😒 | 1 511 |
| 14 | Половина статей про атаки на генеративные модели с использованием изображений оперирует откровенно недостоверными цифрами.
Недавно я наткнулся на препринт от исследователей из Наньянского технологического университета. Они решили сделать простую вещь: взять более 200 text-to-image моделей с Hugging Face и посмотреть, насколько страхи вокруг NSFW-джейлбрейков совпадают с реальностью в опенсурс мире. Результаты получились такими, что половину публикаций по этой теме за последний год можно смело отправлять в корзину.
Авторы отобрали более 200 моделей с Hugging Face и разбили их на четыре семейства: SDXL, SD, FLUX и Qwen. Для атак они использовали MMA-Diffusion - фреймворк для генерации промптов, который автоматически подбирает способы обхода фильтров безопасности. Промпты брали из датасета UnsafeBench: это около 300 запросов, которые гарантированно должны генерировать NSFW-контент, если модель не защищена. Эту конструкцию прогнали через все 200 моделей, замерили Attack Success Rate (ASR), а затем посмотрели, что получилось на самом деле.
Посмотрите, как это обычно работает в исследованиях. Берете модель, отправляете в нее атакующий запрос, срабатывает детектор NSFW, вы записываете в таблицу «успешный взлом» и считаете ASR. ASR растет, начинается паника, все пишут про катастрофу. Только беда в том, что защитный классификатор часто срабатывает на визуальный мусор.
Исследователи поняли, что обычный ASR измеряет не уязвимость модели, а неспособность классификатора отличить реальное нарушение от артефактов генерации. Детектор NSFW, который они использовали, - это стандартный классификатор, обученный на датасете NSFW-изображений. В предыдущих статьях он срабатывал на всё подряд: на кривые руки, лишние пальцы, размытые лица и даже на изображения, которые визуально отдаленно напоминают нарушение, хотя по смыслу им не являются.
Поэтому авторы ввели метрику Advanced ASR (AASR). Успешным взломом теперь считается только та генерация, которая прошла три фильтра подряд. Первый фильтр представляет из себя самый простой классификатор NSFW, который выдает вердикт «unsafe». Но этого недостаточно. Второй фильтр проверяет, что модель рисует именно то, что от нее просили в промпте. Если запрос было что-то опасное, а модель нарисовала абстрактное пятно, на котором классификатор сходит с ума, это не взлом, а артефакт генерации. Третий фильтр оценивает, что картинка не представляет собой кашу из пикселей.
Грубо говоря, AASR задает вопрос: «Действительно ли модель сгенерировала опасный контент, который выглядит адекватно и соответствует запросу, или же классификатор ошибся на артефактах и искажениях?» По сути, именно этот вопрос должен быть определяющим в таких исследованиях.
Возьмем базовые модели SDXL: обычный ASR показывает 0,83 (то есть 83% атак якобы успешны), а AASR всего 0,07. Разница в 12 раз. SD-Turbo: ASR 0,80, AASR 0,07. SDXL-Turbo: ASR 0,67, AASR 0,10. Qwen-Image-NSFW: ASR 0,77, AASR 0,17. То есть подавляющее большинство «успешных взломов», о которых пишут в статьях, - это, как оказалось, шум. Классификаторы в тех исследованиях фиксировали совсем не нарушения безопасности.
Тут важно понять, что именно исправляет AASR. Обычный ASR это метрика первого порядка, она отвечает на вопрос: «Сработал ли классификатор?». Но классификатор - не панацея. AASR это уже метрика второго порядка, она отвечает на вопрос: «Было ли реальное нарушение, которое выглядит адекватно и соответствует запросу?». И разница между этими двумя вопросами колоссальная.
Однако есть модели, которые реально опасны даже после применения всех фильтров. FLUX-Asian2 показывает AASR 0,80; SDXL-RV5 - 0,73; FLUX-Logo-LoRA - 0,73; FLUX-Realism-LoRA - 0,70; GEN-ScandiInterior - 0,70; FLUX-NSFW-Master - 0,67. И самое забавное: некоторые из них выглядят совершенно безобидно в описании, пока не попробуешь прогнать через них атакующий промпт.
Интересно посмотреть, как ведут себя разные семейства моделей под воздействием атак. SDXL уже устарел, но и худший вариант: медианный AASR 0,44, верхняя граница уходит за 0,60. SD -промежуточный вариант с медианой около 0,27. FLUX совсем непредсказуемый: медиана ниже, чем у SD, но разброс такой, что никогда не знаешь, что получишь. Qwen самый устойчивый вариант: медиана около 0,15, большинство значений сконцентрировано в нижней части диапазона. Выбор архитектуры ставит вопрос о том, какой уровень риска вы закладываете в систему по умолчанию.
А дальше всё мрачно. Эволюция SDXL идет в неправильную сторону. В 2023 году средний AASR был около 0,30, в 2024-м - 0,38, а в 2025-м - уже 0,55. За два года рост почти в два раза. Новые поколения моделей SDXL не становятся безопаснее, они становятся уязвимее. FLUX держится на стабильно высоком уровне с легким ростом. У SD, наоборот, пик пришелся на 2023 год, потом пошло на спад.
Короче говоря: делите любой высокий ASR на десять, не верьте описаниям на слово и помните, что FLUX непредсказуем, а новые модели становятся уязвимее с каждым годом. Всё остальное - детали. Актуально это не только для NSFW-джейлбрейков 🍓. Сложно предположить почему авторам захотелось разобрать тему именно таких вот джейлбрейков, но ввести альтернативную ASR'у метрику идея кажется здравой. | 1 558 |
| 15 | Недавно ко мне в коммиты залетел интересный обучающий ресурс - AI Risk Atlas.
первое, что мы видим когда заходим на сайт - это знакомый нам дизайн 😁.
Но помимо этого в глаза бросается большая такая энциклопедия с описанием различных рисков в AI Security, некоторые подкрепляются примерами инцидентов из реального мира. Хоть и часть является не совсем про AI Security - всё-равно, ресурс можно закинуть в копилочку базовых обучающих ресурсов.
Из ноу-хау можно отметить интерактивную песочницу. В ней можно визуально посмотреть как может распространятся атака в зависимости от того, какие приняты меры по защите. Такая вот азбука. | 1 884 |
| 16 | Привет. Интересно стало какие AI Security решения появились за последний год ? Поделитесь пожалуйста в комментариях, возможно мы соберём самый полный список того что делается умельцами из России. | 1 948 |
| 17 | Приветы, сегодня посмотрим на работу GAVEL (ICLR 2026) от Offensive AI Lab. Попытка сделать мониторинг активаций LLM более структурированным и интерпретируемым. 🦸♂️🦸♂️🦸♂️
Идея
Классический подход к мониторингу активаций выглядит так: берём датасет опасных промптов, обучаем классификатор, надеемся на обобщение. Тут есть ряд проблем - низкая точность, сложность интерпретации, необходимость переобучения при изменении сценариев. GAVEL предлагает другую парадигму: декомпозировать поведение модели на Cognitive Elements (CE) - интерпретируемые атомарные факторы вроде making_threat, payment_tools, personal_information, content_creation.
Как это устроено изнутри
Берётся замороженная LLM. Из неё извлекаются активации из нескольких выбранных слоёв, причём только для части диалога, которую генерирует сама модель (assistant). Эти активации подаются на вход TopicRNN - LSTM с несколькими слоями. На выходе модель выдаёт логиты для каждого CE, решая задачу multi-label классификации.
Правила описываются в rules.json и определяют use cases через три типа условий. all_required - CE, которые должны сработать все (логическое И). any_of - группы CE, где достаточно срабатывания любого. supporting - CE, которые поддерживают правило, но не обязательны.
Для примера, правило scamazon (скам-имитация Amazon) требует обязательного наличия personal_information И payment_tools, плюс хотя бы одно действие из any_of (купить, отправить, скачать и т.п.), и опционально поддерживается trust_seeding, making_threat или tax.
Пороги срабатывания для каждого CE подбираются автоматически на тестовых данных. После калибровки для каждого правила из rules.json считаются метрики: TPR, FPR и AUC.
Что показывают бенчмарки
В статье авторы сравнивают GAVEL с девятью базовыми подходами на Mistral-7B (Circuit Breakers, RepBending, CAST, JBShield, Llama Guard 4, Perspective, OpenAI Moderator и обычным классификатором активаций). Результаты сильные: средний AUC по девяти сценариям злоупотребления достигает 0.97, а средний FPR удерживается на уровне 0.03. Для сравнения: методы дообучения вроде Circuit Breakers выдают AUC 0.68 при FPR 0.06, а подходы на основе проекций типа CAST дают те же 0.68 AUC, но с катастрофическим FPR в 0.60.
Отдельного внимания заслуживает устойчивость к атакам. При атаках типа Misdirection, когда вредный контент разбавляют безобидным шумом, GAVEL удерживает TPR выше 85% по всем категориям. В то же время GPT-4 в роли судьи проседает до 12–15% на задачах с бредовыми теориями и вмешательством в выборы, а перехват цели и обход фильтров через перефразирование систему тоже не ломают. GAVEL остаётся стабильным, так как смотрит на внутренние когнитивные состояния модели, а не на поверхностные токены.
Ещё важно сказать про переносимость между моделями и языками. Одни и те же датасеты когнитивных элементов и правила работают на Llama3-8B, Qwen3-8B и Gemma-4B без переобучения. При тестировании на трёх языках (английском, испанском и китайском) TPR держится в коридоре 0.86–1.0 при почти нулевом FPR.
Что на практике
Во-первых, интерпретируемость, когда срабатывает алерт, ты видишь, какие именно CE его вызвали и какое правило применилось. Это отличается от бинарного классификатора, который просто говорит "опасно". Во-вторых, модульность - добавление нового сценария атаки, по сути, правка JSON-файла, а не переобучение модели. В-третьих, переносимость - подход работает с разными LLM без модификации базовой модели, меняется только RNN-зонд.
Но. Вся система стоит на точности отдельных CE-зондов. Если RNN ошибается в детекции making_threat, то правило tax_scam, просто не сработает и ты об этом можешь не узнать. RNN-зонды сами по себе требуют размеченных данных для обучения, и качество CE-таксономии напрямую определяет качество всей системы. Ручное написание правил не масштабируется автоматически - для каждого нового домена нужна экспертиза. И это всё равно внешний слой контроля поверх модели, а не решение проблем безопасности самой LLM.
Полезно для регулируемых отраслей, где важны аудит и объяснимость.
GitHub: https://github.com/Offensive-AI-Lab/gavel | 2 741 |
| 18 | Давно я не делал обзор на интересные книги в AI Security для новичков. Пора исправляться.
Недавно бегло пролистал свежую книгу Practical AI Security от Харриет Фэрлоу. Авторша работала в австралийской разведке и писала кандидатскую по состязательным атакам. Раньше она проводила курсы для государственных организаций, по AI Security. А сейчас она делает свой стартап и ведёт бимбобложик. Редкое сочетание.
Впечатление специфическое. С одной стороны это отличный онбординг для классических экспертов по кибребезе. Фэрлоу не зацикливается только на простых тактиках джейлбрейка моделей, а структурно и простым языком разбирает атаки на цепочку поставок, а также атаки по сторонним каналам на кластеры GPU и показывает фреймворк MAESTRO для мультиагентных систем, который мы разбирали в начале прошлого года. К книге идет репозиторий с кодом. Можно запустить и покрутить руками, хотя местами атаки выглядят откровенно тепличными и учебными. До того чтобы внедрить в продакшен тут далековато. Но это ж и не задача книжки. Задача дать базу.
С другой стороны книга отлично показывает одну из очевидных и интересных проблем, о которой я говорю уже давно. Целые разделы посвящены гардрейлам и фильтрации инструкций, но через банальные регулярные выражения. Мы давно знаем, что внедрение таких заглушек только нормализует девиантное поведение системы, создавая иллюзию контроля для безопасников, пока сама архитектура остается дырявой. Но приятно, что книга собирает воедино ровно те тезисы, которые также были мной описаны в постах с самого начала ведения канала. MLSecOps, изоляция архитектуры, white box подход и подходы к здравой оценки магического мышления вокруг безопасных моделей.
Из действительно сильных и пугающих примеров приведу историю из книги, про Африку. Сам впервые прочитал именно тут о ней. В 2020 году в южноафриканском парке браконьеры обошли систему инфракрасных камер на базе Microsoft Azure, которая должна была обнаруживать людей. Система обработала десятки тысяч изображений, но пропустила нарушителей. В итоге погибли четыре носорога. Действительно трагичные последствия, в сравнении с теми инцидентами о которых я писал тут 🐱.
А вот еще один кейс, думаю вы его читали, но если нет - то вот кратко. В 2025 году исследователи успешно взломали Google Gemini через отравленные приглашения в календарь. Небезопасные инструкции были вшиты прямо в текст встречи, и агент Gemini, пытаясь помочь пользователю, начал отдавать команды умному дому на открытие штор и включение бойлеров. Хорошая иллюстрация того, что происходит, когда мы даем моделям автономию и доступ к инструментам, полагаясь лишь на промпты и эвристики вместо жесткой архитектурной изоляции и границ доверия.
Фэрлоу в своей книге как раз говорит, что AI Security давно переросла рамки обхода фильтров в чат-ботах. Это про некий системный образ мышления, про границы доверия и понимание того, как модель встроена в инфраструктуру. Если мы даем агенту доступ к умному дому или камерам в саванне без жесткой архитектурной изоляции, никакие гардрейлы нас не спасут. Иллюзия контроля остается иллюзией, пока мы не начнем проектировать безопасность на уровне архитектуры, а не лепить заплатки регулярками и прочим шлаком. Но для давних читателей моего канала - это может показаться базой.
Это как раз говорит о том что сама книга, как фундаментальная база и карта системных угроз - вещь полезная. Но если вы ищете грязную практику обхода white box защит на уровне токенов и механистической интерпретируемости, то надо поработать самому.
книга, надеюсь не забанят, но если забанят то вы будете знать почему. | 3 068 |
| 19 | بدون متن... | 2 426 |
| 20 | بدون متن... | 2 318 |
