en
Feedback
AI Security Lab

AI Security Lab

Open in Telegram

Взламываем ИИ, а другим не позволяем HiveTrace x AI Talent Hub ITMO ai.itmo.ru/aisecuritylab

Show more
2 176
Subscribers
-324 hours
+197 days
+15730 days

Data loading in progress...

Attracting Subscribers
September '26
September '26
+40
in 3 channels
August '26
+183
in 4 channels
Get PRO
July '26
+106
in 1 channels
Get PRO
June '26
+144
in 1 channels
Get PRO
May '26
+185
in 6 channels
Get PRO
April '26
+67
in 0 channels
Get PRO
March '26
+66
in 2 channels
Get PRO
February '26
+93
in 0 channels
Get PRO
January '26
+83
in 1 channels
Get PRO
December '25
+66
in 0 channels
Get PRO
November '25
+75
in 1 channels
Get PRO
October '25
+146
in 3 channels
Get PRO
September '25
+265
in 3 channels
Get PRO
August '25
+159
in 3 channels
Get PRO
July '25
+98
in 4 channels
Get PRO
June '25
+131
in 8 channels
Get PRO
May '25
+170
in 7 channels
Get PRO
April '25
+96
in 5 channels
Get PRO
March '25
+219
in 3 channels
Get PRO
February '250
in 1 channels
Get PRO
January '25
+139
in 3 channels
Get PRO
December '240
in 2 channels
Get PRO
November '24
+54
in 2 channels
Date
Subscriber Growth
Mentions
Channels
08 September0
07 September+4
06 September+4
05 September+6
04 September+8
03 September+5
02 September+4
01 September+9
Channel Posts
🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026 Продолжаем осень в активном формате (или подводим итоги лета) Наши студентки выступали на AINL 2026 и сейчас организаторы опубликовали выступление Веры Краснобаевой, выпустившейся магистрантки AI Talent Hub, ITMO University и исследовательницы Hive Trace Security Lab, — Cascading Failures in Multi-Agent LLM Systems. В работе Вера исследует каскадные ошибки в мультиагентных LLM-системах — ситуации, когда сбой или неверное решение одного агента распространяется дальше по цепочке и влияет на работу всей системы. На базе OWASP FinBot она собрала мультиагентный пайплайн из четырёх агентов и исследовала сценарии возникновения таких каскадов. Работа в итоге выросла в контрибьют в OWASP: в FinBot появился отдельный Cascade Lab, где можно увидеть каскадные ошибки в действии на реальном пайплайне. Если хотите разобраться, как ломаются взаимодействия между AI-агентами и почему безопасность отдельных компонентов ещё не гарантирует безопасность всей системы, — рекомендуем посмотреть доклад. Также в этом году можно будет присоединиться к проекту Веры и поработать с ней, как с руководительницей! Проекты будут доступны в ITMO Talent Hub, не пропустите! Записи: 📺 YouTube https://www.youtube.com/watch?v=dCxRy7bWrFI ▶️ VK Видео https://vkvideo.ru/video-38193760_456239039?list=ln-uAMoOe6lPq5kSaI4Mr #AINL2026 #AISecurity #MultiAgentSystems

2
No text...
407
3
No text...
552
4
No text...
521
5
No text...
2 289
6
🗿Могут ли ИИ-агенты пропустить вредоносный код? Вообще говоря, могут. Смотреть на это лучше всего в примерах, чтобы понимать, как делать не надо, чем потом работать с последствиями. Где посмотреть. Разработчик команды HiveTrace Red Никита Беляевский написал материал, где воспроизвел и разобрал эксперимент с агентом, которому предложили поработать с вредоносным репозиторием. Что в статье❓ ✔️ Процесс: как агент анализирует незнакомый репозиторий и ищет подозрительный код; ✔️ Причины изменений в поведении: почему наличие исходного кода, README и других «безопасных» артефактов может повлиять на решение агента; ✔️ Действия: как агент может обнаружить потенциальную угрозу, но после дополнительного анализа решить, что она безопасна; Эксперимент показывает занчимую особенность агентных систем: обнаружение потенциальной угрозы ещё не означает, что агент правильно оценит риск и остановится перед опасным действием. ➡️ Читать статью на Хабре: «Рэд-флаг, который ИИ-агент проигнорировал»
814
7
No text...
1 702
8
Участник лаборатории Мосин Вячеслав завершил работу над обзором 7 ресурсов для мониторинга угроз AI Security 🔥 И обзор доступен каждому Выбор ресурсов для сбора информации об угрозах, в том числе связанных с безопасностью ИИ является важным этапом в решении задач моделирования угроз и разработки стратегий по защите от них. Задача выбора ресурсов трудоёмкая — можно натравить агента принести ссылки, но он не учтет практических особенностей. Слава разобрал 7 ресурсов и свел всё в единую статью. Её можно использовать как для понимания «что есть?», как и для анализа «что взять?». В статье приведены OWASP, MITRE ATLAS, Google SAIF, MIT AI Risk Repository, Cisco - Integrated AI Security and Safety Framework, а также Сбер - Модель угроз для кибербезопасности AI и ФСТЭК - Угрозы безопасности информации систем искусственного интеллекта. Каждый ресурс отмечен его особенностями. Работа поможет быстрее ознакомиться с ними и выбрать подходящий вариант для разных задач. ⤵️ Читать статью на Хабр
1 037
9
No text...
1 122
10
Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥 В материале, Аня рассказывает, об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути. В статье протестировано 5 инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — смена бэкбона на Flash DeBERTa. Такой зоопарк ценен сам по себе, но не менее ценно то, что описаны также найденные Аней сложности и их решения. Приглашаем поддержать сильный дебют: https://habr.com/ru/articles/1067008/ И конечно воспроизвести эксперименты в репо. Ане огни за упорство и результаты!
1 678
11
No text...
837
12
Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим. Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась. Как это подано. Двойной тезис: 1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени; 2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками. Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту. Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент». — [Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки. — [Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии. — [AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов. — [OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека. — И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/). Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени. Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace. Так что работаем, коллеги, работаем!
825
13
Контроль Claude и OpenClaw в HiveTrace На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо р
Контроль Claude и OpenClaw в HiveTrace На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах 🗓 28 июля в 11:00, МСК Что будет в демо: ⬇️ ➡️ как HiveTrace Hooks работают с Claude Code; ➡️ как анализировать пользовательские запросы до передачи в Claude; ➡️ как проверять tool calls до фактического выполнения; ➡️ как контролировать параметры и допустимость действий; ➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент; ➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw; Спикеры: 👤Анна Тищенко, руководитель интеграции, покажет, как с помощью HiveTrace Hooks контролировать работу Claude на разных этапах. 👤Ильдар Исхаков, эксперт по бэкенду и архитектуре, покажет, как HiveTrace помогает защитить OpenClaw и встроить контроль в существующую AI-инфраструктуру. 👤Никита Беляевский, Red-team engineer, покажет атаки на агентов, в ходе которых, агент под воздействием непрямой промпт-инъекции будет выполнять опасные для устройства команды. Вебинар будет полезен тем, кто работает с AI-агентами, tool calls, Claude Code или OpenClaw и хочет контролировать не только запросы к модели, но и действия, которые агент выполняет в системе. ➡️ Успей зарегистрироваться
965
14
Будем делиться новостями по продуктам HiveTrace, новыми релизами и практическими сценариями защиты AI-агентов. Приглашаем на вебинар про контроль Claude и OpenClaw в HiveTrace: покажем лайв-демо HiveTrace Hooks, проверку запросов и tool calls до выполнения, защиту OpenClaw и разбор атак на агентов через непрямые промпт-инъекции. Регистрируйтесь по ссылке и до встречи на вебинаре.
853
15
Новое пространство рассуждений или новый инструмент для AI safety ▫️ 6 июля Anthropic выпустили работу про J-Space — внутреннее пространство вербализуемых (то есть — переводимых в слова) представлений в Claude, которое можно частично читать. Пространство названо в честь нового метода, который и является движком нахождения этого пространства — J-Lens. Верхнеуровнево идея в том, чтобы вместо вопроса: «На какой токен похож hidden state сейчас?» — как делают некоторые другие Lens-подобные методы, а смотреть на очень маленькую динамику: если немного изменить внутреннее состояние модели сейчас, какие будущие слова и концепты изменятся потом? ▫️И если слово «очень маленький» вызвало у вас воспоминание о школьной производной — да! Для ответа на вопрос используется усреднённый якобиан — матрица локальных производных, показывающая, как изменения в одном слое влияют на будущие выходы. Мы не могли упустить это, ибо и авторы подсветили — метод важен для safety. Модель может не писать явно (а зачем ей это делать?), что распознала prompt injection, что считает контекст подозрительным, что заметила evaluation setting или что удерживает некоторый план. Но такие представления могут быть видны в J-Space — ведь бесконечно малые отражают динамику. Грубо говоря, «что трясется внутри модели быстрее всего». В работе приводятся примеры, где J-Lens помогает обнаруживать внутренние концепты (представленные в виде токенов—слов) вроде: fake injection deception blackmail self-preservation evaluation Конечно, это не значит, что появление токена и то, что мы его увидели, доказывает намерение модели. Например, deception может означать, что модель распознала обман в задаче, а не что она сама собирается обманывать. Поэтому J-Lens нельзя воспринимать как «детектор злых намерений», но можно — как инструмент генерации гипотез для аудита моделей. ▫️Читать технические детали AnthropicPaper ◾️Видео-тизер от Anthropic: YouTube ▫️Технические детали с математикой метода, формулами и интуицией: в канале R&D Lead Research направления — Сабрины
985
16
🚗 Nvidia выпустили свежую safety-модель Nemotron 3.5 Content Safety Богдан Минко, ML Engineer в HiveTrace, магистрант AI Talent Hub, ITMO University & AI Security Lab, исследовал модель и поделился своим взглядом: Модель представляет собой мультимодальный guard на базе Gemma-3-4B-it, который разработчики подают как SLM (small language model). Она объединяет два предыдущих релиза: мультимодальную модерацию из Nemotron 3 Content Safety и работу с кастомными политиками из Nemotron Content Safety Reasoning 4B. В трейн добавляли данные с ризонингом, но интереснее примеры следования политике. Идея такая: вместо фиксированной таксономии в модель передается описание политики, она рассуждает и выдаёт вердикт safe/unsafe, а также конкретные safety категории. ➡️ Забавная деталь из бенчмарков: reasoning-режим помогает не всегда, на DynaGuardrail Safety «no think» даёт 0.91 против 0.86 с ризонингом. Для кастомной модели — кастомные бенчмарки: ⬇️ ➡️COSA (code safety) Может быть полезен тем, кто работает с кодовыми ассистентами и планирует интегрировать Guard слой в Claude Code, Cursor и другие ИИ инструменты. ➡️DynaGuardrail Датасет с описаниями политик, который состоит из следующих пунктов: список разрешённых тем, их названия и описания, и сверху много промпта, который будет кушать latency в real time. Вряд ли эта модель станет real-time гардом, обрабатывающим каждый запрос там, где latency критична. Но если ваш UX не ломается от дополнительной пары секунд на размышления и ответ LLM, возможно, это неплохой бейзлайн в каскадном сценарии. 🖥 Nvidia часто открывают свои train-датасеты, вот и в этот раз вместе с моделью выложили Nemotron-3.5-Content-Safety-Dataset. Ребята из SupraLabs уже успели обучить на нём свой очень-очень маленький гард SupraSafety-18M. ➡️ Ну и финальный рецепт каскадного сценария, когда хочется и быстро и качественно: берем SupraSafety 18M, а все случаи где у него низкий confidence отдаем в Nemotron
1 144
17
📣 Актуальные подходы для защиты современных AI-систем: открытая защита проектов лаборатории в записи ➡️ За два дня участники HiveTrace x AI Security Lab представили проекты по самым актуальным направлениям AI Security: детектирование вредоносных запросов, оценка guardrail-моделей, бенчмарки безопасности, анализ мультиагентных систем и многое другое... Не смог присоединиться? Лови запись всех докладов: узнай как AI Security выглядит на реальных проектах 🎥 СМОТРЕТЬ - часть 1 🎥 СМОТРЕТЬ - часть 2 ❤️ — был на вебинаре 👀 — посмотрю в записи
1 101
18
🎥Присоединяйся к Открытой защите проектов в 12:00 Уже через час участники AI Talent Hub покажут, как строить и сравнивать защитные классификаторы, разрабатывать бенчмарки, анализировать ложные срабатывания и исследовать внутренние механизмы LLM-безопасности ➡️ ПОДКЛЮЧИТЬСЯ
2 230
19
⚡️Открытая защита стартует через час. Подключайтесь
1 272
20
Как выбрать хорошую Security команду? У неё нет выходных!🗿 На этих прекрасных выходных (уже завтра!) мы собираемся увидеть, как AI Security выглядит на реальных проектах. 🗓 12 июня в 12:00 Первый день открытой защиты посвящён прикладным проектам: участники AI Talent Hub покажут, как строить и сравнивать защитные классификаторы, разрабатывать бенчмарки, анализировать ложные срабатывания и исследовать внутренние механизмы LLM-безопасности. Спикеры: 👤Герман Кочнев AI Security — курс-практикум по безопасности ИИ-приложений 👤Анастасия Калиманова Линейный классификатор как альтернатива guardrail-моделям 👤Софья Балаба Арена для комплексного сравнения guardrail-моделей 👤Дарина Ковалева RuFPBench — разработка pipeline для формирования примеров, инициирующих ложные срабатывания 👤Владимир Грищенко Анализ совместимости направлений распознавания небезопасного входа и направления отказа 👤Егор Емельянов Домен-ориентированный SAE для анализа безопасности LLM Защиту откроет наш лид — можно будет узнать, как и зачем мы ведем проекты! Готов заглянуть внутрь и узнать над чем участники трудятся в области безопасности ИИ? ➡️Присоединяйся к защите 12 и 13 июня
1 751