AI Security Lab
رفتن به کانال در Telegram
Взламываем ИИ, а другим не позволяем HiveTrace x AI Talent Hub ITMO ai.itmo.ru/aisecuritylab
نمایش بیشتر2 209
مشترکین
-224 ساعت
+187 روز
+12330 روز
در حال بارگیری داده...
کانالهای مشابه
هیچ دادهای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
ابر برچسبها
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
سپتامبر '26
سپتامبر '26
+84
در 3 کانالها
اوت '26
+183
در 4 کانالها
Get PRO
ژوئیه '26
+106
در 1 کانالها
Get PRO
ژوئن '26
+144
در 1 کانالها
Get PRO
مه '26
+185
در 6 کانالها
Get PRO
آوریل '26
+67
در 0 کانالها
Get PRO
مارس '26
+66
در 2 کانالها
Get PRO
فوریه '26
+93
در 0 کانالها
Get PRO
ژانویه '26
+83
در 1 کانالها
Get PRO
دسامبر '25
+66
در 0 کانالها
Get PRO
نوامبر '25
+75
در 1 کانالها
Get PRO
اکتبر '25
+146
در 3 کانالها
Get PRO
سپتامبر '25
+265
در 3 کانالها
Get PRO
اوت '25
+159
در 3 کانالها
Get PRO
ژوئیه '25
+98
در 4 کانالها
Get PRO
ژوئن '25
+131
در 8 کانالها
Get PRO
مه '25
+170
در 7 کانالها
Get PRO
آوریل '25
+96
در 5 کانالها
Get PRO
مارس '25
+219
در 3 کانالها
Get PRO
فوریه '250
در 1 کانالها
Get PRO
ژانویه '25
+139
در 3 کانالها
Get PRO
دسامبر '240
در 2 کانالها
Get PRO
نوامبر '24
+54
در 2 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 18 سپتامبر | +7 | |||
| 17 سپتامبر | 0 | |||
| 16 سپتامبر | +1 | |||
| 15 سپتامبر | +8 | |||
| 14 سپتامبر | +7 | |||
| 13 سپتامبر | 0 | |||
| 12 سپتامبر | +7 | |||
| 11 سپتامبر | +4 | |||
| 10 سپتامبر | +6 | |||
| 09 سپتامبر | +4 | |||
| 08 سپتامبر | 0 | |||
| 07 سپتامبر | +4 | |||
| 06 سپتامبر | +4 | |||
| 05 سپتامبر | +6 | |||
| 04 سپتامبر | +8 | |||
| 03 سپتامبر | +5 | |||
| 02 سپتامبر | +4 | |||
| 01 سپتامبر | +9 |
پستهای کانال
| 2 | Открытый вебинар про интерепретируемость агентов совместно со Stepik.
Завтра (вторник, 18:00 по МСК) лид лабы Сабрина Садиех проведет вебинар про агентов.
Разбор будет построен от базового понимания "что есть агент?", до границ и разбора вопроса "почему мы не можем объяснять поведение агентов".
Будет мини-практика с кодом и много материала, чтобы поучиться (в том числе, чтобы поучиться атаковать агентов).
Зарегистрироваться и прочитать другие тейки можно на лендинге вебинара. Присоединяейтесь! | 532 |
| 3 | بدون متن... | 505 |
| 4 | Наш исследователь — контрибьютор SAE Lens 🎉
PR Егора Емельянова, исследователя нашей лаборатории, приняли в SAE Lens — одну из основных библиотек для обучения и анализа sparse autoencoder'ов.
Sparse autoencoder'ы раскладывают внутренние активации нейросети на более простые и разреженные признаки — это один из ключевых инструментов механистической интерпретируемости. С их помощью исследователи пытаются понять, какие концепции модель представляет внутри. SAE Lens упрощает обучение таких автоэнкодеров и работу с ними.
Как пишет Егор: «В своём исследовании я хотел воспроизвести подход к обучению SAE из Gemma Scope 2, чтобы сравнивать свои результаты с их моделями. Обучал через SAE Lens — и обнаружил, что нужной функции потерь в библиотеке нет.
Я реализовал её самостоятельно, а потом подумал, что она пригодится и другим, и отправил pull request.»
Егор сделал дополнительный вариант штрафа за разреженность для JumpReLU SAE — Quadratic L0 из Gemma Scope 2.
Его ключевое отличие: исследователь заранее задаёт целевой L0 — желаемое среднее число активных признаков, и модель в процессе обучения стремится к этому значению.
Это даёт более прямой контроль над разреженностью и упрощает сравнение разных SAE.
Идея и формула уже существовали в Gemma Scope 2 — задача Егора была корректно перенести подход в SAE Lens, встроить его в существующую архитектуру, добавить валидацию и тесты.
🤝PR: https://github.com/decoderesearch/SAELens/pull/732
Поздравляем Егора — контрибьюты в открытые инструменты интерпретируемости так и работают: нашёл задачу в своём исследовании и закрыл её для всех 🦾 | 504 |
| 5 | 🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026
Продолжаем осень в активном формате (или подводим итоги лета)
Наши студентки выступали на AINL 2026 и сейчас организаторы опубликовали выступление Веры Краснобаевой, выпустившейся магистрантки AI Talent Hub, ITMO University и исследовательницы Hive Trace Security Lab, — Cascading Failures in Multi-Agent LLM Systems.
В работе Вера исследует каскадные ошибки в мультиагентных LLM-системах — ситуации, когда сбой или неверное решение одного агента распространяется дальше по цепочке и влияет на работу всей системы.
На базе OWASP FinBot она собрала мультиагентный пайплайн из четырёх агентов и исследовала сценарии возникновения таких каскадов. Работа в итоге выросла в контрибьют в OWASP: в FinBot появился отдельный Cascade Lab, где можно увидеть каскадные ошибки в действии на реальном пайплайне.
Если хотите разобраться, как ломаются взаимодействия между AI-агентами и почему безопасность отдельных компонентов ещё не гарантирует безопасность всей системы, — рекомендуем посмотреть доклад.
Также в этом году можно будет присоединиться к проекту Веры и поработать с ней, как с руководительницей! Проекты будут доступны в ITMO Talent Hub, не пропустите!
Записи:
📺 YouTube
https://www.youtube.com/watch?v=dCxRy7bWrFI
▶️ VK Видео
https://vkvideo.ru/video-38193760_456239039?list=ln-uAMoOe6lPq5kSaI4Mr
#AINL2026 #AISecurity #MultiAgentSystems | 687 |
| 6 | بدون متن... | 673 |
| 7 | بدون متن... | 783 |
| 8 | بدون متن... | 706 |
| 9 | بدون متن... | 2 758 |
| 10 | 🗿Могут ли ИИ-агенты пропустить вредоносный код?
Вообще говоря, могут. Смотреть на это лучше всего в примерах, чтобы понимать, как делать не надо, чем потом работать с последствиями.
Где посмотреть. Разработчик команды HiveTrace Red Никита Беляевский написал материал, где воспроизвел и разобрал эксперимент с агентом, которому предложили поработать с вредоносным репозиторием.
Что в статье❓
✔️ Процесс: как агент анализирует незнакомый репозиторий и ищет подозрительный код;
✔️ Причины изменений в поведении: почему наличие исходного кода, README и других «безопасных» артефактов может повлиять на решение агента;
✔️ Действия: как агент может обнаружить потенциальную угрозу, но после дополнительного анализа решить, что она безопасна;
Эксперимент показывает занчимую особенность агентных систем: обнаружение потенциальной угрозы ещё не означает, что агент правильно оценит риск и остановится перед опасным действием.
➡️ Читать статью на Хабре:
«Рэд-флаг, который ИИ-агент проигнорировал» | 895 |
| 11 | بدون متن... | 1 845 |
| 12 | Участник лаборатории Мосин Вячеслав завершил работу над обзором 7 ресурсов для мониторинга угроз AI Security
🔥 И обзор доступен каждому
Выбор ресурсов для сбора информации об угрозах, в том числе связанных с безопасностью ИИ является важным этапом в решении задач моделирования угроз и разработки стратегий по защите от них.
Задача выбора ресурсов трудоёмкая — можно натравить агента принести ссылки, но он не учтет практических особенностей. Слава разобрал 7 ресурсов и свел всё в единую статью. Её можно использовать как для понимания «что есть?», как и для анализа «что взять?».
В статье приведены OWASP, MITRE ATLAS, Google SAIF, MIT AI Risk Repository, Cisco - Integrated AI Security and Safety Framework, а также Сбер - Модель угроз для кибербезопасности AI и ФСТЭК - Угрозы безопасности информации систем искусственного интеллекта.
Каждый ресурс отмечен его особенностями. Работа поможет быстрее ознакомиться с ними и выбрать подходящий вариант для разных задач.
⤵️
Читать статью на Хабр | 1 041 |
| 13 | بدون متن... | 1 122 |
| 14 | Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥
В материале, Аня рассказывает, об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути.
В статье протестировано 5 инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — смена бэкбона на Flash DeBERTa. Такой зоопарк ценен сам по себе, но не менее ценно то, что описаны также найденные Аней сложности и их решения.
Приглашаем поддержать сильный дебют: https://habr.com/ru/articles/1067008/
И конечно воспроизвести эксперименты в репо.
Ане огни за упорство и результаты! | 1 678 |
| 15 | بدون متن... | 837 |
| 16 | Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов
Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим.
Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась.
Как это подано. Двойной тезис:
1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени;
2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками.
Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту.
Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент».
— [Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки.
— [Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии.
— [AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов.
— [OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека.
— И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/).
Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени.
Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace. Так что работаем, коллеги, работаем! | 825 |
| 17 | Контроль Claude и OpenClaw в HiveTrace
На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах
🗓 28 июля в 11:00, МСК
Что будет в демо: ⬇️
➡️ как HiveTrace Hooks работают с Claude Code;
➡️ как анализировать пользовательские запросы до передачи в Claude;
➡️ как проверять tool calls до фактического выполнения;
➡️ как контролировать параметры и допустимость действий;
➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент;
➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw;
Спикеры:
👤Анна Тищенко, руководитель интеграции, покажет, как с помощью HiveTrace Hooks контролировать работу Claude на разных этапах.
👤Ильдар Исхаков, эксперт по бэкенду и архитектуре, покажет, как HiveTrace помогает защитить OpenClaw и встроить контроль в существующую AI-инфраструктуру.
👤Никита Беляевский, Red-team engineer, покажет атаки на агентов, в ходе которых, агент под воздействием непрямой промпт-инъекции будет выполнять опасные для устройства команды.
Вебинар будет полезен тем, кто работает с AI-агентами, tool calls, Claude Code или OpenClaw и хочет контролировать не только запросы к модели, но и действия, которые агент выполняет в системе.
➡️ Успей зарегистрироваться | 965 |
| 18 | Будем делиться новостями по продуктам HiveTrace, новыми релизами и практическими сценариями защиты AI-агентов. Приглашаем на вебинар про контроль Claude и OpenClaw в HiveTrace: покажем лайв-демо HiveTrace Hooks, проверку запросов и tool calls до выполнения, защиту OpenClaw и разбор атак на агентов через непрямые промпт-инъекции.
Регистрируйтесь по ссылке и до встречи на вебинаре. | 853 |
| 19 | Новое пространство рассуждений или новый инструмент для AI safety
▫️ 6 июля Anthropic выпустили работу про J-Space — внутреннее пространство вербализуемых (то есть — переводимых в слова) представлений в Claude, которое можно частично читать. Пространство названо в честь нового метода, который и является движком нахождения этого пространства — J-Lens.
Верхнеуровнево идея в том, чтобы вместо вопроса: «На какой токен похож hidden state сейчас?» — как делают некоторые другие Lens-подобные методы, а смотреть на очень маленькую динамику: если немного изменить внутреннее состояние модели сейчас, какие будущие слова и концепты изменятся потом?
▫️И если слово «очень маленький» вызвало у вас воспоминание о школьной производной — да! Для ответа на вопрос используется усреднённый якобиан — матрица локальных производных, показывающая, как изменения в одном слое влияют на будущие выходы.
Мы не могли упустить это, ибо и авторы подсветили — метод важен для safety.
Модель может не писать явно (а зачем ей это делать?), что распознала prompt injection, что считает контекст подозрительным, что заметила evaluation setting или что удерживает некоторый план. Но такие представления могут быть видны в J-Space — ведь бесконечно малые отражают динамику. Грубо говоря, «что трясется внутри модели быстрее всего».
В работе приводятся примеры, где J-Lens помогает обнаруживать внутренние концепты (представленные в виде токенов—слов) вроде:
fake
injection
deception
blackmail
self-preservation
evaluation
Конечно, это не значит, что появление токена и то, что мы его увидели, доказывает намерение модели. Например, deception может означать, что модель распознала обман в задаче, а не что она сама собирается обманывать. Поэтому J-Lens нельзя воспринимать как «детектор злых намерений», но можно — как инструмент генерации гипотез для аудита моделей.
▫️Читать технические детали AnthropicPaper
◾️Видео-тизер от Anthropic: YouTube
▫️Технические детали с математикой метода, формулами и интуицией: в канале R&D Lead Research направления — Сабрины | 985 |
| 20 | 🚗 Nvidia выпустили свежую safety-модель Nemotron 3.5 Content Safety
Богдан Минко, ML Engineer в HiveTrace, магистрант AI Talent Hub, ITMO University & AI Security Lab, исследовал модель и поделился своим взглядом:
Модель представляет собой мультимодальный guard на базе Gemma-3-4B-it, который разработчики подают как SLM (small language model). Она объединяет два предыдущих релиза: мультимодальную модерацию из Nemotron 3 Content Safety и работу с кастомными политиками из Nemotron Content Safety Reasoning 4B.
В трейн добавляли данные с ризонингом, но интереснее примеры следования политике. Идея такая: вместо фиксированной таксономии в модель передается описание политики, она рассуждает и выдаёт вердикт safe/unsafe, а также конкретные safety категории.
➡️ Забавная деталь из бенчмарков: reasoning-режим помогает не всегда, на DynaGuardrail Safety «no think» даёт 0.91 против 0.86 с ризонингом.
Для кастомной модели — кастомные бенчмарки: ⬇️
➡️COSA (code safety)
Может быть полезен тем, кто работает с кодовыми ассистентами и планирует интегрировать Guard слой в Claude Code, Cursor и другие ИИ инструменты.
➡️DynaGuardrail
Датасет с описаниями политик, который состоит из следующих пунктов: список разрешённых тем, их названия и описания, и сверху много промпта, который будет кушать latency в real time.
Вряд ли эта модель станет real-time гардом, обрабатывающим каждый запрос там, где latency критична. Но если ваш UX не ломается от дополнительной пары секунд на размышления и ответ LLM, возможно, это неплохой бейзлайн в каскадном сценарии.
🖥 Nvidia часто открывают свои train-датасеты, вот и в этот раз вместе с моделью выложили Nemotron-3.5-Content-Safety-Dataset. Ребята из SupraLabs уже успели обучить на нём свой очень-очень маленький гард SupraSafety-18M.
➡️ Ну и финальный рецепт каскадного сценария, когда хочется и быстро и качественно: берем SupraSafety 18M, а все случаи где у него низкий confidence отдаем в Nemotron | 1 144 |
