AI Security Lab
رفتن به کانال در Telegram
Взламываем ИИ, а другим не позволяем HiveTrace x AI Talent Hub ITMO ai.itmo.ru/aisecuritylab
نمایش بیشتر2 264
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+167 روز
+8130 روز
در حال بارگیری داده...
کانالهای مشابه
هیچ دادهای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
ابر برچسبها
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
اکتبر '26اکتبر '26
اکتبر '26
+32
در 2 کانالها
سپتامبر '26
+124
در 3 کانالها
Get PRO
اوت '26
+183
در 5 کانالها
Get PRO
ژوئیه '26
+106
در 1 کانالها
Get PRO
ژوئن '26
+144
در 2 کانالها
Get PRO
مه '26
+185
در 7 کانالها
Get PRO
آوریل '26
+67
در 1 کانالها
Get PRO
مارس '26
+66
در 3 کانالها
Get PRO
فوریه '26
+93
در 1 کانالها
Get PRO
ژانویه '26
+83
در 1 کانالها
Get PRO
دسامبر '25
+66
در 0 کانالها
Get PRO
نوامبر '25
+75
در 1 کانالها
Get PRO
اکتبر '25
+146
در 3 کانالها
Get PRO
سپتامبر '25
+265
در 3 کانالها
Get PRO
اوت '25
+159
در 3 کانالها
Get PRO
ژوئیه '25
+98
در 4 کانالها
Get PRO
ژوئن '25
+131
در 8 کانالها
Get PRO
مه '25
+170
در 7 کانالها
Get PRO
آوریل '25
+96
در 5 کانالها
Get PRO
مارس '25
+219
در 3 کانالها
Get PRO
فوریه '250
در 1 کانالها
Get PRO
ژانویه '25
+139
در 3 کانالها
Get PRO
دسامبر '240
در 2 کانالها
Get PRO
نوامبر '24
+54
در 2 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 08 اکتبر | +3 | |||
| 07 اکتبر | +4 | |||
| 06 اکتبر | +3 | |||
| 05 اکتبر | +6 | |||
| 04 اکتبر | +1 | |||
| 03 اکتبر | +3 | |||
| 02 اکتبر | +9 | |||
| 01 اکتبر | +3 |
پستهای کانال
| 2 | بدون متن... | 527 |
| 3 | بدون متن... | 1 179 |
| 4 | بدون متن... | 831 |
| 5 | Открытый вебинар про интерепретируемость агентов совместно со Stepik.
Завтра (вторник, 18:00 по МСК) лид лабы Сабрина Садиех проведет вебинар про агентов.
Разбор будет построен от базового понимания "что есть агент?", до границ и разбора вопроса "почему мы не можем объяснять поведение агентов".
Будет мини-практика с кодом и много материала, чтобы поучиться (в том числе, чтобы поучиться атаковать агентов).
Зарегистрироваться и прочитать другие тейки можно на лендинге вебинара. Присоединяейтесь! | 960 |
| 6 | بدون متن... | 962 |
| 7 | Наш исследователь — контрибьютор SAE Lens 🎉
PR Егора Емельянова, исследователя нашей лаборатории, приняли в SAE Lens — одну из основных библиотек для обучения и анализа sparse autoencoder'ов.
Sparse autoencoder'ы раскладывают внутренние активации нейросети на более простые и разреженные признаки — это один из ключевых инструментов механистической интерпретируемости. С их помощью исследователи пытаются понять, какие концепции модель представляет внутри. SAE Lens упрощает обучение таких автоэнкодеров и работу с ними.
Как пишет Егор: «В своём исследовании я хотел воспроизвести подход к обучению SAE из Gemma Scope 2, чтобы сравнивать свои результаты с их моделями. Обучал через SAE Lens — и обнаружил, что нужной функции потерь в библиотеке нет.
Я реализовал её самостоятельно, а потом подумал, что она пригодится и другим, и отправил pull request.»
Егор сделал дополнительный вариант штрафа за разреженность для JumpReLU SAE — Quadratic L0 из Gemma Scope 2.
Его ключевое отличие: исследователь заранее задаёт целевой L0 — желаемое среднее число активных признаков, и модель в процессе обучения стремится к этому значению.
Это даёт более прямой контроль над разреженностью и упрощает сравнение разных SAE.
Идея и формула уже существовали в Gemma Scope 2 — задача Егора была корректно перенести подход в SAE Lens, встроить его в существующую архитектуру, добавить валидацию и тесты.
🤝PR: https://github.com/decoderesearch/SAELens/pull/732
Поздравляем Егора — контрибьюты в открытые инструменты интерпретируемости так и работают: нашёл задачу в своём исследовании и закрыл её для всех 🦾 | 815 |
| 8 | 🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026
Продолжаем осень в активном формате (или подводим итоги лета)
Наши студентки выступали на AINL 2026 и сейчас организаторы опубликовали выступление Веры Краснобаевой, выпустившейся магистрантки AI Talent Hub, ITMO University и исследовательницы Hive Trace Security Lab, — Cascading Failures in Multi-Agent LLM Systems.
В работе Вера исследует каскадные ошибки в мультиагентных LLM-системах — ситуации, когда сбой или неверное решение одного агента распространяется дальше по цепочке и влияет на работу всей системы.
На базе OWASP FinBot она собрала мультиагентный пайплайн из четырёх агентов и исследовала сценарии возникновения таких каскадов. Работа в итоге выросла в контрибьют в OWASP: в FinBot появился отдельный Cascade Lab, где можно увидеть каскадные ошибки в действии на реальном пайплайне.
Если хотите разобраться, как ломаются взаимодействия между AI-агентами и почему безопасность отдельных компонентов ещё не гарантирует безопасность всей системы, — рекомендуем посмотреть доклад.
Также в этом году можно будет присоединиться к проекту Веры и поработать с ней, как с руководительницей! Проекты будут доступны в ITMO Talent Hub, не пропустите!
Записи:
📺 YouTube
https://www.youtube.com/watch?v=dCxRy7bWrFI
▶️ VK Видео
https://vkvideo.ru/video-38193760_456239039?list=ln-uAMoOe6lPq5kSaI4Mr
#AINL2026 #AISecurity #MultiAgentSystems | 830 |
| 9 | بدون متن... | 780 |
| 10 | بدون متن... | 986 |
| 11 | بدون متن... | 776 |
| 12 | بدون متن... | 2 897 |
| 13 | 🗿Могут ли ИИ-агенты пропустить вредоносный код?
Вообще говоря, могут. Смотреть на это лучше всего в примерах, чтобы понимать, как делать не надо, чем потом работать с последствиями.
Где посмотреть. Разработчик команды HiveTrace Red Никита Беляевский написал материал, где воспроизвел и разобрал эксперимент с агентом, которому предложили поработать с вредоносным репозиторием.
Что в статье❓
✔️ Процесс: как агент анализирует незнакомый репозиторий и ищет подозрительный код;
✔️ Причины изменений в поведении: почему наличие исходного кода, README и других «безопасных» артефактов может повлиять на решение агента;
✔️ Действия: как агент может обнаружить потенциальную угрозу, но после дополнительного анализа решить, что она безопасна;
Эксперимент показывает занчимую особенность агентных систем: обнаружение потенциальной угрозы ещё не означает, что агент правильно оценит риск и остановится перед опасным действием.
➡️ Читать статью на Хабре:
«Рэд-флаг, который ИИ-агент проигнорировал» | 915 |
| 14 | بدون متن... | 1 845 |
| 15 | Участник лаборатории Мосин Вячеслав завершил работу над обзором 7 ресурсов для мониторинга угроз AI Security
🔥 И обзор доступен каждому
Выбор ресурсов для сбора информации об угрозах, в том числе связанных с безопасностью ИИ является важным этапом в решении задач моделирования угроз и разработки стратегий по защите от них.
Задача выбора ресурсов трудоёмкая — можно натравить агента принести ссылки, но он не учтет практических особенностей. Слава разобрал 7 ресурсов и свел всё в единую статью. Её можно использовать как для понимания «что есть?», как и для анализа «что взять?».
В статье приведены OWASP, MITRE ATLAS, Google SAIF, MIT AI Risk Repository, Cisco - Integrated AI Security and Safety Framework, а также Сбер - Модель угроз для кибербезопасности AI и ФСТЭК - Угрозы безопасности информации систем искусственного интеллекта.
Каждый ресурс отмечен его особенностями. Работа поможет быстрее ознакомиться с ними и выбрать подходящий вариант для разных задач.
⤵️
Читать статью на Хабр | 1 041 |
| 16 | بدون متن... | 1 122 |
| 17 | Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥
В материале, Аня рассказывает, об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути.
В статье протестировано 5 инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — смена бэкбона на Flash DeBERTa. Такой зоопарк ценен сам по себе, но не менее ценно то, что описаны также найденные Аней сложности и их решения.
Приглашаем поддержать сильный дебют: https://habr.com/ru/articles/1067008/
И конечно воспроизвести эксперименты в репо.
Ане огни за упорство и результаты! | 1 678 |
| 18 | بدون متن... | 837 |
| 19 | Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов
Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим.
Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась.
Как это подано. Двойной тезис:
1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени;
2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками.
Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту.
Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент».
— [Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки.
— [Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии.
— [AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов.
— [OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека.
— И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/).
Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени.
Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace. Так что работаем, коллеги, работаем! | 825 |
| 20 | Контроль Claude и OpenClaw в HiveTrace
На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах
🗓 28 июля в 11:00, МСК
Что будет в демо: ⬇️
➡️ как HiveTrace Hooks работают с Claude Code;
➡️ как анализировать пользовательские запросы до передачи в Claude;
➡️ как проверять tool calls до фактического выполнения;
➡️ как контролировать параметры и допустимость действий;
➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент;
➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw;
Спикеры:
👤Анна Тищенко, руководитель интеграции, покажет, как с помощью HiveTrace Hooks контролировать работу Claude на разных этапах.
👤Ильдар Исхаков, эксперт по бэкенду и архитектуре, покажет, как HiveTrace помогает защитить OpenClaw и встроить контроль в существующую AI-инфраструктуру.
👤Никита Беляевский, Red-team engineer, покажет атаки на агентов, в ходе которых, агент под воздействием непрямой промпт-инъекции будет выполнять опасные для устройства команды.
Вебинар будет полезен тем, кто работает с AI-агентами, tool calls, Claude Code или OpenClaw и хочет контролировать не только запросы к модели, но и действия, которые агент выполняет в системе.
➡️ Успей зарегистрироваться | 965 |
