fa
Feedback

فریب کلاهبرداران را نخورید! تل‌متریو این کانال‌ها را شناسایی و برچسب‌گذاری می‌کند 👉 برای مشاهده برچسب، اشتراک تهیه کنید 👈

AI Security Lab

AI Security Lab

رفتن به کانال در Telegram

Взламываем ИИ, а другим не позволяем HiveTrace x AI Talent Hub ITMO ai.itmo.ru/aisecuritylab

نمایش بیشتر
2 264
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+167 روز
+8130 روز

در حال بارگیری داده...

کانال‌های مشابه
هیچ داده‌ای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
اکتبر '26
اکتبر '26
+32
در 2 کانال‌ها
سپتامبر '26
+124
در 3 کانال‌ها
Get PRO
اوت '26
+183
در 5 کانال‌ها
Get PRO
ژوئیه '26
+106
در 1 کانال‌ها
Get PRO
ژوئن '26
+144
در 2 کانال‌ها
Get PRO
مه '26
+185
در 7 کانال‌ها
Get PRO
آوریل '26
+67
در 1 کانال‌ها
Get PRO
مارس '26
+66
در 3 کانال‌ها
Get PRO
فوریه '26
+93
در 1 کانال‌ها
Get PRO
ژانویه '26
+83
در 1 کانال‌ها
Get PRO
دسامبر '25
+66
در 0 کانال‌ها
Get PRO
نوامبر '25
+75
در 1 کانال‌ها
Get PRO
اکتبر '25
+146
در 3 کانال‌ها
Get PRO
سپتامبر '25
+265
در 3 کانال‌ها
Get PRO
اوت '25
+159
در 3 کانال‌ها
Get PRO
ژوئیه '25
+98
در 4 کانال‌ها
Get PRO
ژوئن '25
+131
در 8 کانال‌ها
Get PRO
مه '25
+170
در 7 کانال‌ها
Get PRO
آوریل '25
+96
در 5 کانال‌ها
Get PRO
مارس '25
+219
در 3 کانال‌ها
Get PRO
فوریه '250
در 1 کانال‌ها
Get PRO
ژانویه '25
+139
در 3 کانال‌ها
Get PRO
دسامبر '240
در 2 کانال‌ها
Get PRO
نوامبر '24
+54
در 2 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
08 اکتبر+3
07 اکتبر+4
06 اکتبر+3
05 اکتبر+6
04 اکتبر+1
03 اکتبر+3
02 اکتبر+9
01 اکتبر+3
پست‌های کانال

2
بدون متن...
527
3
بدون متن...
1 179
4
بدون متن...
831
5
Открытый вебинар про интерепретируемость агентов совместно со Stepik. Завтра (вторник, 18:00 по МСК) лид лабы Сабрина Садиех проведет вебинар про агентов. Разбор будет построен от базового понимания "что есть агент?", до границ и разбора вопроса "почему мы не можем объяснять поведение агентов". Будет мини-практика с кодом и много материала, чтобы поучиться (в том числе, чтобы поучиться атаковать агентов). Зарегистрироваться и прочитать другие тейки можно на лендинге вебинара. Присоединяейтесь!
960
6
بدون متن...
962
7
Наш исследователь — контрибьютор SAE Lens 🎉 PR Егора Емельянова, исследователя нашей лаборатории, приняли в SAE Lens — одну из основных библиотек для обучения и анализа sparse autoencoder'ов. Sparse autoencoder'ы раскладывают внутренние активации нейросети на более простые и разреженные признаки — это один из ключевых инструментов механистической интерпретируемости. С их помощью исследователи пытаются понять, какие концепции модель представляет внутри. SAE Lens упрощает обучение таких автоэнкодеров и работу с ними. Как пишет Егор: «В своём исследовании я хотел воспроизвести подход к обучению SAE из Gemma Scope 2, чтобы сравнивать свои результаты с их моделями. Обучал через SAE Lens — и обнаружил, что нужной функции потерь в библиотеке нет. Я реализовал её самостоятельно, а потом подумал, что она пригодится и другим, и отправил pull request.» Егор сделал дополнительный вариант штрафа за разреженность для JumpReLU SAE — Quadratic L0 из Gemma Scope 2. Его ключевое отличие: исследователь заранее задаёт целевой L0 — желаемое среднее число активных признаков, и модель в процессе обучения стремится к этому значению. Это даёт более прямой контроль над разреженностью и упрощает сравнение разных SAE. Идея и формула уже существовали в Gemma Scope 2 — задача Егора была корректно перенести подход в SAE Lens, встроить его в существующую архитектуру, добавить валидацию и тесты. 🤝PR: https://github.com/decoderesearch/SAELens/pull/732 Поздравляем Егора — контрибьюты в открытые инструменты интерпретируемости так и работают: нашёл задачу в своём исследовании и закрыл её для всех 🦾
815
8
🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026 Продолжаем осень в активном формате (или подводим итоги лета) Наши студентки выступали на AINL 2026 и сейчас организаторы опубликовали выступление Веры Краснобаевой, выпустившейся магистрантки AI Talent Hub, ITMO University и исследовательницы Hive Trace Security Lab, — Cascading Failures in Multi-Agent LLM Systems. В работе Вера исследует каскадные ошибки в мультиагентных LLM-системах — ситуации, когда сбой или неверное решение одного агента распространяется дальше по цепочке и влияет на работу всей системы. На базе OWASP FinBot она собрала мультиагентный пайплайн из четырёх агентов и исследовала сценарии возникновения таких каскадов. Работа в итоге выросла в контрибьют в OWASP: в FinBot появился отдельный Cascade Lab, где можно увидеть каскадные ошибки в действии на реальном пайплайне. Если хотите разобраться, как ломаются взаимодействия между AI-агентами и почему безопасность отдельных компонентов ещё не гарантирует безопасность всей системы, — рекомендуем посмотреть доклад. Также в этом году можно будет присоединиться к проекту Веры и поработать с ней, как с руководительницей! Проекты будут доступны в ITMO Talent Hub, не пропустите! Записи: 📺 YouTube https://www.youtube.com/watch?v=dCxRy7bWrFI ▶️ VK Видео https://vkvideo.ru/video-38193760_456239039?list=ln-uAMoOe6lPq5kSaI4Mr #AINL2026 #AISecurity #MultiAgentSystems
830
9
بدون متن...
780
10
بدون متن...
986
11
بدون متن...
776
12
بدون متن...
2 897
13
🗿Могут ли ИИ-агенты пропустить вредоносный код? Вообще говоря, могут. Смотреть на это лучше всего в примерах, чтобы понимать, как делать не надо, чем потом работать с последствиями. Где посмотреть. Разработчик команды HiveTrace Red Никита Беляевский написал материал, где воспроизвел и разобрал эксперимент с агентом, которому предложили поработать с вредоносным репозиторием. Что в статье❓ ✔️ Процесс: как агент анализирует незнакомый репозиторий и ищет подозрительный код; ✔️ Причины изменений в поведении: почему наличие исходного кода, README и других «безопасных» артефактов может повлиять на решение агента; ✔️ Действия: как агент может обнаружить потенциальную угрозу, но после дополнительного анализа решить, что она безопасна; Эксперимент показывает занчимую особенность агентных систем: обнаружение потенциальной угрозы ещё не означает, что агент правильно оценит риск и остановится перед опасным действием. ➡️ Читать статью на Хабре: «Рэд-флаг, который ИИ-агент проигнорировал»
915
14
بدون متن...
1 845
15
Участник лаборатории Мосин Вячеслав завершил работу над обзором 7 ресурсов для мониторинга угроз AI Security 🔥 И обзор доступен каждому Выбор ресурсов для сбора информации об угрозах, в том числе связанных с безопасностью ИИ является важным этапом в решении задач моделирования угроз и разработки стратегий по защите от них. Задача выбора ресурсов трудоёмкая — можно натравить агента принести ссылки, но он не учтет практических особенностей. Слава разобрал 7 ресурсов и свел всё в единую статью. Её можно использовать как для понимания «что есть?», как и для анализа «что взять?». В статье приведены OWASP, MITRE ATLAS, Google SAIF, MIT AI Risk Repository, Cisco - Integrated AI Security and Safety Framework, а также Сбер - Модель угроз для кибербезопасности AI и ФСТЭК - Угрозы безопасности информации систем искусственного интеллекта. Каждый ресурс отмечен его особенностями. Работа поможет быстрее ознакомиться с ними и выбрать подходящий вариант для разных задач. ⤵️ Читать статью на Хабр
1 041
16
بدون متن...
1 122
17
Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥 В материале, Аня рассказывает, об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути. В статье протестировано 5 инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — смена бэкбона на Flash DeBERTa. Такой зоопарк ценен сам по себе, но не менее ценно то, что описаны также найденные Аней сложности и их решения. Приглашаем поддержать сильный дебют: https://habr.com/ru/articles/1067008/ И конечно воспроизвести эксперименты в репо. Ане огни за упорство и результаты!
1 678
18
بدون متن...
837
19
Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим. Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась. Как это подано. Двойной тезис: 1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени; 2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками. Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту. Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент». — [Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки. — [Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии. — [AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов. — [OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека. — И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/). Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени. Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace. Так что работаем, коллеги, работаем!
825
20
Контроль Claude и OpenClaw в HiveTrace На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо р
Контроль Claude и OpenClaw в HiveTrace На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах 🗓 28 июля в 11:00, МСК Что будет в демо: ⬇️ ➡️ как HiveTrace Hooks работают с Claude Code; ➡️ как анализировать пользовательские запросы до передачи в Claude; ➡️ как проверять tool calls до фактического выполнения; ➡️ как контролировать параметры и допустимость действий; ➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент; ➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw; Спикеры: 👤Анна Тищенко, руководитель интеграции, покажет, как с помощью HiveTrace Hooks контролировать работу Claude на разных этапах. 👤Ильдар Исхаков, эксперт по бэкенду и архитектуре, покажет, как HiveTrace помогает защитить OpenClaw и встроить контроль в существующую AI-инфраструктуру. 👤Никита Беляевский, Red-team engineer, покажет атаки на агентов, в ходе которых, агент под воздействием непрямой промпт-инъекции будет выполнять опасные для устройства команды. Вебинар будет полезен тем, кто работает с AI-агентами, tool calls, Claude Code или OpenClaw и хочет контролировать не только запросы к модели, но и действия, которые агент выполняет в системе. ➡️ Успей зарегистрироваться
965