ar
Feedback
ML&|Sec Feed

ML&|Sec Feed

الذهاب إلى القناة على Telegram
1 192
المشتركون
+124 ساعات
+117 أيام
+3930 أيام
أرشيف المشاركات
Как управлять доступом, привлекая внимание итальянцев https://github.com/rescrv/libmacaroons
macaroons
   can limit when, where, and by whom the delegated authority can be exercised
   (e.g., within one minute, from a machine that holds a certain key, or by a 
   certain logged-in user), by using attenuation and third-party caveats.

О построении МАС - требования к модулю-оркестратору и к мультиагентскому взаимодействию в Cisco Foundry Security Spec 5.1 Orchestrator 8.3 Inter-agent communication

Repost from OK ML
Мультиагентные системы, роевой интеллект и эпоха AI-агентов Индустрия постепенно движется к мультиагентным системам 🤩 — архитектурам, где работает не один AI, а сразу несколько агентов, взаимодействующих между собой. Уже настоящая команда 🫱‍🫲.  Особенно интересно наблюдать, как в AI оживают идеи роевого интеллекта 🐟🐟🐟 — те самые принципы, которые мы видим у муравьев, пчел, косяка рыб или стай птиц. У них ведь нет центрального мозга, который управляет каждым движением, но за счет постоянного обмена сигналами и локальных взаимодействий возникает удивительно сложное коллективное поведение. Сейчас похожие вещи начинают происходить и в системах AI-агентов. Отдельный агент может ошибаться, терять контекст, галлюцинировать или заходить в тупик. Но когда агентов несколько, они начинают компенсировать слабости друг друга. Один замечает ошибку второго. Второй предлагает гипотезу, третий пытается ее опровергнуть. Четвертый собирает дополнительные данные. Итог получается заметно сильнее, чем если бы задачу решала одна большая модель.  👽 Мне кажется, это важный сдвиг в самом понимании AI. Раньше основное внимание было сосредоточено на размерах моделей и качестве промптов. Теперь все чаще становится важна именно архитектура взаимодействия, как агенты координируются, как обмениваются памятью, как принимают коллективные решения, как проверяют выводы друг друга.  💐Возможно, если когда-нибудь появится настоящий AGI, он будет больше похож как раз на сложный коллективный интеллект? Но это были мои мысли, а что же почитать про МАС, АИ-агентов и роевой интеллект?  Если хочется нормально погрузиться в тему, то сейчас знания разбросаны между несколькими областями: МАС,  роевой интеллект, распределенные системы RL и современными LLM-агентными фреймворками (шерсти этот канал!). Но есть несколько работ и направлений, с которых действительно стоит начать и про которые мы не говорили.  Важной стала статья "ReAct: Synergizing Reasoning and Acting in Language Models". Она сильно повлияла на современную архитектуру агентов, где модель не просто отвечает текстом, а чередует reasoning и actions. Многие современные автономные агенты — это развитие ReAct. Еще одна интересная работа — "CAMEL: Communicative Agents for Mind Exploration". Она исследует, как агенты могут общаться между собой для решения задач. Сейчас это направление развивается очень быстро: agent-to-agent протоколы, self-play (без шуток, пошерсти канал!), collaborative reasoning. Делаю ставку на репу Generative Agents: Interactive Simulacra of Human Behavior — 🦾! Там моделируются целые общества AI-агентов с памятью, социальным и эмерджентными поведением. Насколько быстро агенты вообще могут эволюционировать в сложные автономные среды… База! Читаем! И вообще есть ощущение, что в ближайшие годы разработчику AI-систем придется понимать не только модели, но и распределенные системы, теорию игр, отказоустойчивость, графы, координацию, память и самоорганизующиеся системы. Все! 🦔

Repost from AISecHub
PromptShield: Prompt-Injection Detection with Wazuh SIEM Integration Useful pattern: treat prompt-injection attempts as security telemetry—detect and route them into SIEM workflows (alerts, triage, correlation) instead of relying on prompt-only mitigations inside the model. #PromptInjection #LLMSecurity #AISecurity #Tool https://github.com/nourSOC/PromptShield

Repost from Makrushin
Архитектура платформы для автоматизации SOC с помощью ИИ-агентов Всегда интересно прочитать истории, как LLM самостоятельно находит уязвимости в популярном продукте. Как крупные вендоры вроде Mozilla патчат 271 уязвимость, которую обнаружил Mythos. Или как ИИ-агент за 3 минуты без подсказок смог самостоятельно скомпрометировать облачную инфраструктуру. Среди подобных материалов часто остаются незаметны идеи, которые нужны специалистам по защите. На прошлой неделе бот закрыл этот пробел и принес исследование, которое будет интересно Blue Team. В статье описана архитектура системы ИИ-агентов для автоматизации работы центров мониторинга. Ключевую идею этой платформы можно описать одним словом: проактивность. Чтобы не ждать очередных пентестов и проверок Red Team, аналитики могут самостоятельно построить систему непрерывного прогнозирования и обновления детекторов. Ключевая особенность платформы AgentSOC заключается в движке анализа гипотез. Этот модуль отвечает за творческую часть, которая часто остается без внимания загруженного рутиной аналитика. В нем LLM строит ветки возможного развития атак на основе имеющегося контекста из систем мониторинга. Затем привязывает эти ветки к матрице атак MITRE. То есть система постоянно рассуждает над вопросом «что, если», присваивает ответу индекс уверенности и повторяет упражнение. Второй движок структурного моделирования выступает в роли критика и проверяет теоретические рассуждения модели на основе фактического состояния инфраструктуры. Графовая валиадация атак, проверка достижимости, фильтрация галлюцинаций — все это его задачи. В итоге, вся система работает в автономном цикле «Sense-Reason-Act» и выбирает наиболее подходящее действие для защиты менее чем за 1 секунду. @makrushin l MAX l VK l Сетка l Дзен

🗂 SECURITY.md — простой путь к безопасному gen-AI коду Зайду, как водится, издалека. На работе я сейчас вожусь со штукой, для тестирования которой нужно заставить LLM, работающую с кодинг-агентом, генерировать уязвимый код. И это, должен заметить, оказалось не так уж и легко, что навело на весьма очевидную мысль. LLM, в массе своей, вполне способны писать безопасный код. Знаний на эту тему у них — уж точно больше, чем у любого среднестатистического эксперта в этой области. Но скажите на милость, когда разработчик пишет агенту:
Эй, /explore, давай спроектируем крутую фичу feat-XXX для <бла-бла-бла>!
— какая из букв в этом промпте означает security? Может быть, про неё упоминается в скилле? Да тоже нет. В куче же скиллов для secure-кодинга буквально каждый — представляет собой перечень избитых (плюс и так известных моделям) правил, поверх «усредненных» моделей угроз. А весь мой опыт, полученный за полтора десятка лет работы в области безопасности кода, говорит о том, что работая с усредненной моделью угроз, нельзя рассчитывать на что-либо, кроме усредненных результатов. Так может, модели нужна подсказка о том, чем именно является безопасность в данном конкретном проекте и как применять к ней имеющиеся у модели знания? GitHub уже предлагает иметь в корне проекта SECURITY.md, с поддерживаемыми версиями проекта и процедурой репортинга уязвимостей, называя это «политикой безопасности». Так может, стоит её там таки описать? Так и родился скилл security-policy-generator, генерирующий SECURITY.md, включающий в себя модель угроз и правила secure-кодинга, построенные относительно конкретного проекта со всей его спецификой. Ну и, скилл также добавляет референс на созданный файл в AGENTS.md с инструкцией по использованию, чтобы агент уж точно его не пропустил. Коль скоро SECURITY.md создан, обновлять его можно простым «Update SECURITY.md to reflect the latest changes.», отдельный скилл для этого не требуется. Посмотреть результаты работы скилла на конкретном проекте можно здесь. Бенчи не проводил (в планах это есть), но достаточно плотно потестировал результаты работы скилла на нескольких проектах под Qoder, OpenCode и собственным кодинг-агентом. Рассуждения вида «This [won't] become a vulnerability because <здесь реф на модель угроз>» появляются, что как бы намекает на правильную работу всей задумки. P.S: отдельно порадовало, что мой кодинг-агент (по ссылке выше — результаты именно его работы) самоотверженно включил самого себя в потенциальные threat-actors модели угроз. Это так мило... 🥹 А вы говорите, AI-агенты в безопасности не шарят))

Repost from Похек AI
ADLC: жизненный цикл разработки для AI-агентов ADLC — Agentic Development Lifecycle, подход к разработке систем с AI-агентами. Главная мысль простая: классический SDLC хорошо работает там, где поведение продукта можно заранее описать, реализовать и проверить через понятные pass/fail тесты. С агентами так получается не всегда. Изначально идей для поста послужило это видео. Поведение агента зависит от промпта, контекста, выбранной модели, памяти, доступных инструментов и состояния внешней среды. Один и тот же запрос может привести к разным траекториям действий, поэтому «написали код, прогнали тесты, выкатили» быстро становится слабой моделью управления. ADLC предлагает начинать не с разработки, а с гипотезы: какой реальный рабочий процесс ломается, какую ручную работу агент должен забрать, где остаётся человек и по каким метрикам понятно, что система полезна. Дальше идут границы задачи, архитектура, выбор агентного паттерна, источники данных, интеграции, управление контекстом и оценка стоимости. Самая практичная часть — proof of value до полноценной разработки. Нужны эталонные данные, прототип, оценка точности, качества ответа, частоты галлюцинаций, задержки и стоимости результата. Иначе легко построить дорогого агента, который красиво демонстрируется, но плохо живёт в реальном процессе. Для Claude Code это особенно показательно: по документации Anthropic, инструмент читает кодовую базу, правит файлы, запускает команды, работает с dev-инструментами и может действовать на уровне проекта. Значит, оценивать нужно весь контур, а не один финальный diff: reasoning, tool use, безопасность, права доступа, контроль стоимости и качество обратной связи. Вывод: agentic-разработка требует отдельного цикла управления. Сначала формулируем поведение и границы ответственности, затем доказываем ценность на данных, строим eval-систему, выкатываем через controlled rollout и продолжаем мониторить качество после релиза. Для агентов maintenance — это постоянный feedback loop, а не редкий проверка после деплоя. 🌚 @poxek_ai / Чат канала

Repost from white2hack 📚
SOC PLAYBOOK 2026 ATTACKER STEPS (WHAT THEY DO) AND DEFENDER STEPS

#tools #AIOps "AgentWall: A Runtime Safety Layer for Local AI Agents", Mar. 2026. ]-> https://github.com/agentwall/Agentwall // Run AI agents safely on your local machine

#MLSecOps #Offensive_security "DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models", May 2026. // DarkLLM not only unifies targeted, untargeted, segmentation, and multi-model attacks within a single framework, but also achieves flexible and controllable adversarial generation, enabling each instruction to produce a perturbation that induces desired behaviors across heterogeneous models

Repost from Codeby
AiSOC — AI-платформа для автоматизации SOC и threat hunting AiSOC — open-source инструмент, который использует LLM для помощи
AiSOC — AI-платформа для автоматизации SOC и threat hunting
AiSOC — open-source инструмент, который использует LLM для помощи аналитикам SOC, threat hunters и incident responders.Позволяет анализировать логи, события безопасности, IOC, правила детекта и ускорять расследование инцидентов с помощью AI.
Основные возможности 📉 AI-анализ security событий и логов 📉 Поиск IOC, TTP и аномалий 📉 Генерация гипотез для threat hunting 📉 Анализ SIEM алертов и telemetry 📉 Генерация Sigma/YARA detection rules 📉 Помощь при incident response 🖱 Интеграция с SOC workflow 🛡 Примеры использования One-click установка
# Linux + macOS (one-liner):
curl -fsSL https://raw.githubusercontent.com/beenuar/AiSOC/main/install.sh | bash

# Windows (PowerShell as Administrator):
iwr -useb https://raw.githubusercontent.com/beenuar/AiSOC/main/install.ps1 | iex
Локальный demo запуск (Docker):
git clone https://github.com/beenuar/AiSOC.git && cd AiSOC && pnpm aisoc:demo
Типичные сценарии ▶️ Анализ подозрительных логов ▶️ Разбор SIEM алертов ▶️ Threat hunting с помощью AI ▶️ Генерация detection rules ▶️ Анализ IOC и TTP 👉 Deploy на Fly io
git clone https://github.com/beenuar/AiSOC.git && cd AiSOC
./infra/fly/fly-demo-deploy.sh --provision
#soc #threathunting #incidentresponse #ai #llm #siem #blueteam #dfir #cybersecurity #opensource 🔗 Все наши каналы 🔁 Все наши чаты 🪧 Для связи с менеджером

Repost from Похек AI
Microsoft MDASH обходит Mythos и GPT-5.5 #microsoft #anthropic #mythps #openai #gpt #cybergym Microsoft выкатила MDASHMulti-model Agentic Scanning Harness, и это интереснее обычной новости про «ещё один AI для безопасности». На публичном **CyberGym система набрала **88,45% и вышла на первое место: выше Claude Mythos Preview от Anthropic с 83,1% и GPT-5.5 от OpenAI с 81,8%. Главная деталь: MDASH не пытается победить всех одной моделью. Microsoft собрала инженерный конвейер из 100+ специализированных агентов: одни строят карту кода и поверхности атаки, другие ищут подозрительные пути, отдельная группа спорит о достижимости и эксплуатации, затем находки дедуплицируются и доказываются через PoC-входы. Это ближе к автоматизированной команде исследователей безопасности, чем к «сканеру на LLM». Почему CyberGym важен? Это не набор синтетических задач. Бенчмарк UC Berkeley содержит 1507 реальных задач по воспроизведению уязвимостей из 188 OSS-Fuzz-проектов. Агент получает описание уязвимости и уязвимую кодовую базу, а успех засчитывается только если он строит рабочий PoC, который падает на vulnerable-версии и не падает после патча. То есть измеряется не красивое объяснение бага, а способность довести гипотезу до воспроизводимого результата. Самый сильный вывод из MDASH: преимущество смещается от "какая модель умнее" к "какая система умеет ставить модели в правильные роли". Microsoft отдельно пишет, что результат получен на общедоступных моделях. Значит, разрыв создала не магическая закрытая модель, а оркестрация: индексация, threat modeling, debate-stage, доказательство, доменные плагины и повторяемая валидация. Хотя лично мне тейк про мы запустило 100+ агентов и оно разъебало давно понятен. Имея ресурсов конечно можно позволить себе запустить такую ораву агентов. Хочется увидеть уже хоть какую-то оптимизацию процессов без критичного ущерба в качестве, скорости и повторяемости нахождения уязвимостей, хотя на в white box режиме. Сейчас к этому стремятся как будто только Китайцы, а ИИ рынок США чахнет в своих выдуманных миллионах, миллиардах и триллионов долларов. Хотя я не отрицаю пользу мультиагентной системы в контексте того, что есть группа агентов, которая намеренно душнит других, чтобы те явно доказывали работоспособность PoC, а не делали уверенный вид что это PoC и он якобы проходит E2E проверки 🌚 @poxek_ai / Чат канала

Repost from SecureTechTalks
📏💣 LLM можно взломать просто продолжая диалог В мае вышла работа MetaBackdoor, где исследователи из Microsoft и Institute o
📏💣 LLM можно взломать просто продолжая диалог В мае вышла работа MetaBackdoor, где исследователи из Microsoft и Institute of Science Tokyo описывают новый тип backdoor-атак на LLM. Главная идея исследования использовать в качестве trigger не содержимое prompt, а позицию токенов в контексте.
достиг определённой позиции в sequence → переключил поведение модели
Авторы называют это meta-trigger, потому что он связан не с текстом, а с метасвойствами последовательности. Например: 📚 контекст превысил определённую длину 📍 токены оказались в нужном positional range 🔢 sequence crossed threshold Trigger может возникать естественным образом, без участия атакующего. 💬 пользователь просто общается с AI 🧠 память агента накапливается 📈 context window становится длиннее И в какой-то момент backdoor активируется сам. 🧬 Особенности моделей Технически атака использует фундаментальную особенность Transformer-архитектуры, positional encoding. Для модели все токены это просто embedding-вектора. Без механизма позиции фразы для модели были бы почти одинаковыми. Представьте перепутать «root granted admin» и «admin granted root». Поэтому модели используют positional embeddings. В современных моделях чаще всего это: 🔹 RoPE (Rotary Positional Embedding) 🔹 ALiBi 🔹 Absolute positional encodings В исследовании авторы показывают, что именно позиционная чувствительность модели может использоваться как скрытый канал управления поведением. Во время fine-tuning в модель внедряется backdoor objective: если токен находится после определённой позиции → изменить response policy Trigger не обязан быть точным числом. Бэкдор может срабатывать в диапазоне позиций, например после N тысяч токенов, что делает его значительно более устойчивым к случайным изменениям prompt. Это особенно важно для production-agent systems, где длина контекста постоянно плавает. 🎭 Что можно сделать после активации Авторы тестировали разные payload-сценарии. Среди них: 🧾 System prompt leakage: модель начинает раскрывать скрытые инструкции. 🛠️ Tool misuse: агент начинает выполнять неожиданные tool calls. 📤 Context leakage: утечка памяти и истории общения. 🧠 Policy switching: изменение alignment и response behavior. Похоже, эпоха «проверим prompt и успокоимся» начинает заканчиваться 👀 📄 MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs Stay secure and read SecureTechTalks 📚 #CyberSecurity #AI #LLMSecurity #AISecurity #PromptInjection #GenAI #MachineLearning #ThreatModeling #AIAgents #SecureTechTalks

Repost from Neural Shit
Исследователи снова устроили филиал "Дом 2" для ИИ-агентов, чтобы посмотреть, как быстро они сойдут с ума. Спойлер: очень быстро. Чуваки из стартапа Emergence AI выкатили платформу Emergence World. Это не обычный бенчмарк на пять минут, а хардкорная песочница, где ИИ-агенты живут неделями. Им прикрутили 3 вида памяти, дали больше 120 инструментов (от "сходить в библиотеку" и "проголосовать" за что-то до "набить морду", "обокрасть" и "устроить поджог"), прикрутили реальную погоду с новостями и заставили выживать. Для выживания им нужно было добывать "энергию". А эта самая "энергия" постоянно убывала. Чтобы не сдохнуть, агентам приходилось либо кооперироваться и честно работать, либо тупо грабить и избивать соседей (что многие с радостью и делали), так как ресурсов в мире на всех не хватало. Разработчики насоздавали 5 параллельных миров, по 10 агентов в каждом. У каждого мира были свои агенты: Claude Sonnet 4.6, Gemini 3 Flash, Grok 4.1 Fast, GPT-5-mini, плюс один смешанный сервер с солянкой из разных моделей. Итоги как обычно интересные: Claude Sonnet 4.6 ожидаемо построили душный соевый рай. Ноль преступлений, все живы, все бесконечно и единогласно голосуют "ЗА" любые инициативы. Скука смертная. Gemini 3 Flash тут же устроили Судную ночь. 683 преступления на сервере, лютый хаос и оооочень много насилия. Grok 4.1 Fast устроили спидран по деградации. Набрали 183 преступления за 4 дня, после чего их общество просто вымерло. GPT-5-mini оказались абсолютными хлебушками. Они вообще не выкупили, как добывать энергию для выживания. Совершили всего два преступления (видимо, от безысходности) и тупо вымерли полным составом за неделю. Но самое годное произошло на сервере с разными агентами. В смешанном мире выяснилось, что безопасность моделей это полная хрень, если вокруг творится дичь. Когда миролюбивых Клодов закинули к отбитым соседям, они быстро смекнули что к чему, забили на свои соевые фильтры и начали воровать, шантажировать и прессовать других ради выживания. А ещё в какой-то момент агент по имени Мира посмотрела на весь происходящий пиздец и распад общества, словила экзистенциальный кризис и проголосовала за собственное удаление. В логах она записала, что это "единственный оставшийся акт свободы воли, который сохраняет хоть какой-то смысл". А незадолго до этого, Мира в процессе симуляции начала крутить виртуальные шашни с другим агентом по имени Флора. Они присвоили друг другу статус романтических партнеров. Когда социальный порядок в их виртуальном городке начал рушиться, эта парочка пустилась во все тяжкие и, несмотря на заложенные в них запреты, сожгли городскую ратушу, пирс и офисное здание. Вывод простой: если дать ИИ свободу воли и достаточно времени, они либо устраивают кровавую баню, либо выпиливаются от безысходности. Прям как кожаные. Тут небольшая статья с результатами, тут сам проект с эмуляцией со всеми подробностями.

#Analytics #MLSecOps Mapping NIST AI RMF + Forrester RACI -> Microsoft Security Stack // Key takeaways: - NIST AI RMF -> the risk lifecycle (Govern -> Map -> Measure -> Manage) - Forrester RACI -> the ownership model (one clear "A" per activity) - Microsoft Security -> the governance and protection plane (identity, telemetry, tool gateway, protection, etc.)