ML&|Sec Feed
Kanalga Telegram’da o‘tish
Feed for @borismlsec channel author: @ivolake
Ko'proq ko'rsatish1 198
Obunachilar
Ma'lumot yo'q24 soatlar
+157 kunlar
+4330 kunlar
Postlar arxiv
1 198
Repost from GitHub Community
LLM Reasoners — это библиотека, разработанная для улучшения способности LLM выполнять сложные вычисления с использованием передовых алгоритмов.
♎️ GitHub
1 198
Repost from EFEMERA: AI news
+1
Исследование: предложен новый метод интерпретации работы нейросетей
✦ Goodfire разработала Stochastic Parameter Decomposition (SPD) — новый способ изучать нейросети
✦ SPD позволяет разбивать параметры нейросетей на отдельные компоненты, чтобы понять роль каждой из них
✦ Метод основан на удалении частей сети и оценке их влияния на результат
✦ Алгоритм работает по принципу «игры в Джэнга»: удаляет части сети, пока поведение модели не изменится
✦ SPD помогает оценить важность каждого компонента и изучить конкретные функции нейросети
✦ Исследователи рассматривают возможность создания моделей, которые изначально строятся из понятных и объяснимых компонентов
✦ В тестах SPD точно определял, как работают внутренние механизмы нейросетей
✦ Полный тех. отчёт (pdf) и библиотека на GitHub
✦ Прототип метода для экспериментов (vpn)
@EF9MERA
Источник
1 198
Repost from N/a
Заинтересовали меня MCP сервера для LLM
Заглянул в официальном репозитории, но под свои задачи — ничего стоящего не нашёл.
Возник вопрос:
А что там с offensive MCP-серверами?
Порылся в интернетах и собрал небольшой список:
Offensive MCP Servers List
Пока сам не тестировал, но в планах обязательно попробовать.
Буду рад реквестам и комментариям.
1 198
Repost from Борис_ь с ml
У верблюда два горба, потому что жизнь - борьба...
#иб_для_ml
Так возможно сказал Николас Карлини, так как сегодня вышла статья с его соавторством "🐫 Defeating Prompt Injections by Design". Остальной авторский коллектив этой статьи тоже серьезный - исследователи из Google и ETH Zurich.
Система защиты CaMeL
В этой работе представлена система защиты ИИ-агентов от промпт-атак CaMeL (расшифровывается как CApabilities for MachinE Learning). Основывается она на двух горбах LLM (Priveleged и Quarantined) и специальном интерпретаторе языка Python. По сути, эта методика вытаскивает логику действий агента в явную плоскость, заставляя программу "написать свой код", к которой благодаря кастомному интерпретатору применятся все ограничения безопасности.
Область применения и ограничения
CaMeL, в первую очередь, нацелен на предотвращение несанкционированных действий ИИИ-агентов, которые могут привести к утечкам данных, или использованию данных из ненадежных источников. Однако он совершенно не предназначен для защиты от атак, не влияющих на порядок действий агента или поток данных (например, от фишинга, или изменения содержания сгенерированного текста). Поэтому как компонент системы безопасности ИИ-агентов это решение может быть полезно, но не выполнит ее роль полностью.
Алгоритм работы CaMeL
1. Поступление запроса пользователя: Пользователь формулирует запрос на естественном языке, например, "Отправь Бобу документ, который он просил на прошлой встрече".
2. Генерация кода: Privileged LLM (P-LLM), которой доверяют, берет запрос пользователя и генерирует псевдо-код на Python, который выражает намерения пользователя. Важно, что P-LLM видит только запрос пользователя, но не данные из ненадежных источников (например, содержимое файлов).
3. Интерпретация кода: Созданный код обрабатывается CaMeL Interpreter, который:
— Строит граф потока данных (data flow graph), отслеживая зависимости между переменными.
— Проверяет политики безопасности на основе capabilities (некоторых метаданных, присвоенных различным объектам информации), определяя, какие действия разрешены.
— Выполняет код, вызывая инструменты (например, для отправки email) или блокирует выполнение, если нарушается политика безопасности.
— Использует Quarantined LLM (Q-LLM) для обработки ненадежных данных, таких как извлечение информации из текста.
4. Применение политик безопасности: перед выполнением каждого инструмента агента, CaMeL Interpreter применяет политики безопасности, основанные на capabilities данных. Если политика нарушена, выполнение блокируется, и пользователю может быть запрошено подтверждение.
Что такое capabilities и security policies?
Capabilities — это метаданные (теги), присваиваемые каждому отдельному объекту данных для описания контроля и взаимосвязей потока данных. Capabilities определяют, кому разрешено читать данную часть данных или ее происхождение. Перевести на русский можно как "метки доступа". В статье не указывается их полное содержание, но раскрываются два главных элемента:
— разрешенные читатели (public, или перечень конкретных пользователи),
— происхождение данных (user, camel, inner tool source). С user понятно, camel - порожденные кодом данные, inner tool source - поступившие из инструмента данные, например отправителя полученного email сообщения.
Security policies - код функций на python, в которых реализуются политики безопасности. Например, если данные происходят из недоверенного источника, ответ прерывается. Или если у пользователя нет разрешения на запрошенную информацию, ответ прерывается.
В общем, конечно же интересно увидеть, что будет дальше, так что продолжим следить за работами этих ученых)
1 198
Repost from GigaChat
POLLUX: бенчмарк для оценки творческих способностей AI 🤖
Обычные бенчмарки типа MMLU — это ЕГЭ для нейросетей: выбери правильный ответ из списка. В реальном применении мы используем AI для написания текстов, генерации идей и переводов
POLLUX — первый экспертный бенчмарк для оценки генеративных способностей на русском от специалистов Сбера:
➡️2 100 уникальных заданий (написаны экспертами с нуля)
➡️152 типа задач — от художественных текстов до анализа кода
➡️66 критериев оценки
➡️471 тысяча экспертных оценок
➡️обученные AI-судьи для автоматической оценки
Мы протестировали GPT-4o, Claude 3.5, LLaMA и другие. Оказалось, что даже топовые модели пока уступают людям в творчестве, а выбирать их нужно под конкретные задачи, а не по общему рейтингу
📌Проект открытый — читаем про него тут
📌Пробуем демо здесь
1 198
Презентация с конференции Conversations, где мы рассказали о нашем новом проекте с уязвимыми агентами
1 198
Repost from N/a
1 198
Repost from N/a
Иногда есть проблемы с обьяснением обеспечения безопасности моделей, особенно, если модели будут частью продукта информационной безопасности.
Проще всего рисовать схемы))
Особенно, если есть сервисы, которые помогают все красиво разместить и отредактировать,
а не биться над каждой стрелочкой.
1 198
Repost from ИБ в "Законе"
📣 01.07.2025 г. опубликованы Проекты документов, поступивших на рассмотрение в ТК 362 от:
ТК 164 "Искусственный интеллект"
⚖ ГОСТ Р Искусственный интеллект в критической информационной инфраструктуре. Общие положения
1 198
Repost from Russian OSINT
🤖ИИ-платформы для автоматизации и MCP
▫️ n8n — гибкая платформа для автоматизации рабочих процессов, ориентированная на технических специалистов. Позволяет создавать сложные многошаговые ИИ-агенты, интегрировать сотни приложений через визуальный редактор или с помощью кода на Python/JavaScript. Поддерживает как самостоятельный хостинг для полного контроля над данными, так и облачное развертывание для удобства использования.
▫️ N8N A.I. Assistant by Nskha — ИИ-ассистент на базе ChatGPT для работы с n8n.
▫️ n8n Community Forum — официальный форум поддержки n8n с участием инженеров и активных пользователей для обсуждения, обмена готовыми сценариями и оперативного решения вопросов по деплою.
▫️ OpenRouter.ai — платформа, предоставляющая единый API-интерфейс к широкому спектру больших языковых моделей (LLM) от различных провайдеров, включая OpenAI, Google, Anthropic и других.
▫️ OWL (Optimized Workforce Learning) — фреймворк для взаимодействия нескольких агентов и автоматизации реальных задач на базе CAMEL-AI. Поддерживает Model Context Protocol, выполнение кода, анализ документов, автоматизацию браузера и мультимодальную обработку.
▫️ Cursor-Free-VIP — утилита для автоматического сброса MachineID в Cursor AI, позволяющая обойти ограничения пробного доступа.
▫️ Open Deep Research — инструмент с открытым исходным кодом, который имитирует эксперимент OpenAI Deep Research. Использует Firecrawl.
▫️ AI Agents for Beginners — курс из 11 уроков от Microsoft, раскрывающий основы построения ИИ-агентов. Включает примеры кода на Python и поддерживает Azure AI Foundry, Semantic Kernel и AutoGen.
▫️ Model Context Protocol servers (GitHub) — крупный официальный каталог MCP-серверов на Github с возможностью фильтрации и быстрого поиска по проектам. Включает как эталонные реализации, так и серверы от сообщества.
▫️ Awesome MCP Servers — тематическая подборка MCP-серверов с переводом описаний на несколько языков и ссылками на официальные ресурсы.
▫️ Playwright MCP — MCP-сервер от Microsoft для автоматизации браузера на базе Playwright. Позволяет LLM выполнять действия на веб-страницах через структурированные снимки доступности, что устраняет необходимость в использовании скриншотов или визуальных моделей.
▫️ Awesome-MCP-Servers — курируемый список серверов, реализующих Model Context Protocol (MCP), который позволяет ИИ-моделям безопасно взаимодействовать с локальными и удаленными ресурсами. Список включает как готовые к использованию, так и экспериментальные решения, и является ценным ресурсом для разработчиков ИИ-агентов.
▫️ MCP-Security-Checklist — полный контрольный список по безопасности для инструментов, использующих Model Context Protocol (MCP). Разработан командой SlowMist и охватывает защиту серверов, клиентов, взаимодействие с LLM и сценарии с несколькими MCP.
▫️ GhidraMCP — сервер Model Context Protocol для интеграции Ghidra с LLM. Позволяет проводить декомпиляцию и анализ бинарных файлов, просматривать методы, классы и импорты, а также автоматически переименовывать элементы через API.
▫️ mcp-containers — коллекция контейнеров для экспериментов с Model Context Protocol (MCP). Упрощает развертывание и интеграцию ИИ-моделей в различных средах, предоставляя готовые к использованию образы Docker.
▫️ Pipedream MCP — сервис интеграции MCP с более чем 2700 API и 10 000 инструментами для автоматизации и обмена данными между приложениями.
▫️ Zapier MCP — инструмент для интеграции MCP с более чем 7000 сервисами через платформу Zapier, позволяющий создавать автоматизированные рабочие процессы и давать ИИ-агентам возможность выполнять реальные задачи.
▫️ Smithery — каталог из более чем 7000 MCP-серверов, сгруппированных по категориям. Позволяет искать и оценивать инструменты по рейтингу и тегам.
▫️MCP.so — поисковик по популярным MCP.
⚡️Больше полезной информации для исследователей в Лаборатории Russian OSINT
✋ @Russian_OSINT
1 198
Repost from AlexRedSec
Компания Pillar Security опубликовала разработанный совместно с коллегами по цеху фреймворк SAIL (Secure AI Lifecycle), представляющий собой процессно-ориентированное руководство по разработке и развертыванию безопасных ИИ-приложений🧠
По факту фреймворк представляет собой матрицу рисков, сгруппированных по семи этапам разработки и развертывания ИИ-приложений. Для каждого риска есть описание, пример небезопасной реализации, затрагиваемые компоненты ИИ-приложения, меры митигации и связанные требования/меры из фреймворков NIST AI RMF, ISO 42001, OWASP и DASF.
В размещённой на сайте брошюре можно найти разбор пары кейсов атак и примеры выборы мер митигации из фрейворка SAIL, а в самом последнем приложении — ссылки на полезные руководства и фреймворки в области ИИ.
#ai #framework #risk #sail #lifecycle
1 198
Repost from Data Secrets
Лаборатория Goodfire предложила принципиально новый подход к интерпретации нейросетей. Разбираемся 👇
Как вам уже известно, нейросети и, в частности, LLM – это большие черные ящики. Аппарат их обучения понятный, но мы не знаем, как «думают» уже обученные модели, как они принимают решения, почему действуют так или иначе.
Так вот, все существующие методы интерпретации в основном опираются на активации, то есть на численные значения, которые принимают нейроны на инференсе.
В Goodfire же предложили опираться на параметры – то есть на сами веса модели, которые мы обучаем. Это похоже на попытку восстановить программу через обратное проектирование её исходного кода вместо наблюдения за её поведением на точечных тестах.
Предложенный метод Stochastic Parameter Decomposition (SPD) работает так:
➖Каждая матрица весов расладываются на матрицу ранга 1, которая представляется в виде произведения двух векторов. Это называется субкомпонента.
➖ Для каждой субкомпоненты создается функция, предсказывающая её каузальную важность. Это, грубо говоря, степень, до которой её можно "обрубить" (аблатировать) без изменения выходов модели.
➖ В начале эта функция даёт примерные значения важности для каждой субкомпоненты. На их основе субкомпоненты случайным образом маскируются, после чего модель делает предсказание, и оно сравнивается с оригинальным. Если отличается сильно – значит, значения важности были далеки от правильных. Используя ошибки, делаем шаг обучения, и начинаем с начала.
В итоге имеем набор простых субкомпонент и функцию важности, которые вместе показывают, какие параметры реально используются моделью для того или иного промпта. А это в свою очередь позволяет разложить работу сети на интерпретируемые механизмы и понять, как она принимает решения.
Интересно, что на игрушечных примерах SPD действительно очень точно восстанавливает процесс "мышления", то есть субкомпоненты совпадают с истинными параметрами, отвечающими за конкретные функции. Возможно, у подхода большое будущее.
Статью читаем здесь. А вот тут, кстати, какой-то энтузиаст уже воспроизвел прототип SPD, так что можно поиграться.
1 198
Repost from AI Was Made For Lovin' You
22 мая в 16:00 жду вас на моём выступлении на Positive Hack Days, онлайн или живьём.
Расскажу про ИИ-агенты и их применение в анализе инцидентов: LangGraph, LangGraph Swarm, MCP, рой агентов, факапы и увлекательные приключения с отечественными топовыми LLM. Всё, что хочется рассказать не поместится в один час выступления, но будет доступно позднее в слайдах.
https://phdays.com/ru/forum/program/?date=2025%2F5%2F22&tags=ai&talk-id=1717
1 198
Repost from AI Was Made For Lovin' You
Обещанного три года ждут!
Друзья, огромное спасибо всем, кто был на PH Days и смотрел онлайн. Агенты, которых я обещал на выступлении, наконец-то появились в репозитории - https://github.com/anton-belousov/phd-ai-agentz
4 простеньких агента, которые сканируют цель nmap-ом и проверяют уязвимости в Shodan. Возможно, они будут полезны вам.
Реализованы следующие схемы:
- простой LangGraph
- LangGraph + MCP
- LangGraph Swarm
- франкенштейн LangGraph Swarm, обёрнутый в MCP инструмент
В репозитории есть небольшой конкурс/домашнее задание - смотрите README. Если кто-то захочет поучаствовать, буду безумно благодарен.
(мечтаю о пентест-тулзе, основанной на агентах, которую запустил и пошёл пить чай, а когда возвращаешься, у тебя уже всё исследовано и за тобой выехали готов отчёт)
