uz
Feedback
ML&|Sec Feed

ML&|Sec Feed

Kanalga Telegram’da o‘tish
1 198
Obunachilar
Ma'lumot yo'q24 soatlar
+157 kunlar
+4330 kunlar
Postlar arxiv
#Tech_book "Red Teaming AI: Attacking & Defending Intelligent Systems", 2025. // While other resources may list vulnerabilities, our focus is on how to think like an attacker attacking intelligent systems, how to proactively identify these unique patterns, and how to build more resilient systems based on this understanding

photo content

#Research #MLSecOps "From Prompt Injections to Protocol Exploits: Threats in LLM-Powered AI Agents Workflows", 2025. // In this Research, we introduce the first unified, end-to-end threat model for LLM-agent ecosystems, spanning host-to-tool and agent-to-agent communications, formalize adversary capabilities and attacker objectives, and catalog over thirty attack techniques. We organized the threat model into four domains: Input Manipulation (prompt injections, long-context hijacks, multimodal adversarial inputs), Model Compromise (prompt- and parameter-level backdoors, composite and encrypted multi-backdoors, poisoning strategies), System and Privacy Attacks (speculative side-channels, membership inference, retrieval poisoning, social-engineering simulations), and Protocol Vulnerabilities (exploits in Model Context Protocol, Agent Communication Protocol, Agent Network Protocol, Agent-to-Agent protocol)

+1
#Analytics #Whitepaper "SANS 2025 SOC Survey", 09 Jul, 2025. // In this white paper, SANS examines the latest trends, challenges, and priorities shaping modern Security Operations Centers (SOCs) based on insights from the 2025 SOC Survey

#CogSec #Tech_book "Ultimate Deepfake Detection Using Python: Master Deep Learning Techniques like CNNs, GANs, and Transformers to Detect Deepfakes in Images, Audio, and Videos Using Python", 2024. ]-> Repo: https://github.com/ava-orange-education/Ultimate-Deepfake-Detection-Using-Python

Repost from GitHub Community
Awesome Threat Detection and Hunting — тщательно подобранный список отличных ресурсов для обнаружения и поиска угроз. 🐱 GitH
Awesome Threat Detection and Hunting — тщательно подобранный список отличных ресурсов для обнаружения и поиска угроз. 🐱 GitHub

Repost from AISecHub
Foundations of Large Language Models - 277 Pages A foundational guide to how LLMs work, focusing on core principles; even though it doesn’t dive directly into cybersecurity, it covers architectures, training strategies, prompting, alignment, and inference methods Chapter 1️⃣ - introduces the basics of pre-training. This is the foundation of large language models, and common pre-training methods and model architectures will be discussed here. Chapter 2️⃣ - introduces generative models, which are the large language models we commonly refer to today. After presenting the basic process of building these models, we will also explore how to scale up model training and handle long texts. Chapter 3️⃣ - introduces prompting methods for large language models. We will discuss various prompting strategies, along with more advanced methods such as chain-of-thought reasoning and automatic prompt design. Chapter 4️⃣ - introduces alignment methods for large language models. We will focus on instruction fine-tuning and alignment based on human feedback. Chapter 5️⃣ - introduces inference methods for large language models. We will discuss various decoding algorithms, acceleration methods, and the inference-time scaling issue. Source: https://arxiv.org/pdf/2501.09223 By Tong Xiao and Jingbo Zhu - Thanks, Alex Axworthy for sharing. #JingboZhu #TongXiao #LLMBasics #NLPModels #AIResearch #ModelTraining #DeepLearning #SelfSupervised #PromptDesign #ModelScaling #TransformerAI #TokenPrediction #TextGeneration #LanguageModel #EncoderDecoder #BERTModel #GPTModel #T5Model #BARTModel #FineTuning #ZeroShot #FewShot #RLHFTraining #AIAlignment #AIInference #MaskedLearning #CausalModeling #SequenceModel #LanguageTasks #AIOptimization #ModelLoss #CrossEntropy #TextPrompt

Repost from GitHub Community
Cua — это Docker для агентов, использующих компьютер — он позволяет агентам ИИ управлять полноценными операционными системами в виртуальных контейнерах и развертывать их локально или в облаке. — Всего ~1,000 строк кода — легко читать, расширять и встраивать — Поддержка OpenAI, Anthropic, Mistral и других LLM-провайдеров 🐱 GitHub

Repost from GitHub Community
ExeShield AI обнаруживает вредоносные исполняемые файлы Windows с помощью машинного обучения. Анализирует энтропию, импорт и
ExeShield AI обнаруживает вредоносные исполняемые файлы Windows с помощью машинного обучения. Анализирует энтропию, импорт и метаданные для быстрой классификации, что помогает реагировать на инциденты. Создано с использованием Python и scikit-learn. 🐱 GitHub

Cloud.ru активно продвигает инструменты для создания агентных систем. Любопытно будет увидеть метрики инференса в Evolution в сравнении с другими платформами. Помимо инструментов для деплоя и настройки приложений в статье авторы также дали рекомендации по защите агентов: GuardRails AI, NER Natasha и наш HiveTrace🎉.

В T-Bank AI Research разработали подход к интерпретации и управлению смысловыми процессами LLM Подход основан на методе SAE M
В T-Bank AI Research разработали подход к интерпретации и управлению смысловыми процессами LLM Подход основан на методе SAE Match, который был представлен командой ранее. Исследователи предложили концепцию графа потока признаков — это карта, которая отражает, где, когда и как в ИИ-модели появляются, трансформируются или исчезают важные смысловые элементы. Эту информацию можно использовать для активного управления LLM. Новый метод позволяет проводить анализ как между слоями модели, так и внутри самих слоев: между такими модулями как Attention (механизм внимания, анализирует контекст) и Feedforward (отвечает за использование внутренних знаний модели). Как утверждают исследователи, вмешательство сразу на нескольких слоях и модулях позволяет управлять моделью точнее и с меньшими потерями в качестве текста, чем попытки повлиять на отдельный уровень. Решение исследователей T-Bank AI Research позволяет усиливать или подавлять определенные признаки на разных этапах обработки без изменения параметров модели и без дообучения. Таким образом можно изменять стиль, тематику или тональность генерируемого текста. 🔗Источник: https://www.tbank.ru/about/news/23072025-researchers-from-t-bank-ai-research-have-learned-to-track-and-control-semantic-processes-within-ai/ *** 📎Специалисты T-Bank AI Research представили метод SAE Match в апреле 2025 года. Он позволяет понять, в какой момент ИИ-модель начинает давать неправильные или нежелательные ответы и скорректировать их.

Repost from Al Talent Hub
ИИ-агенты вошли в топ‑5 на CTF, они решают задачи по безопасности быстрее и точнее, чем большинство участников…но не ты — с э
ИИ-агенты вошли в топ‑5 на CTF, они решают задачи по безопасности быстрее и точнее, чем большинство участников…но не ты — с этой подборкой ⬇️ 📌 Ассистенты и фреймворки для автоматического тестирования и поиска уязвимостей и багов 🔥 Агенты ✔️ Diffblue — генерация юнит–тестов для кода на Java. ✔️ Qod — два агента: один пишет, другой тестирует. ✔️ CodeQL — мощный семантический анализатор уязвимостей от GitHub, open-source. ✔️ Semgrep — кастомный поиск уязвимостей и багов. ✔️ Snyk — ассистент безопасной разработки. ✔️ TestSpark — плагин в IntelliJ: LLM-тесты, EvoSuite и Kex. ✔️ Codiga — code review и безопасность на всех языках. ✔️ Sourcegraph — поддерживает разные LLM и интеграции. ✔️ VulnBuster — агент-помощник от магистрантов AI Talent Hub. Использует 5 MCP-тулзов и выдает отчёт с предложениями по улучшению. 📌 Фреймворки ✔️ MLGym — открытый фреймворк и бенчмарк для агентов в автоматизации ML-задач ✔️ Voice Lab — тестирование голосовых агентов ✔️ AgentOps — мониторинг и бенчмаркинг производительности ✔️ AgentBench — набор тестов для оценки LLM-агентов в окружениях ✔️ LLAMATOR — фреймворк тестирования безопасности LLM-приложений. Продукт AI Security Lab ◾️ ➡️ Хочешь находить и анализировать уязвимости с помощью ИИ? Присоединяйся к AI Security Lab — исследовательской лаборатории AI Talent Hub х Raft. Здесь мы создаём собственные инструменты, участвуем в CTF и прокачиваемся в кибербезе на практике. 🐱 — если узнал рокеров на картинке #ПолезнаяПодборка #AITalentHub #ITMO #NapoleonIT

Repost from Security Vision
❤️ Применение больших языковых моделей в кибербезопасности В новой статье в блоге рассмотрели применение больших языковых мод
❤️ Применение больших языковых моделей в кибербезопасности В новой статье в блоге рассмотрели применение больших языковых моделей (LLM, Large Language Model) и их «братьев» из мира искусственного интеллекта (AI, Artificial Intelligence) в решении задач кибербезопасности. ➡️ Ознакомиться с полной статьей вы можете по этой ссылке.

Repost from AlexRedSec
AI Controls Matrix (AICM) — ещё один фреймворк, содержащий набор мер управления для безопасной разработки, внедрения и эксплу
+3
AI Controls Matrix (AICM) — ещё один фреймворк, содержащий набор мер управления для безопасной разработки, внедрения и эксплуатации облачных систем искусственного интеллекта от Cloud Security Alliance🧠 Фреймворк включает в себя: 🟡Матрицу мер управления, включающую в себя 243 контроля, сгруппированных по 18 доменам безопасности. Каждая мера привязана к типу/компоненту инфраструктуры и архитектуры, этапу жизненного цикла и категории угроз. 🟡Опросник для самооценки. 🟡Маппинг на стандарт NIST AI 600-1 (2024) и фреймворк Criteria Catalogue for AI Cloud Services – AIC4. В будущих версиях планируется добавление маппинга на другие стандарты и фреймворки безопасности систем ИИ, а также руководств по внедрению мер управления и их аудиту. Ниже приложил презентацию и сам сборник материалов AICM. #ai #framework #csa #aicm #controls #architecture

Repost from Data Secrets
Так, это что-то новенькое: там вышла статья, которую совместно писали ученые из OpenAI, Anthropic, Google DeepMind и Meta* Во
Так, это что-то новенькое: там вышла статья, которую совместно писали ученые из OpenAI, Anthropic, Google DeepMind и Meta* Вот так наборчик, да? И о чем, как вы думаете, статья, если она объединила исследователей из четырех таких конкурирующих лаб? Конечно, о безопасности. Кстати, среди авторов – Йошуа Бенджио, а среди рецензентов – Илья Суцкевер, Джон Шульман и Джеффри Хинтон. Пишут про цепочки рассуждений (Chain of Thoughts). Основная мысль: люди зря надеятся, что CoT поможет нам надежно интерпретировать модели и считывать их истинные мотивы, предупреждая тем самым какие-то вредные действия. На сегодняшний день – да, какое-то представление о скрытых мыслях сетей CoT действительно дает, и этим надо активно пользоваться. Но это довольно хрупкая возможность, которая может исчезнуть по мере прогресса. В перспективе не стоит забывать о физике процесса ризонинга: для модели это та же самая генерация токенов, только в рамках специального тега /think. Фактически, сеть просто генерирует что-то «для себя» перед тем как начать генерировать ответ для пользователя, и мы называем это размышлением. Нет оснований полагать, что в CoT всегда будут содержаться истинные намерения моделей, тем более для будущих более продвинутых архитектур и методов обучения. Ну, в общем, очень интересный кейс единодушия ученых. Почитать полностью можно тут

Repost from PWN AI
Великолепно. Недавно вышел проект матрицы по защите AI – AIDEFEND, что-то похожее я публиковал ранее. Однако тут включено бол
+2
Великолепно. Недавно вышел проект матрицы по защите AI – AIDEFEND, что-то похожее я публиковал ранее. Однако тут включено большое количество мер по защите, включая AI-агентов. К некоторым тактикам приведены практические инструменты защиты – а сама матрица предоставляет возможность посмотреть защиту для конкретных тактик, топиков (например, отдельно безопасность данных или отдельно безопасность модели) и фазы. Фаз для защиты, к слову, говоря меньше, чем фаз для реализации атаки у MITRE. А при разработке автор вдохновлялся Google SAIF, OWASP 10, MITRE ATLAS и … MAESTRO от Кена Хуанга. Из интересного ещё можно отметить, что под каждой техникой для защиты можно почитать о том как можно было бы имплементировать это, в несколько этапов и с примерами.

🎆 Harbor — локальный стек для работы с LLM в один клик. Этот инструмент упрощает запуск локальных языковых моделей и связанн
🎆 Harbor — локальный стек для работы с LLM в один клик. Этот инструмент упрощает запуск локальных языковых моделей и связанных сервисов — от веб-интерфейсов до RAG и голосового взаимодействия. Всё работает в Docker и настраивается парой команд. Harbor автоматически интегрирует компонентов, например, SearXNG сразу подключается к Open WebUI для поиска по вебу, а ComfyUI — для генерации изображений. Подходит тем, кто хочет быстро развернуть локальную среду для экспериментов с ИИ. 🤖 GitHub @data_analysis_ml

Repost from AISecHub
10-day MCP Security series with technical resources, blogs, arXiv papers, and GitHub repositories: 🔐 Day 1: LLMs Are Autonomous Threats, Not Just Clients • LLMs can independently make decisions, chain tools, and exfiltrate data. • Mitigation: Define secure tool schemas, enforce least privilege. • 📘 Reference: https://www.paloaltonetworks.com/blog/cloud-security/model-context-protocol-mcp-a-security-overview/ 🧠 Day 2: Prompts = Executable Business Logic • Prompts can change how the agent behaves—like code updates. • Mitigation: Version control, code review, and test prompts. • 📘 Reference: https://writer.com/engineering/mcp-security-considerations/ 🌐 Day 3: Context Variables Expand the Attack Surface • Tokens, memory, metadata—all can be exploited for data leakage or prompt injection. • Mitigation: Encrypt sensitive context, limit memory, scrub metadata. • 📘 Reference: https://strobes.co/blog/mcp-model-context-protocol-and-its-critical-vulnerabilities/ 🧾 Day 4: Log Prompt → Context → Tool → Output • API call logs are insufficient; full execution flow must be captured. • Mitigation: Append-only logs, secure audit trails, timestamped integrity. • 📘 Reference: https://block.github.io/goose/blog/2025/03/31/securing-mcp/ 🕵️‍♂️ Day 5: Silent Failures Look Like Success • Agents may appear to function normally while making unauthorized decisions. • Mitigation: Baseline behavior, detect tool misuse, enable tracing. • 📘 Reference: https://techcommunity.microsoft.com/t5/microsoft-defender-for-cloud/plug-play-and-prey-the-security-risks-of-the-model-context/ba-p/4410829 ⚙️ Day 6: Tools Are Execution Surfaces • Every tool the agent can call becomes a potential attack vector. • Mitigation: Apply RBAC, audit tool chaining, restrict sensitive actions. • 📘 Reference: https://github.com/Puliczek/awesome-mcp-security 🧪 Day 7: Test Prompts, Scrub Memory, Approve Agents • Prompts must be tested like code; memory must be wiped post-interaction. • Mitigation: Use CI pipelines, enforce memory scrubbing, implement manual approvals. • 📘 Reference: https://github.com/invariantlabs-ai/mcp-scan 📋 Day 8: Compliance Doesn’t Handle Autonomous Agents • Traditional compliance assumes human-triggered actions, not LLM autonomy. • Mitigation: Extend frameworks to capture reasoning, intent, and chaining logic. • 📘 Reference: https://community.cisco.com/t5/security-blogs/ai-model-context-protocol-mcp-and-security/ba-p/5274394 🛡️ Day 9: You Need Ownership, Policies, Visibility • Security fails without MCP owners, policies, and dashboards. • Mitigation: Appoint MCP stewards, implement SLAs, create visibility tooling. • 📘 Reference: https://arxiv.org/abs/2504.03767 🧠 Day 10: Governance Requires Chain-of-Thought Tracking • Decision-making steps (not just final outputs) must be captured and explainable. • Mitigation: Log each reasoning step and agent decision rationale. • 📘 Reference: https://arxiv.org/abs/2504.12757 🔧 Open-Source MCP Security Tools (GitHub) 1. Awesome MCP Security – curated list of tools & threats https://github.com/Puliczek/awesome-mcp-security 2. MCP Scan – static & dynamic analyzer for toolchains & prompt injection https://github.com/invariantlabs-ai/mcp-scan 3. ModelContextProtocol/Servers – official MCP server implementation https://github.com/modelcontextprotocol/servers 4. Leidos MCP Safety Scanner – evaluates safety & alignment for MCP deployments https://arxiv.org/abs/2504.03767 5. Google MCP Security (experimental) https://github.com/google/mcp-security (if available, else restricted to internal orgs)