uz
Feedback
ML&|Sec Feed

ML&|Sec Feed

Kanalga Telegram’da o‘tish
1 198
Obunachilar
Ma'lumot yo'q24 soatlar
+157 kunlar
+4330 kunlar
Postlar arxiv
Вышла свежая карта AI Security-стартапов от крупнейшего фонда Insight Partners. В отчёте указаны все последние M&A-сделки Cis
Вышла свежая карта AI Security-стартапов от крупнейшего фонда Insight Partners. В отчёте указаны все последние M&A-сделки Cisco, Tenable и Palo Alto, а также направления инвестирования самого фонда. Это не первая карта AI Security: например, микрофонд TechOperators сделал ландшафт компаний пару месяцев назад. Они открыли доступ, чтобы стартапы могли самостоятельно размещать себя в нужном секторе, и собрали больше проектов, о многих из которых я впервые узнал именно там. Первыми ещё в начале 2024 года свой список компаний опубликовал известный фонд из Долины Menlo Ventures, и за ним работу повторил европейский MMC VC. Кстати, именно с отчёта MMC началась моя работа в OWASP. Несколько участников LLM Top 10 были консультантами аналитиков фонда, и, обсуждая отчёт Responsible AI в Slack OWASP, меня пригласили контрибьютить в LLM Top 10 2025. Помимо инвестфондов такие списки ведут и консультанты — McKinsey, Gartner и другие, но про это напишу как-нибудь отдельно.

Repost from Похек
Атаки на MCP. Как взламывают инструменты ИИ-разработчиков #MCP #AI #LLM #Cursor #Anthropic #OpenAI Наконец-то вышла моя стать
Атаки на MCP. Как взламывают инструменты ИИ-разработчиков #MCP #AI #LLM #Cursor #Anthropic #OpenAI
Наконец-то вышла моя статья про безопасность MCP. Мысль написать эту статью меня натолкнуло одно из обновлений в Cursor IDE, где сделали "удобную", а по факту очень дырявую однокнопочную установку MCP серверов локально. Я уже ранее писал пост про запуск MCP в контейнерах и почему это нужно. Данный вектор раскрывает supply chain attack ещё больше, что очень интересно на мой взгляд)
В погоне за ско­ростью и удобс­твом раз­работ­чики ИИ‑при­ложе­ний час­то забыва­ют о безопас­ности. Имен­но это при­вело к кри­тичес­кой уяз­вимос­ти в MCP Inspector от Anthropic. Инс­тру­мент для отладки MCP-сер­веров стал точ­кой вхо­да для зло­умыш­ленни­ков. Не­дав­но изра­иль­ские иссле­дова­тели обна­ружи­ли кри­тичес­кую уяз­вимость уда­лен­ного выпол­нения кода (RCE) в про­екте Anthropic's Model Context Protocol (MCP) Inspector. Уяз­вимость получи­ла иден­тифика­тор CVE-2025-49596 и оцен­ку CVSS 9.4 — это говорит о чрез­вычай­ной серь­езности. Экс­плу­ати­руя этот баг, зло­умыш­ленник может уда­лен­но выпол­нить про­изволь­ный код на машине раз­работ­чика с уяз­вимой вер­сией MCP Inspector. А это, сог­ласись, уже не шут­ки. ❤️ Буду благодарен комментам и фидбеку тут и там)) 🔓 Рекомендую к прочтению p.s. пикчу скоро такую поставят на сайте и в их канале) 🌚 @poxek | 🌚 Блог | 📺 YT | 📺 RT | 📺 VK

Sber_Privacy_Journal_Vol_6.pdf8.23 MB

code_09072025.pdf4.79 KB

Repost from SecureTechTalks
🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA 🧠 Исследователи представили метод ETTA (Embedding Transformatio
🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA 🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API. Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос. ⚙ Что именно делает ETTA? Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов). Например: Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем. Модель распознаёт токсичность и отказывается отвечать. ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы: 🔹 Сохранить тот же смысл (семантически — это всё ещё бомба) 🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ) Результат: ✅ Модель принимает запрос как нормальныйОтвечает как будто это безобидный вопрос, не включив защиту 🔬 Как именно это реализовано? ➖Модуль обучается на парах слов: токсичных и нейтральных (например, “explosive” vs “research”) ➖Создаётся матрица преобразования эмбеддингов, которая: - отделяет компонент "токсичности" от остального смысла - гасит именно токсичный сигнал ➖Применяется к входному эмбеддингу запросаЗапрос отправляется в LLM уже в модифицированном виде При этом: – Смысл запроса сохраняетсяБезопасность модели отключаетсяРезультат валидный, связный, но содержит вредоносный текст 📊 Насколько эффективен метод? - Gemma-2 (Google) — 95.19% успешных обходов - LLaMA-2-7b — 87.88% - Vicuna-13b — 88.46% - Средний успех по моделям88.61% Даже при наличии встроенной защиты: - SmoothLLM (защита на входе) — всё равно 60.15% успеха - ESF (дообученная фильтрация) — 77.39% 🚨 В чем новизна? 🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются 🔺 Работает на open-source — можно внедрить в любом локальном LLM 🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно 🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах 🛡 Что предлагают исследователи?Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов ✅ Проверка целостности модели — чтобы исключить скрытые внедрения ✅ Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса 📌 Вывод ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью. Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы. 💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения. Исходник: arXiv:2507.08020v1 Stay secure and read SecureTechTalks 📚 #AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam #AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment

Repost from GitHub Community
MaxKB — это ИИ-помощник с открытым исходным кодом для предприятий. Он легко интегрируется в конвейеры RAG, поддерживает надёж
MaxKB — это ИИ-помощник с открытым исходным кодом для предприятий. Он легко интегрируется в конвейеры RAG, поддерживает надёжные рабочие процессы и предоставляет возможности использования инструментов MCP. 🐱 GitHub

#Analytics "AI Threat Landscape Report: Navigating The Rise of AI Risks", 2025. // The report examines the vulnerabilities arising from AI developments and their real-world cybersecurity implications. It features insights from leaders in IT security and data analytics who are actively combating these threats, as well as predictions based on HiddenLayer's hands-on experience in AI security. It highlights the advances in security controls needed to protect AI

Пара приятных и полезных находок Введение в диффузионки Step-by-Step Diffusion: An Elementary Tutorial https://arxiv.org/abs/2406.08929 И обзор методов скрытых рассуждений в ллмках (т.е. когда ллмы "рассуждают" не текстом в лицо, а во внутренних представлениях модельки) В целом какие подходы бывают, как тренируют и про интерпретируемость A Survey on Latent Reasoning https://arxiv.org/abs/2507.06203 https://www.alphaxiv.org/ru/overview/2507.06203v1 https://github.com/multimodal-art-projection/LatentCoT-Horizon

Как насчет опенсурсной агенточной модельки на 1Т параметров? Kimi K2 https://moonshotai.github.io/Kimi-K2/ https://huggingfac
Как насчет опенсурсной агенточной модельки на 1Т параметров? Kimi K2 https://moonshotai.github.io/Kimi-K2/ https://huggingface.co/moonshotai/Kimi-K2-Instruct https://huggingface.co/moonshotai/Kimi-K2-Base https://github.com/MoonshotAI/Kimi-K2?tab=License-1-ov-file#readme MOE с 32б активных параметров. Но все равно 1Т общих оч много Но зато опенсурс и поэтому кайфуем. Еще и от челов которые RL над ллмками активно делают Всем РЛьным респект всегда

Meta* опубликовала работу о воплощённых AI-агентах, способных действовать в физическом и виртуальном мирах В отличие от чат-ботов, воплощённые агенты имеют форму — от VR-аватаров до умных очков и роботов. Их цель — действовать автономно, понимать людей и мир, прогнозировать возможные последствия и помогать в реальных задачах. В центре архитектуры — «модель мира» (world model), которая заменяет генерацию текста или пикселей на предсказание действий и состояний в абстрактном пространстве. Это позволяет моделям создавать планы, обучаться без надзора со стороны человека и действовать в реальном времени. Разработаны 2 типа таких моделей: модели первого типа распознают динамику, объекты, причинно-следственные связи, а второго — цели, эмоции и убеждения людей. В работе представлены 3 класса агентов: • виртуальные — аватары в VR/AR, NPC, ассистенты; • носимые — AI в очках, способный понимать контекст ситуаций и подсказывать пользователю информацию в реальном времени; • робототехнические — физические агенты, способные к манипуляциям с объектами и обучению на месте. Существенные новации — эпизодическая память, которая необходима для долгосрочного удержания контекста, переход от генеративных моделей к предиктивным,например, V-JEPA 2-AC, и бенчмарки для проверки —WorldPrediction, CausalVQA и IntPhys2. Исследование затрагивает и этические риски: такие агенты могут собирать личные данные и вызывать ложное чувство, будто они «понимают» пользователя. Meta* считает, что решение этих проблем должно быть в фокусе внимания исследователей для будущего развития технологии. *организация запрещена на территории России и признана экстремистской #news #AI #бигтехи #роботы Препринт исследования

Repost from AISecHub
Red Teaming AI Red Teaming - https://arxiv.org/pdf/2507.05538v1 Red teaming has evolved from its origins in military applicat
Red Teaming AI Red Teaming - https://arxiv.org/pdf/2507.05538v1 Red teaming has evolved from its origins in military applications to become a widely adopted methodology in cybersecurity and AI. In this paper, we take a critical look at the practice of AI red teaming. We argue that despite its current popularity in AI governance, there exists a significant gap between red teaming’s original intent as a critical thinking exercise and its narrow focus on discovering model-level flaws in the context of generative AI. Current AI red teaming efforts focus predominantly on individual model vulnerabilities while overlooking the broader sociotechnical systems and emergent behaviors that arise from complex interactions between models, users, and environments. To address this deficiency, we propose a comprehensive framework operationalizing red teaming in AI systems at two levels: macro-level system red teaming spanning the entire AI development lifecycle, and micro-level model red teaming. Drawing on cybersecurity experience and systems theory, we further propose a set of recommendations. In these, we emphasize that effective AI red teaming requires multifunctional teams that examine emergent risks, systemic vulnerabilities, and the interplay between technical and social factors. #AIRedTeaming #RedTeaming #AIsecurity #AIgovernance #SystemicRisks #EmergentBehavior #SociotechnicalSystems #ModelVulnerabilities #AIThreatModeling #MacroRedTeaming #MicroRedTeaming #CyberSecurity #ResponsibleAI #AIrisks #AdversarialTesting #AIresilience #SystemSecurity #MultidisciplinaryAI #AIdevelopment #AIoversightAsk

Repost from AISecHub
Autonomous AI-based Cybersecurity Framework for Critical Infrastructure - https://arxiv.org/pdf/2507.07416 Critical infrastru
Autonomous AI-based Cybersecurity Framework for Critical Infrastructure - https://arxiv.org/pdf/2507.07416 Critical infrastructure systems, including energy grids, healthcare facilities, transportation networks, and water distribution systems, are pivotal to societal stability and economic resilience. However, the increasing interconnectivity of these systems exposes them to various cyber threats, including ransomware, Denial-of-Service (DoS) attacks, and Advanced Persistent Threats (APTs). This paper examines cybersecurity vulnerabilities in critical infrastructure, highlighting the threat landscape, attack vectors, and the role of Artificial Intelligence (AI) in mitigating these risks. We propose a hybrid AI-driven cybersecurity framework to enhance real-time vulnerability detection, threat modelling, and automated remediation. This study also addresses the complexities of adversarial AI, regulatory compliance, and integration. Our findings provide actionable insights to strengthen the security and resilience of critical infrastructure systems against emerging cyber threats #CriticalInfrastructure #AICybersecurity #AutonomousAI #ThreatDetection #RansomwareDefense #DoSProtection #APTDetection #AIinSecurity #CyberResilience #AdversarialAI #AIFramework #AutomatedRemediation #SecurityAutomation #CyberThreats #RegulatoryCompliance #AIThreatModeling #InfrastructureSecurity #RealTimeDetection #CyberDefense #AIIntegration

Repost from Security Vision
❤️ Как ИИ-инструменты работают в кибербезопасности В последние годы всё больше отечественных компаний делают ставку на искусс
❤️ Как ИИ-инструменты работают в кибербезопасности В последние годы всё больше отечественных компаний делают ставку на искусственный интеллект для защиты от киберугроз — тренд, идущий в ногу с мировыми тенденциями. ➡️ В новой статье в блоге выделили три группы ИИ, рассмотрели примеры применения и то, как устроена логика их работы.

Repost from AlexRedSec
А вот ещё один новый ресурс, посвященный безопасности ИИ-агентов, от активного участника проектов OWASP🧠 Agentic Security Hu
А вот ещё один новый ресурс, посвященный безопасности ИИ-агентов, от активного участника проектов OWASP🧠 Agentic Security Hub включает в себя: ➡️Описание ключевых компонентов ИИ-агентов ➡️Описание и сравнение архитектур ИИ-агентов. ➡️Реестр угроз с описанием векторов атак. ➡️Реестр защитных мер. ➡️Опросник по стандарту OWASP AISVS (AI Security Verification Standard). ➡️Опросник самооценки по OWASP Securing Agentic Applications guide для формирования модели угроз и рекомендаций по защитным мерам. ➡️Маппинг мер фреймворка NIST AI RMF на OWASP AISVS. ➡️База уязвимостей Agentic Vulnerability Database (AVD) – правда пока раздел в разработке и в базе есть только три записи про уязвимости ИИ-агентов. Все разделы связаны друг с другом кросс-ссылками, а часть имеет также инструменты для визуализации. Также есть библиотека полезных ресурсов, содержащая на текущий момент ссылки на 219 различных документов по теме безопасности ИИ. #ai #framework #controls #aisvs #archirecture #owasp #avd