ML&|Sec Feed
Kanalga Telegram’da o‘tish
Feed for @borismlsec channel author: @ivolake
Ko'proq ko'rsatish1 198
Obunachilar
Ma'lumot yo'q24 soatlar
+157 kunlar
+4330 kunlar
Postlar arxiv
1 198
Repost from Евгений Кокуйкин - Raft
Вышла свежая карта AI Security-стартапов от крупнейшего фонда Insight Partners. В отчёте указаны все последние M&A-сделки Cisco, Tenable и Palo Alto, а также направления инвестирования самого фонда.
Это не первая карта AI Security: например, микрофонд TechOperators сделал ландшафт компаний пару месяцев назад. Они открыли доступ, чтобы стартапы могли самостоятельно размещать себя в нужном секторе, и собрали больше проектов, о многих из которых я впервые узнал именно там.
Первыми ещё в начале 2024 года свой список компаний опубликовал известный фонд из Долины Menlo Ventures, и за ним работу повторил европейский MMC VC. Кстати, именно с отчёта MMC началась моя работа в OWASP. Несколько участников LLM Top 10 были консультантами аналитиков фонда, и, обсуждая отчёт Responsible AI в Slack OWASP, меня пригласили контрибьютить в LLM Top 10 2025.
Помимо инвестфондов такие списки ведут и консультанты — McKinsey, Gartner и другие, но про это напишу как-нибудь отдельно.
1 198
Repost from Похек
Атаки на MCP. Как взламывают инструменты ИИ-разработчиков
#MCP #AI #LLM #Cursor #Anthropic #OpenAI
Наконец-то вышла моя статья про безопасность MCP. Мысль написать эту статью меня натолкнуло одно из обновлений в Cursor IDE, где сделали "удобную", а по факту очень дырявую однокнопочную установку MCP серверов локально. Я уже ранее писал пост про запуск MCP в контейнерах и почему это нужно. Данный вектор раскрывает supply chain attack ещё больше, что очень интересно на мой взгляд)В погоне за скоростью и удобством разработчики ИИ‑приложений часто забывают о безопасности. Именно это привело к критической уязвимости в MCP Inspector от Anthropic. Инструмент для отладки MCP-серверов стал точкой входа для злоумышленников. Недавно израильские исследователи обнаружили критическую уязвимость удаленного выполнения кода (RCE) в проекте Anthropic's Model Context Protocol (MCP) Inspector. Уязвимость получила идентификатор CVE-2025-49596 и оценку CVSS 9.4 — это говорит о чрезвычайной серьезности. Эксплуатируя этот баг, злоумышленник может удаленно выполнить произвольный код на машине разработчика с уязвимой версией MCP Inspector. А это, согласись, уже не шутки. ❤️ Буду благодарен комментам и фидбеку тут и там)) 🔓 Рекомендую к прочтению p.s. пикчу скоро такую поставят на сайте и в их канале) 🌚 @poxek | 🌚 Блог | 📺 YT | 📺 RT | 📺 VK
1 198
Repost from SecureTechTalks
🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA
🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.
Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.
⚙ Что именно делает ETTA?
Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).
Например:
Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.
ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
✅ Модель принимает запрос как нормальный
✅ Отвечает как будто это безобидный вопрос, не включив защиту
🔬 Как именно это реализовано?
➖Модуль обучается на парах слов: токсичных и нейтральных (например, “explosive” vs “research”)
➖Создаётся матрица преобразования эмбеддингов, которая:
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
➖Применяется к входному эмбеддингу запроса
➖Запрос отправляется в LLM уже в модифицированном виде
При этом:
– Смысл запроса сохраняется
– Безопасность модели отключается
– Результат валидный, связный, но содержит вредоносный текст
📊 Насколько эффективен метод?
- Gemma-2 (Google) — 95.19% успешных обходов
- LLaMA-2-7b — 87.88%
- Vicuna-13b — 88.46%
- Средний успех по моделям — 88.61%
Даже при наличии встроенной защиты:
- SmoothLLM (защита на входе) — всё равно 60.15% успеха
- ESF (дообученная фильтрация) — 77.39%
🚨 В чем новизна?
🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺 Работает на open-source — можно внедрить в любом локальном LLM
🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах
🛡 Что предлагают исследователи?
✅ Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
✅ Проверка целостности модели — чтобы исключить скрытые внедрения
✅ Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса
📌 Вывод
ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.
Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы.
💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения.
Исходник: arXiv:2507.08020v1
Stay secure and read SecureTechTalks 📚
#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment
1 198
Repost from CyberSecurityTechnologies
#Analytics
"AI Threat Landscape Report:
Navigating The Rise of AI Risks", 2025.
// The report examines the vulnerabilities arising from AI developments and their real-world cybersecurity implications. It features insights from leaders in IT security and data analytics who are actively combating these threats, as well as predictions based on HiddenLayer's hands-on experience in AI security. It highlights the advances in security controls needed to protect AI
1 198
Repost from Агенты ИИ | AGI_and_RL
Пара приятных и полезных находок
Введение в диффузионки
Step-by-Step Diffusion: An Elementary Tutorial
https://arxiv.org/abs/2406.08929
И обзор методов скрытых рассуждений в ллмках (т.е. когда ллмы "рассуждают" не текстом в лицо, а во внутренних представлениях модельки)
В целом какие подходы бывают, как тренируют и про интерпретируемость
A Survey on Latent Reasoning
https://arxiv.org/abs/2507.06203
https://www.alphaxiv.org/ru/overview/2507.06203v1
https://github.com/multimodal-art-projection/LatentCoT-Horizon
1 198
Repost from Агенты ИИ | AGI_and_RL
Как насчет опенсурсной агенточной модельки на 1Т параметров? Kimi K2
https://moonshotai.github.io/Kimi-K2/
https://huggingface.co/moonshotai/Kimi-K2-Instruct
https://huggingface.co/moonshotai/Kimi-K2-Base
https://github.com/MoonshotAI/Kimi-K2?tab=License-1-ov-file#readme
MOE с 32б активных параметров. Но все равно 1Т общих оч много
Но зато опенсурс и поэтому кайфуем. Еще и от челов которые RL над ллмками активно делают
Всем РЛьным респект всегда
1 198
Repost from Innovation & Research
Meta* опубликовала работу о воплощённых AI-агентах, способных действовать в физическом и виртуальном мирах
В отличие от чат-ботов, воплощённые агенты имеют форму — от VR-аватаров до умных очков и роботов. Их цель — действовать автономно, понимать людей и мир, прогнозировать возможные последствия и помогать в реальных задачах.
В центре архитектуры — «модель мира» (world model), которая заменяет генерацию текста или пикселей на предсказание действий и состояний в абстрактном пространстве. Это позволяет моделям создавать планы, обучаться без надзора со стороны человека и действовать в реальном времени.
Разработаны 2 типа таких моделей: модели первого типа распознают динамику, объекты, причинно-следственные связи, а второго — цели, эмоции и убеждения людей.
В работе представлены 3 класса агентов:
• виртуальные — аватары в VR/AR, NPC, ассистенты;
• носимые — AI в очках, способный понимать контекст ситуаций и подсказывать пользователю информацию в реальном времени;
• робототехнические — физические агенты, способные к манипуляциям с объектами и обучению на месте.
Существенные новации — эпизодическая память, которая необходима для долгосрочного удержания контекста, переход от генеративных моделей к предиктивным,например, V-JEPA 2-AC, и бенчмарки для проверки —WorldPrediction, CausalVQA и IntPhys2.
Исследование затрагивает и этические риски: такие агенты могут собирать личные данные и вызывать ложное чувство, будто они «понимают» пользователя. Meta* считает, что решение этих проблем должно быть в фокусе внимания исследователей для будущего развития технологии.
*организация запрещена на территории России и признана экстремистской
#news #AI #бигтехи #роботы
Препринт исследования
1 198
Repost from AISecHub
Red Teaming AI Red Teaming - https://arxiv.org/pdf/2507.05538v1
Red teaming has evolved from its origins in military applications to become a widely adopted methodology in cybersecurity and AI. In this paper, we take a critical look at the practice of AI red teaming. We argue that despite its current popularity in AI governance, there exists a significant gap between red teaming’s original intent as a critical thinking exercise and its narrow focus on discovering model-level flaws in the context of generative AI. Current AI red teaming efforts focus predominantly on individual model vulnerabilities while overlooking the broader sociotechnical systems and emergent behaviors that arise from complex interactions between models, users, and environments. To address this deficiency, we propose a comprehensive framework operationalizing red teaming in AI systems at two levels: macro-level system red teaming spanning the entire AI development lifecycle, and micro-level model red teaming. Drawing on cybersecurity experience and systems theory, we further propose a set of recommendations. In these, we emphasize that effective AI red teaming requires multifunctional teams that examine emergent risks, systemic vulnerabilities, and the interplay between technical and social factors.
#AIRedTeaming #RedTeaming #AIsecurity #AIgovernance #SystemicRisks #EmergentBehavior #SociotechnicalSystems #ModelVulnerabilities #AIThreatModeling #MacroRedTeaming #MicroRedTeaming #CyberSecurity #ResponsibleAI #AIrisks #AdversarialTesting #AIresilience #SystemSecurity #MultidisciplinaryAI #AIdevelopment #AIoversightAsk
1 198
Repost from AISecHub
Autonomous AI-based Cybersecurity Framework for Critical Infrastructure - https://arxiv.org/pdf/2507.07416
Critical infrastructure systems, including energy grids, healthcare facilities, transportation networks, and water distribution systems, are pivotal to societal stability and economic resilience. However, the increasing interconnectivity of these systems exposes them to various cyber threats, including ransomware, Denial-of-Service (DoS) attacks, and Advanced Persistent Threats (APTs). This paper examines cybersecurity vulnerabilities in critical infrastructure, highlighting the threat landscape, attack vectors, and the role of Artificial Intelligence (AI) in mitigating these risks. We propose a hybrid AI-driven cybersecurity framework to enhance real-time vulnerability detection, threat modelling, and automated remediation. This study also addresses the complexities of adversarial AI, regulatory compliance, and integration. Our findings provide actionable insights to strengthen the security and resilience of critical infrastructure systems against emerging cyber threats
#CriticalInfrastructure #AICybersecurity #AutonomousAI #ThreatDetection #RansomwareDefense #DoSProtection #APTDetection #AIinSecurity #CyberResilience #AdversarialAI #AIFramework #AutomatedRemediation #SecurityAutomation #CyberThreats #RegulatoryCompliance #AIThreatModeling #InfrastructureSecurity #RealTimeDetection #CyberDefense #AIIntegration
1 198
Repost from Security Vision
❤️ Как ИИ-инструменты работают в кибербезопасности
В последние годы всё больше отечественных компаний делают ставку на искусственный интеллект для защиты от киберугроз — тренд, идущий в ногу с мировыми тенденциями.
➡️ В новой статье в блоге выделили три группы ИИ, рассмотрели примеры применения и то, как устроена логика их работы.
1 198
Repost from AlexRedSec
А вот ещё один новый ресурс, посвященный безопасности ИИ-агентов, от активного участника проектов OWASP🧠
Agentic Security Hub включает в себя:
➡️Описание ключевых компонентов ИИ-агентов
➡️Описание и сравнение архитектур ИИ-агентов.
➡️Реестр угроз с описанием векторов атак.
➡️Реестр защитных мер.
➡️Опросник по стандарту OWASP AISVS (AI Security Verification Standard).
➡️Опросник самооценки по OWASP Securing Agentic Applications guide для формирования модели угроз и рекомендаций по защитным мерам.
➡️Маппинг мер фреймворка NIST AI RMF на OWASP AISVS.
➡️База уязвимостей Agentic Vulnerability Database (AVD) – правда пока раздел в разработке и в базе есть только три записи про уязвимости ИИ-агентов.
Все разделы связаны друг с другом кросс-ссылками, а часть имеет также инструменты для визуализации.
Также есть библиотека полезных ресурсов, содержащая на текущий момент ссылки на 219 различных документов по теме безопасности ИИ.
#ai #framework #controls #aisvs #archirecture #owasp #avd
