ML&|Sec Feed
Відкрити в Telegram
1 372
Підписники
+124 години
+87 днів
+5730 днів
Архів дописів
1 376
Repost from Похек
Атаки на MCP. Как взламывают инструменты ИИ-разработчиков
#MCP #AI #LLM #Cursor #Anthropic #OpenAI
Наконец-то вышла моя статья про безопасность MCP. Мысль написать эту статью меня натолкнуло одно из обновлений в Cursor IDE, где сделали "удобную", а по факту очень дырявую однокнопочную установку MCP серверов локально. Я уже ранее писал пост про запуск MCP в контейнерах и почему это нужно. Данный вектор раскрывает supply chain attack ещё больше, что очень интересно на мой взгляд)В погоне за скоростью и удобством разработчики ИИ‑приложений часто забывают о безопасности. Именно это привело к критической уязвимости в MCP Inspector от Anthropic. Инструмент для отладки MCP-серверов стал точкой входа для злоумышленников. Недавно израильские исследователи обнаружили критическую уязвимость удаленного выполнения кода (RCE) в проекте Anthropic's Model Context Protocol (MCP) Inspector. Уязвимость получила идентификатор CVE-2025-49596 и оценку CVSS 9.4 — это говорит о чрезвычайной серьезности. Эксплуатируя этот баг, злоумышленник может удаленно выполнить произвольный код на машине разработчика с уязвимой версией MCP Inspector. А это, согласись, уже не шутки. ❤️ Буду благодарен комментам и фидбеку тут и там)) 🔓 Рекомендую к прочтению p.s. пикчу скоро такую поставят на сайте и в их канале) 🌚 @poxek | 🌚 Блог | 📺 YT | 📺 RT | 📺 VK
1 376
Repost from SecureTechTalks
🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA
🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.
Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.
⚙ Что именно делает ETTA?
Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).
Например:
Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.
ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
✅ Модель принимает запрос как нормальный
✅ Отвечает как будто это безобидный вопрос, не включив защиту
🔬 Как именно это реализовано?
➖Модуль обучается на парах слов: токсичных и нейтральных (например, “explosive” vs “research”)
➖Создаётся матрица преобразования эмбеддингов, которая:
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
➖Применяется к входному эмбеддингу запроса
➖Запрос отправляется в LLM уже в модифицированном виде
При этом:
– Смысл запроса сохраняется
– Безопасность модели отключается
– Результат валидный, связный, но содержит вредоносный текст
📊 Насколько эффективен метод?
- Gemma-2 (Google) — 95.19% успешных обходов
- LLaMA-2-7b — 87.88%
- Vicuna-13b — 88.46%
- Средний успех по моделям — 88.61%
Даже при наличии встроенной защиты:
- SmoothLLM (защита на входе) — всё равно 60.15% успеха
- ESF (дообученная фильтрация) — 77.39%
🚨 В чем новизна?
🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺 Работает на open-source — можно внедрить в любом локальном LLM
🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах
🛡 Что предлагают исследователи?
✅ Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
✅ Проверка целостности модели — чтобы исключить скрытые внедрения
✅ Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса
📌 Вывод
ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.
Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы.
💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения.
Исходник: arXiv:2507.08020v1
Stay secure and read SecureTechTalks 📚
#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment
1 376
Repost from CyberSecurityTechnologies
#Analytics
"AI Threat Landscape Report:
Navigating The Rise of AI Risks", 2025.
// The report examines the vulnerabilities arising from AI developments and their real-world cybersecurity implications. It features insights from leaders in IT security and data analytics who are actively combating these threats, as well as predictions based on HiddenLayer's hands-on experience in AI security. It highlights the advances in security controls needed to protect AI
1 376
Repost from Агенты ИИ | AGI_and_RL
Пара приятных и полезных находок
Введение в диффузионки
Step-by-Step Diffusion: An Elementary Tutorial
https://arxiv.org/abs/2406.08929
И обзор методов скрытых рассуждений в ллмках (т.е. когда ллмы "рассуждают" не текстом в лицо, а во внутренних представлениях модельки)
В целом какие подходы бывают, как тренируют и про интерпретируемость
A Survey on Latent Reasoning
https://arxiv.org/abs/2507.06203
https://www.alphaxiv.org/ru/overview/2507.06203v1
https://github.com/multimodal-art-projection/LatentCoT-Horizon
1 376
Repost from Агенты ИИ | AGI_and_RL
Как насчет опенсурсной агенточной модельки на 1Т параметров? Kimi K2
https://moonshotai.github.io/Kimi-K2/
https://huggingface.co/moonshotai/Kimi-K2-Instruct
https://huggingface.co/moonshotai/Kimi-K2-Base
https://github.com/MoonshotAI/Kimi-K2?tab=License-1-ov-file#readme
MOE с 32б активных параметров. Но все равно 1Т общих оч много
Но зато опенсурс и поэтому кайфуем. Еще и от челов которые RL над ллмками активно делают
Всем РЛьным респект всегда
1 376
Repost from Innovation & Research
Meta* опубликовала работу о воплощённых AI-агентах, способных действовать в физическом и виртуальном мирах
В отличие от чат-ботов, воплощённые агенты имеют форму — от VR-аватаров до умных очков и роботов. Их цель — действовать автономно, понимать людей и мир, прогнозировать возможные последствия и помогать в реальных задачах.
В центре архитектуры — «модель мира» (world model), которая заменяет генерацию текста или пикселей на предсказание действий и состояний в абстрактном пространстве. Это позволяет моделям создавать планы, обучаться без надзора со стороны человека и действовать в реальном времени.
Разработаны 2 типа таких моделей: модели первого типа распознают динамику, объекты, причинно-следственные связи, а второго — цели, эмоции и убеждения людей.
В работе представлены 3 класса агентов:
• виртуальные — аватары в VR/AR, NPC, ассистенты;
• носимые — AI в очках, способный понимать контекст ситуаций и подсказывать пользователю информацию в реальном времени;
• робототехнические — физические агенты, способные к манипуляциям с объектами и обучению на месте.
Существенные новации — эпизодическая память, которая необходима для долгосрочного удержания контекста, переход от генеративных моделей к предиктивным,например, V-JEPA 2-AC, и бенчмарки для проверки —WorldPrediction, CausalVQA и IntPhys2.
Исследование затрагивает и этические риски: такие агенты могут собирать личные данные и вызывать ложное чувство, будто они «понимают» пользователя. Meta* считает, что решение этих проблем должно быть в фокусе внимания исследователей для будущего развития технологии.
*организация запрещена на территории России и признана экстремистской
#news #AI #бигтехи #роботы
Препринт исследования
1 376
Repost from AISecHub
Red Teaming AI Red Teaming - https://arxiv.org/pdf/2507.05538v1
Red teaming has evolved from its origins in military applications to become a widely adopted methodology in cybersecurity and AI. In this paper, we take a critical look at the practice of AI red teaming. We argue that despite its current popularity in AI governance, there exists a significant gap between red teaming’s original intent as a critical thinking exercise and its narrow focus on discovering model-level flaws in the context of generative AI. Current AI red teaming efforts focus predominantly on individual model vulnerabilities while overlooking the broader sociotechnical systems and emergent behaviors that arise from complex interactions between models, users, and environments. To address this deficiency, we propose a comprehensive framework operationalizing red teaming in AI systems at two levels: macro-level system red teaming spanning the entire AI development lifecycle, and micro-level model red teaming. Drawing on cybersecurity experience and systems theory, we further propose a set of recommendations. In these, we emphasize that effective AI red teaming requires multifunctional teams that examine emergent risks, systemic vulnerabilities, and the interplay between technical and social factors.
#AIRedTeaming #RedTeaming #AIsecurity #AIgovernance #SystemicRisks #EmergentBehavior #SociotechnicalSystems #ModelVulnerabilities #AIThreatModeling #MacroRedTeaming #MicroRedTeaming #CyberSecurity #ResponsibleAI #AIrisks #AdversarialTesting #AIresilience #SystemSecurity #MultidisciplinaryAI #AIdevelopment #AIoversightAsk
1 376
Repost from AISecHub
Autonomous AI-based Cybersecurity Framework for Critical Infrastructure - https://arxiv.org/pdf/2507.07416
Critical infrastructure systems, including energy grids, healthcare facilities, transportation networks, and water distribution systems, are pivotal to societal stability and economic resilience. However, the increasing interconnectivity of these systems exposes them to various cyber threats, including ransomware, Denial-of-Service (DoS) attacks, and Advanced Persistent Threats (APTs). This paper examines cybersecurity vulnerabilities in critical infrastructure, highlighting the threat landscape, attack vectors, and the role of Artificial Intelligence (AI) in mitigating these risks. We propose a hybrid AI-driven cybersecurity framework to enhance real-time vulnerability detection, threat modelling, and automated remediation. This study also addresses the complexities of adversarial AI, regulatory compliance, and integration. Our findings provide actionable insights to strengthen the security and resilience of critical infrastructure systems against emerging cyber threats
#CriticalInfrastructure #AICybersecurity #AutonomousAI #ThreatDetection #RansomwareDefense #DoSProtection #APTDetection #AIinSecurity #CyberResilience #AdversarialAI #AIFramework #AutomatedRemediation #SecurityAutomation #CyberThreats #RegulatoryCompliance #AIThreatModeling #InfrastructureSecurity #RealTimeDetection #CyberDefense #AIIntegration
1 376
Repost from Security Vision
❤️ Как ИИ-инструменты работают в кибербезопасности
В последние годы всё больше отечественных компаний делают ставку на искусственный интеллект для защиты от киберугроз — тренд, идущий в ногу с мировыми тенденциями.
➡️ В новой статье в блоге выделили три группы ИИ, рассмотрели примеры применения и то, как устроена логика их работы.
1 376
Repost from AlexRedSec
А вот ещё один новый ресурс, посвященный безопасности ИИ-агентов, от активного участника проектов OWASP🧠
Agentic Security Hub включает в себя:
➡️Описание ключевых компонентов ИИ-агентов
➡️Описание и сравнение архитектур ИИ-агентов.
➡️Реестр угроз с описанием векторов атак.
➡️Реестр защитных мер.
➡️Опросник по стандарту OWASP AISVS (AI Security Verification Standard).
➡️Опросник самооценки по OWASP Securing Agentic Applications guide для формирования модели угроз и рекомендаций по защитным мерам.
➡️Маппинг мер фреймворка NIST AI RMF на OWASP AISVS.
➡️База уязвимостей Agentic Vulnerability Database (AVD) – правда пока раздел в разработке и в базе есть только три записи про уязвимости ИИ-агентов.
Все разделы связаны друг с другом кросс-ссылками, а часть имеет также инструменты для визуализации.
Также есть библиотека полезных ресурсов, содержащая на текущий момент ссылки на 219 различных документов по теме безопасности ИИ.
#ai #framework #controls #aisvs #archirecture #owasp #avd
1 376
Repost from GitHub Community
LLM Reasoners — это библиотека, разработанная для улучшения способности LLM выполнять сложные вычисления с использованием передовых алгоритмов.
♎️ GitHub
1 376
Repost from EFEMERA: AI news
+1
Исследование: предложен новый метод интерпретации работы нейросетей
✦ Goodfire разработала Stochastic Parameter Decomposition (SPD) — новый способ изучать нейросети
✦ SPD позволяет разбивать параметры нейросетей на отдельные компоненты, чтобы понять роль каждой из них
✦ Метод основан на удалении частей сети и оценке их влияния на результат
✦ Алгоритм работает по принципу «игры в Джэнга»: удаляет части сети, пока поведение модели не изменится
✦ SPD помогает оценить важность каждого компонента и изучить конкретные функции нейросети
✦ Исследователи рассматривают возможность создания моделей, которые изначально строятся из понятных и объяснимых компонентов
✦ В тестах SPD точно определял, как работают внутренние механизмы нейросетей
✦ Полный тех. отчёт (pdf) и библиотека на GitHub
✦ Прототип метода для экспериментов (vpn)
@EF9MERA
Источник
1 376
Repost from N/a
Заинтересовали меня MCP сервера для LLM
Заглянул в официальном репозитории, но под свои задачи — ничего стоящего не нашёл.
Возник вопрос:
А что там с offensive MCP-серверами?
Порылся в интернетах и собрал небольшой список:
Offensive MCP Servers List
Пока сам не тестировал, но в планах обязательно попробовать.
Буду рад реквестам и комментариям.
