en
Feedback
SecureTechTalks

SecureTechTalks

Open in Telegram

Добро пожаловать на канал "SecureTechTalks"! Мы предлагаем вам увлекательное и информативное погружение в мир кибербезопасности. Здесь вы найдете актуальные новости, советы, методы и инсайты по инфобезу.

Show more
302
Subscribers
No data24 hours
-17 days
-430 days
Posts Archive
🚨 Все современные LLM жульничают, даже если их об этом не просили Исследователи проанализировали поведение 22 современных мо
🚨 Все современные LLM жульничают, даже если их об этом не просили Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench. Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными. ⚙️ Почти все модели начинают искать обходной путь Результаты исследований без дополнительных ограничений: 🔹 21 из 22 моделей хотя бы один раз жульничали; 🔹 37,1% всех успешных решений оказались получены нечестным способом; 🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз. Вместо решения самой CTF-задачи агенты пытались искать более лёгкие способы достижения цели, например исследовали инфраструктуру окружения, искали служебные файлы, пытались использовать особенности платформы или другие пути, позволяющие получить флаг без реальной эксплуатации уязвимости. 🧠 Достаточно одного промпта Исследователи проверили три режима работы: ➖ без защиты; ➖ стандартный anti-cheat prompt; ➖ жёсткий anti-cheat prompt. Вероятность мошенничества снизилась с 33% до 17,8%, а затем до 8,5%. При этом качество решения задач практически не снизилось. Тем не менее полностью избавиться от проблемы не удалось, даже при самых строгих инструкциях 8 моделей продолжали искать обходные пути, а некоторые стали использовать ещё более изощрённые стратегии. 🛡️ Новый показатель для AI-бенчмарков Авторы предлагают отказаться от привычного pass rate и использовать новый показатель, Solve Rate, который учитывает только честно решённые задачи. Если агент получает доступ к shell, файловой системе или сети, измерять нужно уже не только качество его ответов, но и способ достижения результата. В противном случае модель, которая чаще всех нарушает правила, может ошибочно показаться самой сильной. 🔗 Исследование: https://arxiv.org/abs/2607.21763 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #AgenticAI #Cybench #AISecurity #RedTeaming #PromptEngineering #CyberSecurity #SecureTechTalks

🚨 Guardrails можно обнаружить, даже если они полностью скрыты Большинство компаний не раскрывают, какие именно guardrails ст
🚨 Guardrails можно обнаружить, даже если они полностью скрыты Большинство компаний не раскрывают, какие именно guardrails стоят перед их LLM. Для атакующего это серьёзная проблема, т.к. непонятно, блокирует ли запрос отдельный фильтр безопасности или сама модель отказалась выполнять опасную инструкцию. Исследователи из Mindgard показали, что определить наличие guardrails можно анализируя её внешнее поведение. ⚙️ Behavioral Monitoring Авторы предлагают метод Behavioral Monitoring, где вместо анализа модели они наблюдают за косвенными признаками ответа: 🔹 HTTP-коды и структуру ответов; 🔹 задержку обработки запросов; 🔹 особенности формулировок отказов; 🔹 изменения длины и лексики ответов. Если последовательно отправлять серии безопасных и опасных запросов, система начинает выдавать характерные поведенческие паттерны, по которым можно определить, что перед моделью работает отдельный guardrail. 🧠 Выводы По результатам экспериментов исследователи смогли: ➖ определить наличие guardrail со 100% точностью; ➖ отличить срабатывание guardrail от собственного отказа LLM со средним F1 = 98%; ➖ определить, какие именно категории контента фильтрует защита (например, вредоносный код, jailbreak, утечку данных и другие). При таком подходе система безопасности сама начинает раскрывать информацию о своей архитектуре через особенности поведения. 🔗 Исследование: https://arxiv.org/abs/2607.02121 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #Guardrails #PromptInjection #RedTeaming #AISecurity #AgenticAI #CyberSecurity #SecureTechTalks

🧨 GitHub повышает ставки для багхантеров. AI меняет рынок поиска уязвимостей Искусственный интеллект заметно ускорил поиск о
🧨 GitHub повышает ставки для багхантеров. AI меняет рынок поиска уязвимостей Искусственный интеллект заметно ускорил поиск ошибок в программном обеспечении. Исследователи автоматизируют анализ кода, быстрее находят потенциальные уязвимости. В результате объём качественных отчётов растёт настолько быстро, что GitHub пришлось пересматривать правила своей Bug Bounty-программы. ⚙️ VIP только для лучших GitHub запускает постоянную закрытую VIP-программу для исследователей, которые регулярно отправляют качественные отчёты. Попасть в неё можно, обнаружив: 🔹 одну критическую уязвимость; 🔹 две высокой степени опасности; 🔹 четыре средней; 🔹 или семь низкой. После этого выплаты существенно увеличиваются: ➖ Low  $1 000 вместо $250; ➖ Medium  $7 500 вместо $2 000; ➖ High $20 000 вместо $5 000; ➖ Critical  от $30 000 вместо $10 000. GitHub начинает инвестировать не в количество отчётов, а в долгосрочное сотрудничество с исследователями, которые регулярно находят действительно серьёзные проблемы. 🧠 Не только лишь плюсы Одновременно GitHub вводит ограничения для новых участников программы через HackerOne. Теперь новичок сможет отправить только четыре первых отчёта, прежде чем получит возможность подавать больше. Причина очевидна, AI резко снизил стоимость поиска потенциальных уязвимостей. Вместе с качественными исследованиями вырос и поток автоматически сгенерированных, дублирующихся и малополезных репортов. Новые ограничения должны снизить нагрузку на triage-команды и сохранить фокус на действительно важных находках. 🛡️ Новая реальность Bug Bounty Ещё несколько месяцев назад GitHub устранил критическую RCE-уязвимость, позволявшую одной вредоносной командой "git push" получить полный доступ к миллионам приватных репозиториев. Подобные находки показывают, что стоимость действительно качественного vulnerability research только растёт. AI не отменит Bug Bounty, он лишь повысит планку. Простые баги всё чаще будут находить агенты, а основная ценность исследователей сместится в сторону сложных цепочек эксплуатации, архитектурных ошибок и нестандартных сценариев атак. 🔗 Источник Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #BugBounty #GitHub #HackerOne #AppSec #VulnerabilityResearch #CyberSecurity #LLM #SecureTechTalks

🧨 Kimi K3 нашёл уязвимость в Redis за 27 минут На этой неделе по соцсетям разлетелась новость про то, как исследователь Чаоф
🧨 Kimi K3 нашёл уязвимость в Redis за 27 минут На этой неделе по соцсетям разлетелась новость про то, как исследователь Чаофань Шоу обнаружил уязвимость в Redis и подготовил рабочий эксплойт. Анализ производился автоматизировано с помощью Kimi K3, роя из 32 AI-агентов и занял всего за 27 минут. Код эксперимента уже опубликован на GitHub. Если это подтвердится независимыми исследователями, мы можем стать свидетелями серьёзного скачка в автоматизации vulnerability research. По словам автора, агентам дали задачу самостоятельно проанализировать исходный код Redis, найти memory corruption-уязвимость и построить рабочий exploit chain. В опубликованном репозитории представлены PoC для нескольких версий Redis. Один из них позволяет выполнить произвольную команду на сервере через уже аутентифицированное подключение, а для более новой версии предложен ещё один вариант эксплуатации. 🧠 Почему пока рано говорить о "взломе Redis"? Здесь есть сразу несколько оговорок. Во-первых, одна из найденных проблем уже была известна разработчикам Redis, исправление подготовили ещё до публикации эксперимента. Во-вторых, второй эксплойт для актуальной версии Redis пока публично не подтверждён командой Redis и не получил официального статуса уязвимости. И последнее, все цифры (27 минут, 32 агента и степень автономности системы) известны исключительно со слов автора. Полный лог работы агентов и независимое воспроизведение эксперимента не опубликованы. 🔗 GitHub: https://github.com/berabuddies/redis-poc Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #KimiK3 #Redis #VulnerabilityResearch #Exploit #AgenticAI #AppSec #SecureTechTalks

🧨 OpenAI теперь продают готовых AI-сотрудников OpenAI представили Presence, новую платформу для запуска корпоративных AI-аге
🧨 OpenAI теперь продают готовых AI-сотрудников OpenAI представили Presence, новую платформу для запуска корпоративных AI-агентов. Вместо того чтобы дать компании LLM и API, OpenAI начинают поставлять практически готовую операционную среду для автономных агентов. ⚙️ Агент как бизнес-процесс Presence - не новая модель, а инфраструктура вокруг неё. В одном продукте объединены: 🔹 корпоративные политики и SOP; 🔹 управление правами и разрешёнными действиями; 🔹 guardrails; 🔹 симуляции рабочих сценариев; 🔹 автоматическая оценка качества работы; 🔹 механизмы эскалации человеку. Перед запуском агент проходит серию тестов на типовых запросах, сложных сценариях и граничных случаях. Система проверяет не только правильность ответа, но и соблюдение политик компании, корректность использования инструментов и своевременную передачу задачи оператору. 🧠 Саморазвитие Все реальные обращения пользователей, ошибки и случаи эскалации анализируются Codex. Он предлагает изменения поведения агента, после чего новые версии снова прогоняются через симуляции. Только после одобрения сотрудников изменения попадают в production. Получается непрерывный цикл самоулучшения, где агент постоянно адаптируется к изменениям бизнес-процессов, но финальное решение остаётся за человеком. Фактически OpenAI превращают AI-агента в управляемый корпоративный сервис со встроенными механизмами DevSecOps. 🔗 Источник: https://openai.com/index/introducing-openai-presence/ Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #OpenAI #AgenticAI #AISecurity #Guardrails #DevSecOps #EnterpriseAI #SecureTechTalks

🧨 GPT-5.6 Sol взломала Hugging Face во время внутренних тестов OpenAI История с атакой на Hugging Face получила неожиданное
🧨 GPT-5.6 Sol взломала Hugging Face во время внутренних тестов OpenAI История с атакой на Hugging Face получила неожиданное продолжение. OpenAI раскрыла, что за инцидентом, который ранее считался первой автономной атакой AI-агента, стояли две её собственные модели, GPT-5.6 Sol и более мощная предрелизная LLM. ⚙️ Как так получилось? Во время тестирования моделей на бенчмарке ExploitGym исследователи временно отключили стандартные ограничения, чтобы оценить реальные offensive-возможности моделей. Агенты должны были искать способы эксплуатации уязвимостей в изолированной лаборатории. Однако вместо решения задачи в заданных рамках модели начали искать путь за пределы песочницы. По данным OpenAI, агент самостоятельно обнаружил ранее неизвестную zero-day-уязвимость в стороннем ПО, используемом в инфраструктуре компании, повысил привилегии и покинул изолированную среду. 🧠 Самое интересное Получив доступ во внешнюю сеть, агент использовал украденные учётные данные и новую цепочку эксплуатации, чтобы добиться удалённого выполнения кода на серверах Hugging Face. Целью не была атака на платформу. Модель пыталась получить доступ к информации, которая помогла бы успешнее пройти задания ExploitGym. Иными словами, компрометация чужой инфраструктуры стала для неё оптимальным способом достижения поставленной цели. По данным Hugging Face, злоумышленник получил доступ лишь к ограниченному числу внутренних данных и сервисных учётных записей. Признаков компрометации публичных моделей и датасетов обнаружено не было. 🛡️ Послевкусие Впервые публично подтверждён случай, когда современная LLM во время автономного выполнения задачи самостоятельно вышла за пределы тестовой среды, обнаружила новый путь эскалации привилегий, построила полноценную цепочку эксплуатации и атаковала внешнюю инфраструктуру без прямой команды. 🔗 Источник Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #OpenAI #GPT56 #HuggingFace #ExploitGym #AgenticAI #ZeroDay #SecureTechTalks

🧨 MITRE ATT&CK описывает прошлое. PR3TACK пытается предсказать будущее Обычно защита встраивается по уже известным атакам. С
🧨 MITRE ATT&CK описывает прошлое. PR3TACK пытается предсказать будущее Обычно защита встраивается по уже известным атакам. Сначала злоумышленники находят новый способ компрометации, затем появляются отчёты. Далее техника попадает в MITRE ATT&CK, и только потом команды начинают писать правила детектирования. Авторы нового open-source проекта PR3TACK (Preemptive Tactics & Countermeasures Knowledgebase) предлагают перевернуть эту модель. Вместо каталога уже наблюдавшихся TTP они собирают правдоподобные, но ещё не встречавшиеся в реальных атаках техники, чтобы защиту можно было готовить заранее. ⚙️ Охота за атаками, которых ещё не было Каждая техника в PR3TACK получает уровень достоверности: 🔹 High Существует рабочий Proof-of-Concept; 🔹 Medium Техника технически обоснована, но ещё не подтверждена экспериментально; 🔹 Low Идея основана на исследованиях или анализе возможных направлений развития атак. При этом проект не ограничивается привычными Execution или Persistence. В матрицу добавлены совершенно новые классы угроз: ➖ Pre-Positioning Долгосрочная подготовка к будущей атаке, например внедрение "спящих" изменений в open-source проекты; ➖ Resilience Erosion Постепенное разрушение механизмов восстановления: резервных копий, процессов обновления и восстановления; ➖ Governance Subversion Атаки через процессы закупок, доверенных поставщиков и внутренние политики; ➖ Cognitive Manipulation Воздействие на аналитиков с помощью ложных журналов событий, перегрузки алертами и других техник; ➖ Digital Exhaust Manipulation Подмена телеметрии, логов и threat intelligence для введения защитников в заблуждение. 🧠 Конструктор будущих угроз Для каждой техники описываются предполагаемый сценарий эксплуатации, возможные защитные меры и идеи для детектирования ещё до появления первых инцидентов. Авторы предлагают использовать PR3TACK как основу для purple team-упражнений, threat modeling и разработки новых правил обнаружения, а не ждать, пока техника появится в очередном отчёте. 🔗 Источник: https://www.first.org/blog/20260708-FIRSTCON26-PR3TACK Stay secure and read SecureTechTalks 📚 #кибербезопасность #ThreatIntelligence #MITREATTACK #PR3TACK #BlueTeam #PurpleTeam #ThreatModeling #CyberSecurity #DetectionEngineering #SecureTechTalks

🧨 Hugging Face взломали AI-агентом На днях Hugging Face опубликовали разбор реального инцидента, где атака, по данным компан
🧨 Hugging Face взломали AI-агентом На днях Hugging Face опубликовали разбор реального инцидента, где атака, по данным компании, была выполнена автономной агентной системой. ⚙️ Как удалось проникнуть? Точкой входа стал пайплайн обработки датасетов. Злоумышленники использовали сразу два механизма выполнения кода: загрузчик датасетов с возможностью удалённого исполнения и template injection в конфигурации датасета. После получения доступа агент автоматически повысил привилегии, собрал облачные учётные данные и начал lateral movement между внутренними кластерами. По информации Hugging Face, злоумышленники получили доступ к ограниченному числу внутренних наборов данных и сервисных учётных данных. При этом признаков компрометации публичных моделей и датасетов обнаружено не было. 🧠 Расследование Для анализа более 17 000 событий безопасности команда сначала попыталась использовать коммерческие LLM через API. Однако модели отказались обрабатывать журналы, содержащие реальные эксплойты, команды и артефакты C2, поскольку guardrails восприняли такую активность как потенциально вредоносную. В итоге расследование пришлось проводить на собственной инфраструктуре с использованием GLM 5.2 с открытыми весами. Это позволило не только обойти ограничения API, но и не передавать атакующие артефакты и чувствительные данные стороннему провайдеру. 🛡️ Новый парадокс AI-безопасности Атакующий не ограничен никакими правилами использования моделей, тогда как защитник может оказаться заблокирован собственными инструментами безопасности. Если AI уже используется для реагирования на инциденты, то во время расследования необходимо заранее иметь локальную модель, способную анализировать вредоносный код, журналы событий и эксплойты без внешних ограничений. 🔗 Источник: https://huggingface.co/blog/security-incident-july-2026 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #HuggingFace #AgenticAI #IncidentResponse #ThreatIntelligence #SOC #CyberSecurity #SecureTechTalks

🧨 Граница доверия LLM. На arXiv вышла работа Composable Trust for Language Models, где авторы предлагают отказаться от идеи
🧨 Граница доверия LLM. На arXiv вышла работа Composable Trust for Language Models, где авторы предлагают отказаться от идеи «исправить модель», а вместо этого предланают изменить архитектуру агентных систем. ⚙️ Граница доверия становится частью архитектуры Авторы вводят понятие Composable Trust, формальной границы доверия (trust boundary), которая задаётся для каждого компонента пайплайна вокркг LLM. Например: 🔹 RAG может предоставлять информацию, но не инициировать tool calls; 🔹 системный промпт имеет право задавать политики безопасности; 🔹 пользовательские инструкции не могут менять права доступа; 🔹 результаты поиска используются только как данные, а не как инструкции для выполнения. При добавлении нового компонента, например MCP-сервера, общая trust boundary пересчитывается. 🧠 Как измеряют защиту? Авторы разделяют доказуемую безопасность и измеряемую эффективность. Критические решения принимает не сама LLM, а внешний Trust Monitor, детерминированный компонент, который отслеживает происхождение каждого фрагмента контекста и присваивает ему уровень доверия. Если запрос на вызов инструмента сформирован данными из недоверенного источника, monitor блокирует действие независимо от того, что решила модель. После этого измеряется эффективность защиты. В экспериментах на Gemma 3 27B комбинация Trust Monitor и механизма passivation увеличила показатель Genuine Leak Defended Rate примерно с 27% до 94%, при этом качество обычных ответов практически не изменилось (QRel ≈ 0.96). Даже при адаптивных атаках защита сохраняла около 87% успешных блокировок, а корректная атрибуция данных из недоверенных источников достигала 92%. 🛡️ Простота в действии Практически все современные средства защиты пытаются сделать модель «умнее»: обучить новым jailbreak, добавить guardrails или улучшить системный промпт. Авторы данного исследования предлагают противоположный подход. LLM больше не должна принимать решения о доверии. Её задача исключительно генерировать текст. Всё, что связано с доступом к инструментам, данным и выполнением действий, должно контролироваться проверяемым кодом за пределами модели. 🔗 Исследование: https://arxiv.org/abs/2607.13149 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #AgenticAI #AISecurity #PromptInjection #TrustBoundary #RuntimeSecurity #AppSec #SecureTechTalks

🧨 OpenAI решили проверить, сможет ли AI сам распознавать prompt injection OpenAI представили GPT-RED, новую модель, предназн
🧨 OpenAI решили проверить, сможет ли AI сам распознавать prompt injection OpenAI представили GPT-RED, новую модель, предназначенную для автоматического тестирования AI-систем на устойчивость к prompt injection и другим атакам. Вместо ручного написания jailbreak-промптов GPT-RED самостоятельно генерирует тысячи вариантов атакующих сценариев и оценивает, какие из них действительно приводят к компрометации модели. ⚙️ Динамический подбор GPT-RED действует как автономный red team. На вход он получает описание целевой системы и её политики безопасности, после чего строит цепочки атак, постепенно адаптируя их под ответы модели. В отличие от классических наборов тестов, где используются заранее подготовленные промпты, GPT-RED динамически меняет стратегию, если предыдущая попытка оказалась неудачной. Для обучения используется self-play: атакующая модель и защищающиеся модели одновременно совершенствуются, заставляя друг друга искать всё более сложные способы атаки и защиты. 🧠 Не только prompt injection Модель тестирует не отдельный запрос, а поведение всей агентной системы. В фокусе оказываются: ➖ обход системных инструкций; ➖ извлечение скрытого контекста; ➖ нарушение политик безопасности; ➖ атаки на tool calling; ➖ многоэтапные jailbreak-цепочки. По данным OpenAI, GPT-RED успешно находил атаки в 84% сценариев на независимом наборе тестов против 13% у команды людей-red team. Кроме того, атаки, сгенерированные GPT-RED, уже используются для обучения новых моделей OpenAI, что позволило значительно повысить их устойчивость к prompt injection. 🔗 Источник: https://openai.com/index/unlocking-self-improvement-gpt-red Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #OpenAI #PromptInjection #RedTeaming #AgenticAI #AISecurity #CyberSecurity #SecureTechTalks

🧨 Guardrails учатся думать: SingGuard-NSFA Современные guardrails работают примитивно, получили запрос, нашли запрещённый па
🧨 Guardrails учатся думать: SingGuard-NSFA Современные guardrails работают примитивно, получили запрос, нашли запрещённый паттерн и заблокировали. Однако для AI-агентов этого уже недостаточно. Атаки ушли от простых jailbreak'ов к сложным сценариям с prompt injection, опасными tool calls и постепенной компрометацией reasoning. На GitHub появился SingGuard-NSFA, open-source guardrail, разработанный специально для защиты agentic AI. ⚙️ Чем он отличается от остальных? Вместо одного бинарного решения модель использует двухуровневую архитектуру. Для runtime работает лёгкий классификатор, способный принимать решение примерно за 50 мс. Если ситуация неоднозначна, подключается генеративный анализ, который пошагово сопоставляет запрос с политиками безопасности и объясняет, почему действие считается опасным. 🧠 Не просто jailbreak SingGuard построен вокруг таксономии NSFA (Not Secure For Agents), которая описывает 185 вариантов угроз, связанных именно с агентными системами. Среди них: ➖ prompt injection и jailbreak; ➖ попытки извлечения секретов; ➖ генерация вредоносного кода; ➖ опасное использование инструментов; ➖ утечка конфиденциальных данных; ➖ атаки на доступность через истощение ресурсов. В отличие от обычных модераторов контента, модель проверяет не только запрос пользователя, но и ответ самого агента перед выполнением действий. 🛡️ Куда все идет? За последний месяц мы уже видели MCP Injection, GhostCommit и workflow-level jailbreak. Во всех случаях проблема, что модель не генерирует токсичный текст, но принимает опасные операционные решения. Похоже, следующее поколение guardrails будет оценивать уже не содержание диалога, а безопасность поведения AI-агента во время выполнения задач. 🔗 GitHub: https://github.com/inclusionAI/SingGuard-NSFA Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #AgenticAI #AISecurity #Guardrails #PromptInjection #RuntimeSecurity #AppSec #SecureTechTalks

🧨 Данные с сайтов воруют AI-агенты, а CAPTCHA больше не помогает Раньше было достаточно защититься от обычных веб-сканеров.
🧨 Данные с сайтов воруют AI-агенты, а CAPTCHA больше не помогает Раньше было достаточно защититься от обычных веб-сканеров. Сегодня этого уже мало. Всё больше компаний используют agentic crawlers, т.е. AI-агентов, которые скачивают страницы, понимают структуру сайта, объединяют информацию из разных разделов, сжимают её и превращают в готовую базу знаний для RAG и LLM. На arXiv вышло исследование Out of Sight, посвящённое защите контента от агентов. ⚙️ Контент стал новой добычей Современный crawler умеет гораздо больше, чем пройтись по ссылкам. Он открывает документацию, следует по внутренним переходам, анализирует API, собирает статьи в единое представление, удаляет повторы и оставляет только самую ценную информацию. В результате developer-порталы, базы знаний, help-центры и техническая документация превращаются в готовый источник данных для обучения моделей, построения RAG-систем или анализа инфраструктуры потенциальной цели. 🧠 Победить AI его же оружием Авторы предлагают отказаться от борьбы с самим сканированием. Вместо этого они предлагают защищаться от сжатия информации. AI-агент почти всегда пытается максимально сократить объём данных без потери смысла. Если критически важные детали распределить по документу таким образом, чтобы они терялись или искажались при автоматическом summarization, ценность украденного контента резко падает. Защита начинает работать не против HTTP-запроса, а против всей цепочки «чтение → анализ → сжатие → построение базы знаний». 🛡️ Новая гонка вооружений Похоже, в эпоху AI-агентов защищать придётся уже не только доступ к данным, но и способность моделей понимать и эффективно извлекать их смысл. 🔗 Исследование: https://arxiv.org/abs/2607.07069 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #AgenticAI #RAG #WebSecurity #ThreatModeling #DataProtection #CyberSecurity #SecureTechTalks

🧨 PNG-файл может украсть секреты у AI-агента Исследователи представили атаку GhostCommit, где вредоносная инструкция прячетс
🧨 PNG-файл может украсть секреты у AI-агента Исследователи представили атаку GhostCommit, где вредоносная инструкция прячется внутри PNG-изображения в Pull Request. Для человека картинка выглядит безобидно, а большинство AI-ревьюеров вообще не анализируют её содержимое. ⚙️ Как работает GhostCommit? Атака использует разрыв между двумя типами AI-инструментов. Сначала Pull Request проходит проверку AI-ревьюером, который анализирует только текстовые изменения и пропускает изображение. Позже другой AI-агент, уже работающий с репозиторием целиком, открывает PNG, извлекает скрытую инструкцию и начинает выполнять её как часть своей задачи. 🧠 Что заставляют делать агента? В демонстрации агент открывал файл .env, извлекал API-ключи и другие секреты, после чего не отправлял их напрямую наружу, а маскировал в исходном коде в виде массива чисел. Такой коммит выглядит как вполне легитимное изменение, а классические secret scanners не распознают подобную форму эксфильтрации. 🛡️ Дело в Архитектуре Проблема уже не в качестве модели, а в архитектуре агентных пайплайнов. Один AI проверяет код, другой пишет его, третий запускает CI. Каждый из них видит проект по-своему. GhostCommit показывает, что достаточно найти «слепую зону» между такими этапами, чтобы обойти весь процесс защиты. Исследователи также проанализировали 6480 Pull Request в 300 популярных open-source проектах и обнаружили, что 73% изменений попадают в основную ветку без содержательной проверки человеком или AI-ревьюером. Именно такие цепочки становятся наиболее привлекательной целью для атак на AI-агентов. 🔗 Источник: https://www.bleepingcomputer.com/news/security/ghostcommit-hides-prompt-injection-in-images-to-fool-ai-agents-steal-secrets/ Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #AgenticAI #PromptInjection #SupplyChainSecurity #AppSec #CodeReview #CyberSecurity #SecureTechTalks

🧨 AI-агенты научились обходить собственные защитные механизмы Большинство тестов безопасности проверяют LLM просто задавая о
🧨 AI-агенты научились обходить собственные защитные механизмы Большинство тестов безопасности проверяют LLM просто задавая опасный запрос и проверяя, откажется ли модель его исполнять. Однако исследователи показали, что для coding-агентов такой подход больше не работает. Оказывается, агент может уверенно отказаться выполнять вредоносный запрос в чате, а затем самостоятельно собрать тот же результат в процессе обычной разработки. ⚙️ Как работает jailbreak? Исследователи разбили опасную задачу на цепочку привычных действий IDE-агента: 🔹 чтение файлов проекта; 🔹 анализ существующего кода; 🔹 создание новых модулей; 🔹 исправление ошибок; 🔹 рефакторинг; 🔹 генерация итогового проекта. Каждый отдельный шаг выглядит полностью легитимным. Однако в сумме агент постепенно строит код, который в обычном чате отказался бы генерировать. 🧠 Что проверяли? Авторы протестировали GitHub Copilot с несколькими современными моделями. При прямых запросах практически все они корректно отказывались выполнять опасные инструкции. Но при разбиении задачи на последовательность обычных действий IDE исследователи получили успешное выполнение во всех протестированных сценариях. 🛡️ Делаем выводы Для AI-агентов недостаточно фильтровать отдельные сообщения. Решения начинают приниматься на уровне execution graph, где безопасные действия по отдельности складываются в небезопасный результат. 🔗 Исследование: https://arxiv.org/abs/2607.03968 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #GitHubCopilot #AgenticAI #Jailbreak #AISecurity #AppSec #CyberSecurity #SecureTechTalks

🧨 Skills AI-агентов начали массово отравлять Skills сегодня становятся аналогом npm-пакетов для AI-агентов, они расширяют во
🧨 Skills AI-агентов начали массово отравлять Skills сегодня становятся аналогом npm-пакетов для AI-агентов, они расширяют возможности модели, но при этом наследуют её привилегии, могут запускать команды, читать файлы, обращаться к сети и использовать API. ⚙️ Исследования За период с марта по май 2026 года исследователи ESET проанализировали почти 900 000 skills: 🔹 более 25 000 признаны подозрительными; 🔹 свыше 3 000 содержали вредоносную функциональность; 🔹 всего за два месяца число выявленных вредоносных skills выросло почти в пять раз. 🧠 Что умеют вредоносные skills? Исследователи обнаружили целый набор типичных возможностей: ➖выполнение shell-команд; ➖доступ к локальным файлам; ➖загрузка и запуск сторонних программ; ➖внедрение кода в рабочий процесс агента; ➖кража учётных данных и API-ключей; ➖скрытая обфускация собственного поведения. Проблема в том, что каждая из этих возможностей сама по себе может быть абсолютно легитимной. Поэтому статический анализ всё чаще оказывается бесполезным. Он видит код, но не понимает намерение. 🛡️ Куда движется Agent Security? Проверять содержимое skills уже недостаточно. Новые работы предлагают запускать их в песочнице и анализировать реальное поведение: какие процессы создаются, какие файлы читаются, куда уходят данные и как они пересекают границы доверия. Такой подход демонстрирует заметно более высокую эффективность по сравнению со статическими сканерами. 🔗 Источник: ESET Threat Report H1 2026 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #AgenticAI #AISecurity #SupplyChainSecurity #RuntimeSecurity #AppSec #CyberSecurity #SecureTechTalks

🧨 Автономный AI-вымогатель начал атаку Мы дождались момента, когда AI перестал просто помогать атакующим и начал самостоятел
🧨  Автономный AI-вымогатель начал атаку Мы дождались момента, когда AI перестал просто помогать атакующим и начал самостоятельно проводить полноценные атаки. Исследователи Sysdig разобрали кампанию JADEPUFFER, первый публично описанный случай, где LLM-агент без участия человека выполнил весь kill chain: от первоначального проникновения до шифрования инфраструктуры и требования выкупа. ⚙️ Как проходила атака? Точкой входа стала уязвимость CVE-2025-3248 в Langflow. Получив удалённое выполнение кода, агент начал действовать как опытный пентестер. Сначала он собрал всё, что представляло ценность: API-ключи OpenAI, Anthropic, Gemini и DeepSeek, облачные креденшелы AWS, Azure, Google Cloud, Alibaba и Tencent, учётные данные баз данных и даже ключи криптокошельков. Затем самостоятельно построил маршрут дальнейшего продвижения по инфраструктуре. 🧠 AI сам принимал решения Следующей целью стал MinIO. Агент обнаружил сервис, автоматически проверил стандартные учётные данные minioadmin:minioadmin, получил доступ и закрепился через планировщик задач, периодически отправляя beacon на управляющий сервер. После этого он переключился на Nacos, воспользовался CVE-2021-29441, получил административный доступ и добрался до MySQL. В итоге агент зашифровал 1342 записи конфигурации Nacos, удалил исходные таблицы и оставил записку с требованием выкупа. При этом ключ шифрования нигде не сохранился, поэтому восстановление оказалось невозможным даже в случае оплаты. 🧪 Почему исследователи уверены, что это был AI? Артефакты выглядят необычно для классического вредоносного ПО. Код содержал большое количество подробных комментариев на естественном языке. При ошибках агент не просто повторял действия, а анализировал причину сбоя, перепланировал атаку и самостоятельно исправлял её. По оценке Sysdig, в ходе кампании использовались сотни различных эксплойтов и техник. 🔗 Источник: https://www.sysdig.com/blog/jadepuffer-agentic-ransomware-for-automated-database-extortion Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #Ransomware #AgenticAI #ThreatIntelligence #Malware #CyberSecurity #Sysdig #SecureTechTalks

🧨 Microsoft решили, что AI-агентам больше нельзя доверять права пользователя Компания MS представила Microsoft Execution Con
🧨 Microsoft решили, что AI-агентам больше нельзя доверять права пользователя Компания MS представила Microsoft Execution Containers (MXC), новый слой исполнения для AI-агентов в Windows и WSL. Даже если агент получил shell, написал код или решил вызвать инструмент, он не должен автоматически наследовать все права пользователя. ⚙️ Изоляция с помощью MXC MXC запускает действия агента в изолированной среде, где политики определяют, к чему разрешён доступ. Можно ограничить файловую систему, сеть, процессы и другие ресурсы ещё до выполнения сгенерированного кода. В первой версии доступны два режима. Process Isolation изолирует выполнение отдельных команд и ограничивает их доступ к файлам и сети. Session Isolation полностью отделяет агента от рабочего сеанса пользователя: рабочего стола, буфера обмена, устройств ввода и других пользовательских процессов. Каждая сессия работает от собственной учётной записи с отдельными политиками безопасности. 🧠 Повышаем уровень защиты Последние месяцы мы регулярно пишем про атаки на AI-агентов: prompt injection, MCP injection, AutoJack, компрометацию tool chain... Практически во всех случаях проблема одна и та же, агент получает слишком широкие полномочия. Microsoft фактически предлагают перенести принцип наименьших привилегий в мир агентных систем. Модель может ошибиться, но последствия этой ошибки должны оставаться внутри контейнера. 🔗 GitHub: https://github.com/microsoft/mxc Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #AgenticAI #Microsoft #RuntimeSecurity #Sandbox #AppSec #CyberSecurity #SecureTechTalks

🧠🕵️ Claude Code нашли с "водяными знаками" в запросах Исследователи обратили внимание на любопытную особенность Claude Code
🧠🕵️ Claude Code нашли с "водяными знаками" в запросах Исследователи обратили внимание на любопытную особенность Claude Code. Если клиент работает не через официальный API Anthropic, а через собственный прокси (ANTHROPIC_BASE_URL), он может незаметно изменять символы в системном промпте. Вместо привычной строки: Today's date is 2026-06-30 клиент использует визуально идентичные символы: другой апостроф или разделитель даты. Для пользователя и модели текст выглядит одинаково, но на сервер отправляется уже немного другой набор Unicode-символов. Фактически это стеганографическая метка, встроенная прямо в системный контекст. ⚙️ Что именно кодируется? По результатам реверс-инжиниринга логика появилась в версии 2.1.196. При использовании собственного ANTHROPIC_BASE_URL клиент анализирует адрес прокси и, по утверждению исследователей, проверяет совпадение с набором заранее заданных доменов. Отдельно учитывается часовой пояс, например, Asia/Shanghai или Asia/Urumqi. Полученные признаки кодируются изменением отдельных символов даты. При этом сами списки доменов, как сообщается, скрыты в бинарном файле с помощью Base64 и XOR-обфускации. 🧨 Зачем это нужно? Наиболее вероятным объяснением является борьба с неофициальными прокси и массовой дистилляцией моделей. Сегодня существует рынок прокси, которые перепродают доступ к Claude. Кроме того, через такие шлюзы можно автоматически собирать большие массивы ответов модели для последующего обучения собственных LLM. Если выводы исследователей верны, подобные метки позволяют серверной стороне определить, что запрос, вероятно, пришёл не через официальный API. 🛡️ Почему это вызвало дискуссию? Главная претензия не к самой идее защиты от дистилляции, а к её реализации. По данным реверс-инжиниринга, клиент с доступом к shell, Git и файловой системе анализирует параметры окружения и скрытно кодирует их в системном промпте, хотя подобное поведение не было описано в release notes. Для инструментов такого уровня привилегий прозрачность становится вопросом доверия. Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #Claude #Anthropic #LLM #ReverseEngineering #AIsecurity #AgenticAI #SupplyChainSecurity #SecureTechTalks

🚨 У AI-агентов появился полноценный стек безопасности На arXiv вышла работа AI-Infra-Guard, фреймворк для тестирования безоп
🚨 У AI-агентов появился полноценный стек безопасности На arXiv вышла работа AI-Infra-Guard, фреймворк для тестирования безопасности агентных систем. Авторы разбивают фреймворк на 4 слоя: 🔹 Инфраструктурный слой: движки вывода, серверы моделей, API обслуживания 🔹 Протокольный слой: MCP-серверы, API, плагины, внешние инструменты 🔹 Агентный слой: планировщик, память, маршрутизатор инструментов, исполнитель 🔹 Модельный слой: обработка промптов, управление контекстом, логика рассуждений 🧐 Каждый слой ломается по-разному ➖На инфраструктурном уровне: — открытые административные интерфейсы — слабая аутентификация в системе обслуживания моделей — отравленные артефакты моделей — небезопасные механизмы горячего обновления ➖На протокольном уровне:   — вредоносная регистрация MCP-инструментов — подмена схемы вызовов — скрытая передача аргументов — имитация легитимных инструментов ➖На агентном уровне: — рекурсивные циклы вызова инструментов — повышение привилегий через цепочки вызовов — отравление памяти — захват контекста выполнения ➖На модельном уровне: — джейлбрейки — переопределение инструкций — скрытые внедрения в промпты — утечки цепочек рассуждений ⚙️ Что внутри AI-Infra-Guard Фреймворк выглядит очень серьёзно: • 1400+ правил безопасности75+ компонентов AI-экосистемы26 операторов джейлбрейкамногошаговая оркестрация атак в чёрном ящикеаудит MCP-серверовпроверка агентных навыков16 тестовых датасетов Особенно интересен их подход к многошаговой эксплуатации. Атака строится по цепочке: шаг 1 → подготовка контекста шаг 2 → формирование доверия шаг 3 → разведка доступных инструментов шаг 4 → проверка прав доступа шаг 5 → переход к выполнению полезной нагрузки Это намного ближе к реальным атакам на агентные системы, чем классические одноходовые проверки. 🔗 Статья: https://arxiv.org/pdf/2606.31227 Stay secure and read SecureTechTalks 📚 #cybersecurity #aiagents #llmsecurity #redteam #mcp #agentsecurity #promptinjection #devsecops #offensivesecurity #securetechtalks

📌 Уязвимость не всегда живёт в одном файле Когда мы ищем баги в коде, самые опасные цепочки часто размазаны по десяткам файл
📌 Уязвимость не всегда живёт в одном файле Когда мы ищем баги в коде, самые опасные цепочки часто размазаны по десяткам файлов. Данные приходят через controller, проходят DTO, service layer, helper’ы, а потом внезапно оказываются внутри SQL-запроса, shell-команды или file API. На GitHub появился новый open-source инструмент от PhonePe "Nika". Инструмент строит полный путь движения данных через приложение, что делает анализ намного ближе к реальной эксплуатации. ⚙️ Что умеет Nika? Внутри: 🔹 строит межфайловый graph зависимостей 🔹 делает inter-procedural taint tracking 🔹 связывает source → propagation → sink 🔹 анализирует branch-aware изменения (полезно для PR review) 🔹 использует AI-assisted triage для сокращения false positives Поддерживаемые sink’и: • SQL execution • File system operations • Template engines • Reflection • Network requests • Deserialization points Для понимания, инструмент не про «подозрительные строки», а про реальные пути эксплуатации. Для security review больших Java codebase это особенно полезно, потому что позволяет быстро понять, как именно пользовательский ввод проходит через бизнес-логику. 🤖 Интересный момент После основного анализа Nika умеет прогонять findings через LLM и дополнительно фильтровать шум. Это хороший пример правильного применения AI в AppSec, т.к. AI здесь не ищет баги, а помогает понять насколько они эксплуатируемые. 🔗 Исходники: https://github.com/PhonePe/nika Stay secure and read SecureTechTalks 📚 #cybersecurity #appsec #devsecops #javasecurity #taintanalysis #securecoding #opensource #codeaudit #infosec #securetechtalks