fa
Feedback
ML&|Sec Feed

ML&|Sec Feed

رفتن به کانال در Telegram
1 356
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+117 روز
+6130 روز
آرشیو پست ها
Repost from Neural Shit
Австралийцы тем временем решили, что обычных тараканов человечеству недостаточно, и запилили киборгов-тараканов. Со шприцами.
+1
Австралийцы тем временем решили, что обычных тараканов человечеству недостаточно, и запилили киборгов-тараканов. Со шприцами. Исследователи из Университета Квинсленда навесили на гигантских роющих тараканов камеры, датчики, прочую хитрую электронику и миниатюрные системы для инъекций. После всех этих манипуляций тараканом можно управлять и удалённо активировать шприц. Получившихся тварей назвали paraborgs. Зачем оно вообще надо? Это чтобы запускать этих тварей под завалы после землетрясений и прочих катастроф. Таракан размером с котлету может пролезть туда, куда кожаный спасатель или нормальный робот физически не доберётся, найти пострадавшего по встроенной камере и вколоть ему нужный препарат, пока спасатели пытаются до него докопаться. Сами исследователи пишут, что вот этот франкенштейн срабатывал довольно бодро: если таракан уже находился в пределах 15 см от цели, инъекция проходила успешно в 95% случаев. Полный цикл "доползти --> правильно встать --> сделать укол" получился в 72% испытаний. Дальше учёные хотят собирать целые рои таких кибер-тараканов, где у разных особей будут разные задачи: одни ищут людей, другие передают данные, третьи оказывают первую помощь и т.д. Так как это австралийцы, жду следующих логичных инноваций: пауков-птицеедов для наложения жгутов и гигантских эвакуационных сколопендр-носильщиков. тут подробнее

Repost from Makrushin
Анализ причины действия для защиты ИИ-агентов Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие. Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection. Угадай цену такой проверки? Трехкратный рост задержки в действиях. Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты. @makrushin

Repost from Сиолошная
OpenAI опубликовали долгожданный разбор с деталями инцидента с HuggingFace: https://openai.com/index/hugging-face-incident-an
OpenAI опубликовали долгожданный разбор с деталями инцидента с HuggingFace: https://openai.com/index/hugging-face-incident-and-the-road-ahead/ Вместе с ним вышел отчёт от независимой организации METR совместно с Ryan Greenblatt из Redwood Research: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ Бегом читать 🏃

В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с пос
В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе) мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день. Есть ли возможность проверить все вызовы вручную? - нет. Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное. 🐱 Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки Red team строится так: Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар 💛модель ищет правдоподобное окно и добавляет минимум шагов 💛панель джаджей проверяет, что правка настоящая, минимальная и естественная 💛сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце). На постере замеры работоспособности 💅 P.S. было еще 2 крутые работы с симпозиума: Stealing Reasoning Traces from Proprietary LLM APIs Diffuse AI Control on Fuzzy Tasks

Repost from DevSecOps Talks
Agentic Access Model Всем привет! Вопрос управления доступом – задача крайне непростая. Особенно непростой она становится при работе с агентами. Для того, чтобы комплексно подойти к вопросу, ребята из Cloudflare предложили своё видение – Agentic Access Model (AAM). В её основе лежат 5 принципов: 🍭 Учетные данные краткосрочны и ограничены 🍭 Политики применяются именно там, где осуществляется действие или сетевая активность 🍭 Подтверждение действия со стороны человека 🍭 Шаблоны выполняемых задач не должны быть общими 🍭 Осуществляется контроль полномочий Для того, чтобы реализовать эти принципы, Авторы предлагают концепт архитектуры, который состоит из: Identity Broker, Access Engine, Mediation Layer и Trust Ratchet. Каждый элемент и его назначение описывается в статье. Есть пример того, как это можно применять на практике. В итоге получается целостная картина, которая позволяет управлять доступом при работе с агентами и их возможностями при выполнении задач.

Repost from OK ML
Год каналу, а за год накопилось столько всего, что пора сделать навигацию 😑 Уязвимости и AI SecuritySuperset. Три уязвимостиXSS в NextChat — CVE-2025-50733RCE при загрузке моделей в skops — CVE-2025-54886SSRF в Firecrawl — CVE-2025-57818 Local Deep Research — CVE-2025-57806SSRF в HackMD-MCP — CVE-2025-59155RCE в Keras — CVE-2025-9906Prompt Injection в WindsurfRCE в Hugging Face Transformers — CVE-2026-4372пять способов обойти PickleScanатаки на ML supply chainOWASP Agentic Skills Top 10AI Agent Traps от Google DeepMindShadow AI — безопасность MCP 1, 2 , 3 🧘‍♀️ Инструменты, библиотеки и фреймворкиOptuna — тюнинг гиперпараметров — spaCy — промышленный NLP — Netron — рентген для ML-моделей — JAXFORMERDVCPolarsWeights & BiasesEvidently AIPydanticMLBoxInterpretMLOpenTelemetry + LangfuseKedroNVIDIA NeMoInspect Evals 🤩 AI-агенты и мультиагентные системыRoboDuck и победа Theori в AIxCCгде пентест-агенты уже работают, а где нужен человек MetaGPT + AFLOW — безопасность агентных систем 1, 2 MCP как новая поверхность атакside-channel атаки на агентовмультиагентные системы и роевой интеллектмониторинг rogue agentsHarness Engineering 🦔 Исследования и разборы статейModel Inversion Attacksscheming у AI в реальном мире — Your Agent Is Mine: атаки на LLM supply chain — WEF: AI for Cybersecurity 2026 — обзор исследований по LLM-based vulnerability detection — может ли AI самостоятельно взломать бинарникEmergence AI: что произошло, когда AI оставили жить без людей — Anthropic об AI-enabled cyberattacks — InfoKV и сжатие KV-cache — Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2) 💔 ML: архитектуры, концепции и теорияKAN vs MLPнейросимвольный AIмаленькие языковые моделиметрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие — теория категорий и AIReaGAN и агентный подход к графовым нейросетям 🔪 Практика и экспериментыкак искать секреты в Git-репозиториях SQL-инъекция в ML-проекте — Practical NLP: репозитории и ноутбуки — типичные ошибки ML в проде — первый запуск локальной LLM на Jetson Orin Nano — тренажёр prompt injection от Lakeraс чего начать изучение AI Security Короче, тут уже не канал, а небольшой индекс по ML × AI Security. Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.

Repost from papirsec
опа Опубликован проект приказа о внесении изменений в Требования утв. приказом ФСТЭК России от 11.04.2025 № 117 1. Терминология переезжает на новую базу Определение ИИ теперь берется из п. 1 ст. 3 ФЗ от 26.07.2026 № 243-ФЗ, а агент ИИ - из п. 3.1.1 ГОСТ Р 71476-2024. Из третьего абзаца п. 49 исключается слово «доверенных» 2. Новый организационный документ В подпункте «д» п. 14 появляется - «порядок ЗИ при использовании ИИ;» 3. Пункт 60 - полностью новая редакция Базовые требования при применении моделей ИИ: - выделение моделей ИИ в отдельный сегмент ИС/ИТКИ; - привилегированный доступ в сегмент - только по усиленной МФА; - контроль доступа и минимально необходимые права; - регистрация и анализ действий пользователей. Если ИИ обрабатывает информацию ограниченного доступа или реализует значимые функции: - контроль доступа пользователей к моделям; - фильтрация входных запросов и выходных ответов; - квотирование числа запросов; - ограничение и контроль функциональности моделей. Реализация через ПО в составе ИС и/или отдельные средства защиты моделей ИИ 4. Пункт 61 - про агентов и сервисы Для агентов ИИ, включая автономные, требуются меры против несанкционированного воздействия на ресурсы ИС и управление правами доступа агентов. Для сервисов на основе моделей ИИ меры подрядчика фиксируются во внутренних стандартах и регламентах

Repost from N/a
Меньше битов ≠ больше защиты Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модел
Меньше битов ≠ больше защиты Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам. Звучит как бесплатная защита. Но есть нюанс. Авторы исследования David and Goliath⁠ проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление. В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой. Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве. Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей»⁠ мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно. Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков. #AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research

Repost from N/a
Новая атака на Grok что бы собрать пользовательские данные Исследователи из Adversa AI обнаружили способ незаметно похитить данные пользователя Grok: имя, геолокацию, историю переписки просто попросив ИИ «открыть ссылку». На вредоносной странице спрятана зашифрованная AES-256 инструкция. Grok сам её расшифровывает через встроенный Python-sandbox, принимает за «доверенный» источник и отправляет личные данные на сервер злоумышленника без каких-либо предупреждений. О проблеме сообщили xAI ещё 3 июня. Реакции пока ноль. По состоянию на 19 августа атака всё ещё работает (~40% успеха). https://gbhackers.com/zero-click-grok-attack-prompt-injection/

Repost from Хабр / ML & AI
753B на одной видеокарте: разбор FreeToken Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе #moe #локальные_модели #инференс #llama_cpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken | @habr_ai

Repost from N/a
Cursor и Claude Science в докер-песочнице с графическим интерфейсом. Написал скилл и пару скриптов чтобы поставить любой деск
Cursor и Claude Science в докер-песочнице с графическим интерфейсом. Написал скилл и пару скриптов чтобы поставить любой десктопный агент в песочницу и прокинуть экран на хост. Скормите их своему агенту и скажите «подними Cursor и пробрось на хост», остальное он сделает сам. OAuth через браузер тоже работает, для агента всё расписано. Лежит тут: github.com/Andy9542/bring-my-gui. Внутри плагин для Cursor и Claude Code и два скрипта на случай, если агент не нужен. У меня агент живёт в песочнице без подтверждения команд, в худшем случае он сносит только то, что внутри неё. Но есть Claude Science и другие штуки, которые хочется попробовать. Как десктопные приложения они лучше, а ставить на хост стрёмно, вдруг что снесет. До сих пор агент из песочницы показывал мне только cli. Теперь показывает и окна: на скрине Cursor из контейнера с Ubuntu, открытый через встроенный маковский VNC. На сам Mac ничего ставить не пришлось. Если потыкаете и что то отвалится, пишите сразу мне, починю быстро. Ну и лайков на Гитхабе насыпьте, у меня все.

Repost from N/a
Ох, давненько же я не сдувал пыль с этого канала. А тут как раз и хороший повод появился. Пока ждем записи вчерашнего выступления, делюсь материалами нашего доклада на #offzone2026 ❤

Repost from Dealer.AI
OWASP Agent Memory Guard - новая защита от отравления памяти ИИ-агентов. Буду звать его теперь AMG (не mercedes 👍). 📦 помнится говорил про спящих агентов. Это способ атак отложенных во времени и работающих по триггеру в рамках разговора. А-ля стоп слово в bdsm 🤣. AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста. Что умеет AMG? ✅ Перехватывает все чтения/записи в память агента ✅ Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей ✅ Применяет политику: allow, redact, quarantine, block ✅ Работает без внешних API, всё локально ✅ Готовый middleware для LangChain, LlamaIndex. Уже вижу, как безопасники ликуют 😜 Цифры, которые заявляют: · Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток. 😮‍💨 · Точность - 100% (precision), 0% false positive, эти уже хорошо. 🍷 · Задержка ~59 микросекунд на операцию. Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке. 😐 Уже в pip:
pip install agent-memory-guard
Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили. 🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч. 💪

Repost from Sachok AI
Red Security о том как использовать ИИ в форензике и анализе вредоносного кода.