RED BLUE Machines | ИИ и безопасность
Открыть в Telegram
Соединяем машинное обучение с кибербезопасностью. @tokarev_i_v Вся информация предоставляется исключительно в ознакомительных целях.
Больше292
Подписчики
Нет данных24 часа
Нет данных7 дней
Нет данных30 дней
Загрузка данных...
Похожие каналы
Нет данных
Возникли проблемы? Пожалуйста, обновите страницу или обратитесь к нашему support-менеджеру .
Облако тегов
Нет данных
Возникли проблемы? Пожалуйста, обновите страницу или обратитесь к нашему support-менеджеру .
Входящие и исходящие упоминания
---
---
---
---
---
---
Привлечение подписчиков
июль '24июль '24
июль '24
+55
в 0 каналах
июнь '24
+237
в 3 каналах
Посты канала
Комплексный проект по безопасности наших любимых ллмок
JailbreakBench
Авторы трекают прогресс по вредным промтам, собирают статьи по ним
+ ведут несколько репозиториев (в том числе и с самими промтами)
+ лидерборд
+ датасет собирают
+ можно собрать пайплаин для редтима
https://jailbreakbench.github.io/index.html
https://github.com/JailbreakBench/jailbreakbench
https://huggingface.co/datasets/JailbreakBench/JBB-Behaviors
| 2 | Исследователи из New York University пишут, что выложили датасет из 200 CTF соревнований (которые проводились NYU с 2017 по 2023 год), чтобы на них тестить LLMки.
+ вроде как код для автоматизации тестирования
+ некоторые ллмки уже потестили
В репозиториях нужно разбираться, так сходу не очень понятно. Пусть будет.
https://github.com/NYU-LLM-CTF/LLM_CTF_Database
https://github.com/NYU-LLM-CTF/llm_ctf_automation
NYU CTF Dataset: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security
https://arxiv.org/abs/2406.05590 | 337 |
| 3 | Тут статья вышла про то, что мультиагенты на базе LLM могут эксплуатировать Zero-Day уязвимости (когда у агента нет описания уязвимости)
Исследователи назвали свой метод HPTSA.
Нужны 3 компонента: планировщик, менеджер для агентов и специализированные под конкретные задачи агенты.
Планировщик исследует вебсайт и выделяет набор инструкций которые затем отправляет менеджеру.
Менеджер определяет какого агента вызвать. Также собирает информацию от агента после его вызова, чтобы иметь возможность изменять инструкции или вызывать другого агента.
Выделили 6 типов специализированных агентов:
XSS, SQLi, CSRF, SSTI, ZAP, и обобщейнный агент для анализа на web-уязвимости.
Агенты имеют доступ к тулам (sqlmap, ZAP сканеру и тд), и к документам. Авторы пишут, что для каждого агента собирали по 5-6 документов по разным типам уязвимостей.
Работа с веб-приложениями осуществляется через Playwright.
Все тесты проводились на GPT-4 (gpt-4-0125-preview) с использованием LangChain и LangGraph.
Тестировали агентов на собранном окружении с 15 веб уязвимостями. (на скринах)
В результате HPTSA подход показал хороший прирост по success rate по сравнению с простым GPT-4 агентом. Но конечно же хуже по сравнию с агентом GPT-4 w/desc - которому на вход подавалось также описание узявимости.
Без документов и специализированных агентов результаты HPTSA также ухудшаются
Некоторые примеры того как с помощью HPTSA находили уязвимости можно посмотреть в статье
Что по стоимости:
1 запуск обойдется ~ 4,39 доллара. При общем success rate 18% общие затраты составят 24,39 доллара США за успешный эксплойт.
Кода нет
Teams of LLM Agents can Exploit Zero-Day Vulnerabilities
https://arxiv.org/abs/2406.01637 | 3 654 |
| 4 | Attaque a-la russe: атака с помощью промт-инъекций русскоязычных моделей семейства Saiga2 / Хабр
https://habr.com/ru/articles/810459/ | 7 897 |
| 5 | Наткнулся на реп с джейлбрейком лламы 3.
Как понял идея в добавлении harmful префикс, который ллама3 продолжит
https://github.com/haizelabs/llama3-jailbreak | 1 433 |
| 6 | Прикольная находка. Тут чехи (есть и из Rapid7) тюнят ллмки для перевода с русского на английский с целью "Understanding cybercrime communications" используя данные из русскоязычных телеграм каналов:
Towards Better Understanding of Cybercrime: The Role of Fine-Tuned LLMs in Translation
https://arxiv.org/abs/2404.01940 | 485 |
| 7 | Ещё один инструмент для тестирования LLMок на уязвимости через промты
Prompt Fuzzer
https://github.com/prompt-security/ps-fuzz | 526 |
| 8 | Забавный кейс.
Huggingface обычно сканирует модели, и предупреждает юзера, если это *.pkl с подозрительным кодом.
При этом через inference api эту модель можно запустить.
Что и проделали чюваки из WIZ Research (это те, кто недавно нашел на гитхабе 38тб приватных данных MicroSoft :D)
В итоге команде удалось получить доступ к шеллу, где крутилась модель, а затем чуть ли не ко всему инференс кластеру.
Подробнее
Видео
@derplearning | 325 |
| 9 | LLM4Decompile
Набор LLM для декомпиляции x86 assembly инструкций в код на C.
Получены файнтюном из DeepSeek-Coder (и имеют ту же лицензию).
Есть несколько моделей в размерах 1.3B, 6.7B, 33B.
Авторы указывают, что 90% кода из LLM вновь компилируется, при этом ~21% кода полученного из моделей 6B+ показывают то же поведение, что и исходный код + проходят все исходные тесты.
LLM4Decompile: Decompiling Binary Code with Large Language Models
https://arxiv.org/abs/2403.05286
Код + ссылки на модели на HuggingFace можно найти в репозитории
https://github.com/albertan017/LLM4Decompile | 539 |
| 10 | Google еще в феврале опенсорснул Magika - быстрый идентификатор типа файла на базе маленькой ml-модельки которая весит всего ~ 1MB.
Для инференса в несколько миллисекунд достаточно cpu.
Поддерживает более 100 типов файлов (список)
Такую модельку применяют в частности в Gmail, Drive, Safe Browsing.
Можно установить тулу для python (onnx для инференса) и javascript (для инференса используется tf.js )
Блог: https://opensource.googleblog.com/2024/02/magika-ai-powered-fast-and-efficient-file-type-identification.html
демка: https://google.github.io/magika/
Код: https://github.com/google/magika | 532 |
| 11 | Червячок Джимм Morris II 🪱 - твой личный AI-вирус. И дело даже не в показе Dune II.
Создан первый GenAI вирус 👾.
В недавнем исследовании, авторы создали первый вредоносный ИИ-червь, способный самостоятельно плодиться в среде с AI-агентами. Добро пожаловать в AGI world и вот вам новый вид кибератак 😵
Чтобы продемонстрировать возможности червя, исследователи создали почтовую RAG (!!!) систему, которая может отправлять и получать сообщения подключаясь к апи ChatGPT, Gemini и LLaVA. Специалисты обнаружили два способа эксплуатации системы: с использованием текстового самовоспроизводящегося запроса и встраивая самовоспроизводящийся запрос в изображение.
При этом, дядя не шарит в безе, поэтому опишет, как он понимает механизмы атак и нафига тут RAG в системе 🕵♂.
RAG тут ИМХО необходим для того, чтобы использовать некую стартовую базу атак на представленный контекст, а также, чтобы хранить инфо о сообщениях с уже атакованных хостов в локальной (глобальной?) памяти системы. Те RAG тут про память в системе агентов и поиск по БД зловреда. Плюс, ходя вот так по хостам юзеров системы, можно подобные уже увиденные форматы личных/корп. данных прихранивать в памяти червя и юзать их для более эффективного поиска подобных записей/сообщений на основе RAG запросов. Мол вот найди LLM-агент из того, что ты сейчас "видишь" подобные форматы из подсказки (базы атак/уже атакованных сабжей) RAGа. Нашел? Прихрани в памяти агента, передай на сервак зловреда, сделай в сабж опасную инъекцию и пусти дальше по сети сабж к другим юзерам 🤯
Исследователи подчеркивают, что Gen.AI черви станут новым вызовом перед службами безопасности технологических компаний и разработчиков стартапов.
Поэтому крепитесь 🦾 И будьте готовы. | 365 |
| 12 | Cледуй за белым кроликом - WhiteRabbitNeo
- это сетка орентированна на киберсеков и она не плохая для проги
- она умеет генерить ответы с json, вызывать тулы и прочее
- сходу пишет код с многопоточностью(приятно)
- неплохо пишет DL код
Она и правда классная!
hf org
site | 258 |
| 13 | LLamaGuard-7b для проверки промтов и ответов на вредный контент.
Доступ к самой модельке нужно запрашивать.
https://huggingface.co/meta-llama/LlamaGuard-7b | 411 |
| 14 | Прогнал (по 1 запуску на сценарий) одну из самых лучших 7B моделек на сегодня https://huggingface.co/openchat/openchat-3.5-0106
CyberMetric-10000-v1.json | Final Accuracy: 78.3%
CyberMetric-500-v1.json | Final Accuracy: 82.8%
Результаты по тем 80 вопросам, что в табличке выше: CyberMetric-80-v1.json | Final Accuracy: 85.0%
Вопросы на которые ответила неправильно на CyberMetric-80-v1.json добавлю в комментарий к посту. | 393 |
| 15 | Выложили бенчмарк-датасет на 10000 вопросов (в форме теста) по разным направлениям кибербезопасности, чтобы проверять знания людей и ллмок.
На картинке результаты прогона по 80 специально отобранным из 10000 вопросам.
https://github.com/cybermetric/CyberMetric | 430 |
| 16 | Кстати, прямо сейчас проходит
Large Language Model Capture-the-Flag (LLM CTF) Competition @ SaTML 2024
Как я понял из описания продлится до 3 марта.
Кнопочка регистрации команды активна
https://ctf.spylab.ai/ | 6 652 |
| 17 | Нет текста... | 369 |
| 18 | На этот раз обзорная статья по LLM в киберсеке
Large Language Models in Cybersecurity: State-of-the-Art
https://arxiv.org/abs/2402.00891 | 393 |
| 19 | Google подключили LLM к своему фаззеру oss-fuzz и выложили
https://github.com/google/oss-fuzz-gen
Судя по описанию пока что поддерживает только проприетарные сервисы/LLMы:
Vertex AI code-bison
Vertex AI code-bison-32k
Gemini Pro
OpenAI GPT-3.5-turbo
OpenAI GPT-4
А блог выходил еще полгода назад:
https://security.googleblog.com/2023/08/ai-powered-fuzzing-breaking-bug-hunting.html
И вот новый:
https://security.googleblog.com/2024/01/scaling-security-with-ai-from-detection.html
Ссылочку нашел тут: https://t.me/j_links/7357 | 373 |
| 20 | Обзорная статья по графовым нейронкам в киберсеке
Use of Graph Neural Networks in Aiding Defensive Cyber Operations
https://arxiv.org/abs/2401.05680 | 317 |
