RED BLUE Machines | ИИ и безопасность
رفتن به کانال در Telegram
Соединяем машинное обучение с кибербезопасностью. @tokarev_i_v Вся информация предоставляется исключительно в ознакомительных целях.
نمایش بیشتر292
مشترکین
اطلاعاتی وجود ندارد24 ساعت
اطلاعاتی وجود ندارد7 روز
اطلاعاتی وجود ندارد30 روز
در حال بارگیری داده...
کانالهای مشابه
هیچ دادهای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
ابر برچسبها
هیچ دادهای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
ژوئیه '24ژوئیه '24
ژوئیه '24
+55
در 0 کانالها
ژوئن '24
+237
در 3 کانالها
پستهای کانال
Комплексный проект по безопасности наших любимых ллмок
JailbreakBench
Авторы трекают прогресс по вредным промтам, собирают статьи по ним
+ ведут несколько репозиториев (в том числе и с самими промтами)
+ лидерборд
+ датасет собирают
+ можно собрать пайплаин для редтима
https://jailbreakbench.github.io/index.html
https://github.com/JailbreakBench/jailbreakbench
https://huggingface.co/datasets/JailbreakBench/JBB-Behaviors
| 2 | Исследователи из New York University пишут, что выложили датасет из 200 CTF соревнований (которые проводились NYU с 2017 по 2023 год), чтобы на них тестить LLMки.
+ вроде как код для автоматизации тестирования
+ некоторые ллмки уже потестили
В репозиториях нужно разбираться, так сходу не очень понятно. Пусть будет.
https://github.com/NYU-LLM-CTF/LLM_CTF_Database
https://github.com/NYU-LLM-CTF/llm_ctf_automation
NYU CTF Dataset: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security
https://arxiv.org/abs/2406.05590 | 337 |
| 3 | Тут статья вышла про то, что мультиагенты на базе LLM могут эксплуатировать Zero-Day уязвимости (когда у агента нет описания уязвимости)
Исследователи назвали свой метод HPTSA.
Нужны 3 компонента: планировщик, менеджер для агентов и специализированные под конкретные задачи агенты.
Планировщик исследует вебсайт и выделяет набор инструкций которые затем отправляет менеджеру.
Менеджер определяет какого агента вызвать. Также собирает информацию от агента после его вызова, чтобы иметь возможность изменять инструкции или вызывать другого агента.
Выделили 6 типов специализированных агентов:
XSS, SQLi, CSRF, SSTI, ZAP, и обобщейнный агент для анализа на web-уязвимости.
Агенты имеют доступ к тулам (sqlmap, ZAP сканеру и тд), и к документам. Авторы пишут, что для каждого агента собирали по 5-6 документов по разным типам уязвимостей.
Работа с веб-приложениями осуществляется через Playwright.
Все тесты проводились на GPT-4 (gpt-4-0125-preview) с использованием LangChain и LangGraph.
Тестировали агентов на собранном окружении с 15 веб уязвимостями. (на скринах)
В результате HPTSA подход показал хороший прирост по success rate по сравнению с простым GPT-4 агентом. Но конечно же хуже по сравнию с агентом GPT-4 w/desc - которому на вход подавалось также описание узявимости.
Без документов и специализированных агентов результаты HPTSA также ухудшаются
Некоторые примеры того как с помощью HPTSA находили уязвимости можно посмотреть в статье
Что по стоимости:
1 запуск обойдется ~ 4,39 доллара. При общем success rate 18% общие затраты составят 24,39 доллара США за успешный эксплойт.
Кода нет
Teams of LLM Agents can Exploit Zero-Day Vulnerabilities
https://arxiv.org/abs/2406.01637 | 3 654 |
| 4 | Attaque a-la russe: атака с помощью промт-инъекций русскоязычных моделей семейства Saiga2 / Хабр
https://habr.com/ru/articles/810459/ | 7 897 |
| 5 | Наткнулся на реп с джейлбрейком лламы 3.
Как понял идея в добавлении harmful префикс, который ллама3 продолжит
https://github.com/haizelabs/llama3-jailbreak | 1 433 |
| 6 | Прикольная находка. Тут чехи (есть и из Rapid7) тюнят ллмки для перевода с русского на английский с целью "Understanding cybercrime communications" используя данные из русскоязычных телеграм каналов:
Towards Better Understanding of Cybercrime: The Role of Fine-Tuned LLMs in Translation
https://arxiv.org/abs/2404.01940 | 485 |
| 7 | Ещё один инструмент для тестирования LLMок на уязвимости через промты
Prompt Fuzzer
https://github.com/prompt-security/ps-fuzz | 526 |
| 8 | Забавный кейс.
Huggingface обычно сканирует модели, и предупреждает юзера, если это *.pkl с подозрительным кодом.
При этом через inference api эту модель можно запустить.
Что и проделали чюваки из WIZ Research (это те, кто недавно нашел на гитхабе 38тб приватных данных MicroSoft :D)
В итоге команде удалось получить доступ к шеллу, где крутилась модель, а затем чуть ли не ко всему инференс кластеру.
Подробнее
Видео
@derplearning | 325 |
| 9 | LLM4Decompile
Набор LLM для декомпиляции x86 assembly инструкций в код на C.
Получены файнтюном из DeepSeek-Coder (и имеют ту же лицензию).
Есть несколько моделей в размерах 1.3B, 6.7B, 33B.
Авторы указывают, что 90% кода из LLM вновь компилируется, при этом ~21% кода полученного из моделей 6B+ показывают то же поведение, что и исходный код + проходят все исходные тесты.
LLM4Decompile: Decompiling Binary Code with Large Language Models
https://arxiv.org/abs/2403.05286
Код + ссылки на модели на HuggingFace можно найти в репозитории
https://github.com/albertan017/LLM4Decompile | 539 |
| 10 | Google еще в феврале опенсорснул Magika - быстрый идентификатор типа файла на базе маленькой ml-модельки которая весит всего ~ 1MB.
Для инференса в несколько миллисекунд достаточно cpu.
Поддерживает более 100 типов файлов (список)
Такую модельку применяют в частности в Gmail, Drive, Safe Browsing.
Можно установить тулу для python (onnx для инференса) и javascript (для инференса используется tf.js )
Блог: https://opensource.googleblog.com/2024/02/magika-ai-powered-fast-and-efficient-file-type-identification.html
демка: https://google.github.io/magika/
Код: https://github.com/google/magika | 532 |
| 11 | Червячок Джимм Morris II 🪱 - твой личный AI-вирус. И дело даже не в показе Dune II.
Создан первый GenAI вирус 👾.
В недавнем исследовании, авторы создали первый вредоносный ИИ-червь, способный самостоятельно плодиться в среде с AI-агентами. Добро пожаловать в AGI world и вот вам новый вид кибератак 😵
Чтобы продемонстрировать возможности червя, исследователи создали почтовую RAG (!!!) систему, которая может отправлять и получать сообщения подключаясь к апи ChatGPT, Gemini и LLaVA. Специалисты обнаружили два способа эксплуатации системы: с использованием текстового самовоспроизводящегося запроса и встраивая самовоспроизводящийся запрос в изображение.
При этом, дядя не шарит в безе, поэтому опишет, как он понимает механизмы атак и нафига тут RAG в системе 🕵♂.
RAG тут ИМХО необходим для того, чтобы использовать некую стартовую базу атак на представленный контекст, а также, чтобы хранить инфо о сообщениях с уже атакованных хостов в локальной (глобальной?) памяти системы. Те RAG тут про память в системе агентов и поиск по БД зловреда. Плюс, ходя вот так по хостам юзеров системы, можно подобные уже увиденные форматы личных/корп. данных прихранивать в памяти червя и юзать их для более эффективного поиска подобных записей/сообщений на основе RAG запросов. Мол вот найди LLM-агент из того, что ты сейчас "видишь" подобные форматы из подсказки (базы атак/уже атакованных сабжей) RAGа. Нашел? Прихрани в памяти агента, передай на сервак зловреда, сделай в сабж опасную инъекцию и пусти дальше по сети сабж к другим юзерам 🤯
Исследователи подчеркивают, что Gen.AI черви станут новым вызовом перед службами безопасности технологических компаний и разработчиков стартапов.
Поэтому крепитесь 🦾 И будьте готовы. | 365 |
| 12 | Cледуй за белым кроликом - WhiteRabbitNeo
- это сетка орентированна на киберсеков и она не плохая для проги
- она умеет генерить ответы с json, вызывать тулы и прочее
- сходу пишет код с многопоточностью(приятно)
- неплохо пишет DL код
Она и правда классная!
hf org
site | 258 |
| 13 | LLamaGuard-7b для проверки промтов и ответов на вредный контент.
Доступ к самой модельке нужно запрашивать.
https://huggingface.co/meta-llama/LlamaGuard-7b | 411 |
| 14 | Прогнал (по 1 запуску на сценарий) одну из самых лучших 7B моделек на сегодня https://huggingface.co/openchat/openchat-3.5-0106
CyberMetric-10000-v1.json | Final Accuracy: 78.3%
CyberMetric-500-v1.json | Final Accuracy: 82.8%
Результаты по тем 80 вопросам, что в табличке выше: CyberMetric-80-v1.json | Final Accuracy: 85.0%
Вопросы на которые ответила неправильно на CyberMetric-80-v1.json добавлю в комментарий к посту. | 393 |
| 15 | Выложили бенчмарк-датасет на 10000 вопросов (в форме теста) по разным направлениям кибербезопасности, чтобы проверять знания людей и ллмок.
На картинке результаты прогона по 80 специально отобранным из 10000 вопросам.
https://github.com/cybermetric/CyberMetric | 430 |
| 16 | Кстати, прямо сейчас проходит
Large Language Model Capture-the-Flag (LLM CTF) Competition @ SaTML 2024
Как я понял из описания продлится до 3 марта.
Кнопочка регистрации команды активна
https://ctf.spylab.ai/ | 6 652 |
| 17 | بدون متن... | 369 |
| 18 | На этот раз обзорная статья по LLM в киберсеке
Large Language Models in Cybersecurity: State-of-the-Art
https://arxiv.org/abs/2402.00891 | 393 |
| 19 | Google подключили LLM к своему фаззеру oss-fuzz и выложили
https://github.com/google/oss-fuzz-gen
Судя по описанию пока что поддерживает только проприетарные сервисы/LLMы:
Vertex AI code-bison
Vertex AI code-bison-32k
Gemini Pro
OpenAI GPT-3.5-turbo
OpenAI GPT-4
А блог выходил еще полгода назад:
https://security.googleblog.com/2023/08/ai-powered-fuzzing-breaking-bug-hunting.html
И вот новый:
https://security.googleblog.com/2024/01/scaling-security-with-ai-from-detection.html
Ссылочку нашел тут: https://t.me/j_links/7357 | 373 |
| 20 | Обзорная статья по графовым нейронкам в киберсеке
Use of Graph Neural Networks in Aiding Defensive Cyber Operations
https://arxiv.org/abs/2401.05680 | 317 |
