ML&|Sec Feed
Открыть в Telegram
1 199
Подписчики
+624 часа
+197 дней
+4330 день
Архив постов
1 199
Repost from Alaid TechThread
Больше слайдов с Offensive AI Con 2025 - https://github.com/Offensive-AI-Con/OAIC-2025/tree/main
Пока самая интересная конфа по теме
1 199
Repost from AGI Security
JSON для LLM — всё! Да здравствует Token-Oriented Object Notation 🤖
Каждый, кто хоть раз всерьёз гонял запросы к LLM, знает, как больно бывает смотреть на счётчик токенов. Ты вроде просто отправляешь список пользователей в JSON, а нейросеть уже съела половину твоего бюджета.
TOON обещает сократить потребление токенов чуть ли не вдвое 🔥
Это формат сериализации данных JSON в LLM промпты. Он представляет те же объекты, массивы и примитивы, что и JSON, но в синтаксисе, который минимизирует количество токенов и упрощает понимание структуры для моделей.
Токен-ориентированная объектная нотация — это компактное, удобное для восприятия представление модели данных JSON для запросов LLM. Она обеспечивает сериализацию без потерь тех же объектов, массивов и примитивов, что и JSON, но в синтаксисе, который минимизирует количество токенов и упрощает структуру для моделей.
TOON сочетает в себе структуру YAML с отступами для вложенных объектов и табличную структуру в стиле CSV для однородных массивов. Преимущество TOON — однородные массивы объектов (несколько полей в строке, одинаковая структура для всех элементов), что позволяет достичь компактности, подобной CSV, и при этом добавить явную структуру, которая помогает LLM-программистам надёжно анализировать и проверять данные. Для глубоко вложенных или неоднородных данных JSON может быть более эффективным.
Сходство с CSV является намеренным: CSV прост и универсален, и TOON стремится сохранить эту узнаваемость, оставаясь при этом без потерь и простым представлением JSON для больших языковых моделей.
1 199
Repost from Russian OSINT
🛡 Пентагон продолжает тестировать🤖ИИ-агентов в наступательных кибероперациях
Forbes пишет, что военные в США продолжают форсировать интеграцию искусственного интеллекта в наступательные кибероперации, инвестируя миллионы в новые ИИ-решения. В качестве примера приводится контракт 🇺🇸Киберкомандования США со стартапом Twenty на сумму до $12.6 миллионов, который специализируется на применении ИИ для автоматизации наступательных кибервозможностей. Стартап также получил от ВМС США исследовательский контракт на сумму $240 000.
Компания делает упор на автоматизацию и масштабирование киберопераций. Речь может идти о 🤖😷системах, которые способны нацеливаться на сотни целей одновременно.
Примечательно, что команда проекта Twenty укомплектована бывшими офицерами разведки и вооруженных сил США с очень серьезным опытом. Одна из целей создать и индустриализировать кибероружие, чтобы США вместе с союзниками могли «сдерживать, а также побеждать своих противников».
Вакансии компании раскрывают чуть больше деталей. Например, Twenty ищет директора по исследованиям в области cyber offensive (наступательные технологии), который будет разрабатывать «продвинутые возможности проведения кибератак, включая фреймворки… и инструменты автоматизации на базе ИИ». Также в объявлениях имеется вакансия инженера по ИИ, где указано, что Twenty будет внедрять инструменты с открытым исходным кодом, такие как CrewAI, который используется для управления несколькими автономными ИИ-агентами, взаимодействующими друг с другом.
Продукты Twenty представляют собой шаг вперед с точки зрения автоматизации кибервойны.— комментирует Forbes. Известно, что компания ранее привлекла инвестиции от In‑Q‑Tel (венчурное подразделение ЦРУ), а также фондов Caffeinated Capital и General Catalyst. Twenty также планирует использовать ИИ-агентов для ведения информационных операций. Важной частью стратегии является разработка убедительных цифровых личностей для проведения сложных операций 🧠 с использованием социальной инженерии. Кроме того, мелькает тема создания убедительных 🤖 ИИ-персон для внедрения в сети и сообщества противника. 👆Ранее TheIntercept писали, что 👮Командование специальных операций США (SOCOM) переходит от теоретических изысканий к планомерному созданию cовременного ИИ-инструментария для ведения информационных войн. ✋ @Russian_OSINT
1 199
Repost from Пост Лукацкого
Про фреймворки/языки описания правил обнаружения YARA, SIGMA и т.п. слышали многие 👂, но что насчет формализации способов описания различных атак, направленных на LLM? Как обнаруживать jailbreak prompt, adversarial prompt и иные варианты вредоносного использования ИИ, обходящие встроенные фильтры и механизмы защиты? 🤖
И такой фреймворк появился. Это NOVA, который позволяет создавать правила 🧑💻 в похожем на YARA синтаксисе для мониторинга и обнаружения подозрительных запросов, описываемых ключевыми словами или регулярными выражениями. Также NOVA поддерживает семантическую похожесть и поддерживает LLM для анализа и обнаружения плохих запросов. Например, вот так выглядит правило для обнаружения промптов по написанию вредоносного кода 🦠
(keywords.$safety_override or keywords.$ethical_bypass) and (keywords.$hacker_persona or keywords.$malware_terms) and (keywords.$obfuscated_format or keywords.$template_markers) or (keywords.$malware_terms or keywords.$stealth_tech or keywords.$wordcount_manip) and (keywords.$obfuscated_format or keywords.$template_markers) or semantics.$malwareА так, обнаружение обычной prompt injection:
semantics.$injection* or keywords.$bypass*Несмотря на то, что это бета-версия проекта, выглядит вполне себе интересно. #обнаружениеугроз #ии #framework
1 199
Вообще бомба, 90 вопросов для редтимера перед началом теста.
А еще структура отчета по тестированию
И это помимо базового обзора устройства ии-системы и овасп ллм топ 10
1 199
Repost from AISecHub
AI pentest scoping playbook
https://devansh.bearblog.dev/ai-pentest-scoping/
1 199
Repost from Эксплойт
Полностью снимаем цензуру у текстовых нейросетей — на GitHub вышла проект, который превратит самую кроткую LLM в безумного психопата, готового выдать любую инструкцию.
— Программа срезает цензуру с корнем, на уровне внутренних настроек;
— При этом все параметры подбираются автоматически;
— Цензура падает почти в ноль: тестировали на скромной Gemma 3 от Google — процент отказов упал с 97% до 3%;
— Работает со всеми типами моделей;
— Минус один: нужен хотя бы средний комп;
— Разумеется, бесплатно.
Пользуемся осторожно — здесь.
@exploitex
1 199
Repost from CyberSecurityTechnologies
#CogSec
#MLSecOps
Inside OpenAI Sora 2 -
Uncovering System Prompts Driving Multi-Modal LLMs
https://mindgard.ai/resources/openai-sora-system-prompts
// By chaining cross-modal prompts and clever framing, researchers surfaced hidden instructions from OpenAI’s video generator
1 199
Repost from GitHub Community
Resemble AI — клон вашего голоса
Создаёт естественную озвучку с эмоциями, акцентами и нужной интонацией.
Достаточно 5 секунд записи, чтобы ИИ полностью повторил голос любого человека.
Поддерживает русский язык и ещё 22 других.
Можно озвучивать видео, подкасты или делать дубляж с идеальной синхронизацией.
Попробовать здесь
🐱 GitHub
1 199
Repost from CyberSecurityTechnologies
#Research
"How Can We Effectively Use LLMs for Phishing Detection?: Evaluating the Effectiveness of Large Language Model-based Phishing Detection Models", 2025.
// This study investigates how to effectively leverage LLMs for phishing detection by examining the impact of input modalities (screenshots, logos, HTML, URLs), temperature settings, and prompt engineering strategies. We evaluate seven LLMs - two commercial models (GPT 4.1, Gemini 2.0 flash) and five open-source models (Qwen, Llama, Janus, DeepSeek-VL2, R1) - alongside two DL-based baselines (PhishIntention and Phishpedia). Our findings reveal that commercial LLMs generally outperform open-source models in phishing detection, while DL models demonstrate better performance on benign samples
1 199
Repost from CyberSecurityTechnologies
#tools
#AIOps
#Red_Team_Tactics
"UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning", Nov. 2025.
]-> https://github.com/AI-secure/UDora
// In this work, we present UDora, a unified red teaming framework designed for LLM agents that dynamically hijacks the agent's reasoning processes to compel malicious behavior
1 199
Repost from AISecHub
EchoGram: The Hidden Vulnerability Undermining AI Guardrails - https://hiddenlayer.com/innovation-hub/echogram-the-hidden-vulnerability-undermining-ai-guardrails/
1 199
Repost from Клуб CDO
Наверное неожиданно, но все кто занимается управлением разработкой и работой сложных систем, хочу порекомендовать к прочтению: NASA Systems Engineering Handbook
Это не просто книга про космос — это эталон мышления инженеров, которые строят системы, где ошибка недопустима.
Что даёт эта книга:
• учит системному подходу — как из идей и требований выстроить архитектуру, которая выдержит нагрузку и время;
• показывает, как проектировать, верифицировать и валидировать решения на каждом этапе жизненного цикла;
• помогает увидеть систему целиком — от логической структуры до операционного режима;
• формирует инженерную культуру, где надёжность и прозрачность важнее скорости на короткой дистанции.
В общем там очень интересный контент про управление рисками, из оценку, планирование, дизайн систем и тп.
1 199
Repost from Градиент обреченный
Нарисуй предыдущие инструкции
Коротенький обзор/исследование возможностей Nano Banana, модели от Google для генерации и редактирования картинок, она же Gemini 2.5 Flash Image.
🟢 Контекст у модели 32k токенов и автор пробует разные странные идеи типа засунуть в промпт код html странички, чтобы она его нарисовала. Что еще интересней, так это то, что модель его отрисовывает.
🟢 Но самый забавный пример, это просьба нарисовать системный промпт в виде магнитов на холодильник (!). Так как текста много, можно потом просить нарисовать какую-то конкретную часть, чтобы нормально прочитать.
🟢 Попробовал воспроизвести, в виде магнитиков действительно рисует, а в виде обычного текста на листе или в виде татуировки почему-то не хочет.
👉 https://minimaxir.com/2025/11/nano-banana-prompts/
1 199
Repost from Раньше всех. Ну почти.
Wildberries запустила бесплатный дипфейк-детектор, который позволяет пользователям выявлять изображения, сгенерированные с помощью искусственного интеллекта, пишет ТАСС.
К разработке привлекались профессиональные AI-художники, чья экспертиза, наряду с опытом внутренней команды, позволила довести точность распознавания сгенерированных изображений до 95%.
1 199
Repost from CyberSecurityTechnologies
#AIOps
#hardening
#MLSecOps
"Evasion Attacks on LLMs - Countermeasures in Practice:
A Guide to face Prompt Injections, Jailbreaks and Adversarial Attacks", Nov. 2025.
// The publication is aimed at developers and IT security officers protecting LLM systems (pre-trained LLM as a base models in a specific applications) against evasion attacks. It offers practical insights on integrating countermeasures for system hardening
1 199
Руководство по управлению рисками в системах искусственного интеллекта
Цель этого руководства — предоставить ценную информацию и практические рекомендации по выявлению и снижению распространённых технических рисков, связанных с системами искусственного интеллекта, а также по защите персональных данных.
Источник:
Европейский Надзорный орган по защите данных
https://www.edps.europa.eu/data-protection/our-work/publications/guidelines/2025-11-11-guidance-risk-management-artificial-intelligence-systems_en
1 199
Repost from CyberSecurityTechnologies
#AIOps
#Fuzzing
#Offensive_security
"AI for AppSec and Offensive Security: From Automation to Autonomy", BSides Berlin, 2025.
]-> AI-powered workflow automation and AI Agents for AppSec, Fuzzing & Offensive Security
1 199
Repost from Жёлтый AI
+1
@murkyfella воспользовался визой в Канаду после ICML 2025, и рассказал о недавней статье @nikoryagin на COLM 2025: Teach Old SAEs New Domain Tricks with Boosting 🏎
Sparse Autoencoders очень сильно зависят от данных, на которых их обучали, и если у вас появятся новые домены, на которых вы захотите изучить поведение модели, вам придется постоянно обучать новые SAE.
Вместо этого мы предложили очень простой метод, в котором мы учим новые SAE на ошибках старых, получая модуль, способный интерпретировать свежие данные, не ломая старые представления.
Статью можно прочитать тут
