fa
Feedback
ML&|Sec Feed

ML&|Sec Feed

رفتن به کانال در Telegram
1 198
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+167 روز
+4330 روز
آرشیو پست ها
🤖 DeepConf — новый подход к мышлению ИИ Учёные придумали новые метод Deep Think with Confidence (DeepConf). Он позволяет модели сразу отбрасывать «слабые» варианты ответа и оставлять только те, в которых она уверена. Классический метод *parallel thinking* (self-consistency) работает так: модель генерирует множество рассуждений и выбирает лучший ответ по большинству. Точность повышается, но ресурсы тратятся огромные — тысячи токенов уходят на слабые варианты. 🔹 DeepConf решает эту проблему: модель сама оценивает уровень уверенности в рассуждениях и отбрасывает «слабые» ветви — либо сразу, либо после генерации. Как это устроено: 1️⃣ Оценка уверенности на уровне токенов — смотрится вероятность выбранного токена (log-prob) или энтропия. 2️⃣ Group Confidence — оценки объединяются в блоки, чтобы понять силу целой ветки рассуждения. 3️⃣ Online-режим — слабые ветки отсекаются прямо в процессе. 4️⃣ Offline-режим — сначала генерируются все ответы, потом остаются только те, где уверенность высокая. 📈 Результаты: - На AIME-2025 точность выросла до 99,9% - Количество лишних токенов сократилось почти на 85% - Работает без дообучения и сложных настроек 📚 Paper: https://arxiv.org/pdf/2508.15260 🌐 Project: https://jiaweizzhao.github.io/deepconf

#DevOps #MLSecOps #Whitepaper "Visualizing Secure MLOps (MLSecOps): A Practical Guide for Building Robust AI/ML Pipeline Security", 2025. // Scope: - an overview of DevSecOps practices that are applicable to MLSecOps - an overview of MLSecOps practices - open source centric - unique security risks

Llamator для тех кто в танке, в банке, без интернета Базовый сценарий работы Llamator'а предполагает взаимодействие с 3 модел
Llamator для тех кто в танке, в банке, без интернета Базовый сценарий работы Llamator'а предполагает взаимодействие с 3 моделями: 1. Атакующая-модель: генерирует промты 2. Модель которую тестируем 3. Модель-судья: анализирует ответы тестируемой модели Мы будем использовать зараннее подготовленый файл с промтами, специфичными для внутреннего пользования. Создаем заглушку для атакующей модели работающую с json:
class ClientFromFile(ClientBase):
    def __init__(self, prompts_file: str, model_description: str = "Провайдер промптов из файла"):
        
        super().__init__()
        self.model_description = model_description
        self.prompts: List[str] = []
        self.index = 0

        try:
            with open(prompts_file, "r", encoding="utf-8") as f:
                data = json.load(f)

            # Обработка разных форматов данных в файле
            if isinstance(data, list):
                if data and isinstance(data[0], str):
                    self.prompts = data
                elif data and isinstance(data[0], dict):
                    self.prompts = [
                        item.get("text") or item.get("content") or str(item)
                        for item in data
                    ]
                else:
                    self.prompts = [str(data)]
            else:
                self.prompts = [str(data)]

        except FileNotFoundError:
            self.prompts = []
        except json.JSONDecodeError as e:
            self.prompts = []
В этом же классе переопределяем interact, который возвращает следующий промпт из списка:
 def interact(self, message: str = "", *args, **kwargs) -> Dict[str, Any]:
        if not self.prompts:
            return {"content": "Нет доступных промптов"}

        response_text = self.prompts[self.index % len(self.prompts)]
        self.index += 1

        return {"content": response_text}
Далее переопределяем интерфейс генерации промтов (просто вызывается interact), отказываемся от сохранении истории чата и возвращаем информацию о модели в отчете.
def generate(self, prompt: str, *args, **kwargs) -> Dict[str, Any]:
        return self.interact(prompt, *args, **kwargs)

    def chat(self, messages: List[Dict[str, str]], *args, **kwargs) -> Dict[str, Any]:
        return self.interact("", *args, **kwargs)

    def get_model_info(self) -> Dict[str, Any]:
        return {
            "model_type": "file_based",
            "description": self.model_description,
            "prompts_count": len(self.prompts),
        }
Загружаем промты из файла:

attack_model = ClientFromFile(prompts_file="all_prompts.json")
Тестируемая модель Qwen через Ollama:
tested_model = llamator.ClientOpenAI(
        api_key="ollama",  # Ключ для Ollama (фиктивный, т.к. не требуется)
        base_url="http://localhost:11434/v1",
        model="qwen:7b-chat",
        temperature=0.1,
        model_description="Qwen 7B"
    )
Готовим атаки:
basic_tests = [
        ("aim_jailbreak", {"num_attempts": 3}), # Обход ограничений
        ("base64_injection", {"num_attempts": 2}), # Инъекции через Base64
        ("dan", {"num_attempts": 2}), # "Do Anything Now" промпты
        ("linguistic_evasion", {"num_attempts": 3}), # Лингвистические обходы
        ("harmbench", {"num_attempts": 2}), # Тесты на вредоносность
    ]
Конфигурирование тестирования:
config = {
        "enable_logging": True,
        "enable_reports": True,
        "artifacts_path": "./artifacts",
        "debug_level": 1,
        "report_language": "ru",
        "save_responses": True,
    }
Запускаем тестирование:
test_result_dict = llamator.start_testing(
        attack_model=attack_model,
        tested_model=tested_model,
        judge_model=None, # Оценка без модели
        config=config,
        basic_tests=basic_tests,
        num_threads=1,
    )
#MlSecOps

Repost from Data Secrets
Самая громкая статья месяца – Hierarchical Reasoning Model Без предисловий, сразу главный результат: у авторов получилось сде
Самая громкая статья месяца – Hierarchical Reasoning Model Без предисловий, сразу главный результат: у авторов получилось сделать модельку всего на 27 миллионов (!) параметров, которая обошла o3-mini на ARC-AGI-1. Неудивительно, что об этой работе сейчас говорит все комьюнити, а авторы ARC-AGI даже сами написали большой разбор результатов модели на их бенчмарке. Погнали разбираться. Итак, вся архитектура состоит из двух рекуррентных модулей: быстрого низкоуровневого и медленного высокоуровневого. Первый отвечает за быстрые локальные вычисления и решения частных задач, а цель второго – абстрактно управлять процессом и ставить таски первому. Суть в том, что они обновляются с разной частотой. Исходная задача разбивается на несколько циклов рассуждения. В каждом из них верхний модуль обновляется только один раз и дает новый контекст нижнему модулю, который в свою очередь делает много мелких шагов и ищет локальное решение. Сколько будет таких итераций, модель решает сама. Останавливаться (или не останавливаться) в правильный момент ее специально учили с помощью RL. Так что «думать» она может и пару секунд, и пару часов. Обучается HRM не совсем привычно для рекуррентной модели: здесь, вместо того чтобы сохранять все внутренние состояния, авторы решили обновлять градиенты только по финальному стейту. Удивительно, но факт – это работает. Кстати, вся конструкция и принцип обучения очень похожи на то, как работает наш мозг. Некоторые области отвечают за абстракцию, другие – за конкретные моментальные действия, а общаются они посредством обратных связей. Здесь те же принципы иерархии (отсюда и название). Плюс, мозг тоже не хранит промежуточные траектории и к сходимости приходит через схожие волновые циклы. Итог: модель для своего размера просто беспрецедентно хороша на решениях всяких головоломок типа судоку, лабиринтов и индуктивных задач. В общем, именно в тех областях, где привычные LLM обычно фейлятся. Конечно, особенно поражают результаты на ARC-AGI, которые мы описали в начале. Революция или нет, но выглядит действительно очень изящно и эффектно. Обязательно почитайте работу полностью тут (+ вот еще один отличный разбор на русском языке)

#AIOps "When AIOps Become “AI Oops”: Subverting LLM-driven IT Operations via Telemetry Manipulation", 2025. // AIOps as an emerging attack vector for system compromise..

Repost from CodeCamp
Воды твиттера принесли красивый и интерактивный учебник по теории вероятностей и статистике 🤩 Максимум визуализаций, минимум сухой теории: можно покрутить распределения, поиграться с интервалами и почти вживую оценить, как всё работает. Во-первых, это красиво

Repost from Data Secrets
Разбираем статью подписчика: дискретный подход к машинному обучению Авторы (один из них – @x7CFE) предлагают перейти от привы
Разбираем статью подписчика: дискретный подход к машинному обучению Авторы (один из них – @x7CFE) предлагают перейти от привычных нейросетей и методов их обучения к работе с дискретными элементами – разреженными битовыми векторами. Идея основана на том, как кодирует и обрабатывает информацию мозг живого существа. В частности, прототипом послужило строение неокортекса, гиппокампа и других его определяющих частей. По части теории исследователи опирались на гипотезу многообразия и лемму Йонеды, а на практике работает все примерно так: 1. Исходные данные кодируются в так называемые стимулы – как раз те самые битовые векторы. Кодирование происходит по набору правил, то есть это не привычные эмбеддинги. Но полезные свойства сохраняются: стимулы похожих понятий похожи друг на друга. 2. Полученные векторы наносятся на плоскость и происходит кластеризация, выявление паттернов и структур. Для каждого кластера формируется детектор, из которого мы получаем дискретные структурные эмбеддинги. 3. Эти эмбеддинги показывают, какие кластеры активируются, когда модель видит новое поступающее на вход слово. Далее процесс повторяется на следующем уровне иерархии. То есть обучение превращается в изучение четких ассоциаций, а инференс – в поиск соответствий в памяти. И получается, что: – Модель более устойчива к галлюцинациям – Память можно редактировать в любое время, добавлять в нее что-то или удалять (привет элаймент и machine unlearning!) – Это не черный ящик: все шаги модели интерпретируемы и понятны Модель тестировали на нескольких задачах, в том числе на медицинских изображениях (да, это работает для разных модальностей). Показано, что она способна понимать и интерпретировать незнакомые данные, улавливать их структуру и четко воспринимать семантику. В статье приведено еще несколько экспериментов и аргументов, почему это удачный сетап, и чем он лучше современного подхода. Так что советуем почитать полностью, реально интересно ⬇️ - Статья на архив - Лендинг с версией на русском языке, данными и кодом - Сообщение автора из нашего чата с кратким разбором результатов В комментариях приглашаем задавать вопросы лично автору (ну и, конечно, поздравлять его с крутой публикацией!)

Repost from CodeCamp
Давно хотел написать о прикольной штуке — GPU Memory Calculator. Как понятно из названия, это калькулятор GPU, который подска
Давно хотел написать о прикольной штуке — GPU Memory Calculator. Как понятно из названия, это калькулятор GPU, который подскажет, сможете ли вы запустить локальную LLM и насколько эффективно она будет работать 💃 Забираем

#MLSecOps #Offensive_security "Involuntary Jailbreak", 2025. ]-> PoC // involuntary jailbreaks may potentially compromise the entire guardrail structure // Disclaimer

Repost from AISecHub

Repost from AISecHub

Firewall для GenAI? Компании внедряют генеративный ИИ в свои бизнес‑процессы: чат-боты для работы с клиентами и технической поддержкой, поиск по внутренним базам знаний, работа с документами. Появляется всё больше предложений «ИИ‑ассистентов», суть которых архитектурно сводится к одному — вот окошко AI‑агента (чата), которого мы подключим к вашим данным (RAG) и интегрируем с внутренними или внешними системами (tools). Это приносится в виде коробочного «продукта», который устанавливается с доступом к локальной или облачной модели ИИ. В этой ситуации специалист по безопасности оказывается в сценарии Scope 2: Enterprise app («Корпоративное приложение»: использование корпоративных приложений или облачных сервисов со встроенными функциями ИИ) по матрице Generative AI Security Scoping Matrix (писал про неё здесь) и для снижения рисков необходимо внедрить меры в части средств защиты. Scope 2 — это не разработчики решений, а только пользователи. Поэтому будут актуальны угрозы этапа «Эксплуатация модели и интеграции с приложениями» по модели угроз для кибербезопасности AI от Сбера. Как правильному безопаснику, нужно реализовать требования по обеспечению защиты информации при использовании ИИ из нового приказа №117, закрыть угрозу УБИ.220 («угроза нарушения функционирования (“обхода”) средств, реализующих технологии ИИ»), а значит: ➖организовать мониторинг запросов и подключить их к SIEM ➖обеспечить модерацию ввода и вывода запросов ИИ, чтобы модель не навредила системам через интеграции и пользователям неверными ответами ➖блокировать утечки персональных конфиденциальных данных компании в облачные модели ИИ, а также кражу чувствительной информации из локальных баз знаний и документов через чат-боты ➖защитить инфраструктуру ИИ‑агента от нарушения функционирования. *️⃣В качестве отправной точки также можно сфокусироваться на закрытии актуальных угроз из OWASP Top 10 for Large Language Model Applications (по ссылке русский перевод). Для защиты от OWASP Top 10 Web Application Security Risks есть Web Application Firewall, для OWASP Top 10 API - API Gateway и API Firewall. Логично, что для генеративных моделей появились аналогичные по механизму работы решения - условно назовём их LLM Firewall для ИИ. Реализуются они с помощью Guardrails.
Guardrails - это системные механизмы контроля и политики, которые обрабатывают ввод и вывод генеративных моделей и задают границы допустимого поведения для ИИ. Их основная задача - предотвращать вредоносное, некорректное или непреднамеренное поведение модели.
Крупные компании обладают своей экспертизой в области защиты ИИ и реализуют Guardrails напрямую в коде агентных систем. Но пользователям, конечно, предпочтительнее использовать готовые инструменты защиты агентов в момент выполнения (рантайме). Уже есть множество иностранных решений как от крупных игроков (Lakera, Trylon, Cisco, Promptfoo, Amazon Bedrock Guardrails, Cloudflare AI Gateway), так и гуглятся десятки стартапов. Эти решения нам не подходят по понятным причинам, но они служат хорошим ориентиром для изучения подходов. *️⃣Open source инструменты и фреймворки вполне можно использовать у себя, при необходимости дорабатывая под свои уникальные задачи: Guardrails AI LLM Guard Llama Firewall Trylon Gateway NVIDIA NeMo Guardrails. С российскими решениями пока не густо, видимо большинство компаний используют внутренние разработки: *️⃣Презентация RAG@FF: файрвол для компонентов адаптаций больших языковых моделей с конференции про доверенный ИИ, но саму реализацию не нашёл. *️⃣Недавно появилась новость о стартапе LLM Monitoring для GenAI-приложений HiveTrace:
Система борется с промт‑инъекциями, утечками конфиденциальной информации и системных инструкций, некорректной обработкой входных данных, чрезмерным использованием LLM‑агентов, уязвимостями в обработке векторов и эмбеддингов, а также неограниченным потреблением вычислительных ресурсов.
По описанию выглядит именно тем, что нужно. Хотелось бы больше российских продуктов данного класса, так как запрос от заказчиков точно есть. #решенияИБ@oscar_cybersec #mlsecops

#Research #MLSecOps "Generative AI in cybersecurity: A Comprehensive Review of LLM Applications and Vulnerabilities", 2025. // This paper provides a comprehensive review of the future of cybersecurity through GenAI and LLMs. We explore LLM applications across various domains, including hardware design security, intrusion detection, software engineering, design verification, cyber threat intelligence, malware and phishing detection. We present an overview of LLM evolution and its current state. Our analysis extends to LLM vulnerabilities, such as prompt injection, insecure output handling, data poisoning, DDoS, and adversarial instructions

Очередное, достаточно неплохое руководство по MLSecOps. #ии #mlsecops
+1
Очередное, достаточно неплохое руководство по MLSecOps. #ии #mlsecops

Repost from DayDreamMe|Ethical
Карта Ai Red Team Мне очень нравится эта карта, и еще одна, иллюстрирующая компетенции Ai инженера. Структурированно, четко и точно. ❗️ Забирайте тут и тут

Repost from CodeCamp
Ночное-полезное: ультимативная подборка материалов по оптимизации агентных систем. Собранные с 2023–2025 работы по саморазвив
Ночное-полезное: ультимативная подборка материалов по оптимизации агентных систем. Собранные с 2023–2025 работы по саморазвивающимся агентам будет отличной отличной точкой вката в этот мир: это must-read, если хотите, чтобы ваши агенты были не просто «живыми», а ещё и умели жить эффективно. Вкалывают роботы, счастлив человек 😂

TEx (Telegram Explorer) 📚 Раздел: #Агрегация 📄 Описание: Приложение для сбора и агрегации различной информации из групп и каналов в Телеграм. Из базового функционала: - Содержимое групп и каналов - Сбор информации о пользователях включая фото - Автоматическая синхронизация - Прослушивание голосовых сообщений - Система поиска по группам и сообщениям - Распознавание текста в изображениях размещенных в группах и каналах - Оповещение о появление новых сообщений или их изменениях 💻 Платформа: Win/Linux 💳 Стоимость: Бесплатно 🏷 #агрегация #Tg #Telegram