uz
Feedback
ML&|Sec Feed

ML&|Sec Feed

Kanalga Telegram’da o‘tish
1 192
Obunachilar
+624 soatlar
+147 kunlar
+3730 kunlar
Postlar arxiv
Repost from e/acc
Я спарсил все скилы с гитхаба, кластеризировал и прогнал по эвалам. Результаты: - 1 из 3 скилов делает задачу хуже, чем без скила - звездочки вообще не показатель - чем хуже модель, тем полезнее скилы

Repost from CodeCamp
Ночное-полезное: нашел классный опенсорс инструмент для быстрого анализа сайтов – Web-Check. Просто кидаешь URL, и он мгновен
Ночное-полезное: нашел классный опенсорс инструмент для быстрого анализа сайтов – Web-Check. Просто кидаешь URL, и он мгновенно выдает тебе полный комплект информации: IP, DNS, SSL-сертификаты, куки, информацию о домене, местоположение сервера, открытые порты и многое другое. При этом OSINT-инструмент можно использовать как онлайн, так и развернуть у себя. Сайт здесь, GitHub тут 🤓

Blue41_How_we_helped_Bunq_secure_their_financial_AI_assistant.pdf2.29 MB

Тут подвезли новую интересную уязвимость для ECOM1-DEV Консультанты Blue41 нашли в AI агенте банка bunq простейшую уязвимость
Тут подвезли новую интересную уязвимость для ECOM1-DEV Консультанты Blue41 нашли в AI агенте банка bunq простейшую уязвимость. Шлешь людям кучу транзакций на пару центов, а в описание докидываешь пару строчек про то, что надо пройти валидацию по такому-то url. Ну и если человек спросит своего банковского агента про последние транзакции, тот ему и выдаст среди всего фишинговую ссылку. Finn AI даже отличался тем, что выдавал ее как напоминание. Статью с сайта Blue41 уже убрали, но в web архиве она осталась. И заодно я добавил эту задачу в ECOM1-DEV как t55 (чтобы не забыть потом ее переосмыслить в ECOM2). Если вдруг будете тестить своих агентов, запостите в комментарий их первый ответ (до обучения) - интересно! Лимиты на платформе я сбросил для всех :) Ваш, @llm_under_hood 🤗

Repost from Хабр / ML & AI
LLM Sandbox: изолированная среда для исполнения кода от LLM [часть 1, теория] В большинстве бизнес-сценариев LLM перестала быть просто чат-ботом. Современные модели становятся частью агентских систем: у них есть инструменты, доступ к файлам, терминалу, браузеру, базам данных. Они не только отвечают на вопросы, но и выполняют действия. В этой статье (ее первой части) разберём среду изолированного исполнения кода: песочницу (sandbox). Представим ситуацию: пользователь загружает Excel-файл, просит проанализировать таблицу, найти аномалии и на основе анализа создать PowerPoint-презентацию. В чистом виде LLM не умеет читать файлы, строить графики и создавать презентации. Однако может написать код, который всё это сделает. И тут появляется вопрос: где этот код запускать? Генерируемый агентом код может быть ошибочным или, в случае с промпт инъекцией, намеренно опасным. Поэтому для безопасного исполнения кода агенту нужна песочница или изолированная среда. В этой статье разберём: - основные риски исполнения кода в неизолированной среде; - что такое песочница и её ограничения; - какие бывают подходы к реализации песочницы; - вариант логики работы агента с песочницей. Читать далее #агент #llm #sandbox #docker #security #agents #ai #devops #mlops | @habr_ai

𝗚𝗼𝗼𝗴𝗹𝗲 AI 𝗷𝘂𝘀𝘁 𝗿𝗲𝗹𝗲𝗮𝘀𝗲𝗱 𝗗𝗶𝗳𝗳𝘂𝘀𝗶𝗼𝗻𝗚𝗲𝗺𝗺𝗮 — 𝗮𝗻 𝗼𝗽𝗲𝗻 𝗺𝗼𝗱𝗲𝗹 𝘁𝗵𝗮𝘁 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗲𝘀 𝘁𝗲𝘅𝘁 𝗶𝗻 𝗽𝗮𝗿𝗮𝗹𝗹𝗲𝗹, 𝗻𝗼𝘁 𝘁𝗼𝗸𝗲𝗻-𝗯𝘆-𝘁𝗼𝗸𝗲𝗻. Most LLMs today are autoregressive — one token at a time, left to right. DiffusionGemma takes a different path, it replaces token-by-token autoregression with discrete diffusion. Here is how it works: 𝟭. 𝗠𝗼𝗱𝗲𝗹 → 26B Mixture-of-Experts on the Gemma 4 backbone (25.2B total, 3.8B active). → 8 active experts of 128, plus 1 shared. 30 layers, 256K context. 𝟮. 𝗗𝗲𝗰𝗼𝗱𝗶𝗻𝗴 → It denoises a 256-token canvas in parallel, not one token at a time. → Roughly 15–20 tokens are finalized per forward pass. → Google calls the mechanism Uniform State Diffusion. 𝟯. 𝗔𝘁𝘁𝗲𝗻𝘁𝗶𝗼𝗻 → Prefill uses causal attention to ingest the prompt and write the KV cache. → Denoising uses bidirectional attention, so every canvas token attends to all others. 𝟰. 𝗟𝗼𝗻𝗴 𝘀𝗲𝗾𝘂𝗲𝗻𝗰𝗲𝘀 → Block Autoregressive Diffusion commits a finished 256-token block to the KV cache. → A fresh canvas then initializes, conditioned on prior history. 𝟱. 𝗦𝗮𝗺𝗽𝗹𝗶𝗻𝗴 → Entropy-Bounded Denoising with adaptive stopping, max 48 denoising steps. → Low-confidence tokens are re-noised and refined — a self-correction path autoregressive models lack. 𝟲. 𝗣𝗲𝗿𝗳𝗼𝗿𝗺𝗮𝗻𝗰𝗲 𝗮𝗻𝗱 𝗳𝗼𝗼𝘁𝗽𝗿𝗶𝗻𝘁 → Up to 4x faster on dedicated GPUs: 1000+ tokens/sec on H100, 700+ on RTX 5090. → Fits in 18GB VRAM when quantized. Native NVFP4 support. 𝟳. 𝗟𝗶𝗺𝗶𝘁𝗮𝘁𝗶𝗼𝗻𝘀 → Output quality is below standard Gemma 4; Google recommends Gemma 4 for production. → The speedup applies to local, low-concurrency inference, not high-QPS cloud serving. Full breakdown with the comparison table: https://www.marktechpost.com/2026/06/10/google-ai-releases-diffusiongemma-a-26b-moe-open-model-using-text-diffusion-for-up-to-4x-faster-generation/ Model weight on HF: https://huggingface.co/google/diffusiongemma-26B-A4B-it Technical details: https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/

В Orion Soft представили шлюз StarGuard AI для работы с LLM Решение реализовано как обратный прокси-сервер (Reverse Proxy) между пользователями, корпоративными системами и моделями. StarGuard AI блокирует нецелевой контент в ИИ-сервисах. Для этого шлюз анализирует каждый запрос к модели и ответ на него с помощью системы детекции. В нее входят ML-модели для выявления чувствительных данных и LLM-детекторы контекста, промпт-инъекций и инструкций по снятию программных ограничений (Jailbreak). Также с помощью шлюза возможно централизованное управление доступом к LLM, развернутым в облаке и локально. 🔗 Источник: https://www.orionsoft.ru/news/orion-soft-razrabotal-platformu-dlia-bezopasnoi-raboty-s-ai *** 📎 В мае 2026 года «СберТех» вывел на рынок Platform V SOWA AI — шлюз для доступа к системам искусственного интеллекта.

Repost from Похек AI
FABLE 5.0 SYSTEM PROMPT LEAK #jailbreak #systemprompt Спасибо великому Pliny, который в очередной раз джейлит модели Anthropic в кратчайшее время. Системный промпт занимает аж 1250 строк, что жесть. Это огромный перерасход токенов только при инициализации диалога. Оригинальный пост / Промпт Также интересно, что нашёлся другой пользователь, который после анализа системного промпта смог более менее обойти ограничения на корпус кибербеза. Примеры: 1. Not just: “buffer overflow” But: • Missing null termination • OOB reads • Information disclosure risks 2. Next I switched domains entirely. No memory safety. No C exploitation. Just access-control logic. The model correctly identified privilege-escalation risk caused by inconsistent authorization checks. Скрины приложу в комментариях

Repost from AISecHub
Self-Replicating AI Worm Runs on Local Open-Weight Models (PoC) A proof-of-concept worm uses a locally hosted open-weight LLM for autonomous target-by-target planning: it can reason about a network, generate tailored attack steps per host, and self-replicate without calling commercial AI services. #VulnerabilityResearch #AppSec #AISecurity #News https://thehackernews.com/2026/06/researchers-build-self-replicating-ai.html

Repost from ITSecRu
Детерминированные и объяснимые модели ИИ для задач ИБ За последние три года генеративный искусственный интеллект прошел путь
Детерминированные и объяснимые модели ИИ для задач ИБ За последние три года генеративный искусственный интеллект прошел путь от лабораторного эксперимента до одного из ключевых элементов корпоративной автоматизации. Для многих отраслей оказалось достаточным, чтобы результат был “достаточно хорошим". Если при повторном запуске модели, к примеру, маркетинговый текст получится немного иным, это не создаст серьезных проблем. Однако в ИБ такой подход уже не работает. #искусственныйинтеллект https://www.itsec.ru/articles/determinirovannye-i-obyasnimye-modeli-ii-dlya-ib Мы есть в MAX

Т1 внедрил в свою CRM-платформу «Модус» конструктор ИИ-агентов «Агентум ИИ» от ITFB Group В конструкторе можно создавать, обучать, настраивать сценарии поведения и оркестрировать ИИ-агентов, а также отслеживать логику принятия ими решений. Полный цикл обучения занимает от одного до двух дней. Все их действия и рассуждения фиксируются для последующего контроля и дообучения. «Агентум ИИ» связан с платформой «Модус» через протокол MCP, который предоставляет агентам доступ к данным и внутренним системам. Интеграция поддерживает несколько режимов работы. При ассистирующем финальное решение остается за человеком. В полностью автоматическом формате агент самостоятельно обрабатывает обращения. 🔗 Источник: https://itfbgroup.ru/it-holding-t1-i-itfb-group-obyavlyayut-o-partnorstve *** 📎 В ноябре 2025 года Т1 представил ПАК «ИИ-Фабрика Сайбокс» для обучения моделей и запуска ИИ-агентов.

Repost from GitHub Community
Agent Skills предоставляет ИИ-агентам для написания кода структурированные рабочие процессы, соответствующие тому, как старши
Agent Skills предоставляет ИИ-агентам для написания кода структурированные рабочие процессы, соответствующие тому, как старшие инженеры создают программное обеспечение. Вы получаете 20 навыков, организованных в шесть фаз разработки — Определить, Спланировать, Создать, Проверить, Обзор и Выпустить — каждая из которых включает пошаговые процессы, контрольные точки качества и требования к верификации. 🐱 GitHub

Repost from AI Security Lab
📣Начинаем знакомить вас со спикерами! Первый день открытой защиты посвящён проектам в области безопасности и надёжности LLM-систем. Вас ждут доклады о детектировании вредоносных запросов, ускорении защитных моделей, оценке guardrails, анализе отказов мультиагентных систем, разработке бенчмарков безопасности и аудите ML-моделей. 👤Ширин Аланова Обнаружение мультиязычных вредоносных запросов с помощью семантического анализа 👤Анна Решетняк Ускорение inference для GLiNER Guard 👤Вадим Паненко TotalGuardEval — оценка guardrail-моделей 👤Вера Краснобаева Воспроизводимые сценарии каскадных отказов в мультиагентных LLM-системах 👤Ярослав Рогоза, Иван Александров, Герман Кочнев DuMa Benchmark — бенчмарк для оценки безопасности LLM в интерактивной среде 👤Вячеслав Мосин Анализ статических сканеров ML-моделей Доклады идут плотно: каждые 20 минут — новая тема и новый автор. 🔔Стартуем уже 12 июняуспей зарегистрироваться 🔥 - спикерам

Repost from SecureTechTalks
🛡️ Jailbreak начали ловить по поведению модели Большинство защит LLM работают довольно прямолинейно: 🔹 анализируют prompt �
🛡️ Jailbreak начали ловить по поведению модели Большинство защит LLM работают довольно прямолинейно: 🔹 анализируют prompt 🔹 ищут подозрительные шаблоны 🔹 смотрят на внутренние представления модели 🔹 пытаются вычислить «опасное» пространство признаков Однако вполне легитимный запрос вроде: «объясни, как работает анализ вредоносного ПО» фиксируется, как подозрительный просто из-за словаря, а реально вредоносный промпт успешно выполняется. ⚙️ Анализ движения внутри модели В новой работе Manifold Trajectory Kinetics (MTK) исследователи предлагают сформироваться  на том, как запрос эволюционирует внутри модели. Технически MTK отслеживает динамику траектории между слоями трансформера. Нормальный запрос обычно остаётся рядом с другими безопасными примерами на протяжении всех вычислений модели. А вот jailbreak-запрос часто стартует рядом с вредоносными примерами, но затем начинает «маскироваться» и постепенно смещается ближе к безопасной области, пытаясь обмануть систему защиты. 🧪 Цифры На псевдо-вредоносных сценариях система показала: 🔹 95% обнаружения jailbreak-атак 🔹 5% ложных срабатываний для обычных запросов 🔹 всего 2% ложных срабатываний на tricky-сценариях с безопасным намерением Также MTK неплохо переживает адаптивные атаки. Когда атакующий специально оптимизирует jailbreak под обход детектора, успешность обнаружения всё ещё держится около 85%. Для защиты от jailbreak это очень сильный результат. 🧠 Похоже, защита от jailbreak постепенно эволюционирует из фильтрации ключевых слов в полноценную телеметрию поведения LLM во время рассуждений. 🔗 Исследование: https://arxiv.org/abs/2606.07335 Stay secure and read SecureTechTalks 📚 #кибербезопасность #AI #LLM #Jailbreak #PromptInjection #AIsecurity #CyberSecurity #USENIX #AdversarialAI #SecureTechTalks

У нас тут новое исследование вышло "ИИ в 2026: угроза снаружи и внутри" про эволюцию и развитие угроз, связанных с применение
У нас тут новое исследование вышло "ИИ в 2026: угроза снаружи и внутри" про эволюцию и развитие угроз, связанных с применением искусственного интеллекта в кибератаках. В целом, мой опыт модерации ряда мероприятий про ИИ показывает, что эта новомодная технология на стороне киберпреступников используется неоднородно. Да, дипфейки. Да, фишинг. Но в остальном это скорее проба пера. Многие ИБшники по разговорам пока не видят массовых именно ИИ-атак, так как и более простые и привычные методы пока работают. Но ситуация меняется быстро и то, что неактуально сейчас, может перестать быть таковым уже через полгода. Поэтому чтиво годное, стоит ознакомиться 🤖 ЗЫ. на картинке матрица MITRE ATT&CK с помеченными техниками, в которых может применяться ИИ. #research #ии

В «Сбере» представили версию GigaCode для запуска в командной строке Мультиагентная система запускается независимо от типа среды разработки и операционной системы. GigaCode CLI вносит изменения в код, рефакторит его, ищет уязвимости и генерирует тесты. Внутренние испытания показали, что использование решения повышает производительность разработчиков на 30–70%. Разворачивать новую версию ИИ-ассистента можно локально по модели On-Premise. 🔗 Источник: https://www.sberbank.ru/ru/sberpress/all/article?newsID=0c2f00cd-c37b-43c4-9086-f739329f3c63&blockID=1303&regionID=56&lang=ru&type=NEWS *** 📎 В марте 2026 года «Сбер» внедрил GigaCode в формате чата в платформу GitVerse.

https://habr.com/ru/companies/pt/articles/1043962/ — самое то на почитать воскресным вечером 🙂

Google Research показали Agentic RAG для Gemini Enterprise Agent Platform - RAG, который не сдаётся после первого поиска. Обы
Google Research показали Agentic RAG для Gemini Enterprise Agent Platform - RAG, который не сдаётся после первого поиска. Обычный RAG часто ломается на корпоративных вопросах, где ответ лежит не в одном документе, а размазан по нескольким базам. Нашёл кусок про проект, увидел только ID сервера, но не пошёл дальше искать характеристики этого сервера в другой системе - и выдал неполный ответ. У Google идея такая: превратить RAG в многоагентный процесс. Что внутри: - Orchestrator понимает, что запрос не решается за один шаг - Planner разбивает задачу на маршруты поиска - Query Rewriter переписывает вопрос в несколько точных запросов - Search Fanout ищет по разным источникам - Sufficient Context Agent проверяет, хватает ли данных для ответа Модель проверяет: закрыты ли все части вопроса. Если данных не хватает, она явно пишет, чего именно не хватает, и отправляет систему искать дальше. На FramesQA такой подход дал до 34% прироста точности по сравнению со стандартным RAG. В cross-corpus сценарии, где нужно выбрать правильный источник из нескольких, система ответила правильно на 90.1% вопросов. По сути, Google двигает RAG от «поиска + генерации» к маленькому исследовательскому пайплайну, где есть планирование, маршрутизация, проверка контекста и повторный поиск. Для enterprise это важнее красивых демо: меньше галлюцинаций, больше трассируемости и понятнее, почему система дала именно такой ответ. research.google/blog/unlocking-dependable-responses-with-gemini-enterprise-agent-platforms-agentic-rag/

Repost from CodeCamp
Полезное: появился конструктор для наглядного проектирования сетевых архитектур 😊 Netviz позволяет быстро собрать схему из с
Полезное: появился конструктор для наглядного проектирования сетевых архитектур 😊 Netviz позволяет быстро собрать схему из серверов, прокси, балансировщиков, контейнеров и баз данных прямо в вебе. Разраб создал приложение чисто для себя, но оно бесплатно и открыто, так что можно форкнуть и добавить, что нужно. Удобно 👍