ML&|Sec Feed
رفتن به کانال در Telegram
1 384
مشترکین
+224 ساعت
+147 روز
+6030 روز
آرشیو پست ها
1 385
Repost from Анализ данных (Data analysis)
🔥 Microsoft только что выпустила впечатляющий инструмент - OmniParser V2, который может превратить любого LLM в агента, способного использовать компьютер.
Он решает две ключевые проблемы GUI-автоматизации:
- Обнаружение интерактивных элементов.
Традиционно LLM испытывают трудности с определением мелких иконок и других элементов пользовательского интерфейса. OmniParser V2 «токенизирует» скриншоты – переводит изображение экрана из пиксельного пространства в структурированные данные, представляющие интерактивные объекты.
Понимание семантики интерфейса.
Инструмент структурирует информацию так, чтобы LLM могли проводить поиск по элементам и предсказывать следующее действие на основе полученной информации.
Плюсы OmniParser V2
- Повышенная точность:
Благодаря обучению на большем объеме данных для обнаружения интерактивных элементов и функциональных описаний иконок, OmniParser V2 существенно улучшает точность даже для очень маленьких элементов по сравнению с предыдущей версией .
Сокращение задержки:
- Оптимизация размера изображения в модели описания иконок позволила снизить задержку на 60% по сравнению с предыдущей версией, что делает его более оперативным в реальном времени.
Гибкость и интеграция:
- OmniParser V2 легко интегрируется с современными LLM, такими как GPT-4o, DeepSeek, Qwen и Anthropic Sonnet. Это позволяет комбинировать распознавание интерфейса, планирование действий и их исполнение в одном конвейере.
Поддержка тестов через OmniTool:
- Для быстрого тестирования различных настроек агентов разработана платформа OmniTool – docker-решение на базе Windows, содержащее все необходимые инструменты для экспериментов.
Минусы и ограничения
- Требования к техническим навыкам:
Для развертывания и интеграции OmniParser V2 требуется определённый уровень технической подготовки, особенно если вы планируете экспериментировать с настройками через OmniTool.
Ограничения в безопасности:
- Из соображений ответственного использования (Responsible AI), рекомендуется применять OmniParser V2 только к скриншотам, не содержащим чувствительной или личной информации. Это помогает минимизировать риски утечки данных , .
Исследовательская стадия:
На данный момент инструмент ориентирован на исследовательские и экспериментальные задачи, и его коммерческое использование может требовать доработок или адаптации под конкретные задачи.
Как пользоваться OmniParser V2:
Развертывание через OmniTool:
Для упрощения экспериментов Microsoft разработала OmniTool – dockerизированную систему на базе Windows. Запустив OmniTool, вы получите преднастроенную среду, в которой OmniParser V2 может работать с различными LLM.
Подготовка скриншотов:
Сделайте скриншоты пользовательского интерфейса, которые хотите автоматизировать. OmniParser V2 обработает изображение, преобразовав его в структурированные данные, где каждому интерактивному элементу будет присвоен уникальный токен.
Интеграция с LLM:
Передайте полученные данные выбранной языковой модели. LLM, получив «токенизированный» интерфейс, сможет проводить retrieval-based next action prediction, то есть предсказывать следующее действие пользователя на основе распознанных элементов.
Исполнение действий:
После того как LLM определит, какое действие следует выполнить (например, нажатие на кнопку или выбор меню), система может автоматизированно выполнить это действие в графическом интерфейсе.
OmniParser V2 существенно расширяет возможности LLM, превращая их в эффективных агентов для работы с графическими интерфейсами.
▪GitHub → https://github.com/microsoft/OmniParser/tree/master
▪Official blog post → https://microsoft.com/en-us/research/articles/omniparser-v2-turning-any-llm-into-a-computer-use-agent/
▪Hugging Face → https://huggingface.co/microsoft/OmniParser-v2.0
@data_analysis_ml
1 385
Repost from GitHub Community
Oumi — это платформа с полностью открытым исходным кодом, которая упрощает весь жизненный цикл базовых моделей — от подготовки данных и обучения до оценки и развёртывания.
Независимо от того, разрабатываете ли вы на ноутбуке, запускаете крупномасштабные эксперименты на кластере или развёртываете модели в рабочей среде, Oumi предоставляет необходимые инструменты и рабочие процессы.
5️⃣ GitHub
1 385
Repost from Анализ данных (Data analysis)
🔥 RD-Agent — это инструмент с открытым исходным кодом, разработанный Microsoft для автоматизации процессов исследований и разработок (R&D), особенно в сфере искусственного интеллекта!
🌟 Он предназначен для повышения производительности в промышленности, фокусируясь на автоматизации высокоценных процессов, связанных с данными и моделями.
🔐 Лицензия: MIT
🖥 Github
@data_analysis_ml
1 385
Repost from Градиент обреченный
🔺 Мультиязычные MoE эмбеддинги
Nomic выложили модель Embed Text V2 в открытый доступ, можно запускать через sentence_transformers, обещают добавить в ollama.
🔸 Эмбеддинги используются, чтобы перенести тексты в единое векторное пространство, благодаря чему можно количественно посчитать насколько два текста близки по смыслу. В данном случае это можно применить для текстов на разных языках.
🔸 Поддерживается 100+ языков (в табличке, которую прилагают авторы языков 96, но для родственных им языков также будет работать). Обучали на 1.6B пар предложений.
🔸 Архитектура MoE. По-моему, для эмбеддингов такой еще не было. Это значит, что при использовании память будет занимать только часть весов модели, всего 300M параметров, это немного.
🔸 Данные, веса и код выкладывают в открытый доступ, что мы, конечно, приветствуем.
🔸 Эмбеддинги для экономии можно обрезать до 256, так как обучали с подходом Matryoshka.
🔸 Языков России/СНГ не так много, по качеству надо смотреть.
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("nomic-ai/nomic-embed-text-v2-moe", trust_remote_code=True)
sentences = ["Hello!", "Привет!"]
embeddings = model.encode(sentences, prompt_name="passage")
similarity = model.similarity(embeddings[0], embeddings[1])
👉 Пост | GitHub | HF1 385
Repost from SecureTechTalks
💡 SysReptor: платформа для автоматизации отчётов по пентесту
🚀 Пентестеры знают, что сам процесс взлома — это только половина дела. Вторая, не менее важная часть — это оформление отчёта, который должен быть понятным, структурированным и детальным. Однако вручную заполнять таблицы, копировать уязвимости и описывать методы эксплуатации долго и утомительно.
📌 SysReptor — open-source платформа, созданная специально для автоматизации отчётов по кибербезопасности. Она помогает пентестерам сократить время подготовки документации, стандартизировать отчёты и сделать их более удобными для заказчика.
🔹 Основные возможности:
✔ Единая база уязвимостей – повторно используйте описания, не вводя их заново.
✔ Гибкие шаблоны отчётов – формируйте отчёты в нужном формате (Markdown, DOCX, HTML).
✔ Совместная работа – несколько пользователей могут одновременно редактировать отчёт.
✔ Интеграция с системами управления уязвимостями – автоматический импорт данных.
✔ Поддержка API – возможность автоматизированного взаимодействия с другими инструментами.
🛠 SysReptor предоставляет веб-интерфейс, где можно:
📌 Создать новый проект – задать параметры тестирования и подключить базу данных уязвимостей.
📌 Выбрать шаблон отчёта – использовать готовые или создать кастомный.
📌 Добавить найденные уязвимости – заполнить информацию или импортировать данные из автоматизированных сканеров.
📌 Сгенерировать отчёт – в нужном формате и отправить заказчику.
🔒 SysReptor — инструмент, который делает процесс создания отчётов по кибербезопасности быстрее, удобнее и эффективнее. Если вы занимаетесь пентестами, аудитами или управляете уязвимостями, SysReptor поможет сэкономить время и повысить качество документации. Пользуйтесь!:)
🔗 Инструмент доступен на GitHub.
Stay secure and read SecureTechTalks 📚
#SysReptor #Pentest #Кибербезопасность #SecureTechTalks #Автоматизация #RedTeam #BugBounty #Документы #CyberSecTools #Отчёты
1 385
Repost from AM Live
Учения Generative Red Team, проведенные в рамках DEF CON 32, показали, что подобный способ оценки защищенности ИИ не дает адекватной картины. Эксперты предлагают создать систему, подобную CVE и учитывающую целевое назначение объектов анализа.
1 385
Repost from CyberSecurityTechnologies
#MLSecOps
Malicious ML models discovered on Hugging Face platform
https://www.reversinglabs.com/blog/rl-identifies-malware-ml-model-hosted-on-hugging-face
1 385
Repost from UI Elegance ✨
Bolt.new очень впечатлил.
Кроме того, что он неплохо понимает задачу, имеет наглядный интерфейс:
— сначала общается с вами
— параллельно создает структуру проекта и пишет код в IDE
— а потом включает готовое приложение
Выглядит как магия!
@uielegance #ai
1 385
Repost from База знаний AI
+1
В России представили ИИ-модель CA-SER для распознавания эмоций речи
Ученые лаборатории искусственного интеллекта Сбербанка, Института AIRI и МФТИ сообщили о создании ИИ-модели Cross-Attention Feature Fusion for Speech Emotion Recognition (CA-SER) для распознавания эмоций человеческой речи.
Модель объединяет самообучение (Self-Supervised Learning) с использованием предобученной модели wav2vec 2.0 и спектральных акустических признаков. Сначала система детектирует важные характеристики речи, а затем добавляет к ним данные о звуках голоса, в том числе их громкость и тональность, с учетом того, какую часть аудиоспектра лучше всего воспринимает человек. Эти два типа информации объединяются с помощью специального механизма, эффективно соединяя общие характеристики речи с ее детальными особенностями. Это помогает точнее определять эмоции говорящего человека.
Разработчики отмечают, что инструмент применим в голосовых чат-ботах, колл-центрах, а также в приложениях цифрового мониторинга психологического здоровья и других областях, где нужно анализировать эмоции в режиме реального времени.
📃Научная статья в ECAI 2024
🔗 Источник: https://www.sberbank.com/ru/news-and-media/press-releases/article?newsID=82e02842-5bb2-4f1f-99ca-2ca388a2ba86&blockID=7®ionID=77&lang=ru&type=NEWS
1 385
Repost from AI для Всех
🌐 Первый международный отчет по безопасности ИИ: ключевые выводы
Отчет подготовлен 100 независимыми экспертами из 33 стран и сфокусирован на трех ключевых вопросах:
- Что может ИИ общего назначения?
- Какие риски с ним связаны?
- Как эти риски можно снизить?
Важно: отчет не дает конкретных политических рекомендаций, а предоставляет научную основу для принятия решений и международного диалога о безопасности продвинутого ИИ.
Ключевые выводы:
📈 Стремительный рост возможностей ИИ: от написания текстов до создания программ и фотореалистичных изображений. Последние модели демонстрируют значительный прогресс в научном мышлении.
🤖 Компании активно инвестируют в разработку ИИ-агентов — систем, способных автономно действовать и планировать с минимальным контролем человека.
⚠️ Уже подтверждены риски: мошенничество, генерация NSFW-контента, предвзятость моделей, проблемы надежности и конфиденциальности.
🎯 Новые угрозы: масштабное влияние на рынок труда, ИИ-хакинг, биологические атаки. Эксперты расходятся в оценках сроков реализации этих рисков — от десятилетий до нескольких лет.
⚖️ Дилемма для регуляторов: выбор между преждевременными ограничениями и риском остаться неподготовленными к резким скачкам в развитии ИИ.
Отчет станет основой для обсуждения на Саммите по ИИ, который пройдет в Париже 10 - 11 февраля
📝Отчёт
1 385
Repost from infosecurity
🔒 Infosec Awesome.
• Репозиторий с различным материалом и инструментами по информационной безопасности. Можно найти полезную информацию на любой вкус и цвет:
• Adversary Simulation & Emulation;
• Application Security;
• Binary Analysis;
• Cloud Security;
• Courses;
• Cryptography;
• Data Sets;
• Digital Forensics and Incident Response;
• Exploits;
• Hardening;
• Hardware;
• Malware Analysis;
• Mobile Security;
• Network Security;
• Open-source Intelligence (OSINT);
• Password Cracking and Wordlists;
• Social Engineering;
• Smart Contract;
• Vulnerable.
#ИБ
1 385
Repost from Security Harvester
GhidrAssist: An LLM extension for Ghidra to enable AI assistance in RE.
https://github.com/jtang613/GhidrAssist:
1. Author: Jason Tang A plugin that provides LLM helpers to explain code and assist in RE.
2. Current features include: Future Roadmap: General LLM setup is a bit outside the scope of this project since there's so many different options and there are plenty of sources that cover the topic much better than I could.
3. Here's a few resources that might get you started: For local LLM's, I've found that the Llama3.3:70b, Llama3.1:8b and DeepSeek-r1 produce good results.
@secharvester
