ML&|Sec Feed
Kanalga Telegram’da o‘tish
Feed for @borismlsec channel author: @ivolake
Ko'proq ko'rsatish1 199
Obunachilar
Ma'lumot yo'q24 soatlar
+167 kunlar
+4230 kunlar
Postlar arxiv
1 201
Repost from GitHub 红队武器库🚨
GitHub监控消息提醒!!!
更新了:代码审计
描述:一款基于Zjackky/CodeScan的轻量级匹配Sink点并AI审计的代码审计扫描器
URL:https://github.com/righthovel/AICodeScan
标签:#代码审计
1 201
Repost from Data Secrets
⚡️ В Google Colab завезли Data Science агента!
Он создан специально для работы с DS/ML и может создавать не просто фрагменты кода, а целые ноутбуки. Все просто:
1. Нужно подгрузить свои данные
2. Описать цели (например, «визуализируй», «проведи EDA», «напиши и оптимизируй модель предсказания таргета»)
3. Сидеть и наслаждаться тем, как агент сам пишет и запускает ячейки, импортирует нужные библиотеки и совершенствует свой код
Кстати, на бенчмарке DABStep (он как раз оценивает способности анализировать дату) агент занял четвертое место, сразу после o1, o3-mini и Claude, а это довольно мощный уровень.
Доступно для всех юзеров
1 201
Repost from Институт AIRI
О типологии атак на ИИ-модели, рисках для бизнеса и методах защиты от них — в новой колонке для Forbes ⤵
Кандидат физико-математических наук, руководитель группы «Доверенные и безопасные интеллектуальные системы» AIRI, старший научный сотрудник МТУСИ Олег Рогов объясняет, в чем именно OpenAI обвиняли DeepSeek, а также рассказывает о месте науки на рынке информационной безопасности.
📎Читайте материал по ссылке.
1 201
Repost from CyberSecurityTechnologies
#Research
"Artemis: Toward Accurate Detection of Server-Side Request Forgeries through LLM-Assisted Inter-Procedural Path-Sensitive Taint Analysis", 2025.
]-> https://zenodo.org/records/13353039
1 201
Repost from CyberSecurityTechnologies
#MLSecOps
1. How to Hack AI Agents and Apps
https://josephthacker.com/hacking/2025/02/25/how-to-hack-ai-apps.html
2. Smoltalk: RCE in open source agents
https://securityintelligence.com/x-force/smoltalk-rce-in-open-source-agents
3. How to Backdoor LLM
https://blog.sshh.io/p/how-to-backdoor-large-language-models
]-> https://github.com/sshh12/llm_backdoor
1 201
Repost from Data Secrets
Что почитать и посмотреть про обучение LLM и ризонинг? Подборка топ-7 ресурсов от нашей редакции, после которых вы точно лучше поймете, как работают и учатся современные модели 🤓
1. Несомненно, трехчасовое видео Андрея Карпаты "Погружение в LLM". Вся теория по основным этапам обучения, архитектуре, файнтюнингу, ризонингу и обучению с подкреплением верхнеуровнего и доступно. Идеально для первого знакомства с теорией по LLM.
2. Видео про трансформеры от 3Blue1Brown. Немного подробнее про внутреннее устройство LLM. Необходимо хотя бы идейно понять архитектуру, чтобы потом разбираться с новейшими техниками, и этот максимально наглядный гайд подойдет идеально. В видео есть русский дубляж.
3. Для тех, кому хочется практики, отличный бесплатный курс от Hugging Face. Классные иллюстрации, понятные примеры, все необходимое для того, чтобы вы могли сами запускать модели.
4. Статья про модель DeepSeekMath от DeepSeek. Да, здесь все еще не про ризонинг, зато очень подробно и понятно описан этап сбора данных, претрен, эксперименты и обучение с подкреплением. Этот текст даст вам крепкую базу для понимания того, как обучают модели в индустрии. Вот, кстати, наш большой разбор этой статьи.
5. У истоков ризонинга: статья про CoT от Google Research. Одна из первых и самых влиятельных работ, в которой обстоятельно обсуждается, что такое цепочки мыслей CoT и как они влияют на качество результатов. Много примеров. Историческая и необходимая база.
6. Cтатья про DeepSeek-R1. Да, эти ребята умеют хорошо писать. Подробно, лаконично, с практической точки зрения. Прочитайте это, и будете понимать ризонинг лучше, чем 99.9% пользователей ChatGPT. Наш разбор.
7. Очень содержательное выступление "Learning to Reason with LLMs" от Ноама Брауна – известного ученого из OpenAI, который работает как раз над ризонингом и агентами. Про игры, масштабирование компьюта и то, как индустрия пришла к моделям, основанным на рассуждениях.
Сохраняйте!
1 201
Repost from Мониторинг аналитики об IT
+3
Представлены 10 трендов развития глобального рынка генеративного ИИ
Аналитический центр red_mad_robot подготовил обзор прогнозов развития рынка генеративного ИИ в 2025 году. На основе различных источников (McKinsey, Gartner, Synoptek, Salesforce, Deloitte и др.) авторы изучили состояние и архитектуру рынка ГенИИ, составили топ глобальных событий за первые месяцы 2025 года, привели прогнозы его развития. В документе приведены 10 мировых трендов развития генеративного ИИ.
Отдельно аналитики рассмотрели влияние ИИ-трансформации на рынок труда, а также обозначили новые технологические направления, которые могут принести эффект в будущем.
Тренды на 2025 год:
• формирование мультиагентных систем (Multi-Agent Systems);
• RAG (Retrieval-Augmented Generation, добавление в контекст запроса к большой языковой модели дополнительной информации) становится базовой концепцией;
• развитие малых специализированных языковых моделей (SLM);
• трансформация рынка самообучающимися моделями;
•данные становятся продуктом с выделенными командами и стратегиями монетизации;
• AI-Driven UX (переосмысление пользовательского опыта с помощью ИИ);
• появление ИИ-гаджетов на принципе AI-First благодаря ИИ-агентам и копилотам в физических устройствах;
• развитие платформ для управления ИИ (AI Governance Platforms);
• совершенствование гибридных архитектур, объединяющих CPU, GPU, устройства периферийных вычислений, а также нейроморфные, квантовые и фотонные системы;
• массовое применение синтетических данных для создания и тестирования ИИ-моделей.
Изучить тренды и другие выводы →
#искусственный_интеллект #генеративный_ИИ
1 201
Repost from CyberSecurityTechnologies
#Research
#MLSecOps
#Offensive_security
"OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities", 2025.
1 201
Repost from CyberSecurityTechnologies
#Research
#MLSecOps
"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, IncludingOpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking", 2025.
1 201
Repost from GitHub Community
Afrog — это высокопроизводительный сканер уязвимостей, который работает быстро и стабильно.
Он поддерживает пользовательские PoC и имеет несколько встроенных типов, таких как CVE, CNVD, пароли по умолчанию, раскрытие информации, идентификация по отпечатку пальца, несанкционированный доступ, произвольное чтение файлов и выполнение команд.
5️⃣ GitHub
1 201
Repost from Spydell_finance
+1
Лидирующие LLM на начало марта 2025
Консолидация финансового капитала, технологий, вычислительных мощностей и лучших умов человечества в развитии ИИ проектов создают невероятный темп научно-технического прогресса в рамках внедрения передовых LLM, что в свою очередь приводит к выравниванию конкуренции и быстрого достижения предела развития в рамках актуальных архитектур.
Во-первых, с осени 2024 стало невозможным определение однозначно доминирующую LLM, где ни одна передовая разработка не имела ультимативных преимуществ так, как это было в начале технологического рывка в 2023.
Во-вторых, крайне неоднозначное внедрение GPT-4.5 показало, что предел развития где-то рядом. Это справедливо и по относительно слабым анонсам конкурентов.
GPT-4.5 вышла рекордно дорогой (в 30 раз дороже средней цены по конкурентам), имея минимальное преимущество над конкурентами, со спорными инновациями в виде «человекоподобных» генераций, тогда как от LLM требуется точность и стабильность, а не умение «поболтать».
Последние тесты подтвердили, что GPT-4.5 одна из топовых LLM, но не лучшая (результаты artificialanalysis.ai полностью совпали с моими собственными тестами спустя пару часов после презентации).
Среди нерассуждающих LLM, GPT-4.5 уступила Grok 3, но обогнала всех остальных, хотя преимущество минимальное (подтверждение на гистограмме).
Удивительно, но GPT-4.5 вчистую сливает DeepSeek R1, имея стоимость в 50-60 раз выше! Да, они основаны на разных принципах (DeepSeek R1 – рассуждающая модель), но для пользователя имеет значения конечный результат и цена.
Что такое рассуждающие модели? Цепочка мыслей (CoT) — это метод, при котором модель искусственного интеллекта разбивает задачу на шаги, как бы "думая вслух", перед тем как дать ответ. Это помогает моделям лучше справляться с задачами, требующими логики, например, решением математических задач или логических головоломок.
Какие топовые рассуждающие LLM доступны в начале марта?
1. OpenAI o3-mini (high), есть более мощная o3, но она доступна только за 200 баксов в месяц, а прошлый лидер OpenAI o1 немного уступает OpenAI o3-mini (high) в интегральном сравнении.
2. Grok 3 Reasoning по многим тестам является лучшей в мире LLM.
3. DeepSeek R1 является самой универсальной и лучшей китайской моделью, которая по праву формирует мировой ТОП-3.
4. Claude 3.7 Sonnet Thinking представляет лучшие в мире возможности в программировании (разработчики акцент делали именно на них), но уступает лидерам по другим направлениям.
5. Gemini 2.0 Thinking из жесткой внутренней цензуры практически не пригодна для работы, хотя архитектурно на высоких позициях.
Можно отметить значительно улучшенную модификацию думающей модели от Perplexity, которую представили 14 февраля в виде Deep Research.
Я ранее сильно ругал Perplexity, которые 1.5 года практически ничего не делали, но с января они активно взялись за работу, интенсивно внедряя инновации и вышли в лидеры по совокупности факторов среди поисковых LLM.
А где же GPT-4.5? По формальным критериям уступает любой из думающей модели, но находится на лидирующих позициях вне CoT LLM.
Gemini 2.0 Thinking можно тестировать бесплатно в среде разработчиков в Google AI Studio.
Grok 3 Reasoning пока бесплатен в режиме бета теста через платформу X или grok.com.
DeepSeek R1 бесплатный, но сломался уже больше месяца (не работает поиск) и постоянные «отваливания» из-за перегрузки серверов.
Claude 3.7 Sonnet Thinking платный, но можно использовать через агрегатор Syntx (также там Grok 3 Reasoning, OpenAI o3-mini (high) и OpenAI o1 PRO) .
GPT-4.5 неадекватно дорогой, пока представлен только в тарифе PRO за 200 баксов в месяц и в среде разработчиков с прайсом в 30-50 раз выше, чем у конкурентов. Доступен через агрегатор Syntx (25 запросов в час и 150 запросов за сутки) и Perplexity PRO с вчерашнего дня, но всего 10 запросов в день.
С GPT-4.5 еще не успел познакомиться внимательно, требуется более тщательное тестирование. Более полный обзор личного опыта использования LLM в рабочих задачах подготовлю по мере возможностей.
1 201
Датасет синтетических инцидентов ИБ
https://github.com/isisgualdi/cyber-threat-analysis/tree/main
1 201
Repost from Makrushin
Алгоритмы автономного поиска уязвимостей
Пока готовился к заключительному модулю, в котором разбираем сценарии использования LLM в appsec-задачах, встретил еще одно успешное внедрение ИИ для поиска уязвимостей.
В прошлом году мы изучили результаты работ, в которых система смогла самостоятельно определить категорию уязвимости и даже пробовала их эксплуатировать. В этот раз исследователи интегрировали анализ исполнения программы с агентами, которые подключаются на каждом отдельном этапе атаки:
1. Сбор контекста о приложении.
2. Генерация промежуточного представления в виде AST, чтобы лучше оценивать контекст и повысить точность анализа. Из AST можно получить граф вызовов, который упрощает навигацию по коду приложения.
3. Обогащение графа дополнительным контекстом, например, HTTP-методами и состоянием механизмов аутентификации и авторизации.
4. Поиск уязвимостей и их валидация. Вот тут самое интересное: авторы применяют свой фреймворк Tree of Thoughts (ToT), который основан на “цепочке мыслей” (Chain of Thoughts, CoT). То есть шаг за шагом модель рассуждает об уязвимости, разбивая сложную задачу на последовательность более простых логических шагов.
Фреймворк ToT дает цепочку решений, и уже эта цепочка передается в алгоритм самоулучшения дерева Монте-Карло. Основа успеха в применении этого алгоритма - четко определенная и описанная “функция победы”. Функция определяет, является ли текущее состояние в дереве поиска выигрышным, проигрышным или нейтральным. И эта функция становится еще одним объектом рассуждения для LLM.
LLM рассуждает о функции победы 👉 LLM рассуждает о способах достижения этой победы 👉 LLM собирает контекст исполнения для этих способов 👉 Исследователь собирает деньги на покупку видео-карт 😎
1 201
Repost from Data Science | Machinelearning [ru]
💬 Голосовая аутентификация через GPT
Статья исследует возможность аутентификации пользователей GPT-чата во внешних приложениях. Рассматривается голосовое взаимодействие и альтернативный способ аутентификации через пароли вместо OAuth 2.0.
Читать...
1 201
Repost from Kali Novskaya
🌸Курс AI Safety от DeepMind🌸
#nlp #про_nlp #ai_alignment
DeepMind выпустил серию коротких видео с мини-лекциями про безопасность в ИИ
— Введение в AI Safety
— Глава 2: 5 частей про проблему AI Alignment
— Глава 3, Технические решения: обучение моделей и мониторинг качества, интерпретируемость, более безопасные дизайн-паттерны, стресс-тестирование
— Глава 4, Подходы к управлению рисками: институциональный подход к ИИ-безопасности, лучшие практики, оценка экзистенциальных рисков
🟣План курса: https://deepmindsafetyresearch.medium.com/introducing-our-short-course-on-agi-safety
(В конце есть две вакансии, в Лондоне и Нью-Йорке)
🟣Youtube-плейлист: https://youtube.com/playlist?list=PLw9kjlF6lD5UqaZvMTbhJB8sV-yuXu5eW&si=mSHlo4s7u6Q_aXSy
