ru
Feedback
ML&|Sec Feed

ML&|Sec Feed

Открыть в Telegram
1 199
Подписчики
Нет данных24 часа
+167 дней
+4230 день
Архив постов
GitHub监控消息提醒!!! 更新了:代码审计 描述:一款基于Zjackky/CodeScan的轻量级匹配Sink点并AI审计的代码审计扫描器 URL:https://github.com/righthovel/AICodeScan 标签:#代码审计

Repost from Data Secrets
⚡️ В Google Colab завезли Data Science агента! Он создан специально для работы с DS/ML и может создавать не просто фрагменты кода, а целые ноутбуки. Все просто: 1. Нужно подгрузить свои данные 2. Описать цели (например, «визуализируй», «проведи EDA», «напиши и оптимизируй модель предсказания таргета») 3. Сидеть и наслаждаться тем, как агент сам пишет и запускает ячейки, импортирует нужные библиотеки и совершенствует свой код Кстати, на бенчмарке DABStep (он как раз оценивает способности анализировать дату) агент занял четвертое место, сразу после o1, o3-mini и Claude, а это довольно мощный уровень. Доступно для всех юзеров

О типологии атак на ИИ-модели, рисках для бизнеса и методах защиты от них — в новой колонке для Forbes ⤵ Кандидат физико-мате
О типологии атак на ИИ-модели, рисках для бизнеса и методах защиты от них — в новой колонке для Forbes ⤵ Кандидат физико-математических наук, руководитель группы «Доверенные и безопасные интеллектуальные системы» AIRI, старший научный сотрудник МТУСИ Олег Рогов объясняет, в чем именно OpenAI обвиняли DeepSeek, а также рассказывает о месте науки на рынке информационной безопасности. 📎Читайте материал по ссылке.

#Research "Artemis: Toward Accurate Detection of Server-Side Request Forgeries through LLM-Assisted Inter-Procedural Path-Sensitive Taint Analysis", 2025. ]-> https://zenodo.org/records/13353039

Repost from Data Secrets
Что почитать и посмотреть про обучение LLM и ризонинг? Подборка топ-7 ресурсов от нашей редакции, после которых вы точно лучше поймете, как работают и учатся современные модели 🤓 1. Несомненно, трехчасовое видео Андрея Карпаты "Погружение в LLM". Вся теория по основным этапам обучения, архитектуре, файнтюнингу, ризонингу и обучению с подкреплением верхнеуровнего и доступно. Идеально для первого знакомства с теорией по LLM. 2. Видео про трансформеры от 3Blue1Brown. Немного подробнее про внутреннее устройство LLM. Необходимо хотя бы идейно понять архитектуру, чтобы потом разбираться с новейшими техниками, и этот максимально наглядный гайд подойдет идеально. В видео есть русский дубляж. 3. Для тех, кому хочется практики, отличный бесплатный курс от Hugging Face. Классные иллюстрации, понятные примеры, все необходимое для того, чтобы вы могли сами запускать модели. 4. Статья про модель DeepSeekMath от DeepSeek. Да, здесь все еще не про ризонинг, зато очень подробно и понятно описан этап сбора данных, претрен, эксперименты и обучение с подкреплением. Этот текст даст вам крепкую базу для понимания того, как обучают модели в индустрии. Вот, кстати, наш большой разбор этой статьи. 5. У истоков ризонинга: статья про CoT от Google Research. Одна из первых и самых влиятельных работ, в которой обстоятельно обсуждается, что такое цепочки мыслей CoT и как они влияют на качество результатов. Много примеров. Историческая и необходимая база. 6. Cтатья про DeepSeek-R1. Да, эти ребята умеют хорошо писать. Подробно, лаконично, с практической точки зрения. Прочитайте это, и будете понимать ризонинг лучше, чем 99.9% пользователей ChatGPT. Наш разбор. 7. Очень содержательное выступление "Learning to Reason with LLMs" от Ноама Брауна – известного ученого из OpenAI, который работает как раз над ризонингом и агентами. Про игры, масштабирование компьюта и то, как индустрия пришла к моделям, основанным на рассуждениях. Сохраняйте!

Представлены 10 трендов развития глобального рынка генеративного ИИ Аналитический центр red_mad_robot подготовил обзор прогно
+3
Представлены 10 трендов развития глобального рынка генеративного ИИ Аналитический центр red_mad_robot подготовил обзор прогнозов развития рынка генеративного ИИ в 2025 году. На основе различных источников (McKinsey, Gartner, Synoptek, Salesforce, Deloitte и др.) авторы изучили состояние и архитектуру рынка ГенИИ, составили топ глобальных событий за первые месяцы 2025 года, привели прогнозы его развития. В документе приведены 10 мировых трендов развития генеративного ИИ. Отдельно аналитики рассмотрели влияние ИИ-трансформации на рынок труда, а также обозначили новые технологические направления, которые могут принести эффект в будущем. Тренды на 2025 год: • формирование мультиагентных систем (Multi-Agent Systems); • RAG (Retrieval-Augmented Generation, добавление в контекст запроса к большой языковой модели дополнительной информации) становится базовой концепцией; • развитие малых специализированных языковых моделей (SLM); • трансформация рынка самообучающимися моделями; •данные становятся продуктом с выделенными командами и стратегиями монетизации; • AI-Driven UX (переосмысление пользовательского опыта с помощью ИИ); • появление ИИ-гаджетов на принципе AI-First благодаря ИИ-агентам и копилотам в физических устройствах; • развитие платформ для управления ИИ (AI Governance Platforms); • совершенствование гибридных архитектур, объединяющих CPU, GPU, устройства периферийных вычислений, а также нейроморфные, квантовые и фотонные системы; • массовое применение синтетических данных для создания и тестирования ИИ-моделей. Изучить тренды и другие выводы → #искусственный_интеллект #генеративный_ИИ

#Research #MLSecOps #Offensive_security "OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities", 2025.

#Research #MLSecOps "H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, IncludingOpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking", 2025.

Repost from GitHub Community
Langflow — это конструктор приложений с низким уровнем программирования для RAG и многоагентных ИИ-приложений. Он основан на
Langflow — это конструктор приложений с низким уровнем программирования для RAG и многоагентных ИИ-приложений. Он основан на Python и не зависит от какой-либо модели, API или базы данных. 5️⃣ GitHub

Repost from GitHub Community
Afrog — это высокопроизводительный сканер уязвимостей, который работает быстро и стабильно. Он поддерживает пользовательские
Afrog — это высокопроизводительный сканер уязвимостей, который работает быстро и стабильно. Он поддерживает пользовательские PoC и имеет несколько встроенных типов, таких как CVE, CNVD, пароли по умолчанию, раскрытие информации, идентификация по отпечатку пальца, несанкционированный доступ, произвольное чтение файлов и выполнение команд. 5️⃣ GitHub

Repost from Spydell_finance
Лидирующие LLM на начало марта 2025 Консолидация финансового капитала, технологий, вычислительных мощностей и лучших умов чел
+1
Лидирующие LLM на начало марта 2025 Консолидация финансового капитала, технологий, вычислительных мощностей и лучших умов человечества в развитии ИИ проектов создают невероятный темп научно-технического прогресса в рамках внедрения передовых LLM, что в свою очередь приводит к выравниванию конкуренции и быстрого достижения предела развития в рамках актуальных архитектур. Во-первых, с осени 2024 стало невозможным определение однозначно доминирующую LLM, где ни одна передовая разработка не имела ультимативных преимуществ так, как это было в начале технологического рывка в 2023. Во-вторых, крайне неоднозначное внедрение GPT-4.5 показало, что предел развития где-то рядом. Это справедливо и по относительно слабым анонсам конкурентов. GPT-4.5 вышла рекордно дорогой (в 30 раз дороже средней цены по конкурентам), имея минимальное преимущество над конкурентами, со спорными инновациями в виде «человекоподобных» генераций, тогда как от LLM требуется точность и стабильность, а не умение «поболтать». Последние тесты подтвердили, что GPT-4.5 одна из топовых LLM, но не лучшая (результаты artificialanalysis.ai полностью совпали с моими собственными тестами спустя пару часов после презентации). Среди нерассуждающих LLM, GPT-4.5 уступила Grok 3, но обогнала всех остальных, хотя преимущество минимальное (подтверждение на гистограмме). Удивительно, но GPT-4.5 вчистую сливает DeepSeek R1, имея стоимость в 50-60 раз выше! Да, они основаны на разных принципах (DeepSeek R1 – рассуждающая модель), но для пользователя имеет значения конечный результат и цена. Что такое рассуждающие модели? Цепочка мыслей (CoT) — это метод, при котором модель искусственного интеллекта разбивает задачу на шаги, как бы "думая вслух", перед тем как дать ответ. Это помогает моделям лучше справляться с задачами, требующими логики, например, решением математических задач или логических головоломок. Какие топовые рассуждающие LLM доступны в начале марта? 1. OpenAI o3-mini (high), есть более мощная o3, но она доступна только за 200 баксов в месяц, а прошлый лидер OpenAI o1 немного уступает OpenAI o3-mini (high) в интегральном сравнении. 2. Grok 3 Reasoning по многим тестам является лучшей в мире LLM. 3. DeepSeek R1 является самой универсальной и лучшей китайской моделью, которая по праву формирует мировой ТОП-3. 4. Claude 3.7 Sonnet Thinking представляет лучшие в мире возможности в программировании (разработчики акцент делали именно на них), но уступает лидерам по другим направлениям. 5. Gemini 2.0 Thinking из жесткой внутренней цензуры практически не пригодна для работы, хотя архитектурно на высоких позициях. Можно отметить значительно улучшенную модификацию думающей модели от Perplexity, которую представили 14 февраля в виде Deep Research. Я ранее сильно ругал Perplexity, которые 1.5 года практически ничего не делали, но с января они активно взялись за работу, интенсивно внедряя инновации и вышли в лидеры по совокупности факторов среди поисковых LLM. А где же GPT-4.5? По формальным критериям уступает любой из думающей модели, но находится на лидирующих позициях вне CoT LLM. Gemini 2.0 Thinking можно тестировать бесплатно в среде разработчиков в Google AI Studio. Grok 3 Reasoning пока бесплатен в режиме бета теста через платформу X или grok.com. DeepSeek R1 бесплатный, но сломался уже больше месяца (не работает поиск) и постоянные «отваливания» из-за перегрузки серверов. Claude 3.7 Sonnet Thinking платный, но можно использовать через агрегатор Syntx (также там Grok 3 Reasoning, OpenAI o3-mini (high) и OpenAI o1 PRO) . GPT-4.5 неадекватно дорогой, пока представлен только в тарифе PRO за 200 баксов в месяц и в среде разработчиков с прайсом в 30-50 раз выше, чем у конкурентов. Доступен через агрегатор Syntx (25 запросов в час и 150 запросов за сутки) и Perplexity PRO с вчерашнего дня, но всего 10 запросов в день. С GPT-4.5 еще не успел познакомиться внимательно, требуется более тщательное тестирование. Более полный обзор личного опыта использования LLM в рабочих задачах подготовлю по мере возможностей.

Датасет синтетических инцидентов ИБ https://github.com/isisgualdi/cyber-threat-analysis/tree/main

Source: Autonomous Discovery of Critical Zero-Days https://zeropath.com/blog/0day-discoveries

Repost from Makrushin
Алгоритмы автономного поиска уязвимостей Пока готовился к заключительному модулю, в котором разбираем сценарии использования LLM в appsec-задачах, встретил еще одно успешное внедрение ИИ для поиска уязвимостей. В прошлом году мы изучили результаты работ, в которых система смогла самостоятельно определить категорию уязвимости и даже пробовала их эксплуатировать. В этот раз исследователи интегрировали анализ исполнения программы с агентами, которые подключаются на каждом отдельном этапе атаки: 1. Сбор контекста о приложении. 2. Генерация промежуточного представления в виде AST, чтобы лучше оценивать контекст и повысить точность анализа. Из AST можно получить граф вызовов, который упрощает навигацию по коду приложения. 3. Обогащение графа дополнительным контекстом, например, HTTP-методами и состоянием механизмов аутентификации и авторизации. 4. Поиск уязвимостей и их валидация. Вот тут самое интересное: авторы применяют свой фреймворк Tree of Thoughts (ToT), который основан на “цепочке мыслей” (Chain of Thoughts, CoT). То есть шаг за шагом модель рассуждает об уязвимости, разбивая сложную задачу на последовательность более простых логических шагов. Фреймворк ToT дает цепочку решений, и уже эта цепочка передается в алгоритм самоулучшения дерева Монте-Карло. Основа успеха в применении этого алгоритма - четко определенная и описанная “функция победы”. Функция определяет, является ли текущее состояние в дереве поиска выигрышным, проигрышным или нейтральным. И эта функция становится еще одним объектом рассуждения для LLM. LLM рассуждает о функции победы 👉 LLM рассуждает о способах достижения этой победы 👉 LLM собирает контекст исполнения для этих способов 👉 Исследователь собирает деньги на покупку видео-карт 😎

💬 Голосовая аутентификация через GPT Статья исследует возможность аутентификации пользователей GPT-чата во внешних приложениях. Рассматривается голосовое взаимодействие и альтернативный способ аутентификации через пароли вместо OAuth 2.0. Читать...

Repost from Kali Novskaya
🌸Курс AI Safety от DeepMind🌸 #nlp #про_nlp #ai_alignment DeepMind выпустил серию коротких видео с мини-лекциями про безопасность в ИИ — Введение в AI Safety — Глава 2: 5 частей про проблему AI Alignment — Глава 3, Технические решения: обучение моделей и мониторинг качества, интерпретируемость, более безопасные дизайн-паттерны, стресс-тестирование — Глава 4, Подходы к управлению рисками: институциональный подход к ИИ-безопасности, лучшие практики, оценка экзистенциальных рисков 🟣План курса: https://deepmindsafetyresearch.medium.com/introducing-our-short-course-on-agi-safety (В конце есть две вакансии, в Лондоне и Нью-Йорке) 🟣Youtube-плейлист: https://youtube.com/playlist?list=PLw9kjlF6lD5UqaZvMTbhJB8sV-yuXu5eW&si=mSHlo4s7u6Q_aXSy