ch
Feedback
ML&|Sec Feed

ML&|Sec Feed

前往频道在 Telegram

Feed for @borismlsec channel author: @ivolake

显示更多
1 199
订阅者
无数据24 小时
+167
+4230
帖子存档
🔥 Это — бесплатный курс по диффузионным моделям и согласованиям потоков для машинного обучения, ориентированный на техническ
🔥 Это — бесплатный курс по диффузионным моделям и согласованиям потоков для машинного обучения, ориентированный на техническую аудиторию без предварительного опыта в этой области! Авторы стремятся максимально упростить математические детали, сохраняя при этом достаточную точность для вывода корректных алгоритмов. 🔗 Ссылка: *клик* #курс #machinelearning

Repost from ML Underhood
Документный LLM-переводчик в Яндексе Яндекс запустил новую модель для документного перевода на основе YandexGPT. Она уже рабо
Документный LLM-переводчик в Яндексе Яндекс запустил новую модель для документного перевода на основе YandexGPT. Она уже работает в Поиске, Умной камере и Нейропереводчике Яндекс Браузера, а также заняла первое место в бенчмарке DiBiMT по переводу с английского на русский. Обо всех нюансах работы переводчика и о том, как его создавали, на Хабре рассказал руководитель группы базового качества перевода Николай Карпачёв. А здесь — кратко о главном. Документный перевод предполагает адаптацию на другой язык не каждого отдельного предложения, а всего текста. Почему это важно? Причин несколько. Например, английское «you» может означать как «ты», так и «вы», но без контекста модель не понимает, какой вариант выбрать. Термины и стилистика могут «прыгать» внутри текста, а пропущенные элементы, понятные носителю языка, в переводе превращаются в бессмысленный набор слов. Люди воспринимают текст иначе: мы читаем книги, статьи, субтитры — всё целиком. Значит, и машинный перевод должен работать так же. Инженеры Яндекса попробовали перевести тексты LLM-моделью «из коробки», без дообучения, но столкнулись с типичными ошибками: пропущенные фрагменты, лишние добавления, галлюцинации. Чтобы этого избежать, модель пришлось адаптировать. На первом этапе подготовили данные, включая не только классические парные предложения, но и переводы документов, полученные автоматическим выравниванием и с помощью синтетики. Дообучение проходило в форматах LoRA и P-Tuning. На следующем этапе модель дообучалась с помощью технологии alignment. Разные варианты переводов сравнивались редакторами-профессионалами. Полученные оценки использовали для оптимизации методом Contrastive Preference Optimization (CPO). На этой стадии происходит исправление существующих ошибок и проблем LLM-модели, найденных редакторами. Это позволило минимизировать ошибки, связанные с потерей информации и несогласованностью. В итоге по метрике MQM новая модель переводит тексты почти так же хорошо, как человек. Количество грубых ошибок сократилось в два раза по сравнению с предыдущей версией, а финальный результат оказался даже лучше GPT-4o. ML Underhood

Repost from Kali Novskaya
🌸MLGym – открытый фреймворк и бенчмарк для Агентов в автоматизации ML-задач🌸 #nlp #про_nlp #nlp_papers Сегодня, под конец этой насыщенной недели, мы с коллегами выпускаем новую работу "MLGym: A New Framework and Benchmark for Advancing AI Research Agents". 🟣TL;DR MLGym – это фреймворк для оценки и развития LLM-агентов. В нем пока 15 различных ML задач, включая хорошо и не очень определенные: задачи на NLP, CV, RL, теорию игр. Агенты должны продемонстрировать свою способность понять задачу, запустить бейзлайн, оцени его, и начать итерировать эксперименты и улучшать результат, находясь при этом в заданной среде. В среде есть набор инструментов, которые можно использовать: поиск по файловой системе, поиск по файлам, модуль памяти, просмотр и изменение файлов, и собственно действия запуска скрипта оценки и сабмита решения. Каждая задача содержит датасет, метрику, бейзлайн, а также свою собственную среду, где есть контролируемые ограничения на вычислительный бюджет и таймауты. Мы предлагаем иерархическую структуру из 6 уровней для оценки степени автономии и научного вклада агентов: Уровень 0: воспроизведение – аккуратно повторить чужие эксперименты без ошибок Уровень 1: Итеративное улучшение бейзлайна – применение лучших практик, перебор гипертапаметров Уровень 2: Достижение SOTA через итерации от бейзлайна – решение лучше тех, что смогли найти люди Уровень 3: Новый научный вклад – можно быть принятым на условный NeurIPS Уровень 4: Научное новаторство, фундаментальный научный вклад – можно получить "лучшую статью" на том же NeurIPS Уровень 5: Долгосрочная исследовательская программа – test of time awards, научная революция, премия Тьюринга. 🟣Что мы выяснили? Текущие ИИ системы находятся почти поголовно на уровне 1. Удобно оценивать все системы относительно дельты, которую они смогли достичь, опираясь на бейзлайн, за заданное количество итераций (за первые 5 шагов у системы Х получили +15% точности, а у системы Y +20%). Если оценивать LLM-агенты так, то увидим, что O1-preview вырывается вперед практически на всех задачах. GPT-4o и LLama 3.1 405B примерно на одном уровне, Claude и Gemini делят обычно 2 и 3 место. Ну а если помимо дельты оценивать еще и стоимость инференса модели, но картина меняется, и лучше по соотношению оказывается Gemini с большим отрывом.   Достаточно интересно посмотреть распределение действий агентов и их ошибок: — большинство LLM-агентов делают ошибки и из-за этого не доходят до сабмита, тогда как O1 и Gemini гораздо чаще просто не доделывают сабмит до конца. — все агенты большую часть действий тратят на изменение файлов: редактирование скриптов обучения, а также чтение файлов, запуск обучения и валидацию — соотношение действий примерно у всех одинаковое, хотя некоторым система действий требуется меньше. — почти все агенты очень мало используют поиск, хотя могли бы. — минимальное число итераций до первого сабмита — примерно 5. Все системы начинают с чтения файлов, затем запускают валидацию, и дальше планомерно итерируются, изменяя скрипты и запуская обучение. 🟣Что еще есть полезного? — Классный Web UI визуализатор агентных логов на streamlit — Есть набор полезных функций и tools, полностью совместимый с SWE-Agent. — Есть модуль памяти, модуль поиска научной литературы, и еще много разных ништяков, которые можно использовать отдельно от бенчмарка, просто развивая своего агента (свой агент? Это же неодушевленное...).  — Есть большой обзор литературы, охватывающий почти все последние работы в области агентов для SWE, ML, науки, который угадайте кто писал. Линейку задач можно легко расширять — поэтому мы будем рады идеям и контрибьюшенам, а также любой активности в репозитории. 🟣Arxiv: https://arxiv.org/abs/2502.14499 🟣Github: https://github.com/facebookresearch/MLGym 🟣Лицензия: CC-BY-NC 4.0

Repost from epsilon correct
Харкорные инженеры из гугла опубликовали гайд про то, как мы думаем про оптимизацию LLMок под TPU с глубоким разбором того, к
Харкорные инженеры из гугла опубликовали гайд про то, как мы думаем про оптимизацию LLMок под TPU с глубоким разбором того, как всё работает под капотом. Рассказывают про шардирование параметров, тренировку, трюки инференса доступно и с диаграммами. 10/10 чтиво на вечер 👍

TBF_11-02-25_AI_Garbuk.pdf2.48 MB

TBF_11-02-25_AI_Osadchuk.pdf3.44 KB

TBF_11-02-25_AI_Avetisyan.pdf1.18 MB

11 февраля в программе Форума "Технологии и безопасность 2025" состоялась конференция "Искусственный интеллект: вызовы и возможности. Опыт использования AI/ML в различных отраслях, вопросы доверия и информационной безопасности". Предлагаем ознакомиться с материалами: скачать презентации | смотреть видеозапись. https://m.vkvideo.ru/video-227780688_456240670

TBF_11-02-25_AI_Garbuk.pdf2.48 MB

TBF_11-02-25_AI_Osadchuk.pdf3.44 KB

TBF_11-02-25_AI_Avetisyan.pdf1.18 MB

11 февраля в программе Форума "Технологии и безопасность 2025" состоялась конференция "Искусственный интеллект: вызовы и возможности. Опыт использования AI/ML в различных отраслях, вопросы доверия и информационной безопасности". Предлагаем ознакомиться с материалами: скачать презентации | смотреть видеозапись. https://m.vkvideo.ru/video-227780688_456240670

Repost from Cyber Detective
Nuclei AI Prompts Nuclei v3.3.9 (@pdiscoveryio) has -ai option to generate and run nuclei templates on the fly in natural lan
Nuclei AI Prompts Nuclei v3.3.9 (@pdiscoveryio) has -ai option to generate and run nuclei templates on the fly in natural language. This is a list of prompts for this option: - sensitive data exposure - SQLi - XSS - SSRF and more https://github.com/reewardius/Nuclei-AI-Prompts By twitter.com/reewardius

Вышел новый гайд Agentic AI – Threats and Mitigations Guide (v1.0). Это первая попытка в рамках OWASP перечислить и ранжировать угрозы для AI-агентов. Здесь нет упора на научный AI Safety, документ скорее ориентирован на ИБ-специалистов и разработчиков, как и другие гайды OWASP. Он получился объёмным, с пересечениями с классическими практиками ИБ, местами сыроват — но решили не затягивать релиз в стремительно меняющейся среде. Сейчас в рабочей группе собираем обратную связь от сообщества, чтобы проработать её в версии 1.1 (запланирована на весну). Фидбек уже дали коллеги из NIST, Mitre, Robust Intelligence и др. Если вы занимаетесь безопасностью и у вас в проде на подходе чейны ИИ-агентов, пишите в комментах или в личку — можем устроить разбор и вместе посмотреть на уязвимости и атаки на агентные системы.

🔥 CHRONOS — это инновационный подход к созданию хронологических сводок новостей, разработанный командой Alibaba-NLP! 💡 Он о
🔥 CHRONOS — это инновационный подход к созданию хронологических сводок новостей, разработанный командой Alibaba-NLP! 💡 Он основан на итеративной генерации вопросов о теме и полученных документах для формирования последовательных хронологических резюме. В рамках проекта создан актуальный датасет для открытой хронологической сводки новостей, превосходящий существующие публичные наборы данных по размеру и продолжительности временных линий. Эксперименты показали, что метод CHRONOS эффективен в задачах открытой хронологической сводки и достигает сопоставимых результатов с передовыми методами в закрытых доменах, при этом значительно улучшая эффективность и масштабируемость. 🖥 Github @data_analysis_ml

Repost from Data Secrets
Если давно искали, что почитать по LLM, то там вышла крутая книжка The Hundred-Page Language Models Book Внутри 200 страниц с
Если давно искали, что почитать по LLM, то там вышла крутая книжка The Hundred-Page Language Models Book Внутри 200 страниц самой актуальной и очень емкой иллюстрированной информации по:
– ML-базе: матрицы, градиентный спуск и др. математический фундамент – Истории LLM: классические эмбеддинг-модели, RNN, BPE – Внутреннему устройству трансформеров от аттеншена до key-value caching – LLM: файнтюнинг, промптинг, скейлинг, элаймент, мультимодальность, RL и ризонинг
Акцент сделан на интуитивном понимании и практике: к книжке прилагается репа с отличным кодом по всем темам. Кто читал The Hundred-Page ML Book того же автора оценят, что это за сокровище. Бесплатно можно читать здесь

Repost from GitHub Community
Ultravox — это новый тип мультимодального LLM, который может понимать как текст, так и человеческую речь, без необходимости в
Ultravox — это новый тип мультимодального LLM, который может понимать как текст, так и человеческую речь, без необходимости в отдельном этапе распознавания речи (ASR). 5️⃣ GitHub

Repost from SecureTechTalks
💡 APT-LLM: защита от продвинутых киберугроз с помощью ИИ 🤖 🚀 Одна из самых сложных задач ИБ — обнаружение Advanced Persist
💡 APT-LLM: защита от продвинутых киберугроз с помощью ИИ 🤖 🚀 Одна из самых сложных задач  ИБ — обнаружение Advanced Persistent Threats (APT) — скрытых атак, которые могут годами незаметно находиться в системах компаний. Исследователи из Нью-Йоркского университета, Университета Монреаля и Эдинбургского университета представили APT-LLM -  систему, которая использует большие языковые модели для обнаружения аномалий, указывающих на APT-атаки. ⚠️ Почему APT-атаки так опасны? 💀 APT (Advanced Persistent Threat) — это целевые атаки, при которых злоумышленники долго и незаметно проникают в систему, крадут данные или наносят ущерб. Они маскируются под легитимные процессы, из-за чего традиционные методы обнаружения их пропускают. 🌐 В реальных условиях такие атаки часто составляют менее 0,004% от всего трафика, что делает их крайне сложными для выявления стандартными системами безопасности. 🧠 Что такое APT-LLM и как оно работает? APT-LLM — это комплексная система обнаружения аномалий, которая сочетает: 🧩 Большие языковые модели (LLM): BERT, ALBERT, DistilBERT, RoBERTa, MiniLM. 🧬 Автоэнкодеры: Baseline AE, Variational VAE и Denoising DAE. 👨‍💻 Как это работает: 📊 1. Сбор данных: Система собирает журналы активности процессов (открытие файлов, сетевые подключения и т.д.). 📜 2. Превращение в текст: Каждое событие описывается короткими текстовыми фразами. Например: “Процесс 123 открыл файл, записал данные и отправил по сети”. 💡 3. Создание эмбеддингов: LLM превращают текст в числовые векторы (эмбеддинги), которые описывают поведение процессов. 🧠 4. Поиск аномалий с помощью автоэнкодеров: Автоэнкодеры обучаются на нормальном поведении и выявляют отклонения — признаки атак. 💎 Какие LLM использовались и чем они отличаются? 🟡 BERT: Отлично выявляет контекст, но тяжел в вычислениях. 🟠 DistilBERT: Лёгкая версия BERT, быстрее, но чуть менее точна. 🟢 ALBERT: Уменьшенная модель с высокой точностью за счёт повторного использования параметров. 🔵 RoBERTa: Оптимизированная версия BERT с расширенной тренировкой. 🟣 MiniLM: Миниатюрная модель, подходящая для быстрых вычислений в реальном времени. 🛡️ Как работают автоэнкодеры для поиска угроз: 📌 Baseline AE (Стандартный автоэнкодер): Сжимает данные и восстанавливает их. Если восстановление слишком отличается от оригинала, значит, это аномалия. 📌 VAE (Вариационный автоэнкодер): Использует вероятностные модели для выявления даже скрытых аномалий. 📌 DAE (Денойзинг автоэнкодер): Устойчив к шуму и может находить аномалии в "зашумленных" данных. 📊 Результаты экспериментов: 🧪 Тестирование проводилось на реальных данных из программы DARPA Transparent Computing, включая атаки на ОС Android, Linux, BSD и Windows. В выборках атаки составляли менее 0,004% от всех событий — это крайне сложный случай для обнаружения. 🔥 Ключевые результаты: ✅ Лучший результат показала комбинация ALBERT + VAEAUC 0.95, что значительно превосходит традиционные методы. ✅ APT-LLM превзошла классические методы: OC-SVM, DBSCAN, Isolation Forest, особенно на Windows и Linux. 🔗Подробнее про APT-LLM можно прочитать тут. Stay secure and read SecureTechTalks 📚 #Кибербезопасность #APT #LLM #AI #Autoencoder #MachineLearning #SecureTechTalks #AnomalyDetection #ThreatIntelligence #CyberSecurity

Repost from GitHub Community
WebRover — это автономный агент с искусственным интеллектом, предназначенный для интерпретации вводимых пользователем данных
WebRover — это автономный агент с искусственным интеллектом, предназначенный для интерпретации вводимых пользователем данных и выполнения действий путём взаимодействия с веб-элементами для выполнения задач или ответов на вопросы. 5️⃣ GitHub