ML&|Sec Feed
Kanalga Telegram’da o‘tish
Feed for @borismlsec channel author: @ivolake
Ko'proq ko'rsatish1 192
Obunachilar
+624 soatlar
+147 kunlar
+3730 kunlar
Postlar arxiv
1 192
Repost from Alaid TechThread
Разбор угроз при использовании кодинговых ИИ-агентов (Codex, Cursor, Claude Code) от NCC Group
https://www.nccgroup.com/media/jtepwx1t/nccgroup_codingagentswhitepaper.pdf
1 192
Repost from GitHub Community
PythonRobotics — примеры кода на Python и учебник по алгоритмам робототехники.
🐱 GitHub
1 192
Repost from GitHub Community
Baserow — создавайте базы данных, автоматизированные системы, приложения и агентов с помощью искусственного интеллекта — без программирования.
Платформа с открытым исходным кодом, доступная в облаке и на собственном сервере. Соответствует требованиям GDPR, HIPAA и SOC 2. Лучшая альтернатива Airtable.
🐱 GitHub
1 192
Repost from Machinelearning
📌 DeepMind опубликовала архитектуру безопасности AI Control Roadmap
Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов.
Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.
За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты. Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента. Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования. На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров. По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей. Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают. На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов. Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня: 🟡Безопасность отдельного агента
Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.🟡Риски взаимодействия агентов
Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.🟡Общая кибербезопасность
Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).@ai_machinelearning_big_data #news #ai #ml
1 192
Repost from overbafer1
⌨️ Автономный ИИ на ручке для апокалипсиса.
Энтузиаст скрафтил CrankGPT — небольшую коробку с локальной нейронкой, которой не нужен ни интернет, ни облако, ни розетка.
Хочешь спросить ИИ, крути ручку, вырабатывай электричество и жди, пока чатбот ответит.
⚙️ Внутри стоит Raspberry Pi 5 с 8 ГБ памяти, локальная LLM, распознавание речи и озвучка ответов. Среди поддерживаемых моделей — Gemma 3 на 1 млрд параметров. Не GPT-5 конечно, но для коробки, которая работает от человеческой тяги, уже неплохо.После нескольких секунд кручения, модель запускается, слушает вопрос и выдаёт ответ прямо на устройстве. Теперь после апокалипсиса можно крутить CrankGPT, чтобы нейронка объяснила, почему человечество всё-таки доигралось😏 @overbafer1
1 192
Repost from Machinelearning
✔️ Эстония начнет выдавать цифровые ID ИИ-агентам
Инициатива по выдаче цифровых ID автономным агентам в рамках расширения программы e-residency, одобренная премьер-министром страны, определяет правовой статус алгоритмов при выполнении задач от лица компаний, госучреждений и граждан.
Статус позволит ИИ легально работать с базами данных в режиме чтения, готовить документы и управлять финансами в пределах заданных лимитов. Права доступа настраиваются самим владельцем агента, но каждое действие ИИ будет записываться в аудируемый лог.
Эстония уже внедряет LLM в госсектор и школы совместно с OpenAI. Премьер-министр тестирует инструменты разработки лично, недавно он навайбкодил с помощью Claude дашборд для отслеживания приоритетов кабинета министров.
@ai_machinelearning_big_data
#news #ai #ml
1 192
Repost from CodeCamp
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬
Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работы Мехагитлера чат-бота является «вопросом первостепенной национальной безопасности».
💀💀💀
1 192
OpenAI разработала метод прогнозирования ошибок ИИ до его релиза
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.
По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.
Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.
Источник: https://t.me/ai_machinelearning_big_data/10351
1 192
Repost from Data Blog
Привет, друзья!
Хоть в CTF я и профан, занудная любовь к такому формату у меня есть и вряд ли когда-нибудь пройдет. Играть и что-нибудь захватывать любят, кажется, все — независимо от возраста, профессии и должности. Со временем меняется только формат)
И пока у меня самой не хватает времени на новые курсы (хотя осенью у меня будет целый предмет в ВШЭ (с открытой репой, надеюсь), но об этом расскажу, как только переживу лето), мои товарищи выпустили курс «AI Security: практикум по безопасности ИИ-приложений».
Курс — очень вводный (с нуля), очень классный и очень покрывающий тему безопасности AI-систем. Он построен вокруг (как раз) практических CTF-заданий и если вы не любите как-то долго читать теорию, и хотите учиться на практике — то, что нужно.
В курсе покрыты:
• Prompt Injection, jailbreak-техники (разница — есть!) и обход системных инструкций
• Разные ракурсы для вас, как для атакующего — Indirect Prompt Injection через документы, почту и веб-контент, а также атаки на агентные системы и отравление RAG
• Подходы к защите — от простых фильтров до архитектурных решений — потому что все мы за добро доброе
Курс не требует навыков программирования, поэтому подойдет как если вы хотите отдохнуть после работы в IDE, так и если вы в ней не работаете.
Есть демо-доступ.
Ссылка на курс (и я попросила нам персональный промокод, потому что мы с вами уже большие товарищи) со скидкой: здесь.
Тем же временем я в режиме "сечас-все-будет" дописываю ещё пару туториалов, так что тоже скоро зашерю. А вообще — почти первый день лета, и всем желаю, чтобы у вас был запланировало чилл-окно в эти несколько месяцев! 🗿
1 192
Repost from Data Blog
Привет, друзья!
Я решила вернуться красиво и напекла новый туториал. Какое-то количество постов назад писала о библиотеках для interventions и начала делать материалы, чтобы можно было "вкатиться" в них на практике. В туториале описан Activation Steering — это inference-time интервенция: мы не трогаем веса модели, а вмешиваемся в поток вычислений «на лету», пока трансформер генерирует.
Базовая идея: h⁽ˡ⁾ ← h⁽ˡ⁾ + α · v̂ Вектор v̂ кодирует нужное направление, α — сила вмешательства.В туториале описаны три способа реализовать это вмешательство: PyTorch hooks и две библиотеки nnsight, pyvene. Попутно разобрана вся теория. А именно: • Метод CAA (Contrastive Activation Addition) — откуда вообще берётся steering vector; • Почему residual stream и почему последний токен • Странные термины: failure modes: prompt leakage, oversteering, layer mismatch, concept entanglement • PCA-диагностика: видим ли мы разделение классов в латентном пространстве вообще? Модель — GPT-2, запускается везде, коллаб тоже сделан. 🐑 [ссылка на ноутбук] 🐑 [ссылка на Хабр]
1 192
Repost from AISecHub
The New SDLC With Vibe Coding - https://drive.google.com/file/d/1wNEl8FMpTso8aXlb_joxgzparxi-0ciM/view
1 192
Repost from Machinelearning
✔️ Qwen представила тулкит из моделей для управления роботами
Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллекта, который нацелен заполнить пробел между пониманием визуально-языковых моделей и физическим действием.
Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира.
🟡Qwen-RobotNav
Построена на Qwen3-VL и объединяет в одной модели 5 навигационных задач: следование инструкциям, поиск объекта, слежение за целью, автономное вождение и ответы на вопросы о среде.
Поведение задаётся через протокол наблюдения с 4 параметрами - бюджет визуальных токенов, временное затухание, веса камер и режим выборки кадров.
Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.🟡Qwen-RobotManip Опирается на Qwen3.5-4B VL и модуль формирования действий на базе flow-matching DiT. Она использует единое 80-мерное представление состояния и действия для разных типов роботов.
Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.🟡Qwen-RobotWorld Модель мира. По текущему наблюдению и текстовой команде она предсказывает, как изменится сцена. Все действия описываются естественным языком, что позволяет объединить в одной системе более 20 типов роботов и свыше 500 категорий действий. В основе лежит 60-слойная архитектура MMDiT, связанная с представлениями Qwen2.5-VL.
Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.🟡Отдельно анонсирована функция Chat2Robot Это браузерное демо управления текстовыми командами и наблюдением за реакцией робота в реальном времени.
Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.В анонсе не указано, будут ли открыты ли веса и под какой лицензией. Пока доступны технические отчёты и анонсы по каждой модели. @ai_machinelearning_big_data #news #ai #ml
1 192
Repost from AI SecOps
Банк России опубликовал методические рекомендации, которые помогут финансовым организациям обеспечить информационную безопасность при использовании технологий искусственного интеллекта (ИИ). https://www.cbr.ru/press/event/?id=32627
1 192
Repost from The Engine Room
GAS (Genetic Algorithm-Based Suffix) Leak LLM - black-box атака на LLM, где подбор суффиксов происходит автоматически
Незаметка
#ai #cybersecurity #gas #aisecurity #незаметки
The Engine Room👾
1 192
Repost from Хабр / ML & AI
Окупается ли мультиагентность и можно ли автоматически выбрать паттерн под задачу?
Я прогнал шесть мультиагентных паттернов на трёх бенчмарках и трёх моделях. Под командой агентов тут понимаются связки вроде критика-актора или оркестратора с подчинёнными. Почти везде такая команда проиграла одиночному агенту. Проиграла и по точности, и по цене, а по цене иногда вчетверо.
Это была бы скучная заметка в духе «МАС не нужен, расходимся». Но нашлось исключение. Чем труднее задача для модели, тем больше у команды появляется шанс на выигрыш. Так что вопросов у меня два. Влияет ли вообще топология системы на результат? И если влияет, можно ли автоматически выбирать подходящий паттерн под конкретную задачу? Ответ на второй вопрос пока отрицательный, и самое любопытное здесь именно почему.
Примеры я показываю на мультиагентном фреймворке FEDOT.MAS, а весь код экспериментов с паттернами, прогонами и графиками лежит в репозитории. Я меряю инструмент, который сам и пишу. Но и выводы выйдут в основном не в пользу мультиагентности, так что это скорее самокритика, чем реклама. Читать далее
#python #искусственный_интеллект #агенты #llm #ии_агенты | @habr_ai
