en
Feedback
ML&|Sec Feed

ML&|Sec Feed

Open in Telegram
1 192
Subscribers
+624 hours
+147 days
+3730 days
Posts Archive
Repost from Alaid TechThread
Разбор угроз при использовании кодинговых ИИ-агентов (Codex, Cursor, Claude Code) от NCC Group https://www.nccgroup.com/media/jtepwx1t/nccgroup_codingagentswhitepaper.pdf

Repost from GitHub Community
PythonRobotics — примеры кода на Python и учебник по алгоритмам робототехники. 🐱 GitHub
PythonRobotics — примеры кода на Python и учебник по алгоритмам робототехники. 🐱 GitHub

Repost from GitHub Community
Baserow — создавайте базы данных, автоматизированные системы, приложения и агентов с помощью искусственного интеллекта — без
Baserow — создавайте базы данных, автоматизированные системы, приложения и агентов с помощью искусственного интеллекта — без программирования. Платформа с открытым исходным кодом, доступная в облаке и на собственном сервере. Соответствует требованиям GDPR, HIPAA и SOC 2. Лучшая альтернатива Airtable. 🐱 GitHub

photo content

Repost from Machinelearning
📌 DeepMind опубликовала архитектуру безопасности AI Control Roadmap Вслед за недавними размышлениями об эволюции AGI в ASI,
+1
📌 DeepMind опубликовала архитектуру безопасности AI Control Roadmap Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов. Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.
За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.
Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты. Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента. Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования. На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров. По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей. Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают. На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов. Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня: 🟡Безопасность отдельного агента
Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.
🟡Риски взаимодействия агентов
Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.
🟡Общая кибербезопасность
Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).
@ai_machinelearning_big_data #news #ai #ml

Repost from overbafer1
+1
⌨️ Автономный ИИ на ручке для апокалипсиса. Энтузиаст скрафтил CrankGPT — небольшую коробку с локальной нейронкой, которой не нужен ни интернет, ни облако, ни розетка. Хочешь спросить ИИ, крути ручку, вырабатывай электричество и жди, пока чатбот ответит.
⚙️ Внутри стоит Raspberry Pi 5 с 8 ГБ памяти, локальная LLM, распознавание речи и озвучка ответов. Среди поддерживаемых моделей — Gemma 3 на 1 млрд параметров. Не GPT-5 конечно, но для коробки, которая работает от человеческой тяги, уже неплохо.
После нескольких секунд кручения, модель запускается, слушает вопрос и выдаёт ответ прямо на устройстве. Теперь после апокалипсиса можно крутить CrankGPT, чтобы нейронка объяснила, почему человечество всё-таки доигралось😏 @overbafer1

Repost from Machinelearning
✔️ Эстония начнет выдавать цифровые ID ИИ-агентам Инициатива по выдаче цифровых ID автономным агентам в рамках расширения про
✔️ Эстония начнет выдавать цифровые ID ИИ-агентам Инициатива по выдаче цифровых ID автономным агентам в рамках расширения программы e-residency, одобренная премьер-министром страны, определяет правовой статус алгоритмов при выполнении задач от лица компаний, госучреждений и граждан. Статус позволит ИИ легально работать с базами данных в режиме чтения, готовить документы и управлять финансами в пределах заданных лимитов. Права доступа настраиваются самим владельцем агента, но каждое действие ИИ будет записываться в аудируемый лог. Эстония уже внедряет LLM в госсектор и школы совместно с OpenAI. Премьер-министр тестирует инструменты разработки лично, недавно он навайбкодил с помощью Claude дашборд для отслеживания приоритетов кабинета министров. @ai_machinelearning_big_data #news #ai #ml

Repost from CodeCamp
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬 Об этом глава ИИ-направления
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬 Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работы Мехагитлера чат-бота является «вопросом первостепенной национальной безопасности». 💀💀💀

OpenAI разработала метод прогнозирования ошибок ИИ до его релиза Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен. Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения. По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска. Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика. Источник: https://t.me/ai_machinelearning_big_data/10351

Repost from Data Blog
Привет, друзья! Хоть в CTF я и профан, занудная любовь к такому формату у меня есть и вряд ли когда-нибудь пройдет. Играть и что-нибудь захватывать любят, кажется, все — независимо от возраста, профессии и должности. Со временем меняется только формат) И пока у меня самой не хватает времени на новые курсы (хотя осенью у меня будет целый предмет в ВШЭ (с открытой репой, надеюсь), но об этом расскажу, как только переживу лето), мои товарищи выпустили курс «AI Security: практикум по безопасности ИИ-приложений». Курс — очень вводный (с нуля), очень классный и очень покрывающий тему безопасности AI-систем. Он построен вокруг (как раз) практических CTF-заданий и если вы не любите как-то долго читать теорию, и хотите учиться на практике — то, что нужно. В курсе покрыты: • Prompt Injection, jailbreak-техники (разница — есть!) и обход системных инструкций • Разные ракурсы для вас, как для атакующего — Indirect Prompt Injection через документы, почту и веб-контент, а также атаки на агентные системы и отравление RAG • Подходы к защите — от простых фильтров до архитектурных решений — потому что все мы за добро доброе Курс не требует навыков программирования, поэтому подойдет как если вы хотите отдохнуть после работы в IDE, так и если вы в ней не работаете. Есть демо-доступ. Ссылка на курс (и я попросила нам персональный промокод, потому что мы с вами уже большие товарищи) со скидкой: здесь. Тем же временем я в режиме "сечас-все-будет" дописываю ещё пару туториалов, так что тоже скоро зашерю. А вообще — почти первый день лета, и всем желаю, чтобы у вас был запланировало чилл-окно в эти несколько месяцев! 🗿

Repost from Data Blog
Привет, друзья! Я решила вернуться красиво и напекла новый туториал. Какое-то количество постов назад писала о библиотеках для interventions и начала делать материалы, чтобы можно было "вкатиться" в них на практике. В туториале описан Activation Steering — это inference-time интервенция: мы не трогаем веса модели, а вмешиваемся в поток вычислений «на лету», пока трансформер генерирует.
Базовая идея: h⁽ˡ⁾ ← h⁽ˡ⁾ + α · v̂ Вектор v̂ кодирует нужное направление, α — сила вмешательства.
В туториале описаны три способа реализовать это вмешательство: PyTorch hooks и две библиотеки nnsight, pyvene. Попутно разобрана вся теория. А именно: • Метод CAA (Contrastive Activation Addition) — откуда вообще берётся steering vector; • Почему residual stream и почему последний токен • Странные термины: failure modes: prompt leakage, oversteering, layer mismatch, concept entanglement • PCA-диагностика: видим ли мы разделение классов в латентном пространстве вообще? Модель — GPT-2, запускается везде, коллаб тоже сделан. 🐑 [ссылка на ноутбук] 🐑 [ссылка на Хабр]

Repost from AISecHub

Repost from Machinelearning
✔️ Qwen представила тулкит из моделей для управления роботами Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллек
✔️ Qwen представила тулкит из моделей для управления роботами Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллекта, который нацелен заполнить пробел между пониманием визуально-языковых моделей и физическим действием. Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира. 🟡Qwen-RobotNav Построена на Qwen3-VL и объединяет в одной модели 5 навигационных задач: следование инструкциям, поиск объекта, слежение за целью, автономное вождение и ответы на вопросы о среде. Поведение задаётся через протокол наблюдения с 4 параметрами - бюджет визуальных токенов, временное затухание, веса камер и режим выборки кадров.
Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.
🟡Qwen-RobotManip Опирается на Qwen3.5-4B VL и модуль формирования действий на базе flow-matching DiT. Она использует единое 80-мерное представление состояния и действия для разных типов роботов.
Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.
🟡Qwen-RobotWorld Модель мира. По текущему наблюдению и текстовой команде она предсказывает, как изменится сцена. Все действия описываются естественным языком, что позволяет объединить в одной системе более 20 типов роботов и свыше 500 категорий действий. В основе лежит 60-слойная архитектура MMDiT, связанная с представлениями Qwen2.5-VL.
Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.
🟡Отдельно анонсирована функция Chat2Robot Это браузерное демо управления текстовыми командами и наблюдением за реакцией робота в реальном времени.
Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.
В анонсе не указано, будут ли открыты ли веса и под какой лицензией. Пока доступны технические отчёты и анонсы по каждой модели. @ai_machinelearning_big_data #news #ai #ml

Repost from AI SecOps
Банк России опубликовал методические рекомендации, которые помогут финансовым организациям обеспечить информационную безопасность при использовании технологий искусственного интеллекта (ИИ). https://www.cbr.ru/press/event/?id=32627

Repost from The Engine Room
GAS (Genetic Algorithm-Based Suffix) Leak LLM - black-box атака на LLM, где подбор суффиксов происходит автоматически Незаметка #ai #cybersecurity #gas #aisecurity #незаметки The Engine Room👾

Repost from Хабр / ML & AI
Окупается ли мультиагентность и можно ли автоматически выбрать паттерн под задачу? Я прогнал шесть мультиагентных паттернов на трёх бенчмарках и трёх моделях. Под командой агентов тут понимаются связки вроде критика-актора или оркестратора с подчинёнными. Почти везде такая команда проиграла одиночному агенту. Проиграла и по точности, и по цене, а по цене иногда вчетверо. Это была бы скучная заметка в духе «МАС не нужен, расходимся». Но нашлось исключение. Чем труднее задача для модели, тем больше у команды появляется шанс на выигрыш. Так что вопросов у меня два. Влияет ли вообще топология системы на результат? И если влияет, можно ли автоматически выбирать подходящий паттерн под конкретную задачу? Ответ на второй вопрос пока отрицательный, и самое любопытное здесь именно почему. Примеры я показываю на мультиагентном фреймворке FEDOT.MAS, а весь код экспериментов с паттернами, прогонами и графиками лежит в репозитории. Я меряю инструмент, который сам и пишу. Но и выводы выйдут в основном не в пользу мультиагентности, так что это скорее самокритика, чем реклама. Читать далее #python #искусственный_интеллект #агенты #llm #ии_агенты | @habr_ai