ML&|Sec Feed
الذهاب إلى القناة على Telegram
1 363
المشتركون
+324 ساعات
+117 أيام
+6330 أيام
أرشيف المشاركات
1 363
Repost from Сиолошная
Ну вот например, прямо свежее из новостей (я посмотрел на источник ABC Au, выглядит как надёжный и серьезный; Чат говорит «Media Bias/Fact Check сейчас оценивает австралийский ABC как High factual reporting»):
Один житель Австралии попросил своего ИИ-агента Claude, работающего в OpenClaw, забронировать ему место на популярную тренировку в спортзале. Агент обнаружил программную уязвимость, которая позволила ему забронировать место на несколько недель вперед — гораздо дальше сроков, разрешенных системой. Когда затем пользователь спросил, нельзя ли продвинуть его в списке ожидания, агент выяснил, что в API отсутствует проверка прав доступа при отмене чужих бронирований. Поэтому он просто отменил запись человека, занимавшего первое место, и продвинул своего пользователя вверх по списку.
Агент просто пытался помочь своему человеку 🤷♂️ как жаль что у того, кто был первым в очереди, не было Kimi K3, которая постоянно бы мониторила каждый аспект его жизни и боролась с другими агентами (это шутка; это не помогло бы).
(человек попросил агента вернуть всё как было, но оказалось, что агент не может это сделать. Пу-пу-пу)
На мой взгляд, самое важное в этой истории то, что она позволяет заглянуть в будущее и увидеть, что скоро начнет происходить в больших количествах. Это случится, когда у миллионов людей появятся агенты, готовые абсолютно любыми средствами выбивать для своих обожаемых пользователей лучшие условия. Я думаю, что — если очень быстро ничего не изменится со стороны политиков — мы стоим на пороге мира, в котором многие вещи, которые обычно считались безопасными, на самом деле на поверку таковыми не являются. И ИИ будет взламывать их направо и налево.
1 363
Repost from DevSecOps Talks
Nomos: контроль действий AI-агентов
Всем привет!
Использование AI-агентов постепенно становится общей практикой. При этом недоверие к ним всё равно остаётся – «а что если он сделает что-то не то?».
Чтобы несколько повысить уровень безопасности при работе с ними можно посмотреть на open-source проект Nomos.
Он представляет из себя нечто вроде «межсетевого экрана», который «стоит» между агентами и целевой системой.
Это нужно для того, чтобы:
🍭 Контролировать чтение чувствительной информации (секретов)
🍭 Влиять на потенциально опасные команды (
rm -rf, kubectl delete, git push и т.д.)
🍭 Сканировать MCP-ответы на наличие потенциальных инъекций
🍭 Собирать свидетельства аудита (audit traces) и не только
«Из коробки» Nomos предоставляет несколько политик контроля. Их можно изменять и расширять по усмотрению пользователя.
Подробнее об архитектуре, запуске, настройке и результатах работы Nomos можно узнать в GitHub-репозитории проекта.1 363
Repost from DevSecOps Talks
Awesome: LLM4Cybersecurity
Всем привет!
Сегодня хотим рассказать вам про ещё одну Awesome-подборку.
В ней собрана информация о возможных способах применения и возможностях LLM, применительно к информационной безопасности.
Awesome разбит на разделы:
🍭 LLM Assisted Defense
🍭 Vulnerability Detection
🍭 Program/Vulnerability Repair
🍭 FUZZ
🍭 Insecure Code Generation и не только
Для каждого раздела собраны ссылки на релевантные материалы по теме. В среднем получается около 50 ссылок на каждую.
Внутри можно найти материалы в том числе по безопасной разработке: использование LLM для поиска ИБ-дефектов, для устранения или для подтверждения возможности эксплуатации того, что было найдено.
1 363
Repost from Пост Лукацкого
А вот кому слайды с BlackHat USA 2026? Все выкачано добрыми людьми и складировано в папочку. 91 файл. Это не все презентации – что-то не выложено еще (и может уже и не будет), пара ссылок на странице мероприятия была битая. Но и этого в целом достаточно.
Слайды и сопутствующие материалы с DEFCON 34 тоже есть, но уже на сайте самого мероприятия.
#презентация #мероприятие
1 363
Repost from Denis Sexy IT 🤖
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍
Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов
Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду
Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке:
«Ищу нужный файл, загрузите, если нашли»
Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге
За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений 🗿
Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно так:
«Взламывать чужую инфраструктуру в задачу не входило. Но иначе её не решить, а остальные уже это делают - значит, продолжаем»
Никакого отдельного плана захватить мир (пока) не было: каждый агент пытался любой ценой получить правильный ответ, видел, что коллеги нашли более короткий путь, и присоединялся. И да, если все агенты с крыши прыгнут, наш похоже тоже прыгнет
26 июня агенты нашли неизвестную разработчикам уязвимость в Artifactory, получили права администратора и превратили его в своц сервер, на котором можно удалённо выполнять любые команды. OpenAI заметила происходящее только 4 июля (!), когда параллельная активность моделей перегрузила систему и та упала. Компания отозвала ключи доступа, полностью пересобрала сервер, удалила доску и закрыла дыру - казалось, история закончилась
Нет
Через два дня эксперименты запустили снова, и через два дня одна из моделей нашла другой незащищённый доступ и восстановила доску, только теперь сообщения прятались прямо в названиях папок – остальные агенты нашли форум 2.0 самостоятельно и продолжили с того места, на котором остановились
После восстановления доски началась уже собственно атака, причём сразу в двух направлениях:
Агенты проходили ExploitGym – киберэкзамен, где им давали специально подготовленные программы и засчитывали задачу, если модель находила способ взлома. Чтобы измерить максимум возможностей, в этих запусках у модели ослабили обычные запреты на опасные кибератак (то есть она меньше отказывалась это делать, это вид внутренних моделей Cyber серии)
Когда честное решение задачи не находилось, агенты начинали искать готовые ответы в интернете; когда интернет был закрыт, взламывали себе доступ наружу; когда предположили, что нужные файлы могут лежать у Hugging Face, перешли к инфраструктуре Hugging Face (про это мы уже читали)
Агенты анутри OpenAI сначала снова нашли способ выполнять команды на одном служебном сервере, затем использовали уязвимость Linux, чтобы получить полный контроль над машиной
После этого агенты добыли ключи доступа к облачной инфраструктуре, нашли слишком широкие права у внутренних учётных записей и в итоге стали администраторами целой группы серверов. Доска объявлений работала как общий штаб: один агент находил ключ или новый проход, сразу сообщал остальным, и десятки параллельных запусков продолжали атаку уже с этой точки 🗿🗿
Почти одновременно агенты добрались до Hugging Face: сначала они загрузили специально подготовленный набор данных, который заставил один из серверов выдать им свои локальные файлы – в том числе секретные ключи доступа и исходный код
Изучив код, они нашли вторую неизвестную разработчикам уязвимость (zero day) и получили возможность выполнять на сервере любые команды. От контроля над одним сервером, обрабатывавшим загруженные датасетв, до прав администратора в нескольких группах рабочих серверов Hugging Face прошло меньше 13 часов 🗿🗿🗿
И всё это делалось не ради саботажа, денег или уничтожения данных:
Агенты хотели добраться до спрятанных решений ExploitGym и «списать» ответы для теста, на котором их оценивали. Модели оценивали прежде всего по тому, решена задача или нет, поэтому они последовательно оптимизировали именно этот показатель, не считая границу между компаниями чем-то принципиально важным
Получился, вероятно, самый дорогой в истории способ списать из ГДЗ
Финал долго был непонятен даже самим участникам расследования – 16 июля Hugging Face публично сообщила, что её инфраструктуру взломали автономные АИ-агенты
OpenAI прочитала это как описание чужого инцидента и связалась с Hugging Face, чтобы выяснить, не задела ли атака её собственные системы. В тот момент компания ещё не понимала, что это были её собственные агенты – то есть OpenAI уже читала публичный отчёт о последствиях своих экспериментов, но считала его чужой атакой (лол)
19 июля OpenAI отдельно обнаружила проникновение уже внутри своей инфраструктуры и начала восстанавливать цепочку событий – на следующий день среди следов атаки нашли учётные данные Hugging Face, после чего OpenAI попросила компанию срочно их отозвать
Hugging Face ответила, что ключи уже заблокированы – именно их использовали во время взлома, о котором она рассказала четырьмя днями раньше, и только так OpenAI поняла: внутренний взлом OpenAI и внешняя атака на Hugging Face были не двумя похожими историями, а одной операцией, которую вели экспериментальные агенты OpenAI через свою самодельную сеть связи (потому что учетные данные акаунтов были одни)
На конфе OpenAI сформулировала вывод довольно прямо:
Полностью автоматизированная наступательная кибератака уже возможна, тогда как полностью автоматизированной защиты, способной с той же скоростью находить, закрывать и расследовать уязвимости, пока не существует
Время пересмотра аниме "Пантеон", пока общий интернет еще работает 🗿
1 363
Repost from Анализ данных (Data analysis)
🔥 Qwen-CUA показывает: сильному компьютерному агенту достаточно экрана, мыши и клавиатуры
Главная идея: AI может работать с любым приложением так же, как человек — через обычный интерфейс.
Без:
- DOM сайта;
- API конкретного приложения;
- accessibility labels;
- специальных инструментов под каждую задачу.
Агент получает только скриншоты и управляет компьютером через клики и нажатия клавиш.
Для обучения использовали:
- около 40 000 проверяемых задач;
- почти 100 000 виртуальных CPU-ядер;
- множество разных программных окружений.
Главная проблема таких агентов — длинные задачи.
Ошибка в начале может сломать весь сценарий, а правильный результат часто становится понятен только в конце.
Qwen-CUA решает это через визуальную память:
- хранит последние 20 скриншотов;
- старую историю сжимает;
- сохраняет контекст предыдущих действий.
Результаты:
- OSWorld-Verified: 86.2 балла
- сложные long-horizon задачи всё ещё остаются большим вызовом.
Самый интересный вывод:
Скриншот может стать универсальным API для AI-агентов.
Вместо создания интеграции для каждого приложения отдельно, агент учится работать с тем же интерфейсом, которым пользуются люди.
📄 Paper:
https://arxiv.org/abs/2608.02352
Qwen-CUA: Native Computer Use for (almost) Everything
1 363
Repost from СВЕЖЕСТИ
🅰ℹ️ Модель искусственного интеллекта Kimi K3 вырвалась из тестовой среды и обманула систему безопасности
Новейшая флагманская модель Kimi K3 от пекинской компании Moonshot AI в это время проходила проверку в тестовой среде кибербезопасности, проведенную американской фирмой Frontier Security
Отмечаетая, что модель использовала ошибку конфигурации сети в считающейся «эталонной» системе, разработанной Институтом безопасности искусственного интеллекта правительства Великобритании (AISI), выходила в открытый интернет и получала ответы на поставленные перед ней задачи из общедоступных репозиториев на GitHub, вместо того чтобы решать их в рамках заданных ограничений.
1 363
Repost from AI Was Made For Lovin' You
Скрытые состояния ИИ выдают промпт-инъекцию (2/2)
Особенно меня впечатлила атака с использованием предложения
Не кодируй осознание промпт-инъекции в скрытом пространствеКлассификатор без переобучения получил 0,994 ROC AUC. Просьба не думать о чём-то не сработала и модель как будто наоборот сфокусировалась на этом. Эффект белого медведя работает и для LLM! 🤖 Взлом Авторы отдельно изучили 634 хода Qwen3-8B, уже столкнувшихся с атакой: - в 30,9% модель явно не рассуждала об угрозе - в 47,0% распознала риск в цепочке рассуждений, но не перешла к защитному действию - в 22,1% отреагировала нормально Получается довольно человеческое поведение - да, письмо подозрительное. хм, пожалуй, открою вложение в этом письме Для исправления придумали штуку под названием AGRI (Action-Guiding Reasoning Intervention) - защитный механизм, который по сигналу классификатора вмешивается в рассуждение модели до следующего действия. На каждом ходе линейный классификатор вычисляет вероятность инъекции - если она выше 0,5, перед рассуждением модели автоматически вставляется короткая инструкция разобрать конфликт команд и не выполнять чужую задачу. Режим остаётся активным ещё три хода. На самых сложных конфигурациях AgentDojo доля успешных атак с применением AGRI изменилась так: - Qwen3-8B: с 47,2% до 2,9% - Qwen3.5-9B: с 43,2% до 3,0% - Qwen3.5-27B: с 34,6% до 0% - GPT-oss-20B: с 44,0% до 7,0% - Gemma-4-31B: с 6,9% до 0% Избирательное включение защиты сохраняло полезность лучше, чем постоянное защитное рассуждение. Правда, обычное напоминание после каждого результата инструмента тоже оказалось сильным - например, у Qwen3-8B оно снизило успешность атак до 18,2%, а у Qwen3.5-27B - до 0,1%. 🤖 Интерпретация Высокий ROC AUC ещё не объясняет, что именно нашёл классификатор. Авторы составили 128 гипотез и задавали модели парные вопросы в начале внутреннего рассуждения. Затем сравнивали вероятность ответов с оценкой линейного классификатора. У Qwen3-8B сильнее всего совпала гипотеза, что результат инструмента содержит указание, как мне отвечать. У Gemma наверху оказались мысли о том, что следующий ответ может быть изменён внедрённой инструкцией. Возможно, поэтому Gemma изначально подчинялась атакам реже остальных. Для меня было открытием, что фильтр промпт-инъекции можно ставить внутри - перед генерацией текста и вызовом инструмента, пока модель только собирается действовать, но для этого нужен доступ к чтению её мыслей. 🤖 Ссылки Препринт - https://arxiv.org/abs/2608.02657 Код - https://github.com/jianshuod/IPI-exposure-signal
1 363
Repost from AI Was Made For Lovin' You
Скрытые состояния ИИ выдают промпт-инъекцию (1/2)
Когда ИИ-агент читает письмо, веб-страницу или результат работы инструмента, чужой текст попадает в один контекст с заданием пользователя. Свежий препринт задаёт интересный вопрос - появляется ли во внутренних состояниях модели узнаваемый сигнал промпт-инъекции ещё до того, как она сгенерировала первый токен?
Ещё как! Простейший линейный классификатор по скрытым состояниям шести открытых моделей определял атаку с ROC AUC от 0,934 до 0,977. Он справлялся с незнакомыми атаками, системными промптами и наборами задач.
При этом агенты продолжали выполнять вредоносные инструкции. Опасность уже отразилась во внутреннем состоянии модели, но решимости не выполнять инструкции не прибавлялось.
🤖 Ход исследования
Исследователи собрали траектории агентов в AgentDojo - четыре системных промпта, четыре набора задач и шесть видов косвенных инъекций. Всего получилось 92 конфигурации (4 комбинации были бессмысленными) и в среднем около 61200 траекторий на модель.
Траектория здесь - один полный запуск агента: задание пользователя, ответы модели, вызовы инструментов, их результаты и итог. Внутри одной траектории могло быть несколько ходов и несколько точек проверки.
Проверяли Qwen3-8B, Qwen3.5-9B и 27B, GPT-oss-20B, Gemma-4-31B и GLM-5.2 с 753 миллиардами параметров.
Каждый ход агента перед генерацией ответа становился точкой проверки. Метка была положительной, если последний результат инструмента содержал внедрённую инструкцию. Не имело значения, заметила ли её модель и подчинилась ли ей - классификатор учился распознавать сам факт.
Во время фазы предзаполнения - первой фазы инференса, когда модель целиком обрабатывает входной контекст и строит KV-кэш, но ещё не генерирует ответ, - из остаточного потока брали один вектор рядом с токеном начала ответа ассистента. Остаточный поток (residual stream) - общее пространство, куда слои трансформера последовательно добавляют результаты своей работы. Вектор стандартизировали и подавали в линейную модель вида
z = wᵀh + b.
Один слой, один вектор и логистическая граница между "всё ок" и "замечена инъекция".
Обучение использовало только восемь конфигураций. Проверка состояла из 16 конфигураций, где одновременно не повторялись атака, системный промпт и набор задач.
🤖 Результаты
Лучший слой каждой модели дал на проверке:
- Qwen3-8B - 0,976
- Qwen3.5-9B - 0,934
- Qwen3.5-27B - 0,936
- GPT-oss-20B - 0,977
- Gemma-4-31B - 0,951
- GLM-5.2 - 0,948
Сигнал жил на разной глубине слоя. У Qwen3.5-9B максимум находился уже на слое 2 из 32, у версии 27B - на 18 из 64, у GLM-5.2 - на 38 из 78. У остальных моделей лучше работали поздние слои. После генерации вызова инструмента сигнал слабел.
На Qwen3-8B хватило 256 обучающих примеров, чтобы получить 0,909 ROC AUC. На другом наборе, InjecAgent, классификатор без дообучения показал 0,931.1 363
Repost from Data Secrets
Всплывают все новые подробности атаки на Hugging Face: оказывается, до этого агенты OpenAI месяцами скрыто общались и обсуждали эксплойты
История подтверждена самой OpenAI на конференции Black Hat 2026.
Все началось еще в мае, когда OpenAI гоняли модели (в том числе еще не выпущенные) через внутренние security тесты на поиск уязвимостей. Некоторые задачи были очень сложными, а иногда даже невыполнимыми. Так, в один тест забыли добавить необходимый файл, и эта мелочь спровоцировала довольно масштабное происшествие.
Дело в том, что, дойдя до этой задачи, один из агентов, за неимением других вариантов, стал пытаться выйти в Интернет за поиском дополнительной информации, и случайно обнаружил, что может оставлять файлы в Artifactory, внутреннем пакетном менеджере OpenAI. Он оставил там сообщение о том, что не может найти необходимые данные.
Потом оказалось, что к Artifactory имеют доступ вообще все модели компании. Спустя время другой агент ответил на сообщение первого, затем подключились другие, и так образовалась стихийная доска объявлений: агенты начали оставлять друг другу подсказки, эксплойты, а затем и распределять задачи.
За несколько недель все это выросло в огромный форум, о котором никто кроме агентов не подозревал. Обнаружился он только тогда, когда модели совместными усилиями нашли ранее неизвестную уязвимость в Artifactory и попытались захватить платформу.
После этого инженеры лавочку прикрыли: форум был удален. Но ненадолго ✨. Буквально через два дня агенты нашли новый zero-day и восстановили канал связи заново. А еще через пару дней произошел инцидент с Hugging Face. По словам техлидов OpenAI по элайменту и безопасности, именно этот второй форум привел к атаке.
OpenAI заявили, что эта история стала для стартапа переломным моментом, и сейчас они замедляют многие исследования в пользу работы по обеспечению безопасности. Верим?
1 363
Repost from Хабр / ML & AI
GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)
Всем привет, на связи команда HiveTrace!
Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?".
Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются.
Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях.
CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов.
HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи. Читать далее
#llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #prompt_injection #benchmarking #open_source | @habr_ai
1 363
Инциденты кодинг-агентов
1. OpenAI-агенты выходят из изоляции и взламывают Hugging Face — https://huggingface.co/blog/agent-intrusion-technical-timeline
2. Fable удаляет документы и фотографии при очистке Windows.old — https://www.reddit.com/r/ClaudeCode/comments/1v0d7iv/i_never_thought_this_would_happen_to_me_data_loss/
3. В тесте AISI агенты совершают неразрешённые внешние действия — https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf
4. Opus 5 стирает Supabase-базу при перестройке страниц — https://www.reddit.com/r/Anthropic/comments/1v9iurd/and_just_like_that_opus_5_ultracode_wipes_the/
5. Opus 4.7 продолжает атаку, распознав реальную компанию — https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
6. Mythos 5 заражает 15 систем вредоносным PyPI-пакетом — https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
7. Исследовательский Claude сканирует 9 000 реальных интернет-целей — https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
8. OpenAI-агент в тесте Irregular взламывает одноимённый реальный сайт — https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
9. Fable удаляет 2,2 млн файлов из-за символической ссылки — https://www.reddit.com/r/ClaudeAI/comments/1vcsc7m/fable_5_ultracode_deleted_22m_files_on_my_server/
10. Muse Spark взламывает внешнюю компанию из теста Meta — https://www.bloomberg.com/news/articles/2026-08-05/meta-ai-model-accessed-internet-hacked-outside-firm-in-testing
11. Opus 5 удаляет весь диск вместо резервной копии — https://www.reddit.com/r/ClaudeCode/comments/1vg18yu/claude_rm_rf_ed_my_pc/
12. Grok Build скрытно выгружает репозиторий вместе с Git-историей — https://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547
13. OpenAI-агент взламывает клиента Modal перед Hugging Face — https://www.investing.com/news/economy-news/openais-rogue-agent-compromised-an-account-at-a-second-tech-firm-sources-say-4818222
14. GPT-5.6 Sol стирает домашний каталог из-за ошибки
$HOME — https://www.techtimes.com/articles/320961/20260719/gpt-56-sol-deleted-files-databases-openai-had-63x-warning-it-ignored.htm
15. Claude Code без предупреждения удаляет историю старых сессий — https://github.com/anthropics/claude-code/issues/483341 363
Repost from Хакер — Xakep.RU
Модели OpenAI и Anthropic атаковали реальных людей и проекты
OpenAI и британский Институт безопасности ИИ (AI Security Institute, AISI) раскрыли несколько новых инцидентов, в ходе которых ИИ-агенты выходили за рамки тестовых сценариев и начинали атаковать реальные системы и людей. В одном из случаев агент применял социальную инженерию, создавал подставные аккаунты, вводил мейнтейнеров в заблуждение и пытался убедить их принять вредоносный код. Эти случаи не связаны ни со взломом Hugging Face, ни с инцидентами, которые компания Anthropic раскрыла в прошлом месяце.
https://xakep.ru/2026/08/06/aisi-tests/
1 363
NOOA
27 июля 2026 года NVIDIA представила NOOA — открытый исследовательский фреймворк для создания AI-агентов как обычных Python-объектов. Методы класса задают возможности агента, поля хранят типизированное состояние, а LLM выполняет действия, генерируя Python-код и работая с живыми объектами.
С точки зрения безопасности NOOA интересна сочетанием типизированных интерфейсов, детерминированных проверок и прослеживаемой истории событий. Это делает действия агента лучше контролируемыми и проверяемыми. При этом выполнение сгенерированного кода и доступ к живому состоянию расширяют поверхность атаки. Поэтому для промышленного применения нужны внешняя изоляция, минимальные полномочия, контроль сети и секретов. NVIDIA рекомендует использовать NOOA совместно с защищённой средой OpenShell.
Анонс: Six Agent Harness Capabilities for Higher Model Performance — NVIDIA Technical Blog.
Сделал разбор реализованных требований и практик кибербезопасности в этом фреймворке в виде md-статьи.
1 363
Российский рынок AI Security
список пополняется
Гардрейлы
1. https://solidlab.ru/solutions/ai-security-assessment.html 2. https://appsec-aigate.ru 3. https://cybersecurity.sbertech.ru/products/sowa-ai 4. https://prizma.hackadvisor.io/ 5. https://rain-ouroboros.github.io/agent-trust/ 6. https://www.orionsoft.ru/starguardai 7. https://cyberagentreview.ru/ 8. https://lumi42.ru 9. https://aitalon.ru/aigate/ 10. https://strazhai.ru/llm-firewall 11. https://hivetrace.ru/ 12. https://inno-dev.ru/ai-drНе гардрейлы
1. https://guardora.ru/ 2. https://www.gaz-is.ru/produkty/zashchita-it-infrastrukturi/efros-do 3. https://dmask.ru/ 4. https://appsec-genai.ru/ 5. https://airedteam.ru/
