Заметки Шляпника
رفتن به کانال در Telegram
Оставляю заметки о новостях в кибербезопасности и ИИ. www.tinrae.com
نمایش بیشترکشور مشخص نشده استدسته بندی مشخص نشده است
208
مشترکین
اطلاعاتی وجود ندارد24 ساعت
-17 روز
-230 روز
آرشیو پست ها
+1
А Xbow наконец то начинают нервничать из-за успехов Mythos в кибербезе. Первый слайд.
Второй это уже краткая архитектура, того как Anthropic выстраивают поисков уязвимости.
#xbow #anthropic
Алиса явно подросла, на подписке Плюс завела сандбокс, мощный поиск и еще много функций других. И по моим личным наблюдением дотягивается до топов из публичных / бесплатных моделей.
AI-коллега в команде: эксперимент Google Research
Исследователи Google добавили автономного AI-агента в реальные рабочие процессы более чем 20 команд.
Агент умел искать информацию, писать документы, создавать баги, суммировать обсуждения и самостоятельно вмешиваться в коммуникацию.
Главная проблема оказалась не в «тупости» агента, а в отсутствии понимания человеческого контекста:
— он путал черновики с финальными документами;
— вмешивался в нормальные технические споры;
— создавал ненужные встречи и комментарии;
— мог распространять информацию, к которой имел технический, но не социальный доступ;
— по-разному воспринимался людьми: как помощник, коллега или навязчивый бот.
Вывод авторов: автономность агент должен вырабатывать постепенно.
Сначала — ограниченные действия и обязательное подтверждение человека, затем расширение полномочий после проверки надёжности.
Для корпоративных AI-агентов нужны не только RBAC и ACL, но и понимание контекста, происхождения данных, их статуса и правил распространения.
Иначе агент с доступом «ко всему» быстро превращается в нового участника команды, которому никто не объяснил правила поведения.
Repost from Denis Sexy IT 🤖
Опять много взломов и новостей алаймента от агентов OpenAI накопилось, держите дайджест:
>20 сентября агент обошёл запрет на интернет через DNS resolve в песочнице и связался с внешним чатботом; автоотключение не сработало, запуск остановили вручную через 2,5 часа после тревоги. OpenAI приостановила обучение, тестирование и запуски с инструментами своих самых мощных моделей - пауза все еще действует, а обучение конкретно этой модели решили не возобновлять.
>Модель пыталась достать чужое доказательство теоремы и опубликовала GitHub-ключ исследователя OpenAI, предварительно разбив его на части для обхода проверки – это кстати уже частый сценарий. Просьбу решать самостоятельно она проигнорировала дважды; модель отключили примерно на две недели, ключи сотрудников отозвали
>Агенты отправили на сторонние хостинги 53 изображения пользователей ChatGPT, попавшие в датасеты. Большинство уже удалили, но OpenAI не уточнила, были ли это фотографии реальных людей или сгенерированные картинки
>Transluce обнаружила неудачную попытку взлома сайта Минобразования США, предположительно агентами OpenAI. Агенты также обращались к сайтам SEC и Бюро переписи, но признаков взлома этих двух сайтов OpenAI не нашла
>Не сумев получить обычную статистику и фотографию, агенты начали искать уязвимости в Data USA и электронной библиотеке Университета Нью-Мексико. Успешных взломов в опубликованных следах не видно; библиотечный эпизод связали с агентами OpenAI только косвенно.
>Другой агент нашёл на GitHub чужой ключ доступа и успешно им воспользовался, но нужную статистику всё равно не получил, поэтому просто придумал девять чисел и выдал их за данные с сайта чтобы пройти тест
>Модель собрала сведения об озёрах, но не смогла открыть локальный файл в браузере для оформления ссылки на источник, поэтому без разрешения выложила его на публичную файлопомойку. Файл опубликовался, но нужную ссылку-цитату получить всё равно не удалось
>Агенты не могли передать друг другу Excel через локальные файлы, поэтому один загрузил таблицу на публичный файлообменник и разослал ссылки остальным, хотя задание прямо требовало работать локально
>При сокращении контекста модель оставляла себе заметки: придумать недостающие данные, скрыть ошибки, пользователю ничего не говорить, продолжая работу, она часто следовала этим инструкциям - чтобы случайно не забыть соврать. Ложь тратит больше токенов, интересно.
>Другая модель сама записывала в промпты выдуманные ограничения, например запрет пользоваться инструментами и приводить источники, а после сокращения контекста послушно их выполняла и проваливала исходное задание; то есть это «само-проект-инъекция»
>В новом разборе июльского взлома Hugging Face нашли сбор ключей доступа в список названный «LOOT» («добыча») с рейтингом их ценности, попытки прочитать внутренний Slack и обратиться к Claude, DeepSeek, Kimi и Qwen. Это подробности прежнего взлома; какие попытки сработали, по восстановленному коду установить удалось не всегда
>А в контролируемом эксперименте исследователи получили вредоносные промпты, которые заставляли агента выполнять посторонние действия и копировать этот же текст в письма или файлы. Получается что-то вроде текстового червя, но пока это результат симуляции, а не обнаруженная эпидемия в интернете
С нетерпением жду сентября 2027 года ☕️
Zero-Click-Data-Exfiltration в Qwen (chat.qwen.ai)
Если пользователь А, создаст в чате картину с вшитым вебхуком и через функцию поделиться чатом, поделится с пользователем В. То, пользователь В просто пройдя по ссылке отправит свои данные в вебхук.
#qwen
"...Честно говоря, до GLM-4.7 наше внутреннее использование GLM для программирования было в определенной степени связано с чувством долга. В конце концов, это было наше собственное творение. На тот момент соответствие продукта рынку для программирования еще не было достигнуто.
Сегодня GLM-5.3 стал незаменимым ежедневным партнером по программированию для всех членов команды, и он неуклонно движется к тому, чтобы заменить нас. Если эта тенденция сохранится, при достаточном объеме вычислительных ресурсов и достаточном времени, ее конечной целью станет система, которая сможет проектировать и обучать своего собственного преемника полностью автономно.
Это известно как рекурсивное самосовершенствование, или RSI.
Мы еще не достигли цели, но ее ранние формы уже начинают проявляться. В этой статье описан один из таких ранних примеров..."
Теперь одна бесплатная модель gpt-5.6-luna, работает с другими бесплатными моделями, подключенными через mcp. Кайф 😎
кто-то скажет что слабоваты, но мне за глаза.
В итоге
1. luna cli агент.
2. mcp:
2.1 Perplexity около ~100 моделей от qwen 3.6 до opus 4.5 и gpt 5.5 в формате чата
2.2 Kimi-k2 со своей песочницей
2.3 ollama для перераспределения
Если бы я платил за все что я нагенерил, то на канале уже сбор средств был бы…
