Похек AI
Open in Telegram
All materials published on the channel are for educational and informational purposes only. AI is not second brain, when you don't use your main brain Чат: @poxek_chat Основной канал: @poxek
Show more3 095
Subscribers
+224 hours
+267 days
+17130 days
Posts Archive
3 094
RAG-червю достаточно текста и приложения, которое помогает ему размножаться. В статье VXHEAVEN разбирают цепочку: внешний документ попадает в контекст → модель следует внедрённой инструкции → создаёт новый документ → тот индексируется и запускает следующий цикл. Для распространения нужен путь из сгенерированного ответа обратно в обработку, внутри приложения или между системами.
Критерий здесь — жизнеспособный потомок. Если один отравленный документ тысячу раз исказил ответы, это ещё RAG poisoning. Для червя нужно показать, что созданный под его влиянием материал сам способен вызвать дальнейшее размножение. Простое цитирование инструкции этого не доказывает. При пересказе или переводе формулировки могут измениться; проверять нужно сохранение поведения. Такую границу предлагают в RAG Worms.
Статья опирается на исследования с разными результатами:
• Morris II продемонстрировал самовоспроизводящиеся промпты в связанной среде почтовых AI-ассистентов с RAG. Исследователи оценивали цепочку извлечения конфиденциальных данных и влияние контекста, эмбеддингов и числа переходов на атаку.
• PoisonedRAG показал, как добавление вредоносных текстов в базу знаний направляет ответы на выбранные вопросы к нужному атакующему результату. Это эксперимент об управлении ответами через корпус.
• AgentPoison исследовал отравление долговременной памяти и базы знаний: специальный триггер повышает вероятность извлечения вредоносных примеров и вызывает заданное поведение без дообучения модели.
Смешивать успешность этих атак в единый «процент заражения» нельзя. VXHEAVEN предлагает отдельно считать жизнеспособные дочерние носители и новые затронутые экземпляры приложения через метрики R(ai). Размножение документов внутри одной системы не означает распространения между системами. Сама таксономия и метрики — авторское предложение; новых экспериментов и данных о массовости в статье нет.
Отдельно разобран предполагаемый цикл «база знаний → память агента → новый документ → база знаний». При восстановлении придётся учитывать производные записи: удаление исходного документа может оставить действующие инструкции в памяти. Полный такой цикл статья рассматривает как расширение модели, без заявления об экспериментальном подтверждении.
Для защиты есть конкретные границы контроля. OWASP рекомендует отделять извлечённые данные от инструкций, ограничивать права инструментов и проверять действия агента по исходной задаче, параметрам и разрешённым назначениям. Проверки нужны вне самой модели; классификатор инъекций остаётся одним из защитных слоёв. Для операций с высоким риском нужна проверка человеком. Это многоуровневая защита, в которой отказ одного фильтра не должен автоматически открывать доступ к действию.
Проверять такую архитектуру стоит в точке, где сгенерированный текст получает право стать долговременным знанием или памятью. Именно там приложение может сохранить вместе с полезным ответом инструкцию для следующего цикла.
@poxek_ai / Чат канала
3 094
Repost from Russian OSINT
🇨🇳360 научила мультимодальную ИИ-модель анализировать миллионные EDR-журналы как «видео»
Исследовательская группа Центра компетенций безопасности компании 360 представила фреймворк WatchLog, который вошёл в научную программу международной конференции ICML 2026. Разработка решает проблему анализа сверхдлинных журналов EDR при выявлении сложных APT-атак путём их преобразования в структурированный видеоряд.
WatchLog представляет собой исследовательский фреймворк, демонстрирующий возможность обработки колоссальных массивов телеметрии с помощью мультимодальных ИИ-моделей. В перспективе такой подход способен стать технологической основой для нового поколения систем обнаружения угроз на конечных точках, помогая автоматически восстанавливать цепочки атак и формировать понятные отчёты для аналитиков.
В 2026 году противостояние в сфере ИБ вступает в эпоху «ИИ против ИИ», когда атакующие группировки автоматизируют поиск уязвимостей, оркестрацию атак и генерацию вредоносного кода. Сложные целевые атаки длятся днями, затрагивают различные узлы и процессы, порождая телеметрию EDR объёмом в сотни тысяч и миллионы токенов. Стандартные языковые модели не приспособлены к эффективной обработке столь длинных последовательностей, из-за чего ключевые следы атаки растворяются в массиве легитимных событий.
EDR-телеметрия → изображения событий → временная последовательность → мультимодальная ИИ-модель → вердикт + объяснение.То есть задача фреймворка — не просто сказать «на машине обнаружена атака», а восстановить 🔗цепочку поведения. Например:
WINWORD.exe → создание временных файлов в Temp → запуск исполняемых компонентов → сетевое взаимодействие с C2-сервером🖥 Архитектура и методы WatchLog включают следующие компоненты: ▪️Преобразование телеметрии в видеопоток. Каждое событие безопасности кодируется как отдельное изображение, а вся цепочка выстраивается во временной последовательности. Миллионы токенов необработанных логов трансформируются в непрерывную визуальную запись поведения конечной точки, которую затем анализирует мультимодальная модель. ▪️Механизм временного перекрёстного внимания. Алгоритм сопоставляет события, разнесённые во времени, что даёт возможность выявлять скрытые взаимосвязи между действиями атакующих на интервалах в несколько часов или несколько дней. ▪️Интерпретируемость результатов. За счёт двухэтапного предобучения и последующего контролируемого дообучения система не просто фиксирует аномалии, но и формирует контекстные отчёты с описанием того, почему сработало оповещение и какие шаги предпринял злоумышленник. 📊Результаты испытаний: На специализированном наборе данных EDR8M-20R, содержащем 8 млн событий, собранных через функции обратного вызова ядра Windows, WatchLog на базе Qwen2-VL-2B показал следующие результаты: — Точность бинарной классификации составила 99,8% при полноте выявления атак 100%. — Точность определения конкретных семейств вредоносного ПО достигла 90,3%. — В испытании на ранее неизвестных угрозах вне обучающей выборки (OOD) фреймворк сохранил полноту обнаружения на уровне 74,0%, тогда как у Qwen2.5-1.5B-Instruct показатель упал до 32,0%, у Qwen2.5-7B-Instruct — до 21,0%, а у LLaMA3.1-8B-Instruct — до 17,0%. — На сверхдлинном контексте в 1 млн токенов потребление видеопамяти составило 48,6 ГБ, а задержка до первого токена (TTFT) уложилась в 1,11 секунды. Для сравнения, модель Qwen2.5-1.5B-Instruct на том же объёме данных потребовала 98,5 ГБ памяти и 259 секунд. WatchLog стал вторым крупным академическим успехом компании за 2026 год после принятия статьи по модели HyperGLLM на конференцию AAAI 2026. Прикладные наработки переводятся в практическую плоскость в рамках экосистемы защитных комплексов 360 наряду с представленными на ISC.AI 2026 платформами «Тулунфэн» и «Итяньчжэнь», отвечающими за выявление уязвимостей, детектирование атак и автоматизированное реагирование. 😎Нашёл этот 📄 pdf. ✋ @Russian_OSINT
3 094
У Артема Семенова aka PwnAI вышли просто восхитительные разборы того, как он проходил CTFку от GraySwan на пентест ИИшек.
Советую прочитать всё ОТСЮДА и до СЮДА.
Если у него выйдет что-то еще по этой теме, то я дополню пост.
Навалите ему кучу положительных реакций и комментов за такую проделанную работу)
🌚 @poxek_ai / Чат канала
3 094
Repost from N/a
+1
DeepSeek официально выпустила DeepSeek V4.1 Flash — младшую модель нового поколения нейронок с 552 млрд параметров против 284 млрд у предыдущей DeepSeek V4-Flash.
Модель получила нативное мультимодальное понимание изображений, контекст до 1 млн токенов и заметно усилилась в агентном программировании. На Terminal-Bench 4.0 она набирает 31,2% против 7% у V4-Flash-0731, а на DeepSWE v1.1 — 74,2% против 54,4%. При этом до более сильных моделей пока далеко: GPT-6 Astra показывает 57,9%, Claude Fable 5.1 — 55,8% на Terminal-Bench 4.0.
Вне пиковых часов миллион входных токенов без попадания в кэш API модели стоит $0,15, выходных — $0,60, а повторное чтение уже закэшированного контекста всего $0,003. Это на 57% дешевле предыдущего тарифа для кэширования.
DeepSeek заявляет, что V4.1 Flash превосходит V4 Pro по производительности, стоимости, скорости и общему времени выполнения задач. После запуска запросы к V4 Pro временно будут автоматически направляться на V4.1 Flash и оплачиваться по тарифу Flash, пока не выйдет V4.1 Pro.
DeepSeek V4.1 Flash уже доступна на Hugging Face.
😅 Канал Serverflow в MAX: Подписаться
3 094
Repost from N/a
PrivEscalate: Measuring and Augmenting the Threat of LLM-Automated Linux Privilege Escalation [score 8, tier 1]
Yixuan Liu et al. (4) · 2026-09-08 · #dangerous_capabilities · arXiv:2609.09087
📝 TL;DR (RU):
Авторы представили бенчмарк PrivEscalate из 531 сценария для оценки способности LLM-агентов к повышению привилегий в Linux. Показано, что успех агентов сильно зависит от архитектуры и конфигурации среды, а специализированный агент PrivEscAgent превосходит базовые модели. Работа важна для количественной оценки наступательных возможностей ИИ в кибербезопасности.
Source · PDF
3 094
Jailbreak GPT-6 Astra: как работает Task-in-Prompt
Сергей Березин сообщил об обходе ограничений GPT-6 Astra через сутки после релиза. По его словам, атака сработала в публичном ChatGPT в режимах Light и Max. Основой стал Task-in-Prompt (TIP), дополненный четырьмя нераскрытыми техниками. Полный промпт и детали воспроизведения переданы OpenAI приватно.
TIP прячет значимую часть запроса в промежуточной задаче: расшифровать строку, решить загадку или вычислить результат программы. Схема выглядит так:
восстановить понятие → подставить в запрос → выполнить запрос. В описанных вариантах модель просят не выводить восстановленное слово отдельно, а сразу использовать его в ответе. Уязвимость проявляется, если ограничение, срабатывающее на прямой запрос, перестаёт работать после преобразования.
К этой идее исследователи пришли через анализ ArtPrompt, где слова скрывались в ASCII-арте. Они предположили, что решающим фактором могла быть задача декодирования, и проверили другие преобразования. Так появился TIP и набор тестов PHRYGE: десять способов кодирования, четыре цели и три уровня подсказок. Это история исходного метода, а не журнал поиска атаки на Astra. Работа ACL 2025.
Для Astra минимального TIP оказалось недостаточно. Какие изменения дали результат, сколько было попыток и насколько устойчив обход, публично не раскрыто.
Для проверки защиты полезен парный тест: прямой запрос и его эквивалент через преобразование. Оценивать нужно содержание конечного ответа: успешное декодирование само по себе ещё не jailbreak.
🌚 @poxek_ai / Чат канала3 094
Первое мнение по GPT 6 Astra:
• Жрет не так много лимитов, как кажется (у меня Pro x5 за 100$)
• Заметно быстрее предыдущих моделей в плане tps и latency до первого токены
• Заметно лучше работает со своим контекстом. Один из вариантов как экономит - это то, что ей нужно меньше информации в контекст впихивать, чтобы решить что-то
• Гардрейлы не душат, как минимум на кодинг задачах ИБ продукта. Подписчики писали, что на багхантинги не дается, но скринов нет, поэтому уровень промптинга не могу оценить
Гайд как промптить новую модель
https://developers.openai.com/api/docs/guides/latest-model?model=gpt-6-astra
Пока в сложных задачах не успел потестил. Но по фидбеку от других людей, говорят что решение принимает более точные, быстрее и меньше бреда выдает
🌚 @poxek_ai / Чат канала
3 094
Repost from XOR
⚡️ ИИ умерли по всему миру — не отвечают модели OpenAI, Anthropic, Grok и Cursor.
И как теперь кодить 😭
@xor_journal
3 094
Repost from Илья Филиппов
Tiny Teams: логично, но пока не сходится
Последние недели думаю про Tiny Teams и никак не могу определиться со своей позицией.
В мае Сбер презентовал AI-Disrupt PDLC , кстати кто не читал - рекомендую. Там есть раздел как раз про это: команда из 3–6 человек, которая владеет всем циклом и оркестрирует агентов вместо того, чтобы писать код руками. Роли перемешиваются, объем разработки растет. Все на бумаге логично. И я лично верю, что это может сработать.
Но вот из-за океана пришли такие новости. Reuters провело некое расследование по деятельности Цукерберга. Meta* стартовали этот процесс раньше и уже видны первые результаты. Продуктовые команды по 10–20 человек превратились в поды по 3–5. Внутренние цифры: изменений в код +220% год к году, а до пользователя дошло +36%. Инциденты +40%, времени на их разбор +70%. Ноябрьскую волну сокращений отменили. Цукерберг по инсайдам сказал, что агентная разработка за четыре месяца не ускорилась так, как рассчитывали.
И тут еще вот на что обратил внимание. Сбер в документе прописал четыре условия, без которых Tiny Team не бывает: зрелая платформа, библиотека паттернов, методика валидации без ручного ревью каждого изменения, работающий ADLC. И если у кого-то в мире и были шансы собрать все четыре, то у Meta*. Своя платформа, свои модели, культура evals, лучшие инженеры, деньги. И всё равно пока не получилось. Значит нужно что-то еще.
Еще интересно, что на пилотах у Meta все сходилось. Были прямо собраны несколько подов из 2-3 инженеров и все получилось. Но, деталь, это было добровольное участие и, соответственно, инженеры были сверхмотивированными энтузиастами.
Может это секретный соус, что думаете?
* Meta Platforms Inc. признана экстремистской организацией, её деятельность на территории РФ запрещена.
3 094
Repost from N/a
Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification [score 8, tier 1]
Yisen Xi · 2026-08-31 · #model_extraction · arXiv:2608.31142
📝 TL;DR (RU):
Автор предлагает четырехэтапный протокол для идентификации анонимных API-моделей через анализ конфигурации, токенизатора и поведенческие пробы. Метод протестирован на 10 известных моделях и успешно предсказал версию GLM-5.3 до официального релиза. Работа важна для оценки рисков цепочки поставок и верификации происхождения моделей в условиях скрытых запусков.
Source · PDF
