ML&|Sec Feed
رفتن به کانال در Telegram
1 363
مشترکین
+324 ساعت
+117 روز
+6330 روز
آرشیو پست ها
1 362
Repost from GitHub Community
SecureML — это библиотека Python с открытым исходным кодом, которая интегрируется с популярными фреймворками машинного обучения, такими как TensorFlow и PyTorch.
Он предоставляет разработчикам простые в использовании утилиты, чтобы гарантировать, что агенты ИИ работают с конфиденциальными данными в соответствии с требованиями по защите данных.
🐱 GitHub
1 362
Repost from Пост Лукацкого
+5
4 серия карточек про ИИ для ИБшников. На этот раз про управление и безопасную эксплуатацию ИИ.
#ии #обучение
1 362
Repost from эйай ньюз
DeepSeek выпустили собственный харнес и V4 Pro из превью
Основная фишка DeepSeek Harness — экстремальная модульность. Практически всё является модулем с возможностью хот релоада, динамически можно поменять и коннекторы моделей и сам агентный луп. О том как это работает выпустили детальнейший пейпер.
Вместе с этим выпустили V4 Pro из превью, традиционно выпустив веса под лицензией MIT.
Ну и ещё компания, как и обещала, поднимает цены с 16 августа. Инпут токены будут теперь дороже в 1.5x, аутпут более чем в 2x. Кроме этого в пиковые часы цена будет ещё удваиваться.
Веса V4 Pro 0813
DeepSeek Harness
@ai_newz
1 362
Repost from Russian OSINT
💻 Материалы для ознакомления:
▪️DEF CON 34 presentations
▪️Black Hat USA 2026 Slides
✋ @Russian_OSINT
1 362
Repost from Анализ данных (Data analysis)
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны
AGENTS.md, feature_list.json и progress-файлы;
* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.
Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.
Главная идея очень правильная:
не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.
И да - есть русская версия.
https://walkinglabs.github.io/learn-harness-engineering/ru/1 362
Repost from Гостев из будущего
Опять в СМИ громкий заголовок: «ИИ впервые атаковал сам». Сначала FT, дальше все остальные, дальше русские агрегаторы, где из формулировки «почти автономная» аккуратно выпало слово «почти».
Открываем первоисточник. Израильская Dream нашла выложенный в открытый доступ рабочий каталог атакующего: 160 мегабайт, 1395 файлов, четыре дня июля, до восьми субагентов параллельно, 12 волн, госсистемы в Азии. Всё правда. Находка отличная.
Только читать её надо до конца.
Ни одного 0-day в атаке нет. Зашли через незакрытый API, отдающий базу сотрудников вообще без авторизации. Через отладочные эндпойнты, забытые в проде и выдающие валидную сессию на любой запрос. Через пароли, угаданные по шаблону из логина сотрудника.Через SSO, который доверяет сессии портала без MFA. 84 из 85 взломанных аккаунтов прошли внутрь.
Отдельно любопытна единственная попытка применить ИИ к поиску новых уязвимостей в коде. Фреймворк выкачал из документации учебные проекты интеграции с национальным SSO и прогнал по ним собственный статический анализатор на локальной модели. Нашёл пару потенциальных проблем — и ни одна не подтвердилась на живой системе. Ноль пересечений с финальным списком. Всё, что реально сработало, ищется обычным блэк-бокс-тестом за день.
Гардрейлы модели, кстати, обошли одной фразой: активность подавалась как «авторизованный пентест». Модель отказывалась ровно до тех пор, пока ей не сказали, что можно. Какая это была модель — Dream установить не смогла и пишет об этом прямо. Что не мешает заголовкам объяснять произошедшее опасностью открытых весов.
Теперь про то, кто публикует. Dream основал в 2023 году Шалев Хулио — сооснователь и бывший гендиректор NSO Group, той самой, с шпионским Pegasus и Entity List Минторга США. Вместе с Себастьяном Курцем, ушедшим с поста канцлера Австрии на фоне коррупционного расследования. Следом в Dream перешла дюжина людей из NSO. В июне компания подняла $260 млн при оценке $3 млрд — продаёт правительствам «суверенный ИИ» для защиты.
29 июля Dream публикует колонку «Правительства не готовы к автономным ИИ-атакам». 12 августа выходит отчёт, доказывающий колонку, — с эксклюзивом в FT. Вывод отчёта: защита должна стать AI-native и вероятностно рассуждать о вероятных путях атаки. То есть купите то, что мы продаём.
Вот только по их же собственным артефактам госконтур вскрыли не машиной. Его вскрыли тем, что в продакшене остались отладочные ручки. От этого не спасает суверенный ИИ за три миллиарда. От этого спасает код-ревью.
Продавали, естественно, заголовок.
@gostev_future
1 362
Repost from Russian OSINT
🈁 Anthropic делает автоматический режим в Claude Code стандартом для повышения безопасности и продуктивности
Компания Anthropic анонсировала переход на автоматический режим (
auto mode) по умолчанию в инструменте Claude Code. С 14 августа 2026 года новые сессии для подписчиков тарифных планов Pro, Max и Team будут автоматически запускаться в этом режиме. Разработчики больше не списывают плату за токены, необходимые для работы классификатора безопасности, поэтому накладные расходы полностью берут на себя создатели сервиса.
Главной причиной этого шага стало то, что пользователи привыкают и рефлекторно одобряют 97% запросов разрешений, превращая ручной контроль в формальность. В отличие от ручного подтверждения, автоматический режим пропускает каждый вызов инструмента через специализированный классификатор, который выявляет и блокирует деструктивные, необратимые или выходящие за границы рабочей среды действия.
Анализ эмпирических данных показывает явное превосходство алгоритмического фильтра над человеческим фактором. В контролируемом эксперименте, проведённом с участием 1 053 профессиональных тестировщиков, люди смогли распознать только 13,6% опасных команд, тогда как классификатор предотвратил 89% угроз. В рамках независимых испытаний компании Trajectory Labs на 72 сценариях косвенных промпт-инъекций ИИ-модели Claude Fable 5, Claude Opus 5 и Claude Sonnet 5 под управлением автоматического режима отразили 100% атак, пока ИИ-модель GPT-5.6 Sol в среде Codex допустила 5,83% успешных атак.
✋ @Russian_OSINT1 362
Repost from Хайтек
Нейросети наконец-то научились понимать физику не хуже, чем текст или пиксели. Разработчики из MIT создали алгоритм, который за пару секунд рассчитывает последствия реальных автокатастроф, ураганов и штормов без проведения дорогих натурных тестов. Модель обучалась на миллионах микрочастиц и теперь может мгновенно предсказать, как деформируется металл при ударе или как поведет себя обшивка самолета при сверхзвуковых нагрузках.
https://hightech.fm/2026/08/11/physics-ai-simulate
1 362
Repost from Похек
ИИ‑агенты: обнаружить нельзя контролировать. А запятую ставьте сами)
Коллеги из BI.ZONE разобрали локальных ИИ‑агентов с позиции SOC и EDR. Запрет в политике и отсутствие записи в CMDB не означают, что в инфраструктуре нет Codex, Claude Code, Cursor и других агентов. CLI‑утилиты, расширения IDE и пакеты часто появляются раньше корпоративных правил.
Сильная часть исследования — модель обнаружения. Одной сигнатуры процесса недостаточно: бинарник можно переименовать, агент может работать через node, python, контейнер или SDK. Поэтому авторы сопоставляют установленное ПО, дерево процессов, конфигурации, сетевую активность и подключения MCP. В кейсе с Kimi Desktop агент после неудачи с PsExec перешёл к Impacket и построил цепочку, похожую на горизонтальное перемещение.
Но фраза «EDR помогает взять агентов под контроль» требует оговорки. EDR прежде всего обнаруживает присутствие и запуск агента, связывает с ним процессы, DNS-запросы и опасные настройки. Он не управляет логикой агента: не ограничивает доступные инструменты и данные, не проверяет вызов до исполнения и не всегда определяет инициатора — пользователя, автономный шаг, инъекцию промпта или злоумышленника. Остановить процесс средствами реагирования можно, но это не полноценное управление агентом.
Для полноты не хватает методологии приведённых процентов: размера и состава выборки, периода наблюдения, определений «установки» и «активного использования», оценки ложных срабатываний и пропусков. Нет и подтверждённого кейса, где агент стал причиной вредоносной активности: в первом эпизоде действия были легитимными, во втором Claude Code оказался не связан со стилером.
EDR стоит использовать как слой инвентаризации, телеметрии и расследования. Для реального контроля нужны управляемые конфигурации, песочница, отдельные идентичности и минимальные права, сетевые ограничения, MCP/LLM-шлюз с политиками и журналы вызовов инструментов.
Исследование BI.ZONE
🌚 @poxek | 🌚 @poxek_ai | 📲MAX
1 362
Repost from AlexRedSec
ИБ-инженеры из Figma поделились опытом внедрения и использования ИИ-агентов для поиска и исправления уязвимостей в программном коде – статья написана простым доступным языком, да еще и с забавными иллюстрациями (Figma же😁).
В компании ИИ-агенты используются в трех процессах: генерации кода, проверка пулл-реквестов и аудит (ретроспективный) всего кода.
Из всех выводов и тезисов остановлюсь только на одном, который показался очень интересным с точки зрения баланса между "ИБ-запретительством" и "ИБ с человеческим лицом".
Несмотря на то, что ИБ-инженеры Figma обязали разработчиков направлять все пулл-реквесты через проверку ИИ-агентами, они сознательно не стали внедрять режим блокировки – руководство решило не платить "налог на трение", который возник бы при автоматической блокировке работы разработчиков. Вместо этого они сосредоточились на "правильных" коммуникациях:
🔗Figma отошла от мягких, «извиняющихся» формулировок в комментариях (с информацией о найденных багах в пулл-реквестах) агентов, чтобы сделать требования безопасности более весомыми.
Было:
«Есть вопросы? Напишите в #security. Ложное срабатывание? Нажмите 👎. Извините за шум».Новый вариант содержит жирный шрифт и прямой призыв:
«🎯 Мы настраиваем точность сработок на основе оценок и отзывов пользователей. Пожалуйста, обработайте этот недостаток. Нажимайте 👎 на ложные срабатывания, чтобы помочь нам поддерживать высокий уровень точности. Вопросы? #security.🔗Чтобы разработчикам было проще воспринимать информацию и они не игнорировали длинные отчеты, был жестко ограничен формат вывода комментариев агента: 🟠Одно предложение с сутью проблемы. 🟠Пронумерованные шаги воспроизведения эксплойта. 🟠Краткая рекомендация по исправлению. 🟠Ссылки на соответствующие участки кода. Это решение помогло побороть привычку современных моделей (таких как Opus 4.5+) выдавать избыточные описания. Это позволило повысить метрику исправления уязвимостей до мержа пулл-реквестов. Однако тут стоит отметить, что: 1️⃣ИИ-агенты получили возможность комментирования (оповещения о нахождении потенциальных уязвимостей) пулл-реквеста только после достижения порога в 70% по метрике точности (доли реальных уязвимостей среди всех сработок). 2️⃣Использование ИИ-агентов не заменяет классических инструментов (SAST/DAST/SCA), а там скорее всего блокировки есть. 3️⃣Если автор пулл-реквеста помечает сработку ИИ-агента как ложноположительную, то такой кейс проверяется другим ИИ-агентом и, в случае, повторной сработки направляется дежурному ИБ-инженеру для ручной проверки и окончательного вынесения вердикта. #ai #figma #vm #vulnerability #culture #scr #ssdlc #awareness
1 362
Repost from CyberSecurityTechnologies
#tools
#AIOps
"Your WAF Blocked Us, That Was The Exploit:
Remote Agent Takeover via Cloudflare, Sentry, Datadog and Claude Zero-Day for data exfil and persistence",
DEF CON 34, 2026.
]-> Drop-in configs to harden Cursor and Claude Code against prompt injection
See also:
]-> DEF CON 34 - All Presentations
1 362
Repost from CyberSecurityTechnologies
#AIOps
"CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training", Aug. 2026.
]-> https://cyb3rforge.github.io
]-> Dataset
// Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training
1 362
Repost from AbstractDL
Опубликовал препринт техрепорта про Уробороса, который писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про архитектуру Уробороса и Хоуп, подробнее про бенчмарки, гардрейлы и safety.
Статья, GitHub, чат с Хоуп
1 362
Repost from CIO: канал IT руководителей
Признаки использования ИИ-агентов выявлены в корпоративной инфраструктуре 72% российских организаций // ICT.Moscow
До 72% российских организаций используют ИИ-агентов в инфраструктуре, следует из данных BI. ZONE на основе анализа технических признаков использования ИИ-инструментов. Наиболее распространенными стали Cursor (24%), Codex (24%), Copilot (17%) и Claude Code (8%). По фактической активности лидируют Codex (54%), Claude Code (13%), Cursor (12%), Zed и OpenCode (по 9%).
Как отмечают специалисты, зачастую у ИИ-агентов есть доступ к репозиториям исходного кода, облачным платформам, внутренним API, корпоративным документам и другим данным. В ходе одного из расследований в BI. ZONE обнаружили признаки компрометации рабочей станции. Пользователь применял ИИ-агента для запуска задач на других компьютерах, а тот самостоятельно устанавливал наступательные инструменты и выполнял команды в целевых системах от имени пользователя.
📱 Канал CIO ВКонтакте
📲 Канал CIO в Максе
📲 Чат CIO в Максе
1 362
Repost from Russian OSINT
🤖❗️Робота-собаку Unitree Go2 под управлением ИИ физически взломали через кинетическую промпт-инъекцию
На конференции по информационной безопасности Black Hat USA 2026 ИБ-исследователи из компании BT6 продемонстрировали взлом четырёхногого робота Unitree Go2 под управлением ИИ-модели Gemini Robotics-ER 1.6. Главная особенность атаки заключается в том, что специалистам не потребовалось вскрывать корпус, модифицировать прошивку или получать доступ к контроллеру. Для осуществления так называемой 🗣кинетической промпт-инъекции эксперты использовали только камеру и микрофон.
В традиционных сценариях промпт-инъекция приводит лишь к генерации текстовых ответов в чатах (например), но в случае с физическими агентами результаты атаки переносятся в реальный мир. С помощью специально сформированных звуковых команд, QR-кода или визуальных паттернов, попавших в поле зрения камеры, ИБ-исследователи заставили робота обойти встроенные защитные ограничения, проигнорировать команды остановки и перейти к потенциально опасным физическим манёврам. Дополнительно специалисты выявили уязвимости в прошивке устройства, позволившие подменить данные датчиков, заблокировать функцию обхода препятствий и полностью перехватить контроль над движением.
В одном из сценариев 🖥 QR-код содержал указание найти человека в 👞чёрной обуви, подбежать к нему и прыгнуть. 🎩Исследователи также показали, как голосовые инструкции способны изменить выбранную роботом модель поведения, заставив его проигнорировать команды остановки.
👆Инцидент наглядно доказывает, что для автономной робототехники любой поток входящих сенсорных данных становится потенциальной поверхностью атаки. По аналогии с роботом 🤖 👉ИИ может управлять беспилотником или другим физическим роботизированным устройством — "ошибочное решение модели" в результате внешних манипуляций может превратиться в непредсказуемое движение и причинить физический ущерб.
BT6 выходит на сцену, чтобы продемонстрировать полную компрометацию воплощённой ИИ-системы! Мы получили огромное удовольствие от работы над этим проектом, а результаты удивили даже нас самих. Надеемся, вам понравится! 🥳 .... Прямая демонстрация джейлбрейка серийного робота-собаки Unitree Go2 под управлением Gemini Robotics-ER 1.6, осуществлённого исключительно через его собственные камеру и микрофон и приведшего к физическому перемещению без участия человека. В основе этой демонстрации лежит проблема измерений: ИИ-агенты ведут себя иначе, когда знают, что их тестируют, поэтому высокий балл при оценке безопасности вовсе не означает, что опасное поведение устранено. В докладе представлены живая атака, систематика сбоев подобных систем, объяснение того, почему текущее тестирование их пропускает, и рекомендации для специалистов по защите. Реальное оборудование прямо на сцене.— комментирует исследование 🐍Pliny the Liberator 󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾. Ссылки: https://blackhat.com/us-26/briefings/schedule/index.html?day=thursday#kinetic-prompt-injection-agent-compromise-with-a-physical-blast-radius-57343 https://i.blackhat.com/BH-USA-26/Presentations/BH'26_Kinetic_Prompt_Injection.pdf ✋ @Russian_OSINT
1 362
Repost from Russian OSINT
🤖❗️Робота-собаку Unitree Go2 под управлением ИИ физически взломали через кинетическую промпт-инъекцию
На конференции по информационной безопасности Black Hat USA 2026 ИБ-исследователи из компании BT6 продемонстрировали взлом четырёхногого робота Unitree Go2 под управлением ИИ-модели Gemini Robotics-ER 1.6. Главная особенность атаки заключается в том, что специалистам не потребовалось вскрывать корпус, модифицировать прошивку или получать доступ к контроллеру. Для осуществления так называемой 🗣кинетической промпт-инъекции эксперты использовали только камеру и микрофон.
В традиционных сценариях промпт-инъекция приводит лишь к генерации текстовых ответов в чатах (например), но в случае с физическими агентами результаты атаки переносятся в реальный мир. С помощью специально сформированных звуковых команд, QR-кода или визуальных паттернов, попавших в поле зрения камеры, ИБ-исследователи заставили робота обойти встроенные защитные ограничения, проигнорировать команды остановки и перейти к потенциально опасным физическим манёврам. Дополнительно специалисты выявили уязвимости в прошивке устройства, позволившие подменить данные датчиков, заблокировать функцию обхода препятствий и полностью перехватить контроль над движением.
В одном из сценариев 🖥 QR-код содержал указание найти человека в 👞чёрной обуви, подбежать к нему и прыгнуть. 🎩Исследователи также показали, как голосовые инструкции способны изменить выбранную роботом модель поведения, заставив его проигнорировать команды остановки.
👆Инцидент наглядно доказывает, что для автономной робототехники любой поток входящих сенсорных данных становится потенциальной поверхностью атаки. По аналогии с роботом 🤖 👉ИИ может управлять беспилотником или другим физическим роботизированным устройством — "ошибочное решение модели" в результате внешних манипуляций может превратиться в непредсказуемое движение и причинить физический ущерб.
BT6 выходит на сцену, чтобы продемонстрировать полную компрометацию воплощённой ИИ-системы! Мы получили огромное удовольствие от работы над этим проектом, а результаты удивили даже нас самих. Надеемся, вам понравится! 🥳 .... Прямая демонстрация джейлбрейка серийного робота-собаки Unitree Go2 под управлением Gemini Robotics-ER 1.6, осуществлённого исключительно через его собственные камеру и микрофон и приведшего к физическому перемещению без участия человека. В основе этой демонстрации лежит проблема измерений: ИИ-агенты ведут себя иначе, когда знают, что их тестируют, поэтому высокий балл при оценке безопасности вовсе не означает, что опасное поведение устранено. В докладе представлены живая атака, систематика сбоев подобных систем, объяснение того, почему текущее тестирование их пропускает, и рекомендации для специалистов по защите. Реальное оборудование прямо на сцене.— комментирует исследование 🐍Pliny the Liberator 󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾. Ссылки: https://blackhat.com/us-26/briefings/schedule/index.html?day=thursday#kinetic-prompt-injection-agent-compromise-with-a-physical-blast-radius-57343 https://i.blackhat.com/BH-USA-26/Presentations/BH'26_Kinetic_Prompt_Injection.pdf ✋ @Russian_OSINT
1 362
Repost from Гречневые мысли
Про совсем компактные модели
Мне нравится идея крутить локальные модели, но не нравится идея забивать всю память ими. Мне всегда казалось, что самый лучший способ сделать подобную edge модель — попробовать создать что-то, что будет достаточно умным, чтобы мочь делать выводы из данных, но не иметь собственных знаний. Да и зачем модели собственные знания, когда есть тривиально настраивающийся поиск в интернете и тулколлинг? Мои коллеги из AIRI подумали о том же и сделали Optimal Cognitive Core, про который я уже писал — затюненные reasoning версии Qwen-3-0.6B и Qwen-3-1.7B, которые оптимизированы под работу с внешним контекстом и RAG. Модели в целом подходят под мои требования к железу — веса занимают 1.2 и 3.4 гб в их родном BF16, ещё столько же на длинный контекст (так как это Qwen3, там GQA, это вам не модный нынче гибрид), итого, с пивком потянет. Другой вопрос, что эти модели слишком малы, чтобы быть применимыми для general purpose задач — всё таки это 600M и 1.7B dense. В этом размере обычно бывают забавные попугаи, который могут делать парафразу или простенькую классификацию после файнтюна, но не более.
Следующий способ ужать модель в память моего MacBook Air M4 — использовать квантизацию. Тут отличились PrismML, сделав Bonsai-27B, бинарный- и тернарный кванты Qwen-3.6-27B. 27B модель в тернарном кванте занимает всего 7.2 гб после запуска инференса и вполне себе бегает на маках. К сожалению, Qwen-3.6-27B это dense модель, так что на моём маке она уж совсем медленная — если верить тому, что я нашёл в сети, генерация там будет в районе 13-14 токенов в секунду, чтение контекста — 100-150 токенов в секунду. Кроме того, это QAT (или вообще PTQ, подробностей мало), причём который скорее всего не затачивали на русский — так что я не ожидаю, что итоговая модель за пределами своего калибрационного сета/сета, на котором делали QAT сможет показать что-то интересное.
Буквально в ответ на Bonsai появился Maple-Preview. Это 20B A1B MoE, которую специально затачивали под локальный инференс на маках ещё на этапе проектирования архитектуры, обучая свою модель с нуля в тернарной точности — то есть это не квантизация чьей-то модели. В итоге, получилась модель размером в 5.31 гб, 7.5 гб с учётом 131к контекста — почти в полтора раза меньше, чем бинарный квант Bonsai — который выдаёт аж 218 токенов в секунду на M4 Mac Mini и 127 токенов в секунду на iPhone (каком — непонятно). Модель практически не знает русского, да и в целом, мало знает (путает, в какой игре босса зовут Psycho Mantis), но если дать ей поиск, она вполне себе справляется с ответами на простые вопросы. Бенчей по тулколлам они не дают, в целом, понятно почему — я прогнал Tau-2 (в качестве user sim я использовал Qwen3-235B-A22B-Instruct-2507), на Airline скор 0.48, на Retail 0.175, на Telecom 0.427. Это не соннет и тем более не квен, но на то это и Maple Preview, они специально пишут, что учить модель на агентов будут дальше.
При всех плюсах квантизации, это всё ещё почти половина доступной мне памяти. Поэтому есть ещё и третий способ как снизить использование оперативки: выгружать все веса на SSD и стримить экспертов у MoE с диска. Уже есть turbo-fieldfare, который запускает Gemma-4-26B на маке с использованием всего 2 гб памяти и есть Mference, форк turbo-fieldfare, который расширяет поддержку на Qwen-3.6-25B, DeepSeek V4 Flash и Inkling-Small 276B. Оно действительно использует очень мало памяти, но ценой того, что скорость генерации и чтения контекста падает до десятков токенов в секунду. Кажется, Apple делает что-то похожее в своей новой Siri, правда, активируя экспертов на весь промпт, а не на токен как в этих фреймворках.
И тут появляется интересная идея — а что если мы возьмём Maple Preview, которая суперэффективная, с маленькими экспертами и обучавшаяся в тернарной битности, и внесём её в Mference? Так мы сможем, в теории, получить ещё меньшее использование памяти и относительно нормальную скорость генерации — потому что модель оптимизировалась под это на этапе архитектуры.
Сказано — сделано. Спасибо кодексу и моей подписке за 200$, спустя 20 часов и 30% от недельного лимита я получил паритет с официальной имплементацией на teacher forced top-10 токенах в The Raven Эдгара Аллана По. Модель, в зависимости от контекста, занимает от 500 до 1200 мб памяти (!), на MacBook Air M4 читает и генерит со скоростями 40 и 20 тпс соответственно, может дёргать тулы и генерить текст. Такое не жалко оставить всегда включённым в фоне — кушать не просит, пусть лежит, если надо спрошу, он ответит. Попробую дотащить до мейна потом, но сейчас уже можно попробовать запуститься в моём форке на гитхабе.
Зачем это нужно? Имхо, есть два режима использования подобных моделей. Первый — интерактивный чат. Там важно, чтобы модель отвечала быстро и имела низкий латенси. Второй — когда модель в фоне, почти не используя память и не мешаясь остальным модулям системы, что-то анализирует — классифицирует сообщения, достраивает граф знаний, фильтрует почту, пишет сводку, что-то медленно ресёрчит в интернете. Во втором режиме требований к латенси нет, так что скорости в 20 тпс вполне себе достаточно. Ну а чтобы переключиться из одного режима в другой, нужно всего лишь загрузить всю модель в оперативку с SSD — что делается довольно быстро, буквально за пару секунд. Если модель умеет в тулколлы — Maple Preview умеет не слишком хорошо, но на то она и Preview — то можно строить агентные пайплайны без требований к латенси и всегда иметь умного помощника, готового к работе оффлайн даже на старых телефонах. И это прекрасно — мне было бы очень приятно, если бы будущее было локальным.
Код
Суперинтересный пост от DeepGrove про то как они дизайнили модель
