КайфКодинг
Открыть в Telegram
ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками
Больше1 043
Подписчики
Нет данных24 часа
+177 дней
+8630 дней
Архив постов
1 043
Repost from Hacker News
Google fixed more Chrome bugs in June than over the past two years, thanks to AI (Score: 155+ in 4 hours)
Link: https://readhacker.news/s/6ZHiB
Comments: https://readhacker.news/c/6ZHiB
1 043
Repost from False Positive
Всем привет! 👋
Уже завтра на внеплановой Reading Group посмотрим на архитектуру Kimi K3. Авторы модели предлагают масштабировать и пре-трейн, и test-time вычисления одновременно, а как именно: узнаем уже завтра.
Пробежимся по деталям из технического отчета:
- Kimi Delta Attention — как при миллионе токенов не словить переполнение в BF16 и почему оно требует специализированных ядер (FlashKDA);
- Stable LatentMoE — как работать с 896 экспертами, не теряя GPU в простое;
- Post-training pipeline — как 9 RL-экспертов дистиллируются в одну модель для деплоя;
А также посмотрим, как архитектурные решения диктуют инфраструктуру, чтобы создание такой модели в принципе стало возможным.
📅 Встречаемся в пятницу в 15:00 (по МСК).
Толк
#reading_group
1 043
Ваш воркфлоу может сломать чужой релиз, о котором вы не узнаете.
Человек полез в бинарник Claude Code 2.1.219 и нашёл две инструкции, адресованные конкретно Opus 5: не вызывать AgentTool и не запускать workflows без явной просьбы пользователя. Раньше такое прилетало с сервера — теперь вкомпилировано в клиент.
Больнее всего тем, кто строил скиллы вокруг сабагентов.
Вчера работало, сегодня агент вежливо делает вид, что не умеет. В чейнджлоге — ни слова.
Отсюда правило: всё, что держится на недокументированном поведении агента, считайте временным.
Не «не стройте» — стройте, но помните, что срок годности назначаете не вы.
https://www.reddit.com/r/ClaudeCode/comments/1v6y5q2/claude_code_has_a_hardcoded_instruction_telling/
1 043
https://openrouter.ai/deepseek/deepseek-v4-flash-0731 - докрутили быструю модель DeepSeek Flash - вероятно лучшая модель для Гермеса.
1 043
Леша делает феноменальную работу в Авито - делает аналитику доступной для любого пользователя. Очень классный доклад
1 043
Repost from Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб"
В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали
📔 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face
Агент загружает на Hugging Face специально собранные датасеты:
Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов
Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты
📔 11 июля – пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face
Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.
Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот
📔 12 июля – агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает
Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials
Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало.
📔 13 июля – закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37 фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14 UTC.
В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил?
Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы
Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям
Шел июль 2026 года
Все детали тут:
https://huggingface.co/blog/agent-intrusion-technical-timeline
1 043
Агент работает в человеко-минутах, а оценивает в человеко-месяцах.
Мем недели в r/ClaudeCode. Смешно, но за ним настоящая проблема: агент учился на наших тикетах и планах, поэтому унаследовал и наши оценки. Он отрабатывает фазы 1–6 за три минуты и на голубом глазу пишет, что на седьмую нужно ещё три дня.
Вред тут не в юморе. Если попросить агента составить план с оценками, он выдаст человеческий график — и вы под него подстроите свои ожидания и чужие дедлайны.
Просите план в шагах, а не в днях.
https://www.reddit.com/r/ClaudeCode/comments/1v3cy52/claude_this_project_will_take_3_months_me_you/
1 043
Год мы писали агентам правила. Теперь эти правила — балласт.
Anthropic выпустила гайд по context engineering для моделей Claude 5 и заодно призналась, что вырезала 80% системного промпта Claude Code. Логика простая: раньше модели были слабее, и мы компенсировали это списками запретов. Модели подтянулись — списки остались. Теперь они жрут контекст и сужают модели коридор.
Что поменялось конкретно:
— Запреты вроде «не пиши комментарии» больше не нужны. Модель решит сама, и решит лучше, чем ваше правило годовой давности.
— Примеры использования инструмента в промпте теперь вредят: они загоняют модель в узкое пространство поиска. Вместо примеров — выразительные параметры самого инструмента.
— Монолитный CLAUDE.md объявлен мифом. Вместо него дерево файлов, которое грузится в нужный момент.
Что сделать сегодня. Открыть CLAUDE.md и вычеркнуть каждую строку, про которую вы не можете вспомнить, какой конкретно факап она чинила. Не «звучит разумно», а именно «вот тогда сломалось, вот поэтому написал». Всё остальное — суеверие. Потом прогнать /doctor, он пройдёт по скиллам и покажет лишнее.
Неприятный вывод из всей истории: промпт-обвязка амортизируется быстрее кода. Всё, что вы написали, чтобы обойти слабость модели, превращается в мусор ровно в тот день, когда слабость починили. Значит, писать её надо так, чтобы не жалко было выбросить.
https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
А у вас сколько строк в CLAUDE.md? И сколько из них вы сможете объяснить?
1 043
Repost from Мысли Рвачева
📆 Lecture 9 — в понедельник 3 августа, 10am ET / 5pm MSK
Продолжаем курс Stanford MS&E 435. На этот раз поднимаемся на прикладной слой в неожиданной, но очень горячей области — науки о жизни.
Class #9: Applications, AI in Life Sciences
Guest speaker: Eric Kauderer-Abrams (Head of Life Sciences, Anthropic).
Как ИИ меняет разработку лекарств и биологию: где в фарме и биотехе реально возникает ценность, что уже умеют современные модели в науках о жизни и почему этот слой стека может оказаться одним из самых прибыльных. Гость руководит направлением Life Sciences в Anthropic — из первых рук про экономику AI в биомедицине.
📍 Регистрация на Luma:
https://luma.com/yqbc6uut
🎥 К просмотру — Lecture 9:
https://www.youtube.com/watch?v=nWKiJHKIZfo
📚 Доп. материалы добавлю позже.
Увидимся в понедельник! Обсуждать в чате: @rvnikita_blog_chat
#stanford #ai #eric_kauderer_abrams #anthropic #mse435
1 043
https://dl.acm.org/doi/10.1145/3797895 - Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising: An Overview and New Perspectives.
1 043
https://www.youtube.com/@CanItCode - настоящая находка - 400 подписчиков и отличный контент о том, как создавать игры в агентах.
1 043
Кто ни будь знает как сейчас пробиться до покупки подписки?
27 июня заблокировали прошлый аккаунт, сообщение о восстановлении до сих пор ревьюят. Создал новую чистую пиндосовсую почту. Завел новый аккаунт на клоде, но оплатить подписку он не дает, появилась верификация аккаунта. Знает кто ни будь как с этим бороться?
1 043
Repost from False Positive
Всем привет! 👋
В эту пятницу на очередной Reading Group поговорим про ML-инфраструктуру, а именно - про виртуализацию GPU.
В программе:
- NVIDIA Multi-Instance GPU (MIG) - как делить один GPU между несколькими задачами;
- HAMi - виртуализация GPU в Kubernetes для AI-инфраструктуры;
- MLPerf Inference Benchmark - запустим бенчмарк и разберёмся, как интерпретировать результаты.
📅 Встречаемся в пятницу в 15:00 (по МСК).
Ссылка для подключения в Толк. 👈
#reading_group #mlinfra #benchmark
1 043
Repost from AI-Driven Development. Родион Мостовой
1М контекстное окно - прорыв или фикция?
Context Arena забенчмаркали стойкость контекста для GLM 5.2 и Opus 4.8 - значит, это хороший повод нам вспомнить про контекстную инженерию.
На бенчмарке отчетливо видна существенная просадка внимательности моделей на 512к контексте: в среднем, почти в 2 раза в сравнении с 64к контекстом и примерно в 1.5 раз в сравнении с 128к контекстом - грубо говоря, для нас с вами это означает то, что на 512к контексте агент будет терять в полтора раза больше деталей, чем на при 128к заполненности. Для открытых моделей проблема потери контекста особенно актуальна, поэтому практический вывод такой, что по-хорошему, с ними стоит держать заполненность контекстного окна не выше 128к, а лучше даже меньше - ни о каком 1М, конечно, и речи не идет, там просадка будет колоссальной. Кстати, у моделей Kimi K2.6 и, тем более, Minimax M3 дела обстоят еще хуже.
Что еще? Открыв закрытых моделей на большом контексте от открытых все еще впечатляет, хоть уже и не такой драматичный - спасибо DeepSeek за DeepSeek Sparse Attention, которую в GLM-5.2 развили через IndexShare. Кстати, о GLM 5.2 - как видно, моделька действительно на удивление успешная в т. ч. на больших контекстах. Opus 4.8 идет рядышком с GPT 5.5, но последняя все равно сильнее, особенно на совсем больших контекстах. На этом месте вспоминаем интересную деталь - в Codex App по дефолту контекстное окно для GPT 5.5 все еще 256к - то есть, по сути, точность всегда остается где-то на уровне 75%+- (по MRCRv2), а благодаря превосходному алгоритму компактизации, команде Codex удается сохранить все действительно важное так, что эти компактизации обычно и не заметны вовсе - то есть, конкретно в случае с Codex проблему контекстной инженерии ребята здорово решили на уровне модели и на уровне Harness (обвязки), в то время, как Claude Code в этом аспекте требует чуть больше ручной работы - модель на 1M контекста там включается прямо в выпадающем списке (велик соблазн ее включить), но кажется, что простой обыватель зачастую не очень понимает, что переключение на эту модель потребует от него ручного управления контекстом - как только контекст переваливает за условные 200к, начинается зона риска, в которой нужно либо переходить в новый чат, либо, хотя бы, вызывать компактизацию - что и приходилось делать. Что уж говорить, что пользователям открытых моделей за загрузкой контекста все еще стоит следить куда пристальнее. Короче, в 2026-м контекстную инженерию (в которую входит контроль % заполнения контекстного окна) пока никто не отменял - чем больше забит контекст, тем сильнее приходится надеятся на удачу.
И, конечно, не забываем про контроль AGENTS.md, скиллов, MCP, progressive disclosure и т. д. - тоже все составляющие context engineering, с открытыми моделями все это становится еще важнее.
Кстати, современная версия Context Arena прогоняет бенчмарк MRCRv2 от Google DeepMind (GDM-MRCRv2).
Paper про MRCRv2 (Michelangelo)
Датасет MRCRv2
А как вы менеджите контекст? Обращаете ли внимание на % заполнения? Наблюдаете ли просадки в качестве output модели на больших контекстах?
@ai_driven
