ch
Feedback

不要被骗子欺骗!Telemetrio 会找到并标记这些频道 👉 如果想查看标记,请订阅 👈

КайфКодинг

КайфКодинг

前往频道在 Telegram

ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками

显示更多
1 043
订阅者
无数据24 小时
+177 天
+8630 天
帖子存档
Repost from Hacker News
Google fixed more Chrome bugs in June than over the past two years, thanks to AI (Score: 155+ in 4 hours) Link: https://readhacker.news/s/6ZHiB Comments: https://readhacker.news/c/6ZHiB

Repost from False Positive
Всем привет! 👋 Уже завтра на внеплановой Reading Group посмотрим на архитектуру Kimi K3. Авторы модели предлагают масштабиро
Всем привет! 👋 Уже завтра на внеплановой Reading Group посмотрим на архитектуру Kimi K3. Авторы модели предлагают масштабировать и пре-трейн, и test-time вычисления одновременно, а как именно: узнаем уже завтра. Пробежимся по деталям из технического отчета: - Kimi Delta Attention — как при миллионе токенов не словить переполнение в BF16 и почему оно требует специализированных ядер (FlashKDA); - Stable LatentMoE — как работать с 896 экспертами, не теряя GPU в простое; - Post-training pipeline — как 9 RL-экспертов дистиллируются в одну модель для деплоя; А также посмотрим, как архитектурные решения диктуют инфраструктуру, чтобы создание такой модели в принципе стало возможным. 📅 Встречаемся в пятницу в 15:00 (по МСК). Толк #reading_group

Стрим про разбор архитектуры Кими 3

Ваш воркфлоу может сломать чужой релиз, о котором вы не узнаете. Человек полез в бинарник Claude Code 2.1.219 и нашёл две инструкции, адресованные конкретно Opus 5: не вызывать AgentTool и не запускать workflows без явной просьбы пользователя. Раньше такое прилетало с сервера — теперь вкомпилировано в клиент. Больнее всего тем, кто строил скиллы вокруг сабагентов. Вчера работало, сегодня агент вежливо делает вид, что не умеет. В чейнджлоге — ни слова. Отсюда правило: всё, что держится на недокументированном поведении агента, считайте временным. Не «не стройте» — стройте, но помните, что срок годности назначаете не вы. https://www.reddit.com/r/ClaudeCode/comments/1v6y5q2/claude_code_has_a_hardcoded_instruction_telling/

https://openrouter.ai/deepseek/deepseek-v4-flash-0731 - докрутили быструю модель DeepSeek Flash - вероятно лучшая модель для
https://openrouter.ai/deepseek/deepseek-v4-flash-0731 - докрутили быструю модель DeepSeek Flash - вероятно лучшая модель для Гермеса.

https://www.youtube.com/watch?v=iL4mF-PJRAY мой доклад подьехал.

Леша делает феноменальную работу в Авито - делает аналитику доступной для любого пользователя. Очень классный доклад

photo content

Repost from Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿 Таймлайн: 📔 9 июля – агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб" В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали 📔 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face Агент загружает на Hugging Face специально собранные датасеты: Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты 📔 11 июля – пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами. Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот 📔 12 июля – агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало. 📔 13 июля – закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37 фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14 UTC. В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил? Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям Шел июль 2026 года Все детали тут: https://huggingface.co/blog/agent-intrusion-technical-timeline

Агент работает в человеко-минутах, а оценивает в человеко-месяцах. Мем недели в r/ClaudeCode. Смешно, но за ним настоящая проблема: агент учился на наших тикетах и планах, поэтому унаследовал и наши оценки. Он отрабатывает фазы 1–6 за три минуты и на голубом глазу пишет, что на седьмую нужно ещё три дня. Вред тут не в юморе. Если попросить агента составить план с оценками, он выдаст человеческий график — и вы под него подстроите свои ожидания и чужие дедлайны. Просите план в шагах, а не в днях. https://www.reddit.com/r/ClaudeCode/comments/1v3cy52/claude_this_project_will_take_3_months_me_you/

Год мы писали агентам правила. Теперь эти правила — балласт. Anthropic выпустила гайд по context engineering для моделей Claude 5 и заодно призналась, что вырезала 80% системного промпта Claude Code. Логика простая: раньше модели были слабее, и мы компенсировали это списками запретов. Модели подтянулись — списки остались. Теперь они жрут контекст и сужают модели коридор. Что поменялось конкретно: — Запреты вроде «не пиши комментарии» больше не нужны. Модель решит сама, и решит лучше, чем ваше правило годовой давности. — Примеры использования инструмента в промпте теперь вредят: они загоняют модель в узкое пространство поиска. Вместо примеров — выразительные параметры самого инструмента. — Монолитный CLAUDE.md объявлен мифом. Вместо него дерево файлов, которое грузится в нужный момент. Что сделать сегодня. Открыть CLAUDE.md и вычеркнуть каждую строку, про которую вы не можете вспомнить, какой конкретно факап она чинила. Не «звучит разумно», а именно «вот тогда сломалось, вот поэтому написал». Всё остальное — суеверие. Потом прогнать /doctor, он пройдёт по скиллам и покажет лишнее. Неприятный вывод из всей истории: промпт-обвязка амортизируется быстрее кода. Всё, что вы написали, чтобы обойти слабость модели, превращается в мусор ровно в тот день, когда слабость починили. Значит, писать её надо так, чтобы не жалко было выбросить. https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models А у вас сколько строк в CLAUDE.md? И сколько из них вы сможете объяснить?

📆 Lecture 9 — в понедельник 3 августа, 10am ET / 5pm MSK Продолжаем курс Stanford MS&E 435. На этот раз поднимаемся на прикл
📆 Lecture 9 — в понедельник 3 августа, 10am ET / 5pm MSK Продолжаем курс Stanford MS&E 435. На этот раз поднимаемся на прикладной слой в неожиданной, но очень горячей области — науки о жизни. Class #9: Applications, AI in Life Sciences Guest speaker: Eric Kauderer-Abrams (Head of Life Sciences, Anthropic). Как ИИ меняет разработку лекарств и биологию: где в фарме и биотехе реально возникает ценность, что уже умеют современные модели в науках о жизни и почему этот слой стека может оказаться одним из самых прибыльных. Гость руководит направлением Life Sciences в Anthropic — из первых рук про экономику AI в биомедицине. 📍 Регистрация на Luma: https://luma.com/yqbc6uut 🎥 К просмотру — Lecture 9: https://www.youtube.com/watch?v=nWKiJHKIZfo 📚 Доп. материалы добавлю позже. Увидимся в понедельник! Обсуждать в чате: @rvnikita_blog_chat #stanford #ai #eric_kauderer_abrams #anthropic #mse435

https://dl.acm.org/doi/10.1145/3797895 - Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising: An Overview and New Perspectives.

https://www.youtube.com/@CanItCode - настоящая находка - 400 подписчиков и отличный контент о том, как создавать игры в агентах.

Кто ни будь знает как сейчас пробиться до покупки подписки? 27 июня заблокировали прошлый аккаунт, сообщение о восстановлении
Кто ни будь знает как сейчас пробиться до покупки подписки? 27 июня заблокировали прошлый аккаунт, сообщение о восстановлении до сих пор ревьюят. Создал новую чистую пиндосовсую почту. Завел новый аккаунт на клоде, но оплатить подписку он не дает, появилась верификация аккаунта. Знает кто ни будь как с этим бороться?

Repost from False Positive
Всем привет! 👋 В эту пятницу на очередной Reading Group поговорим про ML-инфраструктуру, а именно - про виртуализацию GPU. В
Всем привет! 👋 В эту пятницу на очередной Reading Group поговорим про ML-инфраструктуру, а именно - про виртуализацию GPU. В программе: - NVIDIA Multi-Instance GPU (MIG) - как делить один GPU между несколькими задачами; - HAMi - виртуализация GPU в Kubernetes для AI-инфраструктуры; - MLPerf Inference Benchmark - запустим бенчмарк и разберёмся, как интерпретировать результаты. 📅 Встречаемся в пятницу в 15:00 (по МСК). Ссылка для подключения в Толк. 👈 #reading_group #mlinfra #benchmark

Фабл вывели игры на новый уровень. Даня не дождался выхода ГТА 6 и сделал себе свой

1М контекстное окно - прорыв или фикция? Context Arena забенчмаркали стойкость контекста для GLM 5.2 и Opus 4.8 - значит, это
1М контекстное окно - прорыв или фикция? Context Arena забенчмаркали стойкость контекста для GLM 5.2 и Opus 4.8 - значит, это хороший повод нам вспомнить про контекстную инженерию. На бенчмарке отчетливо видна существенная просадка внимательности моделей на 512к контексте: в среднем, почти в 2 раза в сравнении с 64к контекстом и примерно в 1.5 раз в сравнении с 128к контекстом - грубо говоря, для нас с вами это означает то, что на 512к контексте агент будет терять в полтора раза больше деталей, чем на при 128к заполненности. Для открытых моделей проблема потери контекста особенно актуальна, поэтому практический вывод такой, что по-хорошему, с ними стоит держать заполненность контекстного окна не выше 128к, а лучше даже меньше - ни о каком 1М, конечно, и речи не идет, там просадка будет колоссальной. Кстати, у моделей Kimi K2.6 и, тем более, Minimax M3 дела обстоят еще хуже. Что еще? Открыв закрытых моделей на большом контексте от открытых все еще впечатляет, хоть уже и не такой драматичный - спасибо DeepSeek за DeepSeek Sparse Attention, которую в GLM-5.2 развили через IndexShare. Кстати, о GLM 5.2 - как видно, моделька действительно на удивление успешная в т. ч. на больших контекстах. Opus 4.8 идет рядышком с GPT 5.5, но последняя все равно сильнее, особенно на совсем больших контекстах. На этом месте вспоминаем интересную деталь - в Codex App по дефолту контекстное окно для GPT 5.5 все еще 256к - то есть, по сути, точность всегда остается где-то на уровне 75%+- (по MRCRv2), а благодаря превосходному алгоритму компактизации, команде Codex удается сохранить все действительно важное так, что эти компактизации обычно и не заметны вовсе - то есть, конкретно в случае с Codex проблему контекстной инженерии ребята здорово решили на уровне модели и на уровне Harness (обвязки), в то время, как Claude Code в этом аспекте требует чуть больше ручной работы - модель на 1M контекста там включается прямо в выпадающем списке (велик соблазн ее включить), но кажется, что простой обыватель зачастую не очень понимает, что переключение на эту модель потребует от него ручного управления контекстом - как только контекст переваливает за условные 200к, начинается зона риска, в которой нужно либо переходить в новый чат, либо, хотя бы, вызывать компактизацию - что и приходилось делать. Что уж говорить, что пользователям открытых моделей за загрузкой контекста все еще стоит следить куда пристальнее. Короче, в 2026-м контекстную инженерию (в которую входит контроль % заполнения контекстного окна) пока никто не отменял - чем больше забит контекст, тем сильнее приходится надеятся на удачу. И, конечно, не забываем про контроль AGENTS.md, скиллов, MCP, progressive disclosure и т. д. - тоже все составляющие context engineering, с открытыми моделями все это становится еще важнее. Кстати, современная версия Context Arena прогоняет бенчмарк MRCRv2 от Google DeepMind (GDM-MRCRv2). Paper про MRCRv2 (Michelangelo) Датасет MRCRv2 А как вы менеджите контекст? Обращаете ли внимание на % заполнения? Наблюдаете ли просадки в качестве output модели на больших контекстах? @ai_driven

photo content