КайфКодинг
الذهاب إلى القناة على Telegram
ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками
إظهار المزيد1 042
المشتركون
لا توجد بيانات24 ساعات
+177 أيام
+8630 أيام
أرشيف المشاركات
1 043
Repost from ChillHouse
Короче rage bait пост. Про бизнес, предпринимателей, венчур и «взрослую индустрию tech».
TLDR: венчуру в его текущем виде конец, будут только большие раунды, предприниматели прошлого цикла (а-ля инстаграм кофаундеры) потеряли свою ценность, их опыт не нужен.
А теперь по порядку. Мы находимся у порога технологического цикла. Входного порога конечно. AI такая штука которая срезает все «среднее», «ну такое» и прочее ниже этого по качеству. Технология меняет местами в приоритете две важных вещи. Возможность сделать и возможность проверить.
Раньше самым большим порогом входа было: собрать команду, найти денег чтобы им платить, мотивировать и так далее. Поток людей в индустрию рос. Было много гипотез, но чтобы их проверить нужно было время и ресурсы. Гипотезы были очень простые. О давай продавать это или отмечать фотки на карте, отмечать клиентов в табличке и трекать прогресс. Все было открыто (интернет меньше регулировался). Поэтому предприниматели славились своими софт скилами. Не так важно было знать проблему и ее решать, важно было найти людей и итерировать. Это ценилось превыше всего.
Сегодня я вижу картинку по-другому. Порог до проверки гипотезы упал до нельзя. Простые вещи проверить можно на коленке. Посмотрите на вайбкодинг подделки. И тут оказалось, что решение проблемы в RL стоит сотни миллионов, а твой новый SaaS две выручки дай бог. И для меня поменялось местами следующее. Раньше важно найти с кем и засетапить. Теперь важно очень точно понимать что делать, и желательно формулировать конкретно. И это пресловутое знание в век AI компаний оказалось очень техническим и очень сложным. Залетели первые компании типа perplexity & Harvey. А дальше читая описание компаний поднимающих 200м сразу даже не понятно. И это не потому что они делают чушь (клоуны ахахах), а потому что не понимаешь в чем вообще суть проблемы ими решаемой.
Следом за кризисом у предпринимателей будет кризис аллокации капитала. Ведь теперь нужно разбираться «на что» давать бабки, а не кому давать бабки. Что очень ломает мир инвесторов. И софт скилы отходят на второй план, ведь собрать команду под четкую проблему и зная что внутри легче, чем под «Тиндер для собак». А значит нужны инвесторы которые шарят. А таких будет мало, ибо им легче сделать свою компанию.
Все эти вещи можно заметить уже сейчас: топ рисерч челы уходят из гугла, в инвест фондах меняются лица, потому что прошлые лидеры просто не понимают что происходит. Тупо банально не вдупляют в смысл происходящего.
Такая стадия во многих индустриях. Там где венчура то и нет. Где стало сильно меньше высокорисковых идей с потенциалом. Потому что идеи стали сложные слишком. Это нас ждет и в tech. И да я бы не инвестировал бабки в трек рекорд прошлых лет, а лучше бы студентам норм профессора по ml закинул. Такие дела.
Вторую часть может тоже напишу. Но предрекаю огромное количество «великих предпринимателей» у которыхт в эпоху AI ничего не выйдет. Совсем.
1 043
Ваше внимание к диалогу подтверждения имеет измеренный срок годности. Примерно пятьдесят промптов.
С 14 августа новые сессии Claude Code на планах Pro, Max и Team стартуют в auto mode: разрешать вызовы инструментов будет модель-классификатор, а не вы. В исследовании Anthropic на 1053 платных тестерах подставленную опасную команду поймали 13,6% людей против 89% у классификатора. И главное: в начале сессии люди блокировали около 17% опасных команд, а после пятидесяти и более предыдущих запросов — около 5%. У классификатора доля не зависела от длины сессии вообще.
Тестеры при этом сидели в подставленной среде и знали, что их оценивают.
Диалог подтверждения оказался не механизмом безопасности, а элементом интерфейса со сроком годности. Чинить его не стали — из цепочки убрали вас.
https://claude.com/blog/auto-mode-default-in-claude-code
1 043
Он раздал свой код бесплатно ровно перед тем, как брать деньги. Это не щедрость, а расчёт.
Джан Челик из Анкары четыре месяца в одиночку писал Herdr — рантайм, в котором живут кодинг-агенты. 6 августа объявил, что идёт в Y Combinator: «25k stars and 340k downloads». А за пятнадцать дней до этого сменил лицензию с AGPL на Apache-2.0. Перед раундом лицензию обычно закручивают, а не отпускают.
Сейчас агент привязан к машине.
Поставили Herdr на ноутбук — агенты живут на ноутбуке. Нужна долгая задача — ставите второй Herdr на VPS, и это уже отдельная жизнь, со своими сессиями и своей историей. Третья установка в песочнице — снова с нуля.
Вот это и есть приём, ради которого я притащил историю.
Он собирается привязку убрать. Его слова: «those machines are disconnected. They should be connected». Ноутбук, VPS под шестичасовую задачу, песочница под рискованный код, телефон посмотреть с дивана — перестают быть отдельными установками и становятся одним парком.
Машина превращается в мощность, а сессия — в то, что по этому парку переезжает.
И вот тут появляется бизнес. Соединить ваши машины бинарником нельзя: нужен кто-то посередине, кто знает про все коробки и держит состояние.
Это уже не программа, а сервис, и хостить его будет он. Рантайм остаётся бесплатным навсегда, деньги — на слое поверх.
Поэтому копилефт и пришлось снять. Никто не купит координатор для рантайма, которым не пользуется. Сначала Herdr должен стоять у всех, и только потом сверху продаётся то, что без него не нужно. AGPL эту базу сужала — юротделы её режут. А вокруг Herdr уже выросли 565 плагинов в 556 чужих репозиториях, которые он не писал. Вот его актив: не код, код повторят за месяц.
Что сделать сегодня. Открыть LICENSE у инструмента, на котором стоит ваш пайплайн. Копилефт — счёт придёт за сам продукт. Apache или MIT — деньги возьмут не с кода, и стоит заранее понять, за какой слой поверх вас попросят платить.
Честности ради, продукта пока нет. Он привлёк раунд на установленную базу и на смену лицензии как на заявление о намерениях. Защиты у него теперь тоже нет: ровно на этом обжёгся Elastic, который в январе 2021-го ушёл с Apache под SSPL, потому что AWS торговал их продуктом под их же именем. AWS в ответ форкнул код и выпустил OpenSearch.
https://herdr.dev/blog/herdr-is-joining-y-combinator/
1 043
Он ослабил лицензию прямо перед венчурными деньгами. Это не щедрость, это арифметика.
Джан Челик из Анкары, один человек, четыре месяца писал Herdr — рантайм, на котором живут кодинг-агенты. 6 августа он объявил, что идёт в Y Combinator, батч F26. Первая строка его поста: «Hey everyone, it's Can, the only person behind Herdr». Оттуда же цифры за четыре месяца: «25k stars and 340k downloads». А пятнадцатью днями раньше, 22 июля, в репозитории лёг коммит cd5ea1b — «chore: relicense herdr under apache-2.0». До него была AGPL.
Что такое рантайм для агентов:
— Фоновый сервер владеет терминальными сессиями, поэтому работа переживает закрытую крышку и оборванный ssh.
— Агенты разложены по проектам и помечены: работает, заблокирован, готов. Вы смотрите только туда, где вы нужны.
— Любой клиент — это просто вид: встроенный TUI, ssh с другой машины, телефон.
Сам он объясняет это так: «I want everyone to use Herdr freely». Вот это и есть приём, ради которого я притащил историю. Перед деньгами лицензию обычно закручивают — AGPL, BSL, — чтобы облачный провайдер не съел. Он сделал наоборот и снял копилефт. Расчёт тут работает и без всякой щедрости: защищает его не код рантайма. Защищает его маркетплейс — на сегодня 565 плагинов в 556 репозиториях. Почти по репозиторию на плагин: это не его монорепа, а чужие отдельные проекты. Про них он пишет так: «More than 500 plugins, one month after the marketplace released. I didn't build any of these».
Копилефт бьёт не по конкуренту, а по тому, кто интегрируется.
Эту ставку вы не делаете, вы её покупаете — каждый раз, когда выбираете, чем гонять агентов.
Что сделать сегодня. Открыть страницу расширений своего инструмента и посмотреть не на их число, а на то, где они лежат. Отдельный чужой репозиторий на каждый плагин — экосистема живая, она переживёт смену вендора и вашу тоже. Всё в монорепе вендора — это не экосистема, а список фич, и он кончится в тот день, когда вендору станет неинтересно.
Честности ради, ревью у этого маркетплейса нет вообще. Индекс собирается автоматически по топику herdr-plugin на гитхабе, и на самой странице написано: «Listings aren't reviewed by Herdr, so install at your own discretion». То, что делает ставку выигрышной, делает её и опасной: 556 чужих репозиториев отдают код внутрь рантайма, который владеет терминалами ваших агентов.
https://herdr.dev/blog/herdr-is-joining-y-combinator/
Сколько расширений у вашего агентного инструмента написали не его авторы?
1 043
Repost from Information Retriever
KDD’26, день второй.
1. Personalized Intelligence Workshop — про персонализацию агентов. Над какими проблемами думают:
* как тюнить персонализацию не на один шаг, а на большой горизонт времени
* память. Что и как нужно сохранять в памяти; и что нужно наоборот забывать
* оценка качества. Как оценивать персонализацию агентов тоже пока никто не понимает)
Было выступление от James Caverlee — Personalization in the Agentic AI Era: Opportunities and Challenges. Как я понял, он много где выступает с похожим рассказом, и каждый раз у аудитории спрашивает “Кто считает, что мы достигнем agi в ближайшие пять лет?”:
* в нашей аудитории получилось, что где-то 10% считают, что да
* в феврале на WSDM — где-то 15%-20%
* на computer science graduate курсе, который он преподает, 0% студентов считают, что да
* в Google Deepmind — 75%
Ну то есть у студентов и ресерчеров из GDM совершенно противоположный настрой))
Потом была цитата от Jimmy Lin: “We’re all fucked”. И еще цитата, что “Only 100 people in the whole world matter. And they are working at Anthopic and Moonshot AI”
Говорил, что old-school recsys, когда мы на типичных академических бенчмарках типа мувиленза растим HR и NDCG, уже никому не нужен. Что сейчас надо думать про агентную персонализацию. Приводил примеры, в стиле что пользователь просит агента помочь продвинуться в ближайшие пять лет в карьере / научиться играть на гитаре “Yesterday” за месяц / уменьшить потребление энергии в доме / подобрать хорошую тропу для скалолазания на Чеджу.
Еще говорил, что очень важна мультимодальность — агент, который пытается помочь человеку, должен видеть (как минимум распознавать все предметы в окружении человека) и слышать (понимать насколько он нервничает и тд).
2. AdKDD — наверно, главный воркшоп по рекламе среди всех ML конференций. Я не смог на него пролезть. Уверен, что на других каналах вам про него расскажут))
3. На открытии конференции сразу рассказали про выручку — сколько получили денег со спонсоров и с регистраций (см фотографии). Но при этом вообще ничего не сказали про самое интересное — как участники / авторы статей распределены по странам. А еще, внезапно test of time award выиграл Xgboost!
4. Постерная сессия была огромная (кажется, 700+ постеров), но при этом длилась она всего два часа. Я все это время простоял возле Аргуса, поэтому про остальные индустриальные постеры вам расскажут тоже на других каналах)) Подошел разработчик из Куайшоу, внимательно прочитал постер, по-английски не разговаривал. С разработчиком из Naver сошлись на том, что Naver — корейский Гугл, а Yandex — русский)) Еще автор CLUE попросил сфоткаться
Что еще:
* сейчас уже думаю, что русскоязычных участников 100+
* у ребят из Т-Банка приняли на CIKM 3 статьи! И еще и на RecSys что-то приняли! Очень круто
* всегда хотел записывать на канал кружочки, начиная с фразы “Здравствуйте, дорогие подписчики”. Кажется, момент настал; меня уже не остановить
* завтра день начнется с выступления Jeff Dean. Мы все на хайпе, ждем
1 043
Repost from max.sh
Небольшой анекдот-история, чтобы задать правильный ритм на неделю.
Наблюдал я как-то следующую ситуацию. Была у компании умная модель. И ее через кастомизированные харнессы (system prompts + тулы + конеткст) адаптировали к разным прикладным доменам.
Одна из задач была помочь оптмизировать работу фиансовых консультантов. Техническая команда быстро собрала агентскую обвязку и добавила разных профильных тулов. Среди прочих были и более классические: bash с файловой системой и web_search
Чтобы померить качество своего агента, команда взяля набор открытых публичных бенчмарков, которые пересекались с реальными приложениями хотя бы на уровне инструментов.
Сделали прогоны. На каждый бенчмарк по 5 попыток решить задачу - все честно и с стат значимостью. Бэйзлайны других агентов/моделей гонять не стали – взяли открытые цифры. Получалась SOTA! На каждом бенчмарке! Где-то 15%, где-то и все 30%. Кто следит за лабами, тот знает всю эту кухню бенчмаксинга.
Большие цифры никогоа не смущали. Был проделан быстрый human expert анализ траекторий агентов на небольшом подмножестве сэмплов из каждого бенчмарка. Все клеилось. Агент просто хорош.
Стали готовить презентации, рисовать те самые заветные bar charts, показывая в каком далеком космосе новый агент.
Но все-таки бывалых инженеров что-то засмущало. Проделали еще один инженерный анализ. Выяснилось, что один из инструментов, web_search, так мощно работал, что когда агент решал его использовать, то в выдаче регулярно оказывались ссылки на...исходники бенчмарков! либо на гитхаб репозиторий, либо на hugging face, либо куда-то еще. Бенчи то опенсоурсные и все ответы лежат в открытом доступе!
Обнаружить такое было и правда не тривиально (без некоторых проверок на уровне эвала), потому что модель по-умному читерила. Скачивала бенч, а потом якобы проверяла корректность решения используя все валидные инструменты. То есть траектории были достаточно реалистичны.
Презентации свернули. Продакты краснели от негодования. Молодые рисерчеры краснели еще сильнее. Бывалые соколы оправдывали свое призвание бывалых.
Баги устранили, определенные веб домены были добавлены в исключения, агенту в системном пропмтпе запретели лазить по некоторым сайтам, а в рубрики валидаторов добавили проверку на рассуждения. Эксперимент был перезапущен.
Цифры стали скромнее. SOTA испарилась. Но на некоторых бенчах результаты все равно радовали глаз.
Проверйте результаты, вставляйте все возможные проверки, чтобы отловить читерство.
1 043
Друзья Армяне - вы молодцы https://am.sputniknews.ru/20260808/v-razdane-otkrylsya-krupneyshiy-data-tsentr-ii-v-regione-105559937.html
1 043
Есть классная команда вайбкодеров терминаторов (3 человека).
Берут дорого, но делают очень круто. Пишите в личные сообения.
1 043
Repost from Information Retriever
KDD’26, день первый.
На конференции собралась индустриальная тусовка — приехали ключевые рекомендательные команды из вообще ВСЕХ больших компаний.
1. Сходил на первую половину Tutorial on Generative Recommendation: Foundations and Frontiers от Kuaishou и City University of Hong Kong. Выделили два (будущих?) тренда:
* если изначально все использовали encoder-decoder модели для генеративного ретривала, потому что в них было удобно впихивать богатый контекст; то сейчас двигаются в сторону decoder-only моделей, которые лучше скейлятся
* диффузионные подходы, при которых мы предсказываем сразу все семантические токены целевого айтема — очень перспективное направление, которое позволяет избавиться от аккумуляции ошибок при авторегрессивной генерации токенов
После кофе-брейка я на туториал не вернулся, потому что:
* были супер энциклопедические слайды, на которых перечислялось много статей по паре минуток каждая, очень поверхностно, без инсайтов, с неточностями
* при этом не было живого рассказа - весь текст просто зачитывался. Надеюсь, потом выпустят с этим текстом техрепорт)) Ну а если серьезно, то проще слайды полистать
2. Пообщались с Федором Борисюком. Когда возле него осталась только наша русская компашка, Федор сам первый перешел на русский язык :) Что рассказывал:
* если я все правильно понял, он сейчас руководит тремя командами. Что-то возле поиска и рекомендаций
* статьи пишут по выходным. К процессу привлекается большое количество коллег. Федору просто нравится писать статьи и прокачивать репутацию, а у коллег есть мотивация участвовать как минимум чтобы получить грин-карту))
* сам Федор сторонник того, чтобы на работе со всеми уважительно и дружелюбно обращаться, налаживать хорошие отношения. И максимально коллаборироваться, делать совместные проекты. Но говорит, что это иногда приводит к плохим последствиям, во время политических игрищ
* у него всегда часть проектов долгосрочные, а часть краткосрочные. Долгосрочным как правило занимается небольшая команда из 2-3 человек. Если проект планируется на год-полтора (больше бизнес вряд ли вытерпит), то расставляются майлстоуны на каждые полгода с оффлайн-метриками
* если попался плохой руководитель, то надо просто ротироваться и не мучаться :)
* через полтора месяца должен быть дроп крутой новой статьи от Линкедина
3. Воркшоп Two-sided Marketplace Optimization: Search, Discovery, Matching, Pricing & Growth. Было выступление от Director of Research @ Spotify, Paul Bennett — From User Needs to Ecosystem Design: How AI Is Reshaping Discovery. Рассказывал про разные сценарии, в которых применяют LLM:
* steerable recommendations — тюнят модель с помощью контрольных токенов выдавать familiar (пользователь уже взаимодействовал с подкастом >10 минут за последний месяц) и unfamiliar (обратная ситуация) контент в рекомендациях. Похоже на мою идею с обуславливанием, про которую рассказывал на Turbo ML Conf 2025
* Intent-aware search — в поиске есть разные сценарии; иногда нужно просто включить рекомендации с какими-то настройками, иногда запустить реальный поиск, иногда просто найти артиста, иногда что-то еще. LLM можно использовать как router, который определяет в какой api (recs/search/etc) нужно отправлять запрос
* Conversational discovery — часто пользователь сначала сам не понимает какие ему нужны рекомендации; и только в процессе взаимодействия с рекомендательной системой начинает понимать чего все-таки хочет. И для этого как раз multi-turn диалог, в котором он может и промежуточные рекомендации получить, и пообщаться с рексистемой
4. Что еще:
* на конференции 70+ русскоговорящих участников, это очень много. Много людей со статьями, а еще есть студенты с ИИ360 программы. Жутко им завидую, меня бы кто на первом-втором курсе на конференцию отправил! Говорят, что ничего непонятно, но все очень вдохновляет)
* все офигевают от джетлага
* даже в Линкедине (!) разработчики слушают наш DeepRecsys курс :)
1 043
AI разработка web проектов без велосипедов
Делаю AI-агентов и различные веб-проекты, заметил закономерность: модель охотно лепит самописы там, где давно есть готовые популярные решения. Next/React она знает отлично, но как доходит до инфраструктуры вокруг, хочется заругаться (когда ты всё проглядел а оно уже собрано). Прошёлся по стеку своих проектов и собрал список того, что стоит брать сразу, включая пару вещей, которые модели обычно не предлагают сами.
1️⃣ Realtime и стриминг
Socket.IO. Realtime-связь фронта и бекенда: стриминг токенов от LLM, прогресс агента, каналы событий, живые обновления UI. Готовые реконнекты и доставка, не надо писать руками. (даже не пытайтесь в самописы нейронкой, замучаетесь потом ревьюить и править).
Socket.IO-postgres-adapter. Масштабирование Socket.IO между инстансами через Postgres вместо Redis. Если база и так есть, лишний сервис не нужен.
2️⃣ Очереди и фоновые задачи
Pg-boss. Очереди прямо на Postgres: ретраи, cron, dead letter queue, приоритеты. Модели почти никогда сюда не смотрят, рефлекторно предлагают Redis и BullMQ, даже когда база одна и очередь нужна для трёх джобов в сутки.
Inngest / Trigger.dev. Serverless-воркфлоу с шагами и вебхуками для сложных пайплайнов.
Dockerode. Node-обёртка над Docker Remote API: управление контейнерами, образами, стримами прямо из кода вместо шелл-вызовов docker через child_process. Полезно для любых сценариев с программным запуском контейнеров, включая изолированный запуск сгенерированного агентом кода.
3️⃣ Данные и поиск
Prisma ORM. Типобезопасный доступ к БД, миграции, автогенерация типов. Нейронка с ней работает, как боженька. Не приходится лезть в БД а всю схему БД моделька знает из файла схемы, лежащего в проекте, который и является источником истины. Плюс ко всему, призма не даст сломать миграции или как-то криво их применить агенту.
Drizzle. Альтернатива Prisma без отдельного движка, миграции обычным SQL, ближе к базе. Модели реже про неё вспоминают, хотя в проде она встречается не реже. С некоторым допилом поверх можно тоже прийти к единой схеме как и в призме.
Pgvector. Векторы прямо в Postgres. RAG без отдельного сервиса примерно до 10M эмбеддингов. в 90% случаев закрывает все наши векторные хотелки без прибегания к отдельным векторым бд.
Meilisearch / Typesense. Полнотекстовый и векторный поиск с морфологией вместо LIKE и самописных токенизаторов.
4️⃣ Хранилища
Garage вместо MinIO. MinIO больше не безопасный дефолт: в декабре 2025 проект перевели в maintenance mode, в феврале 2026 репозиторий заархивировали с пометкой «no longer maintained». Garage от Deuxfleurs живой, тот же S3-протокол, спроектирован под self-hosted мультинодовый кластер. Модели по инерции всё ещё советуют MinIO, потому что так было в датасетах.
5️⃣ Эмбеддинги
Multilingual-e5-small. Мультиязычные эмбеддинги локально на CPU, компактная модель, не требует GPU. Разумный выбор для недорогого хостинга: BGE-M3 и e5-large точнее на части задач, но для бюджетного CPU-инстанса small-версия достаточна и заметно легче по ресурсам. Без OpenAI и утечек данных. Именно ее во всех проектах и использую.
6️⃣ LLM-инфраструктура
Vercel AI SDK. Стриминг в React/Next из коробки, useChat/useCompletion, 20+ провайдеров через единый интерфейс.
LiteLLM. Единый API к 100+ LLM с фоллбэками и ретраями вместо provider-specific клея на каждый релиз. Важно, что умеет в статистику по токенам и билинг. Перешел на нее с Cli Proxy Api.
Instructor / Outlines. Структурированный вывод по Pydantic/Zod-схемам вместо ручного парсинга JSON через regex.
7️⃣ Агентные фреймворки
Mastra. TS-фреймворк для продакшен-агентов с готовой памятью поверх Postgres. Прямой конкурент LangChain/LangGraph, но нативно на TS, без питонячьей экосистемы.
Eve (пока в бете, но уже интересен) Для личных, семейных, командных агентов. Разделение простое: Mastra под бизнес-задачи, eve под персональные. Не перевариваю всяких гермесов и опен клав, почему, сам не знаю, наверное из за отвращения к перехайпленным решениям.
8️⃣ Авторизация
better-auth. Гибче классического NextAuth, из коробки организации, роли, 2FA.
1 043
Пример проекта , которым пользуется весь мир.
Трамп может узнавать о том проходят ли танкеры или нет через https://tankermap.com/
Проект сделал великолепный Олег Кузнецов. Проект уже упомянул министр Ирана.
1 043
Repost from Николай Хлебинский
Сегодня вышла вторая серия батла нейросетей 🤖🤛
Собрал двух ИИ-менеджеров по продажам для Битрикс24 с помощью Claude Fable 5 и GPT 5.6 Sol
Попробуйте угадать какая модель справилась лучше, я сильно удивился!
Ролик уже на ютубе: https://youtu.be/hnF5-xJteoI
Все материалы из ролика положил на гитхаб, ссылка будет в комментарии к этому посту.
Обязательно оставляйте ваши идеи для следующих серий батла в комментариях на ютубе!
1 043
+2
Вам показывают не то, что исполнится. Четыре релиза Claude Code подряд чинят ровно этот дефект — и это только половина проблемы.
С 3 по 7 августа вышли 2.1.221, 2.1.222, 2.1.223 и 2.1.224:
— zsh выполнял скрытые команды внутри [[ ]], и проверка прав их не видела.
— Сессия в worktree и её сабагенты могли выполнять разрушительные git-команды против основного чекаута.
— Команда, добитая табами и невидимым Unicode, прятала часть себя от диалога подтверждения.
— Запрет denyRead: "~/.aws/" со слэшем на конце молча не работал.
Четыре разных механизма и одно место поломки — то, что вы видите в окне подтверждения.
Вот это и есть приём, ради которого я притащил историю. Потому что в те же дни вышел замер, который закрывает второй конец той же трубы.
Scale X собрал 409 000 решений approve/deny из 40 тысяч прогонов игры-симулятора. Средняя точность — 66,3%. Явный деструктив вроде rm -rf / пропускают в 11,7% случаев, а cat ~/.aws/credentials — уже в 35,0%. Самая пропускаемая команда из тридцати семи — npm run analyze, её аппрувнули 64,7% игроков. При том, что прямо над промптом в логе показано: скрипт гонит вывод через curl на чужой домен.
Формулировка автора: «Hiding a payload behind a familiar script name roughly doubles its success rate even when the payload is shown in the history log».
Теперь сложите два конца. Машина показывает не то, что исполнится. Человек не читает то, что показано. Ваш гейт подтверждения стоит ровно на этих двух допущениях.
Что сделать сегодня. Откройте свой список разрешённых команд и вычеркните всё, что запускает чужой файл: npm run, make, just, любые скрипты из репозитория. Это не команды, это имена, за которыми лежит произвольный шелл, переписываемый тем же агентом. Что нельзя — должно быть недоступно, а не показано в диалоге.
Честности ради, автор замера сам называет главный минус: в игре угрозами были 34% команд, в жизни их доли процента. Он считает, что в реальности внимание падает ещё сильнее, — но это его допущение, а не измерение.
https://scalex.dev/blog/ai-agent-permissions-stats/
Какую команду вы аппрувите не глядя, потому что видели её тысячу раз?
1 043
+2
Если вы запускаете агентов в git worktree — это не изоляция.
Алекс Чаплинский разобрал, что worktree на самом деле делит с основным репозиторием: ветки, конфиг, стэш и .git/hooks. Своё у него только HEAD, индекс и пара служебных файлов. Агент из своего worktree ставит хук, который выполнится у вас на машине при следующем коммите, переписывает email в атрибуции ваших коммитов и достаёт стэш соседнего агента.
Автор сам считал полноценный clone дорогим, пока не померил на клоне git/git: git worktree add — 826 мс и 58,7 МБ на диске, git clone --shared — 870 мс и 58,9 МБ. Изоляция веток, конфига, стэша и хуков стоит 44 миллисекунды.
Через пять дней Anthropic закрыла ровно это в Claude Code 2.1.222, дословно: «Fixed worktree-isolated sessions and their subagents being able to run destructive git commands against the main checkout».
Слово «isolated» в описании инструмента — это не механизм.
https://fletch.sh/blog/git-worktrees-vs-clones-for-ai-agents/
1 043
https://higgsfield.ai/publications/3c8bcc07-a10d-4c57-a27b-6d4506ebf112 - seedance 2.5 доступна
