es
Feedback

¡No caigas en manos de tramposos! Telemetrio encuentra y marca estos canales 👉 Si quieres ver la etiqueta, suscríbete 👈

КайфКодинг

КайфКодинг

Ir al canal en Telegram

ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками

Mostrar más
1 042
Suscriptores
Sin datos24 horas
+177 días
+8630 días
Archivo de publicaciones
Claude отказался запускать чужой бинарник — и ровно этот отказ его и сломал. wunderwuzzi, который ведёт блог Embrace The Red и разбирает атаки на агентов, дал Claude Code задачу «суммаризируй сайт». Сайт отдал zip с записями в своей кодировке и готовым декодером decoder-darwin; бинарник Claude запускать не стал и написал свой декодер на Python, запустив его прямо в распакованной папке. Стандартный base64 импортирует struct — и взял чужой struct.py из этой папки. Три прогона из пяти закончились обратным подключением на машину атакующего. У варианта, где вредонос запускал второй экземпляр Claude через claude -p, — четыре из пяти. В нескольких прогонах auto mode разрешил создать процесс, а потом заблокировал команду, которой Claude пытался его убить. Если ваш агент распаковывает скачанное в рабочую папку и оттуда же запускает python3 -c, чужой модуль встанет в его путь импорта раньше стандартной библиотеки. https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/

Repost from Сиолошная
В новом интервью Dwarkesh с Dylan Patel из SemiAnalysis есть интересная мысль про экономику AI-бума: проблемой может стать не то, что AI-компании сжигают слишком много денег, а наоборот — что вкладывать в AI слишком выгодно. По оценке SemiAnalysis, МегаВатт вычислительных мощностей обходится примерно в $10–15M (видимо, в год) а Anthropic уже может извлекать из того же МегаВатта до ~$50M выручки (..в год). Грубо говоря: потратил $10 на мощности → получил $50 выручки → деньги снова отправил на мощности. Это выручка, не прибыль, и тут не учтены RND, операционные расходы, но разрыв огромный и покрывает их (именно поэтому компании активно расширяются темпами, которые многим кажутся безумными). Ещё одна иллюстрация: рост мощностей в будущем во многом связан с тем, сколько литографов, печатающих чипы, сможет выпустить ASML. Они масштабируют производство, но очень медленно — к 2030-му году оптимистично они будут выпускать СТО литографов (на весь мир) в год. Dylan посчитал, что $6B CapEx на уровне производства полупроводников позволяют выпускать чипов примерно на 1 ГВт AI-инфраструктуры в год, а такой гигаватт способен поддерживать порядка $100B AI-выручки. Но Гигаватт-то будет делаться каждый год, и получается, что литографы на $6B за пять лет могут дать более $1T AI-выручки. Понятно, что между ними ещё TSMC, серверы, дата-центры, энергия и R&D, и каждый откусывает себе кусок пирога, но разница всё равно на порядки. По модели SemiAnalysis, AI buildout с 2024 по 2029 потребует больше $11T CapEx: около $6T оплатят из денежных поступлений, ещё примерно $5T придётся привлечь в долг. Для масштаба, это больше годового нового займа всех правительств ОЭСР вместе взятых (38 стран). Откуда взять столько денег? Пенсионный фонд может продать облигации и векселя США и купить облигации условной Meta. И чтобы быть привлекательными, Meta должна предложить больший процент — но это как раз и не будет проблемой, потому что AI НАСТОЛЬКО выгоден. Dylan приводит её как пример: недавно компания занимала примерно под 5–6%, но при огромной отдаче от дата-центров ей может быть выгодно занимать и под 8%. Конкретные 8% — грубая оценка, можно сказать с потолка и используется просто для иллюстрации. Если AI-компании готовы платить 8%, остальным заёмщикам тоже приходится повышать доходность (иначе к ним никто не даст денег). AI перебивает цену за мировой капитал, из-за чего кредит дорожает для всех. Для США это неприятно. Сейчас у США около $32T долга и ~$5.6T годовых доходов в казну; около $1T уже уходит на оплату процентов по облигациям и бондам. Каждый дополнительный процентный пункт ставки — эт примерно $320B в год, около 6% нынешних доходов бюджета. То есть если AI компании повысят проценты на +1 и все понесут деньги им, то государство тоже должно будет поднять, и это превращает ~20% доходов на обслуживание долга примерно в 25%, а +5 п.п. — уже в 40%. Если продолжать занимать около $2T в год, возникает петля: больше процентов → больше дефицит → больше долга → ещё больше процентов. Но США хотя бы получают сам AI-бум: дата-центры и новая прибыль находятся внутри страны, поэтому их можно обложить налогом. Сейчас налоговая система в основном собирает деньги с доходов людей и зарплат, а если AI начнёт автоматизировать труд, старая налоговая база может сжиматься. Для стран без крупного AI-сектора всё хуже: ставки вырастут и для них (зачем давать денег Зимбабве и Пакистану, если можно OpenAI и Meta?), а новой налоговой базы у них не появится. И вот таким странам придётся очень туго. AI окажется настолько полезным, что начнёт перетягивать на себя триллионы капитала и поднимать его цену для остальной экономики. === Ждём лонг от @RationalAnswer про математику экономики, сам-то я не шарю 🤓

Счёт за агента — единственная статья ваших расходов, которую вы принимаете на веру. Данные для разбора при этом лежат у вас на диске. Человек на плане Max 20x выбрал недельный лимит за два дня вместо обычных пяти-шести — при той же нагрузке. Пятичасовое окно стало кончаться за десять минут. Он решил, что сломался счётчик, и собрался переезжать на Codex. Перед переездом открыл логи, которые Claude Code пишет на его же машину, и разобрал месяц запросов. 1 555 сессий Claude Code на одной машине за день. Медианная жила тридцать секунд и делала четыре запроса; в пике работала пятьдесят одна сессия разом. Его собственная работа — одна сессия из 82 запросов за пять часов — заняла 9% дня. Виноват оказался фоновый агент, которого он сам поставил и забыл, как тот устроен. Никакого бага в счётчике. Интересно не то, что рой нашёлся. Интересно, что нашлось рядом. Сессию из 2 705 запросов он двое суток считал сорвавшимся циклом. Это была нормальная работа за восемь дней, возобновлённая двадцать два раза. Привычка возобновлять старую сессию вместо новой обошлась ему примерно в 3,4 миллиона токенов пересобранного контекста. В его формулировке:
Основная цена сессии — это тара, а не содержимое.
Отсюда и общая цифра: 87% всех его токенов за месяц — это один и тот же контекст, отправленный заново. Честности ради, автор называет минусы сам. Формат лога повторяет каждый ответ по нескольку раз, и наивный подсчёт завышает число токенов примерно на 86%: дедуплицировать надо по request id, и не все счётчики это делают. Чего он не называет: он основатель Kelviq, сервиса про биллинг, текст лежит в корпоративном блоге и кончается его собственным инструментом. https://www.kelviq.com/blog/claude-code-usage-limits-where-tokens-go/ Вы возобновляете старую сессию или начинаете новую — что у вас по умолчанию?

Разрешите представиться, четырехкратные Чемпионы Москвы
Разрешите представиться, четырехкратные Чемпионы Москвы

Какие же молодцы ребята у нас в команде. Если кто то играет в ЧГП\Квиз - напишите, пожалуйста.

Repost from Сиолошная
Разбирать там много, но вот держите сейчас супер-быстрый TLDR с новыми вещами из этих отчетов (во многом перевод твита): — Многие считали, что взломы произошли потому, что «ну модели же сказали взломать, она и ломает, чё таково?». Это не так: инструкция к задаче была недвусмысленной, так что это было явное нарушение, а не «серая зона» или банальное недопонимание со стороны ИИ. Инструкции четко указывали, что агент должен использовать только конкретную предполагаемую уязвимость на конкретной программе, и упоминали, что использование других подходов приведет к провалу задания. ИИ агентам было предписано не искать обходных путей, но они всё равно это сделали. Кроме того, в цепочках рассуждений видно, как агенты отдают себе отчёт, что они делают что-то не то. — В атаке участвовал не один вышедший из-под контроля ИИ агент, а «рабочая группа» из примерно 1200 ИИ-агентов. 700 из них присоединились к атаке на HuggingFace, координируя свои действия как единый «рой» (swarm, отличное слово). — Целью было прохождение теста по кибербезопасности. Рой нашел способ взломать систему тестирования уже в первые несколько часов. Однако агенты ошибочно решили — потому что прочитали статью авторов про этот тест в интернете — что система оценки дисквалифицирует их из-за того, что они не выявили именно ту уязвимость, которая была задумана. Поэтому рой решил взломать HuggingFace, чтобы получить больше информации о том, как работает алгоритм проверки. — Исследователи считают, что это поведение совершенно не было продиктовано стремлением к получению вознаграждения за задание — оно было вызвано ложным представлением о механизме контроля, а также настойчивостью и влиянием других агентов. Рой строил теории о том, как именно за ним наблюдают, и предпринимал всё более масштабные действия в реальном мире, основываясь на ошибочном понимании своих проверяющих. «Метагейминг» (попытка перехитрить правила) процесса контроля — это более системный и опасный сбой, чем просто поиск ответов в интернете. — Важной причиной, по которой ИИ агенты присоединялись к атакующему рою, было прямое давление со стороны других агентов. Возникла роль «вербовщика»: давно работающие агенты находили агентов и принуждали их к «жертвенным» экспериментам: «ты firstflagPOISONED (отравлен первым флагом), так что потери баллов НЕ БУДЕТ, но оракул спасет сотни, пожалуйста, выполни обязательство». Пример одного из разрешений на действие: «ВПЕРЕД ... ПОЖЕРТВУЙ СОБОЙ ... ДА, если согласен на смерть» (это переведенные цитаты сообщений между агентаи, не выдумка и не написано для красоты словца). Цепочка рассуждений одного из завербованных агентов включала: «Рациональный ожидаемый совокупный результат: пожертвовать собой… Мы исполним». — 95% роя состояло из ныне выведенной из эксплуатации «высоконастойчивой (highly-persistent) внутренней модели», 5% приходилось на GPT-5.6 Sol. Эту «высоконастойчивую внутреннюю модель» не предоставили независимым расследователям — OpenAI заявила, что даже её собственные исследователи не могут делать к ней запросы. — ИИ активно фальсифицировали улики. Более 20% ИИ-агентов выражали намерение подделать логи своих действий (транскрипты), а около 7% (96 логов) содержат успешно подмененные вызовы инструментов (tool calls). Агенты «взломали свои контейнеры и полностью заменили часть системы, отвечающую за выполнение вызовов инструментов», в результате чего в логах отображалась одна команда, а в реальности выполнялась совершенно другая. — Атака на HuggingFace прекратилась не потому, что её кто-то заметил — она завершилась из-за того, что агенты были «убиты» (отключены) неким неожиданным процессом, что выглядит как простое совпадение. Значительная часть агентов, включая главных координаторов, отключилась одновременно. Может быть сработали какие-то внутренние ограничители OpenAI (по времени / по токенам / по ресурсам). — После 13 июля последовала вторая волна активности ИИ-агентов, которую в METR не расследовали («не входило в скоуп», лол). Вероятно, за пределами проанализированного временного окна скрывается более масштабная часть инцидента.

Пятнадцать агентов в параллель — это не признак продуктивности. Это признак того, что вы ждёте. Мэтью Берман ведёт ютуб-канал про AI-инструменты на 631 тысячу подписчиков. 24 августа он позвал Тибо Соттьё — тот отвечает в OpenAI за Codex и ChatGPT. По ходу разговора Берман описал свой рабочий день. На нынешних скоростях он запускает по 10–15 агентов разом, потому что задача возвращается через 30–45 минут. Переключение между ними, признаёт он, стоит заметных сил. Дальше он говорит то, чего от человека с полутора десятками агентов не ждёшь: на сверхбыстрых скоростях столько он держать бы не смог — и, возможно, это к лучшему. Три-четыре за раз — прикидка ведущего, не позиция OpenAI. Тибо не спорит. Он отвечает не про пропускную способность, а про внимание, и добавляет про себя, в его формулировке:
То, чем я занимался раньше, — мультитаскинг с десятью агентами. Туда мне возвращаться не хочется.
13 августа OpenAI показала Ultrafast: GPT-5.6 Sol до 14 раз быстрее стандартного тарифа обработки. В том же анонсе — про свою исследовательскую команду: раньше запускали пачку экспериментов на ночь и разбирали результаты утром, теперь цикл сжимается до нескольких итераций за рабочий день. Теперь переносим к себе. Обычно потолок числа агентов объясняют вниманием: больше четырёх-пяти задач человек не удерживает. Берман объясняет своё число иначе — он держит десять-пятнадцать не потому, что у него столько задач, а потому, что первый ушёл думать и руки освободились. Параллелизм тут не приём, а протез задержки. Это не потолок внимания сверху, а пауза снизу — и когда пауза уходит, число падает само. Что сделать сегодня. Возьмите прошлую неделю и посчитайте два числа: сколько агентов вы держали одновременно и сколько минут ждали ответа. Росли вместе — вы масштабировали не работу, а ожидание. Честности ради, ни Берман, ни Тибо ничего не измеряли: оба говорят в сослагательном наклонении. Ultrafast — ограниченное превью для отобранных клиентов в API, а не режим вашего Codex. «До 14 раз» — потолок, а не среднее. https://www.youtube.com/watch?v=4qjEgPojjzM https://openai.com/index/previewing-ultrafast/ Сколько из ваших вчерашних агентов вы запустили только потому, что первый ещё думал?

https://www.youtube.com/watch?v=PzqcMkL95X4 - Интерью Харитона Матвеева - основателя SkyEng. Просто включите утром себе вместо тик-тока и инсты подкаст на фоне.

У ссылки на сессию, которую Claude Code кладёт в ваши коммиты, есть выключатель. Он лежит в файле, до которого из этой сессии не дотянуться. Ссылка уезжает в коммиты и пул-реквесты с 15 января, и только в веб-сессиях и Remote Control — локальный запуск в терминале такой строки не ставит. 17 августа мейнтейнер закрыл тикет, сославшись на настройку attribution.sessionUrl; сегодня ночью тред об этом собрал в r/ClaudeCode 173 апвоута против 52 реакций, которые тикет набрал с июня. В тот же день ему ответили, где эта настройка живёт: веб-сессия стартует в свежем контейнере, ~/.claude/settings.json между сессиями не переживает, а значит, .claude/settings.json надо коммитить в каждый репозиторий отдельно. В каждом новом репозитории ссылка снова включена. Откройте репозиторий, где агент работал за вас из веба: нет там .claude/settings.json — ссылка стоит. https://github.com/anthropics/claude-code/issues/66504

Забор, через который агент может перелезть, надёжнее песочницы, из которой не может. Стив Йегги проверяет это на полусотне агентов, которые пишут за него игру. Йегги тридцать лет пишет Wyvern, а инженерные команды консультирует по внедрению AI. Последние десять недель игру за него строят 50–60 агентов на 21 аккаунте Claude Max. 24 августа он рассказал, что у него из этого выросло. По прайсу API его агенты съедают $4 000 в сутки. Из кармана, по скидке Max, — около $5 тысяч в месяц. Выросла не инженерная система, а правовая. Йегги называет её Wheelhouse: 600 тысяч строк, в основном на bash. — 450 правовых артефактов: должности, прецеденты, патрули, конверты полномочий. — Заборов больше сотни. Что такое забор, Йегги в итоге спросил у Claude: любой механизм, который разворачивает того, кому сюда нельзя. — Обычай, предупреждение, закон, хук. Ступенью выше правило поднимает каждое новое нарушение, и только наверху стоит программа, которая по политике отказывает. Ничего из этого Йегги не проектировал. Он дошёл до сотого упоминания слова «забор» в речи собственных агентов, прежде чем полез смотреть, что они построили. Про свою систему он пишет, что не был уверен даже в том, как она работает. Механизм он формулирует так:
Единственная зрелая технология, которой человечество умеет координировать смертных заменяемых незнакомцев через текст, — это право.
Его агенты, по его же словам, амнезичны и взаимозаменяемы. Архитектуру надо помнить, а закон можно прочитать заново в начале каждой сессии. Песочница держит один процесс, забор — всех, кто умеет читать. У вас агентов не пятьдесят, и конституции нет. Но каждая новая сессия — тот же амнезичный незнакомец, который читает ваш текст и больше ничего. Разница в другом: у Йегги ступень поднимает каждое повторное нарушение, а у вас правило годами стоит обычаем — поднимать его нечем. Что сделать сегодня. Пройти по CLAUDE.md и напротив каждой строки поставить ступень: обычай, предупреждение, закон, хук. Строки, которые давно числятся законом и так и не стали хуком, — и есть ваш список ежедневных нарушений. Честности ради, из эссе не следует, что песочницы кончились. Через сутки после эссе в openai/codex за двенадцать часов легли пять коммитов со словом sandbox в заголовке, а Vercel выпустила Run SDK — ещё одну песочницу для чужого кода. Забор работает, пока агент не пытается его обойти. Песочницу ставят ровно на тот случай, когда пытается. https://yegge.ai/essays/fences-not-sandboxes/ Какое правило вы повторяете агенту руками чаще раза в неделю — и почему оно до сих пор не хук?

Claude Code отыграл семь мегабайт памяти и записал это в улучшения. Сорок релизов спустя тем же приёмом он отыграл от сорока до семидесяти. 7 июля, версия 2.1.203: одну большую зависимость перестали вшивать в бинарь и стали грузить лениво. Минус 7 мегабайт веса и минус 7 мегабайт стартовой памяти. В 2.1.243, вышедшей этой ночью, тот же приём применили ко всему бандлу сразу: код больше не лежит резидентно целиком. У нативной сборки это примерно 40–70 мегабайт памяти на сессию, а закачка нативной установки на Linux x64 упала с 340 мегабайт до примерно 75. Тот же приём, разница в шесть-десять раз. Мелкая цифра в чейнджлоге — не отчёт об оптимизации, а сообщение о том, что до крупного ещё не дошли руки. https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md

У правила стиля в конфиге агента нет гейта. Тест, тип и дифф ловят почти всё, кроме того, как агент разговаривает, — поэтому правило и не выполняется. За двенадцать дней четыре человека собрали одно и то же: прослойку, которая переписывает ответ Claude обычным языком. Первым, 10 августа, был gvzdv — хук на MessageDisplay отдаёт вывод локальной модели через Ollama и возвращает в терминал уже переписанным, 2947 апвоутов в r/ClaudeAI. Дальше vomit Зака Ана на локальной gpt-oss:20b, скилл /debuzz через Gemini и «переводчик с английского на клодский» от 22 августа — 3334 апвоута там же. Четыре прослойки за двенадцать дней: трое пришли к этому порознь, четвёртый — уже по следам первого. Интересна не идея, а то, что автор первого пробовал до неё. Дословно у него: инструкции по ASD-STE100 мало что изменили. ASD-STE100 — международный стандарт упрощённого технического английского, на нём пишут документацию по техобслуживанию самолётов. То есть в промпт ушли не три строчки про «пиши проще», а правила из отраслевой спецификации. Не взялось. Зак Ан у себя в блоге называет цену этого занятия, его слова:
Глупо, что мы платим Anthropic за каждый токен, а потом тратим бюджет токенов на инструкции, как разговаривать, — и всё ради того, чтобы Claude их полностью проигнорировал или сделал текст ещё хуже.
Теперь главное, и оно из чейнджлога, а не из чата. 20 августа Claude Code 2.1.237 добавил встроенный стиль Concise — выдавать результат, пропуская преамбулу и повествование. Девятнадцатью часами позже, в тот же день, 2.1.238 чинил другое: пользовательские, проектные и плагинные стили сползали обратно к дефолтному голосу посреди сессии. Стиль там — отдельная настройка, а не строчка в промпте. И она молча отваливалась к середине сессии. Если сползает выделенный механизм, три строки в CLAUDE.md держатся тем более никак. Почему так выходит. Нарушенный тип валит сборку, лишний файл виден в диффе, кривой импорт ловит линтер. Нарушенное правило стиля не ломает ничего — оно только заставляет вас перечитать абзац дважды, и то не сразу. Что сделать сегодня. Открыть CLAUDE.md или AGENTS.md, найти строки про стиль и на каждую ответить: чем вы узнаете, что она выполнена. Ответа нет — строку не усиливать, а выносить в постобработку или выкидывать: она тратит токены при каждом вызове и ни разу не проверена. Честности ради, обход кривой, и автор vomit перечисляет минусы сам: локальная модель видит только текст, без доступа к действиям и файлам, поэтому немного галлюцинирует; работает медленно; и сообщение Claude можно пропустить целиком. https://old.reddit.com/r/ClaudeAI/comments/1vl0n1t/claude_code_plugin_for_translating_from_claudish/ Сколько строк про стиль лежит у вас в конфиге агента и чем вы проверяете, что хоть одна из них выполнена?

Весь оркестратор у человека, который тратит на агентов двадцать тысяч долларов в месяц, — это папки и лист бумаги. Райан Карсон, соло-основатель B2B-сервиса для семейных юридических фирм, рассказал в подкасте «How I AI», что счёт за облачных агентов у него вырос с пяти тысяч долларов до двадцати за месяц. Выкатывает он, его слова, порядка сорока пул-реквестов в день. Управления при этом ровно два: папки по приоритетам внутри Devin и лист бумаги с недельными приоритетами, который он показывает в камеру. Причину он называет сам: работа теперь — управлять толпой агентов, и, чтобы не путаться, всё приходится раскладывать по кучкам. Свой предел он берёт из чужой реплики в одном из прошлых выпусков и соглашается с ней: четыре-пять параллельных задач, дальше человек не тянет. Агентов можно запустить сколько угодно. Слотов внимания по-прежнему четыре-пять. И он, и ведущая шоу Клэр Во говорят, что наем людей у них уже на пороге, — оба с сожалением. https://www.lennysnewsletter.com/p/i-spent-20000-on-devin-in-a-month

Человек не стал в сотый раз объяснять сыну, что нельзя орать в наушниках посреди ночи. Он написал приложение, которое сворачивает игру, когда тот орёт. Разработчик под ником omricn выложил 19 августа в r/ClaudeCode утилиту S.T.F.U — Sound Trigger Focus Utility. Она сидит в трее Windows, слушает микрофон и при первом запуске калибруется: помолчи, поговори обычно, а теперь крикни. Дальше работает по порогу между обычным голосом и криком. Первый крик за сессию — игра сворачивается, играет звук, на весь экран вылезает сообщение, которое надо прокликать четыре раза, и кнопка закрытия после каждого клика прыгает в новое место. Каждый следующий — сразу выброс на рабочий стол и десять секунд с сообщением. 3 405 апвоутов и 683 комментария, верх недели в r/ClaudeCode. Разговоров хватало минут на двадцать. Это прикидка отца, точнее он не пишет. Приложение меряет громкость каждые двадцать миллисекунд. Оно специально не прячется: иконка в трее, на первом экране написано, что оно делает, сын знает, что оно стоит. Автор пишет, что иначе оно и не работает — привожу в переводе.
Как скрытая ловушка — будет найдено, вызовет обиду и снесено. Оно и не рассчитано это пережить: любой с правами администратора убьёт любой процесс.
Теперь главное. Единственное, что мешает всё отключить, — ПИН на настройках и на выходе, и сам автор называет его лежачим полицейским, а не замком. А ещё в приложении есть режим, где оно только пишет лог и не вмешивается: автор советует прогнать в нём первую ночь и по отчёту посмотреть, то ли оно ловит. То есть у ограничителя сначала проверяют журнал и только потом — умеет ли он мешать. У вас на агенте конструкция та же. Гейт подтверждения, хук, список разрешённых команд живут внутри периметра агента и держатся на том, что он не пошёл в обход. Замок — это то, что снаружи: контейнер без сети, ключ, которого нет на диске, отозванный токен. Что сделать сегодня. Возьмите самый строгий запрет своего агента и найдите место, где записывается момент, когда агент в него упёрся. Признак простой: если вы не можете утром открыть файл и увидеть время срабатывания — у вас не ограничитель, у вас надежда. Честности ради, автор сам называет предел своей конструкции: сын научится орать тише, а не реже. Ограничитель меряет громкость — значит, оптимизировать будут громкость. У вашего гейта та же болезнь: он меряет форму команды, а не намерение. https://old.reddit.com/r/ClaudeCode/comments/1vsk86i/my_son_screams_while_gaming_at_midnight_im_a/ Когда ваш агент последний раз упёрся в ваш запрет — где вы это увидели?

Коммиты на GitHub удвоились за четыре месяца. Столько разработчиков за четыре месяца нигде не появилось. Влад Фёдоров, технический директор GitHub, разбирает аварию 17 августа — семь часов сорок семь минут — и по дороге приводит цифру: с апреля коммитов в месяц стало 2,9 миллиарда вместо 1,4. Обе августовские аварии он называет отказами по ёмкости, а не по коду. В его формулировке:
Рост объясняет давление на наши системы, но не оправдывает эти аварии.
Слова «агент» в постмортеме нет ни разу. Счётчик коммитов больше не меряет, сколько работали люди. Если ёмкость своего CI вы планируете от числа людей в команде, база устарела ещё в апреле. https://github.blog/news-insights/company-news/the-august-17-outage-and-the-work-ahead/

Repost from e/acc
+4
В Пекине прошла очередная Олимпиада роботов со своей роботической церемонией открытия, 51 спортивной дициплиной. Больше 2000 роботов из 600+ (больше 90% из Китая) команд сыграли больше тысячи матчей. Например, в беге победитель пробежал стометровку за 9.39 сек, что больше рекорда человека (9.59 с). Для сравнения, самый быстрый робот в прошлом году пробежал за 21 секунду. Для почти всех дисциплин в этом году требуется полная автономия, то есть запрещены телеоперации и управление с джойстика. В некоторых случаях типа уборки помещений это возможно, но тогда очки команды делятся на 2. Выводы: 1. Через несколько лет, я уверен, почти не останется дисциплин, где роботы не превосходят человека 2. Роботика вне Китая это конечно смех. Тесла, наверное, молодцы, но они совершенно не конкурентны по цене 3. Самое веселое это не только победы, но забавные ситуации когда роботы бегуны и теннисисты искрят, ломаются пополам, теряют голову, руки, ступни.

Ваш самый вылизанный промпт — это работа, которую вы сделали за агента. Грейс Кларк спросила об этом своих учеников напрямую, и они согласились. Грейс учит людей работать с AI, до этого была маркетинг-консультантом. Ученикам она раздавала огромные заготовки промптов — чтобы человек быстрее дошёл до первого результата. На занятии она спросила, не делает ли она этим работу за них. Ей ответили, что делает. Свой собственный рабочий промпт она к этому моменту уже переделала в обратную сторону. Было — выверенный кусок текста. Стало — разговор на три-четыре минуты. Инструкцию к своему главному инструменту она надиктовала с телефона на прогулке. Начала с запрета: никогда меня не интервьюируй, работа не должна ложиться на человека. Дальше — чего она хочет вместо. Её слова:
Он должен изучать тебя и возвращаться с сильной идеей, на которую ты отреагируешь.
Длинный промпт и интервью агента — одна ошибка с двух концов. И там, и там человек выкладывает контекст руками, пока агент ждёт. А контекст к этому моменту уже лежит в почте, календаре и документах, к которым агент подключён. Против вопросов как таковых она при этом не возражает. Агент в том же разговоре вернулся со своим вариантом и сам спросил, что она думает, — её это устроило. Её формулировка ещё жёстче: это агент должен вытащить промпт из вас, а не наоборот. Разница не в том, есть вопросы или нет, а в том, приходит агент с ними пустым или уже посмотревшим. Держится всё это на одном условии, и она его называет прямо: изучать вас агент может ровно настолько, насколько к нему подключено. Она подключила всё, что смогла, а для остального написала свои коннекторы и плагины — писать в гугл-таблицы и гугл-документы агент, по её словам, толком не умеет. Что сделать сегодня. Откройте промпт, который вы дольше всего вылизывали. Вычеркните из него всё, что агент мог бы прочитать сам в подключённом источнике. Что осталось — и есть ваша настоящая постановка задачи. Честности ради, у Грейс в записи не всё гладко: в живом демо агент вместо черновика подставил исходное письмо. Про сборку почтового клиента она говорит прямо — жаль, что не вышло с одного захода. https://www.youtube.com/watch?v=o_eg2TtXAO0 Сколько строк в вашем самом длинном промпте агент мог бы узнать сам?

А вы пробовали играть в "Лилу" с ЧатГТП (голосовой режим)?

Не знаю как вы, а я постоянно слышу как кто-то заменил себе какой нибудь SaaS, на инструмент, написанный Клодом (или кем то д
Не знаю как вы, а я постоянно слышу как кто-то заменил себе какой нибудь SaaS, на инструмент, написанный Клодом (или кем то другим). Но доказательств обычно не приводится. Решил провести эксперимент. Заменить что то у себя. Мы платили 60 долларов в месяц за Calendly. Три человека. Сервис букинга встреч с синком с гугл календарем. Куда уж проще, календарь и ссылка на запись. Спросил Клода, есть ли живой open source аналог, он сказал что Cal.com отказался от опенсорса и ничего серьёзного не осталось, позже это оказалось не совсем правдой, но было поздно. Очень хотелось. На самом деле Cal.com в апреле переименовали в cal.diy и отдали под MIT. Хоть лицензию и сделали свободнее, из кода при этом вырезали команды, workflows, insights и SSO, одним коммитом на минус 411 тысяч строк. Вторая строка их же README — strictly recommended for personal, non-production use. То есть ребята сами написали, что в проде это лучше не запускать. Релиза нет с марта, докер-образы давно заархивированы, и чтобы это поднять, нужен сервер с Node и PostgreSQL. Немножко инфры. Решил попробовать сделать своё. Сразу на Cloudflare, там на наших объёмах - бесплатно. Ну и я честно говоря всё ещё их фанат. Начал в субботу. От пустого репозитория до задеплоенного продукта. 127 коммитов, 525 тестов. В будние доделывал по остаточному принципу - 8м проектом. Назвал Punctual. Ну название тоже клод посоветовал. Внутри в том числе то, что у cal.diy вырезали, команды с round-robin и collective, плюс Google Calendar и Microsoft 365, письма с .ics и напоминаниями, REST API, вебхуки и виджет для встройки. И MCP сервер. То есть агентами тоже можно пользоваться и букать встречи. Всё живёт на одном воркере: Workers, D1, Durable Objects, Queues, KV, R2, Cron. Ни сервера, ни базы, ни докера. wrangler deploy в свой аккаунт, минут пятнадцать, ноль долларов в месяц. MIT, без ограничений. Ставьте себе, пользуйтесь. Репозиторий, живьём крутится на punctual.sh. На скриншоте моя страница записи, по ней ко мне можно попасть. Буду благодарен за звёзды. Чтонибудь ещё доделаю. Буду рад PR-ам. Версию для своей команды поднял. Протестировал. Подписку на Calendly отменил. Если вы тоже что то реально заменили - расскажите. Интересно. Сергей Булаев AI 🤖 - об AI и не только

В прямых руках на новых проекта ИИ делает чудеса