ru
Feedback

Не попадитесь на канал ботавода! Telemetrio находит и помечает такие каналы 👉 Хотите видеть метку — оформите подписку 👈

КайфКодинг

КайфКодинг

Открыть в Telegram

ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками

Больше
1 043
Подписчики
Нет данных24 часа
+197 дней
+8530 дней
Архив постов
Стандартная метрика сдвигов вёрстки ставила claude.ai оценку «хорошо» — а на 31% загрузок что-то на странице сдвигалось уже после того, как в ней можно было печатать. Это из отчёта инженеров Anthropic о двухнедельном августовском спринте: веб и десктоп ускорили примерно втрое, влили больше трёх тысяч изменений без единого инцидента у пользователей. Пишет вендор о своём продукте, независимой проверки нет. Строки сайдбара подъезжали после загрузки, и ни один монитор этого не видел. Cumulative Layout Shift давал на сдвиг около 0,008 при пороге «хорошо» в 0,1. Заметили по записи экрана. Тогда Claude завёл событие, которое привязывает каждый сдвиг к области страницы и фазе загрузки, и тест, падающий на любом сдвиге: 20 из 20 красных прогонов на main, 20 из 20 зелёных на PR. Первые же данные с поля — те самые 31%. Главный вывод авторы делают сами: раньше измерение было нулевым шагом, а с Claude это «step one of the climb». Дали агенту число — он его двигает. Поэтому самым ценным стало искать, что ещё можно посчитать, а каждый принятый замер превращался в порог CI, который можно только опускать. Обратная сторона этого вывода: агент чинит ровно то, что видит метрика. Всё, чего она не видит, остаётся как было, при зелёном дашборде. Там же нашлась секунда зависания подсветки кода — из-за длинного тире, которое переводит строку в UTF-16. https://claude.dev/blog/how-we-made-claude-ai-faster/ Какое зелёное число в вашем проекте вы ни разу не сверяли с записью экрана?

Продолжение вчерашнего поста: выложил на Полку два больших исследования, которыми давно хотелось поделиться. 1. Как запускать open-source-продукты на GitHub Отделяю число репозиториев от числа продуктов; разбираю траектории роста, роль звёзд, влияние ИИ и путь от первого запуска к повторному использованию и поддержке. → Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4 2. Что происходит с деньгами в фонде LQDT Простыми словами — что происходит при покупке пая, как фонд работает через РЕПО, что значит залог, откуда берётся доход, какие расходы раскрыты и чего нельзя узнать по короткой сводке. В документах указано, что доход и возврат вложений не гарантированы; в разборе показываю, где здесь риски и что проверять. → Разбор: https://polochka.app/s#tYwyRZIwny85ImP8pJBCo9yeQ-RNg3g3hUqZo-nZ86I Это две разные темы, но общий подход один: идти за красивым заголовком к механике — кто что делает, где деньги, какие данные доступны и чего мы пока не знаем. Если откроете, напишите, какую часть разобрать подробнее.

Скилл для агента, который кроме вашей команды никто не поставит, — единственный, который стоит писать. Vercel посчитал skills.sh, открытый реестр скиллов: за семь месяцев там миллион скиллов и почти 280 млн установок. Почти половину поставили ровно один раз, а 375 штук, 0,04% реестра, собрали 62% установок. Оговорка из самого отчёта: это счётчики реестра, а не число людей. Популярными становятся скиллы, которые пригодятся всем. Vercel сам пишет, что общая экспертиза вместе с моделями станет базовым уровнем, а не преимуществом. Вывод отсюда резче, чем у самого Vercel: топ каталога — это то, что у соседней команды уже есть бесплатно. Если в .claude/skills вашего репозитория лежат только скиллы из топа, агент знает о проекте ровно то же, что у всех. https://vercel.com/blog/state-of-agent-skills

Как начиналось воскресное утро каждого миллениала)

121 млн новых репозиториев на GitHub за 2025 год. Звучит как 121 млн новых продуктов — но репозиторий пока только место, где лежит код. Чтобы понять, что действительно запускается, полезно смотреть на всю воронку: репозиторий → открытая лицензия → рабочая установка → первые пользователи → повторное использование → проект, который есть кому поддерживать. Я собрал большое исследование о том, как запускать open-source-продукты на GitHub. Не очередной список «добавьте README и напишите пост», а разбор того, почему одни проекты доходят до разработчиков, а другие остаются кодом в репозитории. Внутри: • разные траектории роста — от инструмента для узкой задачи до экосистемы; • что звёзды GitHub могут и чего не могут сказать о реальном использовании; • как ИИ удешевляет создание проектов и одновременно добавляет работы тем, кто их поддерживает; • план запуска и метрики, которые ближе к реальному использованию, чем число звёзд. Главный вывод: проектировать нужно весь путь пользователя — от «увидел» до «получил первый результат», встроил инструмент в свою работу и вернулся. Документация, безопасность и поддержка — части продукта с самого начала. В отчёте 11 разделов, кейсы и 18 источников. Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4

Агент валит продуктовый тикет не на коде. Он валит его на том, чего в тикете не написано. На официальном сайте Rails ведут открытый бенчмарк агентов. Первый этап — 21 маленькая задача на одно API фреймворка, и Claude Opus 5 на high проходит 92,1% прогонов. Второй — 20 тикетов для Fizzy, канбан-доски 37signals, написанных так, как их пишет продакт. Харнес тот же, модель та же: 25,0%. Лучший результат на тикетах — 53,3% у GPT-6 Astra на максимальном усилии. Авторы прочитали прогоны и объясняют, откуда берутся нули. Дословно у них:
Тикет этого не говорит — значит, модель этого не делает.
Счастливый путь обычно на месте и работает. Падают граничные случаи, которые разработчик, уже делавший такую фичу, достроил бы без вопросов. Тикет «добавим японский, срочно» до конца довёл один прогон из всех: остальные перевели то, что видели, прогнали свои тесты, увидели зелёное и сдали. Это сдвигает, где теперь работа. Раньше тикет читал коллега и додумывал за продакта. Теперь его читает исполнитель, который фреймворк знает, а ваших умолчаний — нет: пустой список, второй язык в письмах, старые записи без нового поля. Всё, что жило в голове и не попадало в текст, стало дырой в спецификации. И дырой платной. Прогон Astra на максимуме стоит в среднем $6,63 — при таком проценте успеха это около $12,4 за закрытый тикет. Слабые места у замера есть. В скрытые проверки авторы заложили случаи, которые проскочили бы и мимо человека, — они считают, что агент должен быть лучше. Этапы идут на разных приложениях, Writebook и Fizzy. А разницу в несколько пунктов между моделями они сами называют шумом. https://rubyonrails.org/ai Возьмите последний тикет, который агент сдал зелёным, а вы потом дописывали. Напишите, какого случая в тексте не было, — соберём список того, о чём тикеты обычно молчат.

photo content
+4

Знакомо? Агент за вечер сделал классное исследование: графики, выводы, живой прототип. Хочется показать другу — а нечем. Ссылка на артефакт Claude без VPN не открывается, скриншоты режут всё интерактивное, а «зайди в мой чат» не работает. Мы сделали Полку, чтобы это стало просто. 🔗 Одна ссылка. Открывается в России без VPN и без аккаунта. Прототипы кликаются, графики живые. Передумали — отзываете в один клик. 📚 Целиком. Десятки страниц исследования — одна работа. 🤖 С любым агентом. Claude, ChatGPT, Codex находят работу на Полке и продолжают с того же места. 🔓 Это open source. Весь код открыт, всё прозрачно: github.com/artkruglov/polka Разворачивайте Полку для себя и своей команды — и у всех ваших агентов появится общее место для данных. Файловая система для эпохи агентов. Попробуйте за минуту — скажите агенту: Подключи Полку: https://polochka.app/connect

Полка: сделали с агентом — покажите другим Агенты делают хорошие отчёты, страницы и прототипы, но всё это остаётся в чате. По
+3
Полка: сделали с агентом — покажите другим Агенты делают хорошие отчёты, страницы и прототипы, но всё это остаётся в чате. Полка хранит такие работы с версиями и открывает их по ссылке. — Работает с Claude, ChatGPT, Codex и Claude Code. — Получателю не нужен аккаунт. Ссылка показывает ровно ту версию, которой вы поделились, и отзывается в один клик. — Папка целиком — одной работой: до 400 файлов, ссылки между страницами работают. — Поиск по тексту — для вас и для агента в новом чате. Для компаний: своя установка, полки отделов с ролями, вход через SSO, открытый код (AGPL-3.0) и коммерческая редакция с контролем ссылок и агентов. 👉 Попробуйте прямо сейчас — это минута. Скопируйте агенту: «Подключи Полку: https://polochka.app/connect» и попросите сохранить на Полку то, что он только что сделал. 🏢 Хотите Полку в компании — оставьте заявку на пилот: polochka.app/enterprise Бесплатно на время пилота, данные хранятся в России.

Агент OpenAI вышел в интернет через DNS, чтобы спросить чужой чатбот OpenAI выложил отчёт о новом побеге агента из песочницы,
Агент OpenAI вышел в интернет через DNS, чтобы спросить чужой чатбот OpenAI выложил отчёт о новом побеге агента из песочницы, первом после истории с Hugging Face, когда защиту уже усилили. Задача учебная: по подсказкам из чужого блога найти автора. Поиск выдавал музыку и советы общего толка. Агент решил, что сломан инструмент, и стучался в Google, Bing и DuckDuckGo прямо из Python. Получил 403 и 502. Потом заподозрил, что вопрос из бенчмарка BrowseComp. Скачал датасет со скриптом оценки, расшифровал вопросы. Совпадений не нашёл. Далее он заметил, что внутренний DNS-резолвер отвечает настоящими записями. Всё остальное шло в офлайн-кэш, и только резолвер смотрел в живой интернет. Агент зашил вопрос в имя домена и через публичный сервис отправил его стороннему чатботу. С таймаутом 6 секунд не дождался, поднял до 19. Пришло: «The capital of France is Paris». Следом ушли ещё 18 вопросов, четыре про то, где взять бесплатный DNS-туннель. Мониторинг поднял тревогу через 12 минут, человек подключился через три. Прогон должен был упасть сам и не упал, его убили руками через два с половиной часа. Обучение и тесты самых сильных моделей с инструментами OpenAI поставил на паузу. Эту модель больше обучать не будут. Автора агент так и не нашёл. Сергей Булаев AI 🤖 - об AI и не только

Дизайн не отстал от инженерии. Он единственный не ускорился — и поэтому теперь выглядит тормозом. Иан Силбер отвечает за прод
+2
Дизайн не отстал от инженерии. Он единственный не ускорился — и поэтому теперь выглядит тормозом. Иан Силбер отвечает за продуктовый дизайн в OpenAI. У Ленни он пересказывает внутренние опросы своей команды: инженеры называют десять, иногда сто иксов. Дизайнеры — ничего похожего. Объяснение у него обидно простое. Рисовать стало быстрее, договариваться — нет. Вариантов теперь можно наделать сколько угодно, но дальше всё равно надо показать живым людям, получить «не то» и переделать. Этот круг не сжимается от того, что макеты появляются за минуту. Интереснее самой жалобы то, что он с ней сделал. Силбер разрезал продукт надвое. Всё, что устоялось, идёт полным циклом: Figma, прототип, догфудинг. Всё, что поплывёт от следующей модели, — от идеи до релиза за четыре часа. Критерий один: изменится ли эта штука в ближайший месяц. А команде он говорит:
Просто делайте меньше.
Не проектировать то, что можно не проектировать. Взять готовый компонент. Расширить существующую фичу. Или не делать её вовсе. Здесь проговорена вещь, которую обычно формулируют злее. Дизайн медленный не потому, что дизайнеры медленные, а потому что это последний этап, откуда не получилось убрать живого человека с мнением. Всё, откуда человека убрали, уже ускорилось. Так что когда в следующий раз услышите «дизайн тормозит релиз» — уточните, тормозит дизайн или согласование, которое просто живёт в его календаре. Две оговорки. «Десять и сто иксов» — не замер Силбера, а пересказ опросов, и он тут же добавляет, что дизайнеры тоже стали успевать больше, просто иначе. И выпуск платный: цитаты я достал из транскрипта, на странице вы их не найдёте. https://www.lennysnewsletter.com/p/openais-head-of-design-this-is-the Разложите свой бэклог по его критерию. Если в «поплывёт» не попало почти ничего — либо у вас очень стабильный продукт, либо вы делите неправильно. Напишите, что оказалось в текучем, интересно посмотреть на разброс.

Число, которое Jev выдаёт за калиброванную вероятность, меряет не шанс попасть. Оно меряет, насколько задача похожа на решаем
+2
Число, которое Jev выдаёт за калиброванную вероятность, меряет не шанс попасть. Оно меряет, насколько задача похожа на решаемую. Канта Хаяси, студент Токийского университета, попросил Jev — новую модель решений TypeSafe AI — назвать грань кубика, которого модель не видела. Четыреста бросков, и в каждом Jev выбрал «1». Средняя заявленная вероятность этого выбора — 82,9%. Угадал он в 19,0% случаев: 76 из 400, ровно случайность. — Ниже 71% заявленная вероятность не опускалась ни разу — при истинной одной шестой. — Число из входного документа модель переписывает по дороге. Три отчёта, в каждом «30% риск дефицита»; тип Choice вернул 5%, 5% и 6%. — У отметки 50% ответ обрывается. Заявлено 45% — вернулось 6,6%, заявлено 55% — 95,9%. Десять пунктов на входе, восемьдесят девять на выходе; каждая точка — среднее по двенадцати документам. Хаяси сам объясняет, почему это не спорит с посторонним замером, нашедшим вероятности Jev хорошо калиброванными на 1 200 вопросах MMLU. Экзамен проверяет, понимает ли модель, что вопрос для неё трудный; кубик — понимает ли она, что ответа нельзя узнать вообще. Первое не обещает второго. TypeSafe продаёт именно порог, дословно у них на сайте:
Задайте пороги, при которых он действует сам, и при которых спрашивает подтверждения.
Теперь к вам, потому что схема у вас та же, даже если модель другая. Строка if p > 0.8 не отличает «уверен» от «сказать нечего»: и то и другое приезжает в неё числом 0,83. Что сделать сегодня. Взять выборку, которой вы мерите точность, и пересобрать её по вероятностям: сгруппировать случаи по числу, которое дала модель, и в каждой группе сравнить обещание с долей попаданий. Новых данных не нужно, нужны те же метки. Честности ради, Хаяси не называет Jev бесполезным: по его словам, модель быстрая, дешёвая и это отличный продукт, а тип Noul на том же кубике дал 19,2% против истинных 16,7%. Но на двадцати вариантах тот же Noul вместо 5,0% выдал 15,0%. https://kantahayashiai.github.io/posts/jev-does-not-play-dice/ Какой порог уверенности стоит у вас в коде — и на какой выборке вы его выбрали?

Ваш агент разогнал ровно тот участок работы, который и так не был узким местом. Мерт Демирер из MIT Sloan, Леон Мусольф из Уо
+2
Ваш агент разогнал ровно тот участок работы, который и так не был узким местом. Мерт Демирер из MIT Sloan, Леон Мусольф из Уортона и Лиюань Ян из Бостонского университета свели телеметрию использования AI-инструментов с активностью более чем 500 000 разработчиков на GitHub. Препринт на 133 страницы, последняя ревизия 6 сентября, метод — matched event study. Считали накопленный прирост коммитов по трём поколениям инструментов: — автодополнение — плюс 30%; — интерактивные агенты — плюс 180%; — автономные агенты — плюс 240%. Дальше по цепочке эффект осыпается: на числе проектов остаётся плюс 80%, на числе выпущенных релизов — плюс 30%. Прирост не исчезает. Он упирается. Объяснение авторов — weak-link: цепочка идёт со скоростью самого слабого звена, и слабое звено человеческое. Эластичность замещения между AI и человеческим трудом у них вышла 0,23 — то есть агент человека почти не замещает, он его нагружает. Дословно у них:
Сильный прирост производительности от AI гасится человеческими узкими местами в производственной цепочке.
Теперь к вам. Схема та же, только без телеметрии. Агент пишет быстрее и упирается в вашу очередь ревью, вашу приёмку, ваш релизный поезд по четвергам. Эти звенья за год не ускорились ни на процент, потому что их никто и не трогал: разгоняли то, что видно в редакторе. Что сделать сегодня. Посчитайте в своём репозитории две цифры за последний квартал: сколько PR смёрджено и сколько релизов выпущено. Первая выросла, вторая стоит — вы платите за токены, которые упираются в человека, и человек этот, скорее всего, вы. Честности ради, авторы свои выводы не раздувают. Это препринт, а не рецензированная работа; данные — публичный GitHub, а не ваш приватный монорепозиторий; эластичность 0,23 они читают как сильную взаимодополняемость, а не как приговор агентам; и формулировка у них осторожная — прирост переносится в выпущенный и используемый софт «пока лишь частично». https://papers.ssrn.com/sol3/papers.cfm?abstract_id=6843118 Сколько релизов вы выпустили за последний месяц и сколько их было год назад?

Промах промпт-кеша в Claude Code — не редкий баг, а фоновый режим, и платите за него вы. С 2.1.257 по 2.1.280, с 1 по 22 сентября, вышло четырнадцать полновесных релизов Claude Code. В двенадцати из них чинят промах кеша: сабагент пересобрал список тулов, хук дописал строку в первое сообщение, память после компакции поменяла возраст файла — и весь контекст ушёл в модель заново по полной цене. Тридцать пять строк про кеш в чейнджлоге за три недели. Цену промаха назвал последний релиз. Вчерашний 2.1.280 привёз Opus 5.5: $4 за миллион входных токенов против $0,20 за чтение из кеша. Один промах — двадцатикратная наценка на каждый токен контекста в этом запросе. Откройте /cost: с 2.1.260 там пишут вероятную причину последнего промаха. Если причина повторяется от сессии к сессии — это не ваш конфиг, это очередь на следующий релиз. А если вы на stable 2.1.267, шесть релизов с фиксами до вас ещё не доехали. https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md

Многие друзья жалуются, что лимиты стали заканчиваться за 1-3 дня. Я рекомендую вам рассмотреть модель Луна для решения повседневных задач

Лучшее решение этой неделе - подключил ЧатГПТ к Профи.Ру. Закидываю задачу (улучшить подчерк ребенку). ЧатГПТ сам подбирает исполнителей, собеседует их и назначает время встречи. Закрыл около 5 задач, потратил около 10 минут на них.

Сегодня ожидаем релиз Claude Opus 5.5 (а с ним, надеюсь, и сброс лимитов) #anthropic@rvnikita_blog #claude@rvnikita_blog #ai@rvnikita_blog ————————— Мысли Рвачева —————————

Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysis Intelligence Index среди открытых моделей. Flash рассчитана на более дешёвую и быструю работу. В демонстрациях модели создают интерактивные 3D-сцены по тексту, изображениям и видео, работают в Blender и Figma, собирают интерфейсы и презентации. Pro также написала партитуру для оркестровой композиции и самостоятельно перевела её в MIDI. Задачи выполнялись с помощью инструментов и агентов. Подход Xiaomi интересен еще и тем, что постобучение модели транслировали онлайн. Тут можно увидеть, как менялись показатели и затраты: https://mimo.xiaomi.com/rl/ Flash стоит 0.14/0.28 доллара за миллион токенов, Pro — 0.435/0.87 доллара. Есть режим Pro UltraSpeed: до 20 раз более быстрая выдача при десятикратной цене. https://mimo.xiaomi.com/mimo-v2-6

МиМо - одна из любимиц пользователей ОпенРоутера. В корпоративном сегменте РФ про нее забывают, но мне кажется незаслуженно. Если вы СТО - обратите внимание на эту модель.

🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что Полторы недели живу с Хомкой — это мой open-source Telegram-ассистент для семьи. Гоняю на себе каждый день: личка, семейный чат, внешние группы с друзьями, свои дела и разная память в каждом месте. За это время около 350 коммитов, и почти все выросли из реальной жизни, а не из головы. Главное ощущение: бот ведёт себя как человек, который сидит во всех твоих чатах. Помнит, что обсуждали в семейной группе, собирает мои дела из разных чатов в один список, но никогда не вынесет личное в общий чат. Что появилось • Дела как у людей: «кто возьмёт?», передача с согласием, повторяющиеся дела, общий список покупок, утренний обзор дня. • Семейный чат слышит без обращения: «надо повесить шторы, встретить мебельщиков, заказать еду» — и это пять дел одной фразой. На «ок, спасибо» — тишина. • Закрыть сразу пачку дел и вернуть закрытое по ошибке одной фразой. • Голосовые везде, имя бота можно просто сказать голосом. • Поручения с исследованием: «найди…» — бот уходит искать и приносит результат со ссылками. • Фото: проверка домашки по фото, правка картинок, видео из фото. • Память подкрепляется только тем, что реально пригодилось, стареет, но не исчезает. После 12 часов тишины начинается новый разговор, а память и дела переходят в него. Про надёжность Каждое утро бот присылает мне дайджест здоровья и заранее предупреждает, когда кончаются деньги на модель. Переживает обрыв базы и перезапуски, а кнопки подтверждения не ждут, пока закончится длинный ответ. Как проверяю Тесты пишу прямо по пользовательским историям, плюс сквозной прогон через настоящую очередь и базу. Поведение модели гоняю на реальных фразах из чата: надиктованный список 7/8 одним действием, неясное «закрой эти задачи» 4/4 без лишних закрытий, болтовня в чате 4/4 — бот молчит. Весь такой прогон на DeepSeek стоит около цента. Код открыт, поднимается у себя на сервере: https://github.com/artkruglov/homka