en
Feedback
DEKSDEN notes

DEKSDEN notes

Open in Telegram

Мои заметки на разные темы, уровень - "для продолжающих") Vibe Coding -> AI SWE, AI Coding Tools, Agents: Claude Code, Codex, news, links Чат (!!!): https://t.me/+B1fB3sZbaVthMDhi (с) 2025-2026, @deksden

Show more
2 996
Subscribers
-424 hours
+297 days
+12630 days
Posts Archive
Codex Camp :: пятница, 12.12 Сабж тут: расскажут про кодекс, покажут мастеркласс, будет PM. Может будут новости про грядущие фичи! 🔗 https://every.to/courses/codex-camp/purchase Бесплатно, к слову!

Google Jules :: Scheduled Tasks Выкатили новую фичу - задачи с запуском по расписанию! Довольно очевидная фича для фонового агента, нужная и удобная. Теперь можно делать что то по расписанию. Например, обслуживать меморибанк, или проводить ревью. 👌 Возможно, у меня появился вариант наконец припахать Жульеса! 🔗 https://jules.google/docs/changelog/#put-routine-maintenance-on-autopilot-with-scheduled-tasks #post @deksden_notes

Google Stitch + Gemini 3 pro В ститче включили g3mini https://x.com/stitchbygoogle/status/1998837129905058198?s=46 Уже можно тестить!

Преждевременный Jules Когда на рынок высыпала такая толпа CLI агентов, работу лучше перехватывать чем раньше, тем больше дост
Преждевременный Jules Когда на рынок высыпала такая толпа CLI агентов, работу лучше перехватывать чем раньше, тем больше достанется! Поэтому Жульес нынче может сканировать до 5 репозиториев и находить там тэги и предлагать их поправить. То есть теперь даже issue на гитхабе не делаем - ставим теги #todo и он сам создаст задачи В общем, чем дальше, тем интереснее Читаем тут: 🔗 https://jules.google/docs/changelog/#enable-suggested-tasks-to-let-jules-find-issues-proactively (ц) На ходу подметки рвут! #post @deksden_notes

DeepAgents CLI Ну - давайте еще одного CLI агента! Давно их что то не было, уже 2 часа прошло Очередной тут, от ЛэнгЧейна: https://github.com/langchain-ai/deepagents/tree/master/libs/deepagents-cli https://blog.langchain.com/evaluating-deepagents-cli-on-terminal-bench-2-0/ ▶️ Этот напитоненый, с memory, с агентами, и, из свежих особенностей - поддерживает скиллы! Подписок нет. примерно так. #post @deksden_notes

Статистика СС В свежем релизе .64 в СС добавили слеш команду /stats Можно играцца
Статистика СС В свежем релизе .64 в СС добавили слеш команду /stats Можно играцца

Откуда они все ползут?! Codebuff Вы удивитесь, но я набрел на еще один CLI агент 🔗 https://www.codebuff.com/ Есть небольшой Free tier - 500 кредитов TypeScript, вроде шустрее СС. Фичи слегка нестандартные, надо будет посмотреть внимательнее. Knowledge files, Agents Store... #post @deksden_notes

И еще один: goose (by block) Еще одного консольного агента увидел: 🔗 https://block.github.io/goose/ Его отселили в новый Foundation под эгидой Linux Foundation, вместе с протоколом MCP и AGENTS md стандартом. Причем, сам агент вроде бы неплохой, на расте, с субагентами, расширениями, mcp, планмодом и так далее! Жаль смотреть я его видимо не буду - он по токенам работает. Ну, будем иметь ввиду, что есть и такое #post @deksden_notes

Еще один: Mistral Vibe CLI Давайте уже CLI от каждого вендора, раз пошла такая ... мода! 🔗 https://mistral.ai/news/devstral-2-vibe-cli Ничего не могу сказать про сабж кроме того, что он есть. Не уверен что в ближайшее сам буду тестировать. Но для "попробовать" - самое время, пока Devstral 2 модель мистраль дает пробовать бесплатно. Потом - оплачиваем токены. Хаб агента тут: https://github.com/mistralai/mistral-vibe Питон, как ни странно. Не ts, не rust. Это они с кими теперь в одном лагере питонистов. вебпоиска в тулах нету. кастомные слеш команды есть, без параметров агенты есть, с настройкой модели, но в toml файлах ("нестандартный", не md как у CC). Если пускается в ZED, видимо поддерживает ACP. #post @deksden_notes

А вы гоняете тесты под агентами?

Тестирование, бизнес-процессы Я уже затрагивал эту тему ранее, в канале, в лонгриде про тестирование : https://t.me/deksden_notes/249 ▶️ Сейчас хотел сказать про немного другой аспект той же проблемы. Когда я делаю какие то системы, я прежде всего на любую фичу планирую какой то интеграционный тест. По мне елать агентами какую то фичу без такого теста - штука бесмысленная! Даже если сделать все юнит тесты, проработать их стратегию тестирования отдельно, даже если сделать полуинтеграционные тесты, и интеграционыне, все равно могут получаться неработающие системы ℹ️ Напомню применяемую мною иерархию тестирования: - юнит тесты: тестируют базовую логику модулей в изоляции; все зависимости обязательно мокнуты, то есть демонстрируют строго детерминированное поведение; - полу-интеграционные тесты: когда части системы тестируются во взаимодействии с другими, но другие части могут быть частично моками или стабами; - компонентные тесты: когда в UI есть что то сложное, и его надо отдельно протестировать на правильность поведения; - тесты - сценарии: по сути большие интеграционные тесты, бизнес-процессы; когда система работает в приближенном к боевому состоянию и тестируется именно полнофункциональная работа по какому то пользовательскому сценарию с реальными компонентами. 👉 Основной поинт этого поста: главным для меня является интеграционный тест / бизнес-процесс. Без него совсем нельзя в AI SWE. Можно без юнит тестов, без компонентных и полу-интеграционных. Они просто подтягивают качество элементов системы. Но основным способом проверять функционирование системы я вижу только бизнес-процесс, без него из элементов может система то и не сложится. "Угадал все буквы но не смог назвать слово!" ❓ Зачем тогда другие тесты? Потому что без них бывает довести интеграционный тест до зеленого состояния совсем затруднительно - слишком много проблем в элементах, из которых состоит система. Если в каждом из них есть "люфт", то система может стать практически неработоспособной - будет все время "виляться" во многих местах, и стабилизировать будет сложно. Поэтому качество системы подтягиваем на всех возможных уровнях: начиная с lint, продолжаем юнит тестами и полу-интеграционными/компонентными. ❓Что за сценарии? Это практически те же юзкейсы из фич/эпиков аджайла. То есть "хотелка" про то, как пользователь работает в системе, только переведенная в "автоматический" режим. 👉 А вот второй поинт поста: для запуска таких тяжелых сценариев я всегда делаю агентное воркфлоу. Подход такой: я делаю некую инструкцию для ИИ агента: - как пересобрать систему (потому что часто тест гоняется после проведенной доработки, и нужно собрать систему чтобы подтянуть изменения), - как поднимать систему в тестовом состоянии (если у вас 3-5 компонентов, то это тоже уже процесс), - как запустить тестовый сценарий (каким раннером) - какие ключевые метрики мы ожидаем (если сценарий оформлен как тест в некоем раннере, то тут просто - тест зеленый); - иногда бывает что этот сценарий - это не тест, а полностью агентный воркфлоу, когда агент чего то запускает, чего то делает, и контролирует результат; по сути - тот же тест, но в виде агентного воркфлоу; - как интерпретирвоать результаты - чтобы агент понимал критерии успеха и неуспеха, - как фиксировать отклонения: какую информацию и где собирать если есть отклонение (в каких логах покопаться, откуда их вытаскивать, может быть в БД сходить или в хранилище и исследовать артефакты); - где лежат фикстуры процесса: тестовые наборы данных (файлы примеров, сиды БД, ...). Идеальный вариант - это с агентом вместе написать интегарционный тест. чтобы он сам прокликал ui и сделал playwright тест на эту тему. Надеюсь инструменты типа антигравити с браузером как раз для таких штук и будут оптимальны! ▶️ Вы верно увидели сходство: по сути дела, я оформляю СКИЛЛ для запуска этого бизнес-процесса. 👉 Когда кодекс запустит скиллы, придет пора оформить это в виде реального скилла, раз этот формат прижился! 👌 И - да, тесты вполне может гонять зайка, что дешево, шустро и в качественной упряжке.

Google Stitch 🎁 Shipmas У гугловского Стича неделя релизов! Первый - теперь оно генеририт код и экспортирует его! Можно получить работающий прототип. Внутри - нанобанана про. https://x.com/stitchbygoogle/status/1998151360446181626?s=46 Такими темпами и попробовать его руки дойдут!)) (Ц) за таким мы посматриваем!

Claude code :: background agents (2.0.60+) Теперь можно запустить агента в фоне, и продолжать чатится, пока он будет работать
Claude code :: background agents (2.0.60+) Теперь можно запустить агента в фоне, и продолжать чатится, пока он будет работать - почти как bash команды отправляются в фон, и управляются через менеджер фоновых заданий. Агента можно опрашивать - чего там у него делается. на скрине - пример (взят с реддита) Выглядит удобным. Как применять для работы - надо придумать. #post @deksden_notes

Codex : todo список задач ... у меня пропал совсем. Модель туда не пишет, и я его уже порядком времени не видел! У всех так? Если да - что бы это значило? Ждем нормлаьный spec / plan mode? с проработкой плана и потом подруливанием модели чтобы она его откатала по полной? Было б прикольно #post @deksden_notes

Сделал менеджера Саб Агентов для Антигравити - можно использовать в качестве саб агентов и Codex и Claude Code - https://github.com/OleynikAleksandr/antigravity-subagents

Codex 5.2 WEN? (следующий вторник?) "Утечки" бенчмарков довольно впечатляющие. Публику прогревают капитально - клиенты должны
Codex 5.2 WEN? (следующий вторник?) "Утечки" бенчмарков довольно впечатляющие. Публику прогревают капитально - клиенты должны знать что у клозедов еще есть тузы в рукавах и не стоит отменять подписки в пользу гемини 3! Обратите внимание с кем сравниваем)) Кстати, с опусом не сравнили! посмотрим на цифры как выйдет. В любом случае - круто как работает конкуренция! Как пользователь я рад (ц) "Такое мы ждем" #post @deksden_notes

Оправа / Упряжка Словарик тут: https://t.me/deksden_notes/174 Вот авторы бенча решили прогнать его в родной оправе моделей и
Оправа / Упряжка Словарик тут: https://t.me/deksden_notes/174 Вот авторы бенча решили прогнать его в родной оправе моделей и зарядили клода внутри СС. Результат на графике - цифры показательные. почему то опус 4.1 только припал, во всех других случаях рост, почти до исчарпания бенчмарка. 👉 Резюме: оправа капец как важна и дает эффект. Поэтому тестировать модели надо не в курсоре, а в родных упряжках (kimi cli, например). Ну или не делать вывода о модели в чужой упряже. #post @deksden_notes

▶️ Агенты как раннеры Пришла в голову идея затестить как работают агенты как раннеры. Запускал идентичные тесты (набор юнит-тестов одного из проектов) в разных средах Сравнивал: - jetbrains тестовый раннер из их ИДЕ - запуск в jetbrains команды pnpm test:unit (terminal) - запуск этой же команды в codex 0.65 из под агента - запуск этой же команды в СС 2.0.59 из под агента (glm) Итоги: - jb: 41s - jb terminal: 39s - codex: 109s - cc: 43s 🤷‍♂️ скрины в комментах

⚪️ TUI ренессанс - discordo В последнее время cli инструменты переживают прям ренессанс. Но, мне кажется - с перегибами. вот такое, оказывается, бывает: 🔗 https://github.com/ayn2op/discordo это TUI клиент для дискорда Мне одному кажется что это - перебор? #post @deksden_notes

ReactGrab Оказывается, не все слышали про такой довольно удобный фронтэнерский агентный инстурмент: штука, облегчающая указание нудных элементов для агентов. Такой data-testid на максималках)) Почитать тут: 🔗 https://www.react-grab.com/blog/intro ну и сам сайт тоже Репо: https://github.com/aidenybai/react-grab Видос в ридми посмотприте для понмиания. Мне показалось полезной! Думаю при случае вместе с Playwriter (чуть выше про него заметка) юзать, чтобы агентный сетап был полноценный. #post @deksden_notes