DEKSDEN notes
Ir al canal en Telegram
Мои заметки на разные темы, уровень - "для продолжающих") Vibe Coding -> AI SWE, AI Coding Tools, Agents: Claude Code, Codex, news, links Чат (!!!): https://t.me/+B1fB3sZbaVthMDhi (с) 2025-2026, @deksden
Mostrar más2 977
Suscriptores
+324 horas
+237 días
+12230 días
Archivo de publicaciones
2 979
⚪️ Свежо Предание
... но верится! Релиз кастрированного Мифоса, получившего гордое имя Fable (сказка, басня, миф, предание).
Номер версии - 5, так что это новое поколение моделей антропика. Еще и публично открывает новый класс - "Мифос класс" моделей, куда входят Mythos preview, Fable 5 и Mythos 5. Самая спосбная из публично выпущенных антропиками (хорошая оговорочка, да? AGI achived internally?)
Примерно в 5% сессий отвечать, по статистике антропиков, будет Опус 4.8 - потому что "безопасность" - вдруг вы чего то не то спрашиваете! Поэтому треды про "отупения Фабла" будут быстро контрится "это тебе Опус ответил". Хоп - и проблема отупения урегулирвоана! Удобненько))
▶️ Claude Mythos 5 ТОЖЕ ВЫХОДИТ сегодня - но для небольшой группы рисёчеров кибербеза, потому что это тот же Фабл, но без удавки по безопасности (со слегка распущенными гардами). Скоро у нас будет не пресловутый китайский соцрейтинг, а тир допуска к ИИ, видимо. Ждали ИИ по Госуслугам? Ну - получите.
Ценник конечно выше Опуса - $10/$50. Лимиты в подписке не ясны. Ну - кто бы еще иное ожидал от антропиков - хорошо, дорого, мало. Выбери все три))
▶️ Бенчи интересны - frontierCode 29% против 6% у gpt-5.5. SWE Bench Pro не интересно комментировать, но высокий. ExploitBench 78% против 34% у gpt. Ну - кто бы сомневался что оно будет умным и способным! Дорогое, что тоже надо отметить.
Продвинулось в доменах - биология, создание лекарств, геном. При этом соталось более-менее послушным, примерно на уровне Опуса 4.8.
В анонсе кучу внимания уделено теме про оебспечение безопасности в киберрисках. Ну ок, спасибо.
▶️ Доступность! тут прям интересные новости. На подписках доступно, но после 22 июня (умение выбрать дату - топ!), начиная прям с 23 июня напала на СССР модель будет доступна с подписок только ЗА ОВЕР-КРЕДИТЫ, то есть по апи ценам. ЕСЛИ вой пользователей будет очень громким если позволит загрузка серверов, НАВЕРНОЕ модель вернут в подписки (видимо, на подписке 20 баксов на 2 запроса - недельный лимит).
(с) ынжой пока не подорожало!
@deksden_notes
2 979
⚪️ Google доработал NotebookLM
Это один из продуктов, которые у Гугла здорово работают с ИИ. Интересно, что модели пока не особо ебя показывают, зато продукты с ИИ у Гугла прям достойные есть! ИИ поиск, и - вот, ноутбук
👉 Дают новинки пока только на Ultra подписку! (купить что ли дешевый аккаунт?)
Что доработали?
* поиск - агент может поискать в интернете, если нужно; при ответах на вопросы обещают что будет придерживаться источников и с цитатами;
* умеет видеть артефакты (сгенерированные, видимо) в чате;
* демонстрируют как оно думает (а я то скучал, конечно!)
Ничего, впрочем, супер прорывного - просто лучше, качественнее, удобнее местами
Ну - развивают же!
@deksden_notes
2 979
⚪️ NotebookLM - обновки тизерят
Гугол нагоняет легкий хайп. Говорит что обновки готовят, и я сумел рассмотреть в видосе что речь о новых форматах, которые будет понимать ноутбук.
Ну - полезное, да!
🔗 Анонсик: https://x.com/NotebookLM/status/2063005289885155439
@deksden_notes
2 979
⚪️ Codex.app - поиск в настройках
Маленькая QoL фича в приложухе - но удобно же! Поиск в настройках. Их становится все больше, тусуют их из версии к версии - поэтому, точно не помешает, а то и поможет!
@deksden_notes
2 979
⚪️ Dynamic Workflows на Pi
Конечно, прямо сразу как сабж появился в СС, его кто то сделал в Pi
🔗 Вот репо: https://github.com/Michaelliv/pi-dynamic-workflows
По функциям - практически полный аналог. Так что можно смотреть как оно устроено в потрохах!
(ц) любопытное, поставил ⭐️
@deksden_notes
2 979
⚪️ Рыбный день особо ничего не принёс
Четверг - бывает, что день релизов. А бывает - что нет! Вот и нынче - нет, немного жаль. Впрочем, на polymarket вроде ставки были на 11.06, а сейчас топ ставок на неделю 15-21, - не будем отобирать у коммерческих прогнозистов хлеб, инсайдерам виднее)) Просто подождем.
Откровенно говоря, особенной мотивации прямо сейчас выпускать 5.6 для клозедов я сейчас не вижу - и текущая 5.5 справляется довольно бодро с конкуренцией с опусом 4.8, а других конкурентов пока не видно. Так что я останусь со своим мнением, что 5.6 заготовлена для уконтривания гугла с 3.5 про, а гугол тоже релиз не делает.
▶️ Раз новой модели не дали, напишу тогда небольшой обзор обновок в Codex
▶️ сначала про Кодекс Апп (текущий 26.602):
• можно делать ComputerUse когда мак заблокирован (на win не работает) https://developers.openai.com/codex/app/computer-use#locked-use;
• красивый профиль со статистикой использования! можно хвастстаься расходом токенов - но пользщователи CPA - мимо, все рабоатет на базе одного аккаунта; наши 15 аккаунтов агрегироем по прежнему через ccusage;
• настойки проектов (environments) в сайдбаре
• плагины для разработки iOS/Mac приложений с поддержкой симулятора, горячей загрузки swiftUI;
• для Бизнеса/Enterprise только: Sites - делать сайтики и деплой на хостинг
• про computer use / mobile для виндов должны знать с более ранней версии 25.527
небольшие доработки codex-cli (0.137):
* теперь web search будут исполняться параллельно
* multi agents v2 будет меньше глючить при resume/fork при смене фичафлага (вы его можете выключить же!) - теперь версия агентного рантама записывается в сессию;
* небольшой тюнинг интер-агентного взаимодействия в multagents v2, яснее сделали семантику некоторых команд (assign_task переименовали в followup_task - потому что она отправляет текущему агенту сообщение и триггерит агентный ход, если агент стоит);
(ц) доработали? ну и хорошо
@deksden_notes
2 979
⚪️ Hermes Personal Agent: открытая песочница для персонального AI-агента
Открываем Alice Personal Agent — публичный open-source workspace для экспериментов с персональными AI-агентами.
В центре проекта — персональный агент Alice. Идея в том, чтобы собрать безопасную, воспроизводимую и понятную основу для разработки личного AI-помощника, который со временем сможет помогать с интеграциями, автоматизацией, документацией, исследовательскими задачами и повседневной работой.
Помимо Alice, в проекте уже лежат еще два специализированных агента:
Sam — ресерчер, который помогает с поиском, анализом и структурированием информации.
Jack — программист, заточенный под работу с кодом, разработку и технические задачи.
Сейчас репозиторий сфокусирован на фундаменте:
безопасная публичная структура без приватных данных;
шаблоны и документация вместо реальных токенов, сессий и серверных деталей;
проверки, которые помогают не утащить в open source секреты, логи или локальные runtime-файлы;
база для дальнейших экспериментов с архитектурой персональных агентов.
Проект активно развивается: постепенно добавляются новые сценарии, агенты, шаблоны, документация и подходы к автоматизации. Это не финальная “витрина”, а живая рабочая песочница, которую можно изучать, форкать, адаптировать под свои идеи и развивать вместе с сообществом.
Репозиторий: https://github.com/YTSuno796765/AliceAIAssistent
#opensource
2 979
⚪️ Void(Zero) теперь в Cloudflare
Вы знаете их продукты - Vite, Vitest, Rolldown, Oxc, Vite+
🔗 Анонс: https://x.com/voidzerodev/status/2062520542121304146
Теперь у нас две ведущие PaaS - Vercel и CF
@deksden_notes
2 979
⚪️ CPA эксперимент : агент и апи в одном флаконе
Как вы знаете, основной смысл проектов типа CLIproxyAPI - это бесшовная ротация аккаунтов.
Но проект дает openAI/anthropic эндпоинты.
Возникла мысль провести эксперимент - пока пул аккаунтов мелкий и не особо жалко если забанят. Для разработки я беру апи - разные варианты пробовал помимо вендорских. Не дешево, и это мои затраты на моей себестоимости, и от глючности моего софта зависят, поэтому определенный интерес к минимизации есть.
Решил посмотреть как будет, если брать по апи -mini модель с эндпоинтов CPA.
При этом сам кодекс работает через этот же эндпоинт))
❓ Что думаете? забанят? или фильтры не высекут запросы к апи как апи от потока работы агента? Делаем ставки))
@deksden_notes
2 979
⚪️ Текущее состояние с телефонной верификацией кодекса и "дешевыми" аккаунтами
В общем, сейчас более-менее работает такой сетап:
* берем дешевые аккаунты
* работаем со стабильного квн, я ставлю пароль и passkey на аккаунт; можно 2fa добавить - но от наличия 2fa вроде бы зависит доступность whatsapp транспорта для сообщений - такие сигналы были от подписчиков;
* берем в giffgaff esim: на мой айфон вроде до 8 esim можно уместить, на андроиды есть вроде даже адаптеры до 50 esim - но как работают с giffgaff приложением надо тестить;
* нашел несколько старых телефонов для whatsapp - потому что в роуминге смс не всегда надежно ходят, но можно и смс без заморочек;
* на каждом старом андроид телефоне пара номеров в whatsapp + whatsapp business еще один номер; клонирование еще не пробовал - там разные прошивки, не уверен что везде будет стабильно и хорошо работать - надо пробовать;
* так как на каждую esim можно по 3 аккаунта кодекса вешать, то получается что на одну esim нужен один телефон, и это позволяет 3 аккаунта обсулживать;
* я завожу все аккаунты за свой прокси в quotio;
* способа сменить номер с аккаунта нету - мне сделали рефанд на аккаунтах, которые встрали с верификацией; то есть они готовы деньги вернуть, но не сменить номер)) надеюсь финансовые сигналы до них дойдут, и будет способ реабилитации аккаунта для смены номера;
* я предложил tibo такой флоу для смены номера - делаешь заявку на смену телефонного номера; она отрабатывается до 30 дней (не менее 14 дней) - до очередного биллингового периода; в итоге одноразовые телефоны для фрода не подойдут, а норм аккаунты народа можно будет спасти в итоге;
👉 Все работает без проблем, хотя некоторые аккаунты инвалидируют рефреш токен чуть ли не каждый день.
▶️ Какие есть наблюдения от подписчиков:
* не исключено, что codex app палит прокси - и по его сигналам инвалидируют логины;
* некоторые логины в proxypal стоят без инвалидации весь срок; но работа ведется не через codex cli/app, а через droid;
* 2fa связано с достпностью whatsapp для остправки сообщений;
2 979
Еще они отмечают другие работы - посмотрите картинку в комментах, тоже положу. Отмечу только что там, по большому счету, два вида сложности (в смысле Complexity) - сложность в объеме (обработать много элементов данных) или в фокусной проработке (внимательно агентом проработать каждый элемент). Для обоих видом идея - разбить изначальный объем работы на эелменты (либо объем работы и состоял уже из кучи этих жлементов), и обрабатывать агентами элементы поштучно. Я называю это "фокусной работой", фокусированием, разбивкой на аспекты и тп. Да, активно применяю в своих флоу и подтверждаю - оч большой эффект на росте качества работы. Скорость? Сомнительно, - тут дело не в увеличении скорости, а скорее в том чтобы или просто сделать такой объем не затупив, или добиться качества проработки. Скорость как правило падает в сравнении с попытой агента нахрапом решить вопрос - но ведь он часто и вообще не справляется с задачей в одного, а при применении флоу и разбивке задачи - все отлично работает.
▶️ Далее чуток разбирается практика использования воркфлоу - забавно что нашел свой подход к соблюдению правил когда флоу policy enforcer проверяет набор правил на соблюдение в кодобазе по одному через субагентов.
Интересный кейс с отладкой - когда исследуем несколько гипотез, и получаем независимые суждения в субагентах с последующей оценкой/синтезом.
Также интересный флоу про обработку пользовательских штук c карантином (тикетов, багрепортов, отзывов) - для безопасности первый агент с ограниченными тулами читает, классифицирует, дедуплицирует и пишет структурированное саммари. А последующие стадии уже работают с предобработанными данными - что улучшает безопасность
Кейса с ранжированием нагенерированных агентом решений по какому то критерию (типа - дизайнов понаделать и указать что есть хорошо, и получить сортировку по этому критерию) - я недопонял.
Ну и роутинг задачи на модель - да, потдверждают - это недетерминированная логика, надо оценивать саму задачу и контекст. Но пока нету динамического роутинга по этапам флоу)) Они пока про такое не пишут! А мы уже обсуждали)
▶️ Кстати, для флоу оказывается можно бюджет в токенах задать!
▶️ ВАЖНО! Вот как, оказывается, по их мнению надо распространять воркфлоу - их нужно оборачивать скиллом! )) А мы обсуждали что они похожи.. А оказывается нужно просто сунуть js в корень скилла и внутри скилла сделать "вызов" воркфлоу с нужными параметрами. Пояснительная картинка в комментах.
▶️ Ну и почти дословно повторили нашу мысль со вчерашнего обсуждения - что мы на фронтире и нету никаких сформирвоанных подходов ЕЩЕ - "there's still much to discover in how to use them best"
(ц) Интересная статья, да
@deksden_notes
2 979
⚪️ Еще раз про Dynamic Workflows от Anthropic
почитва критику https://t.me/deksden_notes/814 про отсутствие кейсов, примеров и best practice и послушав ее от меня же на стриме https://t.me/deksden_notes/834 у Алмаза, Антропики раздуплились и выпустили любопытную статью про сабж - как им пользоваться. Писал небезизвестный штатный евангелист компании thariq
🔗 Вот сама статья : https://x.com/trq212/status/2061907337154367865
▶️ Во-первых, они признают что для сложных задач, требующих глубокой проработки (типа ревью кода, анализа безопасности, и в целом для управления свармом агентов) ранее нужно было делать кастомную упряжку поверх claude -p / Agents SDK. Эти упряжки позволяли организовать сложный флоу, который я называю "рельсовым флоу", потому что он детерминированно проходит ряд этапов.
Теперь Клод умеет собрать такой кастомный рельсовый флоу "на лету" в виде js скрипта - именно поэтому фича называется "Dynamic", а не просто Workflows.
▶️ Посмотрите в статье примеры задач, которые по их мнению достойны флоу, вот часть примеров:
* Using a workflow, go through my last 50 sessions and mine them for corrections I keep making and turn the recurring ones into CLAUDE.md rules
* Take my business plan and run a workflow where different agents tear it apart from an investor's, a customer's, and a competitor's perspective
* I need a name for this CLI tool. Use a workflow to brainstorm a bunch of options and run a tournament to pick the top 3.
* Go through my blog post draft and using a workflow verify every technical claim against the codebase, I don't want to ship anything wrong.
некоторые примеры любопытны, да?
▶️ Далее чуток про имеющиеся в флоу конструкции - agent(), pipeline(), parallel(). По мне так опять ничего толком не написали - но я уловил, что они отчетливо по продукту думают что людям лезть в этот js файл не нужно: Клод будет его писать сам, типа, он сам все понимает. Какую модель для какого этапа применить, как изолировать запуски агентов в рабочих деревьях - он все это типа понмиает.
Опять это не бьется с моим пониманием жизни - по мне так видеть на верхнем уровне флоу как раз необходимость для человека. Неужели и это планируется отобрать? Хм..
▶️ Далее про то - зачем рельсовый флоу? Агент устает (недоделывает, не хватает агентной выносливости), плохо делает ревью своего же кода (все это видели, что ревью надо делать хотя бы другой сессией, в идеале - другим агентом/моделью другого вендора), и забивает контекст, церяя цель.
Конечно, рельсовый флоу это все чинит насовсем, хотя и схема оркестратора с субагентами вполне помогала со всем этим справится. Я добивался досатточно надежной работы агентных флоу на оркестраторе, но детерминированный флоу работает конечно надежнее, факт!
▶️ Опять некоторыц тейк на динамические воркфлоу, которые Клод будет делать ИМЕННО под вашу задачу - типа, кастомизируя. Этого, якобы, не добиться в статических рельсовых флоу. Хм - спорно, ну - ок.
▶️ Зато далее - прикольный слайд (положу в комменты) с паттернами агентных флоу. Слайд говорящий, просто забирайте себе, он весьма полезный
▶️ Далее - кейсы, которые Антропики считают подходящими для флоу. Да, Алмаз @almazom - то что мы вчера обсуждали - тоже там, РОУТИНГ на модель)) Забавно что пруф прям через сутки получили, зацени
2 979
⚪️ Очередной ресет на Кодексе!
Рыбный день начался неплохо. Спасибо, tibo!)
(да - я хз почему процентик-другой от сессии пропадает сразу, до использования. Нолог? Вайбкодинг из хард)
@deksden_notes
2 979
⚪️ Агентные флоу - отчеты
▶️ У меня в работе часто используются агентные флоу. Это именно то, что запускают оркестраторы, да.
И по результатам работы этих флоу агенты, как водится, отчитываются.
▶️ Мне категорически не нравится как отчитывается кодекс:
* он всегда не умел общаться, и формулировал хуже клода
* клод рисовал больше красивых табличек и эмоджи в тему (не все любят, я люблю - сильно разбавляет стены текстов которые постоянно читаю)
* формат отчета надо задавать специально, потому что дефолтный может быть слабо информативен
Клод отчитывается получше, но я же кодексом пользуюсь!
❓ Почему важны эти все отчеты? Потому что флоу у меня длинные, и работы агент делает много. Желательно понимать - чего он сделал.
👉 К чему пришел. Маркдаун - это конечно круто! Но лучше md может быть только html артефакт.
Я повадился для своих флоу в конце формировать итоговый дашборд по результатам прогона флоу. Этот дашборд фиксирует главные итоги прогона флоу по стандартному шаблону (да, агент просто заранее согласованный шаблон юзает)
▶️ На скрине - результат прогона флоу mb-upgrade (этот флоу обновляет меморибанк проекта) и анализа критериев качества обновления (это отдельный ревью флоу, который проверяет что все поапгрейдилось как надо - процесс сложный, там миграция знаний, всё вот это) на одном из проектов.
▶️ Особым удобством мне кажется радарная диаграммка - потому что простой взгляд на ее форму уже говорит как все прошло. если более-менее кругленькая, все ок. "Выщерблены" с любого бока - это просадка какого то аспекта и повод взглянуть на детали этого аспекта.
Плюс диаграммы в том, что когнитивная нагрузка снижается - один взгляд, вместо прочтения таблички с показателями чего там по каждому аспекту.
▶️ Да - здесь нативно использованы субагенты, чтобы сделать анализ по выделенным аспектам. Фокусный субагент, по одному на каждый аспкт - повышаем качество.
❓ А вы заморачиваетесь с отчетами? Какие подходы? Набросайте обратной связи в комменты/чат! ⬇️
(ц) вот таким мы развлекаемся в перерывах между постами
@deksden_notes
2 979
Написал небольшой, но полезный bash-скрипт для кастомизации статус-бара в Antigravity CLI. 🚀
Интерфейс там консольный (TUI), поэтому раскрасить вывод ANSI-кодами не вышло, зато получилось аккуратно вытащить через jq всю самую важную стату из JSON-плейлоада:
🤖 Текущую модель и тир подписки
🔄 Статус агента (idle, etc.)
📉 Детальный расход токенов (Контекст ↓ / Вывод ↑)
📊 Процент использования контекстного окна
Теперь перед глазами всегда понятно, сколько контекста сожрала сессия и сколько еще осталось, всё в одну компактную строку.
Закинул исходник в Gist, кому актуально для работы с LLM — забирайте:
https://gist.github.com/ABIvan-Tech/1c979e29a378a67b88a313dfaee18464
#opensource
2 979
Периодически проверяю не добавилось ли бесплатных моделей в API NVIDIA
🎁 И вижу приятные новости - добавлены бесплатные:
- Kimi K2.6 - https://build.nvidia.com/moonshotai/kimi-k2.6
- GLM 5.1 - https://build.nvidia.com/z-ai/glm-5.1
- Deepseek v4 flash - https://build.nvidia.com/deepseek-ai/deepseek-v4-flash
2 979
⚪️ Dynamic Workflows от Anthropic - созвон на ИИшнице
🕓 Время: 18:30 МСК
Продолжительность: 1-1.5 часа.
Сегодня у Алмаза @almazom в его канале ИИшница (закрытый ИИ клуб).
Я проведу обзор голосом первого оркестратор от вендора, ну и какое-то обсуждение сделаем.
Запись выложим тут в том числе, как и материалы.
Welcome!)
🔗 https://meet.google.com/ens-megp-bxc
@deksden_notes
2 979
⚪️ Вайбкодер токен-борд
Тут вайбкодеры токенами меряются! Кто сколько B сделал.
Кому интересно - почитайте.
🔗 Тред : https://x.com/MadisonMills22/status/2061850191188127935
Напоминаю, что у нас у Валеры Ковальского тоже своя токеномерка существует
codbash с лидербордом
🔗 Репо тулы: https://github.com/vakovalskii/codbash
🔗 Борд: https://leaderboard.neuraldeep.ru/
@deksden_notes
2 979
⚪️ Github Copilot - первые отзывы о новой тарифной политике
Напомню что с 01 июня Копилот решил перейти к политике защиты детей денег от вайбкодеров, и ввел тарификацию "по использованию".
В сети появились первые отзывы пользователей
(с) https://x.com/dedene/status/2061798884603744480
@deksden_notes
2 979
⚪️ Factory Router
Только на днях писал о фишке /advisory из Claude Code
https://t.me/deksden_notes/824
И вот новый тейк на мульти-модельную оркестрацию. Тут - аналогично используем риторику "выбираем оптимальную модель под каждую задачу". Видимо, чеки на $500m впечатлили отрасль.
Но фэктори предлагает другое решение. Если advisory работает внутри сессии и подключается в отдельные моменты, тут упряжка подключается через роутер, который динамически выбирает модель для этой сессии из некоего пула.
👉 Интересно, что хинты по работе роутера можно дать простым текстом (промптом) в настройках роутера: в примере из блога приведена настройка чтобы /auth и /payments обрабатывались фронтирными моделями, как наиболее важные подсистемы. Картинку с блога в комменты кину. ⬇️
▶️ Ну - любопытно. Не совсем ясно как это будет работать, но вроде бы оригинальная штука. Я припоминаю аналог только у Gemini CLI с ее динамической марштуризацией запроса между flash/pro моделями.
▶️ По мне такой подход на уровне сессии не совсем эффективен. Мне кажется тут бы решать на уровне флоу, какой этап какой моделью делается. Я в своих флоу собираю контекст мелкими быстрыми моделями, план пишу фронтиром, кодинг делал -codex ранее (кто же его заменит нынче хз), и ревью снова фронтиром.
При этом возможность тулом позвать сильную модель на один вопрос мне кажется - супер фишкой. Антропики интересную штуку придумали.
В общем, посмотрим на разные подходы, что то покажет себя как рабочая тема! Может, так и внедрится мульти-модельная оркестрация в массы.
🔗 Анонс: https://x.com/FactoryAI/status/2061862733126275549
🔗 Блог: https://factory.ai/news/factory-router
@deksden_notes
