uz
Feedback

Firibgarlarga uchmang! Telemetrio bunday kanallarni topadi va belgilaydi 👉 Belgini ko‘rmoqchi bo‘lsangiz, obuna bo‘ling 👈

AI-Driven Development. Родион Мостовой

AI-Driven Development. Родион Мостовой

Kanalga Telegram’da o‘tish

Увлекательно рассказываю о моем опыте применения AI в разработке и построении продуктов с LLM под капотом. Связь: @rodion_m_tg Чат: @ai_driven_chat

Ko'proq ko'rsatish
5 554
Obunachilar
Ma'lumot yo'q24 soatlar
+447 kun
+23130 kun

Ma'lumot yuklanmoqda...

Obunachilarni jalb qilish
Okt '26
Oktabr '26
+61
1 kanalda
Sentabr '26
+225
7 kanalda
Get PRO
Avgust '26
+70
3 kanalda
Get PRO
Iyul '26
+216
12 kanalda
Get PRO
Iyun '26
+160
5 kanalda
Get PRO
May '26
+213
9 kanalda
Get PRO
Aprel '26
+236
4 kanalda
Get PRO
Mart '26
+375
8 kanalda
Get PRO
Fevral '26
+175
5 kanalda
Get PRO
Yanvar '26
+183
0 kanalda
Get PRO
Dekabr '25
+140
0 kanalda
Get PRO
Noyabr '25
+295
0 kanalda
Get PRO
Oktabr '25
+2 177
4 kanalda
Get PRO
Sentabr '25
+181
2 kanalda
Get PRO
Avgust '25
+401
3 kanalda
Get PRO
Iyul '25
+97
5 kanalda
Get PRO
Iyun '25
+58
1 kanalda
Get PRO
May '25
+108
2 kanalda
Get PRO
Aprel '25
+102
2 kanalda
Get PRO
Mart '25
+459
0 kanalda
Get PRO
Fevral '250
0 kanalda
Get PRO
Yanvar '250
1 kanalda
Get PRO
Dekabr '240
0 kanalda
Get PRO
Noyabr '240
2 kanalda
Get PRO
Oktabr '240
0 kanalda
Get PRO
Sentabr '240
2 kanalda
Get PRO
Avgust '24
+330
0 kanalda
Get PRO
Iyul '240
2 kanalda
Get PRO
Iyun '240
0 kanalda
Get PRO
May '24
+87
0 kanalda
Sana
Obunachilarni jalb qilish
Esdaliklar
Kanallar
09 Oktabr+9
08 Oktabr+20
07 Oktabr+8
06 Oktabr+8
05 Oktabr+2
04 Oktabr+1
03 Oktabr+8
02 Oktabr+4
01 Oktabr+1
Kanal postlari
Собеседования на программиста в эпоху AI (пост для работодателей) Помните раньше была такая штука как собеседование по теории? Когда просто задают вопросы а-ля "как работает хеш таблица" или "а что там происходит при коллизиях"? Так вот, оказывается, такое и сейчас есть. Вообще, тема собеседований мне весьма не чужда, я даже когда-то готовил людей к прохождению этих самых собеседований, причем весьма успешно. Так вот, формат таких теоретических собеседований мне никогда не нравился. А теперь, в эпоху AI он и вовсе потерял какой бы то ни было смысл. Почему? Потому, что кандидату, в целом, ничего не стоит посадить рядом с собой какую-нибудь нейронку на церебрас + live модельку, которая будет слушать и выпуливать ответы даже на самые сложные вопросы быстрее, чем интервьюер закончит задавать вопрос. Более того, такие персональные агенты-помощники вот-вот вообще станут нормой (это если вдруг вы до сих пор относитесь к такому как к читерству). Собсна, при должно сноровке не сложно запромтить агента так, чтобы он вылавливал всевозможные уловки (а-ля чего это вы мне в третий раз одно и то же спрашиваете разными словами) и вообще вел себя как живой. Но как тогда? Есть радикальное мнение, что испытательный срок - это лучшее "собеседование", причем не 3-месячный, а куда более быстрый (сейчас с агентами, в принципе, за неделю-две уже можно делать выводы об адекватности кандидата). Ну ок, каждого же не будешь брать на платную испыталку - согласен. Что тогда? Мне очень нравятся два формата на собесах: 1. Обсуждение опыта: задач, которые кандидат решал ранее и особо запоминающихся проблем/граблей, которые возникали на этом пути (ок, такое и с нейронкой можно провернуть, но явно будет сильно сложнее сделать это органично). 2. И второй формат: вот удивитесь, но это лайв код ревью*. И это как раз тот формат, который не просто позволяет проверить знание той самой теории, но и понимание этой теории на практике. Ну, например, есть у вас тот самый блок вопросов про хеш-таблицы/dict (допустим, вы считаете понимание его строения важным), напишите в коде кейс с коллизией или кейс с overriden GetHashCode() => 0 и спрашивайте, что там в представленной портянке на 100 строк не так (спойлер: там все не так). Ну, или у вас есть странный вопрос про отличие Thread от Task - ну, бахните в коде `Thread.Start`с каким-нибудь async void и await'ом внутри и смотрите что на это кандидат скажет, ну и так далее - а если на ваш теоретический вопрос не получается придумать практический кейс тогда это хороший повод задуматься о целесообразности такого вопроса. Раньше подобные примеры портянок было не просто придумывать и я на РФ рынке встречал всего пару компаний, которые такие штуки делали. Сейчас же, как вы понимаете, такие задачки очень здорово можно нагенерить вместе с нейронкой - берете этот пост, описание вашей вакансии, описание компании и отправляете это все гпт 6 про с просьбой сгенерить такую портянку на часовое интервью. Ну ок, вы мне скажете, что мешает (сильной) нейронке поревьюить код и найти в нем все проблемы? То, что в любом ревью важен контекст, а контекст надо догадаться сначала уточнить и в зависимости от контекста важность той или иной проблемы будет отличаться (мы же помним как хорошо нейронки могут бесконечно находить проблемы). Проблемный код в этом случае выдается кандидату всей портянкой и в нем может быть как много проблем, так и наоборот практически не быть. Здесь еще важно отметить сам процесс - кандидат сразу побежал ошибки искать или сначала попытался понять а что вообще происходит и для чего. Ну и в целом, идеально когда вайб-кандидат не готов к такому формату и тогда его (обычно простой) live-агент просто будет хвататься за первую попавшуюся на экране проблему не вдаваясь особо в контекст и в ее важность. Короче, в таком сетапе обмануть систему становится сильно сложнее. * Речь, конечно, идет о кейсах, когда по классике нанимают конкретного специалиста на конкретный стэк, а не агентного инженера-агностика. А как у вас в компании поменялась механика собеседований? И спрашиваете ли еще в принципе про условное устройство хеш-таблиц или у вас уже AI-native полным ходом и все подкапотные детали - это что-то из разряда знаний ассемблера?) @ai_driven

2
Онбординг агентов в Enterprise кодовые базы на миллионы LoC Вместе с Максимом Ключниковым (Этихлид) поделились своим опытом о том, как добиться максимум эффективности от AI агентов на больших легаси проектах. Я рассказывал про построение тезауруса и борьбу с тех долгом, а также поделился неочевидными результатами наших бенчмарков, измеряющих эффективность контекстных движков (векторный RAG, графовый RAG). Во второй части Максим рассказал об AI-native инфраструктуре . А в третьей части к нам присоединился Глеб Михеев (Уставший техдир) и мы вместе поотвечали на вопросы зрителей, обсудили тему миграции больших проектов, а также тему объективного измерения эффективности агентов на своей кодовой базе. Запись на YouTube: Конвертируем Enterprise-проект в Dark Factory — Родион Мостовой и Максим Ключников Таймкоды: 00:00 Знакомство со спикерами и начало доклада 02:15 Что такое Dark Factory и что для неё нужно 09:25 Делаем Enterprise-проект понятным агенту 14:20 Тезаурус, инварианты и знания команды 26:05 Исследование подсистем и проблема missing change 29:20 Контекстные движки: поиск и GraphRAG 36:50 Верификация: тесты, AI QA и запуск в CI/VM 56:30 Максим Ключников: замыкаем петлю на инфраструктуру 1:25:25 Воркфлоу для типовых задач 1:28:05 Профиль готовности проекта к агентам 1:31:05 Сколько работы можно отдать агентам 1:42:30 Обсуждение и вопросы участников @ai_driven
2 392
3
Vibe-Observability и автономный баг-фиксинг Эксперементирую с автономным исправлением багов через агента - BugSink тригерит облачный claude code в момент когда возникает эксепшн, тот просыпается ищет причину и исправляет (у него полный ридонли доступ к проду + доступ к репозиторию). Проект эксперимельный, цена ошибки не велика, поэтому такая автономия допустима. Но главное другое - чтобы это все нормально работало, вайб-система должна быть предельно прозрачной, трассируемой, нужны хорошие логи, трейсы и прочие обсервабилити с телеметрией, в т. ч. для агента внутри (но что за современный продукт без агента внутри), которые из коробки кодовый агент конечно не делает нормально и остается куча пробелов. Помните мой репо vibe-stack? С оптимальным сетапом для создания не только быстрых, но и хороших и надежных MVP? Так вот я добавил туда два новых документа на эту тему: docs/observability.md это как раз про грамотный сетап обсервабилити, включая сквозные трейсы от клиента до сервера (кстати, баги на стороне клиента тоже фиксируются и летят в BugSink, а благодаря сорс мапам трейсы еще сразу деминифицируются). BugSink если что - это такой более легковесный опенсорсный аналог сентри. А сами логи и трейсы (в тч логи агента) пишутся в OpenObserve - это такой легковесный опенсорсный аналог ELK стека. В общем, для любителей поделать проекты или быстро и качественно поднять MVP чего угодно - рекомендасьен. Скармливаете доку своему агенту - и вуаля ваш прод теперь тоже AI-native, agent-ready, super-mega :) docs/autonomous-bugfixer.md А это как раз тот самый гайд по настройке автономного SRE-баг-фиксера, который просыпается по тригеру из BugSink, читает ваш прозрачный прод и PRит апдейт, который дальше автоматически мерджится тригерит редеплой. Репо: https://github.com/CodeAlive-AI/vibe-stack @ai_driven
3 008
4
Выступление за выступлением. Примерно так проходит для меня сентябрь. Много знакомств, интересных историй и опыта о том, что
Выступление за выступлением. Примерно так проходит для меня сентябрь. Много знакомств, интересных историй и опыта о том, что работает, а что нет. Вот вам ещё немного анонсов выступлений на грядущую неделю. Во вторник, 22 сентября, в 18:00 (GMT+3) на буткемпе от NAITION расскажу про feedback-loop в работе с агентами. Как правильно настроенные циклы обратной связи помогают достичь более качественного результата от работы AI-агентов. И о том, как feedback-loop помогают измерить качество процессов. А в среду, 23 сентября, также в 18:00 (GMT+3), выступят мои товарищи по авторским AI-блогам – Родион Мостовой и Максим Ключников (вы могли их видеть у меня на эфирах про код с AI-агентами и про экономию токенов). Они выступят с очень амбициозной темой: "Конвертируем Enterprise-проект в Dark Factory". Расскажут про то, какой путь надо преодолеть компании на пути к этому состоянию. Даты и время: 22 и 23 сентября, в 18:00 (GMT+3). Доступ на эфиры бесплатный, после регистрации. Регистрация в боте: @ai_meetups_bot
2 615
5
Чем мой оркестратор отличается от claude -p и т. п.? Помимо полезных инструкций, вправляющих мозги как координатору, так и во
Чем мой оркестратор отличается от claude -p и т. п.? Помимо полезных инструкций, вправляющих мозги как координатору, так и воркерам, важнейшая фишка конкретно моего pragmatic-orchestration в том, что он умеет перенаправлять воркера прямо во время работы (в Codex эта фича называется Steer). То есть, если агент-координатор во время очередной проверки видит, что условный Devin пошел не туда или что-то не учел, ну или просто вы отправили какое-то уточнение координатору, он сможет перенаправить воркера (или воркеров) прямо во время выполнения, не прерывая их работу. И это поддерживается практически для всех harnesses - где-то через ACP, где-то встроенными средствами. @ai_driven
2 781
6
Вот за что люблю очередь сообщений в Codex. Накидываешь задачи на ночь одну за другой и со спокойной душой идешь спать. Спека
Вот за что люблю очередь сообщений в Codex. Накидываешь задачи на ночь одну за другой и со спокойной душой идешь спать. Спека дошлифовывается, а Девин субагенты потом идут ее выполнять под контролем Астры. Вообще, тщательное разжевывание сложных и неочевидных мест прямо в плане сильной моделью - важнейшая штука в SDD, особенно когда сама работа делегируется агенту подешевле. @ai_driven
2 500
7
Ребят, на всякий случай уточню если кто не вчитался - по 20$ подписке до 10 октября Девин дают практически бесконечный компьют на свою новую фронтир модель SWE 2.0 - это тюн и без того очень удачной модели Kimi K3. И это пока лучшая модель-исполнитель из тех, что мне встречались - я думаю, на уровне с Sol. У К3, кстати, изначально очень хорошо с удержанием контекста на длинных дистанциях. Я напомню, что Devin недавно купили Windsurf и объедини усилия, а кор команда у них - это лютые олимпиадники - у них отличный CLI с ACP (который полностью поддерживается моим оркестратором) и довольно удобное Desktop приложение для тех, кто хочет юзать его стэндэлон - а вкладка с редактором так вообще киллер фича особенно для любителей посмотреть код. Я в основном использую девина из оркестрации из Codex или Claude Code. Так и пишу: Максимально делегируй работу Девину, на тебе только мышление, оркестрация и проверка. Где уместно - параллель выполнение. Дальше уже скилл оркестрации все, что нужно делает - правильно запускает и инструктирует как оркестратора, так и Девина (подробнее в следующем посте). В бенчах SWE 2.0 идет на уровне самых топовых фронтиров. А лимит там 10 параллельных сессий. В Desktop я его обычно запускаю на Max reasoning, а в CLI на High. Ощущение доступа к бесконечной фронтир модели сильное. ЗЫ: Отдыхайте на выходных :)) @ai_driven
3 975
8
Matn yo'q...
3 146
9
Вижу, что кейс с модерацией через Jev актуален, поэтому публикую пример реализации такого Jev-модератора для для Mastra фреймворка. Реализовано в виде кастомного InputProcessor (по аналогии с обычным LLMным ModerationProcessor): https://github.com/CodeAlive-AI/mastra-jev-moderation @ai_driven
2 195
10
Юзкейсы Jev: улучшение RAG, Browser Use, ... Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в т+1
Юзкейсы Jev: улучшение RAG, Browser Use, ... Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать вероятности каждого варианта. В принципе, современные LLM тоже такое умеют через structured output, но ключевая фишка Jev в том, что делает она это очень быстро и дешево (генерируя ответ в параллель, а не последовательно). В целом, для агентостроителей это дает возможность ускорить и удешить разные участки своих агентов / пайплайнов. Я уже успел провести эксперименты с Jev в одном из своих продуктов: 1. Внутри RAG пайплайна в качестве реранкера: в целом, реранкинг через Choice получился качественнее, быстрее и дешевле, чем реранкинг через Voyage rerank-2.5, Qwen3-Reranker-8B, Cohere rerank-v4-pro (см. скрин). Вообще, для RAGов это прям крутая возможность быстро выцепить релевантные ТОП 10 результатов и отдать их агенту как есть без лишних шагов на progressive disclosure. 2. Внутри чатбота в качестве модератора: против gpt-oss-120b (быстрой версии) получилось примерно в 5 раз быстрее и в 5 раз дешевле при том же качестве. Что я понял пока ее настраивал? То, что ее надо настраивать, промптить. Вот так с ходу трудно сразу получить хороший результат. Например, в моем кейсе с реранкингом лучше всего себя показал вариант с Choice на каждый результат (запросы отлично параллеляться) + отточенный промпт. Причем эксперименты, надо сказать, проходят очень быстро, в отличие от стандартных LLM. Что еще интересного делают с Jev? Browser Use уже запили скилл для очень быстрых оптимизаций в браузере - супер полезная штука для всех вайб кодеров и агентных инженеров: ускорение feedback loop на финальном этапе это отлично. Классный кейс Jev - применение в около real-time сценариях, когда нужна реакция на какое-либо событие: например, на встречах AI-помощник с live транскрибацией, которая каждую секунду отправляется в Jev и тот определяет какой tool call сделать. Т. е. это кейс с продвинутыми голосовыми агентами, которые просто слушают и как-то реагируют когда сочтут нужным (Jev ответит true). То есть, можно надежно и дешево собирать что-то типа ElevenLabs Agent. За сущие копейки можно делать сервисы типа trigify.io, которые отслеживают определенные события/сообщения в чатах и сообщают вам если появилось что-то релевантное. Еще, у нас в чатике канала обсуждали кейс с выбором оптимальной модели для оркестрации - в целом, если достаточно подробно формализовать критерии, то должно неплохо работать. Если вы уже попробовали Jev - расскажите про свои кейсы и результаты. Кстати, Jev уже появился в Vercel AI Gateway - что очень удобно. @ai_driven
2 643
11
Нелепости агентов Агентная разработка - веселая штука конечно. Вот планируешь и кодишь несколько дней с Астрой, Фейблом и Опу
Нелепости агентов Агентная разработка - веселая штука конечно. Вот планируешь и кодишь несколько дней с Астрой, Фейблом и Опусом, а потом на e2e вот такое вот выясняется (см. скрин и пояснения в конце). И это прям системная история - 99% получается хорошо и правдоподобно, а в каком-то неожиданном месте Но справедливости ради - это был сложный и огромный кусок работы на десятки тысяч строк кода, хоть и делался в лучших традициях SDD с хорошим планом. Выводы? 1. Делайте e2e тесты - причем как классические через условный Playwright / XCUIAutomation и тд, так и агентные "JIT" тесты - когда агент сам запускает вашу систему в около продовых условиях и ведет себя как Manual QA. 2. Рефлексируйте - если все-таки что-то вылезло несмотря на все ваши пятьсон уровней гардрейлов, обязательно ищите источник проблемы - то есть, в какой момент вашей даркфактори агентного пайплайна вылеза ошибка и как она вообще дошла до live e2e. * Контекст: я разрабатываю агентный интерфейс к одному из своих проектов (в данном случае - это MCP + skill) и вот там оказалось, что ответ в во всех MCP инструментах просто дублируется (структурированный + обычный текст) - абсолютно комичный дефект, который добрался аж до финальной стадии верификации. Live e2e же там устроен так, что сильный агент тестирует другого агента на предмет того, как тот справляется с задачами из юз кейсов - и то, как быстро он справляется, и сколько токенов у него на задачу уходит. Это, кстати, правильный подход и к evals скиллов тоже. Если тоже сталкивались с подобными нелепостями агентов - расскажите в комментариях что это было и как боролись. @ai_driven
2 666
12
DS 4.1 Flash и галлюцинации Там новый дипсик впечатляющие результаты показывает на бенчах и вообще выглядит как новый победит
DS 4.1 Flash и галлюцинации Там новый дипсик впечатляющие результаты показывает на бенчах и вообще выглядит как новый победитель по Парето-фронт (наиболее оптимальная модель по соотношению цены и качества). Но есть один нюанс, о котором мало кто говорит - это показатель модели в бенчмарке AA-Omniscience. И из топовых моделей довольно слабый результат: -5 в общем забеге (AA-Omniscience Index) и 95% в рейтинге галлюцинаций, и это прям антирекорд. Для сравнения у GLM-5.3-Flash 7 в AA-Omniscience Index и 28% показатель галлюцинаций. Понятно, что AA-Omniscience измеряет родные знания моделей, без внешних tools - тем не менее, если ваш RAG агент все-таки не найдет релевантное, дипсик с большей вероятностью выдумает ответ. Ну и конечно, напомню, что всегда следует проверять новые модельки на ваших evals, измеряющих возможности модели в ваших конкретных задачах - сейчас наличие таких бенчмарков особенно важно, т. к. новые модели выходят практически каждый месяц и потенциально могут уменьшить расходы компании на LLM в разы, не теряя при этом в качестве. Поэтому когда я на консультациях узнаю, что у команда до сих пор нет автоматизированных evals, это удивляет - ведь без них компания теряет как в деньгах, так и в качестве и вообще приходится двигаться практически вслепую. Гибкость, кстати, тоже уменьшается, т. к. с ручными проверками эксперименты становятся слишком трудозатратными, да и попросту необъективными. А возвращаясь к ds flash - предыдущая версия на наших бенчмарках работала очень медленно нестабильно, и от коллег тоже слышал подобные отзывы. Поэтому конкретно дипсики еще более важно тщательно тестировать. А как вам DeepSeek 4.1 Flash? Особенно интересно как она себя показала на ваших бенчмарках. @ai_driven
2 925
13
Дешевые токены и оркестрация В последнее время замечаю тенденцию повышения аппетитов на токены - проектов и фич кодится все б
Дешевые токены и оркестрация В последнее время замечаю тенденцию повышения аппетитов на токены - проектов и фич кодится все больше и их масштабы только растут. Если раньше я мог заваншотить агенту задачу на несколько тысяч строк кода (по спеке обычно), то теперь задачи на десятки тысяч LoC, а иногда и на сотню тысяч становятся нормой (дни или недели работы). И я заметил, что с появлением Астры этот аппетит только вырос - она позволяет делать довольно мощные планы, которые позволяют быстро получать результат, соответствующий ожиданиям. Так вот, к чему это я? К тому, что потребность в дешевых, но стабильных и быстрых моделях-исполнителях растет. Такие модели - это просто воркеры, от которых зачастую требуется просто тщательно выполнить план без отсебятины. Так вот, я уже рассказывал про очень щедрые лимиты на Grok 4.5 из подписки Grok Heavy, которую ранее можно было купить за 100$ на 3 месяца, но, похоже, что эта акция закончилась, да и грок сам по итогу меня слегка разочаровал - слишком много отсебятины делал*. В общем, китайцы сделали весьма полезный сервис для сравнения лимитов на модели в разных подписках: https://real-api-pricing.vercel.app/ (вкладка Monthly Allowance). И этот сервис как раз прекрасно подходит для поиска таких вот дешевых моделей-исполнителей. Главные инсайты оттуда: 1. 200$ подписка на Codex дает 145 миллиардов токенов в неделю на Luna - поэтому, если луна вас устраивает как исполнитель, то выбор очевиден в принципе. Я лично редко пускаю луну код писать, зато в кач-ве исследователя использую ее регулярно (иногда в десятки потоков). 2. 200$ подписка на Claude Code дает 40 миллиардов Sonnet 5 токенов. Признаюсь, соннет я вообще забыл как модель - уж очень она слаба в бенчмарках, да и на токены прожирлива. Но выглядит так, что если у вам доступна только подписка на Claude Code, то Sonnet medium/high - неплохой исполнитель с весьма большим лимитом. 3. Но, пожалуй, главная серая лошадка - это моделька Muse Spark 1.3 (Contributor) внутри OpenCode Go 10$ подписки. Это обновленная модель от Марка, которая на фоне более громких релизов осталась практически незамеченной, хотя результаты на бенчах она выбивает не хуже Опуса / Sol. Они пишут, что в OpenCode Go на нее сейчас недельный лимит 12.5 миллиардов токенов. А сами OpenCode указывают на ~45300 запросов в 5 ч. - в общем, выглядит очень жирно и вкусно. И работает она очень шустро. Единственный минус Contributor версии в том, что данные, которые вы отправляете в модель Марк потом сможет использовать для обучения новых моделей. Моя рефка на OpenCode Go, если все-таки захотите попробовать. А вот про Grok 4.5 на Grok Heavy там, кстати, явно брехня - между грок 4.5 и грок 4.6 разница в потреблении точно x10+. И из моего опыта интересное открытие - Opus 5 low (особенно на 200$ подписке) лимитов хватает на довольно большой объем работы, сильно больше, чем Sol, например. Понятное дело, что она очень хороший исполнитель. * Кстати, когда просите архитектора-оркестратора делегировать задачи мелким моделям, лучше сразу так и писать ему: имей в виду, что эта модель глуповата и может как упускать детали, так и делать лишнюю отсебятину, поэтому ставь ей задачу предельно точно и по итогам работы проверяй ее код сам. А еще, за эти полторы недели работы с Opus 5 / Fable 5.1 / Astra я несколько раз оказался свидетелем глупости Opus, которую очень здорово разруливали Fable / Astra, поэтому несмотря на бенчи, в которых Opus 5 в среднем идет почти в ровень с фейбл и астрой, в реальности на сложных задачах разница действительно ощущается. Напомню, что для делегирования работы другим моделям/harnesses я использую скилл agents-consilium - он теперь поддерживает как muse spark, так и новую дипсик, и даже умеет перебивать исполнителя когда нужно (steer). А какие модели вы используете для оркестрации? @ai_driven
2 965
14
Как вам Астра? Я пробую ей давать небольшие баг фиксы на минимальном ризонинге и она работает очень быстро и делает хорошо. Ловлю приятное ощущение, что теперь кучу хвостов можно позакрывать быстро и хорошо (надеюсь, ощущение не обманчиво). Баги исправляются в одном из моих легаси проектов, который я развиваю еще с 2012 года и он ни разу не AI ready (разве что визуальный фидбек настроен). В общем, пока выглядит так, что low (light) ризонинга вполне достаточно для большинства задач, что и бенчмарки подтверждают - DeepSWE, FrontierCode. Единственное что удручает так это быстрый расход лимитов - даже на моей 200$ подписке. С другой же стороны, когда довольно быстро получаешь ожидаемый результат, то может оно того и стоит. Кстати, с более сложной задачей по качественному RAG по большей базе нормативов пока не справилась ни Fable 5.1 max, ни Astra pro - в очередной раз убеждаюсь насколько тяжело до сих пор заодн даже современным моделям разрабатывать сложных агентов, когда нужна предельная точность в ответах. Как у вас ощущения от Астры? Согласны, что low теперь достаточно для большинства задач? @ai_driven
3 297
15
Нюансы Fable 5.1 в SWE задачах В системной карточке Fable 5.1 (которая аж на 212 страниц) как обычно можно найти множество ин
Нюансы Fable 5.1 в SWE задачах В системной карточке Fable 5.1 (которая аж на 212 страниц) как обычно можно найти множество интересных инсайтов. Вот что мне показалось интересным: * Нынче один самых важных вопросов - а какой reasoning effort оптимален? Тк мы видим из бенчей, что он напрямую влияет на цену, а значит и на то, как быстро будут уходить лимиты. Кроме того, на некоторых бенчах можно заметить, что более высокий effort ухудшает результаты моделей. Так, например, во FrontierCode (Main субсет) результаты Fable 5.1 после medium не становятся лучше. А если сравнивать medium vs max, то получим 50.9% vs 50.3%, при том, что medium почти в 5 раз дешевле max. Кроме того, в этом бенче Fable 5.1 medium даже вышел дешевле, чем Opus 5 medium, хоть и с чуть более скромным результатом (50.9 vs 53.4), что тоже слегка удивляет. А в карточке Антропик по этому поводу пишут, что на высоком ризонинге фейбл 5.1 начинает делать больше, чем ее просили. И пишут: Если дополнительно попросить модель быть лаконичнее и не добавлять лишние комментарии или документацию, она реже вносит изменения вне заданного scope. Но опубликованные benchmark-результаты получены без такой дополнительной инструкции. Напомню на всякий случай, что FrontierCode 1.1 от команды Devin - это один из немногих закрытых бенчмарков. * Результаты Fable 5.1 в DeepSWE v1.1: 67.4%. Но есть важный нюанс: Антропики рапортают, что Фейбл сделала часть задач даже тщательнее, чем того требовало задание, поэтому часть скрытых тестов завалились (стр. 168). * В DRACO (это бенчмарк на диприсерч от Perplexity), опус 5 почти на всех эффортах сильнее Fable 5.1 - вот и думайте) Любопытно, кстати, что у них там Opus 4.6 в кач-ве судьи над Опусом и другими - мб в этом дело. * И ресерчеры из METR говорят, Fable 5.1 особенно сильна, когда у задачи есть понятный фидбек. Но когда надо самому придумать, что проверять, куда копать дальше и как вообще выстроить исследование, всё заметно хуже. Вот вам и long-horzont tasks... Все равно, нужно четко критерии ставить и послеживать, чтобы не дрейфовала. Из забавного: на моей памяти впервые Антропик замерили свои модели на бенчмарке FrontierSWE (ага, еще один фронтир - он, к слову, старее всех остальных фронтиров), это бенчмаре на ультра-большие задачи на десятки а то и сотни тысяч LoC, тем самым как бы легализовав его. Получилось вот так: Fable 5.1 (0.57), Claude Opus 5 (0.52), Claude Fable 5 (0.48), GPT-5.6 Sol (0.32). Что забавного? 1. В первой версии их бенчмарка грок 4.5 как-то оказался выше опус 4.8, при том, что грок 4.5 - модель откровенно слабая. 2. Вторая версия бенчмарка пока недоступна нигде, а ссылка из System Card показыват 404. Видимо, ребята тормозят с релизом. И немаловажный нюанс: cutoff date Fable 5.1 июнь 2026, а Opus 5 май 2026. При этом, знания GPT 5.6 sol заканчиваются на фервале 2026. Что нам с этого? То, что всякие современные знания про разработку агентнов и агентную разработку из коробки будут актуальнее всего у Fable 5.1. А по моему опыту агенты очень плохо пишут других агентов (если они хоть немного нестандартные). Какой я для себя делаю вывод? Для большинства задач в Claude Code, видимо, продолжу использовать Opus medium, для планирования и второго мнения Fable 5.1 medium, а для чего-то особого сложного Fable 5.1 xhigh. @ai_drive
3 764
16
Периодически натыкаюсь на разные исследования о том, что в среднем AI не повышает эффективность разработки, что часть команд получают существенный буст, а другая часть наоборот замедляется, да и на моих консультациях это довольно распространенная проблема. Так вот, понятно, что во внедрении AI в существующие процессы и команды разработки куча нюансов и это комплексный процесс, требующий системного подхода и изучения - самостоятельного (больше шишек) либо с условным наставником, который уже успел пройти этот путь (меньше шишек, быстрее профит). Но менее очевидно другое - при внедрении такого мощного бустера, как AI замедление на начальных этапах вполне естественно. Грубо это можно сравнить с тем, как раньше все в вашем районе передвигались на велосипедах и тут все (или не все) резко пересели на автомобили, не успев получить права - да, первое время будет много аварий, но постепенно команда учится на этих ошибках и движение на дорогах сначала нормализуется, затем ускоряется (особенно, при наличии грамотного регулировщика). Главное только в течение этого процесса не расфигачить район (сломать продукт) и не растерять водителей (сотрудников) от травм, не совместимых с жизнью. А как у вас в команде обстоят дела с перфомансом после внедрения агентной разработки? И как вы этот перфоманс измеряете? @ai_driven
3 167
17
Мы в эфире: https://youtube.com/live/bByMKD_wKpQ?feature=share
3 140
18
Через пол часа стартуем стрим про Jujutsu: https://youtube.com/live/bByMKD_wKpQ?feature=share
653
19
Matn yo'q...
2 763
20
Стрим по Jujutsu: решение проблем с git для агентов Последний месяц я на своих проектах активно работаю с Jujutsu (JJ) - современной VCS от Google. Это довольно интересная попытка переизобрести Git и часть его особенностей довольно хорошо ложатся на агентную разработку и решают часть ее проблем. Например: - Конфликтные состояния допустимы - то есть, в истории реально могут лежать конфликты, которые вы с агентами сможете решить тогда, когда вам будет удобно - Возможность легко двигать, сплитить и пересобирать коммиты - Еще, там нет понятия unstaged - все, что агенты делают по умолчанию попадает в - это решает проблему потерянных изменений Но есть и разные подводные камни, которые могут мешать привычной работе и их нужно заранее предусмотреть. В общем, мне решение показалось интересным, поэтому я решил рассказать о нем вам и организовать встречу. В кач-ве эксперта я позвал Федора Шереметьева - он 2 года работает с JJ, и даже сделал свой продукт VisualJJ для более наглядной работы с Jujutsu. Федор поделиться своим флоу агентной разработки с jj и расскажет нам о том, как там все устроено. Дата: сегодня в 13:00 по МСК, 11:00 по Лондону и 15:00 по Алматы. Ссылка на стрим в YouTube. Еще, мне удалось выловить Макса Шапошникова из DeepMind поэтому, в эту субботу проведем стрим про агентную разработку и немного про карьеру, так что следите за анонсами в канале и ставьте колокольчики. @ai_driven
2 599