IT Does Matter
前往频道在 Telegram
Заставляем ИИ работать за вас. В основном про вайбкодинг в 1С: https://vibecoding1c.ru/. Обсуждаем среды, практики, MCP, ИИ агенты и роботы.
显示更多4 145
订阅者
+1424 小时
+497 天
+13030 天
帖子存档
4 151
https://github.com/pingdotgg/t3code - у кого как и у меня несколько подписок и куча агентов. Web интерфейс для агентов. Юзает их напрямую, думаю шансов блок получить нет. Для отдельных кейсов это пожалуй удобнее чем юзать автономного агента.
https://github.com/agegr/pi-web - кучно пошло. Видимо Pi обладает какой то "отдельной магией" для любителей "сделай сам", у которых теперь есть ИИ.
4 151
В дополнение к бенчу - какую модель (модели) используете (для разработки\аналатики) чаще всего
4 151
Итак, бенчмарк полностью готов, а также статья на хабр по нему. Задачи опубликованы на github. Кому было интересно - можете посмотреть.
Выводы примерно следующие:
👉 Opus по-прежнему на коне. Вцелом лучшая сейчас модель для разработки (абстрактной в вакуме)
👉 А вот если не лень настроить MCP и правила, то ситуация уже другая: GPT модели дают лучший результат и резко падает потребление токенов. А по лимитам есть ощущения что у codex они несколько более приятные.
👉 Grok и Composer, которыми без MCP по сути пользоваться крайне проблемно с MCP дают результаты на уровне топа
Итого, что я для себя выбрал как новый стек:
👉 Opus 5 для эксклюзивных задач и планирования архитектуры (думаю должно хватить лимитов курсора), может оркестрации
👉 Grok/Composer как рабочие лошадки (c MCP результаты очень хорошие, а модели дешевые и в Cursor очень быстрые)
👉 GPT для review и backup, а также у меня на них автономные агенты работают (потому как лимиты приятные и скорость хорошая). Тут отдельная подписка. Ну и длительная оркестрация тоже на них будет.
Без подписки Claude - по крайней мере дорогой, пока надеюсь обойтись. Китайские модели, пожалуй, пока тоже исключу.
4 151
Opus 5 прекрасен. Дотестировался. Сейчас это лучшая модель для кодинга в чистом виде. Дорогущий Fable точно смысл теряет. Если не хотите ничего делать а хотите результат - это ваш выбор. Ну а если не лень подключить MCP и правила - тут уже вопросики появляются, но о них напишу вскоре отдельно. Бенч ещё проверяю конечно руками, что то может поменяться, но уже незначительно
4 151
Краткий ответ на тему "чем заменить OpenRouter". Более детальный будет в статье на хабр. Но смысл примерно в том что агрегаторов куча. На 30% наценку конечно попадаем, но зато "оплата в рублях" и от юрлиц везде практически... routerai.ru вроде самая пока что приятная история.
4 151
Но предварительные выводы уже все поняли, да? Если модель работает без обвязки - важно насколько она держит агентский сценарий и умеет разными подходами добиваться конечного результата. А если у неё есть нормальные правила и MCP - важно насколько модель может при этом держать контекст и следовать инструкциями. Именно поэтому при наличии MCP и правил GPT модели показывают себя даже лучше Claude, в то время как без них - очевидно сильно проигрывают.
Ну и да, первые результаты opus 5 уже в бенчмарке. Он прекрасен :)
4 151
Давно не было моих видосов на канале. На этот раз о том как пользоваться и какие есть нюансы бенчмарка, который оказался существенно сложнее чем казалось на первый взгляд. В видео так же рассказал как бенч организован. Как автономный агент (тут hermes). Несколько суток работает над одной задачей. Поднимает среды для 1С, обновляет базы, оценивает задачи бенча, перепроверяет оценки. Решает задачи разными агентами и разными средами и оценки вместе с артефактами вносит на сайт. Думаю как пример мощи автономных агентов вполне полезно посмотреть. А бенч (ещё не готов до конца!) крайне важен в современном мире где просто кучи моделей, каждый день выходят новые и надо выбирать что то что эффективно работает с учетом обвязки и ограниченного бюджета.
4 151
А тем временем пока вы спали вышел claude opus 5. Я так понимаю про fable можно забыть... Запустил в бенч уже...
4 151
Repost from Уставший техдир
Цените какое золото!
Процитирую перевод:
Пытаюсь использовать Claude, чтобы он помогал мне писать код, но мне просто некомфортно позволять ему редактировать мои файлы. Кто-нибудь ещё так себя чувствует? Если я несу ответственность за код, мне НЕОБХОДИМО его понимать — хотя бы психологически, если не по другим причинам.
Начал программировать в 1983-м. Старый?
Дядюшка Боб (тот самый Боб Мартин, который про клинкод)
Я значительно старше тебя. Начал кодить в конце 60-х. Моя текущая стратегия — вообще не читать код, который пишут мои агенты. Только так я могу воспользоваться их продуктивностью. Вместо этого я окружаю агентов жёсткими ограничениями: юнит-тесты, gherkin-тесты, QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами и куча всего ещё. В итоге у меня очень высокая уверенность в коде, который они производят, потому что им пришлось пройти через череду всех моих ограничений и тестов».
Так вот, уважаемые вы мои отрицатели агентного кодинга. Даже такие мастадонты как Боб Мартин или мой любимый Кент Бек, приняли новый уклад и преуспели. А вы все отпустить не можете.
Писать код руками — всё, забыто)
4 151
https://github.com/comol/ai_rules_1c - важный апдейт правил если у кого Claude Code, обновитесь.
4 151
Давайте ещё по Pi решим что делать, я сейчас главным образом задумался нужен ли он в курсе или трата времени...
4 151
Поработал в Pi, впечатлился. Решение конечно маленькое, но:
👉 Можно самому отредактировать нормально systemprompt, а не "бороться" сторонними инструментами с постоянными grep и readfile при наличии нормальных инструментов
👉 скиллы и MCP можно "вшить" прямо вовнутрь - сделать условно нативными.
👉 Вообще сделать отдельную сборки - агент кодинга для 1С и даже из него плагин для EDT, к примеру, собрать
👉 Можно сделать нормальный автоматический анализ сессии автономным агентом и корректировку - самоулучшение это ужу Must в современных агентах
👉 Лютая экономия токенов как следствие
👉 Пожалуй самый быстрый рост аудитории среди кодинг агентов
4 151
https://tenchat.ru/media/5740190-bezopasnykh-itservisov-net-ii-vzlamyvayet-za-29-minut-to-chto-zaschischali-godami - ох не хотел бы я сейчас быть CEO SaaS-а, который хранит что то важное. Новость ещё в дополнение была что Kimi k3 с Redis тоже за полчаса справилась... А прикиньте если ансамбль моделей без блокеров будет 24x7 работать...
4 151
В бенчмарке моделей для 1С появились фильтры по категориям задач. Ну и для части фильтров уже доступны результаты с MCP и правилами. Можно посмотреть куда обычно уходят токены, на какую категорию задач больше всего влияют MCP, что проверяет данная задача и какая модель лучше для каких целей.
4 151
Касательно Claude Cowork и OpenAI work от которых тут многие писают кипятком, предрекая смерть крабам и гермесам.
Не претендую на истину в последней инстанции, но как бы:
👉 Для начала это вообще о разном, научитесь вы уже автономными агентами пользоваться, забудьте про эти поделки.
👉 Оба инструмента облачные, оба с политикой безопасности... Не даст вам вендор нормально, к примеру "поправить реестр". Просто не сделаете то, ради чего эти агенты нужны. Там по сути к модели добавили "скилы и обвязки" из коробки и "продают домохозяйкам"
👉 Hermes и OpenClaw у вас как сервис в инфраструктуре стоят. Инструменты от вендора могут что угодно долго и автономно делать в облаке только оно вам не надо. Ну вот надо мне чтобы у меня агент тестировал и разворачивал базы 1С - они у меня локально. Какая мне разница что он в облаке может делать.
👉 Все кто поработал с Hermes и OpenClaw знают что память и адаптивность - наше всё. И эти фичи улучшаются с каждым днём. Основная фишка в том что автономный агент учится работая. Сам себе skills пишет, пишет в память и семантический поиск по ней. Адаптирует своё поведения, устанавливает нужные skills. Это другого уровня эффект чем "мне табличку Excel создали ваншотом"
👉 3000 PR в OpenClaw - вдумайтесь в эту цифру... ни один вендор в одиночку не осилит такое
👉 У вас в конце концов нет Vendor Lock - модель можете в любое время поменять
👉 ClawHub и HermesHub - огромная экосистема Skills, ещё большая экосистема Plugins. Со своим 10-ком плагинов куда уж этим Work и Cowork.
👉 Будущее всё таки за решениями вроде Paperclip (он тоже был в курсе. Если зажались там посмотреть, попробуйте хотя бы сами изучить - это правда нужно). А Paperclip скорее оркестратор этих "крабов" и "гермесов", работающий по примерно тем же правилам.
👉 OpenAI вообще продвинутые ребята и понимают что это не одно и то же - соответственно
Итого, я считаю что Work и Cowork условно "решения для домохозяек", которые от вида чёрного окна терминала падают в обморок. Остальные как то в состоянии уже пару команд освоить и подключить себе краба или гермеса и закинуть туда 10-ок навыков (в курсе перечислял рекомендованные). Времена ваншотных экселей и пауерпоинтов прошли - пора уже думать о тру автономии а не страдать этой фигнёй.
И ещё раз, я не отрицаю - инструменты хороши и полезны в определенных сценариях. Я может даже курс по ним сделаю (после чего меня окончательно запишут в инфоцигане, но домохозяйкам у которых нет мужа айтишника правда нужен и очень полезен), но если вы уже разработку с ИИ осваиваете, то как бы автономные агенты дают куда больше мощи и гибкости, нет причин юзать "вендорские инструменты".
4 151
https://ai.google/static/documents/GoogleATLASv1.pdf - Исследование внедрения ИИ от Google подогнали:
👉 Риск усиления цифрового неравенства (ну наконец то хоть кто то заговорил). Тот кто научился будет получать ещё больше, кто не научился - ещё меньше. Всё просто, ну вы поняли я к чему.
👉 В РФ процент использования ИИ низкий (в Нидерландах зато используют больше чем населения страны... :) ), но процент использования по работе один из самых высоких
👉 Большая часть (86%) вообще ИИ юзает не для работы, а себе во благо ("но краб нам конечно всем не нужен")
👉 Чем умнее и образованнее люди и чем больше они получают, тем больше они ИИ используют в работе (были сомнения?)
👉 Больше всего юзают айтишники, но уверенно номер 2 - внезапно финансисты
