AI Makes Me Hate
الذهاب إلى القناة على Telegram
AI systems engineer и скептический практик, который проверяет и внедряет AI на реальных задачах разработки
إظهار المزيدلم يتم تحديد البلدالفئة غير محددة
558
المشتركون
لا توجد بيانات24 ساعات
+197 أيام
+8830 أيام
أرشيف المشاركات
AI как экзокостюм разработчика: ссылки к докладу
АГЕНТЫ И HARNESS
Anthropic: Demystifying Evals for AI Agents - https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
Pi Agent Harness - https://github.com/earendil-works/pi
Agent Squad: оркестратор для iOS - https://github.com/2FastLabs/agent-squad
SKILLS И ПРОЦЕСС РАЗРАБОТКИ
Superpowers - https://github.com/obra/superpowers
Skill Conductor - https://github.com/smixs/skill-conductor
OpenAI: переосмысление skills и промптов для GPT-6 Astra - https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra
КОНТЕКСТ, ПАМЯТЬ И БАЗА ЗНАНИЙ
Cline - https://cline.bot/
Cline Memory Bank - https://docs.cline.bot/best-practices/memory-bank
Synozur: модель зрелости управления знаниями - https://www.synozur.com/models/knowledge-management-maturity-model
TOON: компактный формат структурированных данных - https://toonformat.dev/
ИНСТРУМЕНТЫ И ЭФФЕКТИВНОСТЬ
MCP vs CLI: сравнение расхода токенов - https://afrozeamjad.com/writing/mcp-vs-cli-token-benchmark/
Видео к теме «Почему агенты тормозят в больших кодовых базах?» - https://www.youtube.com/watch?v=LyjG7-lq8UE
ТЕСТИРОВАНИЕ И ПРОВЕРКА РЕЗУЛЬТАТА
Callstack Agent Device - https://github.com/callstack/agent-device
Google Artemis - https://github.com/google/artemis
Storybook: AI Best Practices - https://storybook.js.org/docs/ai/best-practices
КЕЙСЫ КОМПАНИЙ
Shopify: Back to Native - https://shopify.engineering/back-to-native
Публикация Яндекса из раздела «Экзо-команды на рынке» - https://t.me/yandex/5421
Microsoft .NET: кейс Doggie Bus - https://dotnet.microsoft.com/en-us/platform/customers/doggie-bus
КНИГИ И КАНАЛЫ
Материалы о детерминизме и AI - https://t.me/iosmmcresources/142
DX-Ray: сайт автора Claude Code for Developer Experience - https://dx-ray.com/
крутой тул для создания скиллов. Впервую очередь задает вопрос "а точно ли тебе этот скилл нужен?"
https://github.com/smixs/skill-conductor
Repost from CodeCamp
OpenAI выпустила гайд по скиллам и промптам для GPT-6 Astra!
Astra стала самостоятельнее, поэтому старые огромные промпты и раздутые скиллы теперь могут только мешать. OpenAI советует убирать лишнее, давать документацию по необходимости и чётко описывать конечный результат.
Пользуемся 👌
Все чаще вопросы "а как купить подписки если нет номера телефона/впн/карты и тп?".
Решил подсуетиться и Собрал 30 слайдов и > 50 ссылок как пользоваться кодексом и подписками:
• виртуальные карты и покупки онлайн
• виртуальные телефоны и аренда
• оплата через мтс и банки
• покупка карт из узбекистана, казахстана, армении и тп с доставкой в квартиру
• где выгодней всего брать подписки
• рабочий VPN
• частые причины банов аккаунтов
• в чем отличие подписки App Store от других
• многое другое
Ставьте лайк и пишите в комменты чего не хватает
OpenAI отменили подписку за 200$... Как хорошо что я успел взять. Или это прогрев гоев?
Repost from iOS Makes Me Hate
Shopify возвращается с React Native обратно на натив из-за аи-агентов
уже пару лет были предсказания что кроссплатформа стала бессполезной из-за аи. Что писать код на обоих платформах стало проще с нормальным агентом и харнессом.
Вот и shopify делятся в статье почему отказываются от реакт нейтива и переходят обратно на натив:
1️⃣ два приложения больше не обязательно означает в два раза больше работы
2️⃣ они строят разработку вокруг агентов и думают об общих архитектурах, механизмах и тп
3️⃣ цитата "мы строим harness, внутри которого AI физически сложно протащить плохой код дальше"
Они проектируют приложение не только для пользователей и разработчиков, но и так, чтобы агент мог наблюдать систему, воздействовать на нее и самостоятельно проверять результат.
Че думаем? Ставьте лайк если топ новость 🖤
или пишите коммент почему утопия
Repost from Data, Stories and Languages
Как AI-агенты помогли мне взять серебро на Kaggle - и где они меня подвели
Недавно я, впервые за долгое время, поучаствовал в соревновании Kaggle - ROGII. Задача - geosteering: по гамма-каротажу и траектории понять, где буровое долото находится внутри геологического слоя. Мы заняли 93 место из 6000+ команд, серебро.
Главное отличие от прошлых соревнований: агенты написали практически весь мой код. Я выбирал направления и решал, чему верить; ChatGPT Deep Research искал статьи и подходы; Claude Code делал имплементацию, а ближе к концу я всё чаще переключался на Codex.
Работало весьма хорошо. Раньше bottleneck часто был в реализации идей, а теперь мог сказать "добавь эти пять фич и перезапусти тренировку" и получить результат. Агенты присылали апдейты по тренировке в Telegram; и через remote connection можно было направлять следующие шаги.
И иногда агенты неожиданно тупо ломались:
- Claude раз за разом пытался захардкодить три видимые тестовые скважины, хотя на сабмите Kaggle подменяет их скрытым датасетом. Пришлось заводить отдельное правило и заставлять проверять его каждый раз.
- Codex решил, что несколько сложных сэмплов "плохие", и выкинул их из OOF. Локально стало красивее, а при мерже с тимейтами выяснилось, что у меня не хватает строк.
- Claude любил запускать "быстрый дешёвый smoke run", после которого идея объявляется нерабочей, хотя эксперимент имел мало общего с тем, что я хотел.
- неправильные выводы записывались в память и влияли на следующие эксперименты, приходилось чистить руками.
- Opus 4.6 выполнял инструкции надёжнее, чем 4.8 и 5.0: дал пять задач - сделает пять, а более новые версии иногда брали одну-две и игнорировали остальное.
Главный вывод: агент оптимизирует ту метрику, которую видит. Приватный лидерборд он оптимизировать не может, поэтому работает через прокси - локальный CV, паблик, время выполнения или просто "выглядит ли задача сделанной". И очень способный агент может стать очень хорош в оптимизации чего-то, что слабо связано с тем, что тебе нужно.
Ещё показательно: победители переформулировали задачу - вместо построчной регрессии 2D alignment и декодирование связного пути через всю скважину. Агенты отлично искали итеративные улучшения имеющихся идей, но не могли придумать что-то принципиально новое.
Так что агенты не отменяют экспертизу. Они её усиливают: если ты в теме, то можешь проверить много идей; если просто просишь агентов работать за тебя - они уйдут в неправильном направлении быстрее, чем ты сам.
Блог
Medium
Ycombinator
#ai #kaggle
Repost from Валера Ковальский
neuraldeep.ru взломали и по логам это был агент на базе astra, выводы делайте сами
Зачем нужен харнесс если будут умные модели которые все заменят?
Все чаще встречаю такое заблуждение. Поэтому решил походить по самым мощным тяжеловесам яндекса в лс и задать им вопрос. Самый лучший ответ дал @aostrikov_ai_agents
это просто разные вещи, дополняющие друг друга сама модель - это очень неудобная штука. она не запоминает стейт, ты в неё можешь запулить большой запрос и получишь большой ответ. и все а любой харнес делает так, что он постоянно вызывает модель и крутит вот эти самые агентские циклы. они все крутятся внутри харнесса. то есть, по сути, harness гибко управляет твоим контекстом, убирает оттуда лишнее, добавляет то, что нужно, держит все доступные скиллы и дает модели дотягиваться до других систем. и еще много всего делает, типа субагентов, памяти и прочего то есть, типа, модель - это как мощный движок машины, а харнес - сама машина
+2
Начал считать калории с гпт
Говорю рост, вес, возраст и считаем примерный лимит калорий
Из прикольного он может дать совет по фото какое блюдо сколько по бжу. А также что из меню больше подходит
MCP vs CLI
В яндексе я делаю одну CLIшку, которая помогает собирать BDUI фреймворк. Была проблема долгого старта. Чтобы запустить сложную микросервесную архитектуру, нужно было множество приседаний. Разрабу приходилось тратить пару дней на понимание что где зачем скачать, подключить и запустить.
Можно было ограничиться скиллом. Но гайд антропиков предлагает выносить весь детерминированный код в скрипты, а не скиллы. А если у вас много скриптов, то это должна быть CLIшка, которая управляет стейтами.
Да и агент и модели сам по себе мало что умеют в мире, где наши данные разбросаны по десяткам приложений и сервисов. Каждый вызов таких инструкций будет с рандомным результатом.
На заре агентских технологий MCP придумали удобного взаимодействия. Но после поняли что это неэффективно и неудобно. Да и жрет много токенов из-за возрата модели промежуточного результата. Вместо этого агент с терминалом может вызвать давно существующий CLI.
В одном из бенчмарков CLI использовал в 1,3–80 раз меньше токенов, чем MCP.
В другом тесте сравнили одну и ту же Microsoft Graph-обвязку, у которой были и CLI-, и MCP-интерфейсы. CLI со скиллом оказался на 38% дешевле, а MCP — примерно на 9% быстрее.
CLI побеждает не потому, что терминал магический. Он побеждает потому, что дает агенту программируемый слой между внешней системой и моделью.
Полезные ссылки:
• https://github.com/scalekit-inc/mcp-vs-cli-benchmark
• https://www.anthropic.com/engineering/advanced-tool-use
• https://afrozeamjad.com/writing/mcp-vs-cli-token-benchmark/
