ch
Feedback
AI Makes Me Hate

AI Makes Me Hate

前往频道在 Telegram

AI systems engineer и скептический практик, который проверяет и внедряет AI на реальных задачах разработки

显示更多
未指定国家未指定类别
558
订阅者
无数据24 小时
+197 天
+8830 天
帖子存档
скилл чтоб делать презы https://github.com/slidevjs/slidev

AI как экзокостюм разработчика: ссылки к докладу АГЕНТЫ И HARNESS Anthropic: Demystifying Evals for AI Agents - https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents Pi Agent Harness - https://github.com/earendil-works/pi Agent Squad: оркестратор для iOS - https://github.com/2FastLabs/agent-squad SKILLS И ПРОЦЕСС РАЗРАБОТКИ Superpowers - https://github.com/obra/superpowers Skill Conductor - https://github.com/smixs/skill-conductor OpenAI: переосмысление skills и промптов для GPT-6 Astra - https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra КОНТЕКСТ, ПАМЯТЬ И БАЗА ЗНАНИЙ Cline - https://cline.bot/ Cline Memory Bank - https://docs.cline.bot/best-practices/memory-bank Synozur: модель зрелости управления знаниями - https://www.synozur.com/models/knowledge-management-maturity-model TOON: компактный формат структурированных данных - https://toonformat.dev/ ИНСТРУМЕНТЫ И ЭФФЕКТИВНОСТЬ MCP vs CLI: сравнение расхода токенов - https://afrozeamjad.com/writing/mcp-vs-cli-token-benchmark/ Видео к теме «Почему агенты тормозят в больших кодовых базах?» - https://www.youtube.com/watch?v=LyjG7-lq8UE ТЕСТИРОВАНИЕ И ПРОВЕРКА РЕЗУЛЬТАТА Callstack Agent Device - https://github.com/callstack/agent-device Google Artemis - https://github.com/google/artemis Storybook: AI Best Practices - https://storybook.js.org/docs/ai/best-practices КЕЙСЫ КОМПАНИЙ Shopify: Back to Native - https://shopify.engineering/back-to-native Публикация Яндекса из раздела «Экзо-команды на рынке» - https://t.me/yandex/5421 Microsoft .NET: кейс Doggie Bus - https://dotnet.microsoft.com/en-us/platform/customers/doggie-bus КНИГИ И КАНАЛЫ Материалы о детерминизме и AI - https://t.me/iosmmcresources/142 DX-Ray: сайт автора Claude Code for Developer Experience - https://dx-ray.com/

Скилл для создания презентаций https://github.com/slidevjs/slidev

крутой тул для создания скиллов. Впервую очередь задает вопрос "а точно ли тебе этот скилл нужен?" https://github.com/smixs/skill-conductor

ответила?

Repost from CodeCamp
OpenAI выпустила гайд по скиллам и промптам для GPT-6 Astra! Astra стала самостоятельнее, поэтому старые огромные промпты и р
OpenAI выпустила гайд по скиллам и промптам для GPT-6 Astra! Astra стала самостоятельнее, поэтому старые огромные промпты и раздутые скиллы теперь могут только мешать. OpenAI советует убирать лишнее, давать документацию по необходимости и чётко описывать конечный результат. Пользуемся 👌

Все чаще вопросы "а как купить подписки если нет номера телефона/впн/карты и тп?". Решил подсуетиться и Собрал 30 слайдов и > 50 ссылок как пользоваться кодексом и подписками: • виртуальные карты и покупки онлайн • виртуальные телефоны и аренда • оплата через мтс и банки • покупка карт из узбекистана, казахстана, армении и тп с доставкой в квартиру • где выгодней всего брать подписки • рабочий VPN • частые причины банов аккаунтов • в чем отличие подписки App Store от других • многое другое Ставьте лайк и пишите в комменты чего не хватает

OpenAI отменили подписку за 200$... Как хорошо что я успел взять. Или это прогрев гоев?

продолжаю завоевывать ачивки
продолжаю завоевывать ачивки

Repost from iOS Makes Me Hate
Shopify возвращается с React Native обратно на натив из-за аи-агентов уже пару лет были предсказания что кроссплатформа стала бессполезной из-за аи. Что писать код на обоих платформах стало проще с нормальным агентом и харнессом. Вот и shopify делятся в статье почему отказываются от реакт нейтива и переходят обратно на натив: 1️⃣ два приложения больше не обязательно означает в два раза больше работы 2️⃣ они строят разработку вокруг агентов и думают об общих архитектурах, механизмах и тп 3️⃣ цитата "мы строим harness, внутри которого AI физически сложно протащить плохой код дальше" Они проектируют приложение не только для пользователей и разработчиков, но и так, чтобы агент мог наблюдать систему, воздействовать на нее и самостоятельно проверять результат. Че думаем? Ставьте лайк если топ новость 🖤 или пишите коммент почему утопия

Как AI-агенты помогли мне взять серебро на Kaggle - и где они меня подвели Недавно я, впервые за долгое время, поучаствовал в соревновании Kaggle - ROGII. Задача - geosteering: по гамма-каротажу и траектории понять, где буровое долото находится внутри геологического слоя. Мы заняли 93 место из 6000+ команд, серебро. Главное отличие от прошлых соревнований: агенты написали практически весь мой код. Я выбирал направления и решал, чему верить; ChatGPT Deep Research искал статьи и подходы; Claude Code делал имплементацию, а ближе к концу я всё чаще переключался на Codex. Работало весьма хорошо. Раньше bottleneck часто был в реализации идей, а теперь мог сказать "добавь эти пять фич и перезапусти тренировку" и получить результат. Агенты присылали апдейты по тренировке в Telegram; и через remote connection можно было направлять следующие шаги. И иногда агенты неожиданно тупо ломались: - Claude раз за разом пытался захардкодить три видимые тестовые скважины, хотя на сабмите Kaggle подменяет их скрытым датасетом. Пришлось заводить отдельное правило и заставлять проверять его каждый раз. - Codex решил, что несколько сложных сэмплов "плохие", и выкинул их из OOF. Локально стало красивее, а при мерже с тимейтами выяснилось, что у меня не хватает строк. - Claude любил запускать "быстрый дешёвый smoke run", после которого идея объявляется нерабочей, хотя эксперимент имел мало общего с тем, что я хотел. - неправильные выводы записывались в память и влияли на следующие эксперименты, приходилось чистить руками. - Opus 4.6 выполнял инструкции надёжнее, чем 4.8 и 5.0: дал пять задач - сделает пять, а более новые версии иногда брали одну-две и игнорировали остальное. Главный вывод: агент оптимизирует ту метрику, которую видит. Приватный лидерборд он оптимизировать не может, поэтому работает через прокси - локальный CV, паблик, время выполнения или просто "выглядит ли задача сделанной". И очень способный агент может стать очень хорош в оптимизации чего-то, что слабо связано с тем, что тебе нужно. Ещё показательно: победители переформулировали задачу - вместо построчной регрессии 2D alignment и декодирование связного пути через всю скважину. Агенты отлично искали итеративные улучшения имеющихся идей, но не могли придумать что-то принципиально новое. Так что агенты не отменяют экспертизу. Они её усиливают: если ты в теме, то можешь проверить много идей; если просто просишь агентов работать за тебя - они уйдут в неправильном направлении быстрее, чем ты сам. Блог Medium Ycombinator #ai #kaggle

photo content

neuraldeep.ru взломали и по логам это был агент на базе astra, выводы делайте сами

Зачем нужен харнесс если будут умные модели которые все заменят? Все чаще встречаю такое заблуждение. Поэтому решил походить по самым мощным тяжеловесам яндекса в лс и задать им вопрос. Самый лучший ответ дал @aostrikov_ai_agents
это просто разные вещи, дополняющие друг друга сама модель - это очень неудобная штука. она не запоминает стейт, ты в неё можешь запулить большой запрос и получишь большой ответ. и все а любой харнес делает так, что он постоянно вызывает модель и крутит вот эти самые агентские циклы. они все крутятся внутри харнесса. то есть, по сути, harness гибко управляет твоим контекстом, убирает оттуда лишнее, добавляет то, что нужно, держит все доступные скиллы и дает модели дотягиваться до других систем. и еще много всего делает, типа субагентов, памяти и прочего то есть, типа, модель - это как мощный движок машины, а харнес - сама машина

Начал считать калории с гпт Говорю рост, вес, возраст и считаем примерный лимит калорий Из прикольного он может дать совет по
+2
Начал считать калории с гпт Говорю рост, вес, возраст и считаем примерный лимит калорий Из прикольного он может дать совет по фото какое блюдо сколько по бжу. А также что из меню больше подходит

photo content

MCP vs CLI В яндексе я делаю одну CLIшку, которая помогает собирать BDUI фреймворк. Была проблема долгого старта. Чтобы запус
MCP vs CLI В яндексе я делаю одну CLIшку, которая помогает собирать BDUI фреймворк. Была проблема долгого старта. Чтобы запустить сложную микросервесную архитектуру, нужно было множество приседаний. Разрабу приходилось тратить пару дней на понимание что где зачем скачать, подключить и запустить. Можно было ограничиться скиллом. Но гайд антропиков предлагает выносить весь детерминированный код в скрипты, а не скиллы. А если у вас много скриптов, то это должна быть CLIшка, которая управляет стейтами. Да и агент и модели сам по себе мало что умеют в мире, где наши данные разбросаны по десяткам приложений и сервисов. Каждый вызов таких инструкций будет с рандомным результатом. На заре агентских технологий MCP придумали удобного взаимодействия. Но после поняли что это неэффективно и неудобно. Да и жрет много токенов из-за возрата модели промежуточного результата. Вместо этого агент с терминалом может вызвать давно существующий CLI. В одном из бенчмарков CLI использовал в 1,3–80 раз меньше токенов, чем MCP. В другом тесте сравнили одну и ту же Microsoft Graph-обвязку, у которой были и CLI-, и MCP-интерфейсы. CLI со скиллом оказался на 38% дешевле, а MCP — примерно на 9% быстрее. CLI побеждает не потому, что терминал магический. Он побеждает потому, что дает агенту программируемый слой между внешней системой и моделью. Полезные ссылки: • https://github.com/scalekit-inc/mcp-vs-cli-benchmarkhttps://www.anthropic.com/engineering/advanced-tool-usehttps://afrozeamjad.com/writing/mcp-vs-cli-token-benchmark/