КайфКодинг
Відкрити в Telegram
ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками
Показати більше1 043
Підписники
Немає даних24 години
+157 днів
+8230 днів
Архів дописів
1 042
Repost from AI-Driven Development. Родион Мостовой
1М контекстное окно - прорыв или фикция?
Context Arena забенчмаркали стойкость контекста для GLM 5.2 и Opus 4.8 - значит, это хороший повод нам вспомнить про контекстную инженерию.
На бенчмарке отчетливо видна существенная просадка внимательности моделей на 512к контексте: в среднем, почти в 2 раза в сравнении с 64к контекстом и примерно в 1.5 раз в сравнении с 128к контекстом - грубо говоря, для нас с вами это означает то, что на 512к контексте агент будет терять в полтора раза больше деталей, чем на при 128к заполненности. Для открытых моделей проблема потери контекста особенно актуальна, поэтому практический вывод такой, что по-хорошему, с ними стоит держать заполненность контекстного окна не выше 128к, а лучше даже меньше - ни о каком 1М, конечно, и речи не идет, там просадка будет колоссальной. Кстати, у моделей Kimi K2.6 и, тем более, Minimax M3 дела обстоят еще хуже.
Что еще? Открыв закрытых моделей на большом контексте от открытых все еще впечатляет, хоть уже и не такой драматичный - спасибо DeepSeek за DeepSeek Sparse Attention, которую в GLM-5.2 развили через IndexShare. Кстати, о GLM 5.2 - как видно, моделька действительно на удивление успешная в т. ч. на больших контекстах. Opus 4.8 идет рядышком с GPT 5.5, но последняя все равно сильнее, особенно на совсем больших контекстах. На этом месте вспоминаем интересную деталь - в Codex App по дефолту контекстное окно для GPT 5.5 все еще 256к - то есть, по сути, точность всегда остается где-то на уровне 75%+- (по MRCRv2), а благодаря превосходному алгоритму компактизации, команде Codex удается сохранить все действительно важное так, что эти компактизации обычно и не заметны вовсе - то есть, конкретно в случае с Codex проблему контекстной инженерии ребята здорово решили на уровне модели и на уровне Harness (обвязки), в то время, как Claude Code в этом аспекте требует чуть больше ручной работы - модель на 1M контекста там включается прямо в выпадающем списке (велик соблазн ее включить), но кажется, что простой обыватель зачастую не очень понимает, что переключение на эту модель потребует от него ручного управления контекстом - как только контекст переваливает за условные 200к, начинается зона риска, в которой нужно либо переходить в новый чат, либо, хотя бы, вызывать компактизацию - что и приходилось делать. Что уж говорить, что пользователям открытых моделей за загрузкой контекста все еще стоит следить куда пристальнее. Короче, в 2026-м контекстную инженерию (в которую входит контроль % заполнения контекстного окна) пока никто не отменял - чем больше забит контекст, тем сильнее приходится надеятся на удачу.
И, конечно, не забываем про контроль AGENTS.md, скиллов, MCP, progressive disclosure и т. д. - тоже все составляющие context engineering, с открытыми моделями все это становится еще важнее.
Кстати, современная версия Context Arena прогоняет бенчмарк MRCRv2 от Google DeepMind (GDM-MRCRv2).
Paper про MRCRv2 (Michelangelo)
Датасет MRCRv2
А как вы менеджите контекст? Обращаете ли внимание на % заполнения? Наблюдаете ли просадки в качестве output модели на больших контекстах?
@ai_driven
1 042
Привет!
Мы вместе с Олегом Краусом @suarko придумали курс "Предпринимательское мышление" для детей 10-15 лет.
Вести его будет наша преподавательница Диана (она психолог, тьютор и препод по софтскиллам) и сам Олег.
Курс состоит из 6 занятий по субботам в 12.30 Мск, на нем ребята научатся:
⭐️ разбираться, как устроены бизнесы и продукты, которые нас окружают
⭐️ придумывать и проверять простые бизнес-идеи
⭐️ применять предпринимательские навыки в обычной жизни
Стартуем в эту субботу! Кто хочет и может в это время — можно записаться вот тут: https://nezabudka.school/summer?oleg
1 042
Repost from Глеб Кудрявцев — мастер AI
https://www.youtube.com/watch?v=lWFVuOz3mLk
Разобрал присланные тестовые.
О том, какой я плохой, пишите в каменты под видео 😁
1 042
Repost from Андрей Шишкин про B2B лидген
Сделал себе AI-бухгалтера
Больше всего на свете я не люблю заниматься первичкой.
Выставлять все эти акты, УПД и пр.
ЭЦП их подписывает еще очень медленно, сразу пачкой у меня их какого-то фига создать и подписать нельзя.
При этом у меня их не так много, чтобы прям хотелось нанять парт-тайм бухгалтера.
Но при этом достаточно, чтобы залипнуть в них на целый день пару раз в месяц.
По итогу сделал себе Skill в Claude Code, который по моей просьбе сам по банку смотрит кому нужно сделать УПД, генерит их в Диадок, подписывает, отправляет.
+ может выставить счет по запросу “нужен счет такому-то ИНН услуга/сумма”.
Пришлось потратить какое-то время на общение с поддержкой банка, Диадока и самим Claude Code, но думаю оно кратно окупится на дистанции :)
И прикольно, что один раз созданный skill переиспользуется Клодом в других задачах, например, он сам предложил использовать его в боте для приема оплат “Claude Code for Sales”.
Дальше подключу Телегу и вежливые пинги по неоплаченным счетам.
Всегда хотел себе AI SDR, но получился AI-бухгалтер😎
1 042
Repost from Сто лет бэклога
У меня есть проблема: я несистемно разбираю свою почту.
Точнее, разбираю качественно, но нерегулярно, и из-за этого всё время копится куча непрочитанных писем. Коллеги, партнёры, разные службы - все, кто со мной коммуницируют, вынуждены иногда дублировать: звонить, писать в телегу, догонять другими каналами. История так себе.
Глубокий анализ ситуации показал: мне пишут больше, чем я читаю :)
В какой-то момент понял, что мне нужен инструмент, который помогает разгребать почту - приоритизировать её, подсказывать, что с письмом делать. Готового под мою логику не нашлось, и я сделал такой инструмент под себя.
Нативное приложение под Mac на Swift, бэкенд на Python. Называется Niti (нити - как ниточки-треды переписки, которые оно и распутывает).
Что получилось:
1. Обычный почтовый клиент. База: входящие, исходящие, приём-отправка - всё как у нормального почтового клиента.
2. Приоритизация - то, ради чего всё затевалось. Внутри работает простой агент (сложный тут и не нужен). Он разбирает не отдельные письма, а треды целиком, всю цепочку по одной теме и раскладывает их по категориям обязательств:
- Ждут ответа от меня - мяч на моей стороне.
- Я что-то пообещал - взял на себя обязательство сделать к какой-то дате.
- Надо делегировать - прилетело мне, но за вопрос отвечаю не я, надо передать вниз по команде или в сторону.
- Жду ответа я - сам кого-то попросил и жду, что вернутся.
Получаются доски обязательств: письма разложены по группам, а агент по каждому треду даёт саммари и подсказки - за пару секунд видно, что от меня хотят и что надо сделать.
3. Проекты. Я завожу проект - какое-то большое направление, которое веду и описываю его. Агент по описанию сам классифицирует нужные письма, вытаскивает из них важное и связывает с проектом, складывая всё в отдельную папку. В итоге по проекту все материалы лежат в одном месте. Захотел статус, дашборд или сводку - натравил агента на эту папку, и он суммаризирует: где мы находимся, что есть по проекту и что стоит сделать дальше.
ИМХО качество моделей снова переходят в новое состояния, когда почти каждый может под себя создавать быстро нужно ПО. Это не может не вдохновлять :)
1 042
Общее правило (операционный контракт)
1. Один источник правды. Полный план кладём в репозиторий как docs/plans/react-ui-kit-migration.md (живая спека). Goal ссылается на этот файл и ставит цель: «выполнить план аккуратно — по фазам, с ревью, тестами и прод-деплоем за флагом». Меняется скоуп → сначала правим файл, он авторитетнее чата.
2. Малые обратимые шаги. Идём фаза за фазой. Каждый коммит самодостаточен, откатывается независимо, и приезжает red-spec-first (сначала падающий тест, потом фикс). Ветка на фазу, никогда прямо в main. Без Co-authored-by.
3. Обязательное Codex-ревью на КАЖДЫЙ коммит/MR. После коммита — сильная модель по диффу, read-only:
codex exec -m gpt-5.5 -c model_reasoning_effort=xhigh -s read-only + дифф + «проверь корректность, утечку IP, недостающие тесты, регрессии». Codex — блокирующий ревьюер: чиню CONFIRMED, взвешиваю PLAUSIBLE — до следующего коммита. Два независимых ревьюера: Codex на каждый коммит, человек на границах фаз.
4. Гейты перед мержем. pnpm guard + pnpm typecheck + пакетные тесты + зелёный red-spec фазы. «Готово» — только с доказательством.
5. IP-инвариант — проверяется каждым коммитом. Закрытый исходник/бандл react-ui-kit никогда не попадает в git (публичный origin). Grep дерева на каждом коммите; бандл живёт только в слое Dockerfile.internal + staging в run-cwd.
6. Дисциплина деплоя. Едем за env-флагом (сосуществуем со static-HTML). В прод — только в окне без активных ранов, через drain-gated путь, проверка в поде; на каждую фазу — один revert-MR.
7. Честность и стоп-на-разрыве. Отчёт — что реально прошло/упало, с доказательством. Ломается допущение фазы → стоп и переплан, не наслаиваем патчи.
8. Цикл пары (на коммит): Claude пишет → guard/typecheck/tests → коммит → Codex ревьюит дифф → Claude правит → чекпоинт человека в конце фазы → дальше. Goal не двигает фазу, пока Codex-ревью + гейты не зелёные.
1 042
А вы ведь говорите Опусу "На каждый коммит вызывай Codex CLI и делай с ним автоматически код ревью" ?
Связка Клод Код + Кодекс дает сильный прирост в качестве решаемых задач (на уровне Fable)
1 042
Skill + cli для AI агентов по управлению вашим портфелем в сервисе т. инвестиции уже здесь.
↗️ Да-да, я не сошёл с ума. Теперь агент берет на себя всю рутину по анализу вашего портфеля и рынка ценных бумах и прочих активов. Нет, это не торговый бот, и НЕ КОНСУЛЬТАНТ, ведь закон гласит: нельзя кому попадя раздавать ИИР (индивидуальные инвестиционные рекомендации). Это терминал в прямом смысле слова для доступа к т.инвестициям. Инвестируем на вайбе!
Денег он за Вас не заработает, но даст исчерпывающую картину рынка инвестиций, проанализирует степень диверсификации, рассчитает доходность, напомнит про ближайшие дивиденды и купоны, соберет актуальные новости.
Skill содержит cli, который вмещает в себя полноценный клиент для работы с api. Без сторонних зависимостей. Упаковано в js файл.
Чтобы не пугать с порога: у агента есть 3 режима:
1️⃣ Sandbox.
Песочница, деньги на счету ненастоящие, а котировки и вся информация по api - актуальная, можно потренироваться на виртуальном балансе и оценить работу скилла и агента в целом.
2️⃣ Read-only.
Агент уже видит реальный баланс, но денежных операций выполнить не получится. В данном режиме агент перелопатит за вас тонну информации и даст полную картину по рынку, сэкономив время на скрининге.
3️⃣ Full
В этом режиме есть возможность уже покупать и продавать, со всеми трейдерскими опциями, и конечно же через жесткое подтверждение в агенте по каждой операции. При этом всём, агент перед каждой операцией хорошенько проверит, не "хомяк" ли вы.
🚨 Если вы почувствовали, что нейросети уже готовы, есть специальный режим (
stonks mode, включается в .env файле, лежит по пути ~/.config/tinvest папка создастся при автоматической установке, либо создать вручную и положить туда). Дает агенту возможность делать операции без подтверждений. Но даже тут агент просто так не пойдет что-то делать, пока его не попросишь (ну или не повесишь на cron своему клешнеботу задачу что-то периодически выполнять, например, мониторить курсы или искать желаемую точку входа в актив)
Чуть-чуть погонял на реальном портфеле, буду дальше пользоваться на постоянке.
💻 Репозиторий
(проще дать его агенту он сам установит)
🗯 curl -fsSL https://raw.githubusercontent.com/nyxandro/t-invest-skill/main/install.sh | bash
(установка командой)
🎆 Репосты и звезды в github приветствуются.1 042
🎙 Послушал выпуск с Сергеем Марковым про AGI и гонку ИИ.
Главный инсайт: ИИ — это уже не «модель на GitHub», а целый промышленный конвейер: данные, вычисления, обучение, оценка, продуктовая доводка и инфраструктура. Поэтому вопрос «а есть ли аналог OpenAI?» упирается не только в код, а в способность выстроить полный цикл.
Что зацепило:
— если доступ к OpenAI ограничат, важен не один “заменитель”, а собственная экосистема разработки моделей;
— Китай, похоже, масштабирует именно AI-конвейеры — гонка становится не лабораторной, а промышленной;
— Anthropic интересен не только моделями, но и тем, как устроен сам процесс их создания;
— развитие ИИ будут тормозить не только алгоритмы, но и вычисления, данные, регулирование и экономика внедрения;
— AGI обсуждается не как магический «супермозг», а как система, способная самостоятельно ставить цели и действовать;
— людям не нужно «меньше знаний» — скорее, меняется ценность знаний: важнее становится умение задавать рамку, проверять ответы и принимать решения.
Отдельно интересно — разговор про блокировку Mythos и Fable: это уже не история про чат-ботов, а про контроль доступа к технологиям, которые могут стать стратегической инфраструктурой.
И практичный финал — про ИИ на интервью. Похоже, скоро будут проверять не то, умеешь ли ты всё делать руками, а то, умеешь ли правильно управлять ИИ и получать надёжный результат.
Выпуск для тех, кто смотрит на AI не как на хайп, а как на новую индустриальную гонку.
https://www.youtube.com/watch?v=_NUcSPvYSQY
1 042
Эфир от Коли про ИИ. Как всегда интересно. Ссылка на зум: https://us06web.zoom.us/j/82806267127?pwd=j6oplbwRU4qbKzQXZNaJBJvF0HTvTW.1
Присоединяйтесь, стартуем через несколько минут!
1 042
Repost from Константин Доронин
Запись нашего с Алексеем Остриковым стрима "Как нанимать AI-инженеров?".
Также на YouTube (они в Телеграм тоже работают!) добавил тайм-коды. Пользуйтесь!
Вот сколько тем обсудили за 2 часа стрима:
00:00 — Вступление
09:50 — Представление гостя
12:30 — Адаптация процесса найма в Яндексе
15:52 — Кто такой AI-инженер?
20:43 — Как использовать AI для своей профессии?
25:20 — Насколько нужен AI классическим IT-ролям?
27:27 — Как начать путь в профессию AI-инженера?
33:28 — Почему резюме уже не так важно
34:24 — Какие курсы изучать?
38:35 — Как пройти первичные фильтры?
43:13 — Может ли AI-инженер приносить компании деньги?
46:05 — Средний возраст AI-инженера, которого нанимал Алексей
49:50 — Как делать свою работу с помощью AI
51:50 — Можно ли полностью писать код AI-агентом?
54:11 — Лёша доказывает, что он не AI
55:20 — Насколько зрелый рынок найма AI-профессий?
57:55 — Лучший способ попасть в любую компанию
1:01:40 — Процесс найма AI-инженера
1:08:05 — Нужны ли тестовые задания?
1:12:07 — Если уже через 5 минут понятно, что кандидата хочется нанять
1:18:52 — Сколько зарабатывает AI-инженер?
1:23:50 — Какие профессии исчезают из-за AI?
1:29:20 — Вопросы от зрителей
p.s.: срочно разыскиваю четырёх желающих подписаться на YouTube-канал, чтобы пробить планку в 300 подписчиков.
1 042
Repost from red_mad_robot
ИИ-агенты заходят в бронирование: рассказали Forbes, что это значит для рынка
«Туту» открыл поиск и бронирование поездок через ИИ-агентов. Для сервисов это ранний тест нового канала дистрибуции: пользователь формулирует намерение в диалоге с помощником, а платформа получает шанс подключиться к нему до перехода в привычный интерфейс.
Если ИИ-агент станет точкой входа в выбор поездки, сервисам важно быть доступными для него технически и коммерчески. В моменте трафик из таких сценариев, скорее всего, будет небольшим, но для бизнеса это работа на будущую позицию в цепочке принятия решения: кто окажется ближе к моменту пользовательского намерения, тот и получит преимущество в агентной коммерции. Илья Филиппов, CEO red_mad_robot AIПри этом есть техническая сторона: сам поиск через агента уже знаком рынку, поэтому важна глубина MCP.
Browser use у агентов существует около полутора лет: сильные модели уже умеют открывать сайты, обходить защиты через прокси, делать скриншоты и доставать релевантную информацию. Поэтому поиск сам по себе рынок не удивит. Главный вопрос — позволяет ли MCP дойти до оформления заказа. Сейчас агент может довести пользователя до собранного заказа, но финальную оплату человек подтверждает сам — это агентный поиск и сборка корзины, но ещё не сквозная покупка. Настоящим переломом станет момент, когда MCP позволит закрывать и оплату. Валера Ковальский, руководитель ИИ-направления red_mad_robot↗️ red_mad_robot
1 042
Repost from Глеб Кудрявцев — мастер AI
Если вы по каким-то причинам еще не вайбкодите, но зачем-то читаете меня, то объявляю last call на третий поток курса по вкатыванию в вайб-кодинг.
Стартуем 22 июня, уже в этот понедельник. Инструменты развиваются стремительно, поэтому собрал офигенную обновленную программу под современные реалии.
Расскажу и покажу, как делать ботов, сайты, мобильные приложения.
Помогу с настройкий и покупкой необходимых инструментов.
Рассказываю не просто «что и как», но еще и «почему», короче, до кучи это экспресс-курс по вкатыванию в архитектуру современного IT
Курс веду лично, так что вы все узнаете непосредственно от меня, а не в десятом перессказе 🙂
Отзывы и подробную программу смотрите тут: https://glebkudr.com/courses/vibecoding
Скидка 10% по промокоду GLEB3 💵
