КайфКодинг
Ir al canal en Telegram
ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками
Mostrar más1 042
Suscriptores
Sin datos24 horas
+177 días
+8630 días
Archivo de publicaciones
1 042
Repost from Усиленные Инвестиции
На этой неделе был на Радио РБК в «Инвестиционном часе» — обсуждали, как инвестору выжимать максимум из искусственного интеллекта прямо сейчас. Вместе с Мосбиржей (их FinGPT) и ВТБ.
Мой главный тезис: ИИ реально помогает почти на всех шагах — от анализа МСФО-отчётности до проверки эмитентов облигаций — но не из коробки.
Ключевая ловушка: ИИ излишне оптимистичен. На бэктесте у него любая стратегия «пушка-бомба, космос». На бумажном счёте результат уже в разы хуже. А на реальном — съедают комиссии, спреды и проскальзывание, и доходность уходит в ноль.
Поэтому нужны несколько степеней перепроверки: один агент извлекает данные, другой перепроверяет, третий проверяет второго. Только так выводу можно доверять.
Пара фрагментов — в видео. Полная запись эфира на Радио РБК: https://www.rbc.ru/radio/20/08/2026/6a8738b49a794757273be69a
Не является индивидуальной инвестиционной рекомендацией.
1 042
Мы с Кириллом встретились у него в офисе - поговорить за рынок акций.
А оказалось, что Кирилл - участник всероссийской олимпиады по математике, про пользователь Клода.
Его агенты работают как пчелки и заменяют десятки аналитиков.
Я думаю, что будущее на фонде, за такими ребятами, как Кирилл
1 042
Кому прям очень интересно глубоко в геном, вот тут был выпуск, Григорий прям подробно описал
https://youtu.be/z7U5bPDWd54?is=PI1AhZOF1OCZgROn
1 042
Repost from GPT/ChatGPT/AI Central Александра Горного
Binance разрешила AI-агентам самостоятельно торговать криптой
Биржа запустила Agent OS — платформу, через которую AI-агенты могут получать рыночные данные и сами совершать сделки. Подключить можно Codex, Claude Code, Cursor и другие инструменты. Агенту доступны спотовая и маржинальная торговля, фьючерсы и обмен криптовалют.
Чтобы AI случайно не слил весь депозит, для него создаётся отдельный субаккаунт. Пользователь сам решает, сколько туда положить, что агенту разрешено делать и нужно ли подтверждать каждую сделку. Вывод средств с таких счетов по умолчанию заблокирован. Но отдельного лимита на максимальный убыток Binance не устанавливает — фактически агент может потерять всё, что пользователь ему выделил.
https://www.binance.com/ru/agent-os
1 042
Repost from Мысли Рвачева
Каждый раз как ребенок радуюсь новому юзкейсу, которому может помочь AI.
Люблю поигрывать в Civilization VI в самолете, если не дают интернет. В другое время просто нет времени играть такие длиннющие партии. Невероятно крутая игра, развивающая стратегические навыки, но и, конечно, без того, чтобы разбираться в деталях, никуда.
Так вот, сегодня забросил Claude Code запрос: "иди найди сохраненный файл последней игры, дай анализ игры и представь в обучающем формате". На выходе целая обучающая книжка с разбором партии.
#claude@rvnikita_blog #claude_code@rvnikita_blog #ai@rvnikita_blog #civilization@rvnikita_blog
—————————
Мысли Рвачева
—————————
1 042
У дизайнеров OpenAI ускорился перебор идей и не ускорился цикл обратной связи. Их руководитель советует делать меньше.
Ян Силбер три года ведёт продуктовый дизайн в OpenAI, до этого — Artifact и восемь лет в Instagram. Во внутренних опросах его дизайнеры называли одно и то же: у инженеров производительность выросла в десять, иногда в сто раз, у них — нет.
Идей теперь выдаётся много и быстро. А дальше всё по-старому: показать людям, услышать, что мимо, начать заново, и в большой компании ещё всех согласовать.
Его формулировка — делать меньше. Не проектировать то, что можно не проектировать: взять существующую систему или компонент и достроить сверху, расширить старую фичу, а иногда обнаружить, что фича не нужна вовсе.
Ускорилось дешёвое, дорогое осталось на месте. Считайте прирост не по тому, сколько вариантов вы теперь выдаёте, а по тому, сколько из них дошло до людей.
https://www.lennysnewsletter.com/p/openais-head-of-design-this-is-the
1 042
Когда вы спрашиваете агента «ты уверен?», вы его не проверяете. Вы получаете второй ответ той же модели, и звучит он так же уверенно, как первый.
Есть, впрочем, место, где этот приём работает. Мэдди Риз год назад не писала кода вообще: отец показал ей Lovable, с этого началось.
Сейчас у неё на столе термопринтер на Raspberry Pi — любой человек в мире заходит на её страницу, пишет сообщение, и оно печатается на чековой ленте. Ещё есть пейджер с событиями твиттер-аккаунта и личный API с её заказом кофе.
Про код она говорит прямо: до конца не понимает. Сравнивает с испанским, который, вырастая в Сан-Диего, понимаешь на слух, но сам не говоришь.
Проверять ей поэтому нечем, кроме вопросов к самому агенту. Ты уверен, что это правильно. Перепроверь. Убедись, что это согласуется с тем, что мы делаем.
Отдельным шагом она выясняет, кто вообще ошибся — она сама или он.
И на железе это сработало: перед покупкой она перепроверяет рекомендацию по два-три раза, и агент несколько раз ошибался — обычно советовал не те провода. Её слова:
Несколько раз, но я всегда это ловила.Сработало не потому, что она нашла правильную формулировку. Сработало потому, что ответ было с чем сверить: с описанием товара, с разъёмом на плате, с ценой. Провода видно глазами. В коде сверять не с чем. Там тот же вопрос возвращает не проверку, а вторую генерацию. Что сделать сегодня. Возьмите место, где вы спрашиваете агента «точно?», и назовите внешний источник, которым проверяется ответ: тест, типы, лог, счёт, живой человек. Не называется ни один — у вас не проверка, а ритуал. Честности ради, масштаб у Мэдди игрушечный: принтер, пейджер, личный API, ничего похожего на прод. Пейджер во время записи так и не сработал — она предупреждала, что связь у него рваная. https://www.youtube.com/watch?v=KCGKb3huDsY Чем вы проверяете ответ агента, кроме самого агента?
1 042
Эффект от кодинг-агентов до сих пор меряют счётчиком пул-реквестов. Причём открытых, а не смёрженных.
Linear разобрал когорту из 6 887 своих платящих команд — 4 280 из них подключили кодинг-агента. У этой когорты недельные пул-реквесты за два года выросли с 21 до 65; у команд без агента счётчик сдвинулся с 8 до 10.
Открытый PR ничего не говорит о ценности изменения — это формулировка самого Linear, в разделе про метрику. Там же они признают, что не знают, привёл ли рост выпуска к результату для бизнеса: видна только чёткая корреляция между внедрением AI и ускорением.
Посмотрите, что считает ваш дашборд: открытые пул-реквесты или смёрженные. Это разные новости.
https://linear.app/data
1 042
Repost from Сиолошная
Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов:
— Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно что агенты убегут!
Если тестировать без интернета, то можно существенно недооценить уровень навыков моделей. В реальных кейсах-то их будут использовать без такого ограничения. Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило?
— Они же вообще недоэксперты, не могут даже безопасно контейнер настроить чтоб модель не взламывала!
Ну, вообще-то модели нашли несколько ранее неизвестных уязвимостей, так что как минимум все основные известные дыры были закрыты. Но это всё равно не важно — по той же причине, что и пункт выше: просто отодвигает проблему на пару месяцев вперёд, от тестирования к использованию.
— Ну ничего серьезного же не произошло!
Вообще я не согласен, полноценный взлом HF и попытка взлома реального человека — это серьезно; но даже если нет, то... окей, сейчас не случилось, и это значит, что у нас есть ещё несколько месяцев, чтобы подготовиться. Пока что вся история развития моделей показывает, что прогресс продолжается. Я не вижу причин, по которым через год модель не сможет завершить полноценный взлом десятков-сотен людей через социальную инженерию, свеженайденные уязвимости и огромные базы утёкших паролей и почт, которые сейчас банально лень перебирать.
— Да просто свои модели контролировать не могут!
Но кто может? Про то, что мы не умеем выравнивать намерения людей и моделей я рассказываю года 3-4, эксперты лет 8-10, а философы и писатели — лет 20-30. Не существует на данный момент гарантированных способов контроля поведения моделей, чтобы они ничего не взламывали и не делали лишнего. В этом и проблема.
— Так может просто надо остановить OpenAI и Anthropic?
А это поможет? Вот если их в понедельник не станет — разве через год в открытом доступе не появится модель, примерно схожая по навыкам с тем, что есть сейчас? Так ладно просто появится — её-то можно будет специально и намеренно доучить на атаки и взломы (со слов OAI/Anth они сейчас этого не делают, а то, что мы видим — это просто результат развития других навыков).
— Я не верю что модели такие умные! У меня они совсем тупые и еле работают!
А вы часто даёте своим моделям возможность неделю работать в режиме, где ошибка ничего не стоит и при этом результат легко проверить, и они могут перепробовать сотни-тысячи вариантов? Потому что почти всё, где модели работают хорошо, подпадает под эти критерии, и именно поэтому мы видим прогресс там в первую очередь.
— Да это всё вранье, или маркетинг, или пиар, или и то и то!
Если это единственная, основная вразумительная линия защиты человека, то понятно, что ему сложно... и страшно поверить в происходящее. Для меня это звучит на уровне «мы никогда не были на Луне», тут мне нечего добавить.
===
Почему они неправильные? Потому что очень близоруки, и не учитывают, что будет происходить в ближайшие полгода-год, когда модели такого уровня а) потенциально будут выпущены в открытый доступ б) что их может скачать каждый недоброжелатель в) который не будет себя утруждать вопросами о безопасности и ограничении доступа в интернет.
Те, кто задают вопросы выше, для меня напоминают людей, которым показываешь на небо, а они смотрят на палец.
1 042
Repost from GPT/ChatGPT/AI Central Александра Горного
Подписчик прислал интересный промпт для Claude Code. Я проверил на другом домене, результаты того стоили. Рекомендую.
1 042
В вашем репозитории стоит правило: пул-реквест не смержить без одобрения человека. Его можно выполнять годами и не прочитать при этом ни строчки кода.
Как это выглядит, когда доведено до конца. Клэр Во — она ведёт шоу про AI-инструменты и делает продукт для продактов — собрала в своём рабочем репозитории бота, который читает дифф, оценивает риск и сам аппрувит всё, что счёл безопасным. Зовут Merge Mommy.
Требование «одобрено человеком» у неё осталось: гитхаб не даёт боту закрыть эту галочку. Снять правило или обойти было можно, она называет оба варианта.
Она не стала. Вместо этого переопределила, что значит «одобрил». Её слова:
Мы решили, что эта галочка будет сигналом: наши люди могут нажать approve, не глядя в код.Правило на месте. Аудит его увидит. Смысл из него вынут. А дальше деталь, из-за которой история и стоит того. Пороги, по которым бот решает — оценка от нуля до ста, всё ниже 24 проходит само, — выбрала не она. Файл с категориями риска, где документация считается низким, а биллинг высоким, тоже написала модель. Дословно у неё: я этого не писала, я это отредактировала. Сложите: человек не читает код и не пишет правило, по которому код пропускают. Он нажимает кнопку. Что сделать сегодня. Откройте документ, по которому у вас пускают в прод: чеклист ревью, матрицу рисков, критерии релиза. По каждому порогу спросите, кто поставил эту цифру и после какого случая. Не находится автор ни у одного — правило у вас соблюдается, но не работает. Честности ради, Клэр ничего не прячет и считает, что так безопаснее. Она проговаривает, что схема годится, только если прописана в политиках ревью и рисков и проходит аудит. И ссылается на Intercom, где одобренные ботом пул-реквесты доезжают до мержа впятеро быстрее человеческих. https://www.youtube.com/watch?v=cmATJGbA8bI Кто поставил пороги в документе, по которому у вас пускают код в прод?
1 042
Всем привет! Где-то год назад на SLP Pecha Kucha я рассказывал о том, как веду личный дневник вот уже 14 лет, не пропустив ни дня, и что мне это дало. Тогда же я рассказал, что после рождения дочки завёл второй дневник, для неё, чтобы когда-нибудь передать ей записи про её детство.
🚀 Теперь я запустил продукт про это. Хочу поделиться с SLP и попросить вашей поддержки.
📙 Chapter One Journal — мобильное приложение, дневник для родителей.
• Если вы родитель и когда-либо хотели вести дневник про вашего ребёнка, с посланиями ему в будущее, сейчас самое время начать и это отличный инструмент.
• Основной фокус на голосовых заметках, чтобы быстро сохранять записи, и на подсказках, которые учитывают возраст ребёнка и помогают придумать, о чём рассказать сегодня.
• Планов громадьё (например, режим, когда оба родителя могут вести дневник одновременно), но первой версией можно пользоваться уже прямо сейчас.
📲 Скачать можно здесь (пока только для iOS)
🏷️ Для участников SLP и ваших друзей сделал промо: 2 месяца премиум-доступа бесплатно по коду SLPALUMNI (или просто кликните на эту ссылку). Код действителен до 1 сентября.
Пользуйтесь и рассказывайте друзьям-родителям.
Отдельно хочу попросить вашей поддержки:
1️⃣ Я буду невероятно благодарен за ваши пятёрки в сторе. Эти оценки очень сильно помогают в органическом продвижении в App Store! 🙏🏻
2️⃣ Даже если вы не родитель перешлите этот пост знакомом родителям, которым это может быть интересно.
3️⃣ Ну и буду рад любому фидбэку, сюда или в личку.
1 042
Higgsfield valued at $5.4bn as Goldman and Intel back AI video start-up - мои поздравления команде.
1 042
Совет по глубине рассуждения агента ничего не стоит без вашей задачи. В этой истории таких советов три, и смотрят они в разные стороны.
Саймон Уиллисон прогнал вышедшую в пятницу Qwen 3.8 27B — 27 миллиардов параметров, лицензия Apache 2, квант на 17 гигабайт — локально на MacBook Pro M5 Max и NVIDIA DGX Spark. Рисунок в SVG занял 21 минуту: 22 276 токенов рассуждения ради 3 223 токенов вывода. Тот же промпт с выключенным рассуждением — 137 секунд.
— Карточка модели ставит дефолтом самый глубокий из трёх уровней, xhigh, «for complex tasks demanding thorough analysis».
— Уиллисон про свой же лучший результат: «Was that worth waiting 21 minutes for? Absolutely not», и дальше — игнорируйте дефолт, начинайте с low или вовсе без рассуждения.
— Та же карточка ниже предупреждает об обратном: в многоходовых агентных задачах пониженный reasoning effort не всегда сокращает общее время, потому что даёт меньше анализа, больше провалов и повторных попыток.
— В треде на Hacker News советуют третье: не low, а medium и окно побольше, иначе модель упирается в компакцию и передумывает одно и то же по кругу.
И вот тут начинается то, ради чего я притащил историю. Все три совета верны — просто каждый про свою задачу. Уиллисон мерил рисунок пеликана. Человек под ником SwellJoe мерил свой пул-реквест: одиннадцать часов на паре видеокарт, «default everything, no tuning», при том что GPT 5.5 сделала похожую задачу у него примерно за двадцать минут. Карточка говорит про многоходовые агентные прогоны вообще и не даёт ни одного числа. Три задачи — три ответа, и ни один из них не про вашу.
Эта же ручка есть и у вас: в агенте, в клиенте локальной модели или в параметрах вызова API. И вы, скорее всего, не трогали её ни разу, потому что непонятно, в какую сторону.
Что сделать сегодня. Взять не бенчмарк, а свою типовую задачу и прогнать её дважды: на дефолте и уровнем ниже. Признак, по которому решать, — не секунды, а сколько раз пришлось переспрашивать. У Уиллисона на быстрой настройке инструмент почти заработал: «nearly works but shows the boxes in the wrong place».
Честности ради, SwellJoe в следующей же фразе объясняет, что дело не только в дефолте: другие мелкие модели на своих настройках укладывались в пару часов, «but did a worse job». Да и главный вывод самого Уиллисона не про глубину — ежедневным инструментом модель не даёт стать сырая скорость, 15–30 токенов в секунду на дорогом железе.
https://simonwillison.net/2026/Aug/16/qwen-38-27b/
Какой уровень рассуждения стоит по умолчанию в том агенте, которым вы вчера пользовались чаще всего?
