ch
Feedback

不要被骗子欺骗!Telemetrio 会找到并标记这些频道 👉 如果想查看标记,请订阅 👈

КайфКодинг

КайфКодинг

前往频道在 Telegram

ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками

显示更多
1 042
订阅者
无数据24 小时
+177 天
+8630 天
帖子存档
+1
На этой неделе был на Радио РБК в «Инвестиционном часе» — обсуждали, как инвестору выжимать максимум из искусственного интеллекта прямо сейчас. Вместе с Мосбиржей (их FinGPT) и ВТБ. Мой главный тезис: ИИ реально помогает почти на всех шагах — от анализа МСФО-отчётности до проверки эмитентов облигаций — но не из коробки. Ключевая ловушка: ИИ излишне оптимистичен. На бэктесте у него любая стратегия «пушка-бомба, космос». На бумажном счёте результат уже в разы хуже. А на реальном — съедают комиссии, спреды и проскальзывание, и доходность уходит в ноль. Поэтому нужны несколько степеней перепроверки: один агент извлекает данные, другой перепроверяет, третий проверяет второго. Только так выводу можно доверять. Пара фрагментов — в видео. Полная запись эфира на Радио РБК: https://www.rbc.ru/radio/20/08/2026/6a8738b49a794757273be69a Не является индивидуальной инвестиционной рекомендацией.

Мы с Кириллом встретились у него в офисе - поговорить за рынок акций. А оказалось, что Кирилл - участник всероссийской олимпиады по математике, про пользователь Клода. Его агенты работают как пчелки и заменяют десятки аналитиков. Я думаю, что будущее на фонде, за такими ребятами, как Кирилл

Кому прям очень интересно глубоко в геном, вот тут был выпуск, Григорий прям подробно описал https://youtu.be/z7U5bPDWd54?is=PI1AhZOF1OCZgROn

Binance разрешила AI-агентам самостоятельно торговать криптой Биржа запустила Agent OS — платформу, через которую AI-агенты могут получать рыночные данные и сами совершать сделки. Подключить можно Codex, Claude Code, Cursor и другие инструменты. Агенту доступны спотовая и маржинальная торговля, фьючерсы и обмен криптовалют. Чтобы AI случайно не слил весь депозит, для него создаётся отдельный субаккаунт. Пользователь сам решает, сколько туда положить, что агенту разрешено делать и нужно ли подтверждать каждую сделку. Вывод средств с таких счетов по умолчанию заблокирован. Но отдельного лимита на максимальный убыток Binance не устанавливает — фактически агент может потерять всё, что пользователь ему выделил. https://www.binance.com/ru/agent-os

Каждый раз как ребенок радуюсь новому юзкейсу, которому может помочь AI. Люблю поигрывать в Civilization VI в самолете, если
Каждый раз как ребенок радуюсь новому юзкейсу, которому может помочь AI. Люблю поигрывать в Civilization VI в самолете, если не дают интернет. В другое время просто нет времени играть такие длиннющие партии. Невероятно крутая игра, развивающая стратегические навыки, но и, конечно, без того, чтобы разбираться в деталях, никуда. Так вот, сегодня забросил Claude Code запрос: "иди найди сохраненный файл последней игры, дай анализ игры и представь в обучающем формате". На выходе целая обучающая книжка с разбором партии. #claude@rvnikita_blog #claude_code@rvnikita_blog #ai@rvnikita_blog #civilization@rvnikita_blog ————————— Мысли Рвачева —————————

У дизайнеров OpenAI ускорился перебор идей и не ускорился цикл обратной связи. Их руководитель советует делать меньше. Ян Силбер три года ведёт продуктовый дизайн в OpenAI, до этого — Artifact и восемь лет в Instagram. Во внутренних опросах его дизайнеры называли одно и то же: у инженеров производительность выросла в десять, иногда в сто раз, у них — нет. Идей теперь выдаётся много и быстро. А дальше всё по-старому: показать людям, услышать, что мимо, начать заново, и в большой компании ещё всех согласовать. Его формулировка — делать меньше. Не проектировать то, что можно не проектировать: взять существующую систему или компонент и достроить сверху, расширить старую фичу, а иногда обнаружить, что фича не нужна вовсе. Ускорилось дешёвое, дорогое осталось на месте. Считайте прирост не по тому, сколько вариантов вы теперь выдаёте, а по тому, сколько из них дошло до людей. https://www.lennysnewsletter.com/p/openais-head-of-design-this-is-the

Когда вы спрашиваете агента «ты уверен?», вы его не проверяете. Вы получаете второй ответ той же модели, и звучит он так же уверенно, как первый. Есть, впрочем, место, где этот приём работает. Мэдди Риз год назад не писала кода вообще: отец показал ей Lovable, с этого началось. Сейчас у неё на столе термопринтер на Raspberry Pi — любой человек в мире заходит на её страницу, пишет сообщение, и оно печатается на чековой ленте. Ещё есть пейджер с событиями твиттер-аккаунта и личный API с её заказом кофе. Про код она говорит прямо: до конца не понимает. Сравнивает с испанским, который, вырастая в Сан-Диего, понимаешь на слух, но сам не говоришь. Проверять ей поэтому нечем, кроме вопросов к самому агенту. Ты уверен, что это правильно. Перепроверь. Убедись, что это согласуется с тем, что мы делаем. Отдельным шагом она выясняет, кто вообще ошибся — она сама или он. И на железе это сработало: перед покупкой она перепроверяет рекомендацию по два-три раза, и агент несколько раз ошибался — обычно советовал не те провода. Её слова:
Несколько раз, но я всегда это ловила.
Сработало не потому, что она нашла правильную формулировку. Сработало потому, что ответ было с чем сверить: с описанием товара, с разъёмом на плате, с ценой. Провода видно глазами. В коде сверять не с чем. Там тот же вопрос возвращает не проверку, а вторую генерацию. Что сделать сегодня. Возьмите место, где вы спрашиваете агента «точно?», и назовите внешний источник, которым проверяется ответ: тест, типы, лог, счёт, живой человек. Не называется ни один — у вас не проверка, а ритуал. Честности ради, масштаб у Мэдди игрушечный: принтер, пейджер, личный API, ничего похожего на прод. Пейджер во время записи так и не сработал — она предупреждала, что связь у него рваная. https://www.youtube.com/watch?v=KCGKb3huDsY Чем вы проверяете ответ агента, кроме самого агента?

Эффект от кодинг-агентов до сих пор меряют счётчиком пул-реквестов. Причём открытых, а не смёрженных. Linear разобрал когорту из 6 887 своих платящих команд — 4 280 из них подключили кодинг-агента. У этой когорты недельные пул-реквесты за два года выросли с 21 до 65; у команд без агента счётчик сдвинулся с 8 до 10. Открытый PR ничего не говорит о ценности изменения — это формулировка самого Linear, в разделе про метрику. Там же они признают, что не знают, привёл ли рост выпуска к результату для бизнеса: видна только чёткая корреляция между внедрением AI и ускорением. Посмотрите, что считает ваш дашборд: открытые пул-реквесты или смёрженные. Это разные новости. https://linear.app/data

Repost from Сиолошная
Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов: — Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно что агенты убегут! Если тестировать без интернета, то можно существенно недооценить уровень навыков моделей. В реальных кейсах-то их будут использовать без такого ограничения. Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило? — Они же вообще недоэксперты, не могут даже безопасно контейнер настроить чтоб модель не взламывала! Ну, вообще-то модели нашли несколько ранее неизвестных уязвимостей, так что как минимум все основные известные дыры были закрыты. Но это всё равно не важно — по той же причине, что и пункт выше: просто отодвигает проблему на пару месяцев вперёд, от тестирования к использованию. — Ну ничего серьезного же не произошло! Вообще я не согласен, полноценный взлом HF и попытка взлома реального человека — это серьезно; но даже если нет, то... окей, сейчас не случилось, и это значит, что у нас есть ещё несколько месяцев, чтобы подготовиться. Пока что вся история развития моделей показывает, что прогресс продолжается. Я не вижу причин, по которым через год модель не сможет завершить полноценный взлом десятков-сотен людей через социальную инженерию, свеженайденные уязвимости и огромные базы утёкших паролей и почт, которые сейчас банально лень перебирать. — Да просто свои модели контролировать не могут! Но кто может? Про то, что мы не умеем выравнивать намерения людей и моделей я рассказываю года 3-4, эксперты лет 8-10, а философы и писатели — лет 20-30. Не существует на данный момент гарантированных способов контроля поведения моделей, чтобы они ничего не взламывали и не делали лишнего. В этом и проблема. — Так может просто надо остановить OpenAI и Anthropic? А это поможет? Вот если их в понедельник не станет — разве через год в открытом доступе не появится модель, примерно схожая по навыкам с тем, что есть сейчас? Так ладно просто появится — её-то можно будет специально и намеренно доучить на атаки и взломы (со слов OAI/Anth они сейчас этого не делают, а то, что мы видим — это просто результат развития других навыков). — Я не верю что модели такие умные! У меня они совсем тупые и еле работают! А вы часто даёте своим моделям возможность неделю работать в режиме, где ошибка ничего не стоит и при этом результат легко проверить, и они могут перепробовать сотни-тысячи вариантов? Потому что почти всё, где модели работают хорошо, подпадает под эти критерии, и именно поэтому мы видим прогресс там в первую очередь. — Да это всё вранье, или маркетинг, или пиар, или и то и то! Если это единственная, основная вразумительная линия защиты человека, то понятно, что ему сложно... и страшно поверить в происходящее. Для меня это звучит на уровне «мы никогда не были на Луне», тут мне нечего добавить. === Почему они неправильные? Потому что очень близоруки, и не учитывают, что будет происходить в ближайшие полгода-год, когда модели такого уровня а) потенциально будут выпущены в открытый доступ б) что их может скачать каждый недоброжелатель в) который не будет себя утруждать вопросами о безопасности и ограничении доступа в интернет. Те, кто задают вопросы выше, для меня напоминают людей, которым показываешь на небо, а они смотрят на палец.

Voice dictation startup Wispr raised $280M at a $2B valuation орнул

Мои поздравления команде, но продукт у них работает плохо - я отменю подписку.

Repost from Рживопись
Пабло Пикассо. «Может Концерт Канье Вест в Питере» Из коллекции Рживописи
Пабло Пикассо. «Может Концерт Канье Вест в Питере» Из коллекции Рживописи

Подписчик прислал интересный промпт для Claude Code. Я проверил на другом домене, результаты того стоили. Рекомендую.
Подписчик прислал интересный промпт для Claude Code. Я проверил на другом домене, результаты того стоили. Рекомендую.

В вашем репозитории стоит правило: пул-реквест не смержить без одобрения человека. Его можно выполнять годами и не прочитать при этом ни строчки кода. Как это выглядит, когда доведено до конца. Клэр Во — она ведёт шоу про AI-инструменты и делает продукт для продактов — собрала в своём рабочем репозитории бота, который читает дифф, оценивает риск и сам аппрувит всё, что счёл безопасным. Зовут Merge Mommy. Требование «одобрено человеком» у неё осталось: гитхаб не даёт боту закрыть эту галочку. Снять правило или обойти было можно, она называет оба варианта. Она не стала. Вместо этого переопределила, что значит «одобрил». Её слова:
Мы решили, что эта галочка будет сигналом: наши люди могут нажать approve, не глядя в код.
Правило на месте. Аудит его увидит. Смысл из него вынут. А дальше деталь, из-за которой история и стоит того. Пороги, по которым бот решает — оценка от нуля до ста, всё ниже 24 проходит само, — выбрала не она. Файл с категориями риска, где документация считается низким, а биллинг высоким, тоже написала модель. Дословно у неё: я этого не писала, я это отредактировала. Сложите: человек не читает код и не пишет правило, по которому код пропускают. Он нажимает кнопку. Что сделать сегодня. Откройте документ, по которому у вас пускают в прод: чеклист ревью, матрицу рисков, критерии релиза. По каждому порогу спросите, кто поставил эту цифру и после какого случая. Не находится автор ни у одного — правило у вас соблюдается, но не работает. Честности ради, Клэр ничего не прячет и считает, что так безопаснее. Она проговаривает, что схема годится, только если прописана в политиках ревью и рисков и проходит аудит. И ссылается на Intercom, где одобренные ботом пул-реквесты доезжают до мержа впятеро быстрее человеческих. https://www.youtube.com/watch?v=cmATJGbA8bI Кто поставил пороги в документе, по которому у вас пускают код в прод?

Всем привет! Где-то год назад на SLP Pecha Kucha я рассказывал о том, как веду личный дневник вот уже 14 лет, не пропустив ни дня, и что мне это дало. Тогда же я рассказал, что после рождения дочки завёл второй дневник, для неё, чтобы когда-нибудь передать ей записи про её детство. 🚀 Теперь я запустил продукт про это. Хочу поделиться с SLP и попросить вашей поддержки. 📙 Chapter One Journal — мобильное приложение, дневник для родителей. • Если вы родитель и когда-либо хотели вести дневник про вашего ребёнка, с посланиями ему в будущее, сейчас самое время начать и это отличный инструмент. • Основной фокус на голосовых заметках, чтобы быстро сохранять записи, и на подсказках, которые учитывают возраст ребёнка и помогают придумать, о чём рассказать сегодня. • Планов громадьё (например, режим, когда оба родителя могут вести дневник одновременно), но первой версией можно пользоваться уже прямо сейчас. 📲 Скачать можно здесь (пока только для iOS) 🏷️ Для участников SLP и ваших друзей сделал промо: 2 месяца премиум-доступа бесплатно по коду SLPALUMNI (или просто кликните на эту ссылку). Код действителен до 1 сентября. Пользуйтесь и рассказывайте друзьям-родителям. Отдельно хочу попросить вашей поддержки: 1️⃣ Я буду невероятно благодарен за ваши пятёрки в сторе. Эти оценки очень сильно помогают в органическом продвижении в App Store! 🙏🏻 2️⃣ Даже если вы не родитель перешлите этот пост знакомом родителям, которым это может быть интересно. 3️⃣ Ну и буду рад любому фидбэку, сюда или в личку.

Higgsfield valued at $5.4bn as Goldman and Intel back AI video start-up - мои поздравления команде.

Совет по глубине рассуждения агента ничего не стоит без вашей задачи. В этой истории таких советов три, и смотрят они в разные стороны. Саймон Уиллисон прогнал вышедшую в пятницу Qwen 3.8 27B — 27 миллиардов параметров, лицензия Apache 2, квант на 17 гигабайт — локально на MacBook Pro M5 Max и NVIDIA DGX Spark. Рисунок в SVG занял 21 минуту: 22 276 токенов рассуждения ради 3 223 токенов вывода. Тот же промпт с выключенным рассуждением — 137 секунд. — Карточка модели ставит дефолтом самый глубокий из трёх уровней, xhigh, «for complex tasks demanding thorough analysis». — Уиллисон про свой же лучший результат: «Was that worth waiting 21 minutes for? Absolutely not», и дальше — игнорируйте дефолт, начинайте с low или вовсе без рассуждения. — Та же карточка ниже предупреждает об обратном: в многоходовых агентных задачах пониженный reasoning effort не всегда сокращает общее время, потому что даёт меньше анализа, больше провалов и повторных попыток. — В треде на Hacker News советуют третье: не low, а medium и окно побольше, иначе модель упирается в компакцию и передумывает одно и то же по кругу. И вот тут начинается то, ради чего я притащил историю. Все три совета верны — просто каждый про свою задачу. Уиллисон мерил рисунок пеликана. Человек под ником SwellJoe мерил свой пул-реквест: одиннадцать часов на паре видеокарт, «default everything, no tuning», при том что GPT 5.5 сделала похожую задачу у него примерно за двадцать минут. Карточка говорит про многоходовые агентные прогоны вообще и не даёт ни одного числа. Три задачи — три ответа, и ни один из них не про вашу. Эта же ручка есть и у вас: в агенте, в клиенте локальной модели или в параметрах вызова API. И вы, скорее всего, не трогали её ни разу, потому что непонятно, в какую сторону. Что сделать сегодня. Взять не бенчмарк, а свою типовую задачу и прогнать её дважды: на дефолте и уровнем ниже. Признак, по которому решать, — не секунды, а сколько раз пришлось переспрашивать. У Уиллисона на быстрой настройке инструмент почти заработал: «nearly works but shows the boxes in the wrong place». Честности ради, SwellJoe в следующей же фразе объясняет, что дело не только в дефолте: другие мелкие модели на своих настройках укладывались в пару часов, «but did a worse job». Да и главный вывод самого Уиллисона не про глубину — ежедневным инструментом модель не даёт стать сырая скорость, 15–30 токенов в секунду на дорогом железе. https://simonwillison.net/2026/Aug/16/qwen-38-27b/ Какой уровень рассуждения стоит по умолчанию в том агенте, которым вы вчера пользовались чаще всего?