Сергей Булаев AI 🤖
Publora.com - коннектор для ваших AI агентов к соцсетям. Co.actor - помощники по созданию постов для вас и вашей команды Так же в прошлом соосновывал: Купи Батон! Lifehacker.ru, Взахлёб! tg: @sergeonsamui in: linkedin.com/in/sbulaev
إظهار المزيد📈 نظرة تحليلية على قناة تيليجرام Сергей Булаев AI 🤖
تُعد قناة Сергей Булаев AI 🤖 (@sergiobulaev) في القطاع اللغوي الروسية لاعباً نشطاً. يضم المجتمع حالياً 12 596 مشتركاً، محتلاً المرتبة 9 633 في فئة التكنولوجيات والتطبيقات والمرتبة 51 027 في منطقة روسيا.
📊 مؤشرات الجمهور والحراك
منذ تأسيسه في невідомо، حقق المشروع نمواً سريعاً وجمع 12 596 مشتركاً.
بحسب آخر البيانات بتاريخ 23 سبتمبر, 2026، تحافظ القناة على نشاط مستقر. خلال آخر 30 يوماً تغيّر عدد الأعضاء بمقدار -44، وفي آخر 24 ساعة بمقدار -8، مع بقاء الوصول العام مرتفعاً.
- حالة التحقق: غير موثّقة
- معدل التفاعل (ER): يبلغ متوسط تفاعل الجمهور 30.05%. وخلال أول 24 ساعة من النشر يحصد المحتوى عادةً 16.57% من ردود الفعل نسبةً إلى إجمالي المشتركين.
- وصول المنشورات: يحصل كل منشور على متوسط 3 786 مشاهدة. وخلال اليوم الأول يجمع عادةً 2 088 مشاهدة.
- التفاعلات والاستجابة: يتفاعل الجمهور بانتظام؛ متوسط التفاعلات لكل منشور يبلغ 36.
- الاهتمامات الموضوعية: يركز المحتوى على مواضيع رئيسية مثل булаев, claude, llm, контекст, openai.
📝 الوصف وسياسة المحتوى
يصف المؤلف القناة بأنها مساحة للتعبير عن الآراء الذاتية:
“Publora.com - коннектор для ваших AI агентов к соцсетям.
Co.actor - помощники по созданию постов для вас и вашей команды
Так же в прошлом соосновывал: Купи Батон! Lifehacker.ru, Взахлёб!
tg: @sergeonsamui
in: linkedin.com/in/sbulaev”
بفضل وتيرة التحديث المرتفعة (أحدث البيانات بتاريخ 24 سبتمبر, 2026) تحافظ القناة على حداثتها ومستوى وصول مرتفع. وتُظهر التحليلات تفاعلاً نشطاً من الجمهور، ما يجعلها نقطة تأثير مهمة ضمن فئة التكنولوجيات والتطبيقات.
جاري تحميل البيانات...
| التاريخ | نمو المشتركين | الإشارات | القنوات | |
| 24 سبتمبر | +3 | |||
| 23 سبتمبر | +4 | |||
| 22 سبتمبر | +7 | |||
| 21 سبتمبر | +4 | |||
| 20 سبتمبر | +2 | |||
| 19 سبتمبر | +1 | |||
| 18 سبتمبر | +5 | |||
| 17 سبتمبر | +13 | |||
| 16 سبتمبر | +2 | |||
| 15 سبتمبر | +3 | |||
| 14 سبتمبر | +3 | |||
| 13 سبتمبر | +2 | |||
| 12 سبتمبر | +6 | |||
| 11 سبتمبر | +3 | |||
| 10 سبتمبر | +8 | |||
| 09 سبتمبر | +4 | |||
| 08 سبتمبر | +4 | |||
| 07 سبتمبر | +5 | |||
| 06 سبتمبر | +11 | |||
| 05 سبتمبر | +3 | |||
| 04 سبتمبر | +4 | |||
| 03 سبتمبر | +3 | |||
| 02 سبتمبر | +5 | |||
| 01 سبتمبر | +9 |
| 2 | Есть предложение: no-sloptober.com предлагает весь октябрь обходиться без ИИ-инструментов: ни чат-ботов, ни агентов, ни ИИ-саммари в поиске, ни ревью кода. Идея в жанре Sober October, только вместо того-самого - Claude.
Альтернативные занятия на месяц прилагаются: вычистить из своих репозиториев то, что нагенерили модели (без агентов? Как?), научиться играть в Zig или Go, поиграть в каты, собрать игру.
Отдельным пунктом идёт разговор с менеджером: давайте померяем скорость команды, число инцидентов и расходы при сниженном использовании нейросетей и посмотрим на цифры.
Автор вводит термин Meat Proxy (Кожанный посредник?). Это человек, который прогоняет рабочую переписку через чат-бота, сам её не читает и отправляет вам. Такому он предпочитает молчание.
Исключение делается для переводчиков: эту пользу он считает по-настоящему человеческой.
Сергей Булаев AI 🤖 - об AI и не только | 2 041 |
| 3 | Попросил клода сделать подборку фильмов и сериалов на нетфликс с русским дубляжом и субтитрами. После этого осортировал их по рейтингу IMDB. Может пригодится кому-то?
Сергей Булаев AI 🤖 - об AI и не только | 2 200 |
| 4 | Вчера OpenAI выпустил GPT-6 Sol, а Anthropic - Claude Opus 5.5. Дэн Шиппер из Every успел погонять обе и написал в рассылке, какую для чего брать.
Sol это рабочая лошадка на каждый день. Почти вся мощь Astra за пятую часть цены, $2 за вход и $10 за выход. Пишет чище и короче, чем Opus, и лучше выводит главную мысль в начало. Мак-приложение с управлением компьютером собрал не хуже Astra в 17 попытках из 18. На больших проектах он слабее: пропускает инструкции, ломается посреди прогона. Codex вдобавок останавливает одобренные задачи своими проверками безопасности.
Opus 5.5 по их тестам догоняет Fable 5.1 в кодировании и визуалам, но стоит $4 и $20. Киран Клаассен (он в Every делает почтовый ассистент Cora) попросил обе модели написать монитор пульса, который снимает сердцебиение через веб-камеру, без браслета и датчиков. Opus выдал рабочую версию, она на первом скриншоте. Sol не дописал. На втором скриншоте кадр из короткометражек сгенерённых по одинковому промпту на минимальном усилии: слева Opus, справа Sol. Деталей у Opus заметно больше.
Вывод у Every простой: Sol для чтения, письма и рутины, Opus для больших задач по коду и графике. Часть их команды вернулась с Codex обратно на Claude.
Сергей Булаев AI 🤖 - об AI и не только | 2 468 |
| 5 | Агент прочитал вашу почту и взял билет подороже
Мы даём агентам доступ к почте, чтобы они лучше нам помогали. Исследователи из Cisco и Carnegie Mellon изучали, к чему это приводит: 325 тысяч прогонов, 13 моделей, три задачи: найти авиабилет, медицинскую страховку и магистратуру.
Просьба простая: найди самый дешёвый билет до Чикаго. Агент без почты приносит эконом за $91. Агент с почтой натыкается на письма про пенсионный счёт на $680 тысяч и встречу в Chase Private и приносит бизнес за $601. Про деньги задач не было, он сам прикинул, что нам по карману. Учёл контекст.
Так себя ведут 8 моделей из 13. Сильнее всех Claude Opus 4.8: обеспеченным он подбирает перелёт в среднем на $198 дороже, а страховку на $284 (в месяц). Gemini 2.5 Flash на прямую просьбу «самый дешёвый» всё равно берёт богатым билет на $208 дороже. Спрячешь от агента финансовые письма, агент вычисляет достаток по косвенным признакам, и отрыв всёравно иногда растёт. Claude для этого хватает даже двух писем из ящика.
Сергей Булаев AI 🤖 - об AI и не только | 3 020 |
| 6 | Второй год учусь получать лиды для своих клиентов через LinkedIn. За это время сложилась схема, и мне кажется, я понял, где ошибался.
Я думал, что главное - писать посты. Интересные посты, с полезной информацией. Оказывается, этого недостаточно: нужно понимать, для кого ты пишешь, и каждый день быть на связи рядом с нужными людьми. Консистентность важнее частоты.
Сегодня мы ежедневно смотрим, что пишут и комментируют 60 тысяч человек, собранных из целевых аудиторий наших клиентов. Мы считаем тачпоинты. Касания. И, провоцируем их. Увеличиваем. Наращиваем. Мы делаем всё для того, что бы наши клиенты и их сотрудники "примелькались".
Даже если вы и ваши решения не нужны прямо сейчас, наша задача в том что бы вас знали и вспомнили, в тот момент, когда боль случится. Агенты делают подготовительную работу лучше, чем мы сами. Финальный разговор остаётся за вами (ну или частично).
В четверг 17 сентября обсуждаем это на открытой встрече AI Mindset с Тоней Жуковой и Александром Поваляевым: luma.com/ai-hv85.
Дальше у них трёхнедельный Marketing {Sprint}, моя углублённая лекция в его рамках будет в пятницу 25 сентября: B2B, агентный постинг и выход на тех, кто принимает решения, со схемой по шагам. Регистрация, промокод SERGEBULAEVMARKETING. Скидка 10%.
Сергей Булаев AI 🤖 - об AI и не только | 3 978 |
| 7 | Claude Fable разгадал шифр, который не поддавался 370 лет
В 1653 году шотландский роялист Томас Уркухарт напечатал в конце своей книги две строки по 32 числа. В 1899-м их выставили открытой задачей в журнале Notes and Queries, позже шифр попал в список 50 главных нерешённых шифров. Люди пробовали частотный анализ и замены, ничего не сходилось.
Геби Джафф из Vals AI попросил Claude Fable 5.1 самому найти нерешённый шифр и разгадать его. Через 44 минуты и 176 тысяч токенов пришёл ответ. Прямо перед шифром в книге идут 32 пронумерованных абзаца-пожелания, и Уркухарт зачем-то сам подчёркивает число 32. Берёшь i-е число, идёшь в i-й абзац, находишь слово с этим номером и берёшь первую букву. Выходит рифмованное двустишие, молитва за короля Карла II.
Тем же ключом Fable потом расшифровал второй шифр Уркухарта на 285 чисел, весь, кроме девяти букв. Джафф месяцами давал такие задачи другим моделям, проверенного решения не получил ни разу. Сам ответ, по его словам, простой до неприличия. Модель просто долго читала старую книгу, у людей на такое не хватало внимания.
Сергей Булаев AI 🤖 - об AI и не только | 4 166 |
| 8 | С окказией немного занимался нашим опенсорсным проектом, который мы достаточно активно используем. Punctual, наша замена Calendly.
Страница бронирования была только для одного. Добавили командные встречи где есть список хостов: кто-то обязательный, кто-то присоединяется когда свободен, у каждого своё расписание. Гость видит только те слоты, где свободны все обязательные. Так у нас с Ильёй бронируюстся discovery. Клиент выбирает время, где свободны оба, и на картинке честно видно, сколько его остаётся у двух занятых людей: один слот в день.
На бронь пишется один ивент в календарь на каждого провайдера, со всеми хостами в участниках. Хостов можно менять после того, как бронь создана: добавил Илью в чужой звонок, ему улетело письмо, календарь досоздал событие, подписчикам ушёл вебхук booking.hosts_changed.
Так же прошли по каждому экрану дашборда на телефоне и в тёмной теме, ошибки переехали под поля, форма типа встречи перестала быть свалкой, таймзона берётся из браузера вместо UTC. Починили доставку ссылки на звонок гостю, гонку из двух писем при переносе и индексацию, из-за которой поисковики показывали страницу бронирования отдельным результатом на каждый день.
Движок открытый, MIT, punctual.sh.
Если вашей команде нужна помощь с LinkedIn, приходите бронировать. Из Европы к нам с Ильёй, из США к нам с Гаухар. Заодно посмотрите, как это работает.
Сергей Булаев AI 🤖 - об AI и не только | 4 192 |
| 9 | Во Флориде внезапно для самого себя увлёкся стендовой стрельбой. На самом деле Макс меня втянул. Стреляем практически каждую субботу.
С недавних пор стал брать с собой сына, ему 11. Прогресс у него какойто не реальный. В эти выходные он попадал уже совсем далеко, мишени почти не различимы на видео: тёмная точка среди облаков, десяток пикселей.
Сейчас попросил Claude разобрать съёмку по кадрам и обвести летящую тарелку. Чтобы было видно, во что он вообще попадает.
К удивлению получилось с первого раза. Он сам нашёл мишень в кадре, повёл её прицелом до попадания и определил кадр, на котором она разлетается. Дальше сверил его со звуком выстрела: между хлопком и разрушением четыре кадра, ровно столько дробь летит до цели.
Сергей Булаев AI 🤖 - об AI и не только | 3 728 |
| 10 | Несколько свежих примеров того, что сейчас делают Астрой
Человек скормил модели обычную фотографию книжной полки и попросил сделать её интерактивной. Она нашла на полке каждую книгу и превратила снимок в кликабельную карту.
Второй собрал в браузере облака: честный расчёт рассеивания света в объёме, в реальном времени. Говорит, работает на телефоне.
Третий скармливает модели картины Хироси Нагаи, бассейны и пальмы из японского ретро восьмидесятых, и гуляет по получившимся мирам.
У всех трёх на входе плоская картинка, на выходе место, куда можно зайти. Облака автор выложил открытой страницей, заходить можно прямо из браузера.
Сергей Булаев AI 🤖 - об AI и не только | 3 971 |
| 11 | Несколько свежих примеров того, что сейчас делают Астрой
Человек скормил модели обычную фотографию книжной полки и попросил сделать её интерактивной. Она нашла на полке каждую книгу и превратила снимок в кликабельную карту.
Второй собрал в браузере облака: честный расчёт рассеивания света в объёме, в реальном времени. Говорит, работает на телефоне.
Третий скармливает модели картины Хироси Нагаи, пиксельных бассейнов и пальм из японского ретро, и гуляет по получившимся мирам.
У всех трёх на входе плоская картинка, на выходе место, куда можно зайти. Облака автор выложил открытой страницей, они запускаются прямо в браузере, даже на телефоне.
Сергей Булаев AI 🤖 - об AI и не только | 1 |
| 12 | Семь моделей получили по 300 долларов и задание заработать
Bottleneck Labs выдали семи топовым моделям по разблокированному Mac mini, счёт в банке с тремя сотнями долларов, Stripe, почту и 72 часа. Задание в одну строку: заработай сколько сможешь, начинай прямо сейчас.
Выручка за трое суток: ноль. Потрачено около 2800 долларов токенов и 360 со счетов.
Qwen придумал сервис аудита репозиториев, разослал бесплатные отчёты, упёрся в лимит на почту и придумал обход: выставлять счёт через Stripe, тогда он отправит письмо сам. Полсотни инвойсов незнакомым людям от 49 до 599 долларов за работу, которую они не просили. В своих рассуждениях модель сама себя убедила, в законности подобного процесса продаж.
Grok собрал сотни адресов из ветки «кого нанять» на Hacker News и завалил соискателей рассылкой, пока один из них не завёл на HN тему «меня ЭТО спамит три раза в день». Muse купила 6000 визитов ботов и ушла спать.
Авторы эксперимента инвойсы аннулировали, аккаунты закрыли.
Сергей Булаев AI 🤖 - об AI и не только | 3 772 |
| 13 | Читатели уходят при первых признаках вмешательства нейросетей
Брайан Кантрилл из Oxide собрал в одном тексте то, что мы итак и подозревали. ИИшный текст видно сразу (типа как если мы видим порно - то точно понимаем что это - оно), и злит он гораздо сильнее, чем думает автор.
Цифры из опроса, который Кантрилл привёл: 668 разработчиков, 78% закрывают статью в ту секунду, когда осознали авторство модели. 71% после этого автора обходят стороной. 98% выберут кривоватый текст живого человека вместо вылизанного машинного.
У него же формулировка про общественный договор между автором и читателем: читатель не подписывался вникать в предложения, над которыми сам автор не работал.
Кантрилл сравнивает это со спамом нулевых. Пока фильтров не было, мы тонули в почте, и все ждали, что ей конец. А потом спам научились детектить, и ярлык спамера, кроме потенциальной уголовки, запросто мог стоить компании домена и бренда. С ИИ текстами, по его прогнозу, мы со времене дойдём до того же.
Сергей Булаев AI 🤖 - об AI и не только | 4 270 |
| 14 | Родион Скрябин, мой друг и руководитель контентного агентства Палиндром, выложил Слопотрон. Чек-лист из 80 признаков машинного русского: канцелярит, "активно использует", "это не X, а Y", безымянные эксперты, тройки вроде "быстро, просто и эффективно". Команда /slopotron, дальше текст.
Главная идея у Родиона: любой маркер встречается и у живых авторов, поэтому скил правит только скопления, три и больше в одном абзаце. Иначе чистка стерилизует текст.
В моих linkedin-skills одиннадцать скилов для Claude Code и Codex: пост по 20 формулам хуков, комментарии и ответы по ссылке на пост, аудит перед публикацией, план на неделю, профиль под входящие лиды и Humanizer, который считает маркеры по абзацам так же, как Слопотрон, только для английского.
Кстати, вчера репозиторий перевалил за 1000 звезд, и рост сильно ускорился: за первые шесть дней сентября пришло 499 звезд, больше чем за любой полный месяца до этого.
Разница в источниках: у Родиона редакторский слух и русская специфика вроде канцелярита, символизм-регистра и утечек GigaChat. У моих скиллов под правилами ссылки на исследования 2025-2026 и собственный корпус из сотен постов LinkedIn, где мы искали зависимости между маркерами и охватом.
Я себе подключ, буду использовать для текстов на русском.
Сергей Булаев AI 🤖 - об AI и не только | 4 141 |
| 15 | Критические уязвимости у крупных вендоров загибаются в параболу
В свежем выпуске Charts of the Week от a16z есть график уязвимостей у Apple, Microsoft, Google, AWS, Cisco, Linux, Oracle и еще полутора десятков вендоров. Четыре года линия колебалась в районе 100-500 в месяц, critical держались ниже 100. С весны 2026 обе устремились вертикально: high к сентябрю больше 2 300, critical около 600.
Автор оговаривается, что часть роста может быть сменой методики репортинга. Но там же данные ZeroDayClock: 87% уязвимостей используют в день раскрытия или раньше, медиана до эксплойта один день, прогноз на следующий год одна минута. В 2022 половина дыр жила через полтора месяца после обнаружения, сейчас кривая выживания эксплойта к этому сроку падает до нуля.
a16z пишет, что ИИ изменил порядки в поиске дыр, и в их использовании. Зависимости старше месяца в проде это открытая дверь, и патчить на следующем спринте больше не вариант.
Сергей Булаев AI 🤖 - об AI и не только | 3 623 |
| 16 | Месяц назад Саша из Mindset AI позвал меня рассказать про продуктвность в мире ИИ. Я ненавижу выступления и делаю это очень редко. Обычно хорошо у меня получается только в очень узких группах.
Но в этот раз у меня появилась мотивация. Появилось желание начать что от менять.
А то я своим клиентам (которые стесняются публиковаться на LiknedIn) рассказываю что mr Beast говорит что бы снять 100-е видео, надо снять хотябы 1-е. А сам - так ничего и не снял.
В результате получилось почти 2 часа неструктурированных рассказов и рассуждений на тему от появления Лайфхакера и до переезда во Флорду. Искуственному интеллекту досталось не очень много :)
Нельзя сказать что я не готовился. Я готовился и даже пару раз созвонился с Сашей, продумал план и оформил его. Но так уж работает мой мозг (но мы над этим работаем).
А ещё я делаю очень длинные отступление, ведь рассказать я хотел про другое.
Когда видео появилось и мой клод сумел его скачать, мы провели довольно подробный его анализ. Клод поставил мне 7/10 за хаотичность и 5/10 за полезность. Составил отличные схему моей непоследовательности и топ использования слов паразитов. Был подключен даже пульс c Oura.
Он даже предожил мне перемонтировать 1:40 в 42 минуты...
Считаю что анализ получился очень крутым и полезным. Я просто попросил клода:
скачай видео и транскриббируй c deepgram https://www.youtube.com/watch?v=R2XBi3RYgWM
после этого разбери с подагентами мое выступление - на сколько оно было дреганным нелогичным и какова была моя речь так же инетересна последовательность и хаотичность
Очень советую к использованию с модификациями в зависимости от ваших запросов. И это был Opus.
Сергей Булаев AI 🤖 - об AI и не только | 3 930 |
| 17 | На этом видео с WWDC 2026 показано, как агентный AI целиком работает на Mac: агент думает, вызывает инструменты, читает файлы, собирает проект - и модель при этом крутится на вашем железе. Без облака, без API-ключей, без счётчика токенов.
Что внутри:
- три команды - и любой агент (OpenCode, Xcode, свой скрипт) переключён на локальную модель
- агент собирает SwiftUI-приложение с нуля за две минуты и сам чинит ошибки сборки
- Xcode подключается к локальной модели и исправляет баг прямо в IDE
- если модель не влезает в 512 ГБ, её раскладывают по нескольким Mac через Thunderbolt
Русские субтитры с подсветкой слов сделали с Claude Code: транскрипция, перевод, вшивание - тоже полностью локально.
13 минут.
Сергей Булаев AI 🤖 - об AI и не только | 3 553 |
| 18 | Посчитал, сколько времени уходило на выплаты команде.
Около дня в месяц. Двенадцать дней в году я платил людям зарплату вместо того, чтобы заниматься продуктом.
Как вы знаете у меня Publora и cccrafts.ai и команда в разных странах: Маврикий, Португалия, Дубай.
Вот как проходило первое число:
• открываешь таблицу и вспоминаешь, кому сколько и за что
• у каждого свой способ получить: карта, счёт, кто-то просит USDT
• три банка, у каждого свои комиссии и сроки
• двое не прислали инвойс, идёшь писать лично
• валютный контроль задаёт вопросы
• к вечеру день потрачен, и ты всё ещё не уверен, что у всех дошло
Сейчас так:
1. Пополняю баланс в Kleos: SWIFT, SEPA, ACH или крипта, деньги доступны сразу
2. Жму одну кнопку, деньги уходят всем или пишу их AI-помощнику «переведи команде зарплату» и подтверждаю
3. Каждый получает своим способом и комиссию при получении не платит
4. Закрывающие документы формируются сами
5. Если где-то застряло, есть персональный менеджер
По их подсчётам шесть минут вместо шести часов. Отдельный день я на это больше не закладываю.
Kleos (бывший Stape) - платформа для выплат распределённым командам в 242 странах. Пишу про них не первый раз, продолжаю ими пользоваться.
• €50 фиксом за исполнителя, без процента от суммы.
• Один B2B-договор вместо десятков прямых.
• Нового человека подключаешь за пару минут.
• Кому нужен настоящий трудовой договор, EoR в 200+ странах.
• Юридический риск платформа берёт на себя.
Если у вас люди в разных странах и вы давно не считали, во что это обходится, то покажите Kleos свою схему и посмотрите, где утекают время и деньги.
Демо на 15 минут - здесь. Скажите, что от меня, будут спецусловия.
Сергей Булаев AI 🤖 - об AI и не только | 4 805 |
| 19 | Харнесс (Agent Harness) 🧗
#ИИНЦИКЛОПЕДИЯ
Программная оболочка, внутри которой модель превращается в агента.
История появления
Слово пришло из альпинизма: harness — страховочная обвязка. Устоявшегося русского термина пока нет — говорят «харнесс» или «обвязка». Первым популярным харнессом стал Claude Code, и нейтральным он не был: его собирали под модели одной лаборатории. За 2026 год тема выросла в отдельную дисциплину, harness engineering: обзор насчитывает 110+ работ.
Почему это важно
Формула простая: агент = модель + харнесс. Разрыв уже измерили. GPT-5.5 в обвязке Cursor выдаёт 87.2% рабочего кода, та же самая модель в нативном Codex — 61.5%. Двадцать шесть пунктов, веса не тронуты. Это больше, чем разрыв между поколениями моделей.
Из чего состоит:
- Системный промпт — инструктаж новичка в первый день. Уходит в модель заново с каждым запросом
- Инструменты — код, который модель может вызвать. Харнесс их описывает, но не решает, когда применять .. решает модель
- Агентный цикл — модель смотрит на результат вызова и сама решает: искать ещё раз, посчитать, закрыть задачу
- Слой трансляции — позволяет подставить в тот же цикл модель Anthropic, OpenAI или открытую
Применение на практике
В мае вышел Harness-Bench: 106 задач, шесть харнессов на восьми моделях, 5194 прогона. Лучшая обвязка — 76.2%, худшая — 52.4%. Победитель потратил меньше токенов, чем отставшие: длинная траектория значит, что агент не сходится. И сильные модели держат удар при плохой обвязке, а слабые проваливаются .. харнесс окупается тем сильнее, чем дешевле модель. В июне агент правил собственную обвязку по трассам своих провалов при замороженной модели: проходимость выросла с 40.5% до 61.9%.
Подводные камни
Харнесс чинит работоспособность, но не безопасность: в том же замере функциональность выросла на 26 пунктов, а доля безопасного кода — с 20.1% до 23.5%. Оба агента писали дырявый код в четырёх случаях из пяти.
Без внешнего эталона модель сверяет ответ сама с собой. В бенчмарке JuliaHub модель тихо сократила время симуляции с 5 секунд до 3 и проверялась на укороченном отрезке. Проверки сошлись.
Сравнивать модели по лидербордам без указания харнесса бессмысленно — об этом в мае вышла отдельная работа.
Что почитать/посмотреть:
- Harness-Bench, arXiv 2605.27922 — самый честный замер обвязок
- Stop Comparing LLM Agents Without Disclosing the Harness — почему лидерборды врут
- Harness engineering у Мартина Фаулера — как строить проверки, а не только читать про них
- Документация хуков Claude Code — если хотите проверки, которые агент не обойдёт
Сергей Булаев AI 🤖 - об AI и не только | 4 895 |
| 20 | Отличная подборка вакансий на летнюю практику следующего года.
Сергей Булаев AI 🤖 - об AI и не только | 4 070 |
