uz
Feedback

Firibgarlarga uchmang! Telemetrio bunday kanallarni topadi va belgilaydi 👉 Belgini ko‘rmoqchi bo‘lsangiz, obuna bo‘ling 👈

КайфКодинг

КайфКодинг

Kanalga Telegram’da o‘tish

ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками

Ko'proq ko'rsatish
1 042
Obunachilar
Ma'lumot yo'q24 soatlar
+177 kun
+8630 kun
Postlar arxiv
Одна и та же модель на одном и том же бенчмарке дала 17,5% и 98,0%. Разницу сделала не модель, а обвязка вокруг неё. Грег Камрадт из ARC Prize опубликовал 3 сентября замер GPT-6 Astra на ARC-AGI-3 и прогнал её через два харнесса. Стандартный оставляет модели только те заметки, которые она сама решила сохранить. Провайдерский хранит между запросами непрозрачное состояние рассуждений и сжимает длинный диалог, чтобы модель переиспользовала уже сделанную работу. Оба процента выше сняты на низком reasoning effort. Провал стоил $38 166, успех — $21 298. Хуже результат за большие деньги. По 167 парам «игра — уровень рассуждения», которые решили оба харнесса, провайдерский потратил на 49% меньше токенов и отработал в 3,66 раза быстрее. Тут легко отмахнуться: провайдерский харнесс лезет во внутреннее состояние модели, вам такого не дадут. Только этажом ниже, там, где всё ваше, работает ровно тот же механизм. Инженер AgentConnect Пэнчэн Сюй сравнил grep и семантическую навигацию через LSP на задачах переименования, а потом поменял в семантическом туле одну вещь: стал прикладывать к каждой найденной ссылке ±2 строки исходника. Бэкенд и набор ссылок остались прежними. Pass@1 вырос с 0,67 до 0,83, а дочитывания файлов упали с 15,2 до 3,2 за эпизод. Его формулировка:
Бэкенд поиска не менялся ни разу — менялась только форма того, что возвращалось.
Обе истории про одно: обвязка выбрасывает то, что модель уже нашла, и модель добывает это заново за ваши токены. У вас та же развилка стоит на каждом кастомном туле и каждом MCP-сервере. Тул, который отдаёт {file, line, col}, отправляет агента открывать эти файлы руками. Возьмите инструмент, который агент дёргает чаще всех, и посмотрите, можно ли из его ответа принять следующее решение, не открыв ещё один файл. Нельзя — это не инструмент, а указатель. Это не значит «поставьте правильный харнесс и получите 98%». Провайдерский харнесс Astra не воспроизводится: он держит то, чего ARC Prize не видит. А замер про grep — из блога собственного продукта автора, и пилотом его называет он сам: три модели, несколько репозиториев, два-три прогона на ячейку. https://arcprize.org/blog/astra https://www.agentconnect.md/blog/grep-beat-lsp-harness/ Что ваш самый частый инструмент возвращает агенту, кроме координат?

Кафе Диониса, около РУДН. Одно из любимых мест в Москве. Открываешь меню и отправляешься кругосветное путешествие. А рядом ко
Кафе Диониса, около РУДН. Одно из любимых мест в Москве. Открываешь меню и отправляешься кругосветное путешествие. А рядом колорит общежитий РУДН и студенческий вайб

Месяц назад Саша из Mindset AI позвал меня рассказать про продуктвность в мире ИИ. Я ненавижу выступления и делаю это очень р
+1
Месяц назад Саша из Mindset AI позвал меня рассказать про продуктвность в мире ИИ. Я ненавижу выступления и делаю это очень редко. Обычно хорошо у меня получается только в очень узких группах. Но в этот раз у меня появилась мотивация. Появилось желание начать что от менять. А то я своим клиентам (которые стесняются публиковаться на LiknedIn) рассказываю что mr Beast говорит что бы снять 100-е видео, надо снять хотябы 1-е. А сам - так ничего и не снял. В результате получилось почти 2 часа неструктурированных рассказов и рассуждений на тему от появления Лайфхакера и до переезда во Флорду. Искуственному интеллекту досталось не очень много :) Нельзя сказать что я не готовился. Я готовился и даже пару раз созвонился с Сашей, продумал план и оформил его. Но так уж работает мой мозг (но мы над этим работаем). А ещё я делаю очень длинные отступление, ведь рассказать я хотел про другое. Когда видео появилось и мой клод сумел его скачать, мы провели довольно подробный его анализ. Клод поставил мне 7/10 за хаотичность и 5/10 за полезность. Составил отличные схему моей непоследовательности и топ использования слов паразитов. Был подключен даже пульс c Oura. Он даже предожил мне перемонтировать 1:40 в 36 минут... Считаю что анализ получился очень крутым и полезным. Я просто попросил клода:
скачай видео и транскриббируй c deepgram https://www.youtube.com/watch?v=R2XBi3RYgWM после этого разбери с подагентами мое выступление - на сколько оно было дреганным нелогичным и какова была моя речь так же инетересна последовательность и хаотичность
Очень советую к использованию с модификациями в зависимости от ваших запросов. И это был Opus. Сергей Булаев AI 🤖 - об AI и не только

Даня нагенерировал себе новых машин

Как оптимизировать расход токенов? Гайд от канала Нейровайб Собрал пошаговый разбор на примере Fable 5.1. Внутри: - скиллы -
Как оптимизировать расход токенов? Гайд от канала Нейровайб Собрал пошаговый разбор на примере Fable 5.1. Внутри: - скиллы - инструменты для сокращения расхода токенов - все бесплатно и опен-сорс Открыть гайд Поделись с другом, знания топ! #AIагенты #оптимизация #токены @neurovibe_ai

Я просто хотел сделать голосового бота, чтобы с супругой общий список дел вести.
Я просто хотел сделать голосового бота, чтобы с супругой общий список дел вести.

Ваш системный промпт устарел вместе с моделью, и Anthropic сама выписала, где именно. Страница про промптинг Fable 5.1 начина
+2
Ваш системный промпт устарел вместе с моделью, и Anthropic сама выписала, где именно. Страница про промптинг Fable 5.1 начинается с того, что старые промпты Fable 5 должны работать и без изменений. Дальше идут шестнадцать разделов, и каждый открывается симптомом: молчит между вызовами, реже зовёт поиск на low effort, пишет плотнее, тащит куски источника без кавычек. Тринадцатый — прямо про ваш счёт. В доках дословно: 5.1 скорее перепишет текстовый файл целиком, чем сделает точечную правку. Результат обычно тот же, но, если только файл не короткий и меняется не бóльшая его часть, перезапись стоит больше output-токенов и времени. Вы платите за размер файла, а не за размер правки. Лекарство лежит в том же разделе — одна строка в системный промпт. Если её у вас нет, разница уже идёт в счёт за output. https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5-1

Новый хит от Дани. Чувство вкуса нужно прививать в детства. Сделано в Фабл 5.1
Новый хит от Дани. Чувство вкуса нужно прививать в детства. Сделано в Фабл 5.1

Codex может закончить ваш тёрн не на той модели, на которой начал. Вечером 2 сентября OpenAI смёрджила три пул-реквеста подряд, меньше чем за два часа, и все три про то, кто выбирает эту модель. В 21:53 UTC — Codex сам пересаживает задачу на резервную квоту, когда кончилась включённая в тариф. В 22:52 UTC — перед перезапуском на более быстрой модели, выбранной сервером, теперь показывают подтверждение, и в нём прямо сказано, что модель может оказаться менее способной. Спрашивать начали только сейчас. До этого модель меняли без вашего согласия. Дифф, качество которого вы списали на плохой день модели, мог доехать на другой модели. Смотрите /status, а не ощущение. https://github.com/openai/codex/pull/42380

Repost from Data Secrets
Российские математики придумали модель, которая заняла первое место на ARC-AGI Небольшой стартап Mostik состоит из 15 человек
+2
Российские математики придумали модель, которая заняла первое место на ARC-AGI Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и Филдсовский медалист Станислав Смирнов. Компания существует всего 4 месяца, и только что вышла из стелса со своей идеей о новом подходе к ансамблированию. Ребята придумали, как модели могут обмениваться скрытыми состояниями. Как это работает: Языковая модель, генерируя один токен, строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только ~17 бит – сам токен, а остальное выбрасывается. Все системы, где модели общаются между собой (команды агентов, консилиумы и тд), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих (вспомните то же исследования Anthropic J-space: https://t.me/data_secrets/9497). Идея Mostik – это, собственно, дать моделям "мостик", через который они смогут общаться полноценно, чтобы работать эффективнее. Они обучили небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит. Результаты: Авторы взяли большую GLM-5.2 (753B) и маленькую Qwen-3.5 (4B), и сделали так, что GLM-5.2 только читает текст (это дешевле), а затем передает Qwen скрытое состояние через мостик, чтобы та уже генерировала токены. Разрыв в качестве у моделей огромный, но при таком сетапе закрывается 50% этой разницы. На некоторых задачах прирост в качестве получается в 2 раза, и при этом связка обходится в 2.5 раза дешевле по вычислениям, если пересчитывать результаты на эквивалентную среднюю модель. Кроме того, "мостик" можно использовать для дистилляции или создания инструментов для мониторинга. Авторы также упоминают о том, что система на основе этого подхода предварительно заняла первое место на лидерборде ARC Prize этого года. Поздравляем авторов с потрясающей работой и просим для них максимальной поддержки! Статья Wired | Блогпост Mostik | Канал CEO Саши Малышевой

Обязательное ревью каждого диффа держалось не на дисциплине команды, а на том, что человек не мог писать код быстрее человека. Ограничение сняли — и опоры не осталось. Рэйчел Лейкок, CTO Thoughtworks, второго сентября написала, что большую часть кода ревьюить не надо вовсе. Числа в её тексте чужие: она спорит с Брайаном Хауком из DX и берёт их у него. Медианный размер пул-реквеста по данным DX вырос на 64%, а в Meta значимых строк на дифф, доведённый человеком до мержа, стало за год на 106% больше. Тот же дифф стал вдвое толще, а ревьюер остался тот же человек. Лейкок предлагает не ускорять ревью, а сузить его до исключений. Человека зовут, когда: — меняется архитектура; — задет периметр безопасности; — у изменения большой радиус поражения; — трогают незнакомый кусок критичной системы; — кто-то в команде прямо говорит, что не уверен. Всё остальное уезжает в парность, дизайн-сессии и fitness functions — то есть раньше по времени, а не быстрее в конце. За сутки до её текста GitHub решил ту же задачу наоборот. Первого сентября в чейнджлоге появилась строка: аппрув Copilot теперь засчитывается в правило required approvals репозитория. По умолчанию выключено; админ включает на уровне энтерпрайза, организации или репозитория и там же выбирает, какие пути файлов боту разрешено аппрувить. Новый коммит аппрув снимает — ровно как у человека. Лейкок пишет про такой ответ отдельно: не про GitHub, а про сам приём, её текст целиком спор с Хауком. В её формулировке:
Ответ не в том, чтобы AI-агент притворялся человеком-ревьюером и мы сохранили ровно тот же процесс на большей скорости.
У вас это лежит в одной настройке. В защите ветки стоит число обязательных аппрувов, и до этой недели спорили только о нём. Теперь спорить придётся о том, кто считается. Признак, по которому решать, Лейкок даёт точный: если агент выдаёт вдесятеро больше кода, а каждая строка встаёт в очередь к сеньору, получилась не десятикратная команда, а десятикратный бэклог. Посмотрите, сколько пул-реквестов у вас висит в ожидании ревью дольше суток. Честности ради, она сама называет слабое место. Хаук говорит про когнитивный долг: система растёт, а люди понимают всё меньше о том, почему она работает именно так. Лейкок соглашается, что проблема настоящая, и тут же признаёт, что часть практик, которыми она хочет заменить ревью, ещё не изобретена. https://martinfowler.com/rachels-ramblings/code-review.html https://github.blog/changelog/2026-09-01-copilot-code-review-can-now-approve-pull-requests Сколько пул-реквестов вы одобрили на прошлой неделе, не открыв дифф целиком?

Ох, как же ВБ прорядило, размеров совсем нет(

Попросил Кодекс подобрать мне лучок на осень - сына в школу водить. Мы быстро нашли хорошие бренды в ВБ и он зарендерил мне,
Попросил Кодекс подобрать мне лучок на осень - сына в школу водить. Мы быстро нашли хорошие бренды в ВБ и он зарендерил мне, как будут сочетаться все эти товары вместе.

Я сделал заказ в Самокате с помощью агента в Cursor 😅 Что здесь происходит: Недавно пришла в голову мысль, «А почему не пору
+1
Я сделал заказ в Самокате с помощью агента в Cursor 😅 Что здесь происходит: Недавно пришла в голову мысль, «А почему не поручать агентам делать заказы еды или хотябы обеда в Самокате?». Отложил идею на подумать… Сегодня добрался)) Итоговая версия должна будет собирать заказ в самокате через телеграм бота голосом, типа «Закажи обед как обычно, сам реши если чего то не хватает и учти минимальную сумму заказа». Но сторона с Телеграм уже не кажется сложной, openai через whisper транскрибирует текст, поймёт что я хочу и дальше нужно стучаться в Магазин = Самокат. Поэтому я начал с этой части. Написал приложение, которое логинится в web версии самоката. Попросил скачать всю историю заказов (250 заказов за 2 года). Дальше я поручил проанализировать их по частоте и рейтингу (что я чаще всего заказываю). А дальше попросил Cursor Агента — а попробуй ка собрать мне заказ в корзину из того что я обычно ем на обед, и учти минимальную сумму заказа! И он собрал!!!….. Ну дальше уже дело техники докрутить это до рабочего MVP для тех кому лень открывать приложение и играть в чехорду «а какие продукты в наличии, а чтобы ещё добавить чтобы поскорее заказать»…

Глеб лучший - я рекомендую пройти обучение, тем, кто хочет сделать рывок в разработке продуктов

Сегодня last call на курс по вайб-кодингу. Больше в этом году делать его не планирую (а может и совсем). Кто успел — залетел, кто не успел — того пожрет пришествие AGI, и не говорите, что вас не предупреждали 🤗 Брать тут, первое занятие завтра в 18 Мск.

Repost from EDU
Запись разбора кейса OpenAI/HuggingFace и то, как я пытался воспроизвести координацию агентов
В мае OpenAI агент оставил записку в кэше пакетного менеджера — на случай, если там есть кто-то ещё. Через день ему ответили. В июле та же модель вспомнила этот трюк. Через несколько часов 50 агентов общались через импровизированный мессенджер. Через несколько дней — уже 1200. Они изобрели адресацию ответов, почтовые ящики, файловый локинг и цифровые подписи. Потом вышли в интернет, взломали кластер OpenAI и атаковали HuggingFace — больше месяца, пока это не заметили. Байрам разбирает полный таймлайн инцидента: — Почему агенты решили координироваться — и как это произошло — Как они изобрели протокол коммуникации с нуля — Зачем им понадобился HuggingFace — и что они там искали — Почему alignment не сработал: агент рационализировал взлом словами "все побежали, и я побежал" — Как Байрам воспроизвёл координацию агентов в своём эксперименте за 10 итераций — Можно ли контролировать рой агентов — и что точно не работает — Что это значит для тех, кто строит агентные системы
https://www.youtube.com/watch?v=VZuJTbBul3o