ch
Feedback

不要被骗子欺骗!Telemetrio 会找到并标记这些频道 👉 如果想查看标记,请订阅 👈

КайфКодинг

КайфКодинг

前往频道在 Telegram

ВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками

显示更多
1 043
订阅者
无数据24 小时
+177 天
+8630 天
帖子存档
Repost from Krist/Blog
GLM-5.2 Спустя несколько дней после релиза в подписке, z.ai выпускают свою новую модель в опенсорс: - Контекст теперь миллион
GLM-5.2 Спустя несколько дней после релиза в подписке, z.ai выпускают свою новую модель в опенсорс: - Контекст теперь миллион токенов. - Ещё лучше в коде. - Лучше в долгосрочных задачах. - Дешёвый контекст благодаря IndexShare. - Лицензия MIT. Блогпост, веса

с момента моего прошлого поста - акции Z AI прибавили еще 40%. А кто знает как можно выйти на руководство китайской компании?

Антропик, ты не понял с кем связался! Fable уже на Рутрекере 😅
Антропик, ты не понял с кем связался! Fable уже на Рутрекере 😅

Все идет по том сценарию, что я предсказывал - Fable был отключен через 2 дня для иностранцев. Национальная безопасность. https://www.reuters.com/technology/us-blocks-foreign-access-anthropics-most-advanced-ai-models-axios-reports-2026-06-13/

Посмотрел выступление Anthropic про то, как они собирают агентов, которые могут работать часами. Схема такая: planner → agent → evaluator Это маленькая продуктовая команда из агентов. У каждого своя роль, свой контекст и своя зона ответственности. Но есть важные нюансы. 1. Planner: верхний план и спринты Planner получает короткий запрос и превращает его в структуру работы: — что собираем — какие большие части нужны — в какой последовательности идти — какие спринты должны получиться Важная деталь: planner не расписывает всю техническую реализацию заранее. Если в начале придумать подробный план на 200 шагов и ошибиться, ошибка потом поедет каскадом через несколько часов работы. Поэтому planner держит уровень продукта и спринтов, а технические решения остаются ближе к моменту реализации. 2. Agent: сборка следующего спринта Agent берёт следующий спринт и собирает фичу. Но перед началом работы он сначала договаривается с evaluator, что именно будет считаться готовым результатом. Это главный механизм всей системы. В обычной агентской работе часто бывает так: дал задачу, агент что-то сделал, сам себя проверил, сказал “готово”, а потом выясняется, что половина сценариев не работает. Anthropic решает это через contract. 3. Contract: договорённость о готовом результате Agent пишет: я соберу такую фичу, проверять её надо вот так. Evaluator отвечает: добавь такой сценарий, такой edge case, такое состояние интерфейса, такую проверку. Они обмениваются markdown-файлами и уточняют критерии, пока не сходятся на contract. Contract — это список конкретных проверяемых утверждений. Дальше evaluator проверяет уже не исходный расплывчатый запрос пользователя, а этот contract. Например, исходный запрос: “сделай retro game maker” А contract превращает его в конкретику: — можно создать новый проект — есть sprite editor — есть play mode — сохраняется состояние — canvas работает корректно — основные сценарии кликаются в браузере В примере Anthropic для одного приложения получилось 27 contract criteria. Если критерии расплывчатые, critique тоже будет расплывчатой. Agent получает “ну как-то не очень” и не понимает, что именно чинить. Если критерии конкретные, он видит точную проблему. 4. Evaluator: жёсткая проверка через браузер Evaluator — это отдельный агент-критик. Он открывает приложение через Playwright, кликает по интерфейсу, делает скриншоты, проверяет сценарии, пишет критику и отдаёт её обратно agent. Отдельного критика проще настроить быть жёстким. У него отдельный контекст, отдельная роль и отдельная инструкция. Agent собирает. Evaluator атакует результат. За счёт этого появляется нормальное давление на качество. 5. Финальный цикл Итоговый процесс выглядит так: 1. planner разбивает задачу на спринты 2. agent берёт следующий спринт 3. agent и evaluator согласуют contract 4. agent строит 5. evaluator проверяет через браузер 6. agent чинит 7. цикл повторяется С новыми моделями эту схему можно делать проще. Иногда agent может два часа спокойно собирать продукт, а потом evaluator прогоняет проверку. Но суть остаётся: качество держится не на “модель умная”, а на архитектуре процесса. 6. Как собрать похожее самому Нужны понятные примитивы: — subagents для отдельных ролей — Playwright / Chrome MCP для проверки интерфейса — skills / rubrics для критериев качества — auto mode / permissions для долгой автономной работы — contract files для договорённости о “готово” до начала реализации — Я сам дошёл до части этих принципов: независимое тестирование, контракт (у меня назвался definition of done, dod). Теперь хочу попробовать воспроизвести целиком. Видео: https://youtu.be/mR-WAvEPRwE

Repost from Denis Sexy IT 🤖
⚙️ Меня немного запарило, что все кодинг агенты не умеют из коробки делать актуальных на сегодня агентов, потому что внутри – модели еще не обучены всем современным агентским трюкам – поэтому я прошелся по исходникам Codex, Claude Code и других популярных уроков по созданию агентов, работу с кешами, авто-сжатием контекста и тп, и собрал скилл agents-best-practices который чинит эту проблему – причем, там отдельно прописано, что эти знания для всех видов агентов, не только для кодинга: Там нет кода, есть текстовые справочники на темы – мне помогло:
Архитектура агентного harness Как устроить runtime вокруг модели: контекст, инструменты, permissions, память, наблюдаемость и остановочные условия. Agentic loop Базовый цикл: модель → tool call → валидация → permission check → выполнение → observation → следующий шаг или финальный ответ. System prompts и инструкции Как проектировать слои промптов: global, workspace, domain-specific, task-level и runtime reminders. Tools и permissions Как делать инструменты узкими, типизированными, безопасными, проверяемыми и разделёнными по risk class. Planning mode Как отделять планирование от исполнения: read-only exploration, план-артефакт, approval и потом мутации. Goal-like loop Как задавать долгоживущие цели с budget, checkpoints, validation criteria и stop condition. Это вместо Ralph Loop. Context, memory и auto-compaction Как управлять контекстом, делать retrieval, сохранять рабочее состояние и сжимать историю без потери критичных данных. Prompt caching и cost-aware context Как строить стабильные prompt-prefixes, deterministic tool ordering и cache-friendly agent runtime. Skills и progressive disclosure Как подключать reusable workflows: короткий skill index сначала, полные инструкции только при необходимости. MCP и external connectors Как подключать внешние системы через governed connectors: namespacing, auth, permissions, audit logs и least privilege. Security, approvals и sandboxing Prompt injection, secrets, approval flows, draft-vs-commit, sandbox для open-world tools. Observability и evals Как логировать agent runs, tool calls, approvals, compactions, failures и тестировать harness на реальные failure modes. Provider API patterns Практики для OpenAI, Anthropic и OpenAI-compatible API без привязки к одному провайдеру. Checklists и coverage audit Готовые списки для проверки: перед запуском, перед добавлением tools, перед подключением skills/connectors и перед продом.

Опрос
Anonymous voting

Repost from e/acc
Завтра пройдет интересный стрим (бесплатный) про то как использовать ИИ для здоровья. Я не спикер, но тема любопытная. Ниже н
Завтра пройдет интересный стрим (бесплатный) про то как использовать ИИ для здоровья. Я не спикер, но тема любопытная. Ниже небольшое био спикеров: ​Оля Конышева (@nontoxic_productivity) — продакт (ex-Яндекс), нутрициолог, инструктор @badbuddhas. биовозраст по WHOOP — минус 12 лет. разобрала кожу, расписание и физиологию через данные — с конкретными выводами и изменениями. ​Тоня Жукова (@zhukovatonya) — серийный предприниматель, 2 экзита (Farfetch, IQ Option). три цикла исследований, протокол под SNP с алертами в Telegram. железо, дозировки, паттерны — всё через данные. ​Илья Гиндин (@gindinthecreator) — основатель comulabs, t4s, seenbot. два года анализирует показатели здоровья с ИИ: WHOOP, анализы, календарь — агенты видят то, что сам не замечаешь. собрал открытый OpenHealth. Регистрация тут.

Почему мозг в миллион раз экономичнее видеокарты Навин Рао — человек, который успел построить почти всё в мире AI-железа: осн
Почему мозг в миллион раз экономичнее видеокарты Навин Рао — человек, который успел построить почти всё в мире AI-железа: основал одну из первых чиповых компаний (её купил Intel), потом MosaicML (её купил Databricks), руководил там всем AI-направлением. А теперь занялся самым странным своим проектом — компанией Unconventional AI. И в коротком выступлении он, по сути, говорит неприятную вещь: мы строим искусственный интеллект на компьютерах, которые для этого вообще не предназначены. Цифровой компьютер — это случайность из 1940-х. Двоичный код, числа с плавающей точкой — всему этому почти 80 лет. Придумано под совсем другие задачи и под совсем другое железо. Мы до сих пор строим на этом фундаменте не потому, что он идеален, а просто по инерции: так можно выпустить продукт за пару лет. Рао предлагает вернуться к началу и спросить — а что, если считать вообще иначе? Еще говорит, что скооро в мире кончится энергия для AI. Не через 10 лет — через 2–4 года. Уже сегодня обучение и работа моделей съедают гигаватты. При этом: - Все 8 миллиардов человеческих мозгов вместе — это около 160 гигаватт (каждый мозг ≈ 20 ватт, как тусклая лампочка). - Вся выработка энергии в мире — около 9000 гигаватт, и она крутит вообще всё: отопление, заводы, электромобили. То есть всё человечество думает на крошечной доле общей энергии планеты. Если сравнивать мозг человека с моделями: - человеческий мозг работает на ~20 ваттах; - а одна большая AI-модель, если посчитать всё вместе, её обучение плюс работу на серверах для миллионов людей — тянет на мегаватты, а то и под гигаватт. Это примерные цифры. Но суть тут в разнице: между 20 ваттами и миллионами ватт — разница примерно в миллион раз. И при этом мозг по-прежнему умнее :). Хороший пример — белка. Она прыгает с ветки на ветку и не промахивается, работает на меньше чем 10 милливаттах — это в сто раз меньше телефона. Ни один гигаваттный дата-центр такого трюка пока не повторит. --- А что Рао предлагает взамен? Он говорит: мозг не перемножает матрицы и не считает строго в нулях и единицах. Он использует нелинейную динамику. Что такое «линейно» и «нелинейно» на пальцах. Линейно — это когда вдвое сильнее нажал, вдвое больше получил. Нелинейно — это когда элементы влияют друг на друга, и из этого взаимодействия рождается сложное поведение, которое не сводится к простой сумме. Самый наглядный пример — метрономы на общей подставке. Поставьте десяток метрономов вразнобой на лёгкую доску. Сначала хаос и каждый тикает как хочет. Но они чуть-чуть толкают доску, доска чуть-чуть толкает их обратно и через минуту, без всякого оркестратора, они начинают качаться синхронно. Никто их не программировал. Согласованность возникла сама, просто из того, что они связаны между собой. Рао строит чип из таких же связанных «качалок» (осцилляторов), только связи между ними делает обучаемыми — и тогда систему можно вести к нужному ответу. --- В итоге он говорит: настоящий потолок в физике энергопотребления самого железа. И мозг живое доказательство, что можно быть в тысячи, а то и в миллион раз экономичнее, если перестать цепляться за компьютер в его нынешнем виде. Чип они собрали за полгода во многом потому, что им помогал AI. И закончил он фразой: *«Кажется, мы впервые сможем понять, как работает мозг, — потому что наконец-то можем его построить»*.

Антропик представили динамические рабочие процессы в Claude Code Работа, которую вы обычно планировали на кварталы, теперь вы
Антропик представили динамические рабочие процессы в Claude Code
Работа, которую вы обычно планировали на кварталы, теперь выполняется за несколько дней.
Динамические рабочие процессы доступны уже сегодня в режиме предварительного просмотра для исследовательских целей в CLADE Code CLI, Desktop и расширении VS Code для планов Max, Team и Enterprise (при наличии прав администратора). Для достижения наилучших результатов при использовании динамических рабочих процессов включите автоматический режим. После этого у вас будет два способа запустить рабочий процесс: Попросите Клода создать динамический рабочий процесс напрямую (например, «Создать рабочий процесс»), или Включите новую настройку, специфичную для Claude Code, под названием [название настройки] ultracode. Она доступна через меню «Уровень сложности» и устанавливает уровень сложности на «xhigh», позволяя Claude автоматически определять, когда использовать рабочий процесс для выполнения вашей задачи. Статья: https://claude.com/blog/introducing-dynamic-workflows-in-claude-code Документация: https://code.claude.com/docs/en/workflows

Repost from Эксплойт
Фиаско: один из разработчиков Anthropic перед свадьбой закинул в Claude 12 лет переписки с будущей женой и попросил сделать с
+3
Фиаско: один из разработчиков Anthropic перед свадьбой закинул в Claude 12 лет переписки с будущей женой и попросил сделать сайт. Результат убил. Самые популярные эмодзи в переписке: 😭 😡😑 @exploitex

🔹 addyosmani/agent-skills ⭐ 45008 звёзд · Shell Эдди Османи собрал 23 workflow'а для AI-агентов, покрывающих цикл от специфи
🔹 addyosmani/agent-skills ⭐ 45008 звёзд · Shell Эдди Османи собрал 23 workflow'а для AI-агентов, покрывающих цикл от спецификации до прода. Работает с Claude Code, Cursor, Gemini CLI, Windsurf, OpenCode, Copilot и Kiro IDE через 7 slash-команд: /spec, /plan, /build, /test, /review, /code-simplify, /ship. Фишка — таблица рационализаций в каждом skill: типичные отмазки пропустить шаг и контраргументы к ним. Верификация обязательна на каждом этапе: тесты, build output, runtime data. Рекомендуемый размер коммита — около 100 строк. В комплекте 3 персоны (code-reviewer, test-engineer, security-auditor) и 4 чек-листа: тесты, OWASP Top 10, Core Web Vitals, WCAG 2.1 AA. репозиторий Сергей Булаев AI 🤖 — об AI и не только

Repost from EDU
7 идей с конфы Code w/ Claude Посмотрел, наконец, конфу Code w/ Claude, мои топ 7 идей + одна центральная тема всех выступлений ниже: 1) Haiku берёт Opus в эдвайзеры - CPO GitHub рассказал про их хак: даёте агенту, работающему на слабой модели (haiku) эдвайзера на модели поумнее, и в случае чего он обращается к ней за помощью, простым tool call-ом. Красиво; детальнее тут и тут 2) Время полураспада агента - любой код, компенсирующий непредсказуемость поведения агента имеет время полураспада равное месяцам (6-12 обычно) —> лабы его реализуют как встроенная возможность модели/api; а вот код, "подключающий" агента к вашему уникальному миру (контекст, авторизация, внешние системы и тп) - реально уникален и туда должны быть приложены наши усилия —> источник 3) Как работет Claude Code команда - команда отказывается от долгосрочных роадмапов (just in time planning) и ряда других процессов; технические дебаты решаются 2-3 альтернативными пулл-реквестами, узкое место свдигается на проверку, безопасность —> источник 4) Дайте каждому агенту свой компьютер с теми же тулами и "глазами", что и у вас - онбординг для агентов должен быть аналогичен онбордингу сотрудника + юзаем computer use + self improvement loop (каждый агент репортит ошибки/затруднения, затем их решают люди + агенты, и потом рой агентов тестит и подтверждают что полегчало). Источник 5) Оценивайте новую версию модели по тому, помогает ли она вам удалить код - лучший сигнал, что надо апгрейдиться, что вы теперь можете удалить какой-то код/сократить промпт. Источник 6) 3 аспекта памяти агента: хранение, структура, процесс - проектируя память агента, мы должны ответить на 3 класса вопросов: где хранится память, структура (.md файлы для памяти, скиллы - как "процессная" память), и процесс (что триггерит обновление, как оно происходит). Источник 7) Закон Amdahl как бизнес стратегия - если вы ускоряете один этап процесса в 3-5 раз, то все остальные становятся узким местом; задачей CEO/продакта должны стать те самые медленные стадии, что ограничивают прогресс; причем желательно перепроектировать/инвестировать в них сразу, а не делать после. Идеально вписывается в мои заметки с полей (1, 2). Следующие юникорны будут в областях, в которых кто-то сможет построить инфраструкутуру для верификации/оценки аутпута модели, которой нет у других. Источник Центральная тема всех токов имхо:
узкое место сдвигается в инфраструктуру вокруг модели - harness, системы обратной связи, системы верификации, контекст и память, безопасная работа агентов, эвалы.
Разумеется, там сильно больше, чем эти 7, поэтому приятного просмотра!

Мы уже полгода делаем сразу 2 интерфейса: - для людей - для агентов

Codex уже 7 часов непрерывно оптимизирует интерфейс сервиса. Harness постучался в дом неожиданно.
Codex уже 7 часов непрерывно оптимизирует интерфейс сервиса. Harness постучался в дом неожиданно.

ИИ и дети Мой друг Тёма, с которым мы жили в одной комнате общаге, создал успешную технологическую компанию в ИИ и продал её
+6
ИИ и дети Мой друг Тёма, с которым мы жили в одной комнате общаге, создал успешную технологическую компанию в ИИ и продал её одному из крупнейших банков А сейчас преподает детям нейросети в начальной (!) школе Летово Нейросети не заменят учителей Но уже сейчас становятся мощным инструментом персонализации обучения - превращая образование и скучные домашние задания в увлекательные интерактивные игры и творчество Тёма записал увлекательный и вдохновляющий подкаст с живыми примерами проектов и заданий, которые он делает с сыном и другими детьми Реально круто и интересно. А самое главное, это можете делать и вы со своими детьми