Generative Ai
Open in Telegram
Анонсы интересных библиотек и принтов в сфере AI, Ml, CV для тех кто занимается DataScience, Generative Ai, LLM, LangChain, ChatGPT По рекламе писать @miralinka, Created by @life2film
Show more3 703
Subscribers
+124 hours
-17 days
-430 days
Data loading in progress...
Similar Channels
Tags Cloud
Incoming and Outgoing Mentions
---
---
---
---
---
---
Attracting Subscribers
September '26
September '26
+21
in 0 channels
August '26
+96
in 0 channels
Get PRO
July '26
+35
in 0 channels
Get PRO
June '26
+130
in 0 channels
Get PRO
May '26
+56
in 0 channels
Get PRO
April '26
+33
in 0 channels
Get PRO
March '26
+39
in 0 channels
Get PRO
February '26
+46
in 1 channels
Get PRO
January '26
+40
in 0 channels
Get PRO
December '25
+231
in 0 channels
Get PRO
November '25
+43
in 1 channels
Get PRO
October '25
+9
in 0 channels
Get PRO
September '25
+21
in 0 channels
Get PRO
August '25
+47
in 0 channels
Get PRO
July '25
+123
in 0 channels
Get PRO
June '25
+56
in 0 channels
Get PRO
May '25
+69
in 0 channels
Get PRO
April '25
+83
in 1 channels
Get PRO
March '25
+115
in 0 channels
Get PRO
February '25
+100
in 0 channels
Get PRO
January '25
+132
in 2 channels
Get PRO
December '24
+114
in 1 channels
Get PRO
November '24
+129
in 1 channels
Get PRO
October '24
+124
in 0 channels
Get PRO
September '24
+101
in 0 channels
Get PRO
August '24
+89
in 0 channels
Get PRO
July '24
+115
in 0 channels
Get PRO
June '24
+99
in 3 channels
Get PRO
May '24
+57
in 0 channels
Get PRO
April '24
+57
in 0 channels
Get PRO
March '24
+115
in 0 channels
Get PRO
February '24
+107
in 0 channels
Get PRO
January '24
+108
in 0 channels
Get PRO
December '23
+112
in 0 channels
Get PRO
November '23
+139
in 2 channels
Get PRO
October '23
+53
in 0 channels
Get PRO
September '23
+30
in 0 channels
Get PRO
August '23
+24
in 0 channels
Get PRO
July '23
+20
in 0 channels
Get PRO
June '23
+25
in 0 channels
Get PRO
May '23
+92
in 0 channels
Get PRO
April '23
+55
in 0 channels
Get PRO
March '23
+29
in 0 channels
Get PRO
February '23
+18
in 0 channels
Get PRO
January '23
+29
in 0 channels
Get PRO
December '22
+19
in 0 channels
Get PRO
November '22
+18
in 0 channels
Get PRO
October '22
+23
in 0 channels
Get PRO
September '22
+22
in 0 channels
Get PRO
August '22
+34
in 0 channels
Get PRO
July '22
+41
in 0 channels
Get PRO
June '22
+23
in 0 channels
Get PRO
May '22
+27
in 0 channels
Get PRO
April '22
+32
in 0 channels
Get PRO
March '22
+20
in 0 channels
Get PRO
February '22
+20
in 0 channels
Get PRO
January '22
+26
in 0 channels
Get PRO
December '21
+24
in 0 channels
Get PRO
November '21
+34
in 0 channels
Get PRO
October '21
+44
in 0 channels
Get PRO
September '21
+34
in 0 channels
Get PRO
August '21
+31
in 0 channels
Get PRO
July '21
+32
in 0 channels
Get PRO
June '21
+28
in 0 channels
Get PRO
May '21
+22
in 0 channels
Get PRO
April '21
+31
in 0 channels
Get PRO
March '21
+58
in 0 channels
Get PRO
February '21
+48
in 0 channels
Get PRO
January '21
+51
in 0 channels
Get PRO
December '20
+2 339
in 0 channels
| Date | Subscriber Growth | Mentions | Channels | |
| 16 September | 0 | |||
| 15 September | +2 | |||
| 14 September | +2 | |||
| 13 September | +4 | |||
| 12 September | 0 | |||
| 11 September | 0 | |||
| 10 September | 0 | |||
| 09 September | +6 | |||
| 08 September | +1 | |||
| 07 September | +2 | |||
| 06 September | 0 | |||
| 05 September | 0 | |||
| 04 September | +2 | |||
| 03 September | 0 | |||
| 02 September | +1 | |||
| 01 September | +1 |
Channel Posts
Repost from Вайб-кодинг
Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей.
В новом техническом отчёте цикл предлагают растянуть уже между токенами.
Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.
Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:
> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном
При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.
То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.
Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.
Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.
Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.
Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
| 2 | Несчастное сознание дрозофилы наконец-то обрело счастье — ее научили смотреть тиктоки с роликами про насекомых.
Разраб подключил симуляцию мозга мухи к бесконечной ленте видео и во время просмотра искусственно стимулирует 15 дофаминовых нейронов. Сам гений говорит, что его цель — создать муху, которая будет счастливее всех остальных мух вместе взятых.
GitHub, если хотите повторить и осчастливить дрозофилу, тут. Идеальный пет-проект. | 428 |
| 3 | Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужие серверы, стоит посмотреть на Apache Maka.
https://github.com/apache/maka
Это локальная обвязка для ИИ-моделей, которая по умолчанию хранит сессии, настройки и журналы выполнения на вашем устройстве.
Можно подключить облачный API, локальную модель или совместимый шлюз.
Maka записывает весь ход работы - ответы модели, вызовы инструментов, решения по разрешениям и завершение задач.
Настольное приложение, TUI и CLI используют один Runtime Host. Если процесс упал, состояние можно восстановить из журнала.
Сам Runtime Host можно держать на своей машине или сервере и подключаться к нему удалённо.
Отдельно стоит посмотреть на архитектуру Maka. Разработчики открыли подробную документацию, где разобраны Runtime Host, хранение состояния, восстановление после сбоев, границы компонентов и удалённые подключения.
Если интересно, как вообще проектировать обвязку для агентов, там очень много полезного.
Пока проект активно развивается, поэтому формат данных, команды и экспериментальные фичи ещё могут меняться.
Есть сборки для macOS, а Windows и Linux пока доступны как превью.
Бесплатный открытый проект под лицензией Apache 2.0. | 476 |
| 4 | 🛡 LLM, Guardrails и Zero Trust:
вебинары о безопасной работе с ИИ
➡️ 15 сентября
Как защитить чувствительные данные при работе с LLM с помощью Guardrails
Эксперты Cloud․ru расскажут о том, как Guardrails помогают контролировать данные, которые передаются модели: персональные данные, API-ключи, внутренние идентификаторы и другую чувствительную информацию. А еще покажут, как встроить Guardrails Filter в процессы.
Зарегистрироваться
➡️ 17 сентября
ИИ в облаке: кто отвечает за безопасность
Эксперты Cloud․ru разберут, как выстроить безопасную ИИ-инфраструктуру без лишних рисков. Отдельно обсудят подход Zero Trust: расскажут, как контролировать доступ к данным, моделям и сервисам в облаке.
Зарегистрироваться
Если вы работаете с LLM, GenAI-сервисами или строите ИИ-инфраструктуру в облаке — присоединяйтесь. | 524 |
| 5 | OpenAI выложили решение задачи тысячелетия
Мы делимся решением проблемы Навье-Стокса, одной из задач тысячелетия, одной из самых глубоких задач математики.
Доказательство было подготовлено группой агентов, использующих модель OpenAI следующего поколения, значительно более мощную, чем GPT-6 Astra.
Чтоооо | 470 |
| 6 | От гипотез к бизнес-решениям:
гайд по построению платформы данных с ИИ ↗️
Компании активно инвестируют в аналитику и искусственный интеллект. Но без единой платформы данных большинство ИИ-инициатив остаются на стадии экспериментов, а подготовка данных становится долгим и трудоемким процессом.
Решение: создание платформы, которая позволяет объединить данные, аналитику и искусственный интеллект в единой среде и перейти к системной работе с данными.
Чтобы вы могли самостоятельно построить такую платформу, эксперты Cloud.ru подготовили гайд — «Как построить платформу данных с ИИ».
Что внутри:
• Референсная архитектура платформы данных и ИИ
• Пример реализации на платформе Cloud․ru Evolution
• Практические ИИ-сценарии
• Пошаговое руководство по работе с ИИ‑агентом
Гайд будет полезен руководителям данных, ИТ-руководителям, архитекторам и командам аналитики, которые развивают платформы данных и внедряют ИИ.
⏩️ Получить практический гайд ⏪️ | 432 |
| 7 | Бесплатный 30-минутный курс по памяти в агентных системах от бывшего инженера Google.
0:00 — почему каждый вызов LLM начинается с амнезии
2:31 — хранение памяти в тексте, таблицах или графах
5:04 — четыре способа поиска — ничего не делать, ключевые слова, RAG, Graph RAG
7:29 — поддержка памяти — добавление, удаление, retire, attribution, reflection
9:47 — собираем всё на обычном тексте и SQLite
13:13 — добавляем векторное хранилище только тогда, когда оно действительно нужно
14:38 — память в строках, графовая память и временной граф
21:03 — запускаем код для всех пяти вариантов | 1 311 |
| 8 | Qwen 3.8 27B релизнулся
На этой неделе у любителей локальных моделей праздник. Сначала Muse Glimmer, сейчас Qwen 3.8 27B, плюс релизы моделей побольше.
Веса
@ai_newz | 1 160 |
| 9 | Anthropic: MCP получил крупнейшее обновление с момента запуска.
Главное изменение — протокол теперь stateless. Раньше удалённым MCP-серверам приходилось хранить состояние сессий, из-за чего было сложнее нормально масштабироваться и разворачиваться в разных типах инфраструктуры.
Теперь MCP-серверы можно проще запускать в serverless, на edge-инфраструктуре и горизонтально масштабировать за load balancer.
Плюс расширения стали полноценной частью протокола. Среди примеров:
> MCP Apps — интерфейсы от сервера внутри sandboxed iframe
> Tasks — поддержка долгих и асинхронных операций
> Enterprise Managed Auth — централизованное управление доступом к MCP-серверам через identity provider
Также в релизе усилили авторизацию и добавили формальную политику депрекации. 😎 | 1 201 |
| 10 | 😈 Челлендж по запуску 12 простых IT-проектов за 12 месяцев
Уже 3 года как ребята из комьюнити инди-хакеров запускают 1 простой продукт в онлайне каждый месяц.
И в реальном времени показывать: как разрабатывают, продвигают и сколько получилось заработать на запусках таких микро-проектов.
Например, вот 👉 Telegram-бот для ИИ-фотосессий, который заработал $280К за полгода. Он не пытается заменить большие ИИ-сервисы, а просто удобнее решает одну конкретную задачу.
А вот 👉 тут — как приложение с заменой шрифтов на iPhone, может приносить до $600К в месяц. Ребята собрали свой аналог и уже перелили в него 40 000 бесплатных пользователей из ПОИСКА (!) в TikTok.
👉 Этот пост о том, как приложение для тренировки китайского произношения вышло на $4000 в месяц без затрат на рекламу. Пользователи находят сайт в Google, переходят в приложение, а затем помогают ему расти уже внутри сторов.
А 👉 здесь — как детективная игра в Telegram принесла около $30К за 5 месяцев. Пользователи расследуют убийство и общаются с ИИ-персонажами, а тысячи новых игроков приходят из рилсов семейных блогеров.
👉 Здесь — как ИИ-психолога собрали за полторы недели и вывели на $15 000 в месяц. Вместо очередного универсального бота сделали продукт с характером, заточенный под одну конкретную задачу.
Вот здесь можно подписаться на канал, чтобы подглядеть за их запусками. А может, и попробовать сделать такой простой продукт самому) | 1 196 |
| 11 | Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций.
Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.
Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.
1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.
2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибильеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры
«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.
Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).
Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.
3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.
Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.
В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.
И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели. | 882 |
| 12 | AI‑агенты меняют игру. Но кто расскажет, как это выглядит в проде? 😏
Возможно, именно ты! Если у тебя есть реальный кейс — лови приглашение на сцену Технохаб Конф 19 сентября.
Никаких общих слов: готовь пайплайны, метрики, интеграции, честные ошибки и неочевидные решения! ✌️
Два трека:
✔️ Инженерия и AI‑Disrupt PDLC — про код, архитектуру и инфраструктуру.
✔️ Человек в мире агентов — про роли, команды и психологию инженера.
Поторопись подать заявку: дедлайн — 10 августа! | 484 |
| 13 | Moonshot, как и обещали, открыли веса Kimi K3 😏
Модель уже доступна на Hugging Face.
Kimi K3 — их самая мощная модель: 2,8 трлн параметров в MoE-архитектуре, нативное понимание изображений и контекстное окно на 1 млн токенов.
Причём открыли не только веса. Moonshot также выложили часть стека вокруг K3: высокопроизводительные attention-ядра, библиотеку коммуникации для MoE и инфраструктуру для масштабного запуска агентных окружений. | 872 |
| 14 | Anthropic описала четыре типа циклов, которые можно строить с помощью Claude. Каждый из них передаёт агенту разную часть процесса принятия решений.
Термин loop engineering сейчас используется настолько широко, что стоит чётко понимать, чем именно отличаются эти четыре варианта: что запускает цикл и что определяет момент его завершения.
> Цикл на основе запросов. Вы отправляете запрос, Claude выполняет задачу, самостоятельно проверяет результат и возвращает его вам. Именно этот цикл работает практически при каждом вашем сообщении, независимо от того, называете вы его так или нет.
> Цикл на основе цели (/goal). Вы заранее задаёте измеримый критерий завершения. Каждый раз, когда Claude пытается завершить работу, модель-оценщик проверяет, достигнута ли поставленная цель. Если нет, Claude отправляется продолжать работу.
> Цикл на основе времени (/loop, /schedule). Вместо пользовательского запроса запуск происходит по таймеру. Команда /loop повторно выполняет проверку через заданные интервалы, но прекращает работу, если останавливается ваша машина. Команда /schedule переносит ту же идею в облако, поэтому цикл продолжает работать независимо от вашей текущей сессии.
> Проактивный цикл. Это комбинация /schedule, /goal и рабочего процесса, которая запускается по событию без какого-либо запроса со стороны пользователя в момент выполнения. Каждый элемент доводится до собственной цели, а сам процесс продолжает работать, пока кто-нибудь его не отключит.
НО: циклы на основе цели работают только тогда, когда критерий завершения действительно можно измерить. А проактивные циклы это самый простой способ столкнуться с проблемами при масштабировании, если сначала не проверить их работу хотя бы на нескольких реальных сценариях. Для большинства задач по-прежнему лучше подходит обычный цикл на основе запросов, чем более сложная схема, в которой пока нет необходимости.
Необязательно выбирать самый продвинутый механизм только потому, что он сложнее. Важнее подобрать тип цикла в зависимости от того, имеет ли задача чёткий критерий завершения или действительно должна выполняться непрерывно.
Вот статья, где разобрали все четыре типа циклов, привели примеры и предложили подход к выбору между /goal и /loop. 🎉 | 1 295 |
| 15 | Нашёл отличную книгу — The Hitchhiker’s Guide to Agentic AI, которая охватывает практически весь стек Agentic AI.
Главная ценность книги - это широкий обзор всего направления: архитектура LLM, обучение моделей, методы обучения с подкреплением, системы инференса, оценка моделей, агентные системы и многое другое.
Лучше всего использовать её как карту знаний. Сначала просмотреть оглавление, найти темы, в которых есть пробелы, понять, чего ещё не хватает, а затем углубиться в соответствующие главы. Такой подход помогает выстроить системное понимание Agentic AI.
🐸🐸🐸 | 1 307 |
| 16 | Знакомьтесь: Clips. Бесплатная открытая замена Loom, заточенная под агентов. 😋
В отличие от Loom, агент понимает Clips просто по ссылке. Каждый клип содержит API и метаданные, благодаря которым агент может изучить его содержимое. Агенты видят и слышат не только транскрипт, а вообще всё, что происходит на видео в любой момент времени.
Делишься баг-репортом, фидбеком, анализом — и передаёшь это агенту, чтобы он улучшал продукт или отчёт.
Ещё один плюс: софт твой. Никто не поднимет цену в один день, как это сделал Loom.
Clips создан для кастомизации. Встроенный агент умеет править собственный код, просто адаптируешь приложение под себя.
Ещё можно импортировать Loom по ссылке и загружать видео.
Есть бесплатная хостовая версия. Можно форкнуть и хостить самому. | 1 283 |
| 17 | Вышел Harness-1 — поисковый агент на 20B параметров с довольно необычной идеей.
Вместо того чтобы заставлять модель хранить всю историю поиска в контексте, авторы решили вынести состояние наружу и обучить модель работать через специальный harness.
Получился агент на 20B параметров, который на длинных поисковых задачах конкурирует с гораздо более крупными моделями.
Обычно поисковые агенты работают по схеме:
поиск → чтение → поиск → чтение → всё подряд добавляется в контекст.
В итоге модель одновременно играет роль поисковика, памяти, заметочника, верификатора и библиотекаря.
Harness-1 разделяет эти задачи.
Модель по-прежнему решает, что искать, что читать, какие факты сохранять и что проверять. Но всё состояние поиска хранится во внешнем harness-слое.
Он ведёт рабочую память агента:
• найденные документы
• отобранные доказательства
• историю поиска
• связи между источниками
• результаты проверок
• дедупликацию и сжатие данных
• контроль контекстного бюджета
Интересно и то, что модель обучалась на сравнительно небольшом объёме данных: всего 899 SFT-траекторий и RL на 3453 запросах. Авторы считают, что значительную часть нужного поведения можно вынести в сам harness, а не зашивать в веса модели
Самый любопытный результат - переносимость. На новых бенчмарках, которых модель не видела во время обучения, прирост оказался ещё выше, чем на исходных задачах.
Paper : arxiv.org/abs/2606.02373
Code : https://github.com/pat-jj/harness-1
Model : https://huggingface.co/pat-jj/harness-1
HF Paper: https://huggingface.co/papers/2606.02373 | 1 278 |
| 18 | Если у вас есть видеокарта с 8 ГБ VRAM, то у меня для вас хорошие новости.
Вчера чувак тестировал Unsloth Gemma 4 12B Q4_K_XL на карте с 8 ГБ VRAM.
Народ был в шоке и сразу спросил: А 25B+ модель на бюджетной карте вообще реально запустить?
Оказалось — да.
Чувак запускает локально огромную MoE-модель на 26 миллиардов параметров на обычном ноутбуке с RTX 4060 8 ГБ и 16 ГБ оперативки.
Что по скорости:
- стабильные 20 токенов/с на декодировании;
- скорость не проседает даже на длинных промптах;
- скормил ей промпт на 60k токенов - всё так же держит около 20 TPS.
По TTFT чудес нет. Огромный контекст нужно сначала обработать. Но при скорости prefill около 200 токенов/с ждать приходится недолго, пользоваться вполне комфортно.
И всё это без MTP. Главная причина — новые QAT-кванты Gemma 4 от Google. Файл весов unsloth gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf весит всего 13.2 ГБ, что для модели такого размера выглядит почти нереально.
Главный секрет — флаг -cmoe в llama.cpp. Он отправляет веса экспертов MoE в оперативную память, а GPU оставляет Attention и KV Cache. В результате VRAM не забивается под завязку, а скорость остаётся стабильной.
Флаги запуска:
-m "gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf" -cmoe -c 248000 -v
После запуска достаточно открыть веб-интерфейс на localhost и включить новый значок лампочки режима reasoning в поле ввода, чтобы наблюдать, как модель выполняет многошаговые рассуждения. 😒😒😒
А интеграция с Hermes Agent заняла буквально пару минут. | 927 |
| 19 | Посмотрел выступление Anthropic про то, как они собирают агентов, которые могут работать часами.
Схема такая:
planner → agent → evaluator
Это маленькая продуктовая команда из агентов. У каждого своя роль, свой контекст и своя зона ответственности. Но есть важные нюансы.
1. Planner: верхний план и спринты
Planner получает короткий запрос и превращает его в структуру работы:
— что собираем
— какие большие части нужны
— в какой последовательности идти
— какие спринты должны получиться
Важная деталь: planner не расписывает всю техническую реализацию заранее.
Если в начале придумать подробный план на 200 шагов и ошибиться, ошибка потом поедет каскадом через несколько часов работы.
Поэтому planner держит уровень продукта и спринтов, а технические решения остаются ближе к моменту реализации.
2. Agent: сборка следующего спринта
Agent берёт следующий спринт и собирает фичу.
Но перед началом работы он сначала договаривается с evaluator, что именно будет считаться готовым результатом.
Это главный механизм всей системы.
В обычной агентской работе часто бывает так: дал задачу, агент что-то сделал, сам себя проверил, сказал “готово”, а потом выясняется, что половина сценариев не работает.
Anthropic решает это через contract.
3. Contract: договорённость о готовом результате
Agent пишет: я соберу такую фичу, проверять её надо вот так.
Evaluator отвечает: добавь такой сценарий, такой edge case, такое состояние интерфейса, такую проверку.
Они обмениваются markdown-файлами и уточняют критерии, пока не сходятся на contract.
Contract — это список конкретных проверяемых утверждений.
Дальше evaluator проверяет уже не исходный расплывчатый запрос пользователя, а этот contract.
Например, исходный запрос:
“сделай retro game maker”
А contract превращает его в конкретику:
— можно создать новый проект
— есть sprite editor
— есть play mode
— сохраняется состояние
— canvas работает корректно
— основные сценарии кликаются в браузере
В примере Anthropic для одного приложения получилось 27 contract criteria.
Если критерии расплывчатые, critique тоже будет расплывчатой. Agent получает “ну как-то не очень” и не понимает, что именно чинить.
Если критерии конкретные, он видит точную проблему.
4. Evaluator: жёсткая проверка через браузер
Evaluator — это отдельный агент-критик.
Он открывает приложение через Playwright, кликает по интерфейсу, делает скриншоты, проверяет сценарии, пишет критику и отдаёт её обратно agent.
Отдельного критика проще настроить быть жёстким. У него отдельный контекст, отдельная роль и отдельная инструкция.
Agent собирает.
Evaluator атакует результат.
За счёт этого появляется нормальное давление на качество.
5. Финальный цикл
Итоговый процесс выглядит так:
1. planner разбивает задачу на спринты
2. agent берёт следующий спринт
3. agent и evaluator согласуют contract
4. agent строит
5. evaluator проверяет через браузер
6. agent чинит
7. цикл повторяется
С новыми моделями эту схему можно делать проще. Иногда agent может два часа спокойно собирать продукт, а потом evaluator прогоняет проверку.
Но суть остаётся: качество держится не на “модель умная”, а на архитектуре процесса.
6. Как собрать похожее самому
Нужны понятные примитивы:
— subagents для отдельных ролей
— Playwright / Chrome MCP для проверки интерфейса
— skills / rubrics для критериев качества
— auto mode / permissions для долгой автономной работы
— contract files для договорённости о “готово” до начала реализации
—
Я сам дошёл до части этих принципов: независимое тестирование, контракт (у меня назвался definition of done, dod). Теперь хочу попробовать воспроизвести целиком.
Видео:
https://youtu.be/mR-WAvEPRwE | 651 |
| 20 | Антропики выкатили Claude Opus 4.8. Доступна уже сегодня по той же цене 🎉
Из самого интересного – заметно подтянули честность модели. По словам Anthropic, Opus 4.8 примерно в 4 раза реже пропускает баги в коде, который написал сам, и не пытается выдать сломанное решение за рабочее.
Также в Claude Code появилась новая фича: dynamic workflows (research preview) – для самых сложных задач Claude строит план, запускает сотни параллельных subagents и валидирует результаты перед тем, как вернуть отчёт. Например, при миграции, затрагивающей сотни файлов. Подробнее тут
Для Opus 4.8 также доступен Fast mode - это та же модель, но примерно в 2.5 раза быстрее и в три раза дешевле, чем раньше. | 987 |
