ar
Feedback
Agents Lab

Agents Lab

الذهاب إلى القناة على Telegram

Обсуждаем AI агентов Наш чатик https://t.me/openclaw_lab_community

إظهار المزيد
لم يتم تحديد البلدالفئة غير محددة
1 005
المشتركون
+124 ساعات
+97 أيام
+4230 أيام
أرشيف المشاركات
Что не новая модель, то AGI 😱 Есть уже опыт с Kimi? Чат | Токены дешево
Что не новая модель, то AGI 😱 Есть уже опыт с Kimi? Чат | Токены дешево

Что происходит, когда AI-агенты получают доступ к мессенджеру, коду, данным и рабочим процессам всей компании? В разборе Cerebras Исаак Тай, Дэниел Ким и Майк Гао, команда создателей внутренней базы знаний, показывают систему с 15 000 запросов в день: гибридный поиск, реранжирование, MCP и контроль доступа. В истории Replit основатель и CEO Амджад Масад вместе со Скоттом Кеннеди описывают «компанию на автопилоте»: loops с субагентами проверяют PR, расследуют инциденты и помогают аналитикам, продажам и поддержке. И поднимают главный вопрос автономности: как доказать, что работа действительно выполнена правильно. И также из новостей, вышла Kimi K3, которая стала самой большой открытой моделью, на 2.8 трлн параметров. Теперь это реальный конкурент клоду и гпт, немного недотягивающий по мощности, но при этом и подешевле - $3/$15 за 1кк токенов. Чат | Токены дешево

Вышла новая модель Inkling от Thinking Machines Lab - стартапа Миры Мурати, бывшего технического директора OpenAI. Модель дос
Вышла новая модель Inkling от Thinking Machines Lab - стартапа Миры Мурати, бывшего технического директора OpenAI. Модель достаточно средненькая по всем параметрам, но пускай будет. Кроме того, SpaceXAI открыла исходный код агента Grok Build 8к⭐. Из интересного: CLI не собирает телеметрию и не отправляет ваши данные, за исключением самих промтов. Чат | Токены дешево

От issue до PR: облачная фабрика разработки 🔥 Cloud Factory Demo 79⭐ собирает цепочку: триаж новых задач → PRODUCT.md и TECH
От issue до PR: облачная фабрика разработки 🔥 Cloud Factory Demo 79⭐ собирает цепочку: триаж новых задач → PRODUCT.md и TECH.md для сложных изменений → реализация → проверка PR → внешний loop, который учится на реакции команды. Шаблон использует Oz Warp, GitHub Actions и скиллы. Каждый этап оставляет проверяемый артефакт, изменения проходят через PR, а среду запуска можно заменить. Верификация и мониторинг пока в плане. 📎 Автоматический триаж задач 📎 Спецификации для сложных задач 📎 Самоулучшающийся агент проверки кода Автор Зак Ллойд - основатель и CEO Warp, ранее Principal Engineer в Google Docs и CTO Time. Статьи показывают, как команда строит систему, которая ведет работу от issue до проверенного PR. Чат | Токены дешево

Pi как оркестратор для Claude Code и Codex Ben Davis показал свою сборку Pi 453 ⭐. Основная сессия Pi запускает Pi, Claude Code и Codex как полноценных субагентов через единый набор инструментов с отдельными сессиями и общим интерфейсом. Его рабочий loop: Claude Code/Fable: исследование и дизайн API → Codex: реализация → свежий Claude Code/Fable: ревью и упрощение Одновременно могут работать до четырёх подагентов. /subagents показывает модель, заполнение контекста, время, активные инструменты и статус. Можно открыть полный лог, отправить уточнение, остановить запуск или перехватить управление. Готовый результат автоматически возвращается в основную сессию. Свежий контекст ревьюера помогает не унаследовать ошибочное предположение из плана и реализации. В репозитории также есть JavaScript-workflow с фазами, параллельным запуском и результатами по JSON Schema, фоновые терминалы с /ps, инструменты Firecrawl, ask_user, Git/PR-информация и панель с моделью, контекстом, стоимостью и скоростью генерации. Слепо копировать не стоит. Claude-подагенты запускаются с bypassPermissions, Codex - с approvalPolicy: never и danger-full-access. Текущий SETUP.md также не ставит зависимости вложенных extensions. После их отдельной установки type-check и все 105 тестов проходят. Многие говорят, что Pi агент очень хорош, если у нас те кто хочет поделится своим сетапом? Чат | Токены дешево

У бизнеса с маржой 3% экономия менее 1% выручки может увеличить прибыль примерно на 27% Главный резерв часто скрыт в «работе вокруг работы»: маршрутах, согласованиях, документах, счетах и разборе исключений. Именно сюда стоит встраивать ИИ-агентов - в существующие ERP, почту и таблицы, с понятными границами и передачей спорных случаев человеку. 📎 Почему бизнес с низкой маржой может выиграть от ИИ больше всех Чат | Токены дешево

AI coding loop для Hermes 🔱 Он убирает постоянное сопровождение агента и оставляет человеку две задачи: описать идею и проверить готовый результат. Работает так: 1. Создаём три skills: /spec, /build и /review. 2. Запускаем /spec "идея". Hermes задаёт уточняющие вопросы, а затем сохраняет подробное задание в Markdown-файл: что сделать, какие есть ограничения и как проверить результат. 3. Cron-задача /build регулярно проверяет папку со спецификациями. Находит новую задачу, пишет код, запускает тесты и меняет статус в том же файле на review. 4. Другая cron-задача запускает /review в свежей сессии. Она проверяет код, безопасность, производительность и тесты. Если находит проблемы, записывает замечания в Markdown и возвращает статус fix. 5. /build подхватывает замечания, исправляет код и снова отправляет его на проверку. Цикл build - review продолжается, пока все проверки не пройдены. 6. После успешной проверки Hermes присылает в Telegram краткое описание изменений, результаты тестов и ссылку на PR. Остаётся проверить результат и ответить merge. Вся память цикла хранится в обычных Markdown-файлах, а фоновые запуски выполняют cron-задачи Hermes. Утром присылаете несколько идей, днём агент самостоятельно прогоняет разработку и проверки, вечером вы просматриваете готовые изменения. (В идеальном мире) Собственно можете прислать этот пост своему агенту и попросить выстроить loop. Чат | Токены дешево

Сатья Наделла, CEO Microsoft, сформулировал тревожный парадокс корпоративного ИИ: компании платят моделям деньгами, а затем передают им свои самые ценные знания через запросы. Он объясняет, почему собственные данные, память, проверки и loop обучения скоро станут одним из главных активов бизнеса. 📎 Обратный информационный парадокс: кому принадлежит обучение компании Чат | Токены дешево

Один большой дизайн skill уже не даёт лучший результат: сравнение пяти популярных skills показывает, что UI лучше собирать отдельными проходами. Taste Skill и DESIGN.md мы уже обсуждали, поэтому вот продолжение стека. По установкам через skills.sh сейчас впереди frontend-design 161к⭐ от Anthropic с 657к, web-design-guidelines от Vercel с 459к, UI UX Pro Max с 263к, Impeccable с 192к и основной skill Эмиля Ковальски со 133к. Но популярность не означает, что один из них стоит держать включённым на всех этапах. 🔵 Impeccable 46к⭐ добавляет 23 точечные команды: /audit, /critique, /polish, /typeset и другие. Внутри есть 46 детерминированных проверок, поэтому его лучше запускать как отдельный проход после первого варианта. 🔵 web-design-guidelines 29к⭐ не придумывает стиль, а проверяет готовую страницу: доступность, формы, состояния фокуса, семантику, адаптивность и анимации. В сравнении пяти skills этот набор оказался сильнее остальных именно по веб-нормам и доступности. 🔵 Emil Kowalski Skills 11к⭐ закрывает движение. /review-animations и /improve-animations исправляют кривые ускорения, появление элементов, жесты и анимации компоновки. Иот же тест поставил этот набор первым по анимациям. 🔵 UI UX Pro Max 105к⭐ полезен на этапе выбора системы: 67 стилей, 161 палитра и 57 пар шрифтов. Большая база правил может ограничивать модель и усреднять результат, поэтому лучше использовать её для направления, а финальную проверку отдать более узким skills. 🔵 shadcn/improve 8к⭐ связывает эти этапы: находит 3-5 самых заметных проблем в кодовой базе и строит план улучшений. Рабочий цикл: референс или DESIGN.md → Taste либо Impeccable → /improve → Vercel audit → Emil animations → проверка скриншотом в браузере Не подключайте все skills для дизайна одновременно. Запускайте их отдельными проходами, тогда правила не спорят друг с другом и видно, какой слой реально улучшил результат. Чат | Токены дешево

Разработчики Codex поддержали CLIProxyAPI: GPT-5.6 Sol можно запускать прямо в Claude Code Theo показал Claude Code, где вмес
Разработчики Codex поддержали CLIProxyAPI: GPT-5.6 Sol можно запускать прямо в Claude Code Theo показал Claude Code, где вместо Claude работает GPT-5.6 Sol. Tibo из команды OpenAI попросил выложить рецепт: «мы не дискриминируем обвязки», а затем сам опубликовал настройку через CLIProxyAPI с 40.7к ⭐. Получается Claudex: интерфейс, инструменты, permissions и субагенты Claude Code, а модель и лимиты приходят через Codex OAuth. Шаг 1: Установите CLIProxyAPI Шаг 2: Подключитесь Шаг 3: Определите следующий alias и наслаждайтесь Claudex:
alias claudex='CLAUDE_CODE_SUBAGENT_MODEL=gpt-5.6-sol \
CLAUDE_CODE_ALWAYS_ENABLE_EFFORT=1 \
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY=3 \
ENABLE_TOOL_SEARCH=false \
claude --model gpt-5.6-sol'
У этой схемы есть практический смысл. Сейчас в Codex подагенты Sol наследуют уровень effort родителя: запустили основного агента на ultra - все дочерние агенты тоже начинают жечь лимиты на ultra. Проблема все еще открыта, а разработчик Codex DX ответил, что команда уже работает над исправлением. Theo пока советует полностью избегать ultra. В Claude Code основной Sol можно оставить на xhigh, а подагентам давать medium. В одном небольшом тесте на трех задачах Sol medium в Claude Code оказался примерно на 46% быстрее и использовал на 23% меньше выходных токенов, чем в Codex, при сопоставимом результате. Выборка маленькая, но влияние обвязки на одну и ту же модель видно хорошо. Чат | Токены дешево

prose - маленький STYLE.md, который учит Codex отвечать спокойнее, как Claude Он заставляет агента общаться связанной техниче
prose - маленький STYLE.md, который учит Codex отвечать спокойнее, как Claude Он заставляет агента общаться связанной технической прозой, не дробить мысль на десятки заголовков и списков и убирать всё, что не меняет следующий шаг. Автор кладёт правила прямо в AGENTS.md, потому что skills в разных агентных обвязках могут загружаться выборочно. Вы можете скопировать промт здесь или просто использовать одну из команд на сайте: curl -fsSL prose.ami.rip/STYLE.md >> ~/.codex/AGENTS.md Многие уже собирали такие правила вручную. Prose меняет подачу, но не точность ответа, поэтому логи тестов и вывод инструментов лучше оставлять без улучшений. Чат | Токены дешево

11 skills, из которых складывается персональная Agent OS разработчика Разраб из PostHog хранит в своих dotfiles навыки для Claude Code. Вместе они образуют процесс работы с PR, систему инженерных решений и память прошлых расследований. Самые интересные: 🔵 pr-shepherd связывает qa-swarm, review-triage, simplify и ci-shepherd. Система делает от двух до четырех проходов ревью, исправления и упрощения кода, останавливаясь, когда новый проход становится чистым. qa-swarm запускает четыре независимых взгляда, review-triage разбирает комментарии, а CI-агент обновляет ветку и сообщает состояние проверок, не превращая CI в стоп-сигнал. Сильные модели заняты ревью, более дешевые - механической работой. 🔵 takeover-stale-pr оживляет заброшенный PR: подтягивает свежую базу, разбирает старые замечания, запускает затронутые тесты и передает готовую ветку в pr-shepherd. 🔵 paul-pair срабатывает перед вопросом человеку и перед словом «готово». Три режима: сделать самому, сделать и предложить альтернативу, остановиться и спросить. Рядом лежат paul-reviewer с акцентом на связанность, наблюдаемость и безопасный выкат и xp-reviewer с YAGNI, простым дизайном и правилом «немного дублирования лучше неправильной абстракции». 🔵 investigate-library-upgrade читает changelog, находит реально используемые API пакета и связывает несовместимые изменения с конкретными файлами. Выдает радиус работ и план выката, но не обновляет зависимость без отдельного разрешения. 🔵 hunt-memory-leaks - полноценный исполняемый плейбук по утечкам памяти браузера. Он различает JS heap и память процесса рендеринга, требует тесты с несколькими вкладками в браузере с интерфейсом и несколько повторов, использует CDP, снимки JS heap, сетевые события и трассировки аллокаторов. В references/ записаны уже исправленные причины, открытые гипотезы и тупики, которые не нужно проходить заново. 🔵 manage-claude-memory переносит память проектов из локального хранилища Claude в хранимые в git dotfiles через символические ссылки. Перед записью проверяет содержимое на ключи, персональные данные и закрытую продуктовую информацию. Сильная часть репозитория - накопленное инженерное состояние. Каждый skill знает последовательность действий, границы автономности, условия остановки и уже проверенные гипотезы. Так личный опыт разработчика постепенно становится исполняемой системой для агента. Чат | Токены дешево

Вот что можно сказать о новых GPT моделях 🔵 Если вам не нужна производительность уровня Terra Ultra, всегда лучше использова
Вот что можно сказать о новых GPT моделях 🔵 Если вам не нужна производительность уровня Terra Ultra, всегда лучше использовать модель Luna с более высокими настройками сложности (та же или лучшая производительность, но дешевле). 🔵 Забудьте обо всем, что ниже Sol High, используйте Luna с более высокими настройками сложности. 🔵 Забудьте о Sol Extra High, используйте Terra Ultra. 🔵 Дополнительные затраты на Sol Ultra, вероятно, не оправдывают себя по сравнению с Max. Просто использовать постоянно GPT 5.6 Sol Ultra не получится даже на подписке за 200$, лимиты будут улетать. Теперь нужно правильно выбирать инструмент. Чат | Токены дешево

Все очень активно обсуждают новые модели, снова на хайпе тема с оркестрацией Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac. Теперь локальная модель генерирует ответы в стиле создателя. А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя. Skill Advisor Orchestrator Worker 117к⭐ - здесь в целом собрано очень много полезного для агентов. Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44⭐ Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование. Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста. Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят 😦 Чат | Токены дешево

OpenAI и Meta в один день выпустили модели 🔥 GPT-5.6 вышел семейством Sol - флагман, Terra - баланс, Luna - быстрые дешевые задачи. Еще апдейт - ChatGPT Work: Codex и ChatGPT собирают в одно desktop-приложение. И у GPT-5.6 появился режим ultra: несколько агентов параллельно работают над сложной задачей. В X Цукерберг вернулся после 3 лет молчания с анонсом Muse Spark. Модель от Meta Superintelligence Labs для кодинга, tool use, computer use и мультимодальных агентных задач. Внутри 1M контекста, работа с desktop/mobile/browser, MCP, custom skills и делегирование в параллельных субагентов. Самый агрессивный ход - public preview для US developers, совместимость с OpenAI SDK, $20 кредитов бесплатно. Цена: $1.25 input и $4.25 output за 1M токенов. По сравнению с GPT-5.6 Sol это примерно в 4 раза дешевле на входе и в 7 раз дешевле на выходе. Есть кто уже попробовал новые модельки? Про Grok 4.5 не забываем. Чат | CloseRouter

Вышел Grok 4.5 😐 Модель отдельно тренировали под кодинг и агентные задачи. В официальном треде акцент на инженерную работу: большие репозитории, долгие loops с инструментами, несколько репо, skills и агентные сценарии. По цифрам модель выглядит как быстрый рабочий исполнитель: 🔵 500k контекста, reasoning low/medium/high 🔵 $2 за 1M входных и $6 за 1M выходных токенов, cached input $0.50 🔵 около 80 TPS и 15.9k output tokens на SWE Bench Pro против 67k у Opus 4.8 в замере xAI 🔵 доступна в Grok Build, Cursor, API и Office add-ins, EU пока ждет. Важная деталь: бенчи неровные. Grok 4.5 силен в Terminal Bench и SWE Marathon, но на DeepSWE 1.1 и SWE Bench Pro уступает Fable/Opus. Сам Маск в ответах написал, что Fable сильнее, просто большинству задач такой уровень не нужен. Для агентных процессов это интересный слот: быстрый и заметно дешевле топовых моделей, этакий opus по цене sonnet, по словам пробовавших. Мне понравился такой формат работы с новым Grok: fable-advisor 190⭐ - Claude Code сессия работает на Fable 5 как архитектор, пишет требования, декомпозирует задачу и проверяет результат, а реализацию отправляет в Grok 4.5 через Grok CLI или в GPT-5.5 через Codex CLI. Чат | CloseRouter

Agent Skills for Context Engineering 17к ⭐ - библиотека SKILL.md для тех, кто собирает AI-агентов вокруг контекста, памяти, инструментов, evals и loops. Главная польза репо - готовые инженерные плейбуки. Каждый skill объясняет, когда его подключать, какие ошибки он ловит и как превратить идею в рабочий агентный процесс. 🔵 context-degradation - как понять, что агент начал ломаться из-за контекста. Lost-in-middle, старые факты, лишние документы, конфликтующие версии API, отравленная история после галлюцинации или плохого tool output 🔵 context-compression и context-optimization - как ужимать длинную сессию без потери решений, файлов, рисков и следующих шагов. Там же про masking, caching, partitioning и выбор того, что вообще стоит держать в окне 🔵 memory-systems и filesystem-context - как вынести память из промпта: файлы, scratchpads, JSONL-логи, графы, долговременные факты, handoff между агентами 🔵 multi-agent-patterns - когда реально нужны несколько агентов, как делить работу между supervisor, worker и verifier, и как не смешивать их контексты 🔵 tool-design - как писать инструменты для агентов: понятные имена, схемы, ошибки, форматы ответа, MCP naming и сокращение лишних tools, чтобы агент меньше путался 🔵 evaluation и advanced-evaluation - как проверять агентные системы: deterministic checks, regression suites, rubrics, LLM-as-judge, pairwise comparison и защита от bias 🔵 harness-engineering - обвязка вокруг автономного агента: что можно редактировать, что locked, где вести логи, как делать rollback, novelty gate и human approval 🔵 self-improvement-loops - самый интересный skill. Он про loops, где агент улучшает уже не ответ, а собственный workflow, prompt, skill, harness или механизм контекста. Важный принцип: evaluator, права, бюджеты и sandbox должны быть вне зоны, которую loop может менять. Иначе агент быстро начнет оптимизировать метрику вместо задачи И это не все, что есть в репозитории 😏 Чат | CloseRouter

Shepherd 1.1к ⭐ - Git-like trace для AI-агентов Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь. Shepherd строит вокруг агента такую историю запуска: 🔵 каждый model call, tool call и изменение файлов становится событием в trace 🔵 управляющий агент может наблюдать за рабочими агентами и вмешиваться до конфликта 🔵 результат работы хранится сбоку как предложение: его можно принять, отклонить или выпустить отдельно 🔵 права задаются прямо в Python-сигнатуре: этому repo можно только читать, этому можно писать 🔵 в статье fork/revert для контейнерных задач занимал примерно 134-147 мс, плюс около 95% переиспользования prompt cache при ответе Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%. Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить. Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель. Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий. Чат | CloseRouter

Собрал две статьи про harness для AI-агентов - слой, который превращает модель в рабочий процесс: контекст, loop, инструменты, проверки, права, память и подагенты. 📎 Как получать сильный результат от любой модели Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про CLAUDE.md, объективные проверки, независимого verifier, hooks, permissions, skills, memory и MCP. 📎 Harness engineering для самоулучшающихся AI-систем Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска. Главная мысль для практики: зеленая галочка done имеет смысл только тогда, когда есть внешний gate, логи, состояние, лимиты и артефакты, которые можно проверить через неделю. Чат | CloseRouter

Свежая статья от Anthropic 📎 С чего начать loops в Claude Code Раз уж мы говорим о Claude Code, есть полезный репозиторий, к
Свежая статья от Anthropic 📎 С чего начать loops в Claude Code Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex. Codex MCP Server 540⭐ - Используйте GPT в клоде как советника или оставьте на Claude только планирование, а всю реализацию отдавайте в Codex. Чат | CloseRouter