Agents Lab
رفتن به کانال در Telegram
Обсуждаем AI агентов Наш чатик https://t.me/openclaw_lab_community
نمایش بیشترکشور مشخص نشده استدسته بندی مشخص نشده است
1 005
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+77 روز
+4130 روز
آرشیو پست ها
1 005
Собрал две статьи про harness для AI-агентов - слой, который превращает модель в рабочий процесс: контекст, loop, инструменты, проверки, права, память и подагенты.
📎 Как получать сильный результат от любой модели
Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про
CLAUDE.md, объективные проверки, независимого verifier, hooks, permissions, skills, memory и MCP.
📎 Harness engineering для самоулучшающихся AI-систем
Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.
Главная мысль для практики: зеленая галочка done имеет смысл только тогда, когда есть внешний gate, логи, состояние, лимиты и артефакты, которые можно проверить через неделю.
Чат | CloseRouter1 005
Свежая статья от Anthropic
📎 С чего начать loops в Claude Code
Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex.
Codex MCP Server 540⭐ - Используйте GPT в клоде как советника или оставьте на Claude только планирование, а всю реализацию отдавайте в Codex.
Чат | CloseRouter
1 005
Если модель вроде Fable 5 уходит из подписки, последние часы стоит тратить на извлечение ее экспертизы в артефакты:
CLAUDE.md, skills, критерии качества, дорожные карты, заметки и проверяемые цели.
Короткий плейбук из 5 сценариев с готовыми промтами:
📎 Сделайте это в свой последний день работы с Fable
Чат | CloseRouter1 005
4X DGX Spark для локальной MoA-сетки агентов
Парень из X собрал стек на Hermes: Qwen закрывает легкие задачи, Nemotron берет мультимодальный ввод, Two-Tower работает с длинными повторяемыми генерациями, DeepSeek-V4-Flash маршрутизирует, а Claude/Codex/Grok остаются редким облачным учителями.
Автор целится в около 90% AI-работы локально. Каждый сложный запрос, который ушел в облако, сохраняется в лог: задача, выбранный агент, ответ и исправление. Потом эти пары идут в LoRA-тренировку Gemma-4-12B, чтобы похожие задачи дальше закрывались на локальном стеке.
Главная ценность здесь - loop обучения из собственных логов:
Репозиторий пока выглядит как журнал сборки и каркас. Routing hooks, miner, LoRA harness и бенчи есть, но eval-gate и hot-swap еще описаны как ручной шаг.
Чат | CloseRouter
1 005
David Ondrej выложил свои Agent Skills в open source
David Ondrej - основатель DeepAPI, OpenDataset и Vectal. Вчера он открыл репозиторий davidondrej/skills 450⭐ - личный набор скиллов, который, по его словам, собран из сотен часов проб и ошибок.
Внутри 30 скиллов по 5 категориям:
🔵
agent-orchestration - запуск loops, Codex /goal, delegation, handoff, cmux, DeepSWE
🔵 skill-authoring - как писать, улучшать, публиковать и раскатывать skills между агентами
🔵 research-and-web - browser harness, deep research, YouTube transcripts, web-поиск для Pi
🔵 thinking-and-docs - превращение идей в docs, ADRs, interview-style planning, “прожарь меня”
🔵 ops-and-setup - VPS, setup, cyber audit, anti-sleep для macOS, кастомные модели в Pi
Самое полезное здесь - структура: каждый SKILL.md превращает повторяемый агентный сценарий в маленькую инструкцию, которую можно подключать к Claude Code, Codex, Hermes или своим агентам.
Часть skills завязана на стеке David, но как библиотека паттернов для своих скиллов - очень годно.
Чат | CloseRouter1 005
Loop engineering для solo-разработчика начинается с вопроса: откуда агенту брать задачи?
Если проект делает один человек, backlog часто живет в голове. Поэтому первый loop должен не писать код, а превращать цель проекта в маленькие проверяемые задачи.
цель → метрика → воронка → провал → маленький PR
А потом только идем к реализации:
диагностика → узкое место → план → diff от Codex → тесты → деплой → отчет
Hermes в такой схеме может работать как оркестратор: читает цель, метрики и диагностику, выбирает один узкий участок, пишет план и проверяет результат. Codex CLI работает как исполнитель: берет одну задачу, делает diff, запускает проверки и останавливается, если нужен продуктовый выбор.
Начинать стоит с файла вроде docs/product-loop.md: цель, метрика, границы поведения агента, воронка и правила выбора следующей задачи.
📎 Как собрать автономный loop
Чат | CloseRouter1 005
Вечерний набор на выходные: два репо для маленькой фабрики кодовых агентов
Parallel Code 811 ⭐ - desktop-интерфейс для mac и linux, где Claude Code, Codex, Gemini, Copilot и другие CLI работают параллельно, каждый в своем
git worktree. Создали несколько задач, агенты разошлись по веткам, дальше смотрите diff, CI, комментарии и мерджите удачные варианты.
repowise 2.9к ⭐ - слой понимания репозитория для агента. Индексирует код, git-историю, архитектурные решения, health/risk и документацию, потом отдает это через MCP в Claude Code, Codex, Cursor и других клиентов.
Для Codex: pip install repowise
repowise init --codex --provider codex_cli --yes
Хорошая связка для эксперимента: Parallel Code гоняет несколько агентов, repowise дает агентам карту проекта и помогает проверять изменения по риску и контексту.
Чат | CloseRouter1 005
Eсть способ снизить затраты в Fable 5 примерно на 70% - pxpipe 800⭐
Просто преобразуйте контекст Claude Code в изображение и настройте Fable (и не только) на распознавание текста 😂
Чат | CloseRouter
1 005
Разобрал около 100 ответов под опросом про Hermes. Получился хороший снимок того, как люди реально живут с агентами каждый день.
Главный паттерн - Hermes почти у всех уходит из терминала в рабочую среду:
- 55% используют Telegram, Discord, iMessage или другие мессенджеры
- 30% сидят в Desktop/браузере
- 30% все еще активно используют TUI/CLI
По моделям лидируют GPT/Codex - 35%. Дальше DeepSeek и локальные модели - по 25%, MoA/роутеры - около 20%. То есть схема уже не “одна лучшая модель”, а набор: сильная модель для сложных задач, дешевые или локальные воркеры для рутины.
Самое интересное - память. Obsidian, vault и markdown всплывают у 35%, встроенная память Hermes - у 20%, Honcho - у 10%. Люди явно хотят память, которую можно читать, синкать, коммитить и чинить руками.
По оркестрации: delegate_task и subagents - 25%, kanban и cron - примерно по 20%. А кто то всегда ведет разработку, отдавая кодинг задачи Claude/Codex CLI в отдельный tmux.
Skills упоминают чаще, чем MCP: 35% против 10%.
Хороший практический пример - статья Matthew Gunnin про память для двух агентов: OpenClaw и Hermes. У него память разделена на 4 слоя: markdown-файлы с identity и memory index, локальное сохранение фактов через Hindsight 17.9к⭐, общий Obsidian/Nexus-лог для синхронизации агентов и gbrain 24.9к⭐ как поисковый слой поверх всего vault.
Самая полезная мысль оттуда: память агента - это не просто засунуть больше в контекст. Рабочая схема больше похожа на инфраструктуру: факты проходят от сессии к сессии, решения пишутся в проверяемые файлы, несколько агентов читают один общий state, а старые знания можно найти без загрузки всего архива в контекст.
Чат | CloseRouter
1 005
📎 Как ускорить Hermes Agent без смены модели
Про простую вещь, которая часто дает больше скорости, чем апгрейд модели: нормальная карта рабочей области.
INDEX.md, канонические файлы, отдельный архив и понятные точки входа помогают агенту меньше искать и быстрее начинать работу.
📎Как создать Frontier Agent OS
Идея Agent OS - вынести координацию в отдельный слой. Одна модель планирует, другая делает, третья проверяет. Самое важное здесь - роли, критерии готовности, логи маршрутизации и доказательства результата.
📎 Loop engineering: метод Karpathy и следующий слой
Loop engineering превращает агентную работу в повторяемый цикл: цель, состояние, проверка, стоп-условие. В статье разобран Karpathy Loop и следующий слой - loop, который улучшает саму стратегию поиска.
📎 Уровни автономности AI-агентов
Полезная шкала для тех, кто запускает подагентов, worktrees, фоновые сессии и manager-agents. Автономность стоит повышать там, где есть sandbox, откат, проверки и evidence trail.
Чат | CloseRouter1 005
OpenWiki 945 ⭐ - CLI от LangChain, который пишет wiki для репозитория под кодовых агентов.
AGENTS.md и CLAUDE.md быстро раздуваются, если складывать туда весь контекст проекта. OpenWiki выносит подробности в папку openwiki/, а в агентные инструкции добавляет короткую ссылку.
Запуск:
npm install -g openwiki
openwiki --init
🔵 генерирует страницы про архитектуру, CLI, операции, source map и правила работы с кодом
🔵 обновляет wiki через openwiki --update, читая git status, git log и git diff
🔵 хранит метаданные последнего запуска в openwiki/.last-update.json
🔵 умеет ежедневный GitHub Action, который открывает PR с обновлением документации
🔵 работает через OpenRouter, Fireworks, Baseten, OpenAI и Anthropic, плюс опционально трассирует запуск в LangSmith
Авто-wiki может закрепить ошибку агента. Поэтому безопасный режим - обновлять документацию через PR и ревьюить ее как код.
Чат | CloseRouter1 005
Hermes Agent v0.18.0 - Judgment Release 🔱
Большой релиз про надежность длинных агентных задач. За окно закрыли около 1 950 issues/PR, полностью зачистили P0/P1 и зафиксировали ноль открытых критичных задач.
Что самое интересное, помимо MoA, /learn и /usage:
🔵
/goal получил контракты готовности. Теперь можно заранее описать, какой результат считается готовым, а Hermes сверяет работу с проверками, логами и данными.
🔵 Появился журнал проверок для coding-задач: агент запоминает каноничные проверки проекта, запускает их и показывает статус через gateway.
🔵 delegate_task теперь умеет запускать несколько субагентов в фоне. Отправили параллельно исследовать конкурентов, проверить модули или собрать данные - и продолжили чат. В конце приходит одна сводка.
🔵 /journey показывает, чему Hermes научился: memories и skills в виде таймлайна, с возможностью править и удалять. В desktop добавили memory graph.
🔵 Desktop стал ближе к coding cockpit: Projects, worktrees, review pane, multi-terminal и инструменты проекта для агента.
Hermes двигают к агенту, которому можно доверить длинную работу с понятным контрактом готовности и проверяемым результатом.
Чат | CloseRouter1 005
supermemory 28к ⭐ - память и контекст для AI-агентов, теперь полностью локально
Запуск:
npx supermemory local
supermemory-server
На машине поднимается весь стек: graph engine, локальные embeddings, извлечение фактов, user profiles и Memory API. Модель выбираете сами: OpenAI, Anthropic, Gemini, Groq или офлайн через Ollama.
Хорошо ложится с Claude Code, Cursor, Codex, Hermes, LangChain, Vercel AI SDK. Агент может помнить проект, предпочтения, прошлые решения и доставать нужный контекст между сессиями.
Чат | CloseRouter1 005
Claude Fable 5 вернут в течении суток 🎉
Ужесточили гарды, классификатор для модели. Еще чаще будет фолбекать на Opus 4.8 на запрещенных темах.
Доступна по подписке до 7 июля и только до 50% лимитов можно потратить.
Hermes Agent работает с web до 60 раз быстрее и в 49 раз дешевле 🔱
Web_extract перестал прогонять каждую большую страницу через LLM-саммаризатор.
🔵Если страница до 15000 символов - возвращают целиком
🔵Если больше - берут head+tail окно примерно 75/25
🔵Полный текст сохраняют в cache/web/<slug>-<hash>.md
🔵В ответ добавляют footer с путем к файлу и подсказкой для read_file
🔵Inline base64-картинки заменяют на [IMAGE: alt], чтобы не забивать контекст
Главный инсайт из PR:
Мы платили LLM round-trip за сжатие markdown, который backend уже вернул чистым.
Ускорили не сам скрапинг, а post-processing после него. Убрали генерацию, чанкинг, синтез и ожидание auxiliary-модели. Сохранили доступ к полному тексту через файл, поэтому качество восстановления ответа осталось тем же.
Чат | CloseRouter1 005
Вышла Claude Sonnet 5 💬
Лучше предшественника, слабее опуса. Обновление рабочей лошадки.
Чат | CloseRouter
1 005
Hermes Agent получил апдейт для больших multi-agent запусков🔱
Главное -
AsyncSessionDB: обращения к SQLite в gateway вынесли с event loop в рабочий поток.
Для нас это означает меньше зависаний, когда параллельно живут сессии, сигналы активности и Kanban-задачи.
Второй апдейт - /usage. Теперь в чате видно, куда уходит контекст: системный промпт, инструменты, правила, skills, MCP, subagents, memory и сам диалог.
чат1 005
Karpathy недавно дал хорошую рамку для агентной разработки: агентов уже мало просто запустить. Их нужно проектировать через спецификации, evals, ревью, безопасность, наблюдаемость и понятный путь до production.
В 📎статье показано, как Google Agents CLI пытается собрать это в один процесс: установка skills для coding agent, сборка RAG-агента, локальные проверки, eval suite, развертывание в Agent Runtime и публикация в Gemini Enterprise.
Если делаете внутренних ассистентов, RAG или агентов на ADK, это хороший пример того, как довести прототип до сервиса для команды.
чат
1 005
Deepsec 4к ⭐ - сканер уязвимостей (агент) от Vercel Labs
Он сначала быстро проходит репозиторий правилами на регулярных выражениях и отмечает подозрительные места. Потом агент для кода читает файлы, контекст проекта из
INFO.md и решает, есть ли реальная уязвимость.
🔵 автоматически использует как фолбек claude/codex подписку, либо настраиваете Vercel AI API
🔵 работает по стадиям: scan → process → revalidate → enrich → export
🔵 хранит состояние в .deepsec/data, поэтому упавший запуск можно повторить, уже обработанные файлы он пропустит
🔵 для PR есть process --diff: проверяет только измененные файлы и готовит комментарий в Markdown
🔵 свои правила поиска можно писать под фреймворк, авторизацию, RPC или внутренний SDK
Старт:
npx deepsec init
cd .deepsec && pnpm install
pnpm deepsec scan
pnpm deepsec process
pnpm deepsec revalidate
Честно предупреждают про стоимость: полный прогон большой кодовой базы может стоить тысячи долларов. Нормальный вход - начать с --limit 50, заполнить короткий INFO.md, прогнать HIGH через revalidate, а потом добавить правила под свои реальные точки входа.
чат1 005
Компания из одного человека обычно ломается не из-за нехватки идей. Чаще - из-за памяти и повторяемости.
Когда решения, клиентский контекст, заметки и черновики живут в разных местах, владелец быстро становится главным хранилищем, исполнителем и напоминалкой для самого себя.
В статье разобран рабочий контур для соло-предпринимателя: Obsidian как память, Claude Code как обработчик знаний, Claude Cowork как исполнитель для файлов, Hermes Agent как фоновый оператор в Telegram с навыками и расписаниями.
📎 Компания из одного человека: рабочая система на Obsidian, Claude и Hermes
чат
1 005
Два свежих репозитория про то, как LLM становятся лучше
slime (7к⭐) - фреймворк для дообучения моделей на реальных задачах. Если агент пишет код, вызывает инструменты или решает задачу в несколько шагов, slime помогает собирать такие попытки, оценивать результат и улучшать модель.
DeepSpec (1к⭐) - проект DeepSeek для ускорения ответов. Идея простая: маленькая модель быстро набрасывает продолжение, большая модель проверяет сразу несколько токенов, и генерация идет быстрее.
Отдельно разобрал, как работает обучение агентов на попытках и ошибках через ART (10.2к⭐), GRPO и RULER:
📎 Как дообучать LLM
чат
